Operador de red NVIDIA
Al activar el complemento de cluster de operador de red NVIDIA, puede transferir los siguientes pares clave/valor como argumentos.
| Clave (API y CLI) | Nombre mostrado de clave (consola) | Descripción | Necesario/Opcional | Valor por defecto | Valor de ejemplo |
|---|---|---|---|---|---|
affinity |
afinidad |
Grupo de reglas de programación de afinidad. Formato JSON en texto sin formato o codificado en Base64. No utilizado por:
Posibles equivalentes:
|
Opcional | nulo | nulo |
nodeSelectors |
selectores de nodos |
Puede utilizar selectores de nodos y etiquetas de nodos para controlar los nodos de trabajador en los que se ejecutan los pods complementarios. Para que un pod se ejecute en un nodo, el selector de nodos del pod debe tener la misma clave/valor que la etiqueta del nodo. Defina Formato JSON en texto sin formato o codificado en Base64. No utilizado por:
Posibles equivalentes:
|
Opcional | nulo | {"foo":"bar", "foo2": "bar2"}El pod solo se ejecutará en nodos que tengan la etiqueta |
numOfReplicas |
Número de réplicas | Número de réplicas del despliegue del complemento. No utilizado por:
Posibles equivalentes:
|
Obligatorio | 1Crea una réplica del despliegue del complemento por cluster. |
2Crea dos réplicas del despliegue del complemento por cluster. |
rollingUpdate |
actualización continua |
Controla el comportamiento deseado de la actualización continua por maxSurge y maxUnavailable. Formato JSON en texto sin formato o codificado en Base64. No utilizado por:
Posibles equivalentes:
|
Opcional | nulo | nulo |
tolerations |
tolerancias |
Puede utilizar contaminantes y tolerancias para controlar los nodos de trabajador en los que se ejecutan los pods de complementos. Para que un pod se ejecute en un nodo que tenga un tinte, el pod debe tener una tolerancia correspondiente. Defina Formato JSON en texto sin formato o codificado en Base64. Posibles equivalentes:
|
Opcional | nulo | [{"key":"tolerationKeyFoo", "value":"tolerationValBar", "effect":"noSchedule", "operator":"exists"}]Solo los pods que tienen esta tolerancia se pueden ejecutar en nodos de trabajador que tengan el mantenimiento |
topologySpreadConstraints |
topologíaSpreadConstraes |
Cómo difundir vainas coincidentes entre la topología dada. Formato JSON en texto sin formato o codificado en Base64. No utilizado por:
|
Opcional | nulo | nulo |
| Clave (API y CLI) | Nombre mostrado de clave (consola) | Descripción | Necesario/Opcional | Valor por defecto | Valor de ejemplo |
|---|---|---|---|---|---|
operator.nodeSelectors |
nvidia-network-operator nodeSelectores | Selectores de nodos en los pods del operador de red NVIDIA. | Opcional | null |
|
operator.tolerations |
Tolerancias nvidia-network-operator | Tolerancias en los pods del operador de red NVIDIA. | Opcional | null |
|
nicClusterPolicy.tolerations |
Tolerancias de nicClusterPolicy | Tolerancias para DaemonSets gestionados por NicClusterPolicy. | Opcional | null |
|
nicClusterPolicy.deploymentTolerations |
Tolerancias de despliegue de nicClusterPolicy | Tolerancias para despliegues gestionadas por NicClusterPolicy. | Opcional | null |
|
operator.affinity |
afinidad nvidia-network-operator | Reglas de programación de afinidad para el operador de red NVIDIA. Formato JSON en texto sin formato. | Opcional | null |
|
operator.resources |
Recursos de contenedor de nvidia-network-operator | Los recursos del operador de red NVIDIA controlan los límites de recursos y las solicitudes para el contenedor nvidia-network-operator. Formato JSON en texto sin formato. |
Opcional |
|
|
operator.cniBinDirectory |
Directorio de cniBin | Directorio binario CNI para el operador de red NVIDIA. | Opcional | /opt/cni/bin |
|
operator.cniNetworkDirectory |
Directorio de cniNetwork | Directorio de red CNI para el operador de red NVIDIA. | Opcional | /etc/cni/net.d |
|
operator.admissionControllers.enabled |
operator.admissionControllers.enabled | Active los controladores de admisión para el operador de red NVIDIA. | Opcional | false |
|
sriovNetworkOperator.enabled |
sriovNetworkOperator.activado | Active el operador de red NVIDIA SR-IOV. | Opcional | false |
|
sriov-network-operator.operator.resourcePrefix |
sriov-network-operator.operator.resourcePrefix | Prefijo de recurso para recursos creados por el operador de red SR-IOV. | Opcional | nvidia.com |
|
sriov-network-operator.operator.admissionControllers.enabled |
sriov-network-operator.operator.admissionControllers.enabled | Active los controladores de admisión para el operador de red SR-IOV. | Opcional | false |
|
sriov-network-operator.operator.sriovOperatorConfig.configDaemonNodeSelectors |
sriov-network-operator.operator.sriovOperatorConfig.configDaemonNodeSelectors | Configure configDaemonNodeSelector para sriovOperatorConfig. |
Opcional |
|
|
vfCreationMode |
Modo de creación de vf | Modo para la creación de VF. Los valores válidos son sriovNetworkOperator y custom. |
Opcional | custom |
|
customizeVfCreationConfigMap |
personalizarVfCreationConfigMap | Especifique si desea omitir la creación del mapa de configuración vf-shape-config. |
Opcional | false |
|
skipNodeFeatureDiscoveryDependencyCheck |
omitir comprobación de dependencia de NFD | Omita la comprobación de dependencia de detección de funciones de nodo. | Opcional | false |
En la siguiente tabla, se describen las consideraciones para configurar este complemento de cluster en clusters de gran tamaño.
| Nombre del Argumento | Número de nodos ordenado de roles | Descripción | A medida que aumenta el tamaño del cluster | Riesgos | Recomendación |
|---|---|---|---|---|---|
operator.nodeSelectors
|
Y |
Controla dónde están programados los pods del operador de red NVIDIA. |
|
Si este argumento está mal configurado:
|
|
operator.tolerations
|
Y |
Controla las tolerancias para los pods del operador de red NVIDIA y DaemonSets relacionados. |
|
Si este argumento está mal configurado:
|
|
operator.affinity
|
Y |
Controla las reglas de afinidad de nodos para los pods del operador de red NVIDIA. |
|
Si este argumento está mal configurado:
|
|
operator.resources
|
Y |
Define las solicitudes de CPU y memoria y los límites para el contenedor de operador de red NVIDIA. |
El operador coordina los recursos de red en todo el cluster. A medida que aumenta el número de nodos, debe procesar más objetos, cambios de estado de nodo y operaciones de conciliación. El operador también depende de las etiquetas de detección de funciones de nodo para determinar qué nodos necesitan componentes de red. |
Si los recursos tienen un tamaño insuficiente:
|
|
operator.cniBinDirectory
|
N |
Controla el directorio en los nodos donde se despliegan los binarios CNI. |
Los binarios CNI se deben desplegar en el directorio que utiliza el tiempo de ejecución del contenedor. Una ruta incorrecta puede afectar a muchos nodos al mismo tiempo. |
Si este argumento está mal configurado:
|
|
operator.cniNetworkDirectory
|
N |
Controla el directorio de host donde se despliegan los archivos de configuración de CNI. |
Los archivos de configuración de CNI deben colocarse en el directorio leído por kubelet o el tiempo de ejecución del contenedor. Un directorio incorrecto puede afectar a todos los nodos que utilizan la configuración. |
Si este argumento está mal configurado:
|
|
operator.admissionControllers.enabled
|
N |
Controla si el operador de red de NVIDIA despliega su controlador de admisión. |
El controlador de admisión ayuda a evitar que la configuración no válida entre en el cluster. Esto se vuelve más importante cuando muchos usuarios o sistemas de automatización crean recursos personalizados de red. |
Si el controlador de admisión está desactivado:
|
|
sriovNetworkOperator.enabled
|
N |
Controla si se implementa el operador de red SR-IOV. |
El operador de red SR-IOV proporciona los componentes SR-IOV necesarios para redes de alto rendimiento basadas en funciones virtuales, incluidas algunas configuraciones de RDMA y GPUDirect RDMA. |
Si el operador de red SR-IOV está desactivado cuando es necesario:
|
|
sriov-network-operator.operator.resourcePrefix
|
N |
Define el prefijo utilizado para los recursos creados por el operador de red SR-IOV. |
El prefijo determina los nombres de recursos ampliados que utilizan Kubernetes y las cargas de trabajo. El cambio del prefijo requiere que todos los manifiestos de carga de trabajo utilicen los nuevos nombres de recursos. |
Si este argumento está mal configurado:
|
|
sriov-network-operator.operator.admissionControllers.enabled
|
Y |
Controla los controladores de admisión del operador de red SR-IOV. |
Los controladores de admisión detectan una configuración SR-IOV no válida antes de que llegue a los nodos y ayudan a mantener la coherencia de la configuración de NIC y función virtual a medida que aumenta el número de políticas y grupos de nodos. |
Si los controladores de admisión están desactivados:
|
|
sriov-network-operator.operator.sriovOperatorConfig.configDaemonNodeSelectors
|
Y |
Selecciona los nodos que configura el daemon de configuración de SR-IOV. |
El selector determina qué nodos reciben la configuración de SR-IOV. En un cluster grande, un selector incorrecto puede afectar a cientos o miles de nodos. |
Si este argumento está mal configurado:
|
|
vfCreationMode
|
N |
Determina si la creación de funciones virtuales es gestionada automáticamente por el operador o por la lógica personalizada. |
Un proceso de creación automatizado y consistente de funciones virtuales reduce las diferencias de configuración entre los nodos. La lógica de creación personalizada proporciona más flexibilidad, pero aumenta la probabilidad de que la configuración de nodos sea inconsistente. |
Si este argumento está mal configurado:
|
|
skipNodeFeatureDiscoveryDependencyCheck
|
Y |
Determina si el operador omite la comprobación de dependencia de detección de funciones de nodo. |
Al omitir la comprobación, se evita la validación de dependencias redundantes cuando la detección de funciones de nodo se gestiona por separado. Sin embargo, el administrador del cluster se hace responsable de garantizar que las etiquetas de nodo necesarias estén disponibles y sigan siendo correctas. |
Si este argumento está mal configurado:
|
|