Operador de GPU NVIDIA

Ao ativar o complemento de cluster do Operador de GPU NVIDIA, você pode passar os seguintes pares de chave/valor como argumentos.

Argumentos de Configuração Comuns à maioria dos Complementos de Cluster
Chave (API e CLI) Nome para Exibição da Chave (Console) Descrição Obrigatório/Opcional Valor Padrão Valor de Exemplo
affinity afinidade

Um grupo de regras de programação de afinidade.

Formato JSON em texto simples ou codificado em Base64.

Não utilizado por:
  • Operador de GPU Nvidia
Possíveis equivalentes:
  • Descoberta de Recursos do Nó, use master.affinity
  • Operador de Rede NVIDIA, use operator.affinity
  • Driver SMB CSI, use contoller.affinity
  • Operador de GPU AMD, use controllerManager.affinity
Opcional null null
nodeSelectors seletores de nó

Você pode usar seletores de nó e labels de nó para controlar os nós de trabalho nos quais os pods complementares são executados.

Para que um pod seja executado em um nó, o seletor de nós do pod deve ter a mesma chave/valor do label do nó.

Defina nodeSelectors como um par de chave/valor que corresponda ao seletor de nós do pod e ao label do nó de trabalho.

Formato JSON em texto simples ou codificado em Base64.

Não utilizado por:
  • Operador de GPU NVIDIA
  • SMB do Driver CSI
Possíveis equivalentes:
  • Descoberta de Recursos do Nó, use worker.nodeSelector
  • Operador de Rede NVIDIA, use operator.nodeSelectors
  • Operador de GPU AMD, use selector ou controllerManager.nodeSelector
Opcional null {"foo":"bar", "foo2": "bar2"}

O pod só será executado em nós que tenham o label foo=bar ou foo2=bar2.

numOfReplicas numOfReplications O número de réplicas da implantação do complemento.
Não utilizado por:
  • Plug-in de GPU AMD
  • Operador de GPU NVIDIA
  • Operador de Rede NVIDIA
  • SMB do Driver CSI
Possíveis equivalentes:
  • CoreDNS, use nodesPerReplica
  • Descoberta de Recursos do Nó, use master.replicaCount
  • Operador de GPU AMD, use controllerManager.replicas
Obrigatório 1

Cria uma réplica da implantação do complemento por cluster.

2

Cria duas réplicas da implantação do complemento por cluster.

rollingUpdate Atualização incremental

Controla o comportamento desejado de atualização incremental por maxSurge e maxUnavailable.

Formato JSON em texto simples ou codificado em Base64.

Não utilizado por:
  • Descoberta de Recurso do Nó
  • Operador de Rede NVIDIA
  • SMB do Driver CSI
Possíveis equivalentes:
  • Operador de GPU NVIDIA, use daemonsets.rollingUpdate.maxUnavailable
  • Operador de GPU AMD, use upgradePolicy em devicePlugin, metricsExporter, testRunner, configManager ou draDriver
Opcional null null
tolerations tolerâncias

Você pode usar taints e tolerations para controlar os nós de trabalho nos quais os pods complementares são executados.

Para que um pod seja executado em um nó que tenha uma taint, o pod deve ter uma tolerância correspondente.

Defina tolerations como um par de chave/valor que corresponda à tolerância do pod e à mancha do nó de trabalho.

Formato JSON em texto simples ou codificado em Base64.

Possíveis equivalentes:
  • Descoberta de Recursos do Nó, use master.tolerations e/ou worker.tolerations
  • Operador de GPU NVIDIA, use daemonsets.tolerations
  • Operador de Rede NVIDIA, use operator.tolerations
  • Driver SMB CSI, use controller.tolerations
  • Operador de GPU AMD, usar tolerações em devicePlugin, metricsExporter, testRunner, configManager, draDriver ou controllerManager
Opcional null [{"key":"tolerationKeyFoo", "value":"tolerationValBar", "effect":"noSchedule", "operator":"exists"}]

Somente pods que têm essa tolerância podem ser executados em nós de trabalho que têm a mancha tolerationKeyFoo=tolerationValBar:noSchedule.

topologySpreadConstraints topologiaSpreadConstraints

Como distribuir pods correspondentes entre a topologia fornecida.

Formato JSON em texto simples ou codificado em Base64.

Não utilizado por:
  • Descoberta de Recurso do Nó
  • Operador de GPU NVIDIA
  • Operador de Rede NVIDIA
  • SMB do Driver CSI
  • AMD GPU Operator
Opcional null null
Argumentos de Configuração Específicos para esta Extensão de Cluster
Chave (API e CLI) Nome para Exibição da Chave (Console) Descrição Obrigatório/Opcional Valor Padrão Valor de Exemplo
skipNodeFeatureDiscoveryDependencyCheck skipNodeFeatureDiscoveryDependencyCheck Ignorar verificação de dependência de Descoberta de Recurso de Nó. Opcional false
disableNvidiaGpuPlugin desativarNvidiaGpuPlugin Desative o complemento NvidiaDevicePlugin existente e os recursos relacionados. Opcional false
cdi.enabled Ativar Interface do Dispositivo Contêiner Indicador para ativar a Interface do Dispositivo do Contêiner. Opcional

false para a versão 25.3.x.

true para a versão 25.10.x e posterior.

cdi.default Ativar CDI como padrão Sinalizador para ativar o tempo de execução do recipiente para usar CDI como a opção padrão para executar a injeção do dispositivo. Opcional

false para a versão 25.3.x.

Obsoleto na versão 25.10.x e posterior.

daemonsets.labels Labels do DaemonSets Labels para todos os DaemonSets do Operador de GPU. Texto JSON ou mapa JSON codificado em Base64. Opcional null
daemonsets.annotations Anotações do DaemonSets Anotações para todos os DaemonSets do Operador de GPU. Texto JSON ou mapa JSON codificado em Base64. Opcional null
daemonsets.tolerations Tolerâncias do DaemonSets Tolerâncias para todos os DaemonSets do Operador de GPU. Texto JSON ou array JSON codificado em Base64. Opcional null
daemonsets.rollingUpdate.maxUnavailable DaemonSets MaxUnavailable Número máximo de pods indisponíveis para atualização incremental em DaemonSets do Operador de GPU. Opcional 1
dcgm.enabled Ativar DCGM Ative o Hostengine NVIDIA DCGM como um pod separado. Opcional false
dcgm.args Argumentos DCGM Argumentos para DCGM Hostengine. Texto sem formatação JSON ou array JSON codificado em Base64. Opcional null
dcgm.env Ambiente DCGM Variáveis de ambiente para DCGM Hostengine. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
dcgm.containerResources Recursos do DCGM Solicitações de recursos e limites para o pod de Hostengine DCGM. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
dcgmExporter.enabled Ativar Exportador DCGM Ative o DaemonSet do Exportador DCGM para métricas. Opcional true
dcgmExporter.env Ambiente do Exportador DCGM Variáveis de ambiente para exportador DCGM. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
dcgmExporter.resources Recursos do Exportador DCGM Solicitações de recursos e limites para o pod Exportador DCGM. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
dcgmExporter.service.internalTrafficPolicy Política de Tráfego de Serviço do Exportador InternalTrafficPolicy para o serviço ClusterIP do Exportador DCGM. Opcional Cluster
dcgmExporter.serviceMonitor.enabled Ativar ServiceMonitor Ative um ServiceMonitor para o Exportador NVIDIA DCGM. Opcional false
dcgmExporter.serviceMonitor.interval Intervalo do ServiceMonitor Intervalo de raspagem para exportador NVIDIA DCGM. Suporta y, w, d, h, m, s e ms. Opcional 15s
dcgmExporter.serviceMonitor.honorLabels ServiceMonitor - Rótulos de honra Preferir labels de métrica de destino em colisões. Opcional false
dcgmExporter.serviceMonitor.additionalLabels ServiceMonitor - Rótulos adicionais Labels adicionais para o ServiceMonitor. Texto sem formatação JSON ou mapa JSON com codificação Base64. Opcional null
dcgmExporter.serviceMonitor.relabelings ServiceMonitor - Rótulos novamente Regras de nova rotulagem para ServiceMonitor. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
dcgmExporter.config.name Nome do ConfigMap do Exportador Nome do ConfigMap que fornece a configuração de métricas personalizadas para o DCGM Exportador. Opcional null
migManager.enabled Ativar Gerenciador MIG Ativar implantação do NVIDIA MIG Manager. Opcional false
migManager.resources Recursos do Gerente de MIG Solicitações de recursos e limites para cada pod do MIG Manager. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
migManager.env MIG - Ambiente do Gerente Variáveis de ambiente para o MIG Manager. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
migManager.config.name Nome ConfigMap MIG Nome ConfigMap com configuração mig-parted para o MIG Manager. Opcional null
migManager.gpuClientsConfig.name Configuração de clientes de GPU MIG Nome ConfigMap com configuração gpu-clients para o MIG Manager. Opcional null
devicePlugin.enabled Ativar Plug-in do Dispositivo Ative o Plug-in do Dispositivo NVIDIA Kubernetes. Opcional true
devicePlugin.args Argumentos de plug-in do dispositivo Argumentos para o Plug-in do Dispositivo. Texto sem formatação JSON ou array JSON codificado em Base64. Opcional null
devicePlugin.env Ambiente de Plug-in do Dispositivo Variáveis de ambiente para o Plug-in do Dispositivo. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
devicePlugin.resources Recursos do Plug-in do Dispositivo Solicitações de recursos e limites para cada pod do Plug-in do Dispositivo. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
devicePlugin.config.name Nome ConfigMap do Plug-in do Dispositivo Nome do ConfigMap que fornece a configuração do Plug-in do Dispositivo, compartilhado com o GFD quando aplicável. Opcional null
devicePlugin.mps.root Raiz MPS Caminho raiz MPS no host. Opcional /run/nvidia/mps
toolkit.enabled Ativar kit de ferramentas Ative a implantação do NVIDIA Container Toolkit. Opcional true
toolkit.env Ambiente do kit de ferramentas Variáveis de ambiente para o Container Toolkit. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
toolkit.resources Recursos do kit de ferramentas Solicitações e limites de recursos para cada pod do Container Toolkit. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
toolkit.installDir Diretório de Instalação do Kit de Ferramentas Instale o diretório de utilitários do Container Toolkit no host. Opcional /usr/local/nvidia
mig.strategy Estratégia MIG Estratégia de MIG para GFD e Plug-in de Dispositivo. Os valores válidos são none, single e mixed. Opcional single
operator.logging.level Nível de Log do Operador Nível de log do zap: debug, info, error ou um inteiro > 0 para verbosidade personalizada. Opcional info
operator.resources Recursos do Operador Solicitações de recursos e limites para o pod Operador de GPU. Texto sem formatação JSON ou JSON codificado em Base64. Opcional null
hostPaths.rootFS RootFS do Host Caminho do sistema de arquivos raiz do host. O caminho deve ser compatível com a raiz. Opcional /
hostPaths.driverInstallDir Diretório de Instalação do Driver Diretório raiz para arquivos de driver NVIDIA no host. Opcional /run/nvidia/driver
driver.rdma.enabled Ativar RDMA no Driver Ative o suporte a RDMA para o driver NVIDIA. Opcional false
driver.rdma.useHostMofed Usar Host MOFED Use o Mellanox OFED fornecido pelo host em vez do Mellanox OFED fornecido pelo contêiner. Opcional false
Considerações sobre Clusters Grandes

A tabela a seguir descreve considerações para configurar este complemento de cluster em clusters grandes.

Nome do Argumento Número wrt de Atribuições dos Nós Descrição À medida que o tamanho do cluster aumenta Riscos Recomendação
devicePlugin.* S

Controla o plug-in de dispositivo NVIDIA que expõe GPUs ao Kubernetes.

O plug-in do dispositivo é executado em cada nó de GPU e é responsável por:

  • Recursos do Advertising nvidia.com/gpu
  • Ativando a programação de GPU

A configuração afeta diretamente as decisões do scheduler e a colocação da carga de trabalho de GPU.

Se este argumento estiver configurado incorretamente:

  • As GPUs podem não estar visíveis para o Kubernetes.
  • Os pods que solicitam GPUs podem permanecer no estado Pending .
  • A disponibilidade de GPU pode ser inconsistente entre os nós.
  • Falhas de agendamento podem ocorrer em escala.
  • Defina devicePlugin.enabled como true .
  • Aloque recursos suficientes usando devicePlugin.resources .
  • Use uma configuração consistente em todos os nós de GPU.
toolkit.* S

Controla o NVIDIA Container Toolkit, que fornece acesso a GPU dentro de contêineres.

O kit de ferramentas é executado em cada nó de GPU e é necessário para cargas de trabalho de GPU acessarem GPUs dentro de contêineres.

Se esse argumento for configurado incorretamente, os pods poderão ser programados com sucesso, mas:

  • Cargas de trabalho de GPU podem falhar ao iniciar.
  • Os contêineres podem não conseguir acessar GPUs.
  • Falhas de tempo de execução podem ser difíceis de diagnosticar.
  • Defina toolkit.enabled como true .
  • Certifique-se de que o kit de ferramentas seja compatível com o runtime do contêiner.
  • Aloque recursos suficientes usando toolkit.resources .
daemonsets.tolerations S

Controla se os componentes do Operador GPU podem ser executados em nós GPU.

Os nós de GPU geralmente são contaminados. Todos os DaemonSets do Operador de GPU devem tolerar essas manchas para serem executadas nos nós de GPU.

Se as tolerâncias necessárias estiverem ausentes:

  • Os componentes do Operador GPU não podem ser executados em nós GPU.
  • As GPUs podem se tornar inutilizáveis em todo o cluster.
  • Configure tolerações que correspondam às manchas aplicadas aos nós de GPU.
  • Valide as tolerâncias para todos os pools de nós de GPU.
daemonsets.rollingUpdate.maxUnavailable S

Controla quantos nós são atualizados simultaneamente.

O valor afeta o número de nós de GPU que estão temporariamente indisponíveis durante uma atualização.

Em um cluster grande, uma atualização pode afetar muitos nós.

Se o valor for muito alto:

  • Muitos nós de GPU podem estar indisponíveis ao mesmo tempo.
  • Cargas de trabalho de GPU podem ser interrompidas.

Se o valor for muito baixo, a implantação da atualização em milhares de nós poderá levar muito tempo.

Use um valor equilibrado que não seja excessivamente agressivo. Defina o valor com base no tamanho do cluster e na quantidade de interrupções que as cargas de trabalho podem tolerar.

operator.resources S

Define os recursos de CPU e memória do controlador do Operador de GPU.

O operador gerencia componentes, incluindo:

  • O plug-in do dispositivo
  • O NVIDIA Container Toolkit
  • GPU de Várias Instâncias
  • Gerenciador de GPU do data center NVIDIA

À medida que o número de nós aumenta, o operador gerencia mais objetos e requer mais recursos.

Se os recursos forem subdimensionados:

  • A reconciliação pode ser lenta.
  • O operador pode se tornar instável.
  • As alterações de configuração e os rollouts de componentes podem estar atrasados.
  • Aumente os recursos de CPU e memória para clusters grandes.
  • Monitore o uso de logs e memória do operador.
cdi.enabled S

Ativa a Interface do Dispositivo do Contêiner.

  • Simplifica a injeção de GPUs em contêineres.
  • Melhora a consistência do runtime entre nós.

Se a Interface do Dispositivo Contêiner estiver desativada, a integração de runtime mais antiga poderá:

  • Causa inconsistências.
  • Tornar a solução de problemas mais complexa.
  • Defina cdi.enabled como true .
  • Use as definições padrão, a menos que você tenha um requisito específico.
mig.strategy S

Controla o particionamento de GPU de várias instâncias.

O particionamento de GPU de várias instâncias permite que as cargas de trabalho compartilhem GPUs e afeta o comportamento do scheduler.

Se este argumento estiver configurado incorretamente:

  • Os recursos de GPU podem se tornar fragmentados.
  • Os pods podem não encontrar uma partição de GPU correspondente.
  • O comportamento pode ser inconsistente entre os nós.
  • Use uma estratégia consistente de GPU de Várias Instâncias em todo o cluster.
  • Evite configurações mistas, a menos que sejam necessárias.
dcgmExporter.* S

Controla a coleta de métricas de GPU.

O exportador gera métricas de GPU para cada nó, aumentando a carga do Prometheus e o tráfego de rede à medida que o número de nós de GPU aumenta.

Se este argumento estiver configurado incorretamente:

  • A extração de métricas com muita frequência pode causar alta sobrecarga.
  • A extração de métricas com pouca frequência pode fornecer visibilidade insuficiente.
  • Ajuste serviceMonitor.interval .
  • Aloque recursos suficientes usando dcgmExporter.resources .
dcgm.* S

Controla o mecanismo de host do Gerenciador de GPU do NVIDIA Data Center.

O componente opcional rastreia a integridade da GPU no cluster.

  • Se o componente estiver desativado, a visibilidade da integridade da GPU será limitada.
  • Se o componente estiver ativado com recursos insuficientes, ele poderá se tornar instável.
  • Ative o componente somente quando ele for necessário.
  • Aloque recursos suficientes.
skipNodeFeatureDiscoveryDependencyCheck N

Controla a verificação de dependência para Descoberta de Recurso de Nó.

A verificação de dependência afeta a rotulagem de nós e a detecção de GPU.

Se a Descoberta do Recurso do Nó estiver ausente:

  • É possível que nós GPU não sejam rotulados.
  • O operador pode falhar ao detectar nós de GPU.
  • Use este argumento somente quando a Descoberta de Recurso de Nó já estiver instalada.
  • Certifique-se de que os labels de nó necessários estejam presentes e corretos.
disableNvidiaGpuPlugin S

Desativa o plug-in de dispositivo de GPU NVIDIA independente.

A desativação do plug-in stand-alone impede a execução de plug-ins de dispositivo de GPU duplicados no cluster.

Se este argumento estiver configurado incorretamente:

  • Vários plug-ins de dispositivo de GPU podem ser executados.
  • Os plugins podem entrar em conflito.
  • Recursos de GPU podem ser relatados incorretamente.

Desative o plug-in de dispositivo GPU NVIDIA independente ao usar o Operador de GPU NVIDIA.