Opérateur GPU NVIDIA

Lorsque vous activez l'extension de cluster NVIDIA GPU Operator, vous pouvez transmettre les paires clé/valeur suivantes en tant qu'arguments.

Arguments de configuration communs à tous les modules de cluster
Clé (API et CLI) Nom d'affichage de la clé (console) Description Obligatoire/Facultatif Valeur par défaut Exemple de valeur
affinity affinité

Groupe de règles de programmation d'affinité.

Format JSON en texte brut ou encodé en Base64.

Non utilisé par:
  • Opérateur GPU Nvidia
Equivalents possibles :
  • Repérage des fonctionnalités de noeud, utilisez master.affinity
  • Opérateur réseau NVIDIA, utilisez operator.affinity
  • Pilote CSI SMB, utilisez contoller.affinity
Facultatif NULL NULL
nodeSelectors Sélecteurs de noeud

Vous pouvez utiliser des sélecteurs de noeud et des libellés de noeud pour contrôler les noeuds de processus actif sur lesquels les pods d'extension sont exécutés.

Pour qu'un pod s'exécute sur un noeud, le sélecteur de noeud du pod doit avoir la même clé/valeur que l'étiquette du noeud.

Définissez nodeSelectors sur une paire clé/valeur correspondant à la fois au sélecteur de noeud du pod et au libellé du noeud de processus actif.

Format JSON en texte brut ou encodé en Base64.

Non utilisé par:
  • Opérateur GPU NVIDIA
  • Pilote CSI SMB
Equivalents possibles :
  • Repérage des fonctionnalités de noeud, utilisez worker.nodeSelector
  • Opérateur réseau NVIDIA, utilisez operator.nodeSelectors
Facultatif NULL {"foo":"bar", "foo2": "bar2"}

Le pod s'exécutera uniquement sur les noeuds possédant le libellé foo=bar ou foo2=bar2.

numOfReplicas numOfReplicas Nombre de répliques du déploiement de l'extension.
Non utilisé par:
  • Module d'extension GPU AMD
  • Opérateur GPU NVIDIA
  • Opérateur réseau NVIDIA
  • Pilote CSI SMB
Equivalents possibles :
  • CoreDNS, utilisez nodesPerReplica
  • Repérage des fonctionnalités de noeud, utilisez master.replicaCount
Requis 1

Crée une réplique du déploiement d'extension par cluster.

2

Crée deux répliques du déploiement d'extension par cluster.

rollingUpdate annulation

Contrôle le comportement souhaité de la mise à jour non simultanée par maxSurge et maxUnavailable.

Format JSON en texte brut ou encodé en Base64.

Non utilisé par:
  • Repérage des fonctionnalités du noeud
  • Opérateur réseau NVIDIA
  • Pilote CSI SMB
Equivalents possibles :
  • Opérateur de GPU NVIDIA, utilisez daemonsets.rollingUpdate.maxUnavailable
Facultatif NULL NULL
tolerations tolérances

Vous pouvez utiliser des tolérances et des taches pour contrôler les noeuds de processus actif sur lesquels les pods d'extension s'exécutent.

Pour qu'un pod s'exécute sur un noeud présentant une entorse, le pod doit avoir une tolérance correspondante.

Définissez tolerations sur une paire clé/valeur correspondant à la fois à la tolérance du pod et à la tache du noeud de processus actif.

Format JSON en texte brut ou encodé en Base64.

Equivalents possibles :
  • Repérage des fonctionnalités de noeud, utilisez master.tolerations et/ou worker.tolerations
  • Opérateur de GPU NVIDIA, utilisez daemonsets.tolerations
  • Opérateur réseau NVIDIA, utilisez operator.tolerations
  • Pilote CSI SMB, utilisez controller.tolerations
Facultatif NULL [{"key":"tolerationKeyFoo", "value":"tolerationValBar", "effect":"noSchedule", "operator":"exists"}]

Seuls les pods présentant cette tolérance peuvent être exécutés sur des noeuds de processus actif présentant la tache tolerationKeyFoo=tolerationValBar:noSchedule.

topologySpreadConstraints Contraintes de répartition de topologie

Comment répartir les pods correspondants entre la topologie donnée.

Format JSON en texte brut ou encodé en Base64.

Non utilisé par:
  • Repérage des fonctionnalités du noeud
  • Opérateur GPU NVIDIA
  • Opérateur réseau NVIDIA
  • Pilote CSI SMB
Facultatif NULL NULL
Arguments de configuration propres à ce module complémentaire de cluster
Clé (API et CLI) Nom d'affichage de la clé (console) Description Obligatoire/Facultatif Valeur par défaut Exemple de valeur
skipNodeFeatureDiscoveryDependencyCheck skipNodeFeatureDiscoveryDependencyCheck Ignorer la vérification de dépendance de repérage de fonctionnalités de noeud. Facultatif false
disableNvidiaGpuPlugin DésactiverNvidiaGpuPlugin Désactivez le module complémentaire NvidiaDevicePlugin existant et les ressources associées. Facultatif false
cdi.enabled Activer l'interface de dispositif de conteneur Indicateur d'activation de l'interface de dispositif de conteneur. Facultatif

false pour la version 25.3.x.

true pour les versions 25.10.x et ultérieures.

cdi.default Activer l'Imagerie Cerner par défaut Indicateur permettant à l'exécution du conteneur d'utiliser l'Imagerie Cerner comme option par défaut pour effectuer une injection de dispositif. Facultatif

false pour la version 25.3.x.

Obsolète dans la version 25.10.x et versions ultérieures.

daemonsets.labels Libellés DaemonSets Libellés de tous les groupes de démons d'opérateur GPU. Correspondance JSON codée en Base64 ou texte JSON. Facultatif null
daemonsets.annotations Annotations DaemonSets Annotations pour tous les groupes de démons d'opérateurs GPU. Correspondance JSON codée en Base64 ou texte JSON. Facultatif null
daemonsets.tolerations Tolérances DaemonSets Tolérations pour tous les groupes de démons d'opérateurs GPU. Tableau JSON encodé en Base64 ou texte JSON. Facultatif null
daemonsets.rollingUpdate.maxUnavailable Ensembles de démons MaxUnavailable Nombre maximal de pods indisponibles pour la mise à jour non simultanée sur les jeux de démons d'opérateur GPU. Facultatif 1
dcgm.enabled Activer DCGM Activez l'hostengine NVIDIA DCGM en tant que pod distinct. Facultatif false
dcgm.args Arguments DCGM Arguments pour DCGM Hostengine. Tableau JSON encodé en Base64 ou texte brut JSON. Facultatif null
dcgm.env Env. DCGM Variables d'environnement pour DCGM Hostengine. Texte brut JSON ou JSON encodé en Base64. Facultatif null
dcgm.containerResources Ressources DCGM Demandes de ressources et limites pour le pod Hostengine DCGM. Texte brut JSON ou JSON encodé en Base64. Facultatif null
dcgmExporter.enabled Activer l'export DCGM Activez le DaemonSet de l'exportateur DCGM pour les mesures. Facultatif true
dcgmExporter.env Env. exportateur DCGM Variables d'environnement pour DCGM Exportateur. Texte brut JSON ou JSON encodé en Base64. Facultatif null
dcgmExporter.resources Ressources d'exportateur DCGM Demandes de ressources et limites pour le pod DCGM Export. Texte brut JSON ou JSON encodé en Base64. Facultatif null
dcgmExporter.service.internalTrafficPolicy Politique de trafic du service d'exportateur InternalTrafficPolicy pour le service ClusterIP de DCGM Export. Facultatif Cluster
dcgmExporter.serviceMonitor.enabled Activer ServiceMonitor Activez un ServiceMonitor pour NVIDIA DCGM Export. Facultatif false
dcgmExporter.serviceMonitor.interval Intervalle ServiceMonitor Intervalle de mise au rebut pour NVIDIA DCGM Exportateur. Prend en charge y, w, d, h, m, s et ms. Facultatif 15s
dcgmExporter.serviceMonitor.honorLabels Libellés d'honneur de ServiceMonitor Préférez les libellés de mesure cible sur les collisions. Facultatif false
dcgmExporter.serviceMonitor.additionalLabels Libellés supplémentaires ServiceMonitor Libellés supplémentaires pour ServiceMonitor. Carte JSON encodée en Base64 ou en texte brut JSON. Facultatif null
dcgmExporter.serviceMonitor.relabelings Relabelings de ServiceMonitor Modification de l'étiquette des règles pour ServiceMonitor. Texte brut JSON ou JSON encodé en Base64. Facultatif null
dcgmExporter.config.name Nom de la carte de configuration de l'exportateur Nom de ConfigMap qui fournit la configuration des mesures personnalisées pour l'exportateur DCGM. Facultatif null
migManager.enabled Activer le gestionnaire MIG Activez le déploiement de NVIDIA MIG Manager. Facultatif false
migManager.resources Ressources du gestionnaire MIG Limites et demandes de ressource pour chaque pod MIG Manager. Texte brut JSON ou JSON encodé en Base64. Facultatif null
migManager.env Env. gestionnaire MIG Variables d'environnement pour MIG Manager. Texte brut JSON ou JSON encodé en Base64. Facultatif null
migManager.config.name Nom de la correspondance de configuration MIG Nom ConfigMap avec la configuration mig-parted pour le gestionnaire MIG. Facultatif null
migManager.gpuClientsConfig.name Configuration des clients GPU MIG Nom ConfigMap avec la configuration gpu-clients pour le gestionnaire MIG. Facultatif null
devicePlugin.enabled Activer le plug-in d'appareil Activez le module d'extension de périphérique NVIDIA Kubernetes. Facultatif true
devicePlugin.args Arguments de plug-in de périphérique Arguments pour le plug-in de périphérique. Tableau JSON encodé en Base64 ou texte brut JSON. Facultatif null
devicePlugin.env Module d'extension d'appareil Variables d'environnement pour le module d'extension de périphérique. Texte brut JSON ou JSON encodé en Base64. Facultatif null
devicePlugin.resources Ressources du plug-in de périphérique Limites et demandes de ressource pour chaque pod de module d'extension de périphérique. Texte brut JSON ou JSON encodé en Base64. Facultatif null
devicePlugin.config.name Nom ConfigMap du plug-in de périphérique Nom ConfigMap qui fournit la configuration du module d'extension de périphérique, partagé avec GFD, le cas échéant. Facultatif null
devicePlugin.mps.root Racine MPS Chemin racine MPS sur l'hôte. Facultatif /run/nvidia/mps
toolkit.enabled Activer la boîte à outils Activez le déploiement de NVIDIA Container Toolkit. Facultatif true
toolkit.env Env. boîte à outils Variables d'environnement pour Container Toolkit. Texte brut JSON ou JSON encodé en Base64. Facultatif null
toolkit.resources Ressources de la boîte à outils Limites et demandes de ressources pour chaque pod Container Toolkit. Texte brut JSON ou JSON encodé en Base64. Facultatif null
toolkit.installDir Répertoire d'installation de boîte à outils Répertoire d'installation des utilitaires Container Toolkit sur l'hôte. Facultatif /usr/local/nvidia
mig.strategy Stratégie MIG Stratégie MIG pour GFD et le plug-in de périphérique. Les valeurs valides sont none, single et mixed. Facultatif single
operator.logging.level Niveau de journalisation de l'opérateur Niveau de journalisation Zap : debug, info, error ou un entier > 0 pour le niveau de détail personnalisé. Facultatif info
operator.resources Ressources de l'opérateur Limites et demandes de ressource pour le pod GPU Operator. Texte brut JSON ou JSON encodé en Base64. Facultatif null
hostPaths.rootFS Hôte RootFS Chemin du système de fichiers root de l'hôte. Le chemin doit pouvoir être chrooté. Facultatif /
hostPaths.driverInstallDir Répertoire d'installation du pilote Répertoire racine des fichiers du pilote NVIDIA sur l'hôte. Facultatif /run/nvidia/driver
driver.rdma.enabled Activer RDMA dans le pilote Activez la prise en charge RDMA pour le pilote NVIDIA. Facultatif false
driver.rdma.useHostMofed Utiliser l'hôte MOFED Utilisez le Mellanox OFED fourni par l'hôte au lieu du Mellanox OFED fourni par le conteneur. Facultatif false