NVIDIA-GPU-Operator
Wenn Sie das Cluster-Add-on NVIDIA GPU Operator aktivieren, können Sie die folgenden Schlüssel/Wert-Paare als Argumente übergeben.
| Schlüssel (API und CLI) | Anzeigename des Schlüssels (Konsole) | Beschreibung | Erforderlich/Optional | Standardwert | Beispielwert |
|---|---|---|---|---|---|
affinity |
Affinität |
Eine Gruppe von Affinitätsplanungsregeln. JSON-Format im Klartext oder Base64-codiert. Nicht verwendet von:
Mögliche Äquivalente:
|
Optional | Null | Null |
nodeSelectors |
Knotenselektoren |
Mit Knotenselektoren und Knotenlabels können Sie die Worker-Knoten steuern, auf denen Add-on-Pods ausgeführt werden. Damit ein Pod auf einem Knoten ausgeführt werden kann, muss der Knotenselektor des Pods denselben Schlüssel/Wert wie das Label des Knotens aufweisen. Setzen Sie JSON-Format im Klartext oder Base64-codiert. Nicht verwendet von:
Mögliche Äquivalente:
|
Optional | Null | {"foo":"bar", "foo2": "bar2"}Der Pod wird nur auf Knoten ausgeführt, die das Label |
numOfReplicas |
numOfReplikate | Die Anzahl der Replikate der Add-on-Bereitstellung. Nicht verwendet von:
Mögliche Äquivalente:
|
Erforderlich | 1Erstellt ein Replikat des Add-on-Deployments pro Cluster. |
2Erstellt zwei Replikate des Add-on-Deployments pro Cluster. |
rollingUpdate |
rollierende Aktualisierung |
Steuert das gewünschte Verhalten der Rolling-Aktualisierung durch maxSurge und maxUnavailable. JSON-Format im Klartext oder Base64-codiert. Nicht verwendet von:
Mögliche Äquivalente:
|
Optional | Null | Null |
tolerations |
Toleranzen |
Mit Taints und Toleranzen können Sie die Worker-Knoten steuern, auf denen Add-on-Pods ausgeführt werden. Damit ein Pod auf einem Knoten mit einem Taint ausgeführt werden kann, muss der Pod eine entsprechende Toleranz aufweisen. Setzen Sie JSON-Format im Klartext oder Base64-codiert. Mögliche Äquivalente:
|
Optional | Null | [{"key":"tolerationKeyFoo", "value":"tolerationValBar", "effect":"noSchedule", "operator":"exists"}]Nur Pods mit dieser Toleranz können auf Worker-Knoten ausgeführt werden, die den Taint |
topologySpreadConstraints |
TopologieSpreadConstraints |
So verteilen Sie passende Pods auf die angegebene Topologie. JSON-Format im Klartext oder Base64-codiert. Nicht verwendet von:
|
Optional | Null | Null |
| Schlüssel (API und CLI) | Anzeigename des Schlüssels (Konsole) | Beschreibung | Erforderlich/Optional | Standardwert | Beispielwert |
|---|---|---|---|---|---|
skipNodeFeatureDiscoveryDependencyCheck |
skipNodeFeatureDiscoveryDependencyCheck | Abhängigkeitsprüfung für Knotenfeature Discovery überspringen. | Optional | false |
|
disableNvidiaGpuPlugin |
deaktivierenNvidiaGpuPlugin | Deaktivieren Sie das vorhandene NvidiaDevicePlugin-Add-on und die zugehörigen Ressourcen. | Optional | false |
|
cdi.enabled |
Containergeräteschnittstelle aktivieren | Kennzeichen zum Aktivieren der Containergeräteschnittstelle. | Optional |
|
|
cdi.default |
CDI als Standard aktivieren | Kennzeichen, mit dem die Containerlaufzeit CDI als Standardoption für die Geräteeinspritzung verwenden kann. | Optional |
In Version 25.10.x und höher veraltet. |
|
daemonsets.labels |
DaemonSets-Labels | Labels für alle GPU Operator DaemonSets. JSON-Text oder Base64-codierte JSON-Zuordnung. | Optional | null |
|
daemonsets.annotations |
DaemonSets-Annotationen | Anmerkungen für alle GPU Operator DaemonSets. JSON-Text oder Base64-codierte JSON-Zuordnung. | Optional | null |
|
daemonsets.tolerations |
DaemonSets-Toleranzen | Toleranzen für alle GPU Operator DaemonSets. JSON-Text oder Base64-codiertes JSON-Array. | Optional | null |
|
daemonsets.rollingUpdate.maxUnavailable |
DaemonSets MaxUnavailable | Maximale Anzahl nicht verfügbarer Pods für Rolling Update auf GPU Operator DaemonSets. | Optional | 1 |
|
dcgm.enabled |
DCGM aktivieren | Aktivieren Sie NVIDIA DCGM Hostengine als separaten Pod. | Optional | false |
|
dcgm.args |
DCGM Argumente | Argumente für DCGM Hostengine. JSON-Keintext oder Base64-kodiertes JSON-Array. | Optional | null |
|
dcgm.env |
DCGM-Umrechnung | Umgebungsvariablen für DCGM Hostengine. JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
dcgm.containerResources |
DCGM-Ressourcen | Ressourcenanforderungen und -limits für den DCGM Hostengine Pod. JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
dcgmExporter.enabled |
DCGM-Exporter aktivieren | Aktivieren Sie das DCGM Exporter DaemonSet für Metriken. | Optional | true |
|
dcgmExporter.env |
DCGM Exporteur - Umgebung | Umgebungsvariablen für DCGM Exporter. JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
dcgmExporter.resources |
DCGM-Exporterressourcen | Ressourcenanforderungen und -limits für den DCGM Exporter-Pod. JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
dcgmExporter.service.internalTrafficPolicy |
Service-Traffic-Policy für Exporteur | InternalTrafficPolicy für den DCGM Exporter ClusterIP-Service. | Optional | Cluster |
|
dcgmExporter.serviceMonitor.enabled |
ServiceMonitor aktivieren | ServiceMonitor für NVIDIA DCGM Exporter aktivieren | Optional | false |
|
dcgmExporter.serviceMonitor.interval |
ServiceMonitor-Intervall | Abstreifintervall für NVIDIA DCGM Exporter. Unterstützt y, w, d, h, m, s und ms. |
Optional | 15s |
|
dcgmExporter.serviceMonitor.honorLabels |
Dienstüberwachung - Auszeichnungslabels | Zielmetriklabels bei Kollisionen bevorzugen. | Optional | false |
|
dcgmExporter.serviceMonitor.additionalLabels |
Dienstüberwachung - Zusätzliche Etiketten | Zusätzliche Labels für den ServiceMonitor. JSON-Keintext oder Base64-kodierte JSON-Zuordnung. | Optional | null |
|
dcgmExporter.serviceMonitor.relabelings |
ServiceMonitor-Umbenennungen | Etikettierungsregeln für ServiceMonitor neu definieren JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
dcgmExporter.config.name |
Name des Exporter-ConfigMap | Name der ConfigMap, die benutzerdefinierte Metrikkonfiguration für DCGM Exporter bereitstellt. | Optional | null |
|
migManager.enabled |
MIG-Manager aktivieren | Bereitstellung von NVIDIA MIG Manager aktivieren. | Optional | false |
|
migManager.resources |
MIG-Managerressourcen | Ressourcenanforderungen und -limits für jeden MIG Manager-Pod. JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
migManager.env |
MIG-Manager - Umgebung | Umgebungsvariablen für MIG Manager. JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
migManager.config.name |
MIG-Konfigurationsmappenname | ConfigMap-Name mit mig-parted-Konfiguration für MIG-Manager. |
Optional | null |
|
migManager.gpuClientsConfig.name |
MIG-GPU-Clients konfigurieren | ConfigMap-Name mit gpu-clients-Konfiguration für MIG-Manager. |
Optional | null |
|
devicePlugin.enabled |
Geräte-Plug-in aktivieren | NVIDIA Kubernetes-Geräte-Plug-in aktivieren. | Optional | true |
|
devicePlugin.args |
Geräte-Plug-in-Argumente | Argumente für das Geräte-Plug-in. JSON-Keintext oder Base64-kodiertes JSON-Array. | Optional | null |
|
devicePlugin.env |
Geräte-Plug-in - Umgebung | Umgebungsvariablen für das Geräte-Plug-in. JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
devicePlugin.resources |
Geräte-Plug-in-Ressourcen | Ressourcenanforderungen und -limits für jeden Geräte-Plug-in-Pod. JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
devicePlugin.config.name |
Name der Geräte-Plug-in-Konfigurationszuordnung | ConfigMap-Name, der die Konfiguration des Geräte-Plug-ins bereitstellt und gegebenenfalls mit GFD gemeinsam verwendet wird. | Optional | null |
|
devicePlugin.mps.root |
MPS-Stamm | MPS-Root-Pfad auf dem Host. | Optional | /run/nvidia/mps |
|
toolkit.enabled |
Toolkit aktivieren | Bereitstellung von NVIDIA Container Toolkit aktivieren. | Optional | true |
|
toolkit.env |
Toolkit-Umgebung | Umgebungsvariablen für das Container Toolkit. JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
toolkit.resources |
Toolkit-Ressourcen | Ressourcenanforderungen und -limits für jeden Container Toolkit-Pod. JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
toolkit.installDir |
Toolkit-Installationsverzeichnis | Installieren Sie das Verzeichnis der Container Toolkit-Dienstprogramme auf dem Host. | Optional | /usr/local/nvidia |
|
mig.strategy |
MIG-Strategie | MIG-Strategie für GFD und Device Plugin. Gültige Werte sind none, single und mixed. |
Optional | single |
|
operator.logging.level |
Operatorlogebene | Zap-Loggingebene: debug, info, error oder eine Ganzzahl > 0 für benutzerdefinierten Ausführlichkeitsgrad. |
Optional | info |
|
operator.resources |
Operatorressourcen | Ressourcenanforderungen und -limits für den GPU Operator-Pod. JSON-Keintext oder Base64-kodierte JSON. | Optional | null |
|
hostPaths.rootFS |
Host-RootFS | Host-Root-Dateisystempfad. Der Pfad muss chroot-fähig sein. | Optional | / |
|
hostPaths.driverInstallDir |
Treiber-Installationsverzeichnis | Root-Verzeichnis für NVIDIA-Treiberdateien auf dem Host. | Optional | /run/nvidia/driver |
|
driver.rdma.enabled |
RDMA in Treiber aktivieren | RDMA-Unterstützung für den NVIDIA-Treiber aktivieren | Optional | false |
|
driver.rdma.useHostMofed |
Host-MOFED verwenden | Verwenden Sie das von uns bereitgestellte Mellanox OFED anstelle des von Containern bereitgestellten Mellanox OFED. | Optional | false |