調整 Apache Spark 的 NVIDIA GPU 叢集

您可以調整 NVIDIA GPU 叢集,使用 GPU 提供者的建議以及安裝選用的程式庫來最佳化其效能。

調整 GPU 叢集可協助最佳化這些叢集在 Oracle AI Data Platform Workbench 中工作呼叫時的效能。

若是 NVIDIA GPU 型叢集,您可以依照 NVIDIA 的調校指南取得最佳化效能的建議和步驟。

您還可以選擇為 Apache Spark 程式庫安裝 NVIDIA cuDF 和 cuML 外掛程式,以協助最佳化:

cuDF 外掛程式程式庫通常會先用於圖徵工程和資料清除,然後會使用 cuML 外掛程式程式庫大規模執行交叉驗證。您可以使用這些程式庫來進行詐騙偵測 (時間序列)、Web 點擊流及 A/B 實驗等使用案例。

表格 9-2 建議的 Spark 組態

設定 數值 備註
繁體中文 (台灣) 0.0625 1 / spark.executor.cores
繁體中文 (香港) 3 GPU 記憶體 / 8GB,最大 4
繁體中文 (台灣) 32 每一工作者的 CPU 核心數 /GPU 數目
繁體中文 (台灣) 32 每一工作者的 CPU 核心數 /GPU 數目
繁體中文 (香港) com.nvidia.spark.rapids.spark350.RapidsShuffleManager -
繁體中文 (台灣) 多重執行緒 -
繁體中文 中文版 _ English -
繁體中文 (台灣) 1 -
spark.sql.files.max 分割區位元組 2 GB 選擇性,建議用於大型資料集
spark.rapids SQL.batch 大小位元組 2 GB 選擇性,建議用於大型資料集
繁體中文 (香港) 32 G 選擇性,建議用於大型資料集
繁體中文 (台灣) 8 G 選擇性,建議用於大型資料集
繁體中文 (台灣) 32 MB 選擇性,建議用於大型資料集
spark.sql.adaptive.advisory 分割區大小位元組 160 MB 選擇性,建議用於大型資料集
已啟用 spark.rapids 檔案快取 選擇性,建議工作負載是否重複使用資料集