調整 Apache Spark 的 NVIDIA GPU 叢集
您可以調整 NVIDIA GPU 叢集,使用 GPU 提供者的建議以及安裝選用的程式庫來最佳化其效能。
調整 GPU 叢集可協助最佳化這些叢集在 Oracle AI Data Platform Workbench 中工作呼叫時的效能。
若是 NVIDIA GPU 型叢集,您可以依照 NVIDIA 的調校指南取得最佳化效能的建議和步驟。
您還可以選擇為 Apache Spark 程式庫安裝 NVIDIA cuDF 和 cuML 外掛程式,以協助最佳化:
- Apache Spark 的 cuDF 外掛程式 程式庫是 Apache Spark 的加速器,並提供一組利用 GPU 加速處理的外掛程式。
- 適用於 Apache Spark 的 cuML 外掛程式程式庫可讓 Apache Spark 上的 GPU 加速分散式機器學習,並提供由 cuML 程式庫支援的數種 PySpark ML 相容演算法。
cuDF 外掛程式程式庫通常會先用於圖徵工程和資料清除,然後會使用 cuML 外掛程式程式庫大規模執行交叉驗證。您可以使用這些程式庫來進行詐騙偵測 (時間序列)、Web 點擊流及 A/B 實驗等使用案例。
表格 9-2 建議的 Spark 組態
| 設定 | 數值 | 備註 |
|---|---|---|
| 繁體中文 (台灣) | 0.0625 | 1 / spark.executor.cores |
| 繁體中文 (香港) | 3 | GPU 記憶體 / 8GB,最大 4 |
| 繁體中文 (台灣) | 32 | 每一工作者的 CPU 核心數 /GPU 數目 |
| 繁體中文 (台灣) | 32 | 每一工作者的 CPU 核心數 /GPU 數目 |
| 繁體中文 (香港) | com.nvidia.spark.rapids.spark350.RapidsShuffleManager | - |
| 繁體中文 (台灣) | 多重執行緒 | - |
| 繁體中文 | 中文版 _ English | - |
| 繁體中文 (台灣) | 1 | - |
| spark.sql.files.max 分割區位元組 | 2 GB | 選擇性,建議用於大型資料集 |
| spark.rapids SQL.batch 大小位元組 | 2 GB | 選擇性,建議用於大型資料集 |
| 繁體中文 (香港) | 32 G | 選擇性,建議用於大型資料集 |
| 繁體中文 (台灣) | 8 G | 選擇性,建議用於大型資料集 |
| 繁體中文 (台灣) | 32 MB | 選擇性,建議用於大型資料集 |
| spark.sql.adaptive.advisory 分割區大小位元組 | 160 MB | 選擇性,建議用於大型資料集 |
| 已啟用 spark.rapids 檔案快取 | 真 | 選擇性,建議工作負載是否重複使用資料集 |