管理计算

本节介绍在 AI 数据平台工作台中创建、更改或删除计算集群的基本功能。

关于计算集群

借助通用计算集群,您可以在 AI 数据平台工作台实例中处理工作负载。

您可以从 Oracle AI Data Platform Workbench 的计算页面管理计算集群。


左窗格中突出显示了计算的 AI 数据平台计算页面

计算的类型

AI 数据平台工作台中存在两种类型的计算:全用途计算集群和默认主目录计算集群。

您只能在 AI 数据平台工作台中创建所有用途的计算集群。全功能计算集群适用于多种工作负载,可以附加到您的笔记本并用于工作流。除非另有说明,文档中对“计算集群”或“集群”的任何引用都引用了所有用途的计算集群。

创建新的全用途计算集群时,可以选择快速入门或定制配置。快速入门配置经过优化,可以提供快速启动,而自定义配置允许您微调所有用途的计算集群,以适应您需要处理的特定工作负载。在“快速入门”和“自定义”配置选项中,您可以查看成本预测并修改空闲超时选项。

注意:

将定制库安装到配置了 Quickstart 的所有专用计算集群会自动将其更改为定制配置。这可能会影响启动性能。

所有 AI 数据平台工作台实例中都存在默认主目录计算集群。此集群负责基本的 AI 数据平台工作台功能,例如搜索搜索、刷新目录对象、创建、编辑和删除对象以及测试连接。

集群运行时

可使用 Apache Spark 3.5 运行时创建全用途计算集群。运行时环境与以下各项兼容:

  • Spark 3.5.0
  • Delta 3.2.0(预先包含)
  • Python 3.11
  • Scala 2.12
  • Hadoop 3.3.4
  • Java 17

计算配置导出和导入

创建计算集群后,可以将为该集群配置的设置导出到工作区或目录中的卷,以再次用于其他集群。您可以将保存的配置导入到其他创建的群集,或者在创建过程中导入这些配置。

您的配置可供有权访问您保存配置的工作区或卷的其他用户使用,从而可以轻松地跨团队共享配置。

创建快速入门集群

您可以选择创建具有预配置设置的全功能计算集群,以在 AI 数据平台工作台中处理数据和 AI 工作负载。

快速入门配置是一个 Apache Spark 集群,具有 1 个驱动程序和最多 10 个 Worker,每个集群都具有 AMD 2 OCPU 和 32 GB 内存。对于快速入门配置,默认情况下会启用自动缩放。您可以将群集设置为始终处于活动状态,也可以设置不活动状态的时间间隔,在此时间间隔之后群集将自动停止(空闲超时)。由附加的工作流或记事本调用时,停止的集群将恢复。

创建后,您可以随时编辑集群。

  1. 单击左侧导航面板中的创建,然后单击计算。您还可以导航到工作区,然后单击计算,然后单击 “创建集群”图标 创建集群

    "Create cluster"(创建群集)对话框打开,其中选择了 "Quickstart radial"(快速入门)选项

  2. 提供名称和说明以标识您的集群。
  3. 选择运行时版本
  4. 选择快速启动作为群集配置。
  5. 选择员工数是静态的还是自动缩放的。对于快速入门配置,默认情况下启用自动缩放。
  6. 对于运行持续时间,选择群集是否会在设置的不活动持续时间后停止运行。如果选择了 Idle timeout(空闲超时),请在群集超时之前指定空闲时间(以分钟为单位)。
  7. 单击创建

创建定制集群

您可以在 Oracle AI Data Platform Workbench 中创建具有您自己选择处理数据和 AI 工作负载的配置设置的通用计算集群。

定制集群适用于希望利用各种配置选项来满足其需求的高级用户。您应选择最适合要处理的工作负载的驱动程序和 worker 选项。您可以将群集设置为始终处于活动状态,也可以设置不活动状态的时间间隔,在此时间间隔之后群集将自动停止(空闲超时)。由附加的工作流或记事本调用时,停止的集群将恢复。

创建后,您可以随时编辑集群。

  1. 单击左侧导航面板中的创建,然后单击计算。您还可以导航到工作区,然后单击计算,然后单击 “创建集群”图标 创建集群

    打开“创建计算集群”对话框,其中选择了“定制径向”选项

  2. 对于创建方法,请选择配置新集群
  3. 提供名称和说明以标识您的集群。
  4. 选择运行时版本
  5. 选择定制作为群集配置。
  6. 为群集选择驱动程序选项。
  7. 选择集群的 Worker 选项。这些选项适用于所有群集工作进程。
  8. 选择员工数是静态还是自动缩放。
    • 如果是静态金额,则指定员工数。
    • 如果为自动缩放,请指定集群可以缩放到的最小和最大工作进程数。
  9. 对于运行持续时间,选择群集是否会在设置的不活动持续时间后停止运行。如果选择了 Idle timeout(空闲超时),请在群集超时之前指定空闲时间(以分钟为单位)。
  10. 单击创建

使用导入的配置创建群集

您可以使用从 Oracle AI Data Platform 工作台中的现有计算集群导出的配置设置来创建全功能计算集群。

通过从导出的 YAML 文件导入设置,您可以快速复制具有相同设置的集群。您可以从与您共享的 AI Data Platform 工作区或卷导入 YAML 文件。

创建后,您可以随时编辑集群。

  1. 单击左侧导航面板中的创建,然后单击计算。您还可以导航到工作区,然后单击计算,然后单击 “创建集群”图标 创建集群
  2. 对于创建方法,请选择使用导出的配置
  3. 配置文件下拉菜单中,选择要用于新群集的已导出配置。导入的文件会预填充运行时、磁带库和环境设置。
  4. 提供名称和说明以标识您的集群。
  5. 根据需要修改其余设置。
  6. 单击创建

创建 NVIDIA GPU 集群

您可以选择在全用途计算集群中使用 NVIDIA GPU 来加速统一 AI 和数据管道中的任何负载。

NVIDIA GPU 配置使用以下配置:

表 9-1 NVIDIA GPU 配置

GPU 计数 OCPU 块存储 (GB) GPU 内存 (GB) CPU 内存 (GB)
1 15 1500 24 240
2 30 3000 48 480

注意:

使用 NVIDIA GPU 配置时,驱动程序和 Worker 配置必须是 NVIDIA GPU。当前不支持为同一集群混合 CPU 和 GPU 配置。
  1. 单击左侧导航面板中的创建,然后单击计算。您还可以导航到工作区,然后单击计算,然后单击 “创建集群”图标 创建集群

    打开“创建计算集群”对话框,其中选择了“定制径向”选项

  2. 提供名称和说明以标识您的集群。
  3. 选择运行时版本
  4. 选择定制作为群集配置。
  5. 对于群集驱动程序选项:
    • 选择 NVIDIA GPU 作为驱动程序配置。
    • 选择 1 或 2 作为 GPU 计数。
  6. 对于集群 Worker 选项:
    • 选择 NVIDIA GPU 作为 Worker 配置。
    • 选择 1 或 2 作为 GPU 计数。
  7. 选择员工数是静态还是自动缩放。
    • 如果是静态金额,则指定员工数。
    • 如果为自动缩放,请指定集群可以缩放到的最小和最大工作进程数。
  8. 对于运行持续时间,选择群集是否会在设置的不活动持续时间后停止运行。如果选择了 Idle timeout(空闲超时),请在群集超时之前指定空闲时间(以分钟为单位)。
  9. 单击创建

导出计算配置

您可以将计算集群配置和相关项导出到工作区中的某个位置,以便将其导入到其他计算集群。

  1. 导航到工作区并单击计算
  2. 在要为其导出设置的计算集群旁边,单击 “操作三个点”图标 操作,然后单击导出计算配置。您还可以单击群集名称,单击右上角的操作,然后单击导出计算配置
  3. 验证依赖项,例如库和环境变量。取消选择不应导出的任何内容。
  4. 选择工作区或卷中的保存位置。
  5. 单击导出

导入计算配置

您可以使用工作区中的 YAML 配置文件将现有计算集群配置及其依赖项导入到全用途集群。

  1. 导航到工作区并单击计算
  2. 在要为其导入设置的计算集群旁边,单击 “操作三个点”图标 操作,然后单击导入计算配置。您还可以单击群集名称,单击右上角的操作,然后单击导入计算配置
  3. 在工作区或卷中搜索要上载的配置 YAML 文件,然后选择一个或多个。
  4. 复查选定的配置文件,然后单击导入

修改群集

您可以更改群集的设置或添加其他参数。

  1. 导航到工作区,然后单击计算
  2. 在要修改的计算集群旁边,单击 “操作三个点”图标 操作,然后单击编辑
  3. 修改计算集群的属性或根据需要添加其他参数。
  4. 单击保存

删除集群

您可以删除未使用或不再需要的计算集群。

  1. 导航到工作区,然后单击计算
  2. 在要删除的群集旁边,单击 “操作三个点”图标 操作,然后单击删除
  3. 单击删除

查看集群详细信息

您可以随时查看集群的配置和设置。

  1. 导航到工作区,然后单击计算
  2. 单击要查看其详细信息的集群的名称。
  3. 单击详细信息选项卡。

计算集群的维护更新

Oracle AI Data Platform 计算可自动应用维护更新,无需用户干预。

维护更新涵盖了操作系统和 AI Data Platform 内部组件的任何必要安全补丁程序或 bug 修复。在应用这些每月维护更新之前,AI Data Platform 会验证没有正在运行的集群。