Skip to main content
创建训练任务后,平台会根据您选择的区域、集群、资源池和实例规格调度资源,并在容器中运行训练命令。本文以控制台表单创建为例说明完整配置流程。

创建训练任务

1. 进入创建页

  1. 进入 训练任务 > 任务管理。
  2. 在 个人任务 页签,单击 新建。

2. 填写通用配置

先填写 PyTorchJob 和 RayJob 共用的基础配置。任务类型会影响后续需要补充的专有配置。

基本信息

环境信息

运行环境决定训练容器使用什么镜像、读取哪些输入、把输出写到哪里,以及容器启动后执行什么命令。创建前请确认镜像、代码路径、数据路径和输出路径已经准备好。
存储、数据集和模型的挂载路径建议使用 /volume、/mnt 等开头的独立目录,避免覆盖 /opt、/workspace、/usr 等镜像默认目录。路径冲突可能导致依赖、代码或启动命令不可用。容器本地盘容量有限,写入大量数据可能导致负载系统变慢,重启或迁移后本地盘数据也可能被清空;训练代码、数据集、模型、checkpoint 和输出结果等重要文件,建议写入挂载的 Volume。

计算资源

计算资源决定任务使用哪类资源、启动多少个副本,以及每个副本申请多少 CPU / GPU。建议按 资源类型 -> 副本规模 -> 实例规格 -> 配额和调度 的顺序填写。 1. 选择资源类型 不同资源类型会影响可选实例、配额校验、资源保障和中断风险。 2. 配置副本规模 3. 选择实例规格 4. 确认配额和调度 提交前不要只看单个实例规格是否可选,还需要确认整个任务能被同时调度。
分布式训练采用整体调度。任务需要的副本不能只看资源总量相加,还要确认每个副本能放入可用节点,并且所有副本能同时启动。资源不足时,任务会整体进入队列,待资源满足后自动调度,无需手动重试。
优先级会影响任务排队和调度顺序,也可能影响资源竞争中的处理结果。更完整的低成本资源、资源保障、节点调度策略和抢占说明,请参考训练任务高级配置。

高级选项

3. 按任务类型补充配置

PyTorchJob

PyTorchJob 适合运行基于 PyTorch 的单机或分布式训练任务。完成通用配置后,请重点检查 命令 是否能正确启动训练脚本。 PyTorchJob 多机多卡训练可在启动命令中使用平台注入的分布式训练环境变量: 平台还会注入任务上下文相关环境变量,例如 X_USER_NAME、X_ORG_NAME、X_TENANT_ID、X_REGION、X_CLUSTER 和 TASK_UUID。如果训练脚本需要记录任务来源、区域、集群或唯一任务标识,可以读取这些变量。 示例:
请根据实际单节点 GPU 数量调整 --nproc_per_node,并将 train.py 替换为实际训练脚本。

RayJob

RayJob 适合运行基于 Ray 的分布式训练、调度或并行计算任务。完成通用配置后,请重点检查 Head / Worker、Runtime Env、共享存储和自动扩缩容等配置。 选择 RayJob 后,需要关注 Ray 运行方式和资源占用:
  • RayJob 会包含 1 个 Head Pod 和若干 Worker Pod。
  • Worker 数由创建表单中的工作节点数决定,最终占用资源的 Pod 数通常为 Worker 数 + 1。
  • RayJob 的用户代码日志通常通过 Submitter Pod 查看。
  • Ray 集群自身日志可查看 Head Pod 或 Worker Pod。
  • RayJob 的启动命令通常是 Ray entrypoint,例如 python main.py。
如需了解共享存储、自动扩缩容、Runtime Env 或 Debug 模式的更多配置建议,请参考训练任务高级配置。

4. 提交创建

单击 新建 提交任务。任务提交后会进入队列等待调度,您可以在任务列表中查看状态,也可以进入详情页查看事件、日志和监控。 如果任务长时间排队、调度失败或启动失败,请先查看详情页事件,再根据事件信息检查资源配额、镜像、挂载路径和启动命令。

后续操作