创建训练任务
1. 进入创建页
- 进入 训练任务 > 任务管理。
- 在 个人任务 页签,单击 新建。
2. 填写通用配置
先填写 PyTorchJob 和 RayJob 共用的基础配置。任务类型会影响后续需要补充的专有配置。基本信息
环境信息
运行环境决定训练容器使用什么镜像、读取哪些输入、把输出写到哪里,以及容器启动后执行什么命令。创建前请确认镜像、代码路径、数据路径和输出路径已经准备好。计算资源
计算资源决定任务使用哪类资源、启动多少个副本,以及每个副本申请多少 CPU / GPU。建议按 资源类型 -> 副本规模 -> 实例规格 -> 配额和调度 的顺序填写。 1. 选择资源类型 不同资源类型会影响可选实例、配额校验、资源保障和中断风险。
2. 配置副本规模
3. 选择实例规格
4. 确认配额和调度
提交前不要只看单个实例规格是否可选,还需要确认整个任务能被同时调度。
优先级会影响任务排队和调度顺序,也可能影响资源竞争中的处理结果。更完整的低成本资源、资源保障、节点调度策略和抢占说明,请参考训练任务高级配置。
高级选项
3. 按任务类型补充配置
PyTorchJob
PyTorchJob 适合运行基于 PyTorch 的单机或分布式训练任务。完成通用配置后,请重点检查 命令 是否能正确启动训练脚本。 PyTorchJob 多机多卡训练可在启动命令中使用平台注入的分布式训练环境变量:
平台还会注入任务上下文相关环境变量,例如
X_USER_NAME、X_ORG_NAME、X_TENANT_ID、X_REGION、X_CLUSTER 和 TASK_UUID。如果训练脚本需要记录任务来源、区域、集群或唯一任务标识,可以读取这些变量。
示例:
--nproc_per_node,并将 train.py 替换为实际训练脚本。
RayJob
RayJob 适合运行基于 Ray 的分布式训练、调度或并行计算任务。完成通用配置后,请重点检查 Head / Worker、Runtime Env、共享存储和自动扩缩容等配置。
选择 RayJob 后,需要关注 Ray 运行方式和资源占用:
- RayJob 会包含 1 个 Head Pod 和若干 Worker Pod。
- Worker 数由创建表单中的工作节点数决定,最终占用资源的 Pod 数通常为
Worker 数 + 1。 - RayJob 的用户代码日志通常通过 Submitter Pod 查看。
- Ray 集群自身日志可查看 Head Pod 或 Worker Pod。
- RayJob 的启动命令通常是 Ray entrypoint,例如
python main.py。
