适用场景
- 提交 PyTorch 多机多卡训练、模型微调或继续训练任务。
- 使用 Ray 运行分布式计算任务,并按需配置共享存储、Runtime Env 或自动扩缩容。
- 跟踪任务调度、运行、日志、监控和资源占用。
- 通过低成本资源、调度策略、自动容错或故障诊断提升训练效率和稳定性。
任务类型
资源形态
训练任务运行在平台 GPU 集群上,按区域和集群组织算力。提交任务时,需要通过资源池和实例规格申请 CPU / GPU。平台支持以下资源使用方式:
Spot 和闲时任务都适合低成本、可中断负载。关键训练任务应优先使用预留或按量资源,并结合 checkpoint、自动容错和监控能力。
资源、镜像和数据关系
- 资源池和实例规格:决定任务可使用的 CPU / GPU 算力。任务提交时,平台会按资源池和实例规格进行配额校验与调度。
- 镜像:决定任务运行环境、框架版本、依赖库和训练工具。
- Volume:用于保存代码、checkpoint、训练输出和模型文件。
- 数据集和模型:通常作为只读输入挂载到训练容器中。
- 启动命令:定义容器启动后执行的训练命令。
训练任务生命周期
- 准备资源配额、镜像、数据集、模型和 Volume。Spot 和闲时资源不需要预先购买配额,但需要确认任务可以被中断。
- 在 训练任务 > 任务管理 中创建训练任务,填写基本信息、运行环境、资源、调度和高级选项。
- 任务进入队列,等待调度到资源池。
- 平台拉起训练容器并执行启动命令。PyTorchJob 可使用平台注入的分布式训练环境变量;RayJob 可使用 RayJob 专有能力。
- 在任务详情页查看生命周期时间线、状态详情、事件、日志、监控和容错详情。
- 如果任务排队、失败、卡住或资源利用异常,可根据事件、日志和监控排查问题,再按需使用自动容错、Debug 重提或 Bisect Diagnose。
- 任务成功、失败、停止或被删除后,根据需要克隆、重提、分享、打标签,或将训练产物注册到模型管理。
任务管理和 Workflows 的区别
- 任务管理:面向单个训练任务,适合直接提交 PyTorchJob 或 RayJob,并管理任务生命周期。
- Workflows:面向多步骤流程,适合把多个 SF 作业节点或 SF 推理节点编排为 DAG,并通过表单或代码方式创建流程。
