Skip to main content
本页用于处理运行后的判断和清理问题。统计差异需要先统一查询口径;停止、恢复或删除前,需要确认任务进度和对象依赖。

大盘、资源详情和任务详情的数字不一致

不同页面可能使用不同筛选范围、时间粒度、统计单位和刷新时间。先统一查询口径,再判断是否存在异常。
  1. 对齐区域、集群、项目组、资源池、实例规格和负载类型等查询范围。
  2. 使用相同的时间窗口,确认比较的是瞬时值、区间汇总还是趋势数据,并核对 GPU、CPU、实例份数和时长等统计单位。
  3. 刷新相关页面,考虑数据采集、聚合和缓存带来的时间差。如果差异持续存在,记录各页面的筛选条件、时间范围、数值和截图后提交支持请求。
资源大盘和任务大盘适合查看趋势与汇总。对于刚完成的操作、实时利用率和实际运行状态,优先查看任务或服务详情,并结合事件和监控判断。
资源维度的查询方法请参考查看资源用量,任务维度请参考查看任务资源占用。

利用率低,能否直接停止或删除任务

不能只凭单一时刻的 GPU 或 CPU 利用率判断。数据加载、通信等待、调试或预热阶段都可能出现低利用率。 判断任务是否真的空闲
  1. 确认任务用途、所有者和当前进度。
  2. 对比一段时间内的利用率、训练步、日志和输出文件,不要只看单个采样点。
决定是否停止或删除
  1. 确认 checkpoint、模型和其他成果已经写入持久化存储。
  2. 确认任务或其产物不会影响依赖任务,以及相关服务的扩容或回滚。
  3. 与任务所有者确认业务影响后,再执行停止或删除。
任务大盘只用于定位可能需要关注的任务。确认实际运行情况时,请进入对应任务详情;资源占用分析方法请参考查看任务资源占用。

任务中断后如何继续训练

能否继续训练同时取决于平台恢复配置和训练程序的 checkpoint 能力。
  1. 确认任务已配置恢复策略,且训练程序能够保存和加载 checkpoint。
  2. 查看原任务的 容错详情 和关联任务,定位当前最新尝试,确认平台执行了原地重启还是重新提交。
  3. 查看日志和训练指标,确认最新尝试已加载 checkpoint、训练步继续推进,且输出能够写入持久化存储。
  4. 人工停止、重试预算耗尽或命中快速失败策略时,任务可能不再自动恢复。先处理对应的终止原因,再决定是否手动重提。
  5. 手动重提前,确认没有同一训练的其他任务仍在运行,避免重复训练。
自动容错的适用范围、配置和验证方法请参考使用自动容错恢复训练任务。

可以删除镜像、数据集、Volume 或服务吗

可以删除不再需要的对象,但这些对象的依赖彼此独立。删除前应分别盘点依赖,并准备和验证替代版本或备份。
运行中的实例正常,不能证明其所依赖的镜像或存储已经可以安全删除。