大盘、资源详情和任务详情的数字不一致
不同页面可能使用不同筛选范围、时间粒度、统计单位和刷新时间。先统一查询口径,再判断是否存在异常。- 对齐区域、集群、项目组、资源池、实例规格和负载类型等查询范围。
- 使用相同的时间窗口,确认比较的是瞬时值、区间汇总还是趋势数据,并核对 GPU、CPU、实例份数和时长等统计单位。
- 刷新相关页面,考虑数据采集、聚合和缓存带来的时间差。如果差异持续存在,记录各页面的筛选条件、时间范围、数值和截图后提交支持请求。
利用率低,能否直接停止或删除任务
不能只凭单一时刻的 GPU 或 CPU 利用率判断。数据加载、通信等待、调试或预热阶段都可能出现低利用率。 判断任务是否真的空闲- 确认任务用途、所有者和当前进度。
- 对比一段时间内的利用率、训练步、日志和输出文件,不要只看单个采样点。
- 确认 checkpoint、模型和其他成果已经写入持久化存储。
- 确认任务或其产物不会影响依赖任务,以及相关服务的扩容或回滚。
- 与任务所有者确认业务影响后,再执行停止或删除。
任务中断后如何继续训练
能否继续训练同时取决于平台恢复配置和训练程序的 checkpoint 能力。- 确认任务已配置恢复策略,且训练程序能够保存和加载 checkpoint。
- 查看原任务的 容错详情 和关联任务,定位当前最新尝试,确认平台执行了原地重启还是重新提交。
- 查看日志和训练指标,确认最新尝试已加载 checkpoint、训练步继续推进,且输出能够写入持久化存储。
- 人工停止、重试预算耗尽或命中快速失败策略时,任务可能不再自动恢复。先处理对应的终止原因,再决定是否手动重提。
- 手动重提前,确认没有同一训练的其他任务仍在运行,避免重复训练。
可以删除镜像、数据集、Volume 或服务吗
可以删除不再需要的对象,但这些对象的依赖彼此独立。删除前应分别盘点依赖,并准备和验证替代版本或备份。运行中的实例正常,不能证明其所依赖的镜像或存储已经可以安全删除。
