> ## Documentation Index
> Fetch the complete documentation index at: https://docs.siflow.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 查看和管理训练任务

> 在人工智能平台中查看训练任务列表、状态详情、任务详情、事件、日志、监控和容错详情，并执行克隆、重提、停止、删除、分享和标签管理。

提交训练任务后，您可以在任务列表中筛选和定位任务，在详情页查看 **状态详情**、**任务详情**、**事件**、**日志**、**监控** 和 **容错详情**，并对任务执行克隆、重提、停止、删除、分享或标签管理。

## 查找训练任务

任务列表包含 **个人任务** 和 **被分享任务** 两个页签。**个人任务** 通常可以执行查看、日志、克隆、重提、停止、删除、分享和打标签等操作。**被分享任务** 通常可以查看详情、查看日志或克隆。

1. 进入 **训练任务 > 任务管理**。
2. 选择区域和集群。
3. 选择 **个人任务** 或 **被分享任务** 页签。
4. 按需输入名称，选择状态、标签或项目组，或打开 **查看全部** 扩大查询范围。

   标签筛选通常是与关系。选择多个标签时，列表会筛选同时匹配这些标签的任务。
5. 单击 **搜索**。

查看搜索结果时，重点关注名称、所有者、项目组名称、资源池、状态、优先级、实例规格、创建时间、更新时间和运行时间，用于判断任务归属、运行进度、资源占用和后续处理方式。

## 判断任务状态

找到任务后，先根据任务状态判断下一步是继续等待、查看详情、排查问题，还是执行克隆、重提、停止或删除等管理操作。

| 状态    | 含义                       | 处理建议                                    |
| ----- | ------------------------ | --------------------------------------- |
| 等待中   | 任务已提交，等待调度或初始化。          | 查看 **事件** 或等待调度。                        |
| 排队中   | 任务正在排队，通常受配额、优先级或调度条件影响。 | 查看 **事件**、资源池配额、优先级和节点调度策略。             |
| 部分等待中 | 部分 Pod 已调度，部分 Pod 仍在等待。  | 查看 **状态详情** 和 **事件**，确认未就绪 Pod、节点或资源原因。 |
| 运行中   | 任务正在运行。                  | 查看 **日志** 和 **监控**。                     |
| 成功    | 任务成功完成。                  | 查看输出或注册模型。                              |
| 失败    | 任务运行失败。                  | 查看 **日志** 和 **事件**，按需重提或排查。             |
| 异常    | 平台或系统侧异常。                | 查看 **事件**，必要时联系平台管理员。                   |
| 停止中   | 任务正在停止。                  | 等待停止完成。                                 |
| 已停止   | 任务已停止。                   | 克隆、重提或删除任务。                             |

开启自动容错的任务可能出现容错相关子状态。闲时任务或 Spot 任务被抢占时，任务可能进入失败状态；如果状态信息出现 `was preempted by another task`，通常表示任务被其他任务抢占。具体原因需结合 **状态详情** 和 **事件** 判断。

## 查看状态详情和任务详情

1. 在任务列表中单击目标任务名称，进入详情页。
2. 根据查看目标，打开 **状态详情** 或 **任务详情** 页签。

**状态详情** 用于查看任务运行阶段和 Pod 状态。

<img src="https://mintcdn.com/siflow/avekptrv6O-LsLPz/ai-platform/training/media/training-task-status-details.png?fit=max&auto=format&n=avekptrv6O-LsLPz&q=85&s=9bea8b6e8c2b1e2e39f84545278ccc73" alt="训练任务状态详情" width="3222" height="1448" data-path="ai-platform/training/media/training-task-status-details.png" />

**任务详情** 用于核对任务创建配置。

<img src="https://mintcdn.com/siflow/avekptrv6O-LsLPz/ai-platform/training/media/training-task-configuration-details.png?fit=max&auto=format&n=avekptrv6O-LsLPz&q=85&s=b5970658ea3bba2dc761bec9d41546f3" alt="训练任务配置详情" width="3198" height="1754" data-path="ai-platform/training/media/training-task-configuration-details.png" />

建议按目标使用：

| 查看目标       | 页签              | 关注信息                           | 后续动作                                                       |
| ---------- | --------------- | ------------------------------ | ---------------------------------------------------------- |
| 判断任务卡在哪个阶段 | **状态详情**        | 生命周期时间线、任务状态、Pod 状态和状态说明。      | 如果卡在排队或调度阶段，继续查看 **事件** 和资源信息；如果卡在运行阶段，查看 **日志** 和 **监控**。 |
| 定位调度或启动失败  | **状态详情**、**事件** | Pod 状态、Pod 退出码、节点信息、状态说明和事件信息。 | 根据事件信息检查资源配额、镜像拉取、Volume 挂载、启动命令或节点调度策略。                   |
| 核对创建配置     | **任务详情**        | 基本信息、资源信息、环境信息、挂载、命令和增强功能配置。   | 如果配置与预期不一致，可克隆任务后修改配置并重新提交。                                |

## 查看事件

1. 单击任务名称，进入详情页。
2. 打开 **事件** 页签。
3. 按时间顺序查看最近事件，确认任务是否卡在调度、镜像拉取、Volume 挂载、Pod 启动、运行或容错恢复阶段。
4. 如果事件指向某个 Pod、节点、资源池或挂载对象，再回到 **状态详情**、**任务详情**、**日志** 或 **监控** 页签继续定位。

<img src="https://mintcdn.com/siflow/avekptrv6O-LsLPz/ai-platform/training/media/training-task-events.png?fit=max&auto=format&n=avekptrv6O-LsLPz&q=85&s=6b08163841e1662a61f119facb927889" alt="训练任务事件列表" width="3196" height="1302" data-path="ai-platform/training/media/training-task-events.png" />

事件用于解释平台侧调度和生命周期变化。常见排查目标包括：

| 排查目标  | 关注事件                                |
| ----- | ----------------------------------- |
| 长时间排队 | 资源不足、配额校验失败、节点调度策略命中或资源池不可用。        |
| 启动失败  | 镜像拉取失败、Volume 挂载失败、Pod 创建失败或启动命令异常。 |
| 运行中断  | Pod 重启、节点异常、资源抢占或容错恢复动作。            |
| 容错恢复  | 自动重试、原地重启、重新提交或故障节点规避相关事件。          |

事件适合先判断问题发生阶段；日志用于查看容器和训练程序输出，监控用于判断资源和指标表现。

## 查看日志

1. 单击任务名称，进入详情页。
2. 打开 **日志** 页签。
3. 选择 **用户日志** 或 **系统日志**。
4. 设置时间段，或筛选具体某个 Pod。
5. 查看日志。

<img src="https://mintcdn.com/siflow/avekptrv6O-LsLPz/ai-platform/training/media/training-task-logs.png?fit=max&auto=format&n=avekptrv6O-LsLPz&q=85&s=94b77a59bc039ca7456643f171829ba1" alt="训练任务日志" width="3200" height="1256" data-path="ai-platform/training/media/training-task-logs.png" />

查看日志时，可按排查目标选择日志类型和 Pod：

| 排查目标                        | 查看内容                                                             |
| --------------------------- | ---------------------------------------------------------------- |
| 训练脚本报错、依赖缺失或数据路径错误          | 查看 **用户日志**，按 Pod、Container 和时间范围定位报错位置。                         |
| 镜像拉取、Volume 挂载、Pod 启动或系统侧异常 | 查看 **系统日志**，确认失败阶段和平台返回的原因；如需进一步定位调度或生命周期原因，再回到详情页查看 **事件**。     |
| 多 Pod 任务只有部分副本异常            | 先在 **状态详情** 中定位异常 Pod，再查看该 Pod 的日志。                              |
| RayJob 日志分散                 | 用户代码日志通常通过 Submitter Pod 查看；Ray 集群自身日志可查看 Head Pod 或 Worker Pod。 |

平台日志当前仅保留近 30 天的数据。如果选择的起始时间超出日志保留范围，可能无法展示日志。

日志查看器支持关键字搜索、查看末尾行数、自动刷新、手动刷新和下载日志，可用于定位错误并保留排查记录。

## 查看监控

1. 单击任务名称，进入详情页。
2. 打开 **监控** 页签。
3. 选择要查看的视角维度。
4. 按需调整指标和时间范围。

<img src="https://mintcdn.com/siflow/avekptrv6O-LsLPz/ai-platform/training/media/training-task-monitoring.png?fit=max&auto=format&n=avekptrv6O-LsLPz&q=85&s=71ae7546146f76825617c88681fc13b4" alt="训练任务监控" width="3188" height="2837" data-path="ai-platform/training/media/training-task-monitoring.png" />

监控信息建议按判断目标使用：

| 判断目标          | 查看方式                               |
| ------------- | ---------------------------------- |
| 判断任务整体负载      | 使用任务级视角查看 GPU、显存、CPU、内存和网络趋势。      |
| 对比不同副本或节点     | 使用 Pod 级视角查看各 Pod 的资源差异，定位异常副本或节点。 |
| 查看团队沉淀的指标视图   | 使用 Dashboard 查看平台预置或配置管理中维护的看板。    |
| 查看训练代码暴露的业务指标 | 使用自定义视角查看任务暴露的 metrics。            |

监控可用于判断任务是否充分使用 GPU，CPU、内存或网络是否成为瓶颈，并为后续调整实例规格、资源池、并发规模或启动参数提供依据。任务结束后，监控数据仍可用于复盘。

## 查看容错详情

如果任务开启了自动容错，或任务状态出现容错相关子状态，可进入 **容错详情** 页签查看恢复过程。

1. 单击任务名称，进入详情页。
2. 打开 **容错详情** 页签。
3. 查看重试链路、故障说明和重试任务状态。

**容错详情** 用于判断平台是否已触发自动恢复、是否达到重试上限，以及是否需要手动重提、Debug 重提或调整任务配置。

## 管理训练任务

在任务列表或任务详情页找到目标任务后，可根据任务状态和权限执行管理操作。

| 操作目标         | 操作        | 注意事项                                                                                    |
| ------------ | --------- | --------------------------------------------------------------------------------------- |
| 复用配置重新创建任务   | **克隆**    | 将已有任务配置加载到创建页，修改后提交新任务。克隆被分享任务时，如果包含当前账号无权限使用的 Volume，需要重新选择存储并核对命令中的路径。                |
| 重新运行已有任务     | **重提**    | 使用相同配置重新提交任务，适合排除偶发失败或重新运行实验。重提支持普通模式和 Debug 模式；Debug 模式通常保留原资源需求，但以排查命令启动新任务，便于进入现场排查。 |
| 中断排队中或运行中的任务 | **停止**    | 停止后会释放资源，并保留任务记录，便于后续查看、克隆或重提。停止前请确认训练进程可以中断，且需要保留的 checkpoint、日志或模型输出已经写入持久化 Volume。   |
| 清理不再需要的记录    | **删除**    | 删除不可恢复；如页面支持批量删除，批量操作前请确认所选任务均不再需要，且需要保留的 checkpoint、日志或模型输出已经写入持久化 Volume。             |
| 让其他用户查看或复用任务 | **分享**    | 被分享用户通常可查看详情、日志并克隆任务；停止、删除和项目组可见性等权限以控制台当前规则为准。                                         |
| 归类和筛选任务      | **打标签**   | 标签校验规则由标签管理配置决定。                                                                        |
| 调整项目组内可见性    | **设置可见性** | 公开状态只影响任务可见性，不自动授予资源池、Volume 或目录读写权限。                                                   |

## 相关文档

* [排查训练任务问题](./troubleshoot-training-tasks)
