> ## Documentation Index
> Fetch the complete documentation index at: https://docs.siflow.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 快速上手人工智能平台

> 了解首次使用人工智能平台的准备事项、典型使用路径和提交后检查方式。

本文按首次使用人工智能平台的常见路径组织，帮助您先确认运行范围、资源和资产，再根据目标进入开发训练、模型部署或通用服务发布。

## 首次使用准备

| 准备事项     | 可以继续的条件                     |
| -------- | --------------------------- |
| 确认租户与项目组 | 能访问本次工作需要的项目组和功能入口。         |
| 选择区域与集群  | 计算资源、镜像、数据和模型能够在同一部署位置配合使用。 |
| 检查计算资源   | 有目标资源池使用权、适用实例规格和所需额度。      |
| 准备存储     | 输入目录可读，结果目录可写，重要文件有持久保存位置。  |
| 准备运行内容   | 镜像可拉取；代码、数据或模型版本明确；启动参数已检查。 |
| 定义最小验证   | 知道用什么样本、命令或请求判断本次运行成功。      |

首次使用建议先完成小规模验证：读取少量样本、执行少量训练步骤，或发送一个测试请求。确认资源、路径和依赖正确后，再扩大运行规模。

找不到资源或对象时，先检查租户、区域、集群、项目组和筛选条件；范围无误后，再请管理员核对权限。列表中的 **全部** 只改变筛选范围，不会增加访问权限。

## 选择工作负载

按工作目标选择入口，再准备对应的资源和资产。

| 要完成的工作                     | 选择                  | 运行特点与完成标志                |
| -------------------------- | ------------------- | ------------------------ |
| 按单元格分析数据、试验算法。             | **JupyterLab 开发环境** | 通过浏览器交互；Notebook 能执行并保存。 |
| 使用编辑器、终端或本地 IDE 开发工程。      | **VSCS 开发环境**       | 通过浏览器或 SSH 连接；代码与依赖验证通过。 |
| 运行长时间训练、微调或平台支持的批量作业。      | **训练任务**            | 按启动命令执行；训练进度与持久输出符合预期。   |
| 加载模型并持续响应推理请求。             | **大模型推理服务**         | 配置模型、引擎及角色资源；实际请求通过验证。   |
| 部署自定义 HTTP / gRPC 应用或容器服务。 | **通用服务**            | 配置镜像、命令、端口和发布方式；服务端点可用。  |

## 典型使用路径

如果从开发调试开始，完整研发与服务路径通常会经过资源与资产准备、开发调试、训练与微调、模型产物确认、推理服务创建和服务请求验证。已有训练配置、已有模型或已有自定义应用镜像时，可以从对应阶段进入，不需要从头执行整条路径。

<img src="https://mintcdn.com/siflow/avekptrv6O-LsLPz/ai-platform/get-started/media/ai-platform-usage-paths-orange.svg?fit=max&auto=format&n=avekptrv6O-LsLPz&q=85&s=19945f303a7f5f0a8e49d8c94d9ec7e3" alt="人工智能平台使用路径" width="1600" height="520" data-path="ai-platform/get-started/media/ai-platform-usage-paths-orange.svg" />

> 完整路径表示常见工作衔接，不代表平台自动执行整条流水线。开发、训练和服务使用独立配置，交接时需要明确镜像、文件位置、模型版本和资源需求。

### 调试代码并完成训练

适用于从数据探索、代码调试进入训练或微调的场景。

| 阶段   | 主要操作                                       | 交付给下一阶段的内容           |
| ---- | ------------------------------------------ | -------------------- |
| 准备输入 | 获取资源与存储授权，准备数据和镜像。                         | 可读数据、可用镜像、独立输出目录。    |
| 开发调试 | 在 **JupyterLab** 或 **VSCS** 中验证样本、依赖和启动命令。 | 固定的代码版本、依赖版本和运行参数。   |
| 提交训练 | 配置任务类型、资源、挂载与命令。                           | 可追踪的任务 ID、训练日志和运行记录。 |
| 确认成果 | 检查训练进度、结果及 checkpoint；需要续训时验证恢复。           | 持久保存的结果、模型文件及复现所需配置。 |

同一份数据可以供不同任务使用，输出目录应按实验区分。正式长训练开始前，先验证 checkpoint 的保存与加载；仅开启平台重试，不能验证训练进度能否恢复。

参考文档：

* [准备实例资源](../resources/prepare-compute-resources)
* [创建和使用存储卷](../resources/create-and-use-storage-volumes)
* [使用 JupyterLab 开发环境](../development/use-jupyterlab-development-environment)
* [使用 VSCS 开发环境](../development/use-vscode-server-development-environment)
* [创建训练任务](../training/create-training-tasks)

### 将模型部署为推理服务

适用于已有模型，或训练完成后需要对外提供在线推理能力的场景。

| 阶段     | 主要操作                       | 完成检查                |
| ------ | -------------------------- | ------------------- |
| 准备模型   | 确认版本、权重、tokenizer、配置及存储位置。 | 目标环境可访问完整文件。        |
| 选择执行方案 | 选择兼容引擎，配置当前支持的部署方式和角色资源。   | 角色资源与模型、并行参数相匹配。    |
| 创建服务   | 配置模型来源、端口、探针、访问方式及所需容量。    | 目标实例就绪，模型加载完成。      |
| 验证并接入  | 获取实际端点，测试协议、鉴权和模型标识。       | 响应内容、错误率、延迟和吞吐满足要求。 |

训练得到的 checkpoint 可能需要按引擎要求整理或转换，完成后再用于部署。扩大服务容量前，应区分单副本装不下模型，还是现有副本的请求处理能力不足。

参考文档：

* [注册和管理自定义模型](../models/register-and-manage-custom-models)
* [推理服务概述](../inference/inference-services-overview)
* [创建大模型推理服务](../inference/create-llm-inference-services)
* [测试大模型推理服务功能](../inference/test-llm-inference-service-functionality)

### 发布自定义容器应用

适用于已经容器化的业务 API、自研推理服务、检索服务、OCR 服务或其他 HTTP / gRPC 应用。

| 阶段   | 主要操作                     | 完成检查                |
| ---- | ------------------------ | ------------------- |
| 准备应用 | 构建固定版本镜像，明确命令、监听端口和外部依赖。 | 镜像在目标集群可拉取，应用可启动。   |
| 创建服务 | 配置副本、资源、存储、探针与网关。        | 目标副本就绪，所需依赖可访问。     |
| 验证请求 | 使用实际端点发送测试请求。            | 路径、鉴权和业务响应正确。       |
| 发布变更 | 按团队流程直接更新或灰度放量，保留回退版本。   | 新版本稳定后，再按发布流程清理旧实例。 |

发布前核对新旧版本并行运行所需的额外容量。有状态应用还需确认数据兼容性；应用版本回滚不恢复已经修改的数据。

参考文档：

* [构建自定义镜像](../images/build-custom-images)
* [同步镜像到其他集群](../images/sync-images-across-clusters)
* [创建通用服务](../inference/create-general-inference-services)
* [管理通用服务](../inference/manage-general-inference-services)

## 提交后如何确认结果

页面提示提交成功，只表示平台接受了创建或变更请求。继续确认以下结果，判断任务或服务是否真正达到预期。

* 配置和申请记录与预期一致。
* 资源已完成调度，目标实例或副本进入可用状态。
* 日志中没有镜像拉取、存储挂载、启动命令或模型加载异常。
* 输出文件、checkpoint、服务请求或性能结果符合本次目标。

如果任务或服务未按预期运行，请根据发生阶段查看对应模块的排查文档；联系平台支持时，提供对象链接与 ID、区域、集群、项目组、发生时间、预期结果和脱敏错误信息。
