Skip to main content
本文按首次使用人工智能平台的常见路径组织,帮助您先确认运行范围、资源和资产,再根据目标进入开发训练、模型部署或通用服务发布。

首次使用准备

首次使用建议先完成小规模验证:读取少量样本、执行少量训练步骤,或发送一个测试请求。确认资源、路径和依赖正确后,再扩大运行规模。 找不到资源或对象时,先检查租户、区域、集群、项目组和筛选条件;范围无误后,再请管理员核对权限。列表中的 全部 只改变筛选范围,不会增加访问权限。

选择工作负载

按工作目标选择入口,再准备对应的资源和资产。

典型使用路径

如果从开发调试开始,完整研发与服务路径通常会经过资源与资产准备、开发调试、训练与微调、模型产物确认、推理服务创建和服务请求验证。已有训练配置、已有模型或已有自定义应用镜像时,可以从对应阶段进入,不需要从头执行整条路径。 人工智能平台使用路径
完整路径表示常见工作衔接,不代表平台自动执行整条流水线。开发、训练和服务使用独立配置,交接时需要明确镜像、文件位置、模型版本和资源需求。

调试代码并完成训练

适用于从数据探索、代码调试进入训练或微调的场景。 同一份数据可以供不同任务使用,输出目录应按实验区分。正式长训练开始前,先验证 checkpoint 的保存与加载;仅开启平台重试,不能验证训练进度能否恢复。 参考文档:

将模型部署为推理服务

适用于已有模型,或训练完成后需要对外提供在线推理能力的场景。 训练得到的 checkpoint 可能需要按引擎要求整理或转换,完成后再用于部署。扩大服务容量前,应区分单副本装不下模型,还是现有副本的请求处理能力不足。 参考文档:

发布自定义容器应用

适用于已经容器化的业务 API、自研推理服务、检索服务、OCR 服务或其他 HTTP / gRPC 应用。 发布前核对新旧版本并行运行所需的额外容量。有状态应用还需确认数据兼容性;应用版本回滚不恢复已经修改的数据。 参考文档:

提交后如何确认结果

页面提示提交成功,只表示平台接受了创建或变更请求。继续确认以下结果,判断任务或服务是否真正达到预期。
  • 配置和申请记录与预期一致。
  • 资源已完成调度,目标实例或副本进入可用状态。
  • 日志中没有镜像拉取、存储挂载、启动命令或模型加载异常。
  • 输出文件、checkpoint、服务请求或性能结果符合本次目标。
如果任务或服务未按预期运行,请根据发生阶段查看对应模块的排查文档;联系平台支持时,提供对象链接与 ID、区域、集群、项目组、发生时间、预期结果和脱敏错误信息。