首次使用准备
首次使用建议先完成小规模验证:读取少量样本、执行少量训练步骤,或发送一个测试请求。确认资源、路径和依赖正确后,再扩大运行规模。
找不到资源或对象时,先检查租户、区域、集群、项目组和筛选条件;范围无误后,再请管理员核对权限。列表中的 全部 只改变筛选范围,不会增加访问权限。
选择工作负载
按工作目标选择入口,再准备对应的资源和资产。典型使用路径
如果从开发调试开始,完整研发与服务路径通常会经过资源与资产准备、开发调试、训练与微调、模型产物确认、推理服务创建和服务请求验证。已有训练配置、已有模型或已有自定义应用镜像时,可以从对应阶段进入,不需要从头执行整条路径。完整路径表示常见工作衔接,不代表平台自动执行整条流水线。开发、训练和服务使用独立配置,交接时需要明确镜像、文件位置、模型版本和资源需求。
调试代码并完成训练
适用于从数据探索、代码调试进入训练或微调的场景。
同一份数据可以供不同任务使用,输出目录应按实验区分。正式长训练开始前,先验证 checkpoint 的保存与加载;仅开启平台重试,不能验证训练进度能否恢复。
参考文档:
将模型部署为推理服务
适用于已有模型,或训练完成后需要对外提供在线推理能力的场景。
训练得到的 checkpoint 可能需要按引擎要求整理或转换,完成后再用于部署。扩大服务容量前,应区分单副本装不下模型,还是现有副本的请求处理能力不足。
参考文档:
发布自定义容器应用
适用于已经容器化的业务 API、自研推理服务、检索服务、OCR 服务或其他 HTTP / gRPC 应用。
发布前核对新旧版本并行运行所需的额外容量。有状态应用还需确认数据兼容性;应用版本回滚不恢复已经修改的数据。
参考文档:
提交后如何确认结果
页面提示提交成功,只表示平台接受了创建或变更请求。继续确认以下结果,判断任务或服务是否真正达到预期。- 配置和申请记录与预期一致。
- 资源已完成调度,目标实例或副本进入可用状态。
- 日志中没有镜像拉取、存储挂载、启动命令或模型加载异常。
- 输出文件、checkpoint、服务请求或性能结果符合本次目标。
