使用表单创建服务
1. 进入创建页
- 进入 推理服务 > 大模型推理。
- 单击 新建,选择 表单创建。
2. 填写配置信息
基础配置
基础配置决定服务所在范围、服务名称和项目组可见性。推荐模板和资源池
如需提前创建或维护模板,请参考管理大模型推理模板。
推理引擎
选择 引擎 后,如页面展示 引擎版本、执行方式 或角色资源配置,请按页面要求继续填写。更换 引擎、引擎版本 或 执行方式 后,原有角色配置可能不再适用,提交前需要重新核对每个角色的副本、组规模、实例规格和 GPU 总量。
常见执行方式和角色关系如下,实际可选项以当前引擎和页面展示为准。
vLLM 和 SGLang 使用平台内置启动方式时,引擎参数会追加到平台生成的启动命令中,例如
vllm serve --port <PORT> --host <HOST> {{引擎参数}} 或 python3 -m sglang.launch_server --port <PORT> --host <HOST> {{引擎参数}}。Custom 模式需要自行填写完整启动命令,并确保命令、端口和服务协议与后续端口、探针和网关配置一致;如需读取平台传入的模型路径或引擎参数,可在命令中引用 MODEL_PATH、ENGINE_PARAMS 等环境变量。
模型配置
选择 Volume 作为模型来源时,需要区分容器内 挂载路径 和挂载目录下的 模型路径。最终传给推理引擎的模型路径为
MountPath/ModelPath。如填写 SubPath,它只用于把 PVC 限定到某个子目录并做目录级鉴权,不要把 模型路径 当作 Kubernetes 的 SubPath 使用。Lora 模型 使用 Volume 来源时也遵循同样规则。
缓存配置
服务配置
服务配置用于控制服务实例的健康检查。
探针支持 HTTP、TCP 和 Exec。HTTP 适合已有
/health 或 /ready 等健康检查接口的服务;TCP 适合只确认端口连通的服务;Exec 适合在容器内执行自定义命令检查文件、进程或多端口状态。
vLLM 和 SGLang 常见健康检查路径为 /health,具体路径和端口仍应以所选引擎配置和服务实际暴露能力为准。
监控配置
高级配置
容器本地盘(如
/root、/tmp 等本地目录)容量有限,写入大量数据可能导致负载系统驱逐;重启或迁移后本地数据会被清空。请将数据集、模型、输出结果等重要文件写入挂载的 Volume 共享存储,挂载路径建议使用 /volume、/mnt 等开头的目录,避免覆盖根目录、/opt、/workspace、/usr 等镜像中默认目录。
3. 提交并验证
- 提交前核对模型来源、引擎版本、执行方式、各角色资源总量、端口、网关和公开范围。
- 单击 提交。
- 提交后查看各角色目标实例和就绪实例,结合事件和日志确认模型加载进度。
- 服务进入 运行中 后,在服务列表单击 Endpoints,或在详情页打开 服务网关,获取实际访问地址和鉴权信息。
- 按协议、路径、端口和鉴权方式发送最小请求,确认模型标识、响应内容以及流式或非流式调用方式符合预期。
使用 JSON 创建服务
如果需要复用已有配置、批量迁移服务,或由自动化流程生成服务参数,可以使用 JSON 创建。- 进入 推理服务 > 大模型推理。
- 单击 新建,选择 JSON 创建。
- 选择 区域 和 集群。
- 在编辑器中填写服务配置 JSON。
- 单击 新建。
示例配置
以下示例使用模型仓库中的模型,通过 vLLM 以 单节点 方式创建大模型推理服务。提交前,请根据实际区域、集群、资源池、实例规格、模型路径和访问策略修改占位值。配置说明
使用 JSON 创建时,请确保资源池、模型、镜像、端口、环境变量和网关信息与目标区域、集群一致。提交前可从已有服务或模板复制配置,再按本次服务目标修改必要字段。
