Skip to main content
创建大模型推理服务后,平台会根据模型、推理引擎、资源池和服务配置拉起服务实例,并提供访问端点用于在线调用。您可以使用表单创建,也可以通过 JSON 复用已有配置。

使用表单创建服务

1. 进入创建页

  1. 进入 推理服务 > 大模型推理。
  2. 单击 新建,选择 表单创建。

2. 填写配置信息

基础配置

基础配置决定服务所在范围、服务名称和项目组可见性。

推荐模板和资源池

如需提前创建或维护模板,请参考管理大模型推理模板。

推理引擎

选择 引擎 后,如页面展示 引擎版本、执行方式 或角色资源配置,请按页面要求继续填写。更换 引擎、引擎版本 或 执行方式 后,原有角色配置可能不再适用,提交前需要重新核对每个角色的副本、组规模、实例规格和 GPU 总量。 常见执行方式和角色关系如下,实际可选项以当前引擎和页面展示为准。 vLLM 和 SGLang 使用平台内置启动方式时,引擎参数会追加到平台生成的启动命令中,例如 vllm serve --port <PORT> --host <HOST> {{引擎参数}} 或 python3 -m sglang.launch_server --port <PORT> --host <HOST> {{引擎参数}}。Custom 模式需要自行填写完整启动命令,并确保命令、端口和服务协议与后续端口、探针和网关配置一致;如需读取平台传入的模型路径或引擎参数,可在命令中引用 MODEL_PATH、ENGINE_PARAMS 等环境变量。

模型配置

选择 Volume 作为模型来源时,需要区分容器内 挂载路径 和挂载目录下的 模型路径。最终传给推理引擎的模型路径为 MountPath/ModelPath。如填写 SubPath,它只用于把 PVC 限定到某个子目录并做目录级鉴权,不要把 模型路径 当作 Kubernetes 的 SubPath 使用。Lora 模型 使用 Volume 来源时也遵循同样规则。

缓存配置

服务配置

服务配置用于控制服务实例的健康检查。 探针支持 HTTP、TCP 和 Exec。HTTP 适合已有 /health 或 /ready 等健康检查接口的服务;TCP 适合只确认端口连通的服务;Exec 适合在容器内执行自定义命令检查文件、进程或多端口状态。 vLLM 和 SGLang 常见健康检查路径为 /health,具体路径和端口仍应以所选引擎配置和服务实际暴露能力为准。

监控配置

高级配置

容器本地盘(如 /root、/tmp 等本地目录)容量有限,写入大量数据可能导致负载系统驱逐;重启或迁移后本地数据会被清空。请将数据集、模型、输出结果等重要文件写入挂载的 Volume 共享存储,挂载路径建议使用 /volume、/mnt 等开头的目录,避免覆盖根目录、/opt、/workspace、/usr 等镜像中默认目录。

3. 提交并验证

  1. 提交前核对模型来源、引擎版本、执行方式、各角色资源总量、端口、网关和公开范围。
  2. 单击 提交。
  3. 提交后查看各角色目标实例和就绪实例,结合事件和日志确认模型加载进度。
  4. 服务进入 运行中 后,在服务列表单击 Endpoints,或在详情页打开 服务网关,获取实际访问地址和鉴权信息。
  5. 按协议、路径、端口和鉴权方式发送最小请求,确认模型标识、响应内容以及流式或非流式调用方式符合预期。
如果 Endpoints 同时提供测试入口和生产入口,测试入口仅用于验证,不建议作为正式调用地址。Auth Token 不应出现在截图、日志或共享材料中。

使用 JSON 创建服务

如果需要复用已有配置、批量迁移服务,或由自动化流程生成服务参数,可以使用 JSON 创建。
  1. 进入 推理服务 > 大模型推理。
  2. 单击 新建,选择 JSON 创建。
  3. 选择 区域 和 集群。
  4. 在编辑器中填写服务配置 JSON。
  5. 单击 新建。

示例配置

以下示例使用模型仓库中的模型,通过 vLLM 以 单节点 方式创建大模型推理服务。提交前,请根据实际区域、集群、资源池、实例规格、模型路径和访问策略修改占位值。

配置说明

使用 JSON 创建时,请确保资源池、模型、镜像、端口、环境变量和网关信息与目标区域、集群一致。提交前可从已有服务或模板复制配置,再按本次服务目标修改必要字段。

后续操作

管理大模型推理服务