Skip to main content
推理服务用于将模型或容器化应用发布为在线服务,并通过访问端点对外提供调用。

服务类型

如果要发布大语言模型,优先使用 大模型推理服务。如果服务本质上是一个自定义 HTTP、gRPC 或其他容器化应用,使用 通用服务 更合适。

基本对象

使用路径

大模型推理服务

  1. 准备模型、资源池和存储资源。模型可来自模型仓库、Volume、对象存储或其他可用来源。
  2. 如需复用团队配置,先准备大模型引擎配置,或在管理大模型推理模板中创建模板。模板可沉淀模型、引擎、执行方式、探针、监控和部分高级配置。
  3. 创建服务时,选择模型来源、推理引擎、执行方式,并按角色配置副本、实例规格和资源池。执行方式会影响需要配置的角色,例如 worker、leader、router、prefill 和 decode。
  4. 配置健康检查、监控、端口、网关和高级选项后提交服务。
  5. 服务进入 运行中 后,查看 Endpoints 并发送最小请求。
  6. 上线后按需管理服务、调整容量、灰度发布、功能测试、性能压测或配置告警。

通用服务

  1. 准备服务镜像、启动命令、服务端口、资源池和必要的存储资源。
  2. 创建服务时,配置基本信息、资源信息、环境信息、增强功能、网关和监控。
  3. 如果开启鉴权或 Base URL,确认调用方能携带 Token,并确认服务能处理对应访问路径。
  4. 服务进入 运行中 后,查看访问端点并发送最小业务请求。
  5. 上线后按需执行上线、下线、更新、重启、定时任务、灰度发布或回滚。

相关文档