创建模板
1. 进入创建页
- 进入 推理服务 > 大模型推理模板。
- 选择 区域 和 集群。
- 单击 新建。
2. 填写配置信息
基础配置
模型和引擎
探针、监控和高级配置
探针支持 HTTP、TCP 和 Exec 等检查方式。服务提供健康检查接口时,优先配置 可用性探针,避免模型未加载完成时接入流量;如果需要在进程卡死或异常时自动恢复,再配置 存活探针。
Documentation Index
Fetch the complete documentation index at: /llms.txt
Use this file to discover all available pages before exploring further.
在人工智能平台中创建、复用和管理大模型推理模板,用于沉淀模型、引擎、探针、监控和高级配置。
| 配置 | 说明 |
|---|---|
| 模板名 | 用于创建服务时识别和选择模板,建议包含模型、引擎或部署形态。 |
| 是否公开 | 控制模板是否可被其他用户查看或复用。 |
| 配置 | 说明 |
|---|---|
| 模型 | 选择模型来源、模型版本和访问路径。 |
| LoRA 模型 | 如需加载 LoRA Adapter,可开启并配置对应模型。 |
| 引擎 | 选择已配置的推理引擎和版本。 |
| 引擎参数 | 为推理引擎追加启动参数。分布式和 PD 分离所需的系统参数通常由平台生成,不需要重复填写。 |
| Served Model Name | 设置服务对外暴露的模型名称。 |
| 配置 | 说明 |
|---|---|
| 存活探针 | 判断服务进程是否存活,失败后平台可按策略重启实例。 |
| 可用性探针 | 判断服务是否可以接收流量,失败时平台不再向该实例分配新请求。 |
| Metrics | 配置指标采集路径和端口,用于监控、扩缩容或告警。 |
| 环境变量 | 注入服务运行时配置。 |
| 存储 | 挂载额外 Volume。 |
| 服务端口 | 配置服务监听或暴露端口。 |
| 弹性扩缩容配置 | 按时间或指标配置服务副本伸缩策略。 |
| 网关配置 | 配置服务访问入口、鉴权和路由。 |
| 是否推送告警 | 控制服务异常时是否进入告警链路。 |
| 操作 | 说明 |
|---|---|
| 编辑 | 修改模板配置。修改后,请在下次使用模板创建服务前重新核对模型、引擎和高级配置。 |
| 克隆 | 基于已有模板复制一份新模板,适合保留原模板并调整模型、引擎或高级配置。 |
| 删除 | 删除不再使用的模板。删除前请确认团队不再依赖该模板创建服务。 |
