> ## Documentation Index
> Fetch the complete documentation index at: https://docs.siflow.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 管理大模型推理服务

> 查找和管理大模型推理服务，查看访问入口、实例状态、事件、日志、监控、测试任务和发布版本，调整服务容量与可见性。

大模型推理服务创建后，您可以在服务列表中查找服务，在详情页获取访问入口、排查实例状态、查看事件日志和监控，并根据业务状态执行扩/缩容、更新、回滚、下线、复制、分享、公开到项目组或删除。

## 查找服务

1. 进入 **推理服务 > 大模型推理**。
2. 选择 **区域**、**集群** 和 **项目组**。
3. 在搜索框中输入服务名称，或使用 **引擎类型**、**服务状态**、**资源池** 等筛选条件。
4. 在 **个人服务** 或 **被分享服务** 页签中查看服务。

列表中重点关注以下信息：

| 目标         | 关注信息                                                       | 判断方式                                                                                                                         |
| ---------- | ---------------------------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------- |
| 判断服务能否调用   | **服务状态**、**Endpoints**。                                    | 服务进入 **运行中** 后，再查看访问地址并发送最小请求。服务处于 **排队中**、**扩/缩容中** 等状态时，先进入详情查看事件和实例。                                                      |
| 判断资源是否正常占用 | **资源池**、**占用资源**。                                          | 关注各角色占用的实例规格和数量。目标副本与就绪副本长期不一致时，查看事件和实例日志。                                                                                   |
| 执行日常运维     | **详情**、**扩/缩容**、**更新**、**回滚**、**下线**、**Endpoints**、**更多**。 | 优先通过 **详情** 确认当前状态；需要调整容量时单击 **扩/缩容**，需要获取访问入口时单击 **Endpoints**。**更多** 菜单中可按需选择 **复制**、**分享**、**创建为模板**、**删除** 或 **公开到项目组**。 |
| 确认协作范围     | **个人服务**、**被分享服务**、创建人、项目组和可见性。                            | 自己创建或有权限管理的服务在 **个人服务** 查看；他人分享的服务在 **被分享服务** 查看。                                                                            |

## 查看服务详情

在服务列表中单击目标服务的 **详情**。详情页顶部展示服务状态、引擎、引擎版本、创建人、区域、集群和可见性；下方页签用于访问、排查、监控和测试。

| 目标            | 进入页签     | 关注信息和操作                                                                                                           |
| ------------- | -------- | ----------------------------------------------------------------------------------------------------------------- |
| 核对当前配置        | **基本信息** | 查看模型、引擎、资源、端口、网关和高级配置是否符合预期，再决定是否更新、扩缩容、回滚或重新创建。                                                                  |
| 排查实例未就绪或重启    | **实例列表** | 按 Pod 名称搜索，查看角色、容器状态、主机 IP、容器 IP、重启次数和状态。可对单个 Pod 单击 **重启**、**实时日志**、**查看监控** 或 **终端**。                           |
| 判断创建、调度或扩缩容卡点 | **事件**   | 通过事件时间线查看服务从创建、初始化、排队到运行的变化；结合事件类型、子类型、发生时间和事件信息定位卡点。需要持续关注时，可从事件行单击 **告警订阅**。                                    |
| 查看资源和引擎指标     | **监控告警** | 在 **配置**、**资源**、**Vllm 监控**、**Sglang 监控** 或 **自定义** 页签中查看；可按 Pod、监控数据、时间范围和采样步进筛选。                                |
| 获取调用地址        | **服务网关** | 查看 **Shared Gateway** 或 **In-Cluster Service** 的网关域名、路径、**Auth Token** 和 **开启路由 hash** 状态。需要验证入口时，单击对应网关的 **测试**。 |
| 管理历史版本        | **发布版本** | 查看版本号、版本状态、创建时间和更新时间。回滚前确认目标版本配置、模型文件和访问方式仍然可用。                                                                   |
| 排查启动或请求异常     | **日志**   | 在 **用户日志** 或 **系统日志** 中选择时间范围、Pod 和行数，使用过滤或关键字搜索定位问题；必要时单击 **下载** 保存日志。                                           |
| 验证接口或评估性能     | **一键测试** | 单击 **发起功能测试** 或 **添加压力测试任务**；任务结束后可 **查看报告**、**复制** 或 **删除** 历史测试任务。                                              |

<img src="https://mintcdn.com/siflow/avekptrv6O-LsLPz/ai-platform/inference/media/llm-inference-service-instance-list.png?fit=max&auto=format&n=avekptrv6O-LsLPz&q=85&s=580307ad65ab65b2473da335f0152912" alt="大模型推理服务实例列表" width="3248" height="784" data-path="ai-platform/inference/media/llm-inference-service-instance-list.png" />

日志默认展示最近 1 小时数据。平台日志当前仅保留近 30 天，选择的起始时间超出日志保留范围时，可能没有日志展示。

## 获取和验证访问入口

服务进入 **运行中** 后，可以在服务列表单击 **Endpoints**，也可以进入详情页打开 **服务网关** 页签。

| 调用入口                   | 适合场景               | 使用方式                                                                     |
| ---------------------- | ------------------ | ------------------------------------------------------------------------ |
| **Shared Gateway**     | 从集群外部或统一网关入口调用服务。  | 获取网关域名和路径；如果开启 **Auth Token**，调用方需要携带鉴权信息；如果开启 **路由 hash**，请按业务需要确认路由行为。 |
| **In-Cluster Service** | 在同一集群内由其他工作负载调用服务。 | 使用页面展示的集群内域名和路径。是否适合作为生产入口，以网络环境和调用方部署位置为准。                              |

如果页面同时提供测试入口和生产入口，测试入口仅用于验证，不建议作为正式调用地址。Auth Token 不应出现在截图、日志或共享材料中。

## 调整服务容量

服务容量不足、业务流量变化，或需要调整角色资源时，在服务列表单击 **扩/缩容**。

| 配置                 | 说明                                                                                                   |
| ------------------ | ---------------------------------------------------------------------------------------------------- |
| **引擎参数**           | 如需调整引擎运行参数，单击 **添加更多输入**。修改引擎参数可能影响启动命令、模型加载和接口行为，提交前需要确认与当前引擎、模型和端口配置兼容。                            |
| **资源池**            | 选择本次扩/缩容使用的资源池。资源池会影响可用配额、调度位置和资源保障方式。                                                               |
| 角色页签               | 按页面展示的角色分别配置，例如 **worker**。多角色服务需要逐个角色确认副本数和资源配置。                                                    |
| **副本数**            | 设置目标副本数量。仅修改副本数通常不会触发滚动更新；缩容前确认剩余副本可以承接当前流量。                                                         |
| **实例配置**           | 选择实例规格。页面会展示规格对应的 CPU、内存等信息以及可用节点数量；可用节点不足时，扩容可能排队或失败。                                               |
| **镜像**、**Command** | 如果页面展示这两个配置，说明本次变更可能涉及服务运行镜像或启动命令。修改前应记录当前可用配置，确认新镜像、命令、端口和模型路径仍能正常启动。                               |
| **智能路由**           | 开启后，按页面要求配置路由侧资源。可选择是否使用其他资源池，并填写路由副本数、实例配置和 **请求分发策略**，例如 `cache_aware_no_queue`。不确定策略含义时，优先保持现有配置。 |

单击 **确定** 后，进入详情页查看 **事件** 和 **实例列表**，确认目标副本和就绪副本逐步达到预期；如果实例长时间未就绪，再查看 **日志** 和 **监控告警**。

## 管理服务

| 操作          | 入口和用途                                                                           | 操作前关注                                                      |
| ----------- | ------------------------------------------------------------------------------- | ---------------------------------------------------------- |
| **更新**      | 在服务列表单击 **更新**，修改服务配置。运行中服务通常适合更新非资源类配置；下线后可修改更多配置。                             | 修改模型、引擎、镜像、启动参数或探针前，建议记录当前可用版本和业务基线。高风险变更优先使用灰度发布。         |
| **回滚**      | 在服务列表或 **发布版本** 页签中使用回滚入口，将服务恢复到历史版本。                                           | 回滚后重新验证模型文件、资源、入口和数据兼容性。                                   |
| **下线 / 上线** | 运行中的服务可在列表中单击 **下线** 停止服务；下线后的服务如页面提供 **上线** 入口，可重新启动服务。                        | 下线前迁移或停止业务流量；上线后等待服务进入 **运行中**，再验证端点。                      |
| **复制**      | 在 **更多** 菜单中选择 **复制**，复用当前服务配置创建相似服务。                                           | 提交前重新核对服务名称、项目组、资源池、访问入口和敏感配置，不要直接复用不适合新场景的 Token、路径或模型版本。 |
| **分享**      | 在 **更多** 菜单中选择 **分享**，将服务分享给其他用户查看或使用。                                          | 确认服务中是否包含敏感模型、访问端点或运行配置。分享后，被分享用户可在 **被分享服务** 页签查看。        |
| **公开到项目组**  | 在 **更多** 菜单中选择 **公开到项目组**，将服务可见范围调整为项目组内可见。                                     | 公开前确认项目组成员是否都适合查看或使用该服务。                                   |
| **创建为模板**   | 在 **更多** 菜单中选择 **创建为模板**，将当前服务配置保存为[大模型推理模板](./manage-llm-inference-templates)。 | 保存前核对模型路径、引擎、探针和网关配置是否适合复用。                                |
| **删除**      | 在 **更多** 菜单中选择 **删除**，删除服务记录和相关运行资源。                                            | 删除前确认服务已无调用方依赖，并保存必要配置、日志或排查信息。                            |

## 排查服务异常

排查服务不可用或性能异常时，建议按以下顺序查看：

1. 查看服务状态和事件，确认是否存在资源不足、镜像拉取失败、探针失败或网关配置问题。
2. 查看实例状态，定位异常角色和异常实例。
3. 查看日志，确认模型加载、引擎启动和请求处理是否异常。
4. 查看资源监控和引擎监控，判断 GPU、显存、CPU、内存、吞吐或延迟是否成为瓶颈。
5. 如果需要验证接口正确性，发起功能测试；如果需要评估容量，发起性能压测。

<img src="https://mintcdn.com/siflow/avekptrv6O-LsLPz/ai-platform/inference/media/llm-inference-service-events.png?fit=max&auto=format&n=avekptrv6O-LsLPz&q=85&s=bde787d5b47c645a945707fdca2296c3" alt="大模型推理服务事件列表" width="3164" height="1462" data-path="ai-platform/inference/media/llm-inference-service-events.png" />

<img src="https://mintcdn.com/siflow/avekptrv6O-LsLPz/ai-platform/inference/media/llm-inference-service-logs.png?fit=max&auto=format&n=avekptrv6O-LsLPz&q=85&s=8305436ef4e0177c9aebf6224b8d5a96" alt="大模型推理服务日志" width="3178" height="1520" data-path="ai-platform/inference/media/llm-inference-service-logs.png" />

## 相关文档

* [使用灰度发布更新推理服务](./release-inference-services-with-canary)
* [对大模型推理服务进行功能测试](./test-llm-inference-service-functionality)
* [对大模型推理服务进行性能压测](./load-test-llm-inference-services)
