> ## Documentation Index
> Fetch the complete documentation index at: https://docs.siflow.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 推理服务高级运维

> 了解推理服务上线后的扩缩容、监控告警、抢占声明以及测试和灰度发布入口。

推理服务上线后，可以通过扩缩容、监控告警、功能测试、性能压测和灰度发布控制服务容量、稳定性和变更风险。本页作为高级运维入口，帮助您判断该进入哪类操作。

## 扩缩容

推理服务支持手动扩缩容和弹性扩缩容。扩容前确认资源池配额；缩容前确认剩余容量可以承接当前流量、长连接和流式请求。

| 类型    | 适合场景                | 使用建议                                                                                           |
| ----- | ------------------- | ---------------------------------------------------------------------------------------------- |
| 手动扩缩容 | 业务流量变化明确，或需要临时提升容量。 | 在服务列表中使用 **扩/缩容** 入口，按角色调整副本数、实例配置和资源池。大模型推理服务如页面展示 **智能路由** 配置，还需要同时确认路由侧副本、实例配置和 **请求分发策略**。 |
| 定时扩缩容 | 流量峰谷规律明显。           | 在创建或更新服务的高级配置中配置时间点和目标副本数，并为资源等待和模型预热预留时间。                                                     |
| 指标扩缩容 | 流量波动较大，需要自动响应负载。    | 根据目标角色、指标、阈值、采集窗口、冷却时间和副本上下限配置规则。先用保守阈值观察，再逐步调整。                                               |

如果服务中任一角色使用多实例组等复杂配置，指标扩缩容能力以当前页面是否允许配置为准。手动调整后，自动策略可能再次修改目标副本；固定容量排障或压测前，应明确自动策略是否需要暂停。

## 监控和告警

推理服务可采集资源指标和引擎指标。资源监控用于查看 CPU、GPU、显存、内存和网络使用情况；引擎监控用于查看 vLLM、SGLang 等引擎的请求、延迟和吞吐相关指标。

<img src="https://mintcdn.com/siflow/avekptrv6O-LsLPz/ai-platform/inference/media/llm-inference-service-resource-monitoring.png?fit=max&auto=format&n=avekptrv6O-LsLPz&q=85&s=a1531d2330eb6ed2d1b1c51f6d8bc1f0" alt="大模型推理服务资源监控" width="3176" height="1626" data-path="ai-platform/inference/media/llm-inference-service-resource-monitoring.png" />

| 目标     | 查看内容                 | 操作建议                            |
| ------ | -------------------- | ------------------------------- |
| 判断资源瓶颈 | CPU、GPU、显存、内存、网络。    | 资源长期接近上限且延迟上升时，评估扩容或调整引擎参数。     |
| 判断引擎瓶颈 | 请求量、错误、延迟、吞吐等引擎指标。   | 与资源监控一起查看，区分服务端瓶颈和请求侧波动。        |
| 配置告警   | 服务异常、错误率、删除滞留或自定义指标。 | 在告警中心订阅推理服务相关告警，并结合业务可用性配置通知策略。 |

当前服务异常类告警以控制台可订阅项为准。如果需要监控自定义指标，请先确认服务已暴露 Metrics 路径和端口。

## 抢占声明

创建推理服务时，部分集群支持声明服务是否允许被抢占。该声明用于表达服务在资源紧张时是否可以让路给更高优先级作业，不改变服务计费口径，也不提升服务调度优先级。

| 场景            | 建议                            |
| ------------- | ----------------------------- |
| 实验性、非关键、可中断服务 | 可以声明允许被抢占。                    |
| 生产服务或关键在线服务   | 不建议声明允许被抢占。                   |
| 使用闲时资源        | 闲时资源通常按可抢占理解，最终行为以资源池规则为准。    |
| 使用按量资源        | 按量资源通常不按可抢占资源处理，最终行为以资源池规则为准。 |

抢占声明的实际效果取决于服务使用的资源池类型和角色资源配置。多角色服务可能为不同角色选择不同资源池，实际抢占行为需要分别判断。

## 专项运维

| 目标                    | 参考文档                                                         |
| --------------------- | ------------------------------------------------------------ |
| 先用部分流量验证新版本，再全量发布或回滚。 | [使用灰度发布更新推理服务](./release-inference-services-with-canary)     |
| 验证服务接口和模型能力是否符合预期。    | [对大模型推理服务进行功能测试](./test-llm-inference-service-functionality) |
| 评估服务吞吐、延迟和容量边界。       | [对大模型推理服务进行性能压测](./load-test-llm-inference-services)         |

智能路由、分布式 KV Cache 和自定义监控看板等能力会受引擎、集群和服务配置影响。当前页面提供对应配置入口时，再按业务目标启用；没有确认入口和字段前，不建议把这些能力写成固定操作路径。
