Skip to main content
推理服务上线后,可以通过扩缩容、监控告警、功能测试、性能压测和灰度发布控制服务容量、稳定性和变更风险。本页作为高级运维入口,帮助您判断该进入哪类操作。

扩缩容

推理服务支持手动扩缩容和弹性扩缩容。扩容前确认资源池配额;缩容前确认剩余容量可以承接当前流量、长连接和流式请求。 如果服务中任一角色使用多实例组等复杂配置,指标扩缩容能力以当前页面是否允许配置为准。手动调整后,自动策略可能再次修改目标副本;固定容量排障或压测前,应明确自动策略是否需要暂停。

监控和告警

推理服务可采集资源指标和引擎指标。资源监控用于查看 CPU、GPU、显存、内存和网络使用情况;引擎监控用于查看 vLLM、SGLang 等引擎的请求、延迟和吞吐相关指标。 大模型推理服务资源监控 当前服务异常类告警以控制台可订阅项为准。如果需要监控自定义指标,请先确认服务已暴露 Metrics 路径和端口。

抢占声明

创建推理服务时,部分集群支持声明服务是否允许被抢占。该声明用于表达服务在资源紧张时是否可以让路给更高优先级作业,不改变服务计费口径,也不提升服务调度优先级。 抢占声明的实际效果取决于服务使用的资源池类型和角色资源配置。多角色服务可能为不同角色选择不同资源池,实际抢占行为需要分别判断。

专项运维

智能路由、分布式 KV Cache 和自定义监控看板等能力会受引擎、集群和服务配置影响。当前页面提供对应配置入口时,再按业务目标启用;没有确认入口和字段前,不建议把这些能力写成固定操作路径。