> ## Documentation Index
> Fetch the complete documentation index at: https://docs.siflow.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 服务访问、扩缩容和发布问题

> 排查推理服务请求失败、扩容后容量未生效、发布风险和监控指标缺失的问题。

本页用于排查通用服务和大模型推理服务上线后的常见问题。先确认服务类型，再使用对应服务的访问、发布和测试文档。

## 服务实例运行中，但请求失败

服务实例运行中只表示工作负载已经启动，不代表网关、鉴权和业务接口都可以正常访问。

1. 在服务详情页确认当前访问地址，以及对应的协议、端口和入口路径。
2. 核对鉴权方式、请求 Header、模型标识和业务 API 路径。
3. 通用服务应监听可供容器外访问的地址；仅监听 `127.0.0.1` 时，通常无法通过网关访问。
4. 检查目标实例是否就绪，并查看事件、健康检查和实例日志。
5. 使用最小请求验证业务响应，再逐步加入完整请求参数和正式流量。

通用服务请参考[创建通用服务](../inference/create-general-inference-services#4-验证访问)；大模型推理服务可使用[功能测试](../inference/test-llm-inference-service-functionality)验证请求。

## 扩容后仍不能承载流量

先区分单个副本是否能够承载模型或应用，再判断已就绪副本的总容量是否足够。

**单个副本无法承载模型或应用**

1. 检查单个副本的资源规格是否足以加载模型或运行应用。
2. 如果单个副本容量不足，调整资源规格、并行方案或模型。

**副本能够正常就绪，但总吞吐不足**

1. 扩容前，需预留模型加载和预热时间。
2. 增加容量后，确认新增副本已经就绪。
3. 观察延迟、错误率和请求排队情况，判断扩容后的总容量是否满足需求。

手动和自动扩缩容的配置边界请参考[推理服务高级运维](../inference/advanced-inference-service-operations#扩缩容)。

## 发布或优雅退出时担心中断请求

* **优雅退出的边界：** 优雅退出延迟只是延长 Pod 终止窗口。应用仍应正确处理终止信号：停止接收新请求、处理或转交在途请求，并在退出前完成状态落盘。
* **发布后的验证：** 上线后先使用低流量验证；不要用延长等待时间替代探针、重试和数据一致性设计。

大模型推理服务请参考[发布和回滚大模型推理服务](../inference/release-and-rollback-llm-inference-services)，通用服务请参考[发布和回滚通用服务](../inference/release-and-rollback-general-inference-services)。

## 推理服务没有指标数据是否表示异常

不一定。可能是查询时间范围内没有请求、监控未采集到样本，或当前引擎不支持该指标。

1. 确认服务正在运行，并将查询时间范围调整到实际请求发生时间。
2. 检查指标采集状态；如果只有部分指标缺失，确认当前引擎是否支持对应指标。
3. 结合服务详情、事件和日志判断服务是否正常，不要仅根据指标是否显示数据下结论。

监控范围和使用方式请参考[推理服务高级运维](../inference/advanced-inference-service-operations#监控和告警)。
