Skip to main content
本页用于排查通用服务和大模型推理服务上线后的常见问题。先确认服务类型,再使用对应服务的访问、发布和测试文档。

服务实例运行中,但请求失败

服务实例运行中只表示工作负载已经启动,不代表网关、鉴权和业务接口都可以正常访问。
  1. 在服务详情页确认当前访问地址,以及对应的协议、端口和入口路径。
  2. 核对鉴权方式、请求 Header、模型标识和业务 API 路径。
  3. 通用服务应监听可供容器外访问的地址;仅监听 127.0.0.1 时,通常无法通过网关访问。
  4. 检查目标实例是否就绪,并查看事件、健康检查和实例日志。
  5. 使用最小请求验证业务响应,再逐步加入完整请求参数和正式流量。
通用服务请参考创建通用服务;大模型推理服务可使用功能测试验证请求。

扩容后仍不能承载流量

先区分单个副本是否能够承载模型或应用,再判断已就绪副本的总容量是否足够。 单个副本无法承载模型或应用
  1. 检查单个副本的资源规格是否足以加载模型或运行应用。
  2. 如果单个副本容量不足,调整资源规格、并行方案或模型。
副本能够正常就绪,但总吞吐不足
  1. 扩容前,需预留模型加载和预热时间。
  2. 增加容量后,确认新增副本已经就绪。
  3. 观察延迟、错误率和请求排队情况,判断扩容后的总容量是否满足需求。
手动和自动扩缩容的配置边界请参考推理服务高级运维。

发布或优雅退出时担心中断请求

  • 优雅退出的边界: 优雅退出延迟只是延长 Pod 终止窗口。应用仍应正确处理终止信号:停止接收新请求、处理或转交在途请求,并在退出前完成状态落盘。
  • 发布后的验证: 上线后先使用低流量验证;不要用延长等待时间替代探针、重试和数据一致性设计。
大模型推理服务请参考发布和回滚大模型推理服务,通用服务请参考发布和回滚通用服务。

推理服务没有指标数据是否表示异常

不一定。可能是查询时间范围内没有请求、监控未采集到样本,或当前引擎不支持该指标。
  1. 确认服务正在运行,并将查询时间范围调整到实际请求发生时间。
  2. 检查指标采集状态;如果只有部分指标缺失,确认当前引擎是否支持对应指标。
  3. 结合服务详情、事件和日志判断服务是否正常,不要仅根据指标是否显示数据下结论。
监控范围和使用方式请参考推理服务高级运维。