Skip to main content
可观测用量稳定性
优化可观测、用量计费、调用链路和稳定性

新功能

  • 用量和费用分析支持展示 Top Models、Top API Keys 和成员用量等信息,便于快速定位主要调用来源和成本来源;其中成员用量仅管理员可见。更多说明请参考 查看模型指标
  • 指标页面新增首 Token 延迟(TTFT)、端到端延迟(Latency)和 Prompt 长度分布(prompt bucket)等指标,方便分析调用性能和响应延迟。更多说明请参考 查看模型指标
  • 使用详情 页面新增更完整的请求明细,包括请求时间、API Key、Token 用量、费用、TTFT 和端到端耗时等信息。

功能优化

  • 模型信息
    • 模型详情页优化 context windowmax output token 展示,帮助您更准确地评估模型上下文和输出能力。
  • 调用链路
    • 优化错误码表达:可重试恢复的错误使用 4xx 表达,便于调用方识别并配置处理逻辑。
    • 优化平台请求重试策略,减少部分临时错误场景下的无效重试。
  • 稳定性与性能
    • 优化高并发场景下的缓存和负载均衡能力,改善长上下文或高吞吐调用场景下的服务稳定性。
    • 优化推理服务部署和启动能力,缩短部分模型的服务准备时间。

Bug 修复

  • 修复部分长上下文调用场景下缓存命中异常的问题,提升连续请求的稳定性。
  • 修复部分长上下文调用场景下请求超时的问题。