新功能
- 用量和费用分析支持展示 Top Models、Top API Keys 和成员用量等信息,便于快速定位主要调用来源和成本来源;其中成员用量仅管理员可见。更多说明请参考 查看模型指标。
- 指标页面新增首 Token 延迟(TTFT)、端到端延迟(Latency)和 Prompt 长度分布(prompt bucket)等指标,方便分析调用性能和响应延迟。更多说明请参考 查看模型指标。
- 使用详情 页面新增更完整的请求明细,包括请求时间、API Key、Token 用量、费用、TTFT 和端到端耗时等信息。
功能优化
-
模型信息
- 模型详情页优化
context window和max output token展示,帮助您更准确地评估模型上下文和输出能力。
- 模型详情页优化
-
调用链路
- 优化错误码表达:可重试恢复的错误使用 4xx 表达,便于调用方识别并配置处理逻辑。
- 优化平台请求重试策略,减少部分临时错误场景下的无效重试。
-
稳定性与性能
- 优化高并发场景下的缓存和负载均衡能力,改善长上下文或高吞吐调用场景下的服务稳定性。
- 优化推理服务部署和启动能力,缩短部分模型的服务准备时间。
Bug 修复
- 修复部分长上下文调用场景下缓存命中异常的问题,提升连续请求的稳定性。
- 修复部分长上下文调用场景下请求超时的问题。
