> ## Documentation Index
> Fetch the complete documentation index at: https://docs.siflow.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 产品发布记录

> 查看 Model Inference 的控制台、API、可观测、用量计费、稳定性和兼容性发布记录。

<Update
  label="2026.08.26"
  description="优化可观测、用量计费、调用链路和稳定性"
  tags={["可观测", "用量", "稳定性"]}
  rss={{
title: "Model Inference 产品发布 - 2026.08.26",
description: "优化模型详情、用量费用、错误码表达、请求重试和高并发调用稳定性。"
}}
>
  ### <Icon icon="sparkles" /> 新功能

  * 用量和费用分析支持展示 Top Models、Top API Keys 和成员用量等信息，便于快速定位主要调用来源和成本来源；其中成员用量仅管理员可见。更多说明请参考 [查看模型指标](/model-inference/usage/view-metrics)。
  * 指标页面新增首 Token 延迟（TTFT）、端到端延迟（Latency）和 Prompt 长度分布（prompt bucket）等指标，方便分析调用性能和响应延迟。更多说明请参考 [查看模型指标](/model-inference/usage/view-metrics)。
  * [使用详情](/model-inference/usage/view-usage) 页面新增更完整的请求明细，包括请求时间、API Key、Token 用量、费用、TTFT 和端到端耗时等信息。

  ### <Icon icon="wrench" /> 功能优化

  * **模型信息**
    * 模型详情页优化 `context window` 和 `max output token` 展示，帮助您更准确地评估模型上下文和输出能力。

  * **调用链路**
    * 优化错误码表达：可重试恢复的错误使用 4xx 表达，便于调用方识别并配置处理逻辑。
    * 优化平台请求重试策略，减少部分临时错误场景下的无效重试。

  * **稳定性与性能**
    * 优化高并发场景下的缓存和负载均衡能力，改善长上下文或高吞吐调用场景下的服务稳定性。
    * 优化推理服务部署和启动能力，缩短部分模型的服务准备时间。

  ### <Icon icon="bug" /> Bug 修复

  * 修复部分长上下文调用场景下缓存命中异常的问题，提升连续请求的稳定性。
  * 修复部分长上下文调用场景下请求超时的问题。
</Update>
