> ## Documentation Index
> Fetch the complete documentation index at: https://docs.siflow.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 查看指标

> 了解如何在算秩控制台查看 Model Inference 的聚合指标、调用趋势、token 分布和延迟表现。

登录控制台后，您可以在 [指标](https://console.siflow.cn/model-inference/metrics) 页面查看模型调用的聚合指标和趋势数据。

<Tip>
  * **指标**：适合用于观察一段时间内的整体调用情况、吞吐变化和延迟表现。
  * **首页**：适合快速查看 Top Models、Top API Keys 和成员用量等主要调用来源；其中成员用量仅管理员可见。
  * **使用详情**：适合查看单次请求的明细，请前往 [使用详情](https://console.siflow.cn/model-inference/usage_detail) 页面。
</Tip>

## 筛选维度

您可以按以下维度查看指标：

* **时间范围**：选择近 24 小时、近 7 天、近 30 天，或通过开始日期和结束日期自定义时间范围。
* **模型**：查看全部模型，或选择指定模型查看对应指标。

## 概览指标

<img src="https://mintcdn.com/siflow/y-4za1XaEo28tRFe/model-inference/media/model-metrics-overview.png?fit=max&auto=format&n=y-4za1XaEo28tRFe&q=85&s=99d513e9de683648f3cbe8c08abb5c68" alt="概览指标" width="2548" height="332" data-path="model-inference/media/model-metrics-overview.png" />

页面顶部会展示当前筛选条件下的汇总指标：

| 指标       | 说明                                | 关注点                                                                 |
| -------- | --------------------------------- | ------------------------------------------------------------------- |
| 总 Tokens | 当前时间范围内的 token 总用量。               | 用于观察整体用量和成本变化。如果总量明显升高，可继续查看 Token 分布，判断增长主要来自输入、输出、推理还是缓存相关 token。 |
| API 请求   | 当前时间范围内的 API 请求总数。                | 用于判断调用规模和流量变化。如果请求数异常升高，可结合业务发布时间、批量任务或重试逻辑排查原因。                    |
| 平均 RPM   | 平均每分钟请求数（Requests Per Minute）。    | 用于观察请求吞吐。如果 RPM 接近密钥或服务限速，需要评估是否调整调用节奏或速率限制。                        |
| 平均 TPM   | 平均每分钟 token 数（Tokens Per Minute）。 | 用于观察 token 吞吐。如果 TPM 明显升高，通常说明长上下文、长输出或并发请求增加，费用也可能随之上升。            |

## 图表说明

<img src="https://mintcdn.com/siflow/y-4za1XaEo28tRFe/model-inference/media/model-metrics.png?fit=max&auto=format&n=y-4za1XaEo28tRFe&q=85&s=ad827fa65e2d21828e961747362f68d2" alt="指标" width="2558" height="1862" data-path="model-inference/media/model-metrics.png" />

指标页面包含多类趋势和分布图，用于从不同角度分析调用情况：

| 图表               | 说明                                           | 关注点                                                                     |
| ---------------- | -------------------------------------------- | ----------------------------------------------------------------------- |
| Token 使用         | 展示 token 使用量随时间的变化。                          | 用于定位用量峰值出现的时间段。若峰值异常，可结合业务日志和使用详情页面排查具体请求。                              |
| API 请求           | 展示 API 请求数量随时间的变化。                           | 用于判断请求量变化。如果请求数增加但 token 用量变化不大，通常说明短请求或探测类请求变多。                        |
| RPM              | 展示每分钟请求数变化，用于观察请求吞吐。                         | 如果 RPM 明显升高，说明请求量或并发使用增加，可结合 API 密钥的 RPM 限制判断是否接近限速。                    |
| TPM              | 展示每分钟 token 数变化，用于观察 token 吞吐。               | 如果 TPM 明显升高，说明整体 token 吞吐增加，可结合 Token 分布判断是否由输入、输出或推理 token 拉高。         |
| Token 分布         | 展示不同 token 类型的分布，例如输入、缓存读、缓存写、推理和输出。         | 用于分析成本结构。如果输出或推理 token 占比较高，可检查生成长度、reasoning 模型使用情况和参数设置。              |
| Prompt 长度分布      | 按 prompt 长度区间展示请求数量，并统计对应的 TTFT 和 E2E 延迟分位数。 | 如果长 prompt 占比较高，可以考虑压缩上下文、拆分任务或使用 Prompt Caching 降低重复上下文处理成本。           |
| 首 Token 延迟（TTFT） | 展示从请求发起到首个输出 token 返回的耗时。                    | 如果 TTFT 升高，调用模型 API 的用户会更早感知到模型开始返回变慢。可结合模型、prompt 长度、是否流式输出和请求峰值进一步分析。 |
| 端到端延迟（E2E）       | 展示从请求发起到响应完成的总耗时。                            | 如果 E2E 升高，通常与输出长度、模型类型、上下文长度或并发负载有关。可结合输出 token 数和使用详情中的单次请求记录定位原因。     |

## 常见分析路径

* **分析成本变化**：优先查看总 Tokens、TPM 和 Token 分布，判断成本增长主要来自输入、输出、推理还是缓存相关 token。
* **排查响应变慢**：优先查看首 Token 延迟（TTFT）和端到端延迟（E2E）。TTFT 偏高时重点关注首个 token 返回速度；E2E 偏高时重点关注输出长度和完整生成耗时。
* **观察流量波动**：结合 API 请求、RPM 和 TPM 判断调用峰值，必要时检查业务侧是否存在批量任务、定时任务或重试放大。
* **优化 prompt 长度**：查看 Prompt 长度分布。如果长 prompt 占比较高，可以考虑压缩上下文、拆分任务或复用缓存能力。
* **对比模型表现**：按模型筛选后查看延迟、吞吐和 token 分布，辅助判断不同模型是否适合当前业务场景。
