| Token 使用 | 展示 token 使用量随时间的变化。 | 用于定位用量峰值出现的时间段。若峰值异常,可结合业务日志和使用详情页面排查具体请求。 |
| API 请求 | 展示 API 请求数量随时间的变化。 | 用于判断请求量变化。如果请求数增加但 token 用量变化不大,通常说明短请求或探测类请求变多。 |
| RPM | 展示每分钟请求数变化,用于观察请求吞吐。 | 如果 RPM 明显升高,说明请求量或并发使用增加,可结合 API 密钥的 RPM 限制判断是否接近限速。 |
| TPM | 展示每分钟 token 数变化,用于观察 token 吞吐。 | 如果 TPM 明显升高,说明整体 token 吞吐增加,可结合 Token 分布判断是否由输入、输出或推理 token 拉高。 |
| Token 分布 | 展示不同 token 类型的分布,例如输入、缓存读、缓存写、推理和输出。 | 用于分析成本结构。如果输出或推理 token 占比较高,可检查生成长度、reasoning 模型使用情况和参数设置。 |
| Prompt 长度分布 | 按 prompt 长度区间展示请求数量,并统计对应的 TTFT 和 E2E 延迟分位数。 | 如果长 prompt 占比较高,可以考虑压缩上下文、拆分任务或使用 Prompt Caching 降低重复上下文处理成本。 |
| 首 Token 延迟(TTFT) | 展示从请求发起到首个输出 token 返回的耗时。 | 如果 TTFT 升高,调用模型 API 的用户会更早感知到模型开始返回变慢。可结合模型、prompt 长度、是否流式输出和请求峰值进一步分析。 |
| 端到端延迟(E2E) | 展示从请求发起到响应完成的总耗时。 | 如果 E2E 升高,通常与输出长度、模型类型、上下文长度或并发负载有关。可结合输出 token 数和使用详情中的单次请求记录定位原因。 |