> ## Documentation Index
> Fetch the complete documentation index at: https://docs.siflow.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# Model Inference

> 了解算秩 Model Inference 的模型 API 平台能力，包括 OpenAI 兼容接口、模型目录、推理加速、用量管理和典型应用场景。

[Model Inference](https://siflow.cn/products/model-serving) 是面向开发者和企业的模型 API 平台，兼顾性能、稳定性与成本效率。平台将多类模型统一到兼容 OpenAI 的 API 规范之下，支持模型快速调用、私有模型独立部署，并提供推理加速、弹性伸缩、可观测性和企业级安全能力，帮助您从原型验证逐步走向生产环境。

## 核心能力

* **统一 API**：兼容 OpenAI 的 REST 和流式接口，覆盖文本、视觉和嵌入场景，只需少量改动即可接入主流 SDK 和编码工具。
* **高性能**：自研推理加速与自动伸缩，实现低延迟、高吞吐，并能稳定承载长上下文负载。
* **丰富的模型目录**：覆盖多类别主流模型，可通过统一 API 和模型广场进行访问。
* **成本可控**：支持按量计费和弹性伸缩，并可按密钥设置额度与速率限制，便于控制支出。
* **用量与安全**：可在首页、使用详情和指标页面查看 token 消耗、消费金额、请求明细和性能指标；API 密钥支持全生命周期管理，并可设置费用额度与速率限制。

## 平台入口

* **[模型选择与体验](/model-inference/get-started/model-selection-playground)**：先在模型广场查找和比较模型，再到体验中心测试效果。
* **[调用 API](/model-inference/get-started/first-api-call)**：创建 API Key，通过 API 调用使用模型。
* **[查看用量](/model-inference/usage/view-usage)**：查看单次请求明细、token 用量、费用和耗时指标；如需查看聚合指标和趋势，可参考 [查看模型指标](/model-inference/usage/view-metrics)。

## 可用模型与覆盖范围

平台当前提供覆盖文本生成、推理、视觉/多模态和嵌入场景的模型。完整模型列表和价格，请以 [模型广场](https://console.siflow.cn/model-inference/models) 为准。

| 类型              | 适用场景                        | 示例模型                                                                                                            |
| --------------- | --------------------------- | --------------------------------------------------------------------------------------------------------------- |
| 文本生成 / 通用对话 LLM | 开放式对话、知识问答、内容生成、智能体工作流和编码辅助 | `deepseek-ai/DeepSeek-V4-Pro`、`Qwen/Qwen3.5-397B-A17B`、`glm-5.2`、`openai/gpt-oss-120b`、`MiniMaxAI/MiniMax-M2.7` |
| 推理              | 数学解题、代码生成、逻辑分析和多步推理         | `Qwen/Qwen3-32B`、`Qwen/Qwen3.6-27B`、`Qwen/Qwen3.5-397B-A17B`、`kimi-k2.6`                                        |
| 视觉 / 多模态模型      | 图像理解、视觉问答、图表分析和图文工作流        | `Qwen/Qwen2.5-VL-72B-Instruct`、`google/gemma-4-31B-it`、`kimi-k2.6`                                              |
| 嵌入模型            | 语义搜索、检索、重排和 RAG 流程          | `Qwen/Qwen3-Embedding-4B`、`Qwen/Qwen3-Embedding-0.6B`、`BAAI/bge-m3`                                             |

<Note>
  模型目录会随着新版本发布持续更新。调用 API 时，请以模型详情页展示的模型名称为准。
</Note>

## 典型应用场景

* **智能问答与助手**：基于 `Qwen/Qwen3-32B` 、`deepseek-ai/DeepSeek-V4-Pro` 等通用 LLM 打造的企业知识问答、运维助手和客服机器人。
* **内容创作与创意构思**：适用于营销文案、长文生成和结构化文档撰写。
* **代码智能与开发者效率**：使用 `glm-5.2`、`Qwen/Qwen3.6-27B` 和 `MiniMaxAI/MiniMax-M2.7` 等模型进行智能体编码、重构以及多步开发工作流。
* **RAG（检索增强生成）**：可使用嵌入模型（`Qwen/Qwen3-Embedding-4B`、`BAAI/bge-m3`）构建检索链路，再结合文本生成模型输出有依据的答案。
* **视觉与多模态理解**：使用 `Qwen/Qwen2.5-VL-72B-Instruct` 和 `kimi-k2.6` 等模型进行图像描述、视觉问答和图表分析。
* **长上下文工作流**：使用 `deepseek-ai/DeepSeek-V4-Pro` 等百万 token 级模型在单次请求中处理大型文档或代码库。

## 计费与成本优化

* **按量计费**：按实际使用的 token 付费，适合从开发验证逐步扩展到生产。
* **模型组合**：可先用成本较低的模型验证场景，再按需求切换到更强的模型。
* **按密钥限制**：为每个 API 密钥设置费用额度和 TPM/RPM 限制，降低用量失控风险。

## 服务与支持

* **企业支持**：提供方案共创、性能调优和生产上线支持。
* **迁移与兼容**：OpenAI 风格的 API 兼容主流 SDK 及 AI 编码工具。
