Skip to main content
Model Inference 是面向开发者和企业的模型 API 平台,兼顾性能、稳定性与成本效率。平台将多类模型统一到兼容 OpenAI 的 API 规范之下,支持模型快速调用、私有模型独立部署,并提供推理加速、弹性伸缩、可观测性和企业级安全能力,帮助您从原型验证逐步走向生产环境。

核心能力

  • 统一 API:兼容 OpenAI 的 REST 和流式接口,覆盖文本、视觉和嵌入场景,只需少量改动即可接入主流 SDK 和编码工具。
  • 高性能:自研推理加速与自动伸缩,实现低延迟、高吞吐,并能稳定承载长上下文负载。
  • 丰富的模型目录:覆盖多类别主流模型,可通过统一 API 和模型广场进行访问。
  • 成本可控:支持按量计费和弹性伸缩,并可按密钥设置额度与速率限制,便于控制支出。
  • 用量与安全:可在首页、使用详情和指标页面查看 token 消耗、消费金额、请求明细和性能指标;API 密钥支持全生命周期管理,并可设置费用额度与速率限制。

平台入口

  • 模型选择与体验:先在模型广场查找和比较模型,再到体验中心测试效果。
  • 调用 API:创建 API Key,通过 API 调用使用模型。
  • 查看用量:查看单次请求明细、token 用量、费用和耗时指标;如需查看聚合指标和趋势,可参考 查看模型指标

可用模型与覆盖范围

平台当前提供覆盖文本生成、推理、视觉/多模态和嵌入场景的模型。完整模型列表和价格,请以 模型广场 为准。
模型目录会随着新版本发布持续更新。调用 API 时,请以模型详情页展示的模型名称为准。

典型应用场景

  • 智能问答与助手:基于 Qwen/Qwen3-32Bdeepseek-ai/DeepSeek-V4-Pro 等通用 LLM 打造的企业知识问答、运维助手和客服机器人。
  • 内容创作与创意构思:适用于营销文案、长文生成和结构化文档撰写。
  • 代码智能与开发者效率:使用 glm-5.2Qwen/Qwen3.6-27BMiniMaxAI/MiniMax-M2.7 等模型进行智能体编码、重构以及多步开发工作流。
  • RAG(检索增强生成):可使用嵌入模型(Qwen/Qwen3-Embedding-4BBAAI/bge-m3)构建检索链路,再结合文本生成模型输出有依据的答案。
  • 视觉与多模态理解:使用 Qwen/Qwen2.5-VL-72B-Instructkimi-k2.6 等模型进行图像描述、视觉问答和图表分析。
  • 长上下文工作流:使用 deepseek-ai/DeepSeek-V4-Pro 等百万 token 级模型在单次请求中处理大型文档或代码库。

计费与成本优化

  • 按量计费:按实际使用的 token 付费,适合从开发验证逐步扩展到生产。
  • 模型组合:可先用成本较低的模型验证场景,再按需求切换到更强的模型。
  • 按密钥限制:为每个 API 密钥设置费用额度和 TPM/RPM 限制,降低用量失控风险。

服务与支持

  • 企业支持:提供方案共创、性能调优和生产上线支持。
  • 迁移与兼容:OpenAI 风格的 API 兼容主流 SDK 及 AI 编码工具。