> ## Documentation Index
> Fetch the complete documentation index at: https://docs.siflow.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 推理服务概述

> 了解人工智能平台推理服务的服务类型、创建前概念，以及大模型推理服务和通用服务的使用路径。

推理服务用于将模型或容器化应用发布为在线服务，并通过访问端点对外提供调用。

## 服务类型

| 服务类型        | 适合场景                                                    | 创建前重点                           |
| ----------- | ------------------------------------------------------- | ------------------------------- |
| **大模型推理服务** | 发布大语言模型，使用 **vLLM**、**SGLang**、**Dynamo** 或自定义引擎提供在线推理。 | 确认模型来源、推理引擎、执行方式、角色资源和是否需要推理模板。 |
| **通用服务**    | 发布 OCR、Embedding、检索、业务 API、后处理服务或自研推理接口等容器化在线应用。        | 确认镜像、启动命令、服务端口、资源规格、访问方式和健康检查。  |

如果要发布大语言模型，优先使用 **大模型推理服务**。如果服务本质上是一个自定义 HTTP、gRPC 或其他容器化应用，使用 **通用服务** 更合适。

## 基本对象

| 概念          | 说明                                              |
| ----------- | ----------------------------------------------- |
| **服务**      | 对外提供调用的在线服务，是推理模块的管理对象。                         |
| **运行资源**    | 服务运行时消耗的资源池、资源类型和实例规格。资源选择会影响服务能否调度、能否扩容以及运行成本。 |
| **实例 / 副本** | 实际承载请求的运行单元。增加副本通常用于提升并发承载能力；多角色服务需要分别关注各角色副本。  |
| **访问端点**    | 客户端调用服务的地址，可用于集群外部访问、集群内部访问或独立网关访问。             |
| **网关**      | 管理服务访问入口、路径、路由和鉴权。开启鉴权后，调用方需要携带访问 Token。        |

## 使用路径

### 大模型推理服务

1. 准备模型、资源池和存储资源。模型可来自模型仓库、Volume、对象存储或其他可用来源。
2. 如需复用团队配置，先准备大模型引擎配置，或在[管理大模型推理模板](./manage-llm-inference-templates)中创建模板。模板可沉淀模型、引擎、执行方式、探针、监控和部分高级配置。
3. 创建服务时，选择模型来源、推理引擎、执行方式，并按角色配置副本、实例规格和资源池。执行方式会影响需要配置的角色，例如 **worker**、**leader**、**router**、**prefill** 和 **decode**。
4. 配置健康检查、监控、端口、网关和高级选项后提交服务。
5. 服务进入 **运行中** 后，查看 **Endpoints** 并发送最小请求。
6. 上线后按需管理服务、调整容量、灰度发布、功能测试、性能压测或配置告警。

### 通用服务

1. 准备服务镜像、启动命令、服务端口、资源池和必要的存储资源。
2. 创建服务时，配置基本信息、资源信息、环境信息、增强功能、网关和监控。
3. 如果开启鉴权或 **Base URL**，确认调用方能携带 Token，并确认服务能处理对应访问路径。
4. 服务进入 **运行中** 后，查看访问端点并发送最小业务请求。
5. 上线后按需执行上线、下线、更新、重启、定时任务、灰度发布或回滚。

## 相关文档

* [准备大模型推理配置](./prepare-llm-inference-configuration)
* [管理大模型推理模板](./manage-llm-inference-templates)
* [创建大模型推理服务](./create-llm-inference-services)
* [创建通用服务](./create-general-inference-services)
