> ## Documentation Index
> Fetch the complete documentation index at: https://docs.siflow.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 对大模型推理服务进行功能测试

> 对运行中的大模型推理服务发起功能测试，验证接口套件、模型能力和测试报告结果。

功能测试用于验证大模型推理服务的接口和能力是否符合预期。平台会对运行中的服务发起标准用例，检查 OpenAI、Messages、Gemini 或 Embedding 等接口套件，并输出通过、不通过、警告和跳过等结果。

## 发起功能测试

### 1. 进入测试页

进入目标大模型推理服务详情页，打开 **一键测试** 页签，单击 **发起功能测试**。

功能测试需要服务处于 **运行中**。同一个服务同一时刻只能有一个活跃测试任务，且功能测试和性能压测共用该限制。若当前集群未开启功能测试能力，或测试镜像未配置，页面可能不会展示对应入口。

### 2. 填写测试配置

| 配置                        | 说明                                                                                                          |
| ------------------------- | ----------------------------------------------------------------------------------------------------------- |
| **接口套件**                  | 按服务实际支持的接口选择，例如 **OpenAI**、**Messages**、**Gemini** 或 **Embedding**。不要对纯 OpenAI 服务运行 Gemini 套件，否则测试结果缺少判断价值。 |
| **用例组开关**                 | 按需开启长上下文、鲁棒性或采样参数等用例组。耗时较长或服务暂不支持的能力，可以先跳过。                                                                 |
| **用例超时**                  | 控制单条用例等待服务响应的时间。模型较大或首轮加载较慢时，应预留更长时间。                                                                       |
| **function calling 抽样条数** | 控制 function calling 用例抽样数量。填写 `0` 表示使用完整数据集；不填时使用平台默认抽样数量。                                                  |
| **超长文本攻击用例**              | 配置超长文本 token 数。填写 `0` 或不填时跳过该用例；需要触发测试时，数值应超过服务上下文窗口。                                                       |
| **测试客户端资源**               | 选择测试客户端使用的实例规格和资源池。资源不足会导致测试任务排队或失败。                                                                        |
| **目标入口**                  | 默认走服务真实网关入口。服务有多个网关入口时，选择本次需要验证的入口。                                                                         |

### 3. 提交测试

单击 **提交**。任务会异步执行，您可以在 **一键测试** 页签的测试任务列表中查看状态。

## 查看测试结果

测试任务到达终态后，在 **一键测试** 页签的任务列表中单击 **查看报告**，查看报告中的总结论和逐用例明细。历史测试任务可按需 **复制** 或 **删除**。

| 查看目标  | 判断方式                                                                  |
| ----- | --------------------------------------------------------------------- |
| 任务状态  | **完成** 只表示测试跑完，不等于测试通过。**失败** 表示测试任务本身执行失败，例如超时、资源不足或客户端异常。           |
| 总结论   | 以报告中的通过或不通过为准。只要存在失败用例，通常应视为本次功能测试未通过。                                |
| 四态计数  | `PASS` 表示通过，`FAIL` 表示不符合预期，`WARN` 表示可选能力或字段存在风险，`SKIP` 表示前置条件不满足或未执行。 |
| 逐用例明细 | 重点查看失败用例的目标端点、HTTP 状态码、延迟、失败原因和补充信息。                                  |

如果服务刚进入 **运行中** 就发起测试，模型可能仍在加载，容易出现大量网关错误或失败用例。建议先发送最小请求确认服务真正可用，再进行功能测试。

## 常见问题

<AccordionGroup>
  <Accordion title="看不到功能测试入口怎么办？">
    功能测试入口取决于当前集群能力和测试镜像配置。请确认服务在支持该能力的集群中，且测试能力已开启。
  </Accordion>

  <Accordion title="提示已有活跃任务怎么办？">
    该服务已有未结束的功能测试或性能压测任务。等待任务结束，或停止现有任务后再发起新的测试。
  </Accordion>

  <Accordion title="任务完成但总结论不通过，是否表示平台执行失败？">
    不是。任务完成表示测试流程正常结束；总结论不通过表示被测服务的接口或能力不符合本次用例预期，需要查看失败用例原因。
  </Accordion>
</AccordionGroup>

## 相关文档

* [对大模型推理服务进行性能压测](./load-test-llm-inference-services)
