Skip to main content
大模型推理服务创建后,您可以在服务列表中查找服务,在详情页获取访问入口、排查实例状态、查看事件日志和监控,并根据业务状态执行扩/缩容、更新、回滚、下线、复制、分享、公开到项目组或删除。

查找服务

  1. 进入 推理服务 > 大模型推理。
  2. 选择 区域、集群 和 项目组。
  3. 在搜索框中输入服务名称,或使用 引擎类型、服务状态、资源池 等筛选条件。
  4. 在 个人服务 或 被分享服务 页签中查看服务。
列表中重点关注以下信息:

查看服务详情

在服务列表中单击目标服务的 详情。详情页顶部展示服务状态、引擎、引擎版本、创建人、区域、集群和可见性;下方页签用于访问、排查、监控和测试。 大模型推理服务实例列表 日志默认展示最近 1 小时数据。平台日志当前仅保留近 30 天,选择的起始时间超出日志保留范围时,可能没有日志展示。

获取和验证访问入口

服务进入 运行中 后,可以在服务列表单击 Endpoints,也可以进入详情页打开 服务网关 页签。 如果页面同时提供测试入口和生产入口,测试入口仅用于验证,不建议作为正式调用地址。Auth Token 不应出现在截图、日志或共享材料中。

调整服务容量

服务容量不足、业务流量变化,或需要调整角色资源时,在服务列表单击 扩/缩容。 单击 确定 后,进入详情页查看 事件 和 实例列表,确认目标副本和就绪副本逐步达到预期;如果实例长时间未就绪,再查看 日志 和 监控告警。

管理服务

排查服务异常

排查服务不可用或性能异常时,建议按以下顺序查看:
  1. 查看服务状态和事件,确认是否存在资源不足、镜像拉取失败、探针失败或网关配置问题。
  2. 查看实例状态,定位异常角色和异常实例。
  3. 查看日志,确认模型加载、引擎启动和请求处理是否异常。
  4. 查看资源监控和引擎监控,判断 GPU、显存、CPU、内存、吞吐或延迟是否成为瓶颈。
  5. 如果需要验证接口正确性,发起功能测试;如果需要评估容量,发起性能压测。
大模型推理服务事件列表 大模型推理服务日志

相关文档