> ## Documentation Index
> Fetch the complete documentation index at: https://docs.siflow.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 人工智能平台发布记录

> 查看人工智能平台的资源管理与调度、训练任务、推理服务和 SDK 发布记录。

<Update
  label="2026.09.17"
  description="更新资源管理与调度、训练任务、推理服务和 SDK 能力"
  tags={["资源管理", "训练任务", "推理服务", "SDK"]}
  rss={{
title: "人工智能平台产品发布 - 2026.09.17",
description: "更新资源大盘、任务大盘、训练任务查询、推理服务和 SDK 通用服务管理能力。"
}}
>
  ### <Icon icon="sparkles" /> 新功能

  * **资源管理与调度**
    * [任务大盘](/ai-platform/resources/view-task-resource-usage) 支持展示实例规格、GPU 卡型和实际资源用量，并支持按 GPU 卡数或 CPU 核数排序。
    * [资源大盘](/ai-platform/resources/view-resource-usage) 新增资源池 GPU 性能指标看板：
      * 展示 SM 利用率、Tensor 利用率、显存使用率、NVLink 收发速率及历史趋势。
      * 支持多个资源池的指标对比，并支持按实例规格、节点筛选查看。
    * [资源大盘](/ai-platform/resources/view-resource-usage) 新增用户详情页：
      * 支持从用户用量排行进入详情，按近 1 天、7 天、14 天和资源池范围查看用户资源使用情况。
      * 支持按资源池查看平均在用 GPU 卡数的历史趋势，并分别展示保障资源、闲时资源的 SM 利用率趋势。
      * 展示用户的任务规模、任务类型及资源池用量分布时，支持切换查看“资源池 × 任务类型”和“GPU 卡型 × 任务类型”的卡时分布。
      * 展示用户历史任务的名称、类型、状态、GPU 卡数、卡型、资源池、SM 利用率、使用卡时、等待与运行时长，以及提交、开始和结束时间。
    * [资源大盘](/ai-platform/resources/view-resource-usage) 新增节点磁盘用量及告警：
      * 支持查看独占池节点磁盘用量、容量、可写量、Top Pod 使用量，以及近 24 小时内因节点磁盘达到预警或 Pod 自身达到预警被驱逐的数量和明细。
      * 当用户 Pod 使用临时存储达到 80% 或 90% 阈值时，平台会向用户发送告警信息。

  * **推理服务**
    * 推理服务 custom 引擎模式支持配置镜像、命令和环境变量。详见 [创建大模型推理服务](/ai-platform/inference/create-llm-inference-services)。
    * 新增大模型推理监控看板。详见 [管理大模型推理服务](/ai-platform/inference/manage-llm-inference-services)。

  * **SDK**
    * [通用服务 SDK](/ai-platform/developer-access/manage-general-services-with-python-sdk) 支持配置优雅终止时长 `extraTerminationGraceSeconds`。
    * 通用服务创建和列表接口支持项目组，并支持设置项目组公开。

  ### <Icon icon="wrench" /> 功能优化

  * 优化资源大盘闲时任务监控口径，对齐首次被抢占前运行时长卡片与 gauge 口径。
  * 优化训练任务模糊查询性能，整体查询耗时从约 3 秒降低至约 1 秒。
</Update>
