Skip to main content
资源管理训练任务推理服务SDK
更新资源管理与调度、训练任务、推理服务和 SDK 能力

新功能

  • 资源管理与调度
    • 任务大盘 支持展示实例规格、GPU 卡型和实际资源用量,并支持按 GPU 卡数或 CPU 核数排序。
    • 资源大盘 新增资源池 GPU 性能指标看板:
      • 展示 SM 利用率、Tensor 利用率、显存使用率、NVLink 收发速率及历史趋势。
      • 支持多个资源池的指标对比,并支持按实例规格、节点筛选查看。
    • 资源大盘 新增用户详情页:
      • 支持从用户用量排行进入详情,按近 1 天、7 天、14 天和资源池范围查看用户资源使用情况。
      • 支持按资源池查看平均在用 GPU 卡数的历史趋势,并分别展示保障资源、闲时资源的 SM 利用率趋势。
      • 展示用户的任务规模、任务类型及资源池用量分布时,支持切换查看“资源池 × 任务类型”和“GPU 卡型 × 任务类型”的卡时分布。
      • 展示用户历史任务的名称、类型、状态、GPU 卡数、卡型、资源池、SM 利用率、使用卡时、等待与运行时长,以及提交、开始和结束时间。
    • 资源大盘 新增节点磁盘用量及告警:
      • 支持查看独占池节点磁盘用量、容量、可写量、Top Pod 使用量,以及近 24 小时内因节点磁盘达到预警或 Pod 自身达到预警被驱逐的数量和明细。
      • 当用户 Pod 使用临时存储达到 80% 或 90% 阈值时,平台会向用户发送告警信息。
  • 推理服务
  • SDK
    • 通用服务 SDK 支持配置优雅终止时长 extraTerminationGraceSeconds。
    • 通用服务创建和列表接口支持项目组,并支持设置项目组公开。

功能优化

  • 优化资源大盘闲时任务监控口径,对齐首次被抢占前运行时长卡片与 gauge 口径。
  • 优化训练任务模糊查询性能,整体查询耗时从约 3 秒降低至约 1 秒。