跳到主要内容

概述

GPU 概述屏幕使操作员能够监控系统中的 GPU 健康状况,识别存在问题的 GPU,跟踪活动警报,并快速导航到详细调查屏幕。所有显示的数据根据所选的集群、节点和项目过滤器进行范围限制。


头部部分

项目描述
Infra用于 GPU 健康和问题跟踪的基础设施监控选项卡。
Platform基于平台的 GPU 监控选项卡。
Cluster集群过滤器。
Node节点过滤器。
Project项目过滤器。

使用

  • 导航到 GPU 概述菜单。
  • 选择 Infra 选项卡。
  • 选择一个集群、节点或项目以缩小监控范围(如有需要)。
  • 系统会根据所选过滤器自动更新所有显示的数据。

指标卡片

指标卡片提供了所选范围内 GPU 健康和状态的快速摘要。

  • 当前选中的卡片会高亮显示,以指示其过滤器处于活动状态。
  • Serving 卡片仅供参考,不作为数据过滤器。
卡片描述
Total GPU完整 GPU 的总数。
Issue GPU当前存在问题的 GPU 总数。
Software具有软件相关问题的 GPU 数量。
Hardware具有硬件相关问题的 GPU 数量。
Serving当前受 SLO 警报影响的工作负载数量。
功能用户操作预期结果
查看所有 GPU点击 Total GPU 卡片。系统显示当前范围内的所有 GPU,并移除任何活动的基于状态的过滤器。
查看问题 GPU点击问题 GPU 卡片。系统仅显示当前被识别为问题 GPU 的 GPU。数据中心视图和 GPU 列表相应地进行了过滤。
查看软件问题点击软件卡片。系统仅显示带有被分类为软件相关问题的警报的 GPU。数据中心视图和 GPU 列表相应地进行了过滤。
查看硬件问题点击硬件卡片。系统仅显示带有被分类为硬件相关问题的警报的 GPU。数据中心视图和 GPU 列表相应地进行了过滤。

数据中心视图

Data Center View 提供了数据中心内物理 GPU 布局的可视化表示,帮助操作员快速识别受影响的机架或 GPU。

  • GPU 信息每 3 秒自动刷新一次。
  • 将鼠标悬停在 GPU 上以快速查看当前的遥测指标:
    • GPU 状态
    • SM 活动
    • 温度
    • 功耗
    • VRAM 使用情况
    • 工作负载信息(如果可用)

切换视图模式

数据中心视图支持两种显示模式:楼层和机架:

  • 楼层视图用于整体基础设施视图。

  • 机架视图用于详细的 GPU 级别调查。
  • 在楼层视图和机架视图之间切换不会影响当前应用的过滤器或显示的数据。

观察数据中心视图中的 GPU 颜色,然后与屏幕底部的颜色图例进行比较,以快速识别影响 GPU 的问题类型。

查看目的描述
楼层显示所选范围内机架的列表。• 楼层视图是默认显示模式。
• 点击楼层以显示所选范围内的所有机架。
• 每个机架显示其机架名称、总 GPU 数量和通过颜色编码的 GPU 块显示的 GPU 状态。
• 将鼠标悬停在 GPU 块上以查看相关的 GPU 信息或警报详情(如果可用)。
• 点击 GPU 块以显示 GPU 信息和可用操作,然后选择指标详情、库存或工作负载详情(如果可用)以导航到相应的屏幕。
• 使用楼层视图快速识别异常机架或 GPU,然后进行详细调查。
机架显示特定机架内 GPU 的详细布局。• 机架视图旨在进行深入的 GPU 调查。
• 点击机架以从楼层视图切换到机架视图。
• 数据中心标题被选定的机架名称替换(例如,gpu-04 - R0),以及机架中 GPU 的总数。
• 每个 GPU 显示为编号的 GPU 块(#0, #1, #2, ...),表示其在机架中的物理位置。
• GPU 状态通过颜色根据颜色图例指示。
• 将鼠标悬停在 GPU 块上以查看相关的 GPU 信息或警报详情(如果可用)。
• 点击 GPU 块以查看 GPU 信息和可用操作,然后选择指标详情、库存或工作负载详情(如果可用)以导航到相应的屏幕。
• 使用上一个和下一个导航按钮在机架之间移动,而无需返回楼层视图。

注意事项

  • 颜色表示整个屏幕上的 GPU 状态。

颜色意义
蓝色正常
橙色软件问题
红色硬件问题
深蓝色服务问题

关键警报

  • 关键警报显示所有当前打开的警报。
项目描述
警报消息警报消息和问题摘要
责任问题所有权分类(软件或硬件)
警报详情链接到警报详情页面
  • 警报数据每 10 秒自动刷新。

查看警报详情

  • 找到您想要调查的警报。
  • 点击警报右侧的 + 按钮。
  • 系统导航到警报详情屏幕。

打开警报规则配置

  • 点击警报列表上方的警报设置链接。

→ 系统导航到警报规则配置屏幕。

注意事项

  • 警报按最近更新的顺序降序显示。
  • 如果没有打开的警报,系统将显示“没有关键警报”。

GPU 列表

本节显示当前范围内的所有 GPU,以及它们的操作状态和任何检测到的异常。

描述
GPUGPU 名称或索引
集群托管 GPU 的集群
项目当前使用 GPU 的项目
状态当前 GPU 状态
SMGPU 利用率 (%)
温度GPU 温度
功率当前功耗
VRAM当前 VRAM 使用情况
工作负载分配给 GPU 的工作负载
症状GPU 被标记为异常的原因

查看 GPU 信息

  • 滚动到 GPU 列表部分。
  • 审查每个 GPU 的信息。
  • 检查状态列以确定 GPU 是否为 FREE、IDLE 或其他状态。
  • 检查温度、功率和显存以评估 GPU 的工作状态。
  • 检查工作负载以识别当前正在使用 GPU 的工作负载。
  • 检查症状以确定任何异常行为的原因。

常见症状

症状意义
检测到 GPU XID 错误已检测到 GPU XID 错误。
GPU 内存接近 OOMGPU 内存使用量接近内存不足阈值。
检测到 GPU 时钟降频由于系统条件,GPU 时钟频率已被降频。