본문으로 건너뛰기

개요

GPU 개요 화면은 운영자가 시스템 전반에 걸쳐 GPU 건강 상태를 모니터링하고, 문제 있는 GPU를 식별하며, 활성 경고를 추적하고, 상세 조사 화면으로 빠르게 탐색할 수 있도록 합니다. 표시된 모든 데이터는 선택한 클러스터, 노드 및 프로젝트 필터에 따라 범위가 설정됩니다.


헤더 섹션

항목설명
InfraGPU 건강 및 문제 추적을 위한 인프라 모니터링 탭.
Platform플랫폼 기반 GPU 모니터링 탭.
Cluster클러스터 필터.
Node노드 필터.
Project프로젝트 필터.

사용법

  • GPU 개요 메뉴로 이동합니다.
  • Infra 탭을 선택합니다.
  • 필요에 따라 모니터링 범위를 좁히기 위해 클러스터, 노드 또는 프로젝트를 선택합니다.
  • 시스템은 선택한 필터에 따라 표시된 모든 데이터를 자동으로 업데이트합니다.

메트릭 카드

메트릭 카드는 선택한 범위 내에서 GPU 건강 및 상태에 대한 간략한 요약을 제공합니다.

  • 현재 선택된 카드는 필터가 활성화되어 있음을 나타내기 위해 강조 표시됩니다.
  • Serving 카드는 정보 제공용으로만 사용되며 데이터 필터로 기능하지 않습니다.
카드설명
총 GPU전체 GPU의 총 수.
문제 GPU현재 문제를 겪고 있는 GPU의 총 수.
소프트웨어소프트웨어 관련 문제를 가진 GPU의 수.
하드웨어하드웨어 관련 문제를 가진 GPU의 수.
Serving현재 SLO 경고의 영향을 받는 워크로드 수.
기능사용자 작업예상 결과
모든 GPU 보기총 GPU 카드를 클릭합니다.시스템은 현재 범위 내의 모든 GPU를 표시하고 활성 상태 기반 필터를 제거합니다.
문제 GPU 보기문제 GPU 카드를 클릭합니다.시스템은 현재 문제 GPU로 식별된 GPU만 표시합니다. 데이터 센터 뷰와 GPU 목록이 이에 따라 필터링됩니다.
소프트웨어 문제 보기소프트웨어 카드를 클릭합니다.시스템은 소프트웨어 관련 문제로 분류된 경고가 있는 GPU만 표시합니다. 데이터 센터 뷰와 GPU 목록이 이에 따라 필터링됩니다.
하드웨어 문제 보기하드웨어 카드를 클릭합니다.시스템은 하드웨어 관련 문제로 분류된 경고가 있는 GPU만 표시합니다. 데이터 센터 뷰와 GPU 목록이 이에 따라 필터링됩니다.

데이터 센터 뷰

Data Center View는 데이터 센터 내의 물리적 GPU 레이아웃에 대한 시각적 표현을 제공하여 운영자가 영향을 받는 랙이나 GPU를 신속하게 식별할 수 있도록 돕습니다.

  • GPU 정보는 3초마다 자동으로 새로 고쳐집니다.
  • GPU 위에 마우스를 올리면 현재 텔레메트리 메트릭을 빠르게 볼 수 있습니다:
    • GPU 상태
    • SM 활동
    • 온도
    • 전력 소비
    • VRAM 사용량
    • 작업 부하 정보 (사용 가능한 경우)

보기 모드 전환

데이터 센터 뷰는 두 가지 표시 모드: 바닥 및 랙을 지원합니다:

  • 바닥 보기(Floor View)는 전체 인프라 뷰에 사용됩니다.

  • 랙 보기(Rack View)는 세부 GPU 수준 조사를 위해 사용됩니다.
  • 바닥 보기와 랙 보기 간의 전환은 현재 적용된 필터나 표시된 데이터에 영향을 미치지 않습니다.

데이터 센터 뷰에서 GPU 색상을 관찰한 후, 화면 하단의 색상 범례와 비교하여 GPU에 영향을 미치는 문제 유형을 신속하게 식별합니다.

보기목적설명
Floor선택한 범위 내의 랙 목록을 표시합니다.• Floor View는 기본 표시 모드입니다.
• Floor를 클릭하여 선택한 범위 내의 모든 랙을 표시합니다.
• 각 랙은 랙 이름, 총 GPU 수 및 색상으로 구분된 GPU 블록을 통해 GPU 상태를 보여줍니다.
• GPU 블록 위에 마우스를 올려 관련 GPU 정보 또는 경고 세부정보(있는 경우)를 확인합니다.
• GPU 블록을 클릭하여 GPU 정보와 사용 가능한 작업을 표시한 다음, Metric Details, Inventory 또는 Workload Detail(있는 경우)를 선택하여 해당 화면으로 이동합니다.
• Floor View를 사용하여 자세한 조사를 수행하기 전에 비정상적인 랙이나 GPU를 신속하게 식별합니다.
Rack특정 랙 내부의 GPU의 자세한 레이아웃을 표시합니다.• Rack View는 심층 GPU 조사를 위해 설계되었습니다.
• Rack을 클릭하여 Floor View에서 Rack View로 전환합니다.
• 데이터 센터 제목이 선택한 랙 이름(예: gpu-04 - R0)으로 대체되며, 랙의 총 GPU 수와 함께 표시됩니다.
• 각 GPU는 랙 내의 물리적 위치를 나타내는 번호가 매겨진 GPU 블록(#0, #1, #2, ...)으로 표시됩니다.
• GPU 상태는 색상 범례(Color Legend)에 따라 색상으로 표시됩니다.
• GPU 블록 위에 마우스를 올려 관련 GPU 정보 또는 경고 세부정보(있는 경우)를 확인합니다.
• GPU 블록을 클릭하여 GPU 정보와 사용 가능한 작업을 확인한 다음, Metric Details, Inventory 또는 Workload Detail(있는 경우)를 선택하여 해당 화면으로 이동합니다.
• 이전 및 다음 탐색 버튼을 사용하여 Floor View로 돌아가지 않고 랙 간에 이동합니다.

노트

  • 색상은 전체 화면에서 GPU 상태를 나타냅니다.

색상의미
파란색정상
주황색소프트웨어 문제
빨간색하드웨어 문제
짙은 파란색서비스 문제

중요 경고

  • 중요 경고는 현재 열려 있는 모든 경고를 표시합니다.
항목설명
경고 메시지경고 메시지 및 문제 요약
책임문제 소유권 분류 (소프트웨어 또는 하드웨어)
경고 세부정보경고 세부정보 페이지 링크
  • 경고 데이터는 10초마다 자동으로 새로 고쳐집니다.

경고 세부정보 보기

  • 조사할 경고를 찾습니다.
  • 경고 오른쪽에 있는 + 버튼을 클릭합니다.
  • 시스템이 경고 세부정보 화면으로 이동합니다.

경고 규칙 구성 열기

  • 경고 목록 위의 경고 설정 링크를 클릭합니다.

→ 시스템이 경고 규칙 구성 화면으로 이동합니다.

노트

  • 경고는 가장 최근 업데이트를 기준으로 내림차순으로 표시됩니다.
  • 열려 있는 경고가 없으면 시스템이 "중요 경고 없음"을 표시합니다.

GPU 목록

이 섹션은 현재 범위 내의 모든 GPU와 그 운영 상태 및 감지된 이상을 표시합니다.

설명
GPUGPU 이름 또는 인덱스
클러스터GPU를 호스팅하는 클러스터
프로젝트현재 GPU를 사용 중인 프로젝트
상태현재 GPU 상태
SMGPU 활용도 (%)
온도GPU 온도
전력현재 전력 소비량
VRAM현재 VRAM 사용량
작업 부하GPU에 할당된 작업 부하
증상GPU가 비정상으로 표시된 이유

GPU 정보 보기

  • GPU 목록 섹션으로 스크롤합니다.
  • 각 GPU에 대한 정보를 검토합니다.
  • 상태 열을 확인하여 GPU가 FREE, IDLE 또는 다른 상태인지 확인합니다.
  • GPU의 작동 상태를 평가하기 위해 온도, 전력 및 VRAM을 확인하십시오.
  • 현재 GPU를 사용하고 있는 작업 부하를 식별하기 위해 작업 부하를 확인하십시오.
  • 비정상적인 동작의 원인을 파악하기 위해 증상을 확인하십시오.

일반적인 증상

증상의미
GPU XID 오류 감지GPU XID 오류가 감지되었습니다.
GPU 메모리 OOM 근처GPU 메모리 사용량이 메모리 부족 임계값에 접근하고 있습니다.
GPU 클럭 스로틀링 감지시스템 조건으로 인해 GPU 클럭 주파수가 제한되었습니다.