개요
GPU 개요 화면은 운영자가 시스템 전반에 걸쳐 GPU 건강 상태를 모니터링하고, 문제 있는 GPU를 식별하며, 활성 경고를 추적하고, 상세 조사 화면으로 빠르게 탐색할 수 있도록 합니다. 표시된 모든 데이터는 선택한 클러스터, 노드 및 프로젝트 필터에 따라 범위가 설정됩니다.
헤더 섹션

| 항목 | 설명 |
|---|---|
| Infra | GPU 건강 및 문제 추적을 위한 인프라 모니터링 탭. |
| Platform | 플랫폼 기반 GPU 모니터링 탭. |
| Cluster | 클러스터 필터. |
| Node | 노드 필터. |
| Project | 프로젝트 필터. |
사용법
- GPU 개요 메뉴로 이동합니다.
- Infra 탭을 선택합니다.
- 필요에 따라 모니터링 범위를 좁히기 위해 클러스터, 노드 또는 프로젝트를 선택합니다.
- 시스템은 선택한 필터에 따라 표시된 모든 데이터를 자동으로 업데이트합니다.
메트릭 카드

메트릭 카드는 선택한 범위 내에서 GPU 건강 및 상태에 대한 간략한 요약을 제공합니다.
- 현재 선택된 카드는 필터가 활성화되어 있음을 나타내기 위해 강조 표시됩니다.
- Serving 카드는 정보 제공용으로만 사용되며 데이터 필터로 기능하지 않습니다.
| 카드 | 설명 |
|---|---|
| 총 GPU | 전체 GPU의 총 수. |
| 문제 GPU | 현재 문제를 겪고 있는 GPU의 총 수. |
| 소프트웨어 | 소프트웨어 관련 문제를 가진 GPU의 수. |
| 하드웨어 | 하드웨어 관련 문제를 가진 GPU의 수. |
| Serving | 현재 SLO 경고의 영향을 받는 워크로드 수. |
| 기능 | 사용자 작업 | 예상 결과 |
|---|---|---|
| 모든 GPU 보기 | 총 GPU 카드를 클릭합니다. | 시스템은 현재 범위 내의 모든 GPU를 표시하고 활성 상태 기반 필터를 제거합니다. |
| 문제 GPU 보기 | 문제 GPU 카드를 클릭합니다. | 시스템은 현재 문제 GPU로 식별된 GPU만 표시합니다. 데이터 센터 뷰와 GPU 목록이 이에 따라 필터링됩니다. |
| 소프트웨어 문제 보기 | 소프트웨어 카드를 클릭합니다. | 시스템은 소프트웨어 관련 문제로 분류된 경고가 있는 GPU만 표시합니다. 데이터 센터 뷰와 GPU 목록이 이에 따라 필터링됩니다. |
| 하드웨어 문제 보기 | 하드웨어 카드를 클릭합니다. | 시스템은 하드웨어 관련 문제로 분류된 경고가 있는 GPU만 표시합니다. 데이터 센터 뷰와 GPU 목록이 이에 따라 필터링됩니다. |
데이터 센터 뷰
Data Center View는 데이터 센터 내의 물리적 GPU 레이아웃에 대한 시각적 표현을 제공하여 운영자가 영향을 받는 랙이나 GPU를 신속하게 식별할 수 있도록 돕습니다.
- GPU 정보는 3초마다 자동으로 새로 고쳐집니다.
- GPU 위에 마우스를 올리면 현재 텔레메트리 메트릭을 빠르게 볼 수 있습니다:
- GPU 상태
- SM 활동
- 온도
- 전력 소비
- VRAM 사용량
- 작업 부하 정보 (사용 가능한 경우)
보기 모드 전환
데이터 센터 뷰는 두 가지 표시 모드: 바닥 및 랙을 지원합니다:

- 바닥 보기(Floor View)는 전체 인프라 뷰에 사용됩니다.

- 랙 보기(Rack View)는 세부 GPU 수준 조사를 위해 사용됩니다.
- 바닥 보기와 랙 보기 간의 전환은 현재 적용된 필터나 표시된 데이터에 영향을 미치지 않습니다.
데이터 센터 뷰에서 GPU 색상을 관찰한 후, 화면 하단의 색상 범례와 비교하여 GPU에 영향을 미치는 문제 유형을 신속하게 식별합니다.
| 보기 | 목적 | 설명 |
|---|---|---|
| Floor | 선택한 범위 내의 랙 목록을 표시합니다. | • Floor View는 기본 표시 모드입니다. • Floor를 클릭하여 선택한 범위 내의 모든 랙을 표시합니다. • 각 랙은 랙 이름, 총 GPU 수 및 색상으로 구분된 GPU 블록을 통해 GPU 상태를 보여줍니다. • GPU 블록 위에 마우스를 올려 관련 GPU 정보 또는 경고 세부정보(있는 경우)를 확인합니다. • GPU 블록을 클릭하여 GPU 정보와 사용 가능한 작업을 표시한 다음, Metric Details, Inventory 또는 Workload Detail(있는 경우)를 선택하여 해당 화면으로 이동합니다. • Floor View를 사용하여 자세한 조사를 수행하기 전에 비정상적인 랙이나 GPU를 신속하게 식별합니다. |
| Rack | 특정 랙 내부의 GPU의 자세한 레이아웃을 표시합니다. | • Rack View는 심층 GPU 조사를 위해 설계되었습니다. • Rack을 클릭하여 Floor View에서 Rack View로 전환합니다. • 데이터 센터 제목이 선택한 랙 이름(예: gpu-04 - R0)으로 대체되며, 랙의 총 GPU 수와 함께 표시됩니다. • 각 GPU는 랙 내의 물리적 위치를 나타내는 번호가 매겨진 GPU 블록(#0, #1, #2, ...)으로 표시됩니다. • GPU 상태는 색상 범례(Color Legend)에 따라 색상으로 표시됩니다. • GPU 블록 위에 마우스를 올려 관련 GPU 정보 또는 경고 세부정보(있는 경우)를 확인합니다. • GPU 블록을 클릭하여 GPU 정보와 사용 가능한 작업을 확인한 다음, Metric Details, Inventory 또는 Workload Detail(있는 경우)를 선택하여 해당 화면으로 이동합니다. • 이전 및 다음 탐색 버튼을 사용하여 Floor View로 돌아가지 않고 랙 간에 이동합니다. |
노트
- 색상은 전체 화면에서 GPU 상태를 나타냅니다.
| 색상 | 의미 |
|---|---|
| 파란색 | 정상 |
| 주황색 | 소프트웨어 문제 |
| 빨간색 | 하드웨어 문제 |
| 짙은 파란색 | 서비스 문제 |
중요 경고

- 중요 경고는 현재 열려 있는 모든 경고를 표시합니다.
| 항목 | 설명 |
|---|---|
| 경고 메시지 | 경고 메시지 및 문제 요약 |
| 책임 | 문제 소유권 분류 (소프트웨어 또는 하드웨어) |
| 경고 세부정보 | 경고 세부정보 페이지 링크 |
- 경고 데이터는 10초마다 자동으로 새로 고쳐집니다.
경고 세부정보 보기
- 조사할 경고를 찾습니다.
- 경고 오른쪽에 있는 + 버튼을 클릭합니다.
- 시스템이 경고 세부정보 화면으로 이동합니다.
경고 규칙 구성 열기
- 경고 목록 위의 경고 설정 링크를 클릭합니다.
→ 시스템이 경고 규칙 구성 화면으로 이동합니다.
노트
- 경고는 가장 최근 업데이트를 기준으로 내림차순으로 표시됩니다.
- 열려 있는 경고가 없으면 시스템이 "중요 경고 없음"을 표시합니다.
GPU 목록

이 섹션은 현재 범위 내의 모든 GPU와 그 운영 상태 및 감지된 이상을 표시합니다.
| 열 | 설명 |
|---|---|
| GPU | GPU 이름 또는 인덱스 |
| 클러스터 | GPU를 호스팅하는 클러스터 |
| 프로젝트 | 현재 GPU를 사용 중인 프로젝트 |
| 상태 | 현재 GPU 상태 |
| SM | GPU 활용도 (%) |
| 온도 | GPU 온도 |
| 전력 | 현재 전력 소비량 |
| VRAM | 현재 VRAM 사용량 |
| 작업 부하 | GPU에 할당된 작업 부하 |
| 증상 | GPU가 비정상으로 표시된 이유 |
GPU 정보 보기
- GPU 목록 섹션으로 스크롤합니다.
- 각 GPU에 대한 정보를 검토합니다.
- 상태 열을 확인하여 GPU가 FREE, IDLE 또는 다른 상태인지 확인합니다.
- GPU의 작동 상태를 평가하기 위해 온도, 전력 및 VRAM을 확인하십시오.
- 현재 GPU를 사용하고 있는 작업 부하를 식별하기 위해 작업 부하를 확인하십시오.
- 비정상적인 동작의 원인을 파악하기 위해 증상을 확인하십시오.
일반적인 증상
| 증상 | 의미 |
|---|---|
| GPU XID 오류 감지 | GPU XID 오류가 감지되었습니다. |
| GPU 메모리 OOM 근처 | GPU 메모리 사용량이 메모리 부족 임계값에 접근하고 있습니다. |
| GPU 클럭 스로틀링 감지 | 시스템 조건으로 인해 GPU 클럭 주파수가 제한되었습니다. |