Monitoring
클러스터 전체 리소스 현황과 GPU/NPU 디바이스 상태를 확인하는 방법을 안내합니다.
왼쪽 사이드바의 Monitoring 메뉴에서 시스템 모니터링 정보를 확인할 수 있습니다.
Summary
페이지 최상단의 Summary 카드에서 클러스터 전체 현황을 한눈에 확인합니다.
우측 상단의 시간 버튼(1h / 6h / 24h / 7d / 30d)으로 시계열 그래프 범위를 조절할 수 있습니다 (기본값 24h).

| 카드 | 설명 |
|---|---|
| Nodes | 정상 노드 수 / 전체 노드 수 |
| Devices | 클러스터에 등록된 GPU/NPU 디바이스 총 개수 |
| In Use | 워크로드에 할당된 디바이스 수 |
| Free | 미할당 디바이스 수 |
| Alerts | 활성 알림 수 |
Node Overview
노드별 카드에서 CPU, Memory, Disk, Net In, Net Out과 디바이스 사용 현황을 확인합니다.
Selected Node 섹션은 기본으로 표시되며, 다른 노드 카드를 클릭하면 선택한 노드 이름과 지표로 갱신됩니다. 이 섹션의 Node Metrics Over Time 그래프는 CPU, Memory, Disk, Net In, Net Out 시계열을 표시합니다.

Device Inventory
선택한 노드의 디바이스 목록을 표시합니다.

| 항목 | 설명 |
|---|---|
| 가속기 종류 필터 | 클러스터에 장착된 가속기 종류만 표시 |
| 할당 상태 필터 | All / In Use / Free |
| 디바이스 카드 | 개별 디바이스의 Usage / Temp / Power / VRAM 사용량, 디바이스를 사용중인 Lab/Serving 정보 |
조건에 맞는 디바이스가 없으면 빈 상태가 표시됩니다.
디바이스 카드를 클릭하면 해당 디바이스의 Usage / Memory / Temperature / Power 시계열 그래프가 모달로 표시됩니다.

이상 징후 대응
모니터링 중 다음 상황이 발생하면 아래 조치를 취하세요.
| 증상 | 조치 |
|---|---|
| 디바이스 온도 과열 | 배포 고급 설정의 Temperature Policy를 확인하고, 임계값 초과 시 자동 스케일다운 또는 트래픽 제한이 적용되는지 점검합니다. |
| 가속기 사용률 지속 100% | 모델 배포에서 Replica 수를 늘리거나 Auto Scaling 설정을 조정합니다. |
| 노드 메모리·디스크 부족 | 불필요한 Serving을 중지하거나, Volumes에서 사용하지 않는 볼륨을 정리합니다. |