본문으로 건너뛰기
버전: 1.0.0

Monitoring

클러스터 전체 리소스 현황과 GPU/NPU 디바이스 상태를 확인하는 방법을 안내합니다.

왼쪽 사이드바의 Monitoring 메뉴에서 시스템 모니터링 정보를 확인할 수 있습니다.

Summary

페이지 최상단의 Summary 카드에서 클러스터 전체 현황을 한눈에 확인합니다.

우측 상단의 시간 버튼(1h / 6h / 24h / 7d / 30d)으로 시계열 그래프 범위를 조절할 수 있습니다 (기본값 24h).

모니터링 클러스터

카드설명
Nodes정상 노드 수 / 전체 노드 수
Devices클러스터에 등록된 GPU/NPU 디바이스 총 개수
In Use워크로드에 할당된 디바이스 수
Free미할당 디바이스 수
Alerts활성 알림 수

Node Overview

노드별 카드에서 CPU, Memory, Disk, Net In, Net Out과 디바이스 사용 현황을 확인합니다.

Selected Node 섹션은 기본으로 표시되며, 다른 노드 카드를 클릭하면 선택한 노드 이름과 지표로 갱신됩니다. 이 섹션의 Node Metrics Over Time 그래프는 CPU, Memory, Disk, Net In, Net Out 시계열을 표시합니다.

노드 상세 그래프


Device Inventory

선택한 노드의 디바이스 목록을 표시합니다.

모니터링 Device

항목설명
가속기 종류 필터클러스터에 장착된 가속기 종류만 표시
할당 상태 필터All / In Use / Free
디바이스 카드개별 디바이스의 Usage / Temp / Power / VRAM 사용량, 디바이스를 사용중인 Lab/Serving 정보

조건에 맞는 디바이스가 없으면 빈 상태가 표시됩니다.

디바이스 카드를 클릭하면 해당 디바이스의 Usage / Memory / Temperature / Power 시계열 그래프가 모달로 표시됩니다.

디바이스 상세 그래프


이상 징후 대응

모니터링 중 다음 상황이 발생하면 아래 조치를 취하세요.

증상조치
디바이스 온도 과열배포 고급 설정의 Temperature Policy를 확인하고, 임계값 초과 시 자동 스케일다운 또는 트래픽 제한이 적용되는지 점검합니다.
가속기 사용률 지속 100%모델 배포에서 Replica 수를 늘리거나 Auto Scaling 설정을 조정합니다.
노드 메모리·디스크 부족불필요한 Serving을 중지하거나, Volumes에서 사용하지 않는 볼륨을 정리합니다.