본문으로 건너뛰기
버전: 1.0.0

Monitoring

클러스터 전체 리소스 현황과 GPU/NPU 디바이스 상태를 확인하는 방법을 안내합니다.

왼쪽 사이드바의 Monitoring 메뉴에서 시스템 모니터링 정보를 확인할 수 있습니다.

Summary​

페이지 최상단의 Summary 카드에서 클러스터 전체 현황을 한눈에 확인합니다.

우측 상단의 시간 버튼(1h / 6h / 24h / 7d / 30d)으로 시계열 그래프 범위를 조절할 수 있습니다 (기본값 24h).

모니터링 클러스터

카드설명
Nodes정상 노드 수 / 전체 노드 수
Devices클러스터에 등록된 GPU/NPU 디바이스 총 개수
In Use워크로드에 할당된 디바이스 수
Free미할당 디바이스 수
Alerts활성 알림 수

Node Overview​

노드별 카드에서 CPU, Memory, Disk, Net In, Net Out과 디바이스 사용 현황을 확인합니다.

Selected Node 섹션은 기본으로 표시되며, 다른 노드 카드를 클릭하면 선택한 노드 이름과 지표로 갱신됩니다. 이 섹션의 Node Metrics Over Time 그래프는 CPU, Memory, Disk, Net In, Net Out 시계열을 표시합니다.

노드 상세 그래프


Device Inventory​

선택한 노드의 디바이스 목록을 표시합니다.

모니터링 Device

항목설명
가속기 종류 필터클러스터에 장착된 가속기 종류만 표시
할당 상태 필터All / In Use / Free
디바이스 카드개별 디바이스의 Usage / Temp / Power / VRAM 사용량, 디바이스를 사용중인 Lab/Serving 정보

조건에 맞는 디바이스가 없으면 빈 상태가 표시됩니다.

디바이스 카드를 클릭하면 해당 디바이스의 Usage / Memory / Temperature / Power 시계열 그래프가 모달로 표시됩니다.

디바이스 상세 그래프


이상 징후 대응​

모니터링 중 다음 상황이 발생하면 아래 조치를 취하세요.

증상조치
디바이스 온도 과열배포 고급 설정의 Temperature Policy를 확인하고, 임계값 초과 시 자동 스케일다운 또는 트래픽 제한이 적용되는지 점검합니다.
가속기 사용률 지속 100%모델 배포에서 Replica 수를 늘리거나 Auto Scaling 설정을 조정합니다.
노드 메모리·디스크 부족불필요한 Serving을 중지하거나, Volumes에서 사용하지 않는 볼륨을 정리합니다.