본문으로 건너뛰기
버전: 1.0.0

Playground

이 페이지에서는 배포된 모델에 직접 메시지를 보내고, 여러 Serving을 나란히 비교하며 프롬프트와 파라미터를 실험할 수 있습니다.

좌측 사이드바의 Playground 항목을 클릭하면 Playground 페이지로 이동합니다. 페이지 상단의 Device / Model 탭으로 상단 상태 바 메트릭 종류를 전환할 수 있습니다. 두 탭 모두 동일한 채팅 UI를 제공하며, 상태 바에 표시되는 지표만 달라집니다.

상태 바 지표
Device하드웨어 메트릭 — 사용률 / 온도 / 전력 / 메모리 (모델이 점유한 GPU/NPU 디바이스 기준)
Model추론 성능 메트릭 — TTFT / ITL / TPS / tok/s/W

아래는 GPU 배포를 선택한 Device 탭의 예시입니다. Serving을 선택하면 상단 상태 바에 사용률·온도·전력·메모리가 표시되고, 채팅 중에도 값이 갱신됩니다. 상태 바를 클릭하면 Usage %, Temp °C, Power W, Mem % 기준의 최근 5분 시계열 차트를 확인할 수 있습니다.

Playground Device 탭 — GPU 배포 선택 후 실시간 하드웨어 지표

Device 탭

Device 탭에서는 채팅 UI와 하드웨어 메트릭을 함께 확인할 수 있습니다.

상태 바에는 다음 4개 지표가 실시간 표시됩니다.

지표설명
Usage %모델이 점유한 GPU/NPU 디바이스의 사용률
Temp °C모델이 점유한 GPU/NPU 디바이스의 현재 온도
Power W모델이 점유한 GPU/NPU 디바이스의 전력 사용량
Mem %모델이 점유한 GPU/NPU 디바이스의 메모리 사용률

Model 탭 — 추론 성능 메트릭

Model 탭은 Device 탭과 동일한 채팅 UI를 제공하며, 상단 상태 바가 하드웨어 메트릭 대신 LLM 추론 성능 지표로 교체됩니다. 채팅으로 모델에 요청을 보내면서 TTFT·TPS 등 서비스 응답 품질 지표를 실시간으로 확인할 수 있어, GPU와 RNGD 배포 비교나 파라미터 튜닝 결과를 수치로 모니터링할 때 활용합니다.

상태 바에는 다음 4개 지표가 실시간 표시됩니다.

지표설명
TTFT첫 번째 토큰이 생성되기까지의 시간 (Time To First Token, 밀리초)
ITL토큰 간 생성 간격 (Inter-token Latency, 밀리초)
TPS초당 출력 토큰 수 (Tokens Per Second)
tok/s/W소비 전력 1W당 생성 토큰 수 (전성비)

상태 바를 클릭하면 최근 5분간의 시계열 팝오버가 표시됩니다. 팝오버에서는 TTFT (ms), ITL (ms), Output TPS, tok/s/W 4개 라인 차트로 추세를 확인할 수 있습니다.

디바이스별 메트릭 소스
  • GPU(NVIDIA) 배포: vLLM 메트릭(vllm:*) + DCGM 전력 메트릭 사용
  • RNGD(Furiosa) 배포: furiosa-llm 메트릭(furiosa_llm_*) + furiosa_npu_hw_power 사용

메트릭 소스는 Serving에 할당된 가속기 유형에 따라 자동으로 분기됩니다.

Serving 선택 및 Sync

각 패널에서 비교할 Serving을 선택하고 메시지를 전송합니다. Select serving 드롭다운에는 OpenAI 호환 API(/v1/chat/completions)를 지원하는 Serving만 표시되며, 드롭다운 안에서 GPU (1), RNGD (1) 처럼 가속기 유형별 그룹으로 나뉩니다. Add panel 버튼으로 비교 패널을 추가할 수 있고, 최대 4개까지 나란히 배치할 수 있습니다.

Playground 멀티 패널

Sync ON 상태인 패널들은 같은 메시지를 동시에 받아 응답을 한 번에 비교할 수 있습니다. 특정 패널을 비교에서 제외하려면 해당 패널을 Sync OFF로 전환합니다.

파라미터 설정

Settings 버튼을 클릭하면 파라미터를 조정하거나 Clear Chat으로 대화를 초기화할 수 있습니다.

파라미터설명범위기본값
System Prompt모델의 역할과 동작 방식을 정의합니다. 입력란에는 You are a helpful assistant...가 기본 placeholder로 표시됩니다
Temperature응답의 무작위성 조절. 높을수록 다양하고 창의적인 응답, 낮을수록 일관된 응답0 – 20.7
Max Tokens생성할 최대 토큰 수. UI에는 최대값이 최대 4096처럼 표시됩니다1 – 모델 context length의 절반 (모델 정보가 없으면 4096)2048
Top P상위 확률 토큰만 샘플링. Temperature와 함께 다양성 조절0 – 11.0
Presence Penalty이미 언급된 주제의 반복을 줄여 새로운 주제 유도0 – 20.0
Frequency Penalty같은 단어·구문의 반복 사용을 줄여 표현 다양화0 – 20.0
Temperature vs Top P

일반적으로 Temperature와 Top P 중 하나만 조정합니다. 둘 다 기본값이 아닌 경우 예측하기 어려운 응답이 나올 수 있습니다.