Evaluations
Evaluations는 등록된 모델 아티팩트를 정해진 Dataset으로 평가를 진행하여 품질 지표와 런타임 지표를 측정합니다. GPU artifact와 NPU compile artifact를 같은 Dataset으로 평가하면 정확도 변화와 속도·전력 효율 차이를 비교할 수 있습니다.
사전 조건
- 평가할 Model Version에 하나 이상의 Artifact가 있어야 합니다.
- Ready 상태의 Dataset Version이 있어야 합니다.
- 해당 Dataset Version에 Ready 상태의 Evaluation Criteria가 있어야 합니다.
Dataset과 Evaluation Criteria 준비 방법은 Datasets를 참고하세요.
평가 실행
Model Version 상세 화면의 Evaluations 탭에서 Local evaluation run 만들기를 클릭하거나, Artifacts 탭에서 artifact 행의 아이콘을 클릭합니다.
평가 생성은 3단계로 진행됩니다.

1. Artifact
평가할 Artifact를 선택합니다. Artifacts 탭에서 진입한 경우 해당 Artifact가 미리 선택되고 변경할 수 없습니다.
2. Dataset
| 입력 | 설명 |
|---|---|
| Dataset 선택 | 평가 데이터가 속한 Dataset |
| Dataset Version 선택 | Ready 상태의 Dataset Version |
| Evaluation Criteria 선택 | 선택한 Dataset Version에 생성된 Ready Evaluation Criteria |
Evaluation Criteria가 없다면 다이얼로그의 Evaluation Criteria 만들러 가기 링크를 통해 Dataset Version의 Evaluation Criteria 탭으로 이동해 먼저 생성합니다.
3. Run config
기본값으로 실행할 수 있으며, 필요시 Advanced settings를 열어 세부 설정을 조정합니다.
| 입력 | 설명 |
|---|---|
| Serving CPU | 평가용 임시 serving Pod의 CPU request |
| Serving memory | 평가용 임시 serving Pod의 memory request |
| Serving accelerator 수 | 평가용 serving에 할당할 accelerator 수 |
| Container image | lm-eval runner image override. 비워두면 NuFi 기본 평가 Image 사용. |
| Limit | 평가에 사용할 샘플 개수 상한. 비워두면 Dataset 전체를 사용 |
| Batch size | 평가 runner에 전달할 batch size |
| 동시 요청 수 | 평가 중 target serving으로 동시에 보낼 요청 수 |
| Few-shot 수 | 평가 prompt에 포함할 few-shot 예시 수 |
실행하면 NuFi가 임시 target serving과 evaluator runner를 준비하고 EvaluationRun을 생성합니다.
평가 목록
Model Version 상세 화면의 Evaluations 탭에서 run 목록을 확인합니다.

| 컬럼 | 설명 |
|---|---|
| Artifact | 평가 대상 Artifact |
| Dataset | 평가에 사용한 Dataset과 Version |
| Status | Pending, Starting, Running, Cancelling, Succeeded, Failed, Cancelled |
| 대표 metric | Evaluation Criteria가 정의한 대표 품질 지표 |
| Runtime | 런타임 지표 - TTFT, ITL, TPS, POWER, EFF |
| 생성 시각 | 생성 시간 |
| Actions | 실행 취소 등 행 단위 액션 |
목록은 Dataset, Artifact, Status로 필터링할 수 있습니다. 실행 중인 run은 자동으로 갱신되며, Pending, Starting, Running 상태에서는 아이콘 액션으로 취소를 요청할 수 있습니다.
상세 결과
Run을 클릭하면 Run {shortId} 상세 화면에서 다음 정보를 확인합니다.

| 영역 | 설명 |
|---|---|
| Run summary | Model, Version, Artifact, Dataset, Runner, Status, 생성 시각, 완료 시각 |
| Quality Metrics | exact match, score 등 evaluator가 계산한 품질 지표 |
| Runtime Metrics | ttftP50, ttftP99, itlP50, itlP99, tps, power, tokensPerWatt |
| Runner Config | runner type, image/version, 생성된 evaluator config, snapshot |
| Result Artifact Path | raw result artifact 위치. 복사 버튼으로 경로를 복사할 수 있습니다. |
Job logs와 Target server logs 버튼으로 runner와 임시 serving 로그를 바로 확인할 수 있습니다.
결과 비교
Compare 화면은 같은 Model Version 안에서 성공한 evaluation run 두 개를 나란히 비교합니다.
- Evaluations 탭에서 Compare를 클릭합니다.
- A와 B 슬롯에서 비교할 run을 선택합니다.
- Quality, Runtime, Config, Compile Options 탭을 확인합니다.
| 탭 | 설명 |
|---|---|
| Quality | Evaluation Criteria가 계산한 품질 metric을 A/B로 비교 |
| Runtime | TTFT, ITL, TPS, POWER, EFF 등 런타임 metric을 A/B로 비교 |
| Config | artifact, Dataset Version, Evaluation Criteria, runner config 등 실행 설정 비교 |
| Compile Options | compile artifact에 저장된 compile option 비교 |

비교 화면은 기본적으로 같은 Dataset Version의 run을 후보로 보여줍니다. 다른 Dataset으로 실행한 run을 비교하면 두 run 의 dataset 이 다릅니다. 비교 결과가 의미 있는지 확인하세요. 경고가 표시되며, 이 경우 품질 지표 차이를 직접적인 모델 차이로 해석하지 않는 것이 좋습니다.
같은 Dataset Version과 Evaluation Criteria로 GPU artifact와 NPU compile artifact를 각각 평가하세요. Quality Metrics로 정확도 보존 여부를 확인하고, Runtime Metrics의 tps, ttft, tokensPerWatt로 성능과 전력 효율 차이를 봅니다.
취소와 실패 대응
- Cancel run은 Pending, Starting, Running 상태의 EvaluationRun에 취소를 요청하고 관련 Kubernetes 리소스 정리를 시도합니다.
- JSONL schema 오류: Dataset Version의 Schema/Profile 탭에서 input/target field가 문자열이고 null/missing row가 없는지 확인합니다.
- Hugging Face private/gated dataset 실패: 프로젝트 설정의 Hugging Face token이 등록되어 있고 dataset 접근 권한이 있는지 확인합니다.
- target serving이 준비되지 않음: Serving CPU, Serving memory, Serving accelerator 수, artifact platform, image pull 오류를 확인합니다.
- OOM 또는 resource 부족: Batch size, 동시 요청 수, Serving memory를 낮춰 짧은 확인 실행으로 다시 실행합니다.
- metric이 비어 있음: Evaluation Criteria가 올바른 field를 참조하는지, runner 로그에 evaluator result가 생성됐는지 확인합니다.
- 로그 확인 순서: error message → Job logs → Target server logs → Dataset Version Schema/Profile 순서로 확인하면 원인을 좁히기 쉽습니다.