본문으로 건너뛰기
버전: 1.0.0

Evaluations

Evaluations는 등록된 모델 아티팩트를 정해진 Dataset으로 평가를 진행하여 품질 지표와 런타임 지표를 측정합니다. GPU artifact와 NPU compile artifact를 같은 Dataset으로 평가하면 정확도 변화와 속도·전력 효율 차이를 비교할 수 있습니다.


사전 조건

  • 평가할 Model Version에 하나 이상의 Artifact가 있어야 합니다.
  • Ready 상태의 Dataset Version이 있어야 합니다.
  • 해당 Dataset Version에 Ready 상태의 Evaluation Criteria가 있어야 합니다.

Dataset과 Evaluation Criteria 준비 방법은 Datasets를 참고하세요.


평가 실행

Model Version 상세 화면의 Evaluations 탭에서 Local evaluation run 만들기를 클릭하거나, Artifacts 탭에서 artifact 행의 clipboard-check 아이콘을 클릭합니다.

평가 생성은 3단계로 진행됩니다.

평가 생성

1. Artifact

평가할 Artifact를 선택합니다. Artifacts 탭에서 진입한 경우 해당 Artifact가 미리 선택되고 변경할 수 없습니다.

2. Dataset

입력설명
Dataset 선택평가 데이터가 속한 Dataset
Dataset Version 선택Ready 상태의 Dataset Version
Evaluation Criteria 선택선택한 Dataset Version에 생성된 Ready Evaluation Criteria

Evaluation Criteria가 없다면 다이얼로그의 Evaluation Criteria 만들러 가기 링크를 통해 Dataset Version의 Evaluation Criteria 탭으로 이동해 먼저 생성합니다.

3. Run config

기본값으로 실행할 수 있으며, 필요시 Advanced settings를 열어 세부 설정을 조정합니다.

입력설명
Serving CPU평가용 임시 serving Pod의 CPU request
Serving memory평가용 임시 serving Pod의 memory request
Serving accelerator 수평가용 serving에 할당할 accelerator 수
Container imagelm-eval runner image override. 비워두면 NuFi 기본 평가 Image 사용.
Limit평가에 사용할 샘플 개수 상한. 비워두면 Dataset 전체를 사용
Batch size평가 runner에 전달할 batch size
동시 요청 수평가 중 target serving으로 동시에 보낼 요청 수
Few-shot 수평가 prompt에 포함할 few-shot 예시 수

실행하면 NuFi가 임시 target serving과 evaluator runner를 준비하고 EvaluationRun을 생성합니다.


평가 목록

Model Version 상세 화면의 Evaluations 탭에서 run 목록을 확인합니다.

평가 목록

컬럼설명
Artifact평가 대상 Artifact
Dataset평가에 사용한 Dataset과 Version
StatusPending, Starting, Running, Cancelling, Succeeded, Failed, Cancelled
대표 metricEvaluation Criteria가 정의한 대표 품질 지표
Runtime런타임 지표 - TTFT, ITL, TPS, POWER, EFF
생성 시각생성 시간
Actions실행 취소 등 행 단위 액션

목록은 Dataset, Artifact, Status로 필터링할 수 있습니다. 실행 중인 run은 자동으로 갱신되며, Pending, Starting, Running 상태에서는 x-circle 아이콘 액션으로 취소를 요청할 수 있습니다.


상세 결과

Run을 클릭하면 Run {shortId} 상세 화면에서 다음 정보를 확인합니다.

평가 결과 상세

영역설명
Run summaryModel, Version, Artifact, Dataset, Runner, Status, 생성 시각, 완료 시각
Quality Metricsexact match, score 등 evaluator가 계산한 품질 지표
Runtime MetricsttftP50, ttftP99, itlP50, itlP99, tps, power, tokensPerWatt
Runner Configrunner type, image/version, 생성된 evaluator config, snapshot
Result Artifact Pathraw result artifact 위치. 복사 버튼으로 경로를 복사할 수 있습니다.

Job logsTarget server logs 버튼으로 runner와 임시 serving 로그를 바로 확인할 수 있습니다.


결과 비교

Compare 화면은 같은 Model Version 안에서 성공한 evaluation run 두 개를 나란히 비교합니다.

  1. Evaluations 탭에서 Compare를 클릭합니다.
  2. AB 슬롯에서 비교할 run을 선택합니다.
  3. Quality, Runtime, Config, Compile Options 탭을 확인합니다.
설명
QualityEvaluation Criteria가 계산한 품질 metric을 A/B로 비교
RuntimeTTFT, ITL, TPS, POWER, EFF 등 런타임 metric을 A/B로 비교
Configartifact, Dataset Version, Evaluation Criteria, runner config 등 실행 설정 비교
Compile Optionscompile artifact에 저장된 compile option 비교

평가 결과 비교

비교 화면은 기본적으로 같은 Dataset Version의 run을 후보로 보여줍니다. 다른 Dataset으로 실행한 run을 비교하면 두 run 의 dataset 이 다릅니다. 비교 결과가 의미 있는지 확인하세요. 경고가 표시되며, 이 경우 품질 지표 차이를 직접적인 모델 차이로 해석하지 않는 것이 좋습니다.

GPU와 NPU 비교

같은 Dataset Version과 Evaluation Criteria로 GPU artifact와 NPU compile artifact를 각각 평가하세요. Quality Metrics로 정확도 보존 여부를 확인하고, Runtime Metrics의 tps, ttft, tokensPerWatt로 성능과 전력 효율 차이를 봅니다.


취소와 실패 대응

  • Cancel run은 Pending, Starting, Running 상태의 EvaluationRun에 취소를 요청하고 관련 Kubernetes 리소스 정리를 시도합니다.
  • JSONL schema 오류: Dataset Version의 Schema/Profile 탭에서 input/target field가 문자열이고 null/missing row가 없는지 확인합니다.
  • Hugging Face private/gated dataset 실패: 프로젝트 설정의 Hugging Face token이 등록되어 있고 dataset 접근 권한이 있는지 확인합니다.
  • target serving이 준비되지 않음: Serving CPU, Serving memory, Serving accelerator 수, artifact platform, image pull 오류를 확인합니다.
  • OOM 또는 resource 부족: Batch size, 동시 요청 수, Serving memory를 낮춰 짧은 확인 실행으로 다시 실행합니다.
  • metric이 비어 있음: Evaluation Criteria가 올바른 field를 참조하는지, runner 로그에 evaluator result가 생성됐는지 확인합니다.
  • 로그 확인 순서: error message → Job logs → Target server logs → Dataset Version Schema/Profile 순서로 확인하면 원인을 좁히기 쉽습니다.