본문으로 건너뛰기
버전: 1.0.0

Model Compilations

Model Registry에 등록된 모델을 NPU 전용 바이너리로 자동 변환합니다. 변환이 완료되면 결과 아티팩트가 Model Registry에 자동 등록되어 바로 배포할 수 있습니다.


사전 조건

  • NuFi Model Registry에 모델과 버전이 등록되어 있어야 합니다.
  • 변환 대상 아티팩트는 platform 미지정(=GPU 원본) 또는 gpu인 원본 아티팩트(format 예: safetensors)여야 합니다.
  • 클러스터에 충분한 CPU 및 메모리 리소스가 있어야 합니다.

NPU 컴파일 진입 경로

NPU 컴파일은 모델 버전 상세 페이지에서 시작합니다.

  1. 좌측 사이드바에서 Models를 클릭하여 모델 목록 페이지로 이동합니다.
  2. 컴파일할 모델 버전 상세 페이지로 이동합니다.
  3. 버전 상세 페이지에서 다음 두 가지 방식으로 컴파일을 시작할 수 있습니다.
    • Compilations 탭Compile 버튼 클릭
    • Artifacts 탭의 원본(platform 미지정 또는 gpu) 아티팩트 행 우측 cpu 아이콘 클릭

여러 컴파일 옵션 후보를 자동 생성하고 평가 지표로 최적 아티팩트를 고르려면 Compile Option Optimizer를 사용하세요.

NPU 컴파일 목록

버전 상세 페이지의 Compilations 탭에서 해당 버전에 대한 컴파일 이력을 확인할 수 있습니다.

NPU 컴파일 목록

컬럼

컬럼설명
PLATFORM대상 NPU 플랫폼
HASH컴파일 옵션 해시 (동일 옵션 식별용)
CONFIG컴파일 옵션이 저장된 이력은 보기 버튼을 표시합니다. 버튼을 클릭하면 컴파일 설정 다이얼로그에서 Max Seq Len, Tensor Parallel, Pipeline Parallel, Prefill Buckets, Decode Buckets, Tokenwise Seq Lens를 확인할 수 있습니다.
PHASE현재 파이프라인 상태
CREATED생성 시간

상태

Phase설명비정상 대응
Pending파이프라인이 스케줄 대기 중클러스터 리소스가 충분한지 확인하세요.
Running컴파일 스텝이 실행 중
Succeeded컴파일·검증 스텝 완료. Model Registry 등록이 자동으로 진행됩니다 (등록 완료 시 Registered로 전환)
Failed하나 이상의 스텝이 실패상세 페이지에서 실패 스텝 로그를 확인하고 재시도 버튼으로 재실행하세요.
Registered컴파일 결과가 Model Registry에 등록 완료

액션 아이콘

행 우측의 아이콘은 좌측부터 다음과 같습니다.

아이콘기능설명
rotate-ccwRe-compile해당 파이프라인의 컴파일 옵션이 사전 입력된 생성 다이얼로그를 엽니다. 기존 run은 이력으로 보존됩니다. Pending/Running 상태이거나 저장된 컴파일 옵션이 없는 이력에서는 비활성화됩니다.
trashDelete해당 컴파일 이력을 삭제합니다. 확인 다이얼로그에서 "삭제" 버튼을 클릭하면 파이프라인과 이력이 영구적으로 삭제됩니다.

파이프라인 생성

Compile 버튼을 클릭하면 생성 다이얼로그가 열립니다.

NPU 컴파일 생성

고정된 설정

다이얼로그 상단의 고정된 설정 영역에는 진입 시점에 결정된 컴파일 대상 정보가 표시됩니다. 사용자가 변경할 수 없습니다.

항목설명
Model진입한 버전 상세 페이지의 모델 이름
Version진입한 버전
Base Artifact변환 대상 아티팩트. 해당 버전의 원본 아티팩트(예: original)가 사용됩니다.

플랫폼 선택

필드설명
Platform *대상 NPU 플랫폼 선택 (예: RNGD)

리소스 설정

필드설명
CPU Request컴파일 Job에 할당할 CPU 코어 수
Memory Request컴파일 Job에 할당할 메모리 크기

컴파일 설정

필드설명
Max Context Length *서빙 시 허용할 최대 토큰 수. 길수록 메모리 요구량이 증가합니다. RNGD 플랫폼은 현재 최대 8192까지만 지원하며, 초과 값을 입력하면 생성이 차단됩니다.
Tensor Parallel텐서를 병렬로 처리할 PE 수. 4 또는 8 중에서 선택합니다 (RNGD 1장 = 8 PE).
Pipeline Parallel파이프라인 병렬 단계 수. 모델 레이어를 여러 NPU에 분산합니다.
Prefill BucketsPrefill 단계 버킷 목록. + bucket 추가 버튼으로 행을 추가하고 각 행에 batch(배치 크기)와 seq_len(시퀀스 길이) 쌍을 입력합니다. 비워두면 Max Context Length에 적합한 버킷이 자동 설정됩니다. 예: batch 1 / seq_len 512
Decode BucketsDecode 단계 버킷 목록. + bucket 추가 버튼으로 행을 추가하고 각 행에 batch(배치 크기)와 seq_len(컨텍스트 길이) 쌍을 입력합니다. 비워두면 자동 설정됩니다. 예: batch 1 / seq_len 1024
Tokenwise Seq Lens토큰 생성 시 사용할 메모리 공간 윈도우 크기 목록. 컴파일 시간과 직결됩니다. 일반적으로 128부터 Max Context Length까지의 2의 제곱승 수를 포함시킵니다. 예: 128,256,512,1024,2048,4096
추가 Args컴파일러에 직접 전달할 추가 인자. RNGD는 현재 추가 인자를 지원하지 않습니다.
환경 변수컴파일 Job 컨테이너에 주입할 환경 변수. KEY=VALUE 형식으로 한 줄에 하나씩 입력하거나, .env 파일을 드래그·업로드할 수 있습니다.
컴파일 설정 선택 기준
  • Tensor Parallel / Pipeline Parallel: 보유한 NPU 장치 수에 맞게 설정합니다. 단일 NPU를 사용한다면 Tensor Parallel은 8, Pipeline Parallel은 1로 설정하세요. RNGD 기준 NPU당 8개의 PE를 가집니다.
  • Prefill / Decode Buckets: 실제 서비스에서 예상되는 입력 길이 분포에 맞게 설정합니다. 버킷이 많을수록 컴파일 시간과 바이너리 크기가 증가합니다.

Create 버튼을 클릭하면 파이프라인이 시작됩니다.


파이프라인 상세

목록에서 파이프라인 행을 클릭하면 상세 페이지로 이동합니다.

상단에는 실행한 컴파일 관련 요약 정보가 표시됩니다.

항목설명
Model컴파일을 실행한 모델
Version컴파일 대상 모델 버전
Platform대상 NPU 플랫폼
Resources컴파일 Job에 요청한 CPU 및 메모리
Created파이프라인 생성 시간

아티팩트가 성공적으로 등록되었다면 생성된 아티팩트 링크가 요약 정보 아래에 표시됩니다.

NPU 컴파일 상세 — Steps

상세 페이지는 Steps 섹션에서 스텝별 상태를 표시합니다.

스텝설명
컴파일모델을 NPU 전용 바이너리로 변환합니다.
Artifact 파일 검증컴파일 스텝이 생성한 아티팩트 파일이 예상 경로에 존재하는지만 확인합니다. 실제 디바이스에 로드하거나 추론을 수행하지는 않습니다.

각 스텝 카드에는 다음 정보가 표시됩니다.

항목설명
START스텝 실행 시작 타임스탬프
END스텝 실행 종료 타임스탬프
DURATION스텝 실행에 걸린 시간
MESSAGE스텝 메시지 또는 오류 출력. 값이 있을 때만 표시됩니다.
OUTPUT FILES스텝이 생성한 출력 파일 목록. 출력 파일이 있는 스텝에만 표시됩니다.
Logs해당 스텝의 상세 로그 보기 버튼. 로그 URL을 만들 수 있을 때만 표시됩니다.

스텝 상태는 스텝명 옆 상태 배지로 표시됩니다 (Waiting / Pending / Running / Succeeded / Failed). Waiting은 이전 스텝 완료 대기 중을 의미합니다.

스텝 단위 재시도: 파이프라인 전체가 Failed 상태일 때, 실패한 각 스텝 카드의 재시도 버튼으로 해당 스텝만 독립적으로 다시 실행할 수 있습니다. 예를 들어 Artifact 파일 검증 스텝만 실패한 경우 컴파일 스텝을 다시 실행하지 않고 검증 스텝만 재시도할 수 있습니다.

컴파일 완료 후 자동 등록

컴파일 + 검증 두 스텝이 모두 Succeeded 상태가 되면, 컴파일된 NPU 아티팩트가 Model Registry의 원본 버전에 자동으로 추가됩니다. 이후 해당 아티팩트로 Quick Deploy를 실행할 수 있습니다.


컴파일 설정 확인

상세 페이지의 상단 요약 정보 아래의 컴파일 설정 아코디언을 클릭해 펼치면 파이프라인 생성 시 사용된 컴파일 옵션 전체를 확인할 수 있습니다 (기본 접힘 상태).

NPU 컴파일 상세 — 컴파일 설정 카드

필드설명
Max Seq Len컴파일 시 설정된 최대 컨텍스트 토큰 수
Tensor Parallel텐서 병렬 처리 PE 수
Pipeline Parallel파이프라인 병렬 단계 수
Prefill BucketsPrefill 단계 시퀀스 길이 버킷 목록
Decode BucketsDecode 단계의 배치 크기 / 컨텍스트 길이 버킷 목록
Tokenwise Seq Lens토큰 생성 시 메모리 공간 윈도우 크기 목록. 값이 있을 때만 표시됩니다.