본문으로 건너뛰기
버전: 1.0.0

Hugging Face 모델로 서빙하기

Hugging Face Hub의 모델을 NuFi로 가져온 뒤 Models에 등록하고 Serving으로 배포합니다. 대시보드에서 다운로드와 등록을 한 번에 처리하려는 경우에 사용합니다.

사전 조건​

  • 모델 파일을 저장할 Volume을 먼저 생성합니다. 이 튜토리얼에서는 tutorial-volume을 예시로 사용합니다.
  • Private repository를 가져오려면 Projects에서 Hugging Face token을 먼저 저장합니다.
  • NPU로 서빙하려면 컴파일 가능한 모델과 NPU 디바이스가 필요합니다. GPU로 바로 서빙할 수도 있습니다.

1. Hugging Face Import 실행​

좌측 사이드바에서 Models를 클릭한 뒤 Integration으로 이동합니다.

Models에서 Integration 이동

Hugging Face 탭에서 Import from Hugging Face를 클릭합니다.

Hugging Face Integration

필드예시 값설명
RepositoryQwen/Qwen2.5-0.5B-Instructowner/name 형식의 Hugging Face repository
Target ModelNew model새 모델 생성 또는 기존 모델에 버전 추가
Target Model 이름qwen-instruct-tutorial-hfNuFi에 등록할 모델 이름
Target Versionv1등록할 버전
Volumetutorial-volume가져온 모델 파일을 저장할 Volume

Hugging Face Import 폼

2. Import 완료 확인​

Import History에서 작업 상태가 completed인지 확인합니다. 완료되면 모델 파일이 선택한 Volume에 저장되고 Models에 모델 버전이 생성됩니다.

Hugging Face Import History

3. 서빙 방식 선택​

GPU로 바로 서빙하려면 모델 상세에서 Quick Deploy를 실행합니다.

NPU로 서빙하려면 먼저 Model Compilations에서 원본 아티팩트를 컴파일합니다. 컴파일이 Succeeded가 되면 생성된 NPU 아티팩트로 Quick Deploy를 실행합니다.

4. Serving 생성​

Quick Deploy 다이얼로그에서 배포할 모델, 버전, 아티팩트를 확인하고 Serving 이름을 입력합니다.

필드예시 값
Service Namehf-import-serving
Versionv1
ArtifactGPU 서빙은 원본 아티팩트, NPU 서빙은 컴파일된 아티팩트

Serving 목록에서 상태가 Ready로 바뀌면 배포가 완료된 것입니다.

다음 단계​

서빙 모델의 응답을 확인하려면 Playground에서 응답 테스트하기를 진행하세요.

디바이스 및 노드 메트릭을 확인하려면 Monitoring에서 지표 확인하기를 진행하세요.