artifact의 동일성과 model readiness를 따로 확인합니다
Model artifact(모델 실행 자료): 가중치·tokenizer·config 등 특정 model을 재현 가능하게 실행하는 파일 묶음입니다.
Model artifact는 가중치 파일만 뜻하지 않습니다. tokenizer, configuration, chat template와 필요한 전처리 규칙까지 함께 있어야 같은 입력을 같은 token과 tensor로 바꿉니다. runtime image와 driver 조합도 실행 결과와 지원 형식에 영향을 줍니다.
Triton model repository는 model 이름 아래 숫자 version 디렉터리와 설정을 연결합니다. server가 실행되어도 특정 backend가 model을 읽지 못하면 해당 model은 ready가 아닙니다. vLLM의 API 호환성 역시 모든 model이 같은 기능과 template를 지원한다는 뜻은 아닙니다.
fixture에서 model 1은 ready이고 model 2는 tokenizer 파일 누락으로 로드 실패했습니다. server live가 200이라는 이유로 model 2로 traffic을 옮기면 실제 요청이 실패합니다. 배포 manifest에는 파일 checksum과 runtime image digest를 함께 보존해야 합니다.
아래 fixture에서 live 성공과 model ready 실패가 함께 나타납니다. traffic 전환 여부와 다음에 읽을 load log를 결정합니다.
- 왜 이런가
- Triton model repository는 model 이름 아래 숫자 version 디렉터리와 설정을 연결합니다. server가 실행되어도 특정 backend가 model을 읽지 못하면 해당 model은 ready가 아닙니다. vLLM의 API 호환성 역시 모든 model이 같은 기능과 template를 지원한다는 뜻은 아닙니다.
- 언제 문제가 되는가
- digest 불일치·model load 실패 조건이면 진행 근거가 부족합니다.
- 초보자가 자주 하는 오해
- model remote code를 검토 없이 실행하거나 mutable tag만으로 배포를 재현했다고 기록하지 않습니다. 본문의 HTTP code는 fixture이며 실패 code는 구현·버전에 따라 확인합니다.
- 직접 확인하는 방법
- 가중치·tokenizer·config checksum을 release manifest와 대조합니다. runtime image digest·backend와 GPU 지원 범위를 기록합니다.