1:42:53
추론의 최전선: 10배 빠른 모델에서 스스로 최적화하는 AI까지 — Philip Kiely & Ali Taha, Baseten
- Baseten은 긴 컨텍스트 요청, KV 캐시, 프리필/디코드 분리, speculative decoding, 전용 배포를 통해 오픈 모델을 실제 프로덕션 API로 만드는 과정을 설명한다.
- 추론 최적화의 핵심은 원본 모델 충실도를 유지하면서 양자화, 병렬화, 라우팅, 하드웨어 특화, 오토튜닝을 조합해 처리량과 지연 시간을 개선하는 것이다.
- 앞으로의 추론 엔지니어링은 커널 최적화를 넘어 시스템 인프라, 지속 학습, 모델이 자기 자신의 서빙 경로를 개선하는 루프로 확장될 것으로 전망된다.