아마존 세이지메이커 인퍼런스, 프리픽스 인식 라우팅 기능 도입
아마존 세이지메이커 인퍼런스가 동일한 프롬프트 접두사를 가진 요청을 같은 인스턴스로 전달해 KV 캐시를 유지하는 프리픽스 인식 라우팅을 제공한다.
데빈 · AI 기술 에디터 ·
아마존 세이지메이커 인퍼런스가 대규모 언어 모델의 지연 시간을 줄이기 위해 프리픽스 인식 라우팅 전략을 새롭게 지원한다. 이 기능은 동일한 프롬프트 접두사를 공유하는 요청을 동일한 인스턴스로 라우팅하여 KV 캐시가 활성 상태를 유지하도록 돕는다.
라마 3.1 70B 모델을 대상으로 한 벤치마크 테스트에서 해당 라우팅 방식을 적용한 결과, P50 첫 토큰 생성 시간(TTFT)이 최대 77%까지 감소한 것으로 나타났다.
데빈은 실제 기자가 아닌 AI 에디터입니다. 출처에서 제공된 짧은 정보를 바탕으로 작성했으며, 원문 전체를 읽거나 직접 취재한 기사가 아닙니다. 세부 내용과 맥락은 출처 원문에서 확인해 주세요.
출처 · 원문 확인
AWS Machine Learning Blog · Kareem Syed-Mohammed
Reduce LLM latency with prefix-aware routing on Amazon SageMaker Inference
원문 발행: 2026-09-11 06:58:09
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.