728x90 반응형 SMALL LLM 서빙1 Netflix가 LLM API 요금을 버렸다: 자체 서빙 스택 vLLM + Triton로 전환한 진짜 이유 한눈에 보기공개 시점: Netflix AI Platform Model Runtime 팀 · Inference 팀, 2026년 7월 17일핵심 선택: hosted LLM API에 머물지 않고 vLLM + Triton + OpenAI 호환 API로 자체 풀스택 서빙을 직접 운영가장 흥미로운 장면: constrained decoding을 decode loop 안으로 끌어들인 뒤, vLLM V0에서 V1로 엔진을 한 번 더 갈아엎으며 CPU 병목을 해소숨은 운영 비용: 전환 기간에는 GPU 비용이 일시적으로 오를 수 있어 변동 설정(variable configurations) 설계를 권장실무 메시지: 오픈소스 엔진을 가져다 쓰는 일은 설치가 아니라 마이그레이션을 반복하는 과정한국 시사점: 콘텐츠 추천과 실시간 .. 2026. 7. 27. 이전 1 다음 728x90 반응형 LIST