추론 엔지니어링의 새로운 기능 — 필립 키엘리, Baseten

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00추론 엔지니어링의 새로운 소식에 대해 이야기하고자 합니다. 안녕하세요, 저는 필립입니다.
00:00:19책을 집필해서 이 자리에 섰습니다. AI 엔지니어 월드 페어 참가는 올해로 3년째인데요.
00:00:24전 세계에서 제가 가장 좋아하는 컨퍼런스이며, 매년 제 일정 중 가장 기다려지는 행사입니다.
00:00:292024년에 이곳에서 연사이자 엔지니어로서 첫발을 내딛었고, 2025년에도 돌아와 많은 활동을 했습니다.
00:00:36그리고 다시 왔습니다. 정말 좋아하는 공간이며, 항상 초청해 주시는 주최 측에 깊이 감사드립니다.
00:00:44'추론 엔지니어링'이라는 책을 3~4개월 전에 출간했는데,
00:00:49엄청난 반응에 압도되었습니다. 2월 23일에 책을 출간한 이후,
00:00:57종이책은 11,000권 이상 판매되었고, 전자책은 30,000권에 육박하며, 전 세계 2,400만 건의
00:01:04트위터 계정에 노출되었습니다. 실제 인원수로는 얼마나 될지 모르겠지만,
00:01:09정말 많은 분들이 추론 엔지니어링 관련 내용을 접하셨습니다. 이런 뜨거운 성원 속에서
00:01:17사람들이 제게 계속 던진 질문이 하나 있었습니다. 도대체 왜 이런 일을 했냐는 것이죠.
00:01:23이렇게 빠르게 변화하는 분야에 대해 왜 책을 쓰냐는 질문이었습니다. 하지만
00:01:29현재 추론 엔지니어링의 수많은 원칙들은 이미 상당 부분 공고해졌으며,
00:01:34모델 세대가 거듭되어도 배울 점과 반복 적용할 수 있는 내용이 매우 많습니다. 하지만 오늘 제가 말씀드릴 내용은
00:01:42추론 엔지니어링의 새로운 변화입니다. 출간 이후 업데이트된 모든 최신 정보를 전하는 첫 공개 보충 강연입니다.
00:01:48추론 엔지니어링의 기본 원칙을 짧게 복습한 뒤,
00:01:542026년 2월 23일 이후 추론 분야에서 일어난 수많은 일들에 대해 다루겠습니다.
00:02:00TurboQuant의 현주소와 KV 압축(compaction)에 대해 살펴보고,
00:02:05dFlash 및 추측적 디코딩(speculative decoding)의 흥미로운 신기술들에 많은 시간을 할애할 예정입니다.
00:02:12그리고 향후 추론 기술이 어떻게 발전할지
00:02:17약간의 예측과 전망을 공유하려 합니다. 다음번 만남 때 발표할 수 있기를 기대하는 주제들이죠.
00:02:23좋습니다. 이제 시작해 보죠. 수많은 사람들과 추론에 대해 이야기를 나누며
00:02:30몇 가지 공통된 원칙들을 정립하게 되었습니다. 그중 핵심적인 하나는,
00:02:38얼마 전 사라와 함께한 팟캐스트에서 추론에 관해 이야기했던 내용인데요.
00:02:44추론 엔지니어링에는 두 가지 뚜렷한 부류가 등장했습니다. 우선 '로컬 추론'인데,
00:02:48여기서의 주된 전략은 보유한 하드웨어가 무엇이든 양자화, 증류, 가지치기 등으로
00:02:56모델을 최대한 구겨 넣어서, 집에 있는 GPU들에 분산시키는 방식입니다.
00:03:02먼저 일단 작동하게 만든 다음, 성능 하락을 개선합니다. 모델 압축으로 인해 발생한
00:03:09치명적인 문제들을 해결하고, 배치 크기(batch size) 1에서
00:03:15기존 지능 기준선까지 다시 끌어올리는 것이죠. 반면 제가 속한 영역은
00:03:20대규모 배치와 데이터 센터의 세계입니다. 출시 당일 우선 vLLM 빌드를 띄워
00:03:27작동하게 만든 뒤, 속도를 올리는 방식입니다. KV 인지 라우팅, 추측적 디코딩,
00:03:33분리(disaggregation) 등을 적용하죠. 이 두 세계 사이에서 서로 배울 점이 매우 많다고 생각합니다.
00:03:40오늘 발표는 제 전문 분야인 데이터 센터 중심의 추론 엔지니어링 발전에 초점을 맞추겠지만,
00:03:46로컬 추론 영역에서도 정말 멋진 기술들이 많이 등장하고 있습니다.
00:03:52저서 '추론 엔지니어링'에서는 가중치(weights)를 완제품으로 전제하곤 했습니다.
00:03:58학습에서 추론으로 넘어가는 인수인계 과정이 명확한 경계를 설정하는 좋은 방법이자
00:04:03중요한 요소라고 생각했기 때문이죠. 하지만 최근 들어 점차 느끼는 것은,
00:04:10추론 최적화의 상당수가 전용 학습 프로세스에서 비롯된다는 점입니다.
00:04:17따라서 학습과 추론 사이의 경계가 갈수록 모호해지고 있으며, 이는 주목할 만한 변화입니다.
00:04:22추론 속도가 빨라지면 더 많은 데이터를 얻고, 이를 이용해 더 나은 모델을 학습시키며,
00:04:28그 결과 추론이 더 빨라져 다시 데이터를 얻는 선순환이 이어집니다.
00:04:33엄청난 성공을 거둘 때까지 이 과정을 계속 반복하게 되죠.
00:04:39추론을 위한 학습에 대해 이야기하자면, 제가 '3대 핵심 분야'라고 부르는 범주 전반에 걸쳐
00:04:45새로운 기술들을 공유하고자 합니다. 양자화(quantization) 분야의 최신 소식,
00:04:52캐싱, 특히 KV 캐시 메커니즘의 최신 정보, 그리고 추측적 디코딩의 최신 동향입니다.
00:04:57추론의 세계에는 오늘 마지막에 다룰 내용을 포함해 수많은 기술이 존재하지만,
00:05:02'특정 모델의 속도를 어떻게 올릴 것인가'라는 실무 현장에서는 주로 이 세 가지 기법이 쓰입니다.
00:05:09우선 지난 2월 책을 출간했을 당시, 저는 뿌듯함에 차 있었습니다.
00:05:16'추론에 관한 모든 핵심을 한 권에 담았다'고 생각했죠. 하지만
00:05:23곧이어 양자화 분야에 새로운 소식이 전해졌습니다. 간단히 복습하자면, 양자화는 작고 정밀도가 낮은 숫자 형식을 사용하여
00:05:32대역폭과 연산량을 절약하고 TTFT와 TPS를 개선하는 기술입니다.
00:05:39보통 하드웨어 의존적이며 비용을 절감해 주지만, 모델 품질이 약간 저하될 수 있습니다.
00:05:45참고로 양자화에 대한 제 전체 견해가 궁금하시다면, 지난달 AI 엔지니어 마이애미 행사에서
00:05:51양자화가 우려만큼 무조건 나쁜 것은 아니며, 그 과정에서 품질을 보존할 수 있는
00:05:57다양한 방법이 있다는 내용으로 강연을 진행했으니 참고하시기 바랍니다.
00:06:04아무튼 양자화 설명에 만족하고 있었는데, 2천만 명이 TurboQuant 기술을 접하게 되었습니다.
00:06:12모두가 “메모리 효율이 엄청나게 좋아져서 플래시 메모리가 더 이상 안 필요하겠다”라 생각한 탓에
00:06:16잠시 메모리 관련 주가가 하락하기도 했죠. 물론 그 예측은 틀렸지만요. 어쨌든 이 기술은
00:06:23올해 3월 대중화된 새로운 양자화 접근법으로, 극좌표계를 활용해
00:06:29KV 캐시를 4비트까지 양자화합니다. 대단한 화제였기에 저 역시
00:06:36'내가 책에서 놓친 거대한 영역이 생겼구나, 이건 또 어떻게 전개될까' 하고 생각했습니다.
00:06:43그래서 저희 팀은 이에 대한 많은 연구를 진행했습니다. 트위터의 @waterloointern으로
00:06:50알려진 저희 모델 성능 팀의 알리(Ali)가 작성한 자료인데요. 지금도 인턴인지는 확실치 않지만
00:06:57워터루 출신인 것은 맞습니다. 아무튼 알리가 TurboQuant에 숨겨진 수학적 원리에 대해 훌륭한 글을 썼습니다.
00:07:04TurboQuant의 주요 이점은 KV 캐시를 8비트 대신 4비트로 표현할 수 있다는 점입니다.
00:07:09공간과 대역폭을 절반으로 줄일 수 있고, 시스템 메모리 내에서 KV 캐시를 이동할 때
00:07:14대역폭이 실질적으로 두 배 늘어납니다. 하지만 단점도 꽤 큽니다.
00:07:21TurboQuant는 디코딩 과정에서 이를 보정하기 위해 순방향 패스(forward pass) 시
00:07:25추가 연산이 필요하며, 이로 인해 TPS가 절반 이하로 떨어집니다.
00:07:32이는 많은 프로덕션 사용 사례에서 받아들이기 힘든 절충안입니다. 따라서 철저히 검토했으나
00:07:38실제 워크로드에는 채택하지 않았고, 여전히 기존의 NVFP4 양자화를 사용하고 있습니다.
00:07:44그럼에도 이 기술은 로컬 추론을 다루는 분들에게는 훌륭한 기법입니다.
00:07:51특히 개인 컴퓨터나 지하실의 GPU로 긴 컨텍스트의 언어 모델을 구동하는 경우,
00:07:58메모리 용량이 매우 제한적이므로 그것이 제일 큰 병목 현상입니다. 따라서 KV 캐시의
00:08:04메모리를 확보하여 더 긴 시퀀스를 올릴 수 있게 해주는 기술은 큰 가치가 있으며,
00:08:09추가적인 순방향 패스 연산으로 인한 손해는 상대적으로 적게 느껴질 것입니다.
00:08:16따라서 TurboQuant는 환상적인 연구 논문이자 훌륭한 기술이지만,
00:08:22데이터 센터 추론 환경에서는 처음에 기대했던 것만큼 적합하지 않았습니다.
00:08:28대신 저희는 KV 캐시보다는 가중치 양자화에 집중하는 NVFP4에 주력하고 있습니다.
00:08:36양자화된 가중치의 거친 경계면을 다듬고, KV 캐시 자체의 확률 분포가 뭉개지지 않도록
00:08:41최선을 다하며, KV 인지 라우팅, KV 오프로딩, KV 공유에 집중하고 있습니다.
00:08:49NCCL, NVIDIA Dynamo 등의 도구를 활용해 KV 캐시를 시스템 내에서 이동시키고,
00:08:55TurboQuant로 압축하는 대신 CPU 일반 메모리로 오프로드하는 방식 등을 적용하고 있죠.
00:09:04또한 다양한 모달리티에서의 양자화에도 집중하고 있습니다.
00:09:11언어 모델뿐만 아니라 이미지 및 비디오 모델에도 NVFP4의 이점을 적용하는 방안을 모색 중입니다.
00:09:17알리가 트위터에 이에 관한 훌륭한 내용을 많이 올렸으니 확인해 보시길 권합니다.
00:09:23그렇다 하더라도 KV 캐시는 여전히 매우 중요합니다. 그럼 KV 압축에 대해 이야기해 봅시다.
00:09:29다시 간단히 요약하자면, 동일한 접두사(prefix)를 가진 프롬프트를 입력할 경우
00:09:35지난번 프리필(pre-fill) 단계에서 계산된 토큰을 재사용할 수 있어 전체 시스템이 한층 빨라지고 효율적이 됩니다.
00:09:42대반적으로 KV 캐시는 손실이 없는 메모리입니다. 추론 시스템을 생각할 때
00:09:48무손실 메모리 출처는 몇 개 되지 않습니다. 프롬프트 내용, 컨텍스트, 그리고 KV 캐시가 있죠.
00:09:55이는 전달하는 데이터양에 비례하여 선형적으로 증가합니다. 이제
00:09:59백만 토큰 수준의 시퀀스 길이를 고려한다면, 메모리 부담이 상당히 커지게 됩니다.
00:10:05그래서 많은 이들이 메모리와 컨텍스트 압축 방안을 고민하고 있습니다. 에이전트 하네스, 랙(RAG) 검색 등
00:10:11우리가 수년간 논의해 온 기법들은 모두 거대한 컨텍스트를
00:10:17모델에 전달하거나 파일로 저장할 수 있는 형태로 축소하는 일종의 압축 방식입니다.
00:10:22이러한 방식들은 보유 데이터양 대비 서브선형(sub-linear)적으로 증가합니다. 그렇다면 절충안은 없을까요?
00:10:28거의 무손실에 가까운 정보 유지력을 보이면서도 기억하는 데이터를 상당 부분 압축할 방법은 없을까요?
00:10:34캐시에 무엇을 남길지 판단하는 데에는 여러 가지 접근 방식이 존재합니다.
00:10:41최신 압축 기법들은 캐시를 훨씬 짧은 길이로 대체할 수 있음을 보여주었습니다.
00:10:47더 짧은 캐시로 교체할 수 있음을 보여줍니다. Attention Matching이나 Cartridges 같은 논문들은
00:10:53높은 압축률과 함께 매우 유망한 결과를 보여주었죠. 하지만 둘 다 추론 시점에 실행됩니다.
00:11:00제가 말씀드리고 싶은 기법이자 주제 중 하나는 바로 '추론을 위한 학습'입니다.
00:11:05그래서 이번에는 Base10 연구팀의 STILL이라는 기술을 소개하고자 합니다. 이는 캐시 상에서
00:11:12정보 자체나 결정론적 부분집합을 그대로 유지하는 대신, 정보의 학습된 표현을 유지함으로써
00:11:17합성을 학습을 통해 분할 상환하는 방식입니다. 저희 포스트 트레이닝 팀의 Charlie와 Mudith가
00:11:25최근 CoSA Compile에서 멋진 칠판 발표를 진행했는데요, YouTube에 올라와 있으니
00:11:31KV 압축에 관심 있으신 분들은 꼭 확인해 보시기 바랍니다.
00:11:37안타깝게도 저에게는 여기서 모든 걸 설명할 시간이나 천재성이 부족하지만, 기본 메커니즘은
00:11:46STILL이 Perceiver 병목 구조를 사용하여 학습된 쿼리 벡터의 고정 집합을
00:11:53전체 KV 캐시와 교차 어텐션하여 단 한 번의 순전파로 압축된 키와 값 세트를 생성하는 것입니다.
00:11:59이를 통해 LLM이 실제 컨텍스트처럼 참조할 수 있는 빠르고 미분 가능한 압축 메모리가 생성됩니다.
00:12:05따라서 KV 압축에 관심이 있다면 Charlie와 Mudith의 연구를 꼭 확인해 보세요.
00:12:09정말 흥미로운 분야였습니다. 지금까지 이야기한 기술 중 두 가지,
00:12:16양자화와 캐싱에 대해 말씀드렸고, 마지막 기술은 추측(Speculation)입니다. 이 분야에서도
00:12:21많은 변화가 있었습니다. 복습해 보자면, 추측 디코딩은 초안 토큰을 사용해 순전파 과정에서
00:12:29이를 검증함으로써 한 번의 순전파당 여러 토큰을 생성하는 방식입니다.
00:12:34초당 토큰 수를 높이는 데 큰 도움이 되며 완전 무손실 최적화라는 점에서 매우 훌륭합니다.
00:12:40품질 저하를 전혀 걱정할 필요가 없기 때문이죠. 추측의 역사에 대해 말씀드리자면,
00:12:46추측 디코딩부터 시작했습니다. 책에도 모두 나와 있는데요, SpecDec처럼 같은 계열의 소형 모델을 사용해
00:12:52초안 토큰을 생성하는 방식이었습니다. 하지만 소형 모델은 초안 토큰 생성기로서 훌륭하지는 않았죠.
00:12:58그저 성능 좋은 소형 모델일 뿐이었습니다. 그래서 업계에서는 Medusa처럼 모델에 디코더 헤드를
00:13:04추가하는 새로운 방식을 개발했고, 마침내 Eagle 3가 등장했습니다. 이는
00:13:09같은 계열의 작은 모델 대신, 타깃 모델의 은닉 상태(Hidden States)를 기반으로 10억 개 파라미터 모델을
00:13:15학습시켜 초안 토큰을 생성하게 하는 방식이었습니다. 이 방식은 매우 효과적이었고,
00:13:21작년 2월이나 올해 2월쯤까지만 해도 Eagle 3는 최고 성능의 추측 기법이었습니다.
00:13:27그런데 이제 dFlash가 나왔습니다. dFlash는 훨씬 더 뛰어난데요, 바로 추측을 위한 확산 모델입니다. dFlash는
00:13:36단일 토큰이 아닌 초안 토큰 시퀀스를 생성합니다. 해당 모델은 확산 언어 모델로서,
00:13:43비디오나 이미지 생성이 프레임 시퀀스나 픽셀 시퀀스를 생성하고 반복 개선하는 것과 동일하게
00:13:49전체 토큰 시퀀스를 생성합니다. 자기회귀 방식으로 토큰을 생성하는 대신 말이죠.
00:13:55dFlash 모델은 실행 속도가 2배에서 4배 정도 느릴 수 있지만, 한 윈도우 내에서
00:14:018개 또는 16개의 토큰을 한 번에 예측합니다. Eagle이 한 번에 하나씩만 처리하는 반면 말이죠.
00:14:08따라서 dFlash의 단일 순전파는 Eagle의 전체 초안 단계보다 빠르며 더 많은 토큰을 예측합니다.
00:14:14이 토큰들은 서로 교차 어텐션을 수행하여 전반적으로 더 높은 수용률을 만들어냅니다. 추측에서는
00:14:21수용률이 전부이기 때문이죠. 실제 환경에서 dFlash는 3배 이상의 성능 향상을 보여주고 있습니다.
00:14:30단일 B200 환경의 Qwen3 8B 모델로 측정한 수치인데요, Eagle과 비교했을 때 토큰 수용률과
00:14:40초당 토큰 수 모두에서 상당한 개선을 확인할 수 있습니다. dFlash 모델은 양방향 초안 생성을 위한 어텐션 마스크로
00:14:47학습됩니다. 타깃 모델이 컨텍스트를 제공하고, 각 블록 내에서
00:14:54샘플링된 깨끗한 토큰의 부분집합을 갖게 되며, 어텐션 마스크가 인과적 일관성을
00:14:59강제합니다. 그러나 양방향 어텐션도 여전히 허용하는데,
00:15:06기존 자기회귀 모델에서는 한 방향의 토큰만 확인하기 때문에, 바로 이런 이유로 저희가
00:15:13확산 기반 아키텍처의 장점을 활용할 수 있는 것입니다. 그리고 다 끝났다고 생각했을 때,
00:15:19며칠 전 dSpark가 나왔습니다. dFlash는 이미 프로덕션 환경에서 운영 중이지만
00:15:25dSpark는 새로운 연구 단계입니다. 그래서 이건 신기술이 존재하고 멋지며 검토 중이라는 정도만
00:15:31말씀드릴 수 있습니다. dFlash와의 차이점은 동일한 확산 모델을 사용하면서도 시퀀셜 모델을
00:15:38함께 결합한다는 것입니다. 그 의도는 이 두 모델을 함께 연동시킴으로써 수용률을 높이는 것이며,
00:15:45단순한 반복형 추측기나 확산형 추측기,
00:15:51혹은 자기회귀형 추측기만 사용하는 것과 차별화됩니다. dSpark는 매우 흥미롭지만, 아직
00:15:57공유할 만한 프로덕션 결과는 없습니다. 다음에 기회가 되면 공유해 드리겠습니다.
00:16:03하지만 지속적인 추측기 재학습 분야에서는 프로덕션 결과를 보유하고 있습니다.
00:16:09다시 dFlash 이야기로 돌아왔는데요, 추측 디코딩이 시스템에서 처리하는
00:16:15실제 프롬프트와 응답 내용에 크게 의존한다는 개념입니다. 따라서
00:16:21라이브 시스템의 프롬프트와 응답에 대해 지속적으로 재학습을 진행하면 토큰 수용률이
00:16:2920%에서 최대 2배까지 향상되는 것을 볼 수 있습니다. 이는 구현하기가 매우 까다로운데,
00:16:36대용량 스토리지와 이러한 방식으로 데이터를 처리할 수 있는 권한이 확보되어야 합니다.
00:16:40엄청난 컴퓨팅 자원이 소모되고 이 모든 정보를 이동시켜야 하며, 하위 모델을
00:16:46변경하면 추측기 모델도 함께 변경해야 합니다. 하지만 미래를 내다보았을 때,
00:16:51초대형 시스템을 위한 지속적 추측 기술은 충분히 가치 있는 최적화가 될 것입니다.
00:16:58그렇다면 추론 분야의 다음 행보는 무엇일까요? 다음 내용은 개인적인 의견과 추측,
00:17:06그리고 공개된 정보에 기반하며, 실제로 출시될 내용을 알고 있더라도 여기서 말씀드릴 수는 없습니다.
00:17:11그러니 이는 어디까지나 제 개인적인 전망입니다. 저는 Ampere, Hopper,
00:17:17Blackwell 출시에 이르기까지 세 번의 하드웨어 주기를 겪어왔습니다.
00:17:23칩이 출하되어 데이터 센터에 설치되고 전체 소프트웨어 스택이
00:17:30그 성능을 제대로 활용하기까지는 항상 시간이 걸립니다. 하지만 제가 기대를 걸고 있는 부분은
00:17:36Rubin 아키텍처의 NVFP4 성능이 놀라울 것으로 보인다는 점입니다.
00:17:44따라서 로컬 추론 기술을 잘 차용하고 NVFP4 데이터 형식으로 모델을 실행하는 데
00:17:49신뢰도를 높일수록, 차세대 Rubin 시스템의 뛰어난 성능을 더욱 잘 활용할 수 있게 될 것입니다.
00:17:54또한 분리형(Disaggregation) 구조와 시스템 전반의 통신이 더욱 중요해질 것입니다.
00:18:00PD 분리 구조를 통해 우수한 초기 성과를 얻고 있으며, KV 캐시 데이터와 같은
00:18:05정보를 시스템 내에서 자유롭게 이동시키는 능력이 점점 더 중요해질 것입니다.
00:18:12그리고 말씀드렸듯이 '추론을 위한 학습'이라는 주제는 앞으로도 업계에
00:18:17지속적으로 큰 영향을 미칠 것입니다. 강연에 참석해 주신 여러분께 진심으로 감사드립니다.
00:18:25저는 X(트위터)와 LinkedIn을 운영하고 있으며 무료 도서를 나누어 드리고 있습니다.
00:18:32QR 코드를 통해 PDF를 다운로드하시거나, 저와 함께 Base10 부스로 오셔서 '추론 엔지니어링'
00:18:37무료 책자를 수령하실 수 있습니다. 많이 준비되어 있어 모두에게 충분할 것 같지만, 부족하면 사무실에서 더 가져오겠습니다.
00:18:43그럼 저는 아래층 Base10 부스에 있겠습니다. 참석해 주셔서 정말 감사합니다.
00:18:48좋은 하루 되세요.

핵심 요약

데이터 센터 환경의 추론 엔지니어링은 단순 모델 압축을 넘어 STILL 기반 KV 압축과 dFlash 등 확산형 추측 디코딩 기법을 통해 속도와 효율성을 끌어올린다.

하이라이트

  • 추론 엔지니어링 출간 이후 종이책 11,000권 이상, 전자책 30,000권에 육박하는 판매량을 기록했다.

  • TurboQuant는 KV 캐시를 4비트로 양자화해 메모리 대역폭을 2배 늘리지만, 순방향 패스 추가 연산으로 인해 초당 토큰 수(TPS)가 절반 이하로 떨어진다.

  • Perceiver 병목 구조를 활용한 STILL 기술은 단 한 번의 순전파로 KV 캐시를 미분 가능한 압축 메모리로 전환한다.

  • 확산 기반 모델인 dFlash는 윈도우 내에서 8개 또는 16개의 초안 토큰을 한 번에 예측하여 Eagle 대비 3배 이상의 성능 향상을 제공한다.

  • 라이브 시스템의 프롬프트와 응답 데이터로 추측기를 지속해서 재학습하면 토큰 수용률이 20%에서 최대 2배까지 증가한다.

타임라인

추론 엔지니어링의 성과와 현황

  • 추론 엔지니어링 관련 도서는 출간 후 종이책 11,000권과 전자책 30,000권에 가까운 판매고를 올렸다.
  • 모델 세대가 바뀌어도 추론 엔지니어링의 핵심 원칙들은 계속해서 반복 적용된다.

추론 엔지니어링 분야는 빠르게 변화하지만 기반이 되는 핵심 원칙들은 이미 견고하게 자리 잡았다. 2026년 2월 출간 이후 수많은 엔지니어가 해당 원칙을 실무에 적용했다. 최신 추론 기술 발전 방향은 크게 양자화, KV 캐시 압축, 추측적 디코딩의 세 가지 영역으로 나뉜다.

로컬 추론과 데이터 센터 추론의 두 가지 접근 방식

  • 로컬 추론은 양자화와 가지치기를 통해 제한된 하드웨어에 모델을 구겨 넣는 방식을 취한다.
  • 데이터 센터 추론은 대규모 배치 환경에서 KV 인지 라우팅과 분리 구조로 속도를 극대화한다.
  • 학습과 추론의 경계가 모호해지면서 추론 최적화가 전용 학습 프로세스에서 이루어진다.

로컬 추론은 하드웨어 제약으로 인해 성능 하락을 감수하더라도 배치 크기 1에서 지능 기준선을 복원하는 데 집중한다. 반면 데이터 센터 추론은 대규모 환경에서 vLLM 등을 우선 가동한 뒤 속도를 끌어올리는 전략을 쓴다. 추론 속도가 빨라질수록 더 많은 데이터를 확보해 나은 모델을 학습시키는 선순환 구조가 형성된다.

TurboQuant의 한계와 NVFP4 가중치 양자화

  • TurboQuant는 극좌표계를 활용해 KV 캐시를 4비트로 양자화하여 메모리 공간을 반으로 줄인다.
  • 순방향 패스 연산 추가로 인해 TPS가 절반 이하로 떨어지므로 데이터 센터 실무 환경에는 부적합하다.
  • 데이터 센터 환경에서는 가중치 양자화 방식인 NVFP4와 CPU 메모리 오프로딩을 조합하여 사용한다.

TurboQuant는 메모리 대역폭을 2배로 확장하여 메모리가 극도로 제한된 로컬 GPU 환경이나 긴 컨텍스트 구동 시에는 큰 이점을 제공한다. 하지만 프로덕션 데이터 센터에서는 추가 연산으로 인한 TPS 저하가 치명적인 병목으로 작용한다. 이에 따라 데이터 센터 워크로드에서는 가중치 양자화인 NVFP4를 채택하고, KV 캐시는 압축 대신 CPU 일반 메모리로 오프로드하는 방식을 적용한다.

STILL 기술을 통한 학습 기반 KV 캐시 압축

  • 동일한 접두사 프롬프트의 토큰을 재사용하면 TTFT와 전반적인 추론 효율이 향상된다.
  • STILL은 Perceiver 병목 구조를 통해 고정된 쿼리 벡터 집합과 전체 KV 캐시를 교차 어텐션한다.
  • 한 번의 순전파만으로 미분 가능한 압축 메모리가 생성된다.

백만 토큰 단위의 길이를 처리할 때 KV 캐시가 차지하는 메모리 부담은 선형적으로 증가한다. 기존 Attention Matching이나 Cartridges는 추론 시점에 압축을 수행하는 반면, STILL은 오프라인 학습을 통해 압축 연산 비용을 분할 상환한다. 생성된 압축 키와 값 세트는 LLM이 실제 컨텍스트처럼 즉시 참조할 수 있는 구조를 가진다.

확산 모델 기반 dFlash와 추측적 디코딩의 진화

  • dFlash는 확산 언어 모델 방식을 적용해 윈도우당 8개 또는 16개의 초안 토큰을 한 번에 생성한다.
  • 단일 B200 환경의 Qwen3 8B 모델 테스트에서 Eagle 대비 3배 이상의 성능 향상을 기록했다.
  • 실제 시스템 프롬프트 데이터로 추측기를 지속 재학습하면 토큰 수용률이 최대 2배까지 상승한다.

기존 Eagle 3 방식이 타깃 모델의 은닉 상태를 기반으로 순차적 초안 토큰을 만들었다면, dFlash는 양방향 어텐션 마스크를 이용해 한 번의 순전파로 토큰 블록 전체를 예측한다. 양방향 어텐션 교차 검증 덕분에 수용률이 획기적으로 향상된다. 나아가 최신 연구 단계인 dSpark는 확산 모델과 시퀀셜 모델을 결합하여 추가적인 수용률 증가를 도모한다.

차세대 하드웨어 및 추론 기술 전망

  • 차세대 Rubin 아키텍처의 NVFP4 처리 성능이 대폭 향상될 전망이다.
  • 프롬프트 및 디코딩 분리(PD Disaggregation) 구조로 KV 캐시의 시스템 내 이동성이 핵심 과제로 떠오른다.

하드웨어가 출하되어 소프트웨어 스택에 완전히 반영되기까지는 일정 시간이 소요된다. 로컬 추론 기법을 데이터 센터 환경에 맞춰 변형하고 NVFP4 데이터 포맷 신뢰도를 높이면 Rubin 아키텍처 도입 시 성능 이점을 극대화할 수 있다. 프록시 및 디코딩 영역을 분리하는 PD 분리 구조와 추론을 고려한 학습 방법론이 향후 최적화의 주축을 이룬다.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기