Transcript
00:00:00추론 엔지니어링의 새로운 소식에 대해 이야기하고자 합니다. 안녕하세요, 저는 필립입니다.
00:00:19책을 집필해서 이 자리에 섰습니다. AI 엔지니어 월드 페어 참가는 올해로 3년째인데요.
00:00:24전 세계에서 제가 가장 좋아하는 컨퍼런스이며, 매년 제 일정 중 가장 기다려지는 행사입니다.
00:00:292024년에 이곳에서 연사이자 엔지니어로서 첫발을 내딛었고, 2025년에도 돌아와 많은 활동을 했습니다.
00:00:36그리고 다시 왔습니다. 정말 좋아하는 공간이며, 항상 초청해 주시는 주최 측에 깊이 감사드립니다.
00:00:44'추론 엔지니어링'이라는 책을 3~4개월 전에 출간했는데,
00:00:49엄청난 반응에 압도되었습니다. 2월 23일에 책을 출간한 이후,
00:00:57종이책은 11,000권 이상 판매되었고, 전자책은 30,000권에 육박하며, 전 세계 2,400만 건의
00:01:04트위터 계정에 노출되었습니다. 실제 인원수로는 얼마나 될지 모르겠지만,
00:01:09정말 많은 분들이 추론 엔지니어링 관련 내용을 접하셨습니다. 이런 뜨거운 성원 속에서
00:01:17사람들이 제게 계속 던진 질문이 하나 있었습니다. 도대체 왜 이런 일을 했냐는 것이죠.
00:01:23이렇게 빠르게 변화하는 분야에 대해 왜 책을 쓰냐는 질문이었습니다. 하지만
00:01:29현재 추론 엔지니어링의 수많은 원칙들은 이미 상당 부분 공고해졌으며,
00:01:34모델 세대가 거듭되어도 배울 점과 반복 적용할 수 있는 내용이 매우 많습니다. 하지만 오늘 제가 말씀드릴 내용은
00:01:42추론 엔지니어링의 새로운 변화입니다. 출간 이후 업데이트된 모든 최신 정보를 전하는 첫 공개 보충 강연입니다.
00:01:48추론 엔지니어링의 기본 원칙을 짧게 복습한 뒤,
00:01:542026년 2월 23일 이후 추론 분야에서 일어난 수많은 일들에 대해 다루겠습니다.
00:02:00TurboQuant의 현주소와 KV 압축(compaction)에 대해 살펴보고,
00:02:05dFlash 및 추측적 디코딩(speculative decoding)의 흥미로운 신기술들에 많은 시간을 할애할 예정입니다.
00:02:12그리고 향후 추론 기술이 어떻게 발전할지
00:02:17약간의 예측과 전망을 공유하려 합니다. 다음번 만남 때 발표할 수 있기를 기대하는 주제들이죠.
00:02:23좋습니다. 이제 시작해 보죠. 수많은 사람들과 추론에 대해 이야기를 나누며
00:02:30몇 가지 공통된 원칙들을 정립하게 되었습니다. 그중 핵심적인 하나는,
00:02:38얼마 전 사라와 함께한 팟캐스트에서 추론에 관해 이야기했던 내용인데요.
00:02:44추론 엔지니어링에는 두 가지 뚜렷한 부류가 등장했습니다. 우선 '로컬 추론'인데,
00:02:48여기서의 주된 전략은 보유한 하드웨어가 무엇이든 양자화, 증류, 가지치기 등으로
00:02:56모델을 최대한 구겨 넣어서, 집에 있는 GPU들에 분산시키는 방식입니다.
00:03:02먼저 일단 작동하게 만든 다음, 성능 하락을 개선합니다. 모델 압축으로 인해 발생한
00:03:09치명적인 문제들을 해결하고, 배치 크기(batch size) 1에서
00:03:15기존 지능 기준선까지 다시 끌어올리는 것이죠. 반면 제가 속한 영역은
00:03:20대규모 배치와 데이터 센터의 세계입니다. 출시 당일 우선 vLLM 빌드를 띄워
00:03:27작동하게 만든 뒤, 속도를 올리는 방식입니다. KV 인지 라우팅, 추측적 디코딩,
00:03:33분리(disaggregation) 등을 적용하죠. 이 두 세계 사이에서 서로 배울 점이 매우 많다고 생각합니다.
00:03:40오늘 발표는 제 전문 분야인 데이터 센터 중심의 추론 엔지니어링 발전에 초점을 맞추겠지만,
00:03:46로컬 추론 영역에서도 정말 멋진 기술들이 많이 등장하고 있습니다.
00:03:52저서 '추론 엔지니어링'에서는 가중치(weights)를 완제품으로 전제하곤 했습니다.
00:03:58학습에서 추론으로 넘어가는 인수인계 과정이 명확한 경계를 설정하는 좋은 방법이자
00:04:03중요한 요소라고 생각했기 때문이죠. 하지만 최근 들어 점차 느끼는 것은,
00:04:10추론 최적화의 상당수가 전용 학습 프로세스에서 비롯된다는 점입니다.
00:04:17따라서 학습과 추론 사이의 경계가 갈수록 모호해지고 있으며, 이는 주목할 만한 변화입니다.
00:04:22추론 속도가 빨라지면 더 많은 데이터를 얻고, 이를 이용해 더 나은 모델을 학습시키며,
00:04:28그 결과 추론이 더 빨라져 다시 데이터를 얻는 선순환이 이어집니다.
00:04:33엄청난 성공을 거둘 때까지 이 과정을 계속 반복하게 되죠.
00:04:39추론을 위한 학습에 대해 이야기하자면, 제가 '3대 핵심 분야'라고 부르는 범주 전반에 걸쳐
00:04:45새로운 기술들을 공유하고자 합니다. 양자화(quantization) 분야의 최신 소식,
00:04:52캐싱, 특히 KV 캐시 메커니즘의 최신 정보, 그리고 추측적 디코딩의 최신 동향입니다.
00:04:57추론의 세계에는 오늘 마지막에 다룰 내용을 포함해 수많은 기술이 존재하지만,
00:05:02'특정 모델의 속도를 어떻게 올릴 것인가'라는 실무 현장에서는 주로 이 세 가지 기법이 쓰입니다.
00:05:09우선 지난 2월 책을 출간했을 당시, 저는 뿌듯함에 차 있었습니다.
00:05:16'추론에 관한 모든 핵심을 한 권에 담았다'고 생각했죠. 하지만
00:05:23곧이어 양자화 분야에 새로운 소식이 전해졌습니다. 간단히 복습하자면, 양자화는 작고 정밀도가 낮은 숫자 형식을 사용하여
00:05:32대역폭과 연산량을 절약하고 TTFT와 TPS를 개선하는 기술입니다.
00:05:39보통 하드웨어 의존적이며 비용을 절감해 주지만, 모델 품질이 약간 저하될 수 있습니다.
00:05:45참고로 양자화에 대한 제 전체 견해가 궁금하시다면, 지난달 AI 엔지니어 마이애미 행사에서
00:05:51양자화가 우려만큼 무조건 나쁜 것은 아니며, 그 과정에서 품질을 보존할 수 있는
00:05:57다양한 방법이 있다는 내용으로 강연을 진행했으니 참고하시기 바랍니다.
00:06:04아무튼 양자화 설명에 만족하고 있었는데, 2천만 명이 TurboQuant 기술을 접하게 되었습니다.
00:06:12모두가 “메모리 효율이 엄청나게 좋아져서 플래시 메모리가 더 이상 안 필요하겠다”라 생각한 탓에
00:06:16잠시 메모리 관련 주가가 하락하기도 했죠. 물론 그 예측은 틀렸지만요. 어쨌든 이 기술은
00:06:23올해 3월 대중화된 새로운 양자화 접근법으로, 극좌표계를 활용해
00:06:29KV 캐시를 4비트까지 양자화합니다. 대단한 화제였기에 저 역시
00:06:36'내가 책에서 놓친 거대한 영역이 생겼구나, 이건 또 어떻게 전개될까' 하고 생각했습니다.
00:06:43그래서 저희 팀은 이에 대한 많은 연구를 진행했습니다. 트위터의 @waterloointern으로
00:06:50알려진 저희 모델 성능 팀의 알리(Ali)가 작성한 자료인데요. 지금도 인턴인지는 확실치 않지만
00:06:57워터루 출신인 것은 맞습니다. 아무튼 알리가 TurboQuant에 숨겨진 수학적 원리에 대해 훌륭한 글을 썼습니다.
00:07:04TurboQuant의 주요 이점은 KV 캐시를 8비트 대신 4비트로 표현할 수 있다는 점입니다.
00:07:09공간과 대역폭을 절반으로 줄일 수 있고, 시스템 메모리 내에서 KV 캐시를 이동할 때
00:07:14대역폭이 실질적으로 두 배 늘어납니다. 하지만 단점도 꽤 큽니다.
00:07:21TurboQuant는 디코딩 과정에서 이를 보정하기 위해 순방향 패스(forward pass) 시
00:07:25추가 연산이 필요하며, 이로 인해 TPS가 절반 이하로 떨어집니다.
00:07:32이는 많은 프로덕션 사용 사례에서 받아들이기 힘든 절충안입니다. 따라서 철저히 검토했으나
00:07:38실제 워크로드에는 채택하지 않았고, 여전히 기존의 NVFP4 양자화를 사용하고 있습니다.
00:07:44그럼에도 이 기술은 로컬 추론을 다루는 분들에게는 훌륭한 기법입니다.
00:07:51특히 개인 컴퓨터나 지하실의 GPU로 긴 컨텍스트의 언어 모델을 구동하는 경우,
00:07:58메모리 용량이 매우 제한적이므로 그것이 제일 큰 병목 현상입니다. 따라서 KV 캐시의
00:08:04메모리를 확보하여 더 긴 시퀀스를 올릴 수 있게 해주는 기술은 큰 가치가 있으며,
00:08:09추가적인 순방향 패스 연산으로 인한 손해는 상대적으로 적게 느껴질 것입니다.
00:08:16따라서 TurboQuant는 환상적인 연구 논문이자 훌륭한 기술이지만,
00:08:22데이터 센터 추론 환경에서는 처음에 기대했던 것만큼 적합하지 않았습니다.
00:08:28대신 저희는 KV 캐시보다는 가중치 양자화에 집중하는 NVFP4에 주력하고 있습니다.
00:08:36양자화된 가중치의 거친 경계면을 다듬고, KV 캐시 자체의 확률 분포가 뭉개지지 않도록
00:08:41최선을 다하며, KV 인지 라우팅, KV 오프로딩, KV 공유에 집중하고 있습니다.
00:08:49NCCL, NVIDIA Dynamo 등의 도구를 활용해 KV 캐시를 시스템 내에서 이동시키고,
00:08:55TurboQuant로 압축하는 대신 CPU 일반 메모리로 오프로드하는 방식 등을 적용하고 있죠.
00:09:04또한 다양한 모달리티에서의 양자화에도 집중하고 있습니다.
00:09:11언어 모델뿐만 아니라 이미지 및 비디오 모델에도 NVFP4의 이점을 적용하는 방안을 모색 중입니다.
00:09:17알리가 트위터에 이에 관한 훌륭한 내용을 많이 올렸으니 확인해 보시길 권합니다.
00:09:23그렇다 하더라도 KV 캐시는 여전히 매우 중요합니다. 그럼 KV 압축에 대해 이야기해 봅시다.
00:09:29다시 간단히 요약하자면, 동일한 접두사(prefix)를 가진 프롬프트를 입력할 경우
00:09:35지난번 프리필(pre-fill) 단계에서 계산된 토큰을 재사용할 수 있어 전체 시스템이 한층 빨라지고 효율적이 됩니다.
00:09:42대반적으로 KV 캐시는 손실이 없는 메모리입니다. 추론 시스템을 생각할 때
00:09:48무손실 메모리 출처는 몇 개 되지 않습니다. 프롬프트 내용, 컨텍스트, 그리고 KV 캐시가 있죠.
00:09:55이는 전달하는 데이터양에 비례하여 선형적으로 증가합니다. 이제
00:09:59백만 토큰 수준의 시퀀스 길이를 고려한다면, 메모리 부담이 상당히 커지게 됩니다.
00:10:05그래서 많은 이들이 메모리와 컨텍스트 압축 방안을 고민하고 있습니다. 에이전트 하네스, 랙(RAG) 검색 등
00:10:11우리가 수년간 논의해 온 기법들은 모두 거대한 컨텍스트를
00:10:17모델에 전달하거나 파일로 저장할 수 있는 형태로 축소하는 일종의 압축 방식입니다.
00:10:22이러한 방식들은 보유 데이터양 대비 서브선형(sub-linear)적으로 증가합니다. 그렇다면 절충안은 없을까요?
00:10:28거의 무손실에 가까운 정보 유지력을 보이면서도 기억하는 데이터를 상당 부분 압축할 방법은 없을까요?
00:10:34캐시에 무엇을 남길지 판단하는 데에는 여러 가지 접근 방식이 존재합니다.
00:10:41최신 압축 기법들은 캐시를 훨씬 짧은 길이로 대체할 수 있음을 보여주었습니다.
00:10:47더 짧은 캐시로 교체할 수 있음을 보여줍니다. Attention Matching이나 Cartridges 같은 논문들은
00:10:53높은 압축률과 함께 매우 유망한 결과를 보여주었죠. 하지만 둘 다 추론 시점에 실행됩니다.
00:11:00제가 말씀드리고 싶은 기법이자 주제 중 하나는 바로 '추론을 위한 학습'입니다.
00:11:05그래서 이번에는 Base10 연구팀의 STILL이라는 기술을 소개하고자 합니다. 이는 캐시 상에서
00:11:12정보 자체나 결정론적 부분집합을 그대로 유지하는 대신, 정보의 학습된 표현을 유지함으로써
00:11:17합성을 학습을 통해 분할 상환하는 방식입니다. 저희 포스트 트레이닝 팀의 Charlie와 Mudith가
00:11:25최근 CoSA Compile에서 멋진 칠판 발표를 진행했는데요, YouTube에 올라와 있으니
00:11:31KV 압축에 관심 있으신 분들은 꼭 확인해 보시기 바랍니다.
00:11:37안타깝게도 저에게는 여기서 모든 걸 설명할 시간이나 천재성이 부족하지만, 기본 메커니즘은
00:11:46STILL이 Perceiver 병목 구조를 사용하여 학습된 쿼리 벡터의 고정 집합을
00:11:53전체 KV 캐시와 교차 어텐션하여 단 한 번의 순전파로 압축된 키와 값 세트를 생성하는 것입니다.
00:11:59이를 통해 LLM이 실제 컨텍스트처럼 참조할 수 있는 빠르고 미분 가능한 압축 메모리가 생성됩니다.
00:12:05따라서 KV 압축에 관심이 있다면 Charlie와 Mudith의 연구를 꼭 확인해 보세요.
00:12:09정말 흥미로운 분야였습니다. 지금까지 이야기한 기술 중 두 가지,
00:12:16양자화와 캐싱에 대해 말씀드렸고, 마지막 기술은 추측(Speculation)입니다. 이 분야에서도
00:12:21많은 변화가 있었습니다. 복습해 보자면, 추측 디코딩은 초안 토큰을 사용해 순전파 과정에서
00:12:29이를 검증함으로써 한 번의 순전파당 여러 토큰을 생성하는 방식입니다.
00:12:34초당 토큰 수를 높이는 데 큰 도움이 되며 완전 무손실 최적화라는 점에서 매우 훌륭합니다.
00:12:40품질 저하를 전혀 걱정할 필요가 없기 때문이죠. 추측의 역사에 대해 말씀드리자면,
00:12:46추측 디코딩부터 시작했습니다. 책에도 모두 나와 있는데요, SpecDec처럼 같은 계열의 소형 모델을 사용해
00:12:52초안 토큰을 생성하는 방식이었습니다. 하지만 소형 모델은 초안 토큰 생성기로서 훌륭하지는 않았죠.
00:12:58그저 성능 좋은 소형 모델일 뿐이었습니다. 그래서 업계에서는 Medusa처럼 모델에 디코더 헤드를
00:13:04추가하는 새로운 방식을 개발했고, 마침내 Eagle 3가 등장했습니다. 이는
00:13:09같은 계열의 작은 모델 대신, 타깃 모델의 은닉 상태(Hidden States)를 기반으로 10억 개 파라미터 모델을
00:13:15학습시켜 초안 토큰을 생성하게 하는 방식이었습니다. 이 방식은 매우 효과적이었고,
00:13:21작년 2월이나 올해 2월쯤까지만 해도 Eagle 3는 최고 성능의 추측 기법이었습니다.
00:13:27그런데 이제 dFlash가 나왔습니다. dFlash는 훨씬 더 뛰어난데요, 바로 추측을 위한 확산 모델입니다. dFlash는
00:13:36단일 토큰이 아닌 초안 토큰 시퀀스를 생성합니다. 해당 모델은 확산 언어 모델로서,
00:13:43비디오나 이미지 생성이 프레임 시퀀스나 픽셀 시퀀스를 생성하고 반복 개선하는 것과 동일하게
00:13:49전체 토큰 시퀀스를 생성합니다. 자기회귀 방식으로 토큰을 생성하는 대신 말이죠.
00:13:55dFlash 모델은 실행 속도가 2배에서 4배 정도 느릴 수 있지만, 한 윈도우 내에서
00:14:018개 또는 16개의 토큰을 한 번에 예측합니다. Eagle이 한 번에 하나씩만 처리하는 반면 말이죠.
00:14:08따라서 dFlash의 단일 순전파는 Eagle의 전체 초안 단계보다 빠르며 더 많은 토큰을 예측합니다.
00:14:14이 토큰들은 서로 교차 어텐션을 수행하여 전반적으로 더 높은 수용률을 만들어냅니다. 추측에서는
00:14:21수용률이 전부이기 때문이죠. 실제 환경에서 dFlash는 3배 이상의 성능 향상을 보여주고 있습니다.
00:14:30단일 B200 환경의 Qwen3 8B 모델로 측정한 수치인데요, Eagle과 비교했을 때 토큰 수용률과
00:14:40초당 토큰 수 모두에서 상당한 개선을 확인할 수 있습니다. dFlash 모델은 양방향 초안 생성을 위한 어텐션 마스크로
00:14:47학습됩니다. 타깃 모델이 컨텍스트를 제공하고, 각 블록 내에서
00:14:54샘플링된 깨끗한 토큰의 부분집합을 갖게 되며, 어텐션 마스크가 인과적 일관성을
00:14:59강제합니다. 그러나 양방향 어텐션도 여전히 허용하는데,
00:15:06기존 자기회귀 모델에서는 한 방향의 토큰만 확인하기 때문에, 바로 이런 이유로 저희가
00:15:13확산 기반 아키텍처의 장점을 활용할 수 있는 것입니다. 그리고 다 끝났다고 생각했을 때,
00:15:19며칠 전 dSpark가 나왔습니다. dFlash는 이미 프로덕션 환경에서 운영 중이지만
00:15:25dSpark는 새로운 연구 단계입니다. 그래서 이건 신기술이 존재하고 멋지며 검토 중이라는 정도만
00:15:31말씀드릴 수 있습니다. dFlash와의 차이점은 동일한 확산 모델을 사용하면서도 시퀀셜 모델을
00:15:38함께 결합한다는 것입니다. 그 의도는 이 두 모델을 함께 연동시킴으로써 수용률을 높이는 것이며,
00:15:45단순한 반복형 추측기나 확산형 추측기,
00:15:51혹은 자기회귀형 추측기만 사용하는 것과 차별화됩니다. dSpark는 매우 흥미롭지만, 아직
00:15:57공유할 만한 프로덕션 결과는 없습니다. 다음에 기회가 되면 공유해 드리겠습니다.
00:16:03하지만 지속적인 추측기 재학습 분야에서는 프로덕션 결과를 보유하고 있습니다.
00:16:09다시 dFlash 이야기로 돌아왔는데요, 추측 디코딩이 시스템에서 처리하는
00:16:15실제 프롬프트와 응답 내용에 크게 의존한다는 개념입니다. 따라서
00:16:21라이브 시스템의 프롬프트와 응답에 대해 지속적으로 재학습을 진행하면 토큰 수용률이
00:16:2920%에서 최대 2배까지 향상되는 것을 볼 수 있습니다. 이는 구현하기가 매우 까다로운데,
00:16:36대용량 스토리지와 이러한 방식으로 데이터를 처리할 수 있는 권한이 확보되어야 합니다.
00:16:40엄청난 컴퓨팅 자원이 소모되고 이 모든 정보를 이동시켜야 하며, 하위 모델을
00:16:46변경하면 추측기 모델도 함께 변경해야 합니다. 하지만 미래를 내다보았을 때,
00:16:51초대형 시스템을 위한 지속적 추측 기술은 충분히 가치 있는 최적화가 될 것입니다.
00:16:58그렇다면 추론 분야의 다음 행보는 무엇일까요? 다음 내용은 개인적인 의견과 추측,
00:17:06그리고 공개된 정보에 기반하며, 실제로 출시될 내용을 알고 있더라도 여기서 말씀드릴 수는 없습니다.
00:17:11그러니 이는 어디까지나 제 개인적인 전망입니다. 저는 Ampere, Hopper,
00:17:17Blackwell 출시에 이르기까지 세 번의 하드웨어 주기를 겪어왔습니다.
00:17:23칩이 출하되어 데이터 센터에 설치되고 전체 소프트웨어 스택이
00:17:30그 성능을 제대로 활용하기까지는 항상 시간이 걸립니다. 하지만 제가 기대를 걸고 있는 부분은
00:17:36Rubin 아키텍처의 NVFP4 성능이 놀라울 것으로 보인다는 점입니다.
00:17:44따라서 로컬 추론 기술을 잘 차용하고 NVFP4 데이터 형식으로 모델을 실행하는 데
00:17:49신뢰도를 높일수록, 차세대 Rubin 시스템의 뛰어난 성능을 더욱 잘 활용할 수 있게 될 것입니다.
00:17:54또한 분리형(Disaggregation) 구조와 시스템 전반의 통신이 더욱 중요해질 것입니다.
00:18:00PD 분리 구조를 통해 우수한 초기 성과를 얻고 있으며, KV 캐시 데이터와 같은
00:18:05정보를 시스템 내에서 자유롭게 이동시키는 능력이 점점 더 중요해질 것입니다.
00:18:12그리고 말씀드렸듯이 '추론을 위한 학습'이라는 주제는 앞으로도 업계에
00:18:17지속적으로 큰 영향을 미칠 것입니다. 강연에 참석해 주신 여러분께 진심으로 감사드립니다.
00:18:25저는 X(트위터)와 LinkedIn을 운영하고 있으며 무료 도서를 나누어 드리고 있습니다.
00:18:32QR 코드를 통해 PDF를 다운로드하시거나, 저와 함께 Base10 부스로 오셔서 '추론 엔지니어링'
00:18:37무료 책자를 수령하실 수 있습니다. 많이 준비되어 있어 모두에게 충분할 것 같지만, 부족하면 사무실에서 더 가져오겠습니다.
00:18:43그럼 저는 아래층 Base10 부스에 있겠습니다. 참석해 주셔서 정말 감사합니다.
00:18:48좋은 하루 되세요.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video