스크립트
00:00:00자, 시작하겠습니다. 여러분 안녕하십니까. 참석해 주셔서 감사합니다. 오늘 세션은 늦은 오후이자 마지막 날의 마지막 세션입니다. 그래서 정말 감사드립니다.
00:00:25저는 Friendly AI의 창립자이자 CEO인 곤입니다. 오늘 저는 에이전틱 추론(agentic inference)에 대해 이야기하고자 합니다. 먼저 무엇이 변했는지, 왜 이것이 중요한지, 그리고 에이전트를 위해 추론 클라우드를 어떻게 재구축하는지 살펴보겠습니다.
00:00:40더 깊이 들어가기 전에, Friendly AI를 간략히 소개해 드리겠습니다. Friendly AI는 에이전트를 위한 프런티어 AI 추론 클라우드입니다.
00:00:50더모듈러스 규모에서 더 빠르고, 저렴하며, 더 안정적으로 제공합니다. 저희는 서울대학교의 연구팀에서 출발했으며, 그러한 연구 DNA가 여전히 우리의 정체성을 이루고 있습니다.
00:01:02저희는 현재 업계 표준이 된 추론 최적화 기술인 연속 배치(continuous batching)를 발명한 팀이며, 저희의 ORCA 연구는 널리 쓰이는 오픈소스 프레임워크인 vLLM에 영감을 주었습니다.
00:01:15현재 저희는 샌프란시스코에 본사를 두고 서울에 팀을 운영하며 프런티어 추론의 규모를 확장하고 있습니다.
00:01:24아시다시피 2026년은 에이전트가 대규모 프로덕션에 도입되는 해이며, 이는 두 가지 트렌드가 맞물린 결과입니다.
00:01:33첫째, 에이전트의 성장이 기하급수적입니다. AI 에이전트는 소프트웨어, 운영, 지식 노동 전반에서 폭발적인 채택을 이끌어내고 있습니다.
00:01:45둘째, 오픈 웨이트 모델이 프런티어 수준에 도달하여 에이전트를 경제적으로 만들고 있습니다. 이들은 이제 성능 면에서 폐쇄형 프런티어 모델과 필적하며, 이는 훨씬 더 낮은 토큰 비용으로 오픈 모델에서 프런티어 품질의 에이전트를 실행할 수 있음을 의미합니다.
00:02:00오픈 웨이트 모델이 이제 이러한 실제 에이전트 워크플로우에 충분히 강력해졌음을 보여드리겠습니다.
00:02:13여기서 우리는 두 모델에 코딩 에이전트를 사용하여 타워 디펜스 게임을 만드는 정확히 동일한 작업을 부여했습니다.
00:02:19왼쪽은 Friendly AI에서 실행되는 오픈 웨이트 모델인 GLM 5.2이고, 오른쪽은 Anthropic의 Opus 4.8입니다.
00:02:29중요한 점은 결과물이 완전히 똑같다는 것이 아닙니다. 핵심은 두 모델 모두 명확하게 사용 가능한 수준으로 작업을 완료한다는 것입니다.
00:02:38많은 에이전트 워크플로우에서 오픈 웨이트 모델은 품질 임계값을 넘었지만, 경제성은 완전히 다릅니다.
00:02:49동일한 작업에 대해 Opus 4.8은 약 1.50달러가 드는 반면, Friendly AI의 GLM 5.2는 0.27달러가 듭니다. 즉, 5.6배 더 저렴합니다.
00:03:03이것이 바로 앞서 말씀드린 가능성입니다. 오픈 웨이트 모델은 적은 비용으로 프런티어 품질의 에이전트를 제공합니다.
00:03:12하지만 모델 비용은 이야기의 일부분일 뿐입니다. 에이전트를 실제로 빠르고 안정적으로 만들려면 추론 스택 자체 가 바뀌어야 합니다.
00:03:22이제 에이전틱 워크플로우 내에서 실제로 어떤 일이 일어나는지 살펴보겠습니다.
00:03:28먼저 워크플로우의 변화를 살펴보겠습니다. 과거의 주된 사용 형태는 챗이었습니다.
00:03:34기본 단위는 요청이었습니다. 사람이 질문을 하고, 모델이 답변하며, 사람이 그것을 읽는 방식이었죠.
00:03:41지연 시간은 하나의 응답을 얼마나 빨리 받았는지를 의미했습니다. 하지만 에이전트는 다릅니다. 기본 단위는 작업(task)입니다.
00:03:49하나의 작업에는 수많은 모델 호출과 도구 호출이 포함될 수 있으며, 한동안 자율적으로 실행될 수 있습니다.
00:03:58따라서 사용자는 개별 요청 하나의 지연 시간에는 별로 신경 쓰지 않습니다.
00:04:04사용자가 신경 쓰는 것은 전체 작업이 언제 완료되는가입니다.
00:04:08즉, 개별 요청뿐만 아니라 작업 전체를 최적화해야 합니다.
00:04:16에이전틱 워크플로우를 더 자세히 살펴보겠습니다. 에이전트는 실제로 작업들로 구성된 세션을 실행합니다.
00:04:23각 작업은 일반적으로 루프 안에서 실행됩니다. 먼저 계획을 세우며, 이는 보통 LLM 호출을 의미합니다.
00:04:29그런 다음 도구를 호출하는 등의 방식으로 행동합니다. 그다음 결과를 관찰하고 이를 다시 컨텍스트에 추가합니다.
00:04:38그리고 작업이 완료될 때까지 이 과정을 반복합니다.
00:04:41따라서 우리는 LLM 추론과 하나 이상의 비LLM 도구 실행을 끊임없이 번갈아 수행하게 됩니다.
00:04:50그러므로 LLM 호출 사이에는 공백이 존재합니다. 또한 에이전트는 하위 에이전트를 생성하여 병렬로 실행할 수도 있습니다.
00:05:01에이전트 입력 역시 챗과는 매우 다릅니다. 여기 그래프는 우리가 매일 사용하는 GLM 5.2 기반 사내 코딩 에이전트 실행의 프롬프트 및 응답 길이 분포를 보여줍니다.
00:05:15훨씬 더 깁니다. 모든 관찰 결과가 컨텍스트에 다시 추가되기 때문에 작업이 진행됨에 따라 길이가 늘어납니다.
00:05:25여기에는 중요한 패턴이 있습니다. 연속된 에이전트 단계들은 대개 거대한 접두사(prefix)를 공유합니다.
00:05:32매번 똑같은 접두사를 다시 계산한다면, 이미 완료한 작업에 엄청난 연산량을 낭비하고 있는 것입니다.
00:05:40이것이 바로 에이전틱 추론에서 가장 큰 기회 중 하나입니다.
00:05:46그렇다면 에이전트는 얼마나 많은 토큰을 소모할까요?
00:05:49이제 심층 리서치(deep research) 같은 장기 작업의 예를 살펴보겠습니다.
00:05:53우리는 Friendly AI에서 GLM 5.2를 장착한 Kilo Code를 사용하여 vLLM의 세쿼이아 디코딩 프레임워크를 설명했습니다.
00:06:02여러 단계가 존재하며 각 단계는 여러 추론 및 도구 호출을 수행하는 하위 에이전트들로 구성됩니다.
00:06:12따라서 수십 개 또는 수백 개의 추론 단계를 거칠 수 있으며, 때로는 몇 분 혹은 몇 시간 동안 이어지기도 합니다.
00:06:19그리고 공유되는 컨텍스트는 내내 계속해서 커집니다.
00:06:23사용자에게 중요한 것은 단일 토큰이나 하나의 호출이 가진 지연 시간이 아닙니다.
00:06:28중요한 것은 내 작업이 언제 완료되는가입니다.
00:06:35따라서 에이전틱 추론은 단순히 요청이 더 많은 챗이 아닙니다.
00:06:39완전히 다른 문제입니다. 컨텍스트는 시간이 지남에 따라 커집니다.
00:06:43모델 호출 사이사이에 도구 작업이 끼어듭니다.
00:06:46모델 호출 횟수는 입력에 따라 달라집니다.
00:06:49그러므로 고정된 요청 속도 계획을 기준으로 삼을 수는 없습니다.
00:06:55진정한 지표는 단일 요청 지연 시간이 아니라 엔드투엔드 작업 지연 시간입니다.
00:07:02그럼 어떻게 해야 할까요? 그 이면에 있는 핵심 엔지니어링을 보여드리겠습니다.
00:07:23우리가 이를 어떻게 바라보고 있는지 보여주는 엔지니어링 지도입니다.
00:07:27우리는 에이전트 워크플로우를 중심으로 스택을 계층별로 구축했습니다.
00:07:33오늘 다룰 네 가지 주요 축이 있습니다.
00:07:37접두사 캐싱, 키-값(줄여서 KV) 캐시 관리, 캐시 인식 라우팅, 에이전트 인식 최적화입니다.
00:07:48그리고 물론 그 밑바닥에는 긴 컨텍스트를 위한 희소 어텐션(sparse attention) 같은 모델 계층 최적화가 필요하며,
00:07:56에러 감소 기술, 고속 커널, 탄력적 서빙 등이 있습니다.
00:08:02이번 발표에서는 이 네 가지 축에 집중하겠습니다.
00:08:05먼저 접두사 캐싱부터 시작하겠습니다.
00:08:09에이전트 단계들은 큰 접두사를 공유하므로, 해당 접두사의 키-값을 한 번 계산하고 캐시합니다.
00:08:17그 후 후속 단계에서는 캐시된 키-값을 재사용하고 새로운 접미사(suffix)만 처리합니다.
00:08:23캐시에서 읽어오는 것은 프리필(prefill)을 다시 계산하는 것보다 훨씬 저렴하므로,
00:08:27이를 통해 첫 토큰 생성 시간(TTFT)이 개선되고 매 단계의 연산량이 줄어듭니다.
00:08:33그리고 에이전트의 작업이 길어질수록 이 가치는 더욱 커집니다.
00:08:41하지만 캐싱은 KV 캐시가 실제로 수용 가능하고 효율적으로 이동할 수 있을 때만 작동합니다.
00:08:48따라서 강력한 KV 캐시 관리가 필요합니다.
00:08:52우리는 GPU 메모리당 더 많은 활성 컨텍스트를 담기 위해 페이지드 메모리(paged memory) 관리를 사용합니다.
00:08:59메모리 사용량을 줄이기 위해 KV 양자화를 사용합니다.
00:09:04GPU 메모리, 호스트 메모리, 디스크를 아우르는 계층형 캐싱을 활용해 GPU의 한계를 뛰어넘습니다.
00:09:13또한 분산 캐싱을 사용하여 단일 인스턴스 내부뿐만 아니라 여러 복제본 간에도 하나의 접두사를 서빙할 수 있게 합니다.
00:09:26글로벌 클러스터 규모에서는 라우팅이 매우 중요해집니다.
00:09:29단순한 부하 분산기는 요청을 GPU 클러스터 전반에 고르게 분산시킬 수 있지만, 이는 캐시 지역성(locality)을 파괴할 수 있습니다.
00:09:38글로벌 규모의 캐시 인식 라우터는 더 영리한 작업을 수행합니다.
00:09:42올바른 접두사가 이미 캐시된 포드로 요청을 보내, 무거운 프리필을 단 한 번의 캐시 적중으로 바꿉니다.
00:09:51동시에 특정 포드가 핫스팟이 되지 않도록 부하를 균형 있게 조절해야 합니다.
00:09:58이 예시에서 작업 A의 두 요청은 캐시 지역성을 위해 동일한 포드 1로 전달됩니다.
00:10:08다음 요소는 에이전트 인식 최적화입니다.
00:10:11이것이 바로 에이전트 추론의 다음 프런티어입니다.
00:10:16오늘날 대부분의 시스템은 각 LLM 호출을 마치 독립된 것인 마냥 스케줄링합니다.
00:10:21이 호출이 더 긴 에이전트 프로그램의 일부라는 점을 실질적으로 이해하지 못합니다.
00:10:27하지만 최적화기가 에이전트 수준의 컨텍스트를 알고 있다면 더 나은 결정을 내릴 수 있습니다.
00:10:33예를 들어 올바른 작업을 선점(preempting)하거나, 예상되는 다음 단계를 위해 투기적으로 컨텍스트를 미리 프리필하거나, 에이전트 수준의 컨텍스트를 바탕으로 더 나은 캐시 축출 결정을 내릴 수 있습니다.
00:10:48따라서 목표는 단일 호출을 빨라 보이게 만드는 것이 아니라 엔드투엔드 작업 지연 시간을 줄이는 것입니다.
00:10:58이 모든 것을 하나로 모았을 때 얻을 수 있는 결실이 바로 이것입니다.
00:11:01우리는 Kilo Code와 함께 동일한 모델인 GLM 5.2를 사용하여 간단한 모바일 게임을 만들고 있습니다.
00:11:07우리는 Friendly AI의 모델 API와 다른 잘 알려진 추론 제공 업체의 모델 API로 동일한 작업을 실행했습니다.
00:11:14보시다시피 Friendly AI는 에이전트 중심의 클라우드 설계 덕분에 동일한 작업을 훨씬 더 빠르게 엔드투엔드로 완료합니다.
00:11:24그렇다면 실제로는 어떤 변화가 가능할까요?
00:11:29더 강력한 프로덕션 에이전트 스택입니다.
00:11:32여러분이 이미 좋아하시는 에이전트를 가져오세요.
00:11:35이제 Friendly AI에서 서빙되는 GLM 5.2, Minimax, Kimi 같은 오픈 웨이트 프런티어 모델을 연동해 보세요.
00:11:43모델은 프런티어 수준의 성능과 더 나은 경제성을 제공합니다.
00:11:49Friendly AI는 프로덕션에 필요한 속도, 안정성, 엔드투엔드 작업 성능을 제공합니다.
00:11:56품질, 속도, 안정성, 비용의 이러한 조합이야말로 프로덕션 환경에서 에이전트를 실제로 유용하고 경제적으로 만드는 요인입니다.
00:12:06Friendly AI는 현재 AI 네이티브 스타트업부터 글로벌 엔터프라이즈에 이르기까지 프로덕션 환경의 팀들을 지원하고 있습니다.
00:12:15여기서 몇 군데를 강조하고 싶습니다.
00:12:20Kilo는 수백만 명의 사용자를 보유한 엄청나게 인기 있는 에이전틱 AI 코딩 도구입니다.
00:12:27LG는 전자부터 헬스케어, 에너지에 이르기까지 사업 영역이 다양전개된 글로벌 기업입니다.
00:12:35매우 다른 기업들이지만, 모두가 똑같은 것을 필요로 합니다.
00:12:39빠르고, 안정적이며, 비용 효율적인 에이전틱 추론 말입니다.
00:12:45저희 고객인 Kilo의 이 추천사는 모든 것을 말해줍니다.
00:12:50지난 1년 동안 Kilo Code는 오픈 모델과 폐쇄형 모델을 모두 호스팅하는 여러 추론 제공 업체를 테스트했습니다.
00:12:56다른 타사 제공 업체 및 Model Lab G.AI의 직접 사용과 비교하여 GLM 5 사용량을 분할 테스트한 결과,
00:13:05Friendly AI는 일관되게 7배 더 빨랐으며 오류율은 현저히 낮았습니다.
00:13:12오늘날 Friendly AI는 Kilo 스택의 핵심 구성 요소입니다.
00:13:17그리고 여러분은 각자의 스택에 맞는 방식으로 이를 이용할 수 있습니다.
00:13:23모델 API는 시작하기 가장 빠른 방법입니다.
00:13:26서버리스 API를 통한 핵심 프런티어 오픈 웨이트 모델 제공입니다.
00:13:29전용 엔드포인트는 프로덕션 워크로드에 대한 보장된 SLA와 함께 격리된 고유의 배포 환경을 제공합니다.
00:13:36그리고 BYOG(나만의 GPU 가져오기)를 통해 사용자의 인프라에서 Friendly 추론을 실행할 수 있습니다.
00:13:44동일한 스택, 세 가지 배포 방식.
00:13:49마무리하며 기억해야 할 세 가지가 있습니다.
00:13:53첫째, 프런티어 오픈 웨이트 모델은 프로덕션 에이전트를 경제적으로 확장 가능하게 만듭니다.
00:13:59둘째, 에이전트는 코어가 더 많은 챗에 불과한 것이 아닙니다.
00:14:03에이전틱 추론은 제가 언급한 과제들과 함께 엔드투엔드 작업 지연 시간을 최적화해야 합니다.
00:14:10셋째, Friendly AI는 에이전트 세상을 위한 추론 클라우드로 구축되었습니다.
00:14:16빠르고, 안정적이며, 비용 효율적인 에이전틱 추론입니다.
00:14:23제 세션에 참석해 주셔서 감사합니다.
00:14:25만약 에이전트를 구축하고 계신다면 오늘 Friendly AI에서 프런티어 오픈 웨이트 모델을 시도해 보세요.
00:14:30몇 분 만에 Friendly AI를 시작하실 수 있습니다.
00:14:34감사합니다.
00:14:35세션이 끝난 후에도 자리에 남아 있겠습니다.
00:14:37감사합니다.
00:14:38감사합니다.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기