에이전트를 위한 프론티어 AI 인퍼런스 클라우드 — 전병곤 (Gon Chun), 프렌들리AI

AAI Engineer
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00자, 시작하겠습니다. 여러분 안녕하십니까. 참석해 주셔서 감사합니다. 오늘 세션은 늦은 오후이자 마지막 날의 마지막 세션입니다. 그래서 정말 감사드립니다.
00:00:25저는 Friendly AI의 창립자이자 CEO인 곤입니다. 오늘 저는 에이전틱 추론(agentic inference)에 대해 이야기하고자 합니다. 먼저 무엇이 변했는지, 왜 이것이 중요한지, 그리고 에이전트를 위해 추론 클라우드를 어떻게 재구축하는지 살펴보겠습니다.
00:00:40더 깊이 들어가기 전에, Friendly AI를 간략히 소개해 드리겠습니다. Friendly AI는 에이전트를 위한 프런티어 AI 추론 클라우드입니다.
00:00:50더모듈러스 규모에서 더 빠르고, 저렴하며, 더 안정적으로 제공합니다. 저희는 서울대학교의 연구팀에서 출발했으며, 그러한 연구 DNA가 여전히 우리의 정체성을 이루고 있습니다.
00:01:02저희는 현재 업계 표준이 된 추론 최적화 기술인 연속 배치(continuous batching)를 발명한 팀이며, 저희의 ORCA 연구는 널리 쓰이는 오픈소스 프레임워크인 vLLM에 영감을 주었습니다.
00:01:15현재 저희는 샌프란시스코에 본사를 두고 서울에 팀을 운영하며 프런티어 추론의 규모를 확장하고 있습니다.
00:01:24아시다시피 2026년은 에이전트가 대규모 프로덕션에 도입되는 해이며, 이는 두 가지 트렌드가 맞물린 결과입니다.
00:01:33첫째, 에이전트의 성장이 기하급수적입니다. AI 에이전트는 소프트웨어, 운영, 지식 노동 전반에서 폭발적인 채택을 이끌어내고 있습니다.
00:01:45둘째, 오픈 웨이트 모델이 프런티어 수준에 도달하여 에이전트를 경제적으로 만들고 있습니다. 이들은 이제 성능 면에서 폐쇄형 프런티어 모델과 필적하며, 이는 훨씬 더 낮은 토큰 비용으로 오픈 모델에서 프런티어 품질의 에이전트를 실행할 수 있음을 의미합니다.
00:02:00오픈 웨이트 모델이 이제 이러한 실제 에이전트 워크플로우에 충분히 강력해졌음을 보여드리겠습니다.
00:02:13여기서 우리는 두 모델에 코딩 에이전트를 사용하여 타워 디펜스 게임을 만드는 정확히 동일한 작업을 부여했습니다.
00:02:19왼쪽은 Friendly AI에서 실행되는 오픈 웨이트 모델인 GLM 5.2이고, 오른쪽은 Anthropic의 Opus 4.8입니다.
00:02:29중요한 점은 결과물이 완전히 똑같다는 것이 아닙니다. 핵심은 두 모델 모두 명확하게 사용 가능한 수준으로 작업을 완료한다는 것입니다.
00:02:38많은 에이전트 워크플로우에서 오픈 웨이트 모델은 품질 임계값을 넘었지만, 경제성은 완전히 다릅니다.
00:02:49동일한 작업에 대해 Opus 4.8은 약 1.50달러가 드는 반면, Friendly AI의 GLM 5.2는 0.27달러가 듭니다. 즉, 5.6배 더 저렴합니다.
00:03:03이것이 바로 앞서 말씀드린 가능성입니다. 오픈 웨이트 모델은 적은 비용으로 프런티어 품질의 에이전트를 제공합니다.
00:03:12하지만 모델 비용은 이야기의 일부분일 뿐입니다. 에이전트를 실제로 빠르고 안정적으로 만들려면 추론 스택 자체 가 바뀌어야 합니다.
00:03:22이제 에이전틱 워크플로우 내에서 실제로 어떤 일이 일어나는지 살펴보겠습니다.
00:03:28먼저 워크플로우의 변화를 살펴보겠습니다. 과거의 주된 사용 형태는 챗이었습니다.
00:03:34기본 단위는 요청이었습니다. 사람이 질문을 하고, 모델이 답변하며, 사람이 그것을 읽는 방식이었죠.
00:03:41지연 시간은 하나의 응답을 얼마나 빨리 받았는지를 의미했습니다. 하지만 에이전트는 다릅니다. 기본 단위는 작업(task)입니다.
00:03:49하나의 작업에는 수많은 모델 호출과 도구 호출이 포함될 수 있으며, 한동안 자율적으로 실행될 수 있습니다.
00:03:58따라서 사용자는 개별 요청 하나의 지연 시간에는 별로 신경 쓰지 않습니다.
00:04:04사용자가 신경 쓰는 것은 전체 작업이 언제 완료되는가입니다.
00:04:08즉, 개별 요청뿐만 아니라 작업 전체를 최적화해야 합니다.
00:04:16에이전틱 워크플로우를 더 자세히 살펴보겠습니다. 에이전트는 실제로 작업들로 구성된 세션을 실행합니다.
00:04:23각 작업은 일반적으로 루프 안에서 실행됩니다. 먼저 계획을 세우며, 이는 보통 LLM 호출을 의미합니다.
00:04:29그런 다음 도구를 호출하는 등의 방식으로 행동합니다. 그다음 결과를 관찰하고 이를 다시 컨텍스트에 추가합니다.
00:04:38그리고 작업이 완료될 때까지 이 과정을 반복합니다.
00:04:41따라서 우리는 LLM 추론과 하나 이상의 비LLM 도구 실행을 끊임없이 번갈아 수행하게 됩니다.
00:04:50그러므로 LLM 호출 사이에는 공백이 존재합니다. 또한 에이전트는 하위 에이전트를 생성하여 병렬로 실행할 수도 있습니다.
00:05:01에이전트 입력 역시 챗과는 매우 다릅니다. 여기 그래프는 우리가 매일 사용하는 GLM 5.2 기반 사내 코딩 에이전트 실행의 프롬프트 및 응답 길이 분포를 보여줍니다.
00:05:15훨씬 더 깁니다. 모든 관찰 결과가 컨텍스트에 다시 추가되기 때문에 작업이 진행됨에 따라 길이가 늘어납니다.
00:05:25여기에는 중요한 패턴이 있습니다. 연속된 에이전트 단계들은 대개 거대한 접두사(prefix)를 공유합니다.
00:05:32매번 똑같은 접두사를 다시 계산한다면, 이미 완료한 작업에 엄청난 연산량을 낭비하고 있는 것입니다.
00:05:40이것이 바로 에이전틱 추론에서 가장 큰 기회 중 하나입니다.
00:05:46그렇다면 에이전트는 얼마나 많은 토큰을 소모할까요?
00:05:49이제 심층 리서치(deep research) 같은 장기 작업의 예를 살펴보겠습니다.
00:05:53우리는 Friendly AI에서 GLM 5.2를 장착한 Kilo Code를 사용하여 vLLM의 세쿼이아 디코딩 프레임워크를 설명했습니다.
00:06:02여러 단계가 존재하며 각 단계는 여러 추론 및 도구 호출을 수행하는 하위 에이전트들로 구성됩니다.
00:06:12따라서 수십 개 또는 수백 개의 추론 단계를 거칠 수 있으며, 때로는 몇 분 혹은 몇 시간 동안 이어지기도 합니다.
00:06:19그리고 공유되는 컨텍스트는 내내 계속해서 커집니다.
00:06:23사용자에게 중요한 것은 단일 토큰이나 하나의 호출이 가진 지연 시간이 아닙니다.
00:06:28중요한 것은 내 작업이 언제 완료되는가입니다.
00:06:35따라서 에이전틱 추론은 단순히 요청이 더 많은 챗이 아닙니다.
00:06:39완전히 다른 문제입니다. 컨텍스트는 시간이 지남에 따라 커집니다.
00:06:43모델 호출 사이사이에 도구 작업이 끼어듭니다.
00:06:46모델 호출 횟수는 입력에 따라 달라집니다.
00:06:49그러므로 고정된 요청 속도 계획을 기준으로 삼을 수는 없습니다.
00:06:55진정한 지표는 단일 요청 지연 시간이 아니라 엔드투엔드 작업 지연 시간입니다.
00:07:02그럼 어떻게 해야 할까요? 그 이면에 있는 핵심 엔지니어링을 보여드리겠습니다.
00:07:23우리가 이를 어떻게 바라보고 있는지 보여주는 엔지니어링 지도입니다.
00:07:27우리는 에이전트 워크플로우를 중심으로 스택을 계층별로 구축했습니다.
00:07:33오늘 다룰 네 가지 주요 축이 있습니다.
00:07:37접두사 캐싱, 키-값(줄여서 KV) 캐시 관리, 캐시 인식 라우팅, 에이전트 인식 최적화입니다.
00:07:48그리고 물론 그 밑바닥에는 긴 컨텍스트를 위한 희소 어텐션(sparse attention) 같은 모델 계층 최적화가 필요하며,
00:07:56에러 감소 기술, 고속 커널, 탄력적 서빙 등이 있습니다.
00:08:02이번 발표에서는 이 네 가지 축에 집중하겠습니다.
00:08:05먼저 접두사 캐싱부터 시작하겠습니다.
00:08:09에이전트 단계들은 큰 접두사를 공유하므로, 해당 접두사의 키-값을 한 번 계산하고 캐시합니다.
00:08:17그 후 후속 단계에서는 캐시된 키-값을 재사용하고 새로운 접미사(suffix)만 처리합니다.
00:08:23캐시에서 읽어오는 것은 프리필(prefill)을 다시 계산하는 것보다 훨씬 저렴하므로,
00:08:27이를 통해 첫 토큰 생성 시간(TTFT)이 개선되고 매 단계의 연산량이 줄어듭니다.
00:08:33그리고 에이전트의 작업이 길어질수록 이 가치는 더욱 커집니다.
00:08:41하지만 캐싱은 KV 캐시가 실제로 수용 가능하고 효율적으로 이동할 수 있을 때만 작동합니다.
00:08:48따라서 강력한 KV 캐시 관리가 필요합니다.
00:08:52우리는 GPU 메모리당 더 많은 활성 컨텍스트를 담기 위해 페이지드 메모리(paged memory) 관리를 사용합니다.
00:08:59메모리 사용량을 줄이기 위해 KV 양자화를 사용합니다.
00:09:04GPU 메모리, 호스트 메모리, 디스크를 아우르는 계층형 캐싱을 활용해 GPU의 한계를 뛰어넘습니다.
00:09:13또한 분산 캐싱을 사용하여 단일 인스턴스 내부뿐만 아니라 여러 복제본 간에도 하나의 접두사를 서빙할 수 있게 합니다.
00:09:26글로벌 클러스터 규모에서는 라우팅이 매우 중요해집니다.
00:09:29단순한 부하 분산기는 요청을 GPU 클러스터 전반에 고르게 분산시킬 수 있지만, 이는 캐시 지역성(locality)을 파괴할 수 있습니다.
00:09:38글로벌 규모의 캐시 인식 라우터는 더 영리한 작업을 수행합니다.
00:09:42올바른 접두사가 이미 캐시된 포드로 요청을 보내, 무거운 프리필을 단 한 번의 캐시 적중으로 바꿉니다.
00:09:51동시에 특정 포드가 핫스팟이 되지 않도록 부하를 균형 있게 조절해야 합니다.
00:09:58이 예시에서 작업 A의 두 요청은 캐시 지역성을 위해 동일한 포드 1로 전달됩니다.
00:10:08다음 요소는 에이전트 인식 최적화입니다.
00:10:11이것이 바로 에이전트 추론의 다음 프런티어입니다.
00:10:16오늘날 대부분의 시스템은 각 LLM 호출을 마치 독립된 것인 마냥 스케줄링합니다.
00:10:21이 호출이 더 긴 에이전트 프로그램의 일부라는 점을 실질적으로 이해하지 못합니다.
00:10:27하지만 최적화기가 에이전트 수준의 컨텍스트를 알고 있다면 더 나은 결정을 내릴 수 있습니다.
00:10:33예를 들어 올바른 작업을 선점(preempting)하거나, 예상되는 다음 단계를 위해 투기적으로 컨텍스트를 미리 프리필하거나, 에이전트 수준의 컨텍스트를 바탕으로 더 나은 캐시 축출 결정을 내릴 수 있습니다.
00:10:48따라서 목표는 단일 호출을 빨라 보이게 만드는 것이 아니라 엔드투엔드 작업 지연 시간을 줄이는 것입니다.
00:10:58이 모든 것을 하나로 모았을 때 얻을 수 있는 결실이 바로 이것입니다.
00:11:01우리는 Kilo Code와 함께 동일한 모델인 GLM 5.2를 사용하여 간단한 모바일 게임을 만들고 있습니다.
00:11:07우리는 Friendly AI의 모델 API와 다른 잘 알려진 추론 제공 업체의 모델 API로 동일한 작업을 실행했습니다.
00:11:14보시다시피 Friendly AI는 에이전트 중심의 클라우드 설계 덕분에 동일한 작업을 훨씬 더 빠르게 엔드투엔드로 완료합니다.
00:11:24그렇다면 실제로는 어떤 변화가 가능할까요?
00:11:29더 강력한 프로덕션 에이전트 스택입니다.
00:11:32여러분이 이미 좋아하시는 에이전트를 가져오세요.
00:11:35이제 Friendly AI에서 서빙되는 GLM 5.2, Minimax, Kimi 같은 오픈 웨이트 프런티어 모델을 연동해 보세요.
00:11:43모델은 프런티어 수준의 성능과 더 나은 경제성을 제공합니다.
00:11:49Friendly AI는 프로덕션에 필요한 속도, 안정성, 엔드투엔드 작업 성능을 제공합니다.
00:11:56품질, 속도, 안정성, 비용의 이러한 조합이야말로 프로덕션 환경에서 에이전트를 실제로 유용하고 경제적으로 만드는 요인입니다.
00:12:06Friendly AI는 현재 AI 네이티브 스타트업부터 글로벌 엔터프라이즈에 이르기까지 프로덕션 환경의 팀들을 지원하고 있습니다.
00:12:15여기서 몇 군데를 강조하고 싶습니다.
00:12:20Kilo는 수백만 명의 사용자를 보유한 엄청나게 인기 있는 에이전틱 AI 코딩 도구입니다.
00:12:27LG는 전자부터 헬스케어, 에너지에 이르기까지 사업 영역이 다양전개된 글로벌 기업입니다.
00:12:35매우 다른 기업들이지만, 모두가 똑같은 것을 필요로 합니다.
00:12:39빠르고, 안정적이며, 비용 효율적인 에이전틱 추론 말입니다.
00:12:45저희 고객인 Kilo의 이 추천사는 모든 것을 말해줍니다.
00:12:50지난 1년 동안 Kilo Code는 오픈 모델과 폐쇄형 모델을 모두 호스팅하는 여러 추론 제공 업체를 테스트했습니다.
00:12:56다른 타사 제공 업체 및 Model Lab G.AI의 직접 사용과 비교하여 GLM 5 사용량을 분할 테스트한 결과,
00:13:05Friendly AI는 일관되게 7배 더 빨랐으며 오류율은 현저히 낮았습니다.
00:13:12오늘날 Friendly AI는 Kilo 스택의 핵심 구성 요소입니다.
00:13:17그리고 여러분은 각자의 스택에 맞는 방식으로 이를 이용할 수 있습니다.
00:13:23모델 API는 시작하기 가장 빠른 방법입니다.
00:13:26서버리스 API를 통한 핵심 프런티어 오픈 웨이트 모델 제공입니다.
00:13:29전용 엔드포인트는 프로덕션 워크로드에 대한 보장된 SLA와 함께 격리된 고유의 배포 환경을 제공합니다.
00:13:36그리고 BYOG(나만의 GPU 가져오기)를 통해 사용자의 인프라에서 Friendly 추론을 실행할 수 있습니다.
00:13:44동일한 스택, 세 가지 배포 방식.
00:13:49마무리하며 기억해야 할 세 가지가 있습니다.
00:13:53첫째, 프런티어 오픈 웨이트 모델은 프로덕션 에이전트를 경제적으로 확장 가능하게 만듭니다.
00:13:59둘째, 에이전트는 코어가 더 많은 챗에 불과한 것이 아닙니다.
00:14:03에이전틱 추론은 제가 언급한 과제들과 함께 엔드투엔드 작업 지연 시간을 최적화해야 합니다.
00:14:10셋째, Friendly AI는 에이전트 세상을 위한 추론 클라우드로 구축되었습니다.
00:14:16빠르고, 안정적이며, 비용 효율적인 에이전틱 추론입니다.
00:14:23제 세션에 참석해 주셔서 감사합니다.
00:14:25만약 에이전트를 구축하고 계신다면 오늘 Friendly AI에서 프런티어 오픈 웨이트 모델을 시도해 보세요.
00:14:30몇 분 만에 Friendly AI를 시작하실 수 있습니다.
00:14:34감사합니다.
00:14:35세션이 끝난 후에도 자리에 남아 있겠습니다.
00:14:37감사합니다.
00:14:38감사합니다.

Key Takeaway

에이전트 워크플로우에 최적화된 프런티어 AI 추론 클라우드는 접두사 캐싱과 전용 엔드포인트 설계를 통해 오픈 웨이트 모델의 비용 효율성과 속도를 극대화한다.

Highlights

  • Friendly AI의 GLM 5.2는 Anthropic의 Opus 4.8과 동일한 코딩 작업을 5.6배 더 저렴하게 수행한다.

  • 연속 배치 기술인 연속 배치는 vLLM 프레임워크에 영감을 주었으며 현재 업계 표준으로 쓰인다.

  • 에이전트 워크플로우는 개별 요청의 지연 시간이 아니라 전체 작업이 완료되는 시간을 기준으로 최적화되어야 한다.

  • 접두사 캐싱과 페이지드 메모리 관리는 불필요한 프리필 연산을 줄이고 첫 토큰 생성 시간을 단속한다.

  • Kilo Code를 통한 실사용 테스트에서 Friendly AI는 다른 타사 제공 업체보다 일관되게 7배 더 빠른 속도와 낮은 오류율을 기록했다.

Timeline

에이전틱 추론의 패러다임 전환과 오픈 웨이트 모델의 경제성

  • 2026년은 오픈 웨이트 모델이 프런티어 수준에 도달하여 에이전트를 대규모 프로덕션에 경제적으로 도입하는 해이다.
  • 오픈 웨이트 모델인 GLM 5.2는 유료 폐쇄형 프런티어 모델과 필적하는 성능을 훨씬 낮은 토큰 비용으로 제공한다.
  • 타워 디펜스 게임 제작 코딩 테스트에서 Friendly AI의 GLM 5.2는 Opus 4.8과 동일한 결과를 5.6배 낮은 비용으로 완성했다.

Friendly AI는 서울대학교 연구팀의 연구 DNA를 바탕으로 연속 배치와 같은 추론 최적화 기술을 발전시켜 왔다. 현재 소프트웨어와 지식 노동 전반에서 AI 에이전트의 채택이 기하급수적으로 늘고 있다. 오픈 웨이트 모델이 실제 에이전트 워크플로우를 충분히 소화할 만큼 강력해지면서 성능 저하 없이 비용 부담을 대폭 낮출 수 있는 환경이 조성되었다.

챗과 구별되는 에이전틱 워크플로우의 고유한 특성

  • 에이전트의 기본 실행 단위는 단일 질문이 아니라 수많은 모델 호출과 도구 호출을 포함하는 작업이다.
  • 에이전트 실행 과정에서는 지속적인 컨텍스트 누적과 하위 에이전트 생성으로 인해 거대한 접두사가 반복 공유된다.
  • 단일 요청의 지연 시간보다 엔드투엔드 작업 지연 시간을 줄이는 것이 핵심 지표이다.

과거의 챗 형태는 사람이 질문하고 모델이 답변하는 단일 요청 중심이었지만, 에이전트는 루프 안에서 계획 수립, 도구 호출, 결과 관찰을 반복한다. 작업이 진행될수록 컨텍스트 길이가 길어지기 때문에 매번 동일한 접두사를 다시 계산하는 것은 방대한 연산량 낭비로 이어진다. 따라서 고정된 요청 속도 계획 대신 전체 작업의 흐름을 고려한 구조적 접근이 요구된다.

에이전트 중심 추론 클라우드의 4대 엔지니어링 축

  • 접두사 캐싱은 공유되는 접두사의 키-값을 한 번만 계산하고 후속 단계에서 재사용하여 첫 토큰 생성 시간을 개선한다.
  • 페이지드 메모리와 KV 양자화를 포함한 강력한 KV 캐시 관리가 GPU 메모리당 더 많은 활성 컨텍스트를 수용한다.
  • 글로벌 캐시 인식 라우터는 캐시 지역성을 유지하면서도 핫스팟 발생을 막기 위해 요청을 적절한 포드로 분산한다.

Friendly AI는 에이전트 워크플로우에 맞춰 접두사 캐싱, KV 캐시 관리, 캐시 인식 라우팅, 에이전트 인식 최적화라는 네 가지 축으로 스택을 구축했다. 시스템이 에이전트 수준의 컨텍스트를 인지하면 올바른 작업을 선점하거나 컨텍스트를 미리 프리필하는 등의 선제적 최적화가 가능하다. 이러한 아키텍처 설계는 개별 호출을 넘어선 전체 작업 속도의 극적 향상을 이끌어낸다.

프로덕션 환경에서의 성능 검증과 배포 방식

  • Friendly AI는 코딩 도구 Kilo와 글로벌 기업 LG 등 다양한 프로덕션 환경의 실무 팀들을 지원하고 있다.
  • 실사용 분할 테스트 결과 Friendly AI는 다른 타사 제공 업체보다 일관되게 7배 더 빠른 속도와 낮은 오류율을 기록했다.
  • 사용자는 모델 API, 전용 엔드포인트, BYOG 등 세 가지 방식을 통해 자신의 스택에 맞는 배포를 선택할 수 있다.

품질, 속도, 안정성, 비용의 조합은 에이전트를 실제 프로덕션에서 유용하게 만드는 결정적 요인이다. 수백만 명의 사용자를 보유한 코딩 도구 Kilo와의 통합 테스트에서 입증되었듯 에이전트 중심 클라우드는 명확한 성능 우위를 제공한다. 모델 API를 통한 빠른 시작부터 SLA가 보장되는 전용 엔드포인트와 인프라 직접 연동까지 유연한 확장 경로를 지원한다.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video