Hermes 에이전트 설정 비용을 80% 절감하는 20가지 이상의 설정

AAI LABS
컴퓨터/소프트웨어경영/리더십AI/미래기술

스크립트

00:00:00Hermes를 처음 사용하기 시작한 이후로 우리는 수많은 워크플로우를 구축해 왔고,
00:00:04오랫동안 OpenAI 구독을 통해 모든 작업을 GPT 모델로 실행했습니다. 처음에는 잘 작동했죠.
00:00:09하지만 우리 팀 전체가 Hermes를 사용하면서 각자 자신만의 플로우를 설정했고,
00:00:14이렇게 많은 사람이 동시에 사용하다 보니 사용량 제한에 계속 걸렸습니다. 작업이 그냥 멈춰버리곤 했죠.
00:00:18그래서 OpenRouter로 옮겼습니다. 제한 문제는 해결되었지만, 새로운 문제가 생겼죠.
00:00:24OpenRouter는 토큰마다 요금을 부과해서, 처음으로 Hermes 비용이 정확히 얼마인지
00:00:29알 수 있게 되었습니다. 예상보다 훨씬 높은 금액이었고, 이상한 점은
00:00:34대부분 우리가 실제로 사용해서 발생한 게 아니라는 겁니다. 사람들이 잘못 설정해 둔
00:00:39작업들에서 대부분 발생하고 있었죠. 그래서 비용을 줄이기로 했지만 출력 품질을 타협할 생각은 없었습니다.
00:00:44모든 설정을 검토하여 Hermes의 성능을 떨어뜨리지 않으면서 비용을 절감하는 설정을 찾았습니다.
00:00:49여기가 처음이시라면 말씀드리자면, 저희는 소프트웨어 회사이고 이곳은 저희 채널 AI Labs입니다.
00:00:54저희가 프로세스를 최적화한 것처럼 여러분의 프로세스를 AI로 최적화하는 방법을 알려드립니다.
00:00:59이번 영상에서는 우리가 변경한 모든 설정과 그것이 어떻게 워크플로우를 바꿨는지,
00:01:03그리고 실제로 얼마나 절약했는지 알아보겠습니다. Hermes 비용을 절감하기 전에,
00:01:08무엇이 토큰을 소비하고 있는지 먼저 알아야 합니다. Hermes 비용은 토큰 사용량에 따라 결정됩니다.
00:01:12토큰은 기본적으로 모델이 읽고 쓰는 단어의 구성 요소입니다. 모든 모델은
00:01:17입력한 토큰과 받는 토큰을 기반으로 구축됩니다. 하지만 입력은 단순히 프롬프트만이 아닙니다.
00:01:22시스템 프롬프트와 지금까지의 대화 전체, 그리고 매 메시지마다 함께 전송되는
00:01:27몇 가지 다른 요소들도 포함됩니다. 여기에는 추가한 각 스킬의 헤더가 포함되는데,
00:01:31이는 항상 로드되는 이름과 설명이며, 설정해 둔 MCP 도구와 메모리,
00:01:36사용자 파일도 포함됩니다. 이 모든 것이 입력 토큰을 늘리며 스킬이 그중 큰 부분을 차지합니다.
00:01:41Hermes는 90개의 스킬이 사전 설치되어 있으며, 이 숫자는 사용할수록 계속 늘어납니다.
00:01:46재사용할 가치가 있는 워크플로우를 새로운 스킬로 만들기 때문이죠. 그래서 각각의 스킬이
00:01:51메시지당 비용을 추가합니다. 스킬 헤더뿐만이 아닙니다. Hermes는 대화를 스캔하여
00:01:56새로운 스킬을 만들 기회를 찾는데, 이것도 토큰을 소비합니다. Hermes는 스스로 진화하는 메모리도 가지고 있습니다.
00:02:03끊임없이 대화를 검토하여 사용자에 대한 구체적인 세부 정보를 추출하고 메모리에 작성합니다.
00:02:07사용자에 대한 맥락을 유지하고 향후 답변을 맞춤 설정하기 위해 스스로 메모리를 업데이트합니다.
00:02:13이 모든 것은 공짜가 아닙니다. 진화하는 스킬과 자동 업데이트되는 메모리 모두 여러분이
00:02:19비용을 지불해야 하는 토큰을 소비하고 있기 때문이죠. 또 다른 큰 요인은 Hermes가 24시간 내내 실행된다는 것입니다.
00:02:25Cloud Code에서 하는 것처럼 한 번 시작하고 실행하는 에이전트가 아닙니다.
00:02:30이미 우리 팀을 위해 설정한 것과 같은 로컬 서버나, 팀원들이 접속할 수 있도록
00:02:35직접 대여해서 실행하는 VPS에서 운영할 수 있죠. Hermes는 항상 켜져 있으므로,
00:02:40백그라운드에서 많은 작업이 실행됩니다. 관리하지 않으면 사용량이 증가하는 주범이죠.
00:02:45단일 작업 실행은 저렴하지만, 계속 반복되거나 비슷한 작업을 많이 설정해 두면
00:02:50비용이 쌓입니다. 게다가 설정한 MCP 도구와 훅도 컨텍스트 창에 로드되므로 토큰을 많이 소비합니다.
00:02:56Hermes에서 목표를 실행하는 것 또한 비용이 듭니다. 다행히 Hermes는 이 모든 것을 추적할 방법을 제공합니다.
00:03:01루트 폴더의 데이터베이스에 모든 토큰 사용 데이터를 저장합니다.
00:03:07작업 중인 모든 에이전트에게 데이터베이스를 검토하여 자세한 분석 내역을 보여달라고 요청할 수 있습니다.
00:03:13에이전트는 Hermes를 처음 설치했을 때부터 지금까지의 데이터베이스 전체를 거슬러 올라갈 수 있습니다.
00:03:17거기서 몇 개의 세션을 실행했는지, 토큰을 얼마나 사용했는지,
00:03:22비용이 얼마나 들었는지 알려줍니다. 사용 내역을 상세하게 보여주므로,
00:03:27Claude와 함께 앉아서 예산을 더 잘 관리하는 방법을 찾을 수 있습니다. Hermes에는
00:03:31거의 동일한 기능을 하는 insights 명령어도 있습니다. 지난 30일간의 비용 내역을 보여주고,
00:03:36어떤 부분이 토큰을 사용했는지, 어떤 도구와 스킬을 가장 많이 사용했는지 알려줍니다.
00:03:42활동 패턴과 가장 긴 세션까지도 보여주죠. 이제 무엇이 토큰을 소비하는지 알았으니,
00:03:47가장 큰 원인인 모델 자체부터 시작해 봅시다. Hermes에 연결한 모델이
00:03:52청구액의 대부분을 차지합니다. Hermes는 연결할 수 있는 많은 모델을 제공하므로,
00:03:56저희가 가진 코드 구독처럼 이미 구독 중인 모델이 있다면, Hermes를 바로 실행할 수 있습니다.
00:04:01설정이 끝나면 이미 지불 중인 구독료 외에 추가 비용 없이 바로 사용할 수 있죠.
00:04:06Anthropic이나 Gemini 구독으로도 똑같이 하고 싶을 수 있지만, Hermes가
00:04:11사용 가능하다고 나열하더라도 사실은 그렇지 않습니다. Claude code를 직접 사용할 수 없습니다.
00:04:16별도의 API가 필요합니다. 둘 다 이런 식으로 구독을 사용하는 것을 정책 위반으로 간주하기 때문입니다.
00:04:21그래서 현재로서는 코드 구독이 최선의 선택입니다. 저희는 처음에 OpenAI
00:04:26구독으로 시작했지만, 결국 OpenRouter로 전환했습니다. 하나의 API 키로
00:04:30더 많은 모델에 접근할 수 있게 해주고 회사 전체에서 사용하기에 가장 좋았기 때문입니다.
00:04:36저희처럼 OpenRouter를 사용하신다면 Pareto 라우터를 사용하여 비용을 절감할 수 있습니다.
00:04:41작업에 실제로 필요한 것이 무엇인지 살펴보고 작업에 적합한 모델로 라우팅해 줍니다.
00:04:46저렴하고 기본적인 것부터 비싸고 강력한 것까지 13개의 모델이 티어별로 나뉘어 있습니다.
00:04:51제공업체 외에도 config.yaml 파일에서 토큰을 절약하는 데 도움이 되는 설정들이 있습니다.
00:04:57Hermes는 많은 백그라운드 작업을 실행하는데, 기본적으로
00:05:02이에 대한 모델은 auto로 설정되어 있습니다. 즉, 작은 작업에도 메인 모델로 폴백된다는 뜻이죠.
00:05:07이런 것들을 보조 작업이라 부르는데, 기본적으로 Hermes가 실행하는 작은 백그라운드 작업들이며
00:05:11메인 모델이 구축된 무거운 추론은 필요하지 않습니다. 이미지 읽기, 스킬 검색,
00:05:17MCP 도구 로드, 프로필 설명 작성 등은 더 가벼운 모델에서도 잘 작동합니다.
00:05:21따라서 그 작업들을 더 저렴한 모델로 지정하면 메인 모델이 단순한 작업에 비싼 토큰을 쓰지 않게 됩니다.
00:05:26같은 아이디어가 이전에 다루었던 하위 에이전트에도 적용됩니다. Hermes는 여러 하위 에이전트를
00:05:32생성하고 작업을 넘길 수 있습니다. 각각은 고유한 컨텍스트 창에서 실행되고
00:05:38자체적으로 작업합니다. 하지만 이것은 토큰 소모가 큽니다. 하위 에이전트마다 결과를
00:05:43보고하는 독자적인 세션이기 때문에 비용이 빠르게 합산됩니다. 그래서 하위 에이전트에
00:05:48더 저렴한 모델을 설정하면 하위 에이전트가 생성될 때마다 비용을 절약할 수 있습니다.
00:05:53어떤 모델을 사용하든 조정할 가치가 있는 것이 하나 더 있는데, 바로 노력 수준입니다.
00:05:58기본적으로 모델이 답변하기 전에 얼마나 깊게 생각하는지를 결정합니다. 최대로 올리면
00:06:03더 나은 결과물을 얻을 수 있지만, 더 많은 토큰을 소모하게 되어 비용이 더 많이 발생합니다.
00:06:08그러니 작업에 맞춰 노력 수준을 조정해야 합니다. 추론이 별로 필요 없는 간단한 작업일 때는
00:06:13사고 기능을 완전히 꺼버릴 수 있습니다. 하지만 넘어가기 전에, 스폰서인 Luma의 말씀을 들어보시죠.
00:06:19창의적인 일을 한다면 진짜 병목 현상은 아이디어가 아닙니다. 한 프로젝트에 8개의 AI 도구를
00:06:24저글링하며 도구 관리하느라 하루의 절반을 날려버리는 것이죠. Luma는 에이전트 AI로 이것을 해결합니다.
00:06:30일반 AI는 단순히 보조만 하지만, Luma의 에이전트는 실제로 여러분과 함께 창작하며,
00:06:35단순히 픽셀이 아니라 사물이 공간에서 어떻게 움직이고 행동하며 존재하는지 물리적 세계를 이해합니다.
00:06:40여러분이 취향과 방향을 제시하면, 에이전트가 그 내부의 모든 것을 조율하여,
00:06:45프로젝트 전반에 걸쳐 맥락을 유지하고 각 단계에 적합한 모델을 불러옵니다.
00:06:51첫 아이디어부터 최종 컷까지 에이전트가 전체 프로젝트를 계속 움직이게 하며,
00:06:56단 한 번의 프롬프트와 결과물로 끝나지 않습니다. 턴마다 에이전트와 함께 작업의 방향을 잡고,
00:07:02다듬어가면서 10배 더 많은 아이디어를 탐색할 수 있습니다.
00:07:0710배의 작업량 없이도 흩어진 10개의 탭 대신 최고의 모델들을 한곳에서 사용할 수 있죠. Luma와 함께 창작하세요.
00:07:12아래 링크에서 조기 액세스를 받거나 화면의 QR을 스캔하세요. 하지만 모델만이
00:07:16토큰을 낭비하는 것은 아닙니다. 컨텍스트 창도 마찬가지입니다. Hermes 에이전트는
00:07:21전체 도구 및 스킬 세트와 함께 제공되며, 보내는 모든 메시지는 지금까지 구축해 온
00:07:26전체 대화 기록을 함께 운반합니다. 대화가 길어질수록 턴마다 보내야 할 기록이 많아지고,
00:07:31컨텍스트 창이 빠르게 계속 커지기 때문에 자주 압축하는 것이 좋은 습관입니다.
00:07:37그렇게 하면 지금까지 일어난 모든 일의 요약을 기반으로 새로운 세션을 시작합니다.
00:07:42토큰을 많이 절약할 수 있고, 모델은 대화의 맥락을 훨씬 더 간결한 형태로 계속 유지합니다.
00:07:47기본적으로 압축 임계값은 50%로 설정되어 있는데, 이는 Hermes가
00:07:52컨텍스트 창이 절반 채워지면 대화를 압축한다는 뜻입니다. 이 값을 조정할 수 있으며,
00:07:58대부분의 경우 더 낮게 유지하는 것이 좋습니다. 그렇게 하면 각 턴마다
00:08:03전송해야 하는 메시지 수가 줄어들어 컨텍스트 사용을 효율적으로 유지하고 모든 메시지의 비용을 낮출 수 있습니다.
00:08:08압축 후 Hermes는 토큰의 일부를 압축되지 않은 상태로 남겨 추가하는데, 이것이 타겟 비율입니다.
00:08:13더 낮은 퍼센트로 설정하면 이전 대화가 컨텍스트 창으로 넘어오는 양이 줄어들어
00:08:18각 턴마다 전송되는 메시지가 적어집니다. 각 도구 결과가 컨텍스트에 얼마나 들어갈지도
00:08:23제어할 수 있습니다. OpenAI 구독을 사용했을 때는 이전 영상에서 다뤘던 것처럼
00:08:28도구 출력이 잘려 나갈 때 Hermes가 세부 사항을 놓치지 않도록 그 값을 높게 설정했습니다.
00:08:34하지만 OpenRouter로 이동한 후에는 비용을 더 면밀히 살펴야 했기에 값을 다시 낮췄습니다.
00:08:39단일 세션에만 필요한 일회성 지침이 있다면 Hermes 컨텍스트 파일에 작성하지 마세요.
00:08:44대신, 그 세션에만 추가되고 아무것도 남지 않는 일시적인 시스템 프롬프트를 사용할 수 있습니다.
00:08:49그렇게 하면 컨텍스트 파일의 공간을 낭비하지 않고도 지침을 사용할 수 있죠.
00:08:54이전에 보여드린 것처럼 제2의 뇌와 같은 로컬 시스템을 실행 중이라면 정보를 제대로 정리하고 싶을 겁니다.
00:08:59그래야 에이전트가 필요하지 않은 추가 토큰을 끌어오는 대신 필요할 때마다 조금씩 로드할 수 있으니까요.
00:09:05직접 만든 파일 외에도 Hermes가 의존하는 메모리 파일이나 에이전트 파일처럼
00:09:10Hermes가 의존하는 파일들을 다듬을 수도 있습니다. 이 파일들은 항상 컨텍스트 창에 머물러 있으므로,
00:09:14작을수록 모든 메시지마다 모델 앞에 놓이는 데이터가 줄어듭니다. Hermes에서는
00:09:20자동 메모리 기능을 끄는 옵션도 제공하는데, 이를 끄면 수집이 중단되고 메모리 파일이
00:09:25컨텍스트 창에 들어오지 않게 됩니다. 메시지마다 더 적은 토큰이 나가므로 돈을 아낄 수 있죠.
00:09:30하지만 자동 메모리를 끄는 것은 Hermes를 처음부터 그렇게 좋게 만들어주는 기능 중 하나를 포기하는 것입니다.
00:09:35그래서 저희 워크플로우에서는 비용이 들더라도 계속 켜둡니다. 회사에 대한 세부 정보를
00:09:40끌어와서 Slack을 통해 팀 전체와 공유하고 싶으니까요. Hermes가 무언가 잘못했을 때,
00:09:45단순히 프롬프트를 다시 보내지 마세요. undo 명령어를 사용하여 메시지 한 단계를 되돌리세요.
00:09:50여러 메시지를 거슬러 올라가는 완전한 되감기는 아니지만, 가장 최근 메시지를
00:09:54취소할 수 있게 해줍니다. 그것이 더 나은 방법입니다. 그곳에서 무엇이 잘못되었고 무엇을 피해야 하는지
00:10:00설명하는 새로운 프롬프트를 줄 수 있기 때문이죠. 지금까지 영상이 즐거우셨다면,
00:10:05채널을 구독하고 좋아요 버튼을 눌러주세요. 이런 작은 응원이 저희에게는 큰 힘이 됩니다.
00:10:10이 모든 것을 다듬으면 사용량이 줄어들고 이제 도구를 살펴볼 차례입니다. 에이전트가 액세스할 수 있는
00:10:15모든 도구도 컨텍스트 창의 일부로 메시지마다 전송되므로, 실제로 사용하지 않는 도구를 줄이는 것이 좋습니다.
00:10:20Hermes에는 17개 이상의 도구가 포함되어 있으며, Hermes list 명령어로 모두 확인할 수 있습니다.
00:10:26비활성화하려면 데스크톱 앱을 거치거나 tools disable 명령어로 끄고 싶은 도구 이름을 실행하면 됩니다.
00:10:31예를 들어, 저희 팀 전체를 위해 설정한 AI labs 프로필은 코드 기반에서
00:10:36어떤 작업도 하지 않으므로 코드 실행이 전혀 필요 없었습니다. 저희는 그것을 위한 별도의 프로필을
00:10:41유지합니다. 그것을 비활성화하고 사용하지 않는 다른 도구들도 모두 꺼서 이유 없이 컨텍스트에
00:10:46남아있는 것이 없도록 했습니다. Hermes는 많은 스킬을 기본으로 제공하는데,
00:10:51대부분 아마 절대 사용하지 않을 것들이므로 필요 없는 스킬은 모두 끌 수 있습니다.
00:10:56스킬 목록에는 실제로 사용하는 것들만 남게 되어, 컨텍스트를 비대하게 만드는 긴 목록이 사라집니다.
00:11:01MCP 서버도 마찬가지입니다. 연결할 때마다 도구 세트가 컨텍스트 창에 들어오므로,
00:11:06사용하지 않는 서버는 모두 연결 해제하고, 유지하는 서버에 대해서는 도구 검색을 auto로 설정하세요.
00:11:11Claude의 도구 검색 기능처럼 작동합니다. 모든 도구를 항상 컨텍스트 창에 유지하는 대신,
00:11:16정말 필요할 때만 도구를 로드합니다. auto로 설정되어 있지 않다면 바꿔주세요. 그래야 토큰을
00:11:22낭비하지 않고 사용하는 도구들을 최대한 활용할 수 있습니다. 하드 제한도 토큰 사용량을 낮게
00:11:27유지하는 또 다른 방법입니다. 에이전트가 멈춰야 하기 전까지 할 수 있는 양을 제한하죠.
00:11:33첫 번째는 모델의 max 토큰을 특정 숫자로 설정하는 것인데, 출력으로 생성할 수 있는 토큰 양을 제어합니다.
00:11:39출력 비용을 절약하고 모델이 장황하게 늘어놓는 대신 더 간결한 답변을 하도록 유도합니다.
00:11:46기본적으로 에이전트의 최대 턴 수는 150으로 설정되어 있습니다.
00:11:51즉, 작업을 수행하는 동안 생각을 하고 도구를 호출하고 출력을 읽고 결과를 평가하는 데
00:11:56최대 150번의 턴을 가질 수 있다는 것입니다. 문제는 에이전트가 혼란스러워질 때
00:12:01무언가를 해결하려는 동안 전체 컨텍스트를 다시 보내면서 그 모든 턴을 소모해 버릴 수 있다는 것입니다.
00:12:06그래서 이것을 더 낮게 설정할 수 있습니다. 저희는 60으로 설정하여 에이전트가
00:12:10막힌 문제에서 헛돌며 턴을 낭비하지 않게 했습니다. 루핑을 방지하는 켜둘 가치가 있는
00:12:15설정이 하나 더 있습니다. 하드 정지 설정을 false에서 true로 바꿀 수 있는데,
00:12:21이것은 에이전트가 이유 없이 루프에 빠지는 것을 막아줍니다. 그래서 멈춰서 진전이 없을 때,
00:12:26하드 정지가 작동하여 계속 갈아대는 것을 멈추게 합니다. 다음은 cron 작업입니다.
00:12:31기본적으로 최대 턴에 제한이 설정되지 않은 채 일정에 따라 스스로 실행되는 작업들입니다.
00:12:36이를 특정 숫자로 설정하여 cron 작업이 취할 수 있는 턴 수에 캡을 씌울 수 있습니다.
00:12:41그러면 백그라운드 작업이 토큰을 소비하는 것을 막고 비용이 영원히 발생하는 것을 방지합니다.
00:12:45이제 Hermes 에이전트를 시작하기 위해, 커뮤니티인 AI Labs Pro에서
00:12:50전체 스타터 팩을 큐레이팅했습니다. 거기서 리소스, 스타터 팩 등을 얻을 수 있으며,
00:12:54저희 팀을 포함한 비슷한 생각을 가진 사람들과 교류할 수 있는 공간이 있습니다.
00:12:59저희가 하는 일에서 가치를 느끼고 채널을 지원하고 싶다면 이것이 가장 좋은 방법입니다. 링크는 설명란에 있습니다.
00:13:04이제 이 영상의 끝에 다다랐습니다. 채널을 지원하고 이런 영상을 계속 만들 수 있도록 도움을 주고 싶다면

핵심 요약

Hermes 에이전트의 백그라운드 작업과 컨텍스트 창을 최적화하고 모델을 작업별로 적절히 라우팅함으로써 에이전트 운영 비용을 80% 절감할 수 있습니다.

하이라이트

  • Hermes 에이전트의 워크플로우를 최적화하여 불필요한 토큰 소비를 줄이고 설정 비용을 80% 절감했습니다.

  • OpenRouter로 전환하여 토큰별 요금을 직접 확인하고 작업별 모델 라우팅을 통해 비용을 관리합니다.

  • 백그라운드 보조 작업(이미지 읽기, 스킬 검색 등)에 메인 모델 대신 저렴한 경량 모델을 할당하여 비용을 절감합니다.

  • 컨텍스트 창의 비대화를 막기 위해 압축 임계값을 50% 미만으로 조정하고, 사용하지 않는 도구와 스킬은 즉시 비활성화합니다.

  • 에이전트의 최대 턴 수를 기본 150에서 60으로 하향 조정하여 무한 루프와 불필요한 토큰 소비를 방지합니다.

  • 하드 정지 설정을 활성화하여 에이전트가 진전 없이 헛도는 작업을 자동으로 중단시킵니다.

타임라인

비용 증가의 원인 파악 및 분석

  • Hermes는 항상 실행되므로 백그라운드 스킬 검색, 메모리 업데이트, MCP 도구 로드 등이 지속적으로 토큰을 소비합니다.
  • 토큰 소비 내역은 루트 폴더의 데이터베이스에 저장되며, insights 명령어를 통해 지난 30일간의 상세 비용과 활동 패턴을 확인할 수 있습니다.
  • 모든 스킬과 시스템 프롬프트, 도구 헤더는 매 메시지마다 컨텍스트에 포함되어 비용을 발생시킵니다.

다수의 사용자가 동시에 Hermes를 사용하면서 발생한 비용 문제를 해결하기 위해 분석을 진행했습니다. 데이터베이스 분석을 통해 실제 작업보다 잘못 설정된 반복 작업이 비용의 대부분을 차지함을 확인했습니다. 특히 에이전트가 24시간 내내 실행되며 스스로 스킬을 생성하고 메모리를 업데이트하는 과정에서 발생하는 토큰 소모가 핵심적인 비용 요인임을 파악했습니다.

모델 라우팅 및 최적화 전략

  • 코드 구독 모델을 유지하되 OpenRouter를 통해 다양한 모델로 접근하고 비용을 관리합니다.
  • 작은 백그라운드 작업에는 메인 모델 대신 저렴한 보조 모델을 지정하여 비용을 최적화합니다.
  • 하위 에이전트 생성 시에도 저렴한 모델을 설정하여 비용 합산을 방지합니다.

가장 큰 비용을 차지하는 모델을 효율적으로 사용하기 위해 작업의 중요도에 따라 모델을 구분했습니다. 메인 모델은 복잡한 추론에만 사용하고, 이미지 인식이나 단순 스킬 검색과 같은 보조 작업은 더 낮은 등급의 모델로 처리하도록 설정했습니다. 이는 모델의 추론 능력이 필요한 작업과 단순 반복 작업 사이의 비용 격차를 이용하여 전체 예산을 줄이는 방식입니다.

컨텍스트 및 도구 관리 최적화

  • 컨텍스트 압축 임계값을 50% 미만으로 유지하여 메시지당 전송되는 데이터 양을 줄입니다.
  • 사용하지 않는 도구와 스킬은 tools disable 명령어를 사용해 비활성화합니다.
  • 일회성 지침은 컨텍스트 파일 대신 임시 시스템 프롬프트를 활용하여 공간을 확보합니다.

대화 기록과 도구 정보가 컨텍스트 창에 쌓이는 문제를 해결하기 위해 압축 전략을 개선했습니다. 필요 없는 도구와 스킬을 제거하여 메시지 크기를 줄이고, MCP 도구 로드 설정을 auto로 바꾸어 정말 필요한 순간에만 도구가 로드되도록 했습니다. 이를 통해 매 턴마다 발생하는 고정 비용을 크게 낮췄습니다.

하드 제한 및 실행 루프 방지

  • 에이전트의 최대 턴 수를 150에서 60으로 낮추어 루프 발생 시의 토큰 낭비를 차단합니다.
  • 하드 정지 설정을 true로 변경하여 진전 없는 작업의 반복을 강제 중단합니다.
  • cron 작업에도 턴 수 제한을 설정하여 백그라운드에서의 무제한 비용 발생을 방지합니다.

시스템 설정 내에서 에이전트의 작동 한계를 명확히 지정하여 안전장치를 마련했습니다. 특히 작업 수행 중 혼란에 빠진 에이전트가 컨텍스트를 반복적으로 재전송하며 턴을 낭비하는 상황을 60턴 제한으로 막았습니다. 하드 정지 설정을 통해 무의미하게 갈아대는 루프를 즉시 멈추게 함으로써 예측 가능한 비용 통제가 가능해졌습니다.

커뮤니티 글

모든 글 보기