스크립트
00:00:00Hermes를 처음 사용하기 시작한 이후로 우리는 수많은 워크플로우를 구축해 왔고,
00:00:04오랫동안 OpenAI 구독을 통해 모든 작업을 GPT 모델로 실행했습니다. 처음에는 잘 작동했죠.
00:00:09하지만 우리 팀 전체가 Hermes를 사용하면서 각자 자신만의 플로우를 설정했고,
00:00:14이렇게 많은 사람이 동시에 사용하다 보니 사용량 제한에 계속 걸렸습니다. 작업이 그냥 멈춰버리곤 했죠.
00:00:18그래서 OpenRouter로 옮겼습니다. 제한 문제는 해결되었지만, 새로운 문제가 생겼죠.
00:00:24OpenRouter는 토큰마다 요금을 부과해서, 처음으로 Hermes 비용이 정확히 얼마인지
00:00:29알 수 있게 되었습니다. 예상보다 훨씬 높은 금액이었고, 이상한 점은
00:00:34대부분 우리가 실제로 사용해서 발생한 게 아니라는 겁니다. 사람들이 잘못 설정해 둔
00:00:39작업들에서 대부분 발생하고 있었죠. 그래서 비용을 줄이기로 했지만 출력 품질을 타협할 생각은 없었습니다.
00:00:44모든 설정을 검토하여 Hermes의 성능을 떨어뜨리지 않으면서 비용을 절감하는 설정을 찾았습니다.
00:00:49여기가 처음이시라면 말씀드리자면, 저희는 소프트웨어 회사이고 이곳은 저희 채널 AI Labs입니다.
00:00:54저희가 프로세스를 최적화한 것처럼 여러분의 프로세스를 AI로 최적화하는 방법을 알려드립니다.
00:00:59이번 영상에서는 우리가 변경한 모든 설정과 그것이 어떻게 워크플로우를 바꿨는지,
00:01:03그리고 실제로 얼마나 절약했는지 알아보겠습니다. Hermes 비용을 절감하기 전에,
00:01:08무엇이 토큰을 소비하고 있는지 먼저 알아야 합니다. Hermes 비용은 토큰 사용량에 따라 결정됩니다.
00:01:12토큰은 기본적으로 모델이 읽고 쓰는 단어의 구성 요소입니다. 모든 모델은
00:01:17입력한 토큰과 받는 토큰을 기반으로 구축됩니다. 하지만 입력은 단순히 프롬프트만이 아닙니다.
00:01:22시스템 프롬프트와 지금까지의 대화 전체, 그리고 매 메시지마다 함께 전송되는
00:01:27몇 가지 다른 요소들도 포함됩니다. 여기에는 추가한 각 스킬의 헤더가 포함되는데,
00:01:31이는 항상 로드되는 이름과 설명이며, 설정해 둔 MCP 도구와 메모리,
00:01:36사용자 파일도 포함됩니다. 이 모든 것이 입력 토큰을 늘리며 스킬이 그중 큰 부분을 차지합니다.
00:01:41Hermes는 90개의 스킬이 사전 설치되어 있으며, 이 숫자는 사용할수록 계속 늘어납니다.
00:01:46재사용할 가치가 있는 워크플로우를 새로운 스킬로 만들기 때문이죠. 그래서 각각의 스킬이
00:01:51메시지당 비용을 추가합니다. 스킬 헤더뿐만이 아닙니다. Hermes는 대화를 스캔하여
00:01:56새로운 스킬을 만들 기회를 찾는데, 이것도 토큰을 소비합니다. Hermes는 스스로 진화하는 메모리도 가지고 있습니다.
00:02:03끊임없이 대화를 검토하여 사용자에 대한 구체적인 세부 정보를 추출하고 메모리에 작성합니다.
00:02:07사용자에 대한 맥락을 유지하고 향후 답변을 맞춤 설정하기 위해 스스로 메모리를 업데이트합니다.
00:02:13이 모든 것은 공짜가 아닙니다. 진화하는 스킬과 자동 업데이트되는 메모리 모두 여러분이
00:02:19비용을 지불해야 하는 토큰을 소비하고 있기 때문이죠. 또 다른 큰 요인은 Hermes가 24시간 내내 실행된다는 것입니다.
00:02:25Cloud Code에서 하는 것처럼 한 번 시작하고 실행하는 에이전트가 아닙니다.
00:02:30이미 우리 팀을 위해 설정한 것과 같은 로컬 서버나, 팀원들이 접속할 수 있도록
00:02:35직접 대여해서 실행하는 VPS에서 운영할 수 있죠. Hermes는 항상 켜져 있으므로,
00:02:40백그라운드에서 많은 작업이 실행됩니다. 관리하지 않으면 사용량이 증가하는 주범이죠.
00:02:45단일 작업 실행은 저렴하지만, 계속 반복되거나 비슷한 작업을 많이 설정해 두면
00:02:50비용이 쌓입니다. 게다가 설정한 MCP 도구와 훅도 컨텍스트 창에 로드되므로 토큰을 많이 소비합니다.
00:02:56Hermes에서 목표를 실행하는 것 또한 비용이 듭니다. 다행히 Hermes는 이 모든 것을 추적할 방법을 제공합니다.
00:03:01루트 폴더의 데이터베이스에 모든 토큰 사용 데이터를 저장합니다.
00:03:07작업 중인 모든 에이전트에게 데이터베이스를 검토하여 자세한 분석 내역을 보여달라고 요청할 수 있습니다.
00:03:13에이전트는 Hermes를 처음 설치했을 때부터 지금까지의 데이터베이스 전체를 거슬러 올라갈 수 있습니다.
00:03:17거기서 몇 개의 세션을 실행했는지, 토큰을 얼마나 사용했는지,
00:03:22비용이 얼마나 들었는지 알려줍니다. 사용 내역을 상세하게 보여주므로,
00:03:27Claude와 함께 앉아서 예산을 더 잘 관리하는 방법을 찾을 수 있습니다. Hermes에는
00:03:31거의 동일한 기능을 하는 insights 명령어도 있습니다. 지난 30일간의 비용 내역을 보여주고,
00:03:36어떤 부분이 토큰을 사용했는지, 어떤 도구와 스킬을 가장 많이 사용했는지 알려줍니다.
00:03:42활동 패턴과 가장 긴 세션까지도 보여주죠. 이제 무엇이 토큰을 소비하는지 알았으니,
00:03:47가장 큰 원인인 모델 자체부터 시작해 봅시다. Hermes에 연결한 모델이
00:03:52청구액의 대부분을 차지합니다. Hermes는 연결할 수 있는 많은 모델을 제공하므로,
00:03:56저희가 가진 코드 구독처럼 이미 구독 중인 모델이 있다면, Hermes를 바로 실행할 수 있습니다.
00:04:01설정이 끝나면 이미 지불 중인 구독료 외에 추가 비용 없이 바로 사용할 수 있죠.
00:04:06Anthropic이나 Gemini 구독으로도 똑같이 하고 싶을 수 있지만, Hermes가
00:04:11사용 가능하다고 나열하더라도 사실은 그렇지 않습니다. Claude code를 직접 사용할 수 없습니다.
00:04:16별도의 API가 필요합니다. 둘 다 이런 식으로 구독을 사용하는 것을 정책 위반으로 간주하기 때문입니다.
00:04:21그래서 현재로서는 코드 구독이 최선의 선택입니다. 저희는 처음에 OpenAI
00:04:26구독으로 시작했지만, 결국 OpenRouter로 전환했습니다. 하나의 API 키로
00:04:30더 많은 모델에 접근할 수 있게 해주고 회사 전체에서 사용하기에 가장 좋았기 때문입니다.
00:04:36저희처럼 OpenRouter를 사용하신다면 Pareto 라우터를 사용하여 비용을 절감할 수 있습니다.
00:04:41작업에 실제로 필요한 것이 무엇인지 살펴보고 작업에 적합한 모델로 라우팅해 줍니다.
00:04:46저렴하고 기본적인 것부터 비싸고 강력한 것까지 13개의 모델이 티어별로 나뉘어 있습니다.
00:04:51제공업체 외에도 config.yaml 파일에서 토큰을 절약하는 데 도움이 되는 설정들이 있습니다.
00:04:57Hermes는 많은 백그라운드 작업을 실행하는데, 기본적으로
00:05:02이에 대한 모델은 auto로 설정되어 있습니다. 즉, 작은 작업에도 메인 모델로 폴백된다는 뜻이죠.
00:05:07이런 것들을 보조 작업이라 부르는데, 기본적으로 Hermes가 실행하는 작은 백그라운드 작업들이며
00:05:11메인 모델이 구축된 무거운 추론은 필요하지 않습니다. 이미지 읽기, 스킬 검색,
00:05:17MCP 도구 로드, 프로필 설명 작성 등은 더 가벼운 모델에서도 잘 작동합니다.
00:05:21따라서 그 작업들을 더 저렴한 모델로 지정하면 메인 모델이 단순한 작업에 비싼 토큰을 쓰지 않게 됩니다.
00:05:26같은 아이디어가 이전에 다루었던 하위 에이전트에도 적용됩니다. Hermes는 여러 하위 에이전트를
00:05:32생성하고 작업을 넘길 수 있습니다. 각각은 고유한 컨텍스트 창에서 실행되고
00:05:38자체적으로 작업합니다. 하지만 이것은 토큰 소모가 큽니다. 하위 에이전트마다 결과를
00:05:43보고하는 독자적인 세션이기 때문에 비용이 빠르게 합산됩니다. 그래서 하위 에이전트에
00:05:48더 저렴한 모델을 설정하면 하위 에이전트가 생성될 때마다 비용을 절약할 수 있습니다.
00:05:53어떤 모델을 사용하든 조정할 가치가 있는 것이 하나 더 있는데, 바로 노력 수준입니다.
00:05:58기본적으로 모델이 답변하기 전에 얼마나 깊게 생각하는지를 결정합니다. 최대로 올리면
00:06:03더 나은 결과물을 얻을 수 있지만, 더 많은 토큰을 소모하게 되어 비용이 더 많이 발생합니다.
00:06:08그러니 작업에 맞춰 노력 수준을 조정해야 합니다. 추론이 별로 필요 없는 간단한 작업일 때는
00:06:13사고 기능을 완전히 꺼버릴 수 있습니다. 하지만 넘어가기 전에, 스폰서인 Luma의 말씀을 들어보시죠.
00:06:19창의적인 일을 한다면 진짜 병목 현상은 아이디어가 아닙니다. 한 프로젝트에 8개의 AI 도구를
00:06:24저글링하며 도구 관리하느라 하루의 절반을 날려버리는 것이죠. Luma는 에이전트 AI로 이것을 해결합니다.
00:06:30일반 AI는 단순히 보조만 하지만, Luma의 에이전트는 실제로 여러분과 함께 창작하며,
00:06:35단순히 픽셀이 아니라 사물이 공간에서 어떻게 움직이고 행동하며 존재하는지 물리적 세계를 이해합니다.
00:06:40여러분이 취향과 방향을 제시하면, 에이전트가 그 내부의 모든 것을 조율하여,
00:06:45프로젝트 전반에 걸쳐 맥락을 유지하고 각 단계에 적합한 모델을 불러옵니다.
00:06:51첫 아이디어부터 최종 컷까지 에이전트가 전체 프로젝트를 계속 움직이게 하며,
00:06:56단 한 번의 프롬프트와 결과물로 끝나지 않습니다. 턴마다 에이전트와 함께 작업의 방향을 잡고,
00:07:02다듬어가면서 10배 더 많은 아이디어를 탐색할 수 있습니다.
00:07:0710배의 작업량 없이도 흩어진 10개의 탭 대신 최고의 모델들을 한곳에서 사용할 수 있죠. Luma와 함께 창작하세요.
00:07:12아래 링크에서 조기 액세스를 받거나 화면의 QR을 스캔하세요. 하지만 모델만이
00:07:16토큰을 낭비하는 것은 아닙니다. 컨텍스트 창도 마찬가지입니다. Hermes 에이전트는
00:07:21전체 도구 및 스킬 세트와 함께 제공되며, 보내는 모든 메시지는 지금까지 구축해 온
00:07:26전체 대화 기록을 함께 운반합니다. 대화가 길어질수록 턴마다 보내야 할 기록이 많아지고,
00:07:31컨텍스트 창이 빠르게 계속 커지기 때문에 자주 압축하는 것이 좋은 습관입니다.
00:07:37그렇게 하면 지금까지 일어난 모든 일의 요약을 기반으로 새로운 세션을 시작합니다.
00:07:42토큰을 많이 절약할 수 있고, 모델은 대화의 맥락을 훨씬 더 간결한 형태로 계속 유지합니다.
00:07:47기본적으로 압축 임계값은 50%로 설정되어 있는데, 이는 Hermes가
00:07:52컨텍스트 창이 절반 채워지면 대화를 압축한다는 뜻입니다. 이 값을 조정할 수 있으며,
00:07:58대부분의 경우 더 낮게 유지하는 것이 좋습니다. 그렇게 하면 각 턴마다
00:08:03전송해야 하는 메시지 수가 줄어들어 컨텍스트 사용을 효율적으로 유지하고 모든 메시지의 비용을 낮출 수 있습니다.
00:08:08압축 후 Hermes는 토큰의 일부를 압축되지 않은 상태로 남겨 추가하는데, 이것이 타겟 비율입니다.
00:08:13더 낮은 퍼센트로 설정하면 이전 대화가 컨텍스트 창으로 넘어오는 양이 줄어들어
00:08:18각 턴마다 전송되는 메시지가 적어집니다. 각 도구 결과가 컨텍스트에 얼마나 들어갈지도
00:08:23제어할 수 있습니다. OpenAI 구독을 사용했을 때는 이전 영상에서 다뤘던 것처럼
00:08:28도구 출력이 잘려 나갈 때 Hermes가 세부 사항을 놓치지 않도록 그 값을 높게 설정했습니다.
00:08:34하지만 OpenRouter로 이동한 후에는 비용을 더 면밀히 살펴야 했기에 값을 다시 낮췄습니다.
00:08:39단일 세션에만 필요한 일회성 지침이 있다면 Hermes 컨텍스트 파일에 작성하지 마세요.
00:08:44대신, 그 세션에만 추가되고 아무것도 남지 않는 일시적인 시스템 프롬프트를 사용할 수 있습니다.
00:08:49그렇게 하면 컨텍스트 파일의 공간을 낭비하지 않고도 지침을 사용할 수 있죠.
00:08:54이전에 보여드린 것처럼 제2의 뇌와 같은 로컬 시스템을 실행 중이라면 정보를 제대로 정리하고 싶을 겁니다.
00:08:59그래야 에이전트가 필요하지 않은 추가 토큰을 끌어오는 대신 필요할 때마다 조금씩 로드할 수 있으니까요.
00:09:05직접 만든 파일 외에도 Hermes가 의존하는 메모리 파일이나 에이전트 파일처럼
00:09:10Hermes가 의존하는 파일들을 다듬을 수도 있습니다. 이 파일들은 항상 컨텍스트 창에 머물러 있으므로,
00:09:14작을수록 모든 메시지마다 모델 앞에 놓이는 데이터가 줄어듭니다. Hermes에서는
00:09:20자동 메모리 기능을 끄는 옵션도 제공하는데, 이를 끄면 수집이 중단되고 메모리 파일이
00:09:25컨텍스트 창에 들어오지 않게 됩니다. 메시지마다 더 적은 토큰이 나가므로 돈을 아낄 수 있죠.
00:09:30하지만 자동 메모리를 끄는 것은 Hermes를 처음부터 그렇게 좋게 만들어주는 기능 중 하나를 포기하는 것입니다.
00:09:35그래서 저희 워크플로우에서는 비용이 들더라도 계속 켜둡니다. 회사에 대한 세부 정보를
00:09:40끌어와서 Slack을 통해 팀 전체와 공유하고 싶으니까요. Hermes가 무언가 잘못했을 때,
00:09:45단순히 프롬프트를 다시 보내지 마세요. undo 명령어를 사용하여 메시지 한 단계를 되돌리세요.
00:09:50여러 메시지를 거슬러 올라가는 완전한 되감기는 아니지만, 가장 최근 메시지를
00:09:54취소할 수 있게 해줍니다. 그것이 더 나은 방법입니다. 그곳에서 무엇이 잘못되었고 무엇을 피해야 하는지
00:10:00설명하는 새로운 프롬프트를 줄 수 있기 때문이죠. 지금까지 영상이 즐거우셨다면,
00:10:05채널을 구독하고 좋아요 버튼을 눌러주세요. 이런 작은 응원이 저희에게는 큰 힘이 됩니다.
00:10:10이 모든 것을 다듬으면 사용량이 줄어들고 이제 도구를 살펴볼 차례입니다. 에이전트가 액세스할 수 있는
00:10:15모든 도구도 컨텍스트 창의 일부로 메시지마다 전송되므로, 실제로 사용하지 않는 도구를 줄이는 것이 좋습니다.
00:10:20Hermes에는 17개 이상의 도구가 포함되어 있으며, Hermes list 명령어로 모두 확인할 수 있습니다.
00:10:26비활성화하려면 데스크톱 앱을 거치거나 tools disable 명령어로 끄고 싶은 도구 이름을 실행하면 됩니다.
00:10:31예를 들어, 저희 팀 전체를 위해 설정한 AI labs 프로필은 코드 기반에서
00:10:36어떤 작업도 하지 않으므로 코드 실행이 전혀 필요 없었습니다. 저희는 그것을 위한 별도의 프로필을
00:10:41유지합니다. 그것을 비활성화하고 사용하지 않는 다른 도구들도 모두 꺼서 이유 없이 컨텍스트에
00:10:46남아있는 것이 없도록 했습니다. Hermes는 많은 스킬을 기본으로 제공하는데,
00:10:51대부분 아마 절대 사용하지 않을 것들이므로 필요 없는 스킬은 모두 끌 수 있습니다.
00:10:56스킬 목록에는 실제로 사용하는 것들만 남게 되어, 컨텍스트를 비대하게 만드는 긴 목록이 사라집니다.
00:11:01MCP 서버도 마찬가지입니다. 연결할 때마다 도구 세트가 컨텍스트 창에 들어오므로,
00:11:06사용하지 않는 서버는 모두 연결 해제하고, 유지하는 서버에 대해서는 도구 검색을 auto로 설정하세요.
00:11:11Claude의 도구 검색 기능처럼 작동합니다. 모든 도구를 항상 컨텍스트 창에 유지하는 대신,
00:11:16정말 필요할 때만 도구를 로드합니다. auto로 설정되어 있지 않다면 바꿔주세요. 그래야 토큰을
00:11:22낭비하지 않고 사용하는 도구들을 최대한 활용할 수 있습니다. 하드 제한도 토큰 사용량을 낮게
00:11:27유지하는 또 다른 방법입니다. 에이전트가 멈춰야 하기 전까지 할 수 있는 양을 제한하죠.
00:11:33첫 번째는 모델의 max 토큰을 특정 숫자로 설정하는 것인데, 출력으로 생성할 수 있는 토큰 양을 제어합니다.
00:11:39출력 비용을 절약하고 모델이 장황하게 늘어놓는 대신 더 간결한 답변을 하도록 유도합니다.
00:11:46기본적으로 에이전트의 최대 턴 수는 150으로 설정되어 있습니다.
00:11:51즉, 작업을 수행하는 동안 생각을 하고 도구를 호출하고 출력을 읽고 결과를 평가하는 데
00:11:56최대 150번의 턴을 가질 수 있다는 것입니다. 문제는 에이전트가 혼란스러워질 때
00:12:01무언가를 해결하려는 동안 전체 컨텍스트를 다시 보내면서 그 모든 턴을 소모해 버릴 수 있다는 것입니다.
00:12:06그래서 이것을 더 낮게 설정할 수 있습니다. 저희는 60으로 설정하여 에이전트가
00:12:10막힌 문제에서 헛돌며 턴을 낭비하지 않게 했습니다. 루핑을 방지하는 켜둘 가치가 있는
00:12:15설정이 하나 더 있습니다. 하드 정지 설정을 false에서 true로 바꿀 수 있는데,
00:12:21이것은 에이전트가 이유 없이 루프에 빠지는 것을 막아줍니다. 그래서 멈춰서 진전이 없을 때,
00:12:26하드 정지가 작동하여 계속 갈아대는 것을 멈추게 합니다. 다음은 cron 작업입니다.
00:12:31기본적으로 최대 턴에 제한이 설정되지 않은 채 일정에 따라 스스로 실행되는 작업들입니다.
00:12:36이를 특정 숫자로 설정하여 cron 작업이 취할 수 있는 턴 수에 캡을 씌울 수 있습니다.
00:12:41그러면 백그라운드 작업이 토큰을 소비하는 것을 막고 비용이 영원히 발생하는 것을 방지합니다.
00:12:45이제 Hermes 에이전트를 시작하기 위해, 커뮤니티인 AI Labs Pro에서
00:12:50전체 스타터 팩을 큐레이팅했습니다. 거기서 리소스, 스타터 팩 등을 얻을 수 있으며,
00:12:54저희 팀을 포함한 비슷한 생각을 가진 사람들과 교류할 수 있는 공간이 있습니다.
00:12:59저희가 하는 일에서 가치를 느끼고 채널을 지원하고 싶다면 이것이 가장 좋은 방법입니다. 링크는 설명란에 있습니다.
00:13:04이제 이 영상의 끝에 다다랐습니다. 채널을 지원하고 이런 영상을 계속 만들 수 있도록 도움을 주고 싶다면