Claude Code 토큰 비용을 20배 줄이는 방법 (& 유용한 사용 팁 4가지)

CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00Claude Code 토큰 비용으로 본래 내야 할 것보다 20배나 더 많이 내고 있으면서도 모를 수 있습니다.
00:00:05Claude Code 토큰을 최대한 활용하는 법을 이해하는 것은
00:00:08터득할 수 있는 가장 중요한 기술 중 하나이며, 단순히 Claude.md 파일에
00:00:14간결하게 작성하라는 한 줄을 적어두는 것보다 훨씬 더 깊은 내용을 다룹니다.
00:00:19프롬프트 캐싱이 어떻게 작동하는지조차 이해하지 못한다면 불필요하게 훨씬 많은 비용을 지불하게 됩니다.
00:00:23따라서 이번 영상에서는 Claude 토큰을 더 잘 관리하여
00:00:27이 최상위 모델들을 실제로 최대한 활용할 수 있는 5가지 방법을 알려드리겠습니다.
00:00:31자, 첫 번째 팁이 가장 중요합니다. 이것은 다른 모든 팁을 합친 것보다 훨씬 더 많은 비용과 사용량을 아껴줄 것인데,
00:00:37바로 프롬프트 캐싱이 실제로 어떻게 작동하는지 이해하는 것입니다. 프롬프트 캐싱을 이해하려면 먼저 토큰이 어떻게 작동하는지 알아야 합니다.
00:00:43모두가 같은 이해를 공유할 수 있도록 아주 빠르게, 약 60초 만에 짚고 넘어가겠습니다.
00:00:47토큰은 대형 언어 모델의 화폐와 같으며, 대략적으로 단순화하자면
00:00:52대략 모든 단어가 하나의 토큰과 같습니다. 따라서 사용자로서 Claude에게 첫 번째 메시지로 오늘 어떻게 지내니?
00:01:00라고 물어보면, 여러분은 5개의 입력 토큰을 보낸 것입니다. 이제 Claude가 응답하여 잘 지내요, 고마워요라고 말하면
00:01:094개의 출력 토큰을 제공한 것입니다. 이것들은 가격이 다르게 책정됩니다. 실제로 출력 토큰은 대체로
00:01:16입력 토큰 비용의 5배에 달합니다. 이제 이 5개의 입력 토큰과 4개의 출력 토큰이
00:01:23컨텍스트 윈도우 내부에 누적됩니다. 토큰이 화폐라면 컨텍스트 윈도우는 우리의 예산입니다.
00:01:31Opus, Claude, Sonnet 모두 1백만 토큰의 예산을 가지고 있으므로 이 시점에서 우리는 1백만 개 중 9개를 사용했으며,
00:01:37많은 양은 아닙니다. 흥미로운 점은 첫 번째 메시지 이후에 후속 메시지를 보낼 때 발생합니다.
00:01:43두 번째 메시지에서 사용자로서 저는 앱을 만들어줘, 실수 없이, 라고 말합니다.
00:01:506개의 입력 토큰이죠? Anthropic과 Claude에게 단지 6개의 입력 토큰만 보내는 것입니다. 글쎄요,
00:01:56꼭 그렇지는 않습니다. 실제로 보내고 있는 것은 모든 것, 즉 Anthropic에게
00:02:04그 시점까지의 이 전체 대화 내용을 보내고 있는 것입니다. 따라서 실제로 6개의 입력 토큰만 보내는 것이 아니라
00:02:11여기서의 5개와 여기서의 4개를 포함하여 총 16개의 입력 토큰을 보내고 있는 셈입니다.
00:02:16맥락을 이해할 수 있도록 전체 메시지를 가져가기 때문입니다. 그리고 모든 단 하나의
00:02:20후속 메시지마다 항상 최신 메시지 이전의 대화 전체를 보내게 됩니다.
00:02:26이것이 아주 빠르게 누적되어 매 메시지마다 5,000개, 10,000개, 100,000개의 입력 토큰이
00:02:32전송되는 상황을 금방 보게 될 것입니다. 그리고 여러분은 그 비용을 지불하고 있습니다.
00:02:37그렇다면 어째서 우리는 사용량을 순식간에 다 소모해 버리지 않는 걸까요?
00:02:43왜 이 AI 시스템을 사용할 때마다 모든 사람이 10억 달러씩 지불하지 않는 걸까요?
00:02:47분명 메시지를 거듭해서 보내고 있는데 말이죠. 서버에는 수많은
00:02:51누적된 메시지가 전송되고 있습니다. 자, 여기서의 해결책은 캐시 시스템입니다. 그래서 맞습니다,
00:02:57여기서 두 번째 메시지를 보낼 때 실제로 이 모든 것을 보내고 있습니다. 하지만 이 시점에 생성된 것은
00:03:05메시지 캐시입니다. 그리고 두 번째 메시지의 경우, 그 메시지 캐시는 처음 두 개의 메시지가 됩니다.
00:03:12메시지 캐시를 Claude가 앞에 두고 있는, 그 시점까지의 전체 대화 내용이 담긴 문서라고 생각하시면 됩니다.
00:03:17여기에 여러분이 Claude와 대화하는 모습이 있고, 여러분은 이제 실수 없이 앱을 만들어 달라는
00:03:23두 번째 메시지를 보내고 있습니다. 하지만 캐시 시스템이 있습니다. 따라서 이 전체 섹션인 처음 두 개의 메시지는
00:03:30이제 이 문서 안에 들어앉아 있습니다. 그래서 Claude와 Anthropic이 할 수 있는 일은
00:03:36그 문서를 읽고, 캐시를 읽을 수 있다는 것입니다.
00:03:42캐시 없이 한 번에 전부 전송하는 것보다 훨씬 저렴한 요율로 그 시점까지의 전체 메시지 기록을 살펴볼 수 있습니다.
00:03:47그것이 비용을 계산하는 방식입니다. 이 캐시 시스템은 영원히 지속되지 않기 때문에 이 비용이 중요합니다.
00:03:54여러분이 이해해야 할 것은 여러분과 Claude가 서로 대화할 때,
00:04:00우리 사이에는 모든 대화 기록을 담고 있는 이 캐시 문서가 존재하며, 이를 아주 저렴하게 읽을 수 있지만,
00:04:06그 데이터는 단 한 시간 동안만 유지된다는 점입니다.
00:04:11따라서 여러분과 Claude가 계속해서 티키타카를 주고받으며 토론을 이어가다가,
00:04:16계속 주고받고 하다가 한 시간 동안 자리를 비운다고 해봅시다. 그리고 대화 내용이
00:04:2150만 토큰에 달하는 문서, 즉 50만 토큰 길이의 대화가 있습니다. 한 시간이 지나면 이것은 사라집니다.
00:04:29이것은 없어집니다. 그래서 50만 1번째 메시지를 보낼 때, 자 보십시오, 이제 여러분은
00:04:38“안녕, 뭐 해?”라고만 말했더라도 전면 요금이 적용된 50만 토큰 메시지 비용을 청구받게 됩니다.
00:04:46이 캐시가 단 한 시간만 지속된다고 할 때, 이는 활동이 없는 상태로 한 시간을 의미한다는 점을 이해하셔야 합니다. 즉, 메시지를 보낼 때마다 갱신됩니다.
00:04:52따라서 마지막 메시지 이후 59분이 지난 시점에 다시 메시지를 보내면 그 한 시간 카운터가 재설정됩니다.
00:04:56자, 왜 이것이 그토록 중요할까요? 음, 바로 비용 때문입니다. 제가 도입부에서 이야기했듯이,
00:05:01캐시 읽기, 즉 이 전체 기록을 읽는 것과 캐시 없이 50만 개의 메시지를 읽는 것의 차이는
00:05:08말 그대로 20배 차이입니다. 그리고 이것은 가격 인상 문서에도 반영되어 있습니다.
00:05:16그러므로 출력 토큰, 즉 Claude가 우리에게 주는 것은 절대 변하지 않는다는 점을 기억하세요.
00:05:22Claude의 경우 1백만 토큰당 50달러이며, Opus의 경우는 25달러입니다. 하지만 입력 토큰이
00:05:27바로 이 전체 대화가 이루어지는 곳입니다. 그래서 우리는 항상 기본 입력 토큰이
00:05:331백만당 10달러라고 말하지만, 이는 약간 잘못된 표현입니다. 왜냐하면 실제로 우리는 항상 캐시 쓰기를 수행하고 있기 때문입니다.
00:05:40따라서 구독 플랜에서 수행하고 있는 1시간 캐시 쓰기는 실제로 비용이 두 배입니다.
00:05:47따라서 첫 번째 메시지처럼 해당 캐시에 처음으로 쓸 때의 비용은 1백만 토큰당 20달러입니다.
00:05:54여기서 5분 캐시 쓰기를 볼 수 있지만, 그것은 실제로 API를 사용하는 사람들을 위한 것입니다.
00:05:59이제 이를 캐시 적중과 비교해 보십시오. 즉, Anthropic이 매시간 누적되어 갱신되는 앞에 있는 그 문서를 그냥 읽는 경우입니다.
00:06:051달러입니다. 20배나 더 저렴하죠. 엄청난 차이입니다.
00:06:13그것이 바로 이 전체 내용, 즉 프롬프트 캐싱과 토큰 시스템의 작동 방식을 이해하는 이 특정 팁이 그토록 중요한 이유입니다.
00:06:18이 시점 이후에 제가 말씀드릴 어떤 내용도 이와 비슷한 수준의 효율성 향상을 가져다주지 못할 것입니다.
00:06:22아무것도 없습니다. 자, Claude Code와 나누고 있는
00:06:2950만 토큰 대화의 예시로 돌아가 봅시다.
00:06:35후속 메시지를 보내기 직전인 상황입니다. 시나리오 1번에서는 캐시 시스템이 있다고 가정해 보겠습니다.
00:06:40이 50만 대화 기록이 캐시되어 있고 제가 새 메시지를 보내고 있는 것입니다.
00:06:46가격 책정 방식은 여전히 이 전체 대화 기록을 읽어야 한다는 점입니다.
00:06:51그리고 그것은 1백만 토큰당 1달러 요율이 적용됩니다. 따라서 다음 메시지에서 모든 것과 새 메시지를 읽는 데 50센트의 비용이 듭니다.
00:06:58그러므로 그 새 메시지가 1,000토큰 길이라고 상상해 보십시오. 그 1,000토큰의 후속 메시지는 1백만당 1달러로 청구되지 않습니다.
00:07:051백만당 20달러로 청구됩니다. 따라서 1,000토큰이면 얼마죠, 약 2센트 정도 되나요? 잘 모르겠네요.
00:07:14제 계산이 틀렸을 수도 있지만 요점은 기록은 1달러이고 새 메시지는 캐시되어 있기 때문에 20달러라는 것입니다.
00:07:18자, 다음에 메시지를 보낼 때도 동일한 시나리오이지만, 이 1,000토큰은 이제 그 캐시 문서의 일부가 될 것입니다.
00:07:26대략 이해가 되시죠? 알겠습니다. 그것이 시나리오 1입니다. 시나리오 2는 캐시가 없는 경우입니다. 보내기 위해 한 시간을 기다렸습니다.
00:07:32보내기 위해 말이죠. 음, 이게 50센트인 대신에 이제 우리는 캐시 읽기 요율로 청구받게 됩니다,
00:07:40아니 죄송합니다, 캐시 쓰기 요율로 청구받게 되며, 이는 기억하시겠지만 1백만당 20달러입니다.
00:07:47그럼 이것은 얼마의 비용이 들까요? 이제 이 하나의 메시지가 우리에게 약 10달러의 비용을 청구하게 됩니다.
00:07:54단지 한 시간을 기다렸다는 이유만으로 50센트에서 10달러로 뛰어오른 것입니다. 이것이 바로 이 내용을 이해하지 못했을 때의 결과입니다.
00:08:00자, 캐시를 잃게 될 때 생각해야 하는 것은 시간만이 아닙니다. 캐시를 완전히 재설정하는 다른 요인들도 있습니다.
00:08:05그리고 이것은 Claude Code 문서에 직접 나와 있는 내용입니다.
00:08:10모델을 전환하는 경우, 즉 Claude를 사용 중이다가 Opus로 전환하고 50만 토큰이 쌓인 상태라면
00:08:14그 데이터는 사라집니다. 캐시가 재설정됩니다. 노력 수준 변경, 패스트 모드,
00:08:20MCP 서버 연결 또는 연결 해제, 플러그인, 도구 거부, 대화 압축, 또는 단순히 Claude Code 업그레이드 등입니다.
00:08:26이러한 것들 중 어느 것이든 캐시를 재설정하게 되며, 다음 메시지는 필요 이상으로 20배 더 비싸질 것입니다.
00:08:32이 모든 것을 고려할 때, 이 정보로 실제로 무엇을 할 수 있을까요?
00:08:38중요한 정보가 많이 담겨 있는 대화에서 잠시 자리를 비워야 하는데 1시간 이상 자리를 비우게 되거나,
00:08:42또는 1시간 이상 자리를 비웠다가 돌아와서 아차 하고 깨닫는 상황에 처했을 때 어떻게 해야 할까요?
00:08:46미리 이 점을 생각하지 못했던 경우 말입니다. 글쎄요, 그것이 바로 두 번째 팁에서 이야기할 내용입니다.
00:08:50하지만 먼저, 오늘의 스폰서인 저에 대한 짧은 안내 말씀입니다. 이번 주에 저는
00:08:54Chase AI+ 내에 완전히 업데이트된 Claude Code 마스터클래스 버전을 출시합니다.
00:08:59처음 출시했을 때 이후로 정말 많은 것이 바꼈습니다. 항상 업데이트하고 있죠. 하지만 근본적으로
00:09:06제가 이 제품을 처음 선보였던 3월 이후로 우리는 긴 거리를 걸어왔습니다.
00:09:12따라서 여러분이 AI 실력을 한 단계 높이고자 하는 분이거나, 기술적인 백그라운드가 전혀 없으면서도
00:09:19기초부터 이 도구를 사용하는 방법을 실제로 알고 싶고 실제 유스케이스에 집중하는 로드맵을 원하신다면 이 강의가 적합합니다.
00:09:24Chase AI+ 내에 있습니다. 고정 댓글에 링크가 있습니다. 자, 두 번째 팁은
00:09:28캐시가 소실되었을 때의 선택지에 관한 것입니다. 우리는 너무 오랜 시간 자리를 비웠고, 20만, 30만,
00:09:3340만, 50만 토큰 길이의 대화가 있습니다. 그리고 그 터무니없는 비용을 지불하는 대신
00:09:37다음 단계가 무엇이어야 하는지 알고 싶어 합니다. 이는 여러분의 시나리오가 무엇이냐에 따라 다릅니다.
00:09:42자, 첫 번째 옵션은 일종의 핵 옵션으로, 슬래시 clear(clear)를 실행하는 것입니다.
00:09:47슬래시 clear는 대화 기록 전체를 지워버립니다. 그리고 이것이 항상 나쁜 것은 아닙니다.
00:09:52실제로 작업 중인 어떤 코드베이스나 수많은 파일과 컨텍스트가 있는 프로젝트가 있다면 아마도 슬래시 clear를 하고 싶을 것입니다.
00:09:58무엇을 작업하고 있었든 간에, 무엇에 대해 이야기하고 있었든 간에,
00:10:04프로젝트 자체에 무슨 일이 일어났는지에 대한 증거가 남아있을 가능성이 높습니다.
00:10:10Claude Code는 그것을 살펴보면 됩니다. 그리고 처음부터 새로운 대화를 시작하면
00:10:15조각들을 모아 이전 상태로 되돌릴 수 있습니다. 이전 대화에 얽매일 필요가 없습니다.
00:10:20자, 두 번째 옵션은 압축(compaction)을 사용하는 것입니다. Claude Code에는 일정량의 토큰에 도달하면
00:10:25작동하는 자동 압축 기능이 있습니다. 저는 그 지점에 도달할 때까지 기다리지 않는 것을 추천합니다.
00:10:3160만, 70만, 80만 토큰 범위에서 작업할 때는 컨텍스트 저하(context rot)를 겪기 시작하기 때문입니다.
00:10:38이러한 더 크고 강력한 모델들에서도 여전히 문제이지만, 언제든지 슬래시 compact(compact)를 실행할 수 있습니다.
00:10:42그리고 그것이 우리를 위해 해주는 일은 우리가 나눈 대화의 요약을 생성하는 것입니다.
00:10:47그런 다음 사실상 슬래시 clear를 수행하되, 그 요약을 가지고 새로운 대화를 시작하는 것입니다.
00:10:51기억 속에 있는 것처럼 말이죠. 따라서 해당 대화에 중요한 내용이 있었고
00:10:57코드베이스에 있는 내용만으로는 그것을 이해하기에 충분하지 않다고 생각한다면,
00:11:03압축, 즉 슬래시 compact를 수행하십시오. 해당 요약을 포함하여 새로운 대화를 시작해 줍니다.
00:11:10그리고 그 요약은 메시지 기록에 남게 됩니다. 자, 세 번째 옵션은
00:11:15컴팩트와 매우 유사하며, 일종의 커스텀 핸드오프 도구를 사용하는 것입니다. 시중에는 많은 커스텀
00:11:20핸드오프 스킬이 존재합니다. 저도 하나 가지고 있죠. 제 무료 커뮤니티에서 얻으실 수 있습니다.
00:11:26핸드오프와 압축의 차이점은 그 요약이 어디에 저장되는가에 있습니다. 핸드오프를 수행하면
00:11:32실제로 디스크에 저장됩니다. 내가 원하는 내용이 담긴 요약과 함께 실제 마크다운 파일을 생성합니다.
00:11:38그런 다음 새로운 대화를 시작하며 “야, Claude Code, 알아야 할 내용을 파악할 수 있게
00:11:46디스크에 있는 저 핸드오프 문서를 살펴봐”라고 말할 수 있습니다. 반면에 압축은
00:11:51어떤 파일도 생성하지 않습니다. 진행 중인 특정 대화의 메시지 기록 내에 있는 메시지일 뿐입니다.
00:11:59미세한 차이입니다. 하지만 어떤 사람들은 디스크에 어떤 종류의 파일이 있기를 원합니다.
00:12:04그리고 대개 그것은 지속적으로 업데이트되는 살아 숨 쉬는 문서입니다.
00:12:10결국 이들이 당신의 세 가지 옵션입니다. 모든 것을 지우고 처음부터 시작하시겠습니까?
00:12:15대개 이것으로 충분합니다. Claude의 기본 기능을 사용하여 압축하고
00:12:20요약을 바로 주입하고 싶으십니까? 아니면 Claude가 살펴볼 수 있는 실제 문서로 요약이 되기를 원하십니까?
00:12:26그렇다면 핸드오프를 사용하세요. 이것이 세 가지 옵션입니다. 그리고 대개 이것들은 새 메시지를 그냥 보내는 것보다 낫습니다.
00:12:31왜냐하면 어쨌든 40만, 50만, 60만 토큰 범위에서 작업해서는 안 되기 때문입니다.
00:12:37자, 세 번째 팁은 모델 라우팅에 관한 것입니다. 작업에 적합한 모델을 어떻게 선택할 것인가?
00:12:42모든 것에 Claude만 사용하는 게 아니라, 더 간단한 작업에는 더 작고, 저렴하고, 덜 똑똑한 모델을 사용할 수 있을까요?
00:12:48대답은 '그렇다'입니다. 그리고 우리는 여러 가지 다양한 방식으로 이에 접근할 수 있습니다.
00:12:53외부 모델을 사용할 수 있습니다. GPT, Sol을 사용할 수도 있습니다. 최근에 가격이 매우 저렴해진 GPT, Luna와 Terra로 갈 수도 있습니다.
00:12:59로컬 모델을 사용할 수도 있고, Anthropic 생태계 안에 머물고 싶다면 다른 선택지도 있습니다.
00:13:04이를 수행하는 가장 쉬운 방법은 어드바이저 모드(advisor mode)라고 생각합니다.
00:13:10여기서 보시는 것은 몇 달 전에 나온 원래의 어드바이저 블로그 게시물에서 가져온 것입니다.
00:13:16따라서 Opus와 Sonnet을 보여주고 있지만, Claude 같은 모델에서도 동일한 시스템이 유지됩니다.
00:13:22그 아이디어는 Claude나 심지어 Opus 같은 스마트한 모델이 작업을 실행할 때 Sonnet 같은 더 작은 모델을 조언해 준다는 것입니다.
00:13:29따라서 큰 모델이 계획을 세우고, 작은 모델이 그것을 실행하며, 작은 모델은 문제가 발생할 때마다
00:13:37더 큰 모델과 자신의 컨텍스트를 공유할 수 있습니다. 그리고 이 모델은 더 낮은 비용으로 더 나은 결과를 자랑했습니다.
00:13:43앞서 프롬프트 캐싱에 대해 논했던 이전 내용과 연결해 보면, 어드바이저와 실행기 모두 동시에 작동하는 각자의 프롬프트 캐시를 가지고 있습니다.
00:13:50자, 두 번째 옵션은 Claude Code 외부에 있는 모델에 작업을 위임하는 것입니다.
00:13:54쉬운 예로 Codex가 있습니다. Claude Code용 Codex 플러그인이 있어서
00:14:01Claude Code 인터페이스에서 쉽게 Codex를 호출할 수 있습니다. 따라서 Claude가 사실상
00:14:06동일한 종류의 어드바이저 모드를 수행하도록 하되, Opus나 Sonnet을 호출하는 대신 GPT 모델을 호출하게 할 수 있습니다.
00:14:12이 Claude Advisor 같은 다른 레포지토리들이 정확히 그런 일을 합니다. 궁극적으로는 이와 같은 작업을 수행하는 자신만의 스킬을 설정하는 것은 꽤 사소한 일입니다.
00:14:18그리고 더 저렴한 모델을 찾고 있다면, 다시 말씀드리지만 GPT 모델들, 특히 Luna와 Terra를 살펴보는 것을 강력히 추천합니다.
00:14:24왜냐하면 첫째, 비용이 대폭 인하되었고, 둘째,
00:14:31Anthropic 패밀리 내에는 그들이 그 가격대에 하는 일을 해내는 모델이 실제로 존재하지 않기 때문입니다.
00:14:36작업상 의미가 있다면 한 걸음 더 나아가 일부 로컬 모델을 가져올 수도 있습니다.
00:14:41자, 네 번째 팁은 Claude 위생(hygiene)에 관한 것입니다. 최근에 널리 퍼지고 있는
00:14:48Claude Code의 창시자 Boris Cherney가 말하는 영상을 보셨을지도 모릅니다.
00:14:53Claude.md 파일을 삭제해야 한다고요. 자, 정말로 그 Claude.md 파일을 삭제해야 할까요?
00:14:57반드시 그런 것은 아니지만, 여러분이 해야 할 일은—그리고 이것은 지난 몇 주 동안 몇 가지 최근 변경 사항이 있었습니다—
00:15:01슬래시 doctor(doctor) 명령어를 실행하는 것입니다. 그리고 이것이 토큰과 무슨 관련이 있을까요?
00:15:07우선, 이 명령어가 다른 일들 중에서도—토큰과 관련된 부분에 집중하자면—
00:15:12여러분의 Claude.md를 살펴보고 이 파일을 깔끔하게 정리해 준다는 것입니다.
00:15:18이 모델들, 특히 5 시리즈 모델들이 작동하는 방식은 그렇게 많은 지시사항을 필요로 하지 않는다는 점입니다.
00:15:233개월, 6개월, 9개월 전에 사람들이 Claude.md용으로 만들었던 것들을 보면 매우 규범적이고 극도로 상세했습니다.
00:15:30아마도 당시에는 그것들이 필요했다는 주장이 제기될 수 있었을 것입니다. 지금은 그렇지 않습니다.
00:15:36따라서 비대해진 Claude.md는 속도를 느리게 만들 뿐만 아니라, 말 그대로 토큰 비용을 낭비하게 만듭니다.
00:15:42그리고 슬래시 doctor는 그것을 살펴보고 Claude.md에서 있을 필요가 없는 것들을 제거해 줍니다.
00:15:46둘째로, 컨텍스트를 해치거나 컨텍스트 윈도우를 비대하게 만드는 요인들을 살펴봅니다.
00:15:53새로운 대화를 시작하고 슬래시 context를 실행할 때조차도 그것을 채우는 것들이 있기 때문입니다.
00:15:59저는 최근에 슬래시 doctor를 실행했기 때문에 비대해진 부분을 많이 제거했지만,
00:16:04메시지를 전혀 보내지 않은 대화 시작 직전의 제 컨텍스트 윈도우는 이렇게 생겼습니다.
00:16:10이미 40,000 토큰을 사용했습니다. 그리고 이것을 많이 차지하고 있는 것은 무엇일까요?
00:16:15여기서 볼 수 있듯이 일부는 스킬 같은 것에서 비롯됩니다. 일부는 시스템 프롬프트뿐만 아니라 메모리 파일도 포함합니다.
00:16:20슬래시 doctor가 할 일은 스킬이나 MCP 같은 것들을 살펴보고
00:16:25사용하지 않는 것들을 정리하기 시작하는 것입니다. 이것이 엄청난 토큰 절약일까요?
00:16:31아니요, 하지만 여백에서의 소소한 절약이며 매우 간단한 해결책입니다.
00:16:36지난 6개월 동안 1,000만 개의 스킬을 축적해 왔고 실제로 이를 정리하며 잘라내지 않았다면 더욱 그렇습니다.
00:16:41그렇게 하는 것이 스킬이 더 효과적으로 작동하도록 만들기 때문에 하지 않을 이유가 없습니다.
00:16:47그리고 어떤 스킬을 호출해야 하는지에 대한 Claude 측의 혼란도 없을 것입니다.
00:16:53분명 프론트엔드 디자인과 관련된 스킬만 10개 정도 쌓여 있고 그 전부가 필요하지는 않을 것입니다.
00:16:58따라서 Claude 위생 관리에 관해 이 매우 간단하고 실행하기 쉬운 팁은 놓쳐서는 안 될 팁입니다.
00:17:03그냥 doctor를 실행하세요. 자, 이것이 마지막 팁으로 이어집니다.
00:17:08요즘 이 무리 중에서 가장 효과가 적다고 생각되지만, 여러분이 도처에서 볼 수 있는 추가적인 스킬과 비계(scaffolding)들입니다.
00:17:12요즘 가장 인기 있는 것은 포니테일(ponytail)이며, 이는 본질적으로 Claude가 작성하는 코드 양을 줄여주면서도
00:17:17효과성을 유지하여 결과적으로 더 저렴하고 빠르게 만듭니다.
00:17:22저는 이 수치를 실제 현실에서 발생하는 일과 비교하는 영상을 제작한 적이 있습니다.
00:17:28GitHub 레포지토리는 매우 오래된 하이쿠 4.5만 보여주고 있기 때문입니다.
00:17:33Claude를 사용하여 이것을 실행했을 때 수치는 실제로 유효했습니다. 사실 더 나은 모델을 사용했을 때 수치는 훨씬 더 좋아 보였습니다.
00:17:38저는 이 GitHub 레포지토리와 함께 제공된 벤치마크를 사용했습니다. 현실에서 여러분에게 효과가 있는 것은
00:17:44프로젝트의 복잡성에 따라 약간 다를 수 있습니다.
00:17:51하지만 이는 토큰 사용량을 계속해서 줄이고 싶다면 지금까지 우리가 이야기한 모든 것에 덧붙여 사용할 수 있는 방법입니다.
00:17:56많이 보게 될 또 다른 하나는 동굴인(Caveman)인데, 요즘 이 도구는 출력 토큰을 65% 줄여준다고 주장합니다.
00:18:01Claude.md에 단문형 규칙을 작성하는 것, 즉 단순히 “간결하게 해라” 같은 간단한 말을 적어두는 것만으로도
00:18:06출력 토큰을 줄일 수 있다고 말하는 사람들이 많이 있습니다. 하지만 기억하세요, 출력 토큰은 퍼즐의 한 조각에 불과합니다.
00:18:11그리고 원래의 논의로 돌아가서 그 퍼즐은 프롬프트 캐싱에 의해 지배됩니다.
00:18:18따라서 이 영상에서 다른 것을 얻지 못하셨더라도 이것만큼은 얻어가셨기를 바랍니다. 오늘 마무리할 내용이 바로 그것이기 때문입니다.
00:18:25늘 그렇듯이, 여러분의 생각을 알려주세요. Claude Code 마스터클래스를 손에 넣고 싶다면
00:18:30ChaseAI Plus를 꼭 확인해 보세요. 다시 말씀드리지만 이번 주에 엄청난 업데이트가 올라옵니다.
00:18:36그럼 이만, 다음에 뵙겠습니다.
00:18:41이 영상에서 다른 것을 얻지 못하셨더라도 이것만큼은 얻어가셨기를 바랍니다. 오늘 마무리할 내용이 바로 그것이기 때문입니다.
00:18:46늘 그렇듯이, 여러분의 생각을 알려주세요. 꼭 확인해 보세요
00:18:50Claude Code 마스터클래스를 손에 넣고 싶다면 ChaseAI Plus를. 다시 말씀드리지만 엄청난
00:18:55업데이트를 이번 주에 진행합니다. 그럼 이만, 다음에 뵙겠습니다.

Key Takeaway

프롬프트 캐시의 1시간 유지 시간을 관리하고 슬래시 doctor나 압축 명령어를 활용하면 Claude Code 토큰 비용을 최대 20배까지 줄일 수 있다.

Highlights

  • 프롬프트 캐싱을 적용하면 캐시가 없을 때보다 토큰 비용을 20배 절감할 수 있다.

  • 대화 기록을 담고 있는 프롬프트 캐시는 마지막 메시지 이후 정확히 1시간 동안 유지된다.

  • 모델 전환, 노력 수준 변경, 패스트 모드, MCP 서버 연결 변경 등이 발생하면 프롬프트 캐시가 초기화된다.

  • 대화가 비대해졌을 때 슬래시 clear나 슬래시 compact 명령어를 사용하면 불필요한 토큰 낭비를 막을 수 있다.

  • 슬래시 doctor 명령어를 실행하면 비대해진 Claude.md 파일과 사용하지 않는 스킬을 정리하여 컨텍스트 윈도우를 최적화할 수 있다.

Timeline

프롬프트 캐싱과 토큰 비용 구조

  • 후속 메시지를 보낼 때는 이전 대화 내용이 모두 포함되어 전송되므로 토큰이 빠르게 누적된다.
  • 캐시 시스템이 작동할 때는 전체 대화 기록을 1백만 토큰당 1달러로 읽을 수 있어 20배 저렴하다.
  • 캐시는 활동이 없는 상태로 정확히 한 시간 동안만 유지되며 시간이 지나면 초기화된다.

토큰은 대형 언어 모델의 화폐 역할을 하며 입력 토큰과 출력 토큰으로 구분된다. 후속 메시지를 전송할 때마다 이전의 모든 대화 내용이 함께 전달되므로 비용이 급격히 증가한다. Anthropic은 대화 기록을 문서 형태로 보관하는 캐시 시스템을 제공하며 이를 통해 비용을 대폭 낮춘다. 그러나 캐시 데이터는 마지막 메시지 이후 1시간 동안만 유지되므로 1시간 이상 자리를 비우면 캐시가 소실되어 전면 요금이 부과된다.

캐시 소실 대응 및 대화 관리 옵션

  • 모델 전환, 패스트 모드, MCP 서버 연결 변경 등이 발생하면 캐시가 완전히 재설정된다.
  • 슬래시 clear 명령어를 실행하면 대화 기록 전체를 지워 불필요한 비용 청구를 방지할 수 있다.
  • 슬래시 compact 명령어는 대화의 요약을 생성한 뒤 새로운 대화를 시작하도록 돕는다.

캐시는 시간 경과뿐만 아니라 모델 변경, 노력 수준 변경, 플러그인 변경 등으로 인해 소실될 수 있다. 캐시가 소실된 상태에서 긴 대화를 이어가면 불필요한 고비용이 발생하므로 적절한 조치가 필요하다. 대화 기록을 완전히 지우는 슬래시 clear, 대화 요약을 유지하며 새로 시작하는 슬래시 compact, 디스크에 마크다운 파일로 요약을 저장하는 커스텀 핸드오프 도구를 상황에 맞게 활용할 수 있다.

모델 라우팅과 Claude 위생 관리

  • 어드바이저 모드를 활용하면 스마트한 대형 모델이 계획을 세우고 작은 모델이 실행을 담당하여 비용을 절감한다.
  • 슬래시 doctor 명령어를 실행하면 비대해진 Claude.md 파일과 불필요한 스킬을 정리해 준다.
  • 포니테일이나 동굴인 같은 추가 스킬을 활용하면 출력 토큰 양을 줄여 비용과 속도를 최적화할 수 있다.

모든 작업에 최상위 모델을 사용하는 대신 어드바이저 모드나 외부 모델 위임을 통해 비용 효율성을 높일 수 있다. 또한 슬래시 doctor 명령어로 Claude.md 파일과 사용하지 않는 스킬을 정리하면 시작 시점의 컨텍스트 윈도우 낭비를 막을 수 있다. 출력 토큰을 줄여주는 추가적인 스킬들을 병행하면 전반적인 토큰 사용량을 추가로 낮출 수 있다.

Community Posts

View all posts