Como Tornar os Tokens do Claude Code 20x mais Baratos (& mais 4 Truques de Uso)

CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00Você pode estar pagando até 20 vezes mais pelos seus tokens do Cloud Code do que precisa e nem sabe disso.
00:00:05Compreender como aproveitar ao máximo os seus tokens do Cloud Code é uma das habilidades
00:00:08mais importantes que você pode dominar, e isso vai muito além de simplesmente colocar uma linha no seu arquivo Cloud.md
00:00:14dizendo para ser breve. Porque se você não entende coisas como o funcionamento do cache de prompt,
00:00:19você pode estar pagando muito mais do que precisa. Então, neste vídeo, vou te dar cinco
00:00:23maneiras diferentes de gerenciar melhor os seus tokens do Cloud para que você possa realmente aproveitar
00:00:27ao máximo esses modelos de ponta. Agora, a dica número um é a mais importante. Ela vai te poupar mais dinheiro
00:00:31e uso do que todas as outras dicas combinadas, de longe, que é entender como o cache de prompt realmente
00:00:37funciona. Para entender o cache de prompt, você precisa entender como os tokens funcionam. Então vamos
00:00:43fazer uma revisão bem rápida, de uns 60 segundos, para ficarmos na mesma página. Os tokens são a moeda de
00:00:47grandes modelos de linguagem e, para todos os efeitos (isso é um pouco simplificado), cada
00:00:52palavra equivale a um token. Então, quando você, usuário, na sua primeira mensagem para o Fable diz: como você está hoje,
00:01:00você enviou cinco tokens de entrada. Agora, quando o Fable te responde e diz: estou ótimo, obrigado,
00:01:09ele te deu quatro tokens de saída. Eles têm preços diferentes. Na verdade, os tokens de saída, em geral,
00:01:16custam cinco vezes o preço de um token de entrada. Agora, esses cinco tokens de entrada e esses quatro tokens de saída
00:01:23acumulam-se dentro da janela de contexto. Se os tokens são a moeda, a janela de contexto é o nosso orçamento.
00:01:31Opus, Fable, Sonnet, todos têm um orçamento de um milhão de tokens, então neste ponto usamos
00:01:37nove do nosso um milhão, não é muita coisa. O que se torna interessante é quando enviamos mensagens de seguimento
00:01:43após a primeira. Na nossa segunda mensagem, eu, o usuário, digo: crie um aplicativo para mim, sem erros,
00:01:50são seis tokens de entrada, certo? Vou enviar apenas seis tokens de entrada para a Anthropic e o Fable. Bem,
00:01:56não exatamente. O que vou enviar de verdade é tudo. Vou enviar para a Anthropic
00:02:04esta conversa inteira até aquele momento. Então não estou enviando apenas seis tokens de entrada, estou na verdade
00:02:11enviando 16 tokens de entrada, porque vou mandar os cinco daqui e os quatro daqui, pois
00:02:16o sistema vai receber a mensagem inteira para poder entender o contexto. E para cada
00:02:20mensagem de seguimento seguinte, será o caso: eu sempre envio a totalidade da conversa
00:02:26anterior a essa última mensagem. E dá para ver rapidamente como isso se acumula muito rápido, a ponto de
00:02:32você estar falando de 5.000, 10.000, 100.000 tokens de entrada sendo enviados a cada mensagem. E você
00:02:37paga por isso. Agora, se esse é o caso, por que não gastamos todo o nosso uso
00:02:43imediatamente? Por que todo mundo não paga um bilhão de dólares cada vez que tenta usar esses sistemas de IA?
00:02:47Porque, obviamente, enviamos mensagem após mensagem. Então há um monte de
00:02:51mensagens acumuladas sendo enviadas aos servidores. Bem, a solução aqui é o sistema de cache. Então sim,
00:02:57quando envio a mensagem número dois aqui, estou de fato enviando tudo isso. Mas o que foi criado
00:03:05a este ponto é o cache de mensagens. E para a nossa segunda mensagem, esse cache de mensagens são estas primeiras
00:03:12duas mensagens. Quero que você pense no cache de mensagens simplesmente como um documento que o Claude tem à sua frente
00:03:17contendo toda a sua conversa até aquele momento. Então temos você conversando com o Claude bem aqui,
00:03:23você agora está enviando a mensagem número dois, que é crie um aplicativo para mim, sem erros. Mas temos o sistema de cache.
00:03:30Portanto, toda esta seção, estas primeiras duas mensagens, agora estão armazenadas neste documento. Assim,
00:03:36o Claude e a Anthropic conseguem ler esse documento, conseguem ler o cache,
00:03:42analisar todo o histórico de mensagens até aquele ponto a uma taxa muito mais barata do que se você estivesse
00:03:47apenas enviando tudo de uma vez sem o cache. E é assim que o custo é calculado. E esse custo
00:03:54é importante porque esse sistema de cache não dura para sempre. O que você precisa entender é que quando
00:04:00você e o Claude estão conversando, e temos este documento de cache entre nós, que possui todo
00:04:06o nosso histórico de conversas, o qual você pode ler de forma muito barata, ele fica guardado por apenas uma hora.
00:04:11Portanto, se você e o Claude estão tendo essa discussão, tendo um vai e volta repetidas vezes,
00:04:16sabe, indo e voltando, e então você se afasta por uma hora, e você tem um
00:04:21documento com 500.000 tokens de extensão, uma conversa de 500.000 tokens. Após uma hora, isso desaparece.
00:04:29Isso some. E então, quando você envia uma mensagem, sabe, de número 500.001, bem, adivinha, você agora
00:04:38vai ser cobrado pela taxa cheia de uma mensagem de 500.000 tokens, mesmo que tudo o que você tenha dito seja: “E aí, beleza?”
00:04:46Agora entenda que quando digo que este cache dura apenas uma hora, refiro-me a uma hora sem atividade. Então ele
00:04:52é atualizado a cada mensagem. Se passaram 59 minutos desde a nossa última mensagem e eu enviar outra,
00:04:56esse contador de uma hora é reiniciado. Agora, por que isso é tão importante? Bem, é pelo custo. Eu falei
00:05:01na introdução, a diferença entre uma leitura de cache (ou seja, ler todo esse histórico) versus ler os 500.000
00:05:08mensagens sem cache é literalmente uma diferença de 20 vezes. E isso se reflete na documentação
00:05:16de aumento de preços. Lembre-se que os tokens de saída, o que o Claude nos dá, nunca mudam.
00:05:22Para o Fable, estamos olhando para 50 dólares por milhão de tokens e 25 dólares no caso do Opus. Mas os tokens de entrada
00:05:27são onde toda esta conversa tem se passado. Então sempre falamos sobre tokens de entrada base
00:05:33sendo 10 dólares por milhão, mas isso é um equívoco, pois na realidade estamos sempre fazendo gravações em cache.
00:05:40Portanto, uma gravação em cache de uma hora, que é o que você faz em um plano de assinatura, de fato dobra o custo.
00:05:47Então, quando gravamos nesse cache pela primeira vez, como naquela primeira mensagem, o custo é de 20 dólares por
00:05:54milhão de tokens. Você notará uma gravação em cache de cinco minutos aqui, mas isso é realmente apenas para quem
00:05:59usa a API. Compare isso com os acessos ao cache, ou seja, a Anthropic apenas lendo aquele documento à sua frente
00:06:05que ela vem acumulando a cada hora e atualiza. Custa 1 dólar, 20 vezes mais barato. Essa é
00:06:13uma diferença gritante. E é por isso que tudo isso, esta dica específica, entender o cache de prompt e
00:06:18como o sistema de tokens funciona, é tão importante. Não há nada que eu vá discutir daqui em diante
00:06:22que vá lhe proporcionar qualquer tipo de ganho de eficiência próximo a isso. Nada.
00:06:29Agora vamos voltar ao nosso exemplo daquela conversa de 500.000 tokens que estamos tendo
00:06:35com o Claude Code e estamos prestes a enviar uma mensagem de seguimento. No cenário número um, vamos
00:06:40imaginar que temos o sistema de cache. Então esse histórico de conversa de 500 mil está em cache e estou enviando
00:06:46essa nova mensagem. A forma como a precificação funcionará é que ele ainda precisa ler todo esse histórico
00:06:51de conversas. E isso é à taxa de 1 dólar por milhão de tokens. Portanto, vai me custar 50 centavos nessa
00:06:58próxima mensagem para ler tudo mais a nova mensagem. Então imagine que essa nova mensagem tinha mil
00:07:05tokens. Essa mensagem de seguimento de mil tokens não é cobrada a 1 dólar por milhão. É cobrada a 20 dólares
00:07:14por milhão. Então, para mil tokens, quanto dá isso? Uns dois centavos ou algo assim? Não sei.
00:07:18Minha matemática provavelmente está errada, mas o ponto é que o histórico custa 1 dólar. A nova custa 20 dólares por mês porque está em cache.
00:07:26Agora, da próxima vez que enviarmos uma mensagem, mesmo cenário, exceto que estes mil tokens agora farão parte daquele
00:07:32documento de cache. Faz sentido, né? Ok. Esse é o cenário um. Cenário dois, não temos cache. Esperamos uma hora
00:07:40para enviá-la. Certo para enviá-la. Bem, em vez de isso custar 50 centavos, agora vamos
00:07:47ser cobrados a uma taxa de leitura de cache, desculpe, a uma taxa de gravação em cache, que lembre-se, é de 20 dólares por milhão. Então quanto
00:07:54isso vai custar? Bem, agora esta única mensagem está nos custando uns 10 dólares. Então fomos de 50 centavos para
00:08:0010 dólares só porque esperamos uma hora. Essas são as consequências de não entender
00:08:05isso. Agora, o tempo não é a única coisa em que temos de pensar quando se trata de perder o cache. Há
00:08:10outras coisas que o reiniciam completamente. E isto vem diretamente da documentação do Cloud Code.
00:08:14Se você mudar de modelo, sabe, está no Fable e muda para o Opus e está com 500.000 tokens acumulados,
00:08:20isso já era. O cache é reiniciado. Nível de esforço, se for alterado. Modo rápido, conectar ou desconectar
00:08:26um servidor MCP, plugins, negar ferramentas, compactar a conversa ou simplesmente atualizar o Cloud Code em
00:08:32geral. Qualquer uma dessas coisas reiniciará o cache e a sua próxima mensagem será 20 vezes mais cara
00:08:38do que precisa ser. Dito tudo isto, o que você pode realmente fazer com essa informação?
00:08:42O que você faz quando está em uma posição em que precisa se afastar de uma conversa
00:08:46que contém muitas informações importantes, mas você vai ficar fora por mais de uma hora,
00:08:50ou se afastou por mais de uma hora e está voltando agora percebendo: “Poxa,
00:08:54eu acabei não pensando nisso antes.” Bem, é disso que falaremos na dica número dois.
00:08:59Mas primeiro, uma breve palavra do patrocinador de hoje: eu mesmo. Então, esta semana, estou lançando uma versão completamente atualizada
00:09:06do meu Cloud Code Masterclass dentro do Chase AI+. Muita coisa mudou desde que eu lancei
00:09:12isso. Eu atualizo o tempo todo. Mas, fundamentalmente, percorremos um longo caminho desde março, quando lancei
00:09:19essa ferramenta. Então, se você é alguém que está tentando elevar o nível do seu jogo com IA, alguém que definitivamente
00:09:24não vem de um background técnico e quer um roteiro para saber de fato como usar essa ferramenta
00:09:28do zero e algo que foque em casos de uso reais, então isto é para você. Está dentro
00:09:33do Chase AI+. Há um link para ele no comentário fixado. Agora, a dica número dois trata de todas as suas
00:09:37opções quando perdemos o cache. Nós nos afastamos por muito tempo. Temos alguma conversa que tem dois,
00:09:42três, quatro, quinhentos mil tokens de comprimento. E queremos saber qual deve ser o próximo passo
00:09:47em vez de pagar esses custos absurdos. E isso depende um pouco de qual é o seu cenário.
00:09:52Agora, nossa primeira opção é meio que a opção nuclear, que é simplesmente usar a barra invertida clear.
00:09:58O comando clear vai apenas apagar todo o histórico da conversa. E isso nem sempre é uma coisa ruim.
00:10:04Na verdade, se você estiver trabalhando em algum tipo de base de código, algum tipo de projeto com.
00:10:10vários arquivos e bastante contexto, você provavelmente só vai querer dar um clear.
00:10:15Seja lá no que você estivesse trabalhando, do que estivesse falando, é provável que haja evidências no próprio projeto.
00:10:20sobre o que aconteceu. O Cloud Code pode simplesmente dar uma olhada nisso. E quando você inicia uma nova conversa.
00:10:25do zero, ele consegue juntar as peças e te trazer de volta para onde você estava. Você não precisa ser escravo.
00:10:31da conversa anterior. Agora, sua segunda opção é usar a compactação. Existe um recurso de compactação automática.
00:10:38dentro do Cloud Code assim que você atinge uma certa quantidade de tokens. Eu sugiro não esperar até.
00:10:42chegar a esse ponto, porque quando estamos trabalhando na faixa de seis, sete, oitocentos mil tokens, estamos.
00:10:47começando a lidar com a degradação de contexto. Ainda é um problema nesses modelos maiores e mais poderosos.
00:10:51mas podemos usar o comando compact a qualquer momento. E o que ele vai fazer por nós é criar um.
00:10:57resumo do que conversamos. E então, para todos os efeitos, ele vai executar o comando.
00:11:03clear, mas vai iniciar uma nova conversa com esse resumo, meio que na memória. Então.
00:11:10se você tinha coisas importantes nessa conversa e acha que o conteúdo da base de código não vai ser.
00:11:15suficiente para ele entender, bem, então basta compactar, use o comando compact. Ele vai iniciar uma nova.
00:11:20conversa com esse resumo. E esse resumo fica armazenado no histórico de mensagens. Agora, sua terceira opção.
00:11:26é muito semelhante à compactação, que consiste em usar algum tipo de ferramenta personalizada de passagem de bastão (handoff). Há várias.
00:11:32habilidades personalizadas de handoff por aí. Eu mesmo tenho uma. Você pode obtê-la dentro da minha comunidade gratuita. E a diferença.
00:11:38entre o handoff e a compactação é onde esse resumo fica armazenado. Então, se eu estiver usando o handoff, o que ele vai fazer.
00:11:46é realmente salvá-lo no meu disco. Ele vai criar um arquivo Markdown real com o resumo contendo.
00:11:51tudo o que eu quiser. E então posso iniciar uma nova conversa e dizer: Ei, Claude Code, dê uma olhada.
00:11:59naquele documento de handoff no disco para se atualizar sobre o que precisa saber. Em contrapartida, na compactação.
00:12:04ele não cria nenhum tipo de arquivo. É apenas uma mensagem no histórico de mensagens daquela conversa.
00:12:10específica que você está tendo. É uma diferença sutil. Mas, para algumas pessoas, é interessante ter um arquivo no.
00:12:15disco. E muitas vezes é um documento dinâmico e vivo que está sendo constantemente atualizado.
00:12:20Então estas são realmente as suas três opções. Você quer apenas limpar tudo e começar do zero?
00:12:26Muitas vezes, isso é totalmente aceitável. Você quer apenas usar o recurso nativo do Claude, compactar e.
00:12:31ter o resumo injetado diretamente? Ou você quer que o resumo seja um documento real que o Claude possa consultar?
00:12:37Nesse caso, use o handoff. Essas são as suas três opções. E muitas vezes elas são melhores do que apenas.
00:12:42enviar uma nova mensagem, porque, no geral, você realmente não deveria estar operando em faixas de 400, 500, 600 mil.
00:12:48tokens de qualquer forma. Agora, a dica número três é sobre roteamento de modelos. Como escolhemos o modelo certo.
00:12:53para o trabalho? Para não ficarmos usando apenas o Fable para tudo. Podemos usar um modelo menor, mais barato e menos inteligente.
00:12:59para tarefas mais simples? A resposta é sim. E podemos abordar isso de várias maneiras diferentes.
00:13:04Podemos usar modelos externos. Poderíamos ir de GPT, Sol. Poderíamos ir de GPT, Luna e Terra, que acabaram de ficar.
00:13:10super baratos. Podemos usar modelos locais, ou temos opções se quisermos permanecer no ecossistema da Anthropic.
00:13:16E a maneira mais fácil de fazer isso, eu acho, é o modo consultor (advisor mode). O que você vê aqui é da postagem.
00:13:22original do blog de consultoria que foi lançada há vários meses. E mostra o Opus e o Sonnet, mas o mesmo sistema.
00:13:29permanece com modelos como o Fable. E a ideia é termos um modelo inteligente como o Fable ou até o Opus aconselhando.
00:13:37um modelo menor como o Sonnet na execução de tarefas. Então o modelo grande elabora um plano, o.
00:13:43modelo pequeno o executa, e o modelo pequeno consegue compartilhar seu contexto com o modelo maior sempre que.
00:13:50encontra problemas. E esse modelo tem apresentado melhores resultados a custos menores. E para trazer nossa.
00:13:54discussão anterior sobre cache de prompt, tanto o consultor quanto o executor têm seu próprio cache de prompt.
00:14:01funcionando ao mesmo tempo. Agora, sua segunda opção é delegar tarefas para modelos fora do Claude.
00:14:06Code. Uma opção fácil é o Codex. Existe um plugin do Codex para o Claude Code, o que torna muito simples.
00:14:12chamar o Codex a partir da interface do Claude Code. Então você poderia ter o Fable essencialmente fazendo o mesmo.
00:14:18tipo de modo consultor, mas em vez de chamar o Opus ou o Sonnet, ele chama os modelos GPT. Existem.
00:14:24outros repositórios como este Fable advisor que fazem exatamente isso. E, no fim das contas, é bem trivial configurar.
00:14:31a sua própria habilidade que faça exatamente isso. E se você está procurando aqueles modelos mais baratos, repito, sugiro muito.
00:14:36olhar para os da GPT, especificamente o Luna e o Terra, porque A, os custos deles foram reduzidos significativamente.
00:14:41e B, realmente não há nenhum modelo na família da Anthropic que faça o que eles fazem.
00:14:48por esse preço. Você pode até dar um passo além e trazer alguns modelos locais se.
00:14:53as tarefas fizerem sentido para isso. Agora, a dica número four é sobre a higiene do seu Claude. Você deve ter visto.
00:14:57recentemente este vídeo circulando de Boris Cherney, o criador do Claude Code, dizendo.
00:15:01você precisa excluir o seu arquivo Claude.md. Bem, será que você realmente precisa excluir esse arquivo Claude.md? Bem.
00:15:07não necessariamente, mas o que você precisa fazer, e isso teve algumas mudanças recentes nas últimas.
00:15:12semanas, é executar o comando doctor. E o que isso tem a ver com tokens?
00:15:18Bem, antes de mais nada, o que esse comando vai fazer, entre outras coisas, mas mantendo.
00:15:23o foco em tokens, é dar uma olhada no seu Claude.md e enxugar esse arquivo..
00:15:30A forma como esses modelos funcionam, especialmente esses modelos da série five, é que eles não precisam de tantas.
00:15:36instruções. Se você olhar o que as pessoas criavam para os Claude.mds há três, seis, nove meses.
00:15:42atrás, eles eram muito prescritivos e extremamente detalhados. E talvez na época, pudesse-se.
00:15:46argumentar que eles precisavam disso. Esse não é mais o caso. E portanto, um Claude.md inchado não apenas.
00:15:53o torna mais lento, como está literalmente custando tokens. E o comando doctor vai analisar isso.
00:15:59e se livrar de coisas no seu Claude.md que simplesmente não precisam estar lá. Em segundo lugar.
00:16:04ele vai examinar elementos que estão prejudicando o seu contexto ou inchando a sua janela de contexto..
00:16:10Porque mesmo quando você inicia uma nova conversa e executa o comando context, há coisas.
00:16:15ocupando espaço. Agora, eu executei o comando doctor recentemente, então eliminei boa parte do meu inchaço.
00:16:20mas é assim que minha janela de contexto se parece bem no início de uma conversa sem nenhuma mensagem.
00:16:25enviada. Já usamos 40.000 tokens. E o que está consumindo muito disso? Bem, parte vem.
00:16:31de coisas como habilidades (skills), como você pode ver aqui. Outra parte inclui o prompt do sistema, bem como.
00:16:36arquivos de memória. O que o comando doctor vai fazer é examinar itens como suas.
00:16:41habilidades, seus MCPs e começar a eliminar aqueles que você simplesmente não tem usado. É uma grande economia.
00:16:47de tokens? Não, mas é algo, é algo nas margens e é uma correção tão simples. Não há.
00:16:53motivo para não fazer, especialmente se você é alguém que vem acumulando 10 milhões de habilidades ao longo.
00:16:58dos últimos seis meses e nunca parou para limpá-las, porque fazer isso.
00:17:03também fará com que suas habilidades sejam acionadas com mais eficiência. E não haverá nenhuma confusão por parte do Claude.
00:17:08sobre qual habilidade ele precisa chamar. Eu aposto que você provavelmente tem umas 10 habilidades aí paradas.
00:17:12que têm a ver com design frontend e você não precisa de todas elas. Então esta dica muito simples e fácil de executar.
00:17:17no que diz respeito à higiene do Claude é imperdível. Apenas execute o doctor. E isso.
00:17:22nos traz à nossa dica final, que eu acho que é a menos eficaz do grupo atualmente, mas que trata-se.
00:17:28de habilidades adicionais e arcabouços (scaffolding) que você vê circulando por aí.
00:17:33O mais popular atualmente é o ponytail e, essencialmente, ele reduz a quantidade de código.
00:17:38que o Claude escreve, mantendo sua eficácia e, portanto, tornando-o mais barato e mais rápido. Agora, eu.
00:17:44fiz um vídeo sobre isso comparando esses números com o que realmente acontece na prática, porque o repositório.
00:17:51do GitHub mostra apenas o haiku 4.5, o que obviamente está muito desatualizado. Quando executei isso usando o Fable, os números.
00:17:56se mantiveram. De fato, os números parecem ainda melhores com modelos superiores. Usei os benchmarks que.
00:18:01foram fornecidos com esse repositório do GitHub. O que funciona para você na realidade pode ser um pouco diferente, dependendo da.
00:18:06complexidade do seu projeto. Mas isso é algo que você pode somar a tudo o que discutimos.
00:18:11até agora, caso queira continuar reduzindo o seu consumo de tokens. Outro que você vai ver bastante é o Caveman.
00:18:18que atualmente afirma reduzir seus tokens de saída em 65%. Há muitas pessoas por aí.
00:18:25que também falam sobre usar apenas frases de efeito no Claude MD, algo tão simples quanto dizer seja breve.
00:18:30o que também vai reduzir seus tokens de saída. Mas lembre-se, os tokens de saída são apenas uma parte do quebra-cabeça.
00:18:36E esse quebra-cabeça, para voltarmos à nossa discussão original, é dominado pelo cache de prompt. Então, se.
00:18:41você não aproveitou mais nada deste vídeo, espero que tenha conseguido entender isso, porque é com isso que.
00:18:46vamos encerrar hoje. Então, como sempre, deixe-me saber o que achou. Não deixe de conferir.
00:18:50o ChaseAI Plus se quiser colocar as mãos na Masterclass do Claude Code. Repito, estou lançando uma enorme.
00:18:55atualização sobre isso esta semana. E fora isso, vejo você por aí.

Key Takeaway

Compreender e manter o cache de prompt ativo evita que conversas longas fiquem até 20 vezes mais caras na API.

Highlights

  • Os tokens de saída custam cerca de cinco vezes o preço de um token de entrada.

  • O cache de prompt ativo reduz o custo de leitura do histórico em até 20 vezes em comparação com a leitura sem cache.

  • O cache de mensagens expira após exatamente uma hora sem nova atividade.

  • O comando doctor no Claude Code remove arquivos e instruções desnecessárias para economizar tokens.

  • A compactação de conversa cria um resumo e inicia uma nova sessão para evitar a degradação de contexto.

Timeline

Funcionamento do sistema de tokens e cache de prompt

  • Cada palavra equivale aproximadamente a um token na moeda dos modelos de linguagem.
  • As mensagens enviadas em sequência reenviam todo o histórico anterior acumulado na janela de contexto.
  • O sistema de cache armazena o histórico de conversas por um período de uma hora sem atividade.
  • A leitura de um histórico em cache custa 1 dólar por milhão de tokens, enquanto a gravação custa 20 dólares.

A compreensão dos custos de tokens revela que mensagens repetidas reenviam dados anteriores para o servidor. O cache de mensagens atua como um documento armazenado temporariamente para reduzir o custo computacional de leitura. A inatividade superior a uma hora, a troca de modelos, ou a modificação de plugins reiniciam o cache, elevando drasticamente o valor cobrado pelas mensagens seguintes.

Opções para lidar com a perda de cache

  • O comando clear apaga todo o histórico da conversa e reinicia o fluxo a partir da base de código.
  • O comando compact gera um resumo automático e inicia uma nova sessão mantendo o contexto essencial.
  • O sistema de handoff salva um arquivo Markdown no disco para consulta dinâmica em novas conversas.

Quando o cache expira após longos períodos de ausência, existem três alternativas principais para evitar custos excessivos. O uso do comando clear descarta o histórico antigo confiando nos arquivos do projeto. A compactação resume o diálogo anterior em uma única mensagem interna, enquanto o handoff cria um documento físico persistente no disco para consultas futuras.

Estratégias de roteamento de modelos e higiene de arquivos

  • O modo consultor utiliza um modelo avançado para planejar tarefas e um modelo menor para executá-las.
  • O comando doctor limpa arquivos Claude.md inchados e remove habilidades desnecessárias.
  • Arcabouços alternativos ajudam a reduzir a quantidade de código gerado e otimizam o consumo de tokens de saída.

O roteamento de modelos diminui os gastos ao delegar tarefas simples para alternativas mais baratas em vez de usar sempre a versão mais potente. A execução periódica do comando doctor elimina instruções obsoletas e reduz o espaço ocupado na janela de contexto antes do início das interações. Ferramentas adicionais complementam essas práticas para manter o uso eficiente de recursos.

Community Posts

View all posts