TuBrief
구독 채널
비디오
커뮤니티

Por que você não deve usar apenas o Claude Sonnet para criar um serviço web sozinho

TuBrief 편집팀
2026년 8월 22일
0
Computing/Software

원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.

Português한국어EnglishEspañol中文العربيةहिन्दीDeutschFrançaisРусскийBahasa Indonesia

관련 영상

O Gemini 3.5 Flash é apenas... ok6:48

O Gemini 3.5 Flash é apenas... ok

Better Stack

커뮤니티의 다른 글

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

2026년 9월 13일

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

2026년 9월 13일

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

2026년 9월 13일

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

2026년 9월 13일

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

2026년 9월 12일

Apple Won the AI Race

2026년 9월 12일

댓글 (0)

Log in to leave a comment

아직 작성된 글이 없습니다

© 2026 . All rights reserved.

TuBrief
구독 채널
비디오
커뮤니티
로그인

Por que você não deve usar apenas o Claude Sonnet para criar um serviço web sozinho

Ao criar e operar um serviço web sozinho com um orçamento mensal inferior a 5 milhões de wons, usar apenas o modelo de IA de mais alto nível fará com que as tarifas de API disparem rapidamente. Se você escolher um modelo de assistência de codificação com base apenas em pontuações de benchmark, ultrapassará o limite de gastos em apenas algumas rodadas no ambiente de desenvolvimento real. Ao compreender o consumo de tokens por etapa de trabalho e dividir o uso entre diferentes modelos, você pode manter a velocidade de desenvolvimento enquanto reduz os gastos com API em mais de 30%.


1. Consumo real de tokens e fórmula de cálculo ao desenvolver sozinho

O desenvolvimento de serviços web é dividido em prototipagem, escrita de lógica central, refatoração e depuração. Supondo uma média de 50 chamadas diárias e 1.000 chamadas de API por mês (com base em 20 dias), a proporção de tokens de entrada varia significativamente em cada etapa de trabalho. Na etapa de depuração, onde logs de erro e códigos anteriores se acumulam em uma única janela de chat, os tokens de entrada disparam para até 45.000 de uma só vez, e a escrita de lógica de backend também exige entradas altas da ordem de 25.000.

Etapa de Desenvolvimento Chamadas Mensais Média de Tokens de Entrada por Chamada Média de Tokens de Resposta por Chamada Total de Tokens de Entrada Mensais Total de Tokens de Resposta Mensais
Prototipagem e design inicial 150 3.000 1.500 450.000 225.000
Implementação da lógica central 450 25.000 2.000 11.250.000 900.000
Refatoração e revisão de código 200 15.000 1.000 3.000.000 200.000
Depuração e rastreamento de erros 200 45.000 2.500 9.000.000 500.000
Total Mensal 1.000 -- -- 23.700.000 1.825.000

Ao calcular os gastos com API, você deve incluir a diferença de preço unitário entre os tokens de entrada e de resposta. Como os tokens de resposta utilizam recursos de computação em tempo real, eles são de 3 a 5 vezes mais caros do que os tokens de entrada. O custo total mensal é calculado pela seguinte fórmula:

ext{Cost}*{ ext{monthly}} = sum*{m} left( rac{T_{ ext{input}, m}}{1.000.000} cdot P_{ ext{input}, m} + rac{T_{ ext{cache}, m}}{1.000.000} cdot P_{ ext{cache}, m} + rac{T_{ ext{output}, m}}{1.000.000} cdot P_{ ext{output}, m} ight)

Se você processar todas as tarefas com um único modelo, o Claude 3.5 Sonnet ($3,00 por 1M de entrada, $15,00 por 1M de resposta), com base no total mensal (cerca de 23,7 milhões de entradas, cerca de 1,825 milhão de respostas), o custo será de $98,48 por mês. O problema surge quando o chat fica longo e o contexto se acumula. Se o volume de entrada aumentar em 3 vezes, os gastos mensais ultrapassam imediatamente os $250. Um desenvolvedor solo deve definir o limite superior de IA entre $100 e 150,oquerepresentamenosde10150, o que representa menos de 10% do orçamento total de operação, e configurar alertas de 50% (150,oquerepresentamenosde1050) e 80% ($80) junto com um bloqueio forçado (Hard Limit) de 100% no console do provedor para garantir a segurança.


2. Exclusão de arquivos desnecessários e cache de prompts

Se você inserir a pasta inteira do projeto diretamente em um agente de codificação, arquivos auxiliares como node_modules, dist/ e package-lock.json serão incluídos, fazendo com que 60% a 70% dos tokens de entrada vão pelo ralo. É melhor usar a ferramenta CLI Repomix para selecionar e empacotar apenas os arquivos de lógica de negócios necessários.

json { "output": { "filePath": "repomix-output.xml", "style": "xml", "removeComments": true, "removeEmptyLines": true }, "ignore": { "useGitignore": true, "useDefaultPatterns": true, "customPatterns": [ "**/node_modules/<strong>", "</strong>/dist/<strong>", "</strong>/*.test.ts", "**/*.spec.ts", "<strong>/package-lock.json", "</strong>/yarn.lock", "**/*.public/<strong>", "</strong>/*.svg" ] } }

Aplique o cache de prompts nos prompts de sistema e no código de bibliotecas comuns. No caso da API do Anthropic Claude, se você inserir um ponto de interrupção cache_control em um prompt de sistema com 1.024 tokens ou mais, ao fazer uma nova solicitação dentro de 5 minutos após a criação inicial, será aplicada uma tarifa de leitura de cache com 90% de desconto de $0,30/1M.

json { "model": "claude-3-5-sonnet-20241022", "max_tokens": 2048, "system": [ { "type": "text", "text": "O usuário é um desenvolvedor solo especializado em TypeScript e Next.js. Retorne apenas o código de acordo com as especificações precisas de interface.", "cache_control": {"type": "ephemeral"} } ], "messages": [ { "role": "user", "content": "Conteúdo do arquivo de definição de esquema de BD comum..." } ] }

As maneiras de reduzir o comprimento do prompt podem ser resumidas em três etapas:

  • Ao executar o Repomix, use a opção --compress para remover partes de implementação interna e extrair apenas interfaces e assinaturas de funções.
  • Adicione os sinalizadores --remove-comments e --remove-empty-lines para eliminar comentários e espaços em branco. O comprimento dos tokens será reduzido em mais 15% a 20%.
  • Envolva os blocos de código extraídos em tags XML em vez de texto simples para evitar confusão do modelo durante a análise.

3. Separação de modelos usados para rascunhos de UI e lógica de backend

Não há necessidade de usar um modelo caro para o posicionamento simples de componentes ou trabalho de estilo com Tailwind CSS. Para rascunhos de UI frontend, use o Gemini 2.0 Flash ($0,10/1M de entrada, 0,40/1Mderesposta)ouoGPT−4omini(0,40/1M de resposta) ou o GPT-4o mini (0,40/1Mderesposta)ouoGPT−4omini(0,15/1M de entrada, $0,60/1M de resposta), que processam contextos longos de forma econômica.

Área de Trabalho Detalhes da Tarefa Modelo Recomendado Motivo da Escolha
UI Frontend Criação de Tailwind CSS com base em capturas de tela, construção de layout HTML Gemini 2.0 Flash Processamento multimodal econômico e velocidade de resposta rápida
Backend Comum Implementação de API RESTful, CRUD básico de BD, validação de valores de entrada DeepSeek V3 Desempenho aceitável com 1/10 do custo unitário em comparação com o Claude
Backend Avançado Múltiplas transações, controle de concorrência, refatoração complexa, verificação de segurança Claude 3.5 Sonnet Substituição pontual quando erros se repetem em modelos inferiores

Escreva a lógica de CRUD geral ou de API pontual usando o DeepSeek V3 ($0,25/1M de entrada, $0,95/1M de resposta), cujo custo unitário é de cerca de 1/10 do Claude 3.5 Sonnet. Mude para o Claude 3.5 Sonnet apenas quando erros não puderem ser resolvidos em códigos difíceis, como consultas complexas envolvendo várias tabelas ou transações de controle de concorrência.

O método de conexão para reduzir o desperdício de contexto entre os dois modelos é o seguinte:

  • Extraia apenas a Interface TypeScript (Props e Estado), excluindo o código completo, dos componentes de UI gerados com o Gemini 2.0 Flash.
  • Crie um esquema JSON leve contendo métodos HTTP, caminhos de URL e corpos de solicitação e resposta com o propósito de passá-lo para o backend.
  • Entregue apenas este esquema ao DeepSeek V3 para implementar os endpoints da API de backend. Você pode economizar 15.000 tokens por sessão e reduzir o tempo total de desenvolvimento em cerca de 5 horas.

4. Bloqueio do loop de autofechamento e critérios de verificação prática

Como os benchmarks públicos são medidos com consultas pontuais, eles diferem do ambiente de um agente de codificação (como o Aider). Se o chat continuar por mais de 10 rodadas, o histórico de conversas anteriores é enviado junto a cada vez, custando de $1 a $2 apenas para corrigir um único erro de digitação.

Se o agente cair em um loop de autofechamento, onde ele conserta o código sozinho e o executa novamente após uma falha no teste, de $20 a $50 escapam em poucos minutos. Para evitar isso, você deve estabelecer três critérios de controle:

  • Defina o número máximo de repetições autônomas sem intervenção humana (Max Iterations) para 3 a 5 vezes nas opções de execução do agente.
  • Em vez de passar todo o log de erro, corte e insira apenas a mensagem principal dentro das 20 linhas superiores.
  • Se as modificações persistirem no mesmo local do arquivo por três vezes ou mais, encerre o processo à força imediatamente e verifique o código você mesmo.
Item de Verificação Conteúdo Detalhado da Revisão Método de Execução e Verificação
Isolamento de Prompts Configuração de arquivos ignorados e verificação do tamanho do empacotamento Medição prévia do número de tokens empacotados após a aplicação de .gitignore, repomix.config.json
Distribuição de Modelos Designação de modelos por dificuldade da tarefa Designar Gemini Flash para UI, DeepSeek V3 para CRUD, Claude Sonnet para lógica avançada
Cache de Prompts Verificação da unidade mínima de tokens e do ponto de interrupção Inserir cache_control após confirmar que o prompt do sistema tem 1.024 tokens ou mais
Limite de Gastos e Restrição de Loop Configuração de dispositivos de interrupção segura Limitar as repetições autônomas do agente a 5 ou menos, definir o limite de gastos no console do provedor de API

O ponto importante ao usar IA para codificação não é anexar cegamente o modelo caro mais recente, mas controlar as ferramentas de acordo com as características da tarefa. Ao estimar o orçamento com fórmulas de cálculo de tokens, cortar prompts com o Repomix e misturar modelos para se adequar à natureza do trabalho, você pode concluir produtos sem o peso dos custos.