Por que você não deve usar apenas o Claude Sonnet para criar um serviço web sozinho
TuBrief 편집팀
2026년 8월 22일
0
Computing/Software원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
커뮤니티의 다른 글
댓글 (0)
Log in to leave a comment
아직 작성된 글이 없습니다
원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
Log in to leave a comment
아직 작성된 글이 없습니다
Ao criar e operar um serviço web sozinho com um orçamento mensal inferior a 5 milhões de wons, usar apenas o modelo de IA de mais alto nível fará com que as tarifas de API disparem rapidamente. Se você escolher um modelo de assistência de codificação com base apenas em pontuações de benchmark, ultrapassará o limite de gastos em apenas algumas rodadas no ambiente de desenvolvimento real. Ao compreender o consumo de tokens por etapa de trabalho e dividir o uso entre diferentes modelos, você pode manter a velocidade de desenvolvimento enquanto reduz os gastos com API em mais de 30%.
O desenvolvimento de serviços web é dividido em prototipagem, escrita de lógica central, refatoração e depuração. Supondo uma média de 50 chamadas diárias e 1.000 chamadas de API por mês (com base em 20 dias), a proporção de tokens de entrada varia significativamente em cada etapa de trabalho. Na etapa de depuração, onde logs de erro e códigos anteriores se acumulam em uma única janela de chat, os tokens de entrada disparam para até 45.000 de uma só vez, e a escrita de lógica de backend também exige entradas altas da ordem de 25.000.
| Etapa de Desenvolvimento | Chamadas Mensais | Média de Tokens de Entrada por Chamada | Média de Tokens de Resposta por Chamada | Total de Tokens de Entrada Mensais | Total de Tokens de Resposta Mensais |
|---|---|---|---|---|---|
| Prototipagem e design inicial | 150 | 3.000 | 1.500 | 450.000 | 225.000 |
| Implementação da lógica central | 450 | 25.000 | 2.000 | 11.250.000 | 900.000 |
| Refatoração e revisão de código | 200 | 15.000 | 1.000 | 3.000.000 | 200.000 |
| Depuração e rastreamento de erros | 200 | 45.000 | 2.500 | 9.000.000 | 500.000 |
| Total Mensal | 1.000 | -- | -- | 23.700.000 | 1.825.000 |
Ao calcular os gastos com API, você deve incluir a diferença de preço unitário entre os tokens de entrada e de resposta. Como os tokens de resposta utilizam recursos de computação em tempo real, eles são de 3 a 5 vezes mais caros do que os tokens de entrada. O custo total mensal é calculado pela seguinte fórmula:
ext{Cost}*{ ext{monthly}} = sum*{m} left( rac{T_{ ext{input}, m}}{1.000.000} cdot P_{ ext{input}, m} + rac{T_{ ext{cache}, m}}{1.000.000} cdot P_{ ext{cache}, m} + rac{T_{ ext{output}, m}}{1.000.000} cdot P_{ ext{output}, m} ight)Se você processar todas as tarefas com um único modelo, o Claude 3.5 Sonnet ($3,00 por 1M de entrada, $15,00 por 1M de resposta), com base no total mensal (cerca de 23,7 milhões de entradas, cerca de 1,825 milhão de respostas), o custo será de $98,48 por mês. O problema surge quando o chat fica longo e o contexto se acumula. Se o volume de entrada aumentar em 3 vezes, os gastos mensais ultrapassam imediatamente os $250. Um desenvolvedor solo deve definir o limite superior de IA entre $100 e 50) e 80% ($80) junto com um bloqueio forçado (Hard Limit) de 100% no console do provedor para garantir a segurança.
Se você inserir a pasta inteira do projeto diretamente em um agente de codificação, arquivos auxiliares como node_modules, dist/ e package-lock.json serão incluídos, fazendo com que 60% a 70% dos tokens de entrada vão pelo ralo. É melhor usar a ferramenta CLI Repomix para selecionar e empacotar apenas os arquivos de lógica de negócios necessários.
json { "output": { "filePath": "repomix-output.xml", "style": "xml", "removeComments": true, "removeEmptyLines": true }, "ignore": { "useGitignore": true, "useDefaultPatterns": true, "customPatterns": [ "**/node_modules/<strong>", "</strong>/dist/<strong>", "</strong>/*.test.ts", "**/*.spec.ts", "<strong>/package-lock.json", "</strong>/yarn.lock", "**/*.public/<strong>", "</strong>/*.svg" ] } }
Aplique o cache de prompts nos prompts de sistema e no código de bibliotecas comuns. No caso da API do Anthropic Claude, se você inserir um ponto de interrupção cache_control em um prompt de sistema com 1.024 tokens ou mais, ao fazer uma nova solicitação dentro de 5 minutos após a criação inicial, será aplicada uma tarifa de leitura de cache com 90% de desconto de $0,30/1M.
json { "model": "claude-3-5-sonnet-20241022", "max_tokens": 2048, "system": [ { "type": "text", "text": "O usuário é um desenvolvedor solo especializado em TypeScript e Next.js. Retorne apenas o código de acordo com as especificações precisas de interface.", "cache_control": {"type": "ephemeral"} } ], "messages": [ { "role": "user", "content": "Conteúdo do arquivo de definição de esquema de BD comum..." } ] }
As maneiras de reduzir o comprimento do prompt podem ser resumidas em três etapas:
--compress para remover partes de implementação interna e extrair apenas interfaces e assinaturas de funções.--remove-comments e --remove-empty-lines para eliminar comentários e espaços em branco. O comprimento dos tokens será reduzido em mais 15% a 20%.Não há necessidade de usar um modelo caro para o posicionamento simples de componentes ou trabalho de estilo com Tailwind CSS. Para rascunhos de UI frontend, use o Gemini 2.0 Flash ($0,10/1M de entrada, 0,15/1M de entrada, $0,60/1M de resposta), que processam contextos longos de forma econômica.
| Área de Trabalho | Detalhes da Tarefa | Modelo Recomendado | Motivo da Escolha |
|---|---|---|---|
| UI Frontend | Criação de Tailwind CSS com base em capturas de tela, construção de layout HTML | Gemini 2.0 Flash | Processamento multimodal econômico e velocidade de resposta rápida |
| Backend Comum | Implementação de API RESTful, CRUD básico de BD, validação de valores de entrada | DeepSeek V3 | Desempenho aceitável com 1/10 do custo unitário em comparação com o Claude |
| Backend Avançado | Múltiplas transações, controle de concorrência, refatoração complexa, verificação de segurança | Claude 3.5 Sonnet | Substituição pontual quando erros se repetem em modelos inferiores |
Escreva a lógica de CRUD geral ou de API pontual usando o DeepSeek V3 ($0,25/1M de entrada, $0,95/1M de resposta), cujo custo unitário é de cerca de 1/10 do Claude 3.5 Sonnet. Mude para o Claude 3.5 Sonnet apenas quando erros não puderem ser resolvidos em códigos difíceis, como consultas complexas envolvendo várias tabelas ou transações de controle de concorrência.
O método de conexão para reduzir o desperdício de contexto entre os dois modelos é o seguinte:
Como os benchmarks públicos são medidos com consultas pontuais, eles diferem do ambiente de um agente de codificação (como o Aider). Se o chat continuar por mais de 10 rodadas, o histórico de conversas anteriores é enviado junto a cada vez, custando de $1 a $2 apenas para corrigir um único erro de digitação.
Se o agente cair em um loop de autofechamento, onde ele conserta o código sozinho e o executa novamente após uma falha no teste, de $20 a $50 escapam em poucos minutos. Para evitar isso, você deve estabelecer três critérios de controle:
| Item de Verificação | Conteúdo Detalhado da Revisão | Método de Execução e Verificação |
|---|---|---|
| Isolamento de Prompts | Configuração de arquivos ignorados e verificação do tamanho do empacotamento | Medição prévia do número de tokens empacotados após a aplicação de .gitignore, repomix.config.json |
| Distribuição de Modelos | Designação de modelos por dificuldade da tarefa | Designar Gemini Flash para UI, DeepSeek V3 para CRUD, Claude Sonnet para lógica avançada |
| Cache de Prompts | Verificação da unidade mínima de tokens e do ponto de interrupção | Inserir cache_control após confirmar que o prompt do sistema tem 1.024 tokens ou mais |
| Limite de Gastos e Restrição de Loop | Configuração de dispositivos de interrupção segura | Limitar as repetições autônomas do agente a 5 ou menos, definir o limite de gastos no console do provedor de API |
O ponto importante ao usar IA para codificação não é anexar cegamente o modelo caro mais recente, mas controlar as ferramentas de acordo com as características da tarefa. Ao estimar o orçamento com fórmulas de cálculo de tokens, cortar prompts com o Repomix e misturar modelos para se adequar à natureza do trabalho, você pode concluir produtos sem o peso dos custos.