TuBrief
Subscribed Channels
Videos
Community

Refatoração de Agentes para a Era do Claude 4: Abandonando o Sharding Complexo e Implementando o Loop de 3 Agentes via Código

TuBrief Editorial
March 31, 2026
0
Computing/Software

Written with AI assistance from the source video. The video is the authority.

Português한국어EspañolEnglish中文हिन्दीDeutschFrançaisРусскийBahasa Indonesia日本語العربية

Related Video

A Anthropic Acabou de Matar seus Frameworks de Agentes de IA14:02

A Anthropic Acabou de Matar seus Frameworks de Agentes de IA

AI LABS

More from the community

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

September 13, 2026

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

September 13, 2026

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

September 13, 2026

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

September 13, 2026

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

September 12, 2026

Apple Won the AI Race

September 12, 2026

Comments (0)

Log in to leave a comment

No posts yet

© 2026 . All rights reserved.

TuBrief
Subscribed Channels
Videos
Community
Log in

Refatoração de Agentes para a Era do Claude 4: Abandonando o Sharding Complexo e Implementando o Loop de 3 Agentes via Código

Estratégia de Migração de Dados de Sharding Legado para Loop de 3 Agentes

O micro-sharding impulsionado pelo LangChain original ou AutoGPT falhou. Dividir etapas em dezenas de pedaços pode fazer com que a cadeia lógica pareça sofisticada, mas, na realidade, o contexto é cortado a cada chamada, aumentando apenas a indeterminação. Ao usar LLMs com capacidades de raciocínio que saltaram drasticamente, como o Claude 3.5 ou o futuro modelo 4, é preciso mudar a estratégia. Não lute com nós fragmentados. Em vez disso, integre-os em uma estrutura de gerenciamento de estado centralizada controlada por um Planner.

Para uma transição de arquitetura bem-sucedida, primeiro agrupe as micro-tarefas existentes como métodos dentro de uma única classe, encapsulando-as em um repositório de ferramentas (Tool Box). Em seguida, defina um objeto de State único que todos os agentes consultem. Este objeto deve conter obrigatoriamente os campos plan (plano passo a passo), history (log de execução de ferramentas) e artifacts (dados gerados).

Aproveite a função reducer do LangGraph para fazer com que cada agente atualize este estado compartilhado ao concluir uma tarefa. Ao bloquear fisicamente a desconexão de contexto, a transmissão redundante de tokens desaparece. Equipes que mudaram para esta estrutura relataram uma redução imediata de mais de 30% nos custos de API.

Implementação de Código de Tabela de Pontuação Quantitativa para o Evaluator

Julgamentos subjetivos de que o resultado do agente "parece bom" são como bombas-relógio em ambientes de produção. Adote o padrão LLM-as-a-Judge, mas force-o obrigatoriamente ao nível do código. O agente Evaluator deve decompor o resultado do Generator em quatro indicadores: precisão, consistência, legibilidade e eficiência, convertendo-os em números.

Use a biblioteca Pydantic para forçar que os resultados da avaliação sigam um esquema JSON específico.

  • Declare uma classe RubricScore e configure cada indicador como um campo de número inteiro entre 1 e 5.
  • Especifique no prompt condições de satisfação detalhadas para cada faixa de pontuação (ex: nota 5 em eficiência é atribuída ao atingir complexidade de tempo de O(n)O(n)O(n) ou inferior).
  • Se a pontuação média for inferior a 4.0, execute um Merge Block para interromper automaticamente a implantação no pipeline de CI/CD e enviar um sinal de retrabalho.

Estabelecer esse sistema de verificação automatizada reduz o trabalho de validação, que levava 5 horas com comparação humana, para menos de 10 minutos. A pontuação mecânica é fria, mas aumenta a previsibilidade do sistema na mesma proporção.

Otimização de Custos Usando Anthropic Prompt Caching

Assim que o loop do agente começa a girar, os tokens acumulam-se a uma velocidade assustadora. Enviar instruções do sistema e definições de ferramentas toda vez é jogar dinheiro fora. O Prompt Caching do Claude cobra apenas cerca de 10% da tarifa normal para tokens em cache. Para aproveitar este benefício, você deve usar uma estratégia de correspondência de prefixo, organizando a estrutura do prompt da parte estática para a dinâmica (Tools → System → Messages).

  • Coloque as instruções imutáveis e as definições de ferramentas no topo e defina um ponto de interrupção cache_control.
  • Use tags <system-reminder> dentro das mensagens do usuário para inserir informações variáveis. Isso garante que o cache do prefixo superior não seja quebrado.
  • Posicione pontos de interrupção adicionais estrategicamente a cada janela de look-back de 20 blocos à medida que a conversa se alonga.

Se a estratégia de cache for bem projetada, os custos de chamada de API podem ser reduzidos em até 90%. A velocidade de resposta também se torna visivelmente mais rápida. É a única forma de ganhar tempo e dinheiro simultaneamente.

Design de Circuit Breaker para Prevenção de Loops Infinitos

Se o Generator e o Evaluator forem teimosos e não chegarem a um acordo, o agente entrará em um deadlock. Isso não é apenas um erro simples, mas um desastre que leva à explosão de custos. Para evitar isso, é necessário um Circuit Breaker de múltiplas camadas que monitore o número de execuções e a similaridade das respostas. Especialmente se a similaridade de cosseno entre a resposta anterior e a atual for 0.95 ou superior, é um sinal claro de que o agente está repetindo a mesma coisa e girando em um loop estúpido.

  1. Insira um contador no loop principal que limite o número máximo de turnos (Max-Turn Limit) por sessão a 15 vezes.
  2. Estabeleça um teto de orçamento (Budget Cap) por sessão e monitore-o em tempo real no API Gateway.
  3. Quando o disjuntor for acionado, resuma imediatamente o traço de execução, envie-o para o Slack e solicite a intervenção de um humano (Human-in-the-loop).

Dar plenos poderes a um agente não é coragem, é irresponsabilidade. É melhor não operar sistemas de agentes sem dispositivos de segurança.

Dashboard de Observabilidade Exclusivo para Times de Agentes

O processo de três agentes trabalhando de forma mista é uma caixa-preta. Se você não sabe onde ocorrem os gargalos, a melhoria é impossível. Conecte um sistema de rastreamento que siga o padrão OpenTelemetry para visualizar o fluxo de mensagens entre os agentes. Implementar o checkpointing baseado em Redis permite retomar do último ponto de sucesso em vez de recomeçar do zero se o sistema falhar.

Extraia o valor cache_read_input_tokens dos cabeçalhos de resposta da API e plote-os no dashboard. Se a taxa de hit do cache for baixa, é prova de que a estrutura do prompt está errada. Além disso, ao transformar em métrica a velocidade com que o loop converge, você pode provar o desempenho da engenharia de prompt com números. Armazenar IDs de sessão e versões de artefatos no PostgreSQL permite revisar com precisão em que pontos o time de agentes teve dificuldades no passado. Agentes que não são registrados nunca se tornam inteligentes.