TuBrief
구독 채널
비디오
커뮤니티

Como dividir prompts gigantes para reduzir o desperdício de tokens de agentes

TuBrief 편집팀
2026년 3월 14일
0
Computing/Software

원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.

Português한국어EnglishEspañol中文العربيةहिन्दीDeutschFrançaisРусскийBahasa Indonesia日本語

관련 영상

▲ Sessão da Comunidade: Como criar e publicar habilidades1:03:28

▲ Sessão da Comunidade: Como criar e publicar habilidades

Vercel

커뮤니티의 다른 글

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

2026년 9월 13일

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

2026년 9월 13일

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

2026년 9월 13일

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

2026년 9월 13일

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

2026년 9월 12일

Apple Won the AI Race

2026년 9월 12일

댓글 (0)

Log in to leave a comment

아직 작성된 글이 없습니다

© 2026 . All rights reserved.

TuBrief
구독 채널
비디오
커뮤니티
로그인

Como dividir prompts gigantes para reduzir o desperdício de tokens de agentes

Uma estrutura monolítica que agrupa todos os tipos de diretrizes e ferramentas em um único prompt de sistema rapidamente mostra suas limitações. Se a conversa se estender um pouco, o agente esquecerá as instruções escritas no meio do prompt. Os custos de inferência dispararem devido ao reenvio redundante dezenas de milhares de tokens a cada solicitação, e você precisa esperar muito tempo até que o primeiro token apareça.

Na prática, esse problema é resolvido com uma estrutura de carregamento de contexto gradual baseada no padrão aberto agentskills.io. É um método de economizar tokens chamando apenas as habilidades apropriadas no momento necessário.

Critérios para separação em arquivos Markdown de habilidades independentes

Os prompts de sistema monolíticos devem ser divididos com base em limites de domínio, permissões de execução de ferramentas e frequência de execução. Você deve manter três ou menos habilidades ativas simultaneamente em uma única sessão para evitar conflitos entre habilidades durante a busca por similaridade de embeddings.

Na parte superior do arquivo de habilidade separado, escreva um Frontmatter em YAML contendo um identificador usando apenas hifens, letras minúsculas em inglês e números, além do propósito de operação.

`yaml

name: backend-api-generator
description: Generates Spring Boot REST API controller and service boilerplate code. Use when the user asks to create API endpoints, build REST controllers, or define DTO mappings for backend services.
when_to_use:

  • User requests new REST API endpoint creation
  • User provides database schema and asks for controller layer implementation
  • Do NOT use for: database migration SQL, frontend component generation
    allowed-tools:
  • read_file
  • write_file
  • list_directory
    effort: medium

`

O processo de criação de uma estrutura de carregamento gradual é simples.

  • Na inicialização do agente, apenas os metadatas do Frontmatter em YAML de todas as habilidades no diretório (cerca de 100 tokens por habilidade) são carregados no prompt.
  • Quando uma solicitação do usuário é recebida, ela é comparada com a descrição da habilidade por similaridade semântica para carregar dinamicamente apenas o corpo da habilidade necessária.
  • Na fase de execução, scripts auxiliares necessários são executados de acordo com as diretrizes do corpo e apenas os valores de resultado são incluídos no contexto.

Substituir a estrutura monolítica que ocupava constantemente de 15.000 a 30.000 tokens por uma estrutura de carregamento tardio SKILL.md reduz o overhead inicial de tokens em mais de 90%. Com base nos dados de testes internos da Anthropic, é possível reduzir a latência p95 de 12% para 40% e economizar uma média de 29,6% no consumo de tokens por conversa.

Restrições internas para evitar a contaminação de contexto

Quando várias habilidades são carregadas em cadeia, as diretrizes da habilidade anterior frequentemente permanecem na sessão e distorcem a próxima tarefa. Para inspeções de alto risco ou tarefas com muitos logs gerados, o isolamento em nível de processo deve ser aplicado adicionando a configuração de ramificação de subcontexto (context: fork) no Frontmatter YAML.

`yaml

name: security-vulnerability-auditor
description: Audits backend source code for OWASP top 10 security flaws. Use when auditing code security or checking for SQL injection vulnerabilities.
context: fork
model: claude-sonnet-4-20250514
effort: high

`

O trabalho de definir claramente os contratos de dados de entrada e saída (Data Contract) também não pode ser omitido.

  • Declare estruturas de argumentos e uma lista de ferramentas permitidas (allowed-tools) nos metadados YAML para evitar a execução arbitrária de comandos Bash ou chamadas de rede indiscriminadas.
  • Especifique regras de esquema de saída no formato JSON puro, sem encapsulamento em Markdown, dentro do corpo.
  • Limite as diretrizes para retornar apenas o resultado final na sessão de conversa.

`markdown

Output Schema Contract

All responses must strictly adhere to the following JSON structure without markdown wrapping:
{
"status": "SUCCESS" | "FAILED",
"generated_files": [
{
"path": "string",
"content": "string"
}
],
"error_message": "string | null"
}

`

O isolamento em subprocessos impede que os logs de chamadas de ferramentas inundem a sessão principal. Como a sessão de conversa principal permanece limpa, a probabilidade de erros durante a troca de dados entre subagentes também diminui.

Projeto de código de defesa para bloquear loops infinitos

Se os requisitos forem vagos ou se os erros de chamada de ferramenta se repetirem, o agente cairá em um loop de tentativas infinitas. É o momento em que dezenas de dólares em custos de API são desperdiçados em poucos minutos. Incluir uma Lista de Verificação de Verificação Estática (Verification Checklist) passo a passo no corpo do arquivo de habilidade faz com que o agente execute verificações por conta própria antes de concluir a tarefa.

`markdown

Execution & Self-Testing Protocol

Before declaring the task finished, you MUST sequentially execute the following verification checklist:

  1. [Pre-check] Verify that all required input parameters are present. If mandatory arguments are missing, STOP immediately and ask the developer for input.
  2. [Generation] Write the requested implementation code.
  3. [Syntax Verification] Check the written code for missing imports, unresolved symbols, and syntax errors.
  4. [Self-Correction] If a syntax error is identified, attempt correction ONCE. Do not re-run the file write tool more than twice for the same error.

`

A criação de um disjuntor (Circuit Breaker) para interromper fisicamente o loop também é simples.

  • Especifique o número máximo de chamadas de ferramentas (MAXIMUM_TOOL_CALL_LIMIT: 3) no topo da habilidade.
  • Escreva restrições para interromper chamadas adicionais de ferramentas se o mesmo código de erro ocorrer duas vezes seguidas.
  • Instrua a parar a execução imediatamente e exibir um modelo de notificação caso a condição de parada seja atingida.

`markdown
[SKILL EXECUTION HALTED]
Skill Name: backend-api-generator
Failure Reason: [Brief error description]
Attempts Made: [Number of retries]
Suggested Action: [Action required by backend developer]

`

É mais seguro aplicar a opção disable-model-invocation: true em tarefas perigosas, como exclusão de arquivos ou exclusão de banco de dados (DROP). Isso impede que o agente as invoque por conta própria e restringe a execução apenas quando o desenvolvedor digita diretamente o comando de barra (/skill-name).

Gerenciamento de versão e implantação em repositório compartilhado para equipes

Ao escrever habilidades em equipe, você deve seguir a arquitetura de diretórios padrão do agentskills.io para evitar problemas com conflitos de arquivos Markdown. Divida e posicione claramente o corpo, scripts CLI, documentos de referência e ativos de modelos estáticos dentro da pasta principal.

Caminho do diretório e arquivo Papel Diretriz de escrita
skills/api-generator/SKILL.md Documento de ponto de entrada obrigatório Contém o Frontmatter YAML e as diretrizes principais de procedimento (dentro de 500 linhas)
skills/api-generator/scripts/ Pasta de código executável Localização dos scripts CLI em Python/Bash chamados pelo agente conforme necessário
skills/api-generator/references/ Pasta de documentos de referência auxiliares Contém especificações de API grandes, esquemas de BD e documentos de guia de estilo
skills/api-generator/assets/ Pasta de modelos de recursos estáticos Armazena boilerplates de código gerado e exemplos de arquivos de configuração

Ao validar a qualidade da habilidade, utilize o framework de avaliação promptfoo.

  • Especifique o caminho do SKILL.md de destino do teste e o modelo LLM no arquivo promptfooconfig.yaml.
  • Escreva casos de teste que verifiquem a correspondência de intenções e a conformidade com o formato JSON.
  • Execute o comando npx promptfoo@latest eval no terminal para medir a taxa de conformidade com as diretrizes.

`yaml
description: "Backend Agent Skills Validation Suite"
prompts:

  • "file://skills/api-generator/SKILL.md"
    providers:
  • id: "anthropic:messages:claude-3-5-sonnet-20241022"
    tests:
  • description: "Test automatic skill activation for REST API generation query"
    vars:
    user_query: "Create a Spring Boot REST Controller for User Management."
    assert:
    • type: icontains
      value: "backend-api-generator"
    • type: javascript
      value: "output.includes('@RestController') && output.includes('ResponseEntity')"

`

Ao implantar, combine uma estratégia de desenvolvimento baseada em tronco usando branches de curta duração com tags do Git (v1.2.0). Se o agente se comportar de forma inesperada em produção, você poderá reverter imediatamente para o ponto da tag anterior usando o comando git checkout tags/v1.1.0 -b hotfix/rollback.