Comment diviser les grands prompts pour réduire le gaspillage de jetons des agents
TuBrief 편집팀
2026년 3월 14일
0
Computing/Software원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
커뮤니티의 다른 글
댓글 (0)
Log in to leave a comment
아직 작성된 글이 없습니다
원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
Log in to leave a comment
아직 작성된 글이 없습니다
Une structure monolithique qui entasse toutes sortes de directives et d'outils dans un seul prompt système montre rapidement ses limites. Dès que la conversation s'allonge un tant soit peu, l'agent oublie les consignes écrites au milieu du prompt. En raison de la transmission redondante de dizaines de milliers de jetons à chaque requête, les coûts d'inférence s'envolent et il faut attendre longtemps avant que le premier jeton n'apparaisse.
Dans la pratique, ce problème est résolu par une structure de chargement contextuel progressif basée sur la spécification ouverte agentskills.io. Cette approche consiste à appeler les compétences appropriées uniquement au moment opportun afin d'économiser des jetons.
Un prompt système monolithique doit être divisé en fonction des frontières de domaine, des autorisations d'exécution d'outils et de la fréquence d'exécution. Il convient de maintenir à 3 ou moins le nombre de compétences activées simultanément dans une même session afin d'éviter les conflits entre compétences lors de la recherche de similarité par similarisation d'embeddings.
En haut du fichier de compétence séparé, on indique un front-matter YAML précisant un identifiant utilisant uniquement des tirets, des lettres minuscules anglaises et des chiffres, ainsi que l'objectif opérationnel.
name: backend-api-generator
description: Generates Spring Boot REST API controller and service boilerplate code. Use when the user asks to create API endpoints, build REST controllers, or define DTO mappings for backend services.
when_to_use:
`
Le processus de création d'une structure de chargement progressif est simple :
En remplaçant la structure monolithique, qui occupait en permanence 15 000 à 30 000 jetons, par une structure de chargement différé SKILL.md, le surdébit de jetons initial est réduit de plus de 90 %. Selon les données de test internes d'Anthropic, cela permet de réduire la latence p95 de 12 % à 40 % et d'économiser 29,6 % de la consommation moyenne de jetons par conversation.
Lorsque plusieurs compétences sont chargées en chaîne, il arrive fréquemment que les directives de la compétence précédente restent dans la session et faussent la tâche suivante. Pour les inspections à haut risque ou les tâches générant beaucoup de journaux, il est nécessaire d'isoler les processus au niveau du système en insérant un paramètre de ramification de sous-contexte (context: fork) dans le front-matter YAML.
`
Il est également indispensable de définir clairement le contrat de données d'entrée/sortie (Data Contract).
allowed-tools) dans les métadonnées YAML pour empêcher l'exécution arbitraire de Bash ou les appels réseau inconsidérés.`markdown
All responses must strictly adhere to the following JSON structure without markdown wrapping:
{
"status": "SUCCESS" | "FAILED",
"generated_files": [
{
"path": "string",
"content": "string"
}
],
"error_message": "string | null"
}
`
L'isolation en sous-processus permet d'éviter que les journaux d'appel d'outils ne submergent la session principale. La session de conversation principale restant propre, la probabilité d'erreurs lors de l'échange de données entre sous-agents diminue également.
Si les exigences sont vagues ou si les erreurs d'appel d'outils se répètent, l'agent tombe dans une boucle de nouvelle tentative infinie. C'est le moment où des dizaines de dollars de frais d'API s'envolent en quelques minutes. L'intégration d'une liste de contrôle de vérification statique étape par étape (Verification Checklist) dans le corps du fichier de compétence permet à l'agent d'effectuer lui-même des vérifications avant de terminer sa tâche.
`markdown
Before declaring the task finished, you MUST sequentially execute the following verification checklist:
`
La méthode de création d'un coupe-circuit (Circuit Broker) pour interrompre physiquement la boucle est également simple.
MAXIMUM_TOOL_CALL_LIMIT: 3) en haut de la compétence.`markdown
[SKILL EXECUTION HALTED]
Skill Name: backend-api-generator
Failure Reason: [Brief error description]
Attempts Made: [Number of retries]
Suggested Action: [Action required by backend developer]
`
Pour les tâches dangereuses telles que la suppression de fichiers ou la réinitialisation de bases de données, il est plus sûr d'activer l'option disable-model-invocation: true. Cela empêche l'agent d'effectuer l'appel de lui-même et limite son exécution au seul cas où le développeur saisit directement la commande slash (/skill-name).
Lorsque les membres de l'équipe rédigent des compétences ensemble, il est nécessaire de suivre l'architecture de répertoire standard agentskills.io pour éviter les problèmes de conflits de fichiers Markdown. Le corps, les scripts CLI, la documentation de référence et les actifs de modèles statiques doivent être clairement répartis et placés dans le dossier parent.
| Chemin du répertoire et du fichier | Rôle | Consignes de rédaction |
|---|---|---|
| skills/api-generator/SKILL.md | Document de point d'entrée obligatoire | Contient le front-matter YAML et les consignes de procédure clés (moins de 500 lignes) |
| skills/api-generator/scripts/ | Dossier de code exécutable | Emplacement des scripts CLI Python/Bash appelés par l'agent si nécessaire |
| skills/api-generator/references/ | Dossier de documentation de référence auxiliaire | Hébergement des spécifications d'API volumineuses, schémas de BD, guides de style |
| skills/api-generator/assets/ | Dossier de modèles de ressources statiques | Stockage du code généré (boilerplate) et d'exemples de fichiers de configuration |
Pour vérifier la qualité des compétences, il convient d'utiliser le framework d'évaluation promptfoo.
promptfooconfig.yaml.npx promptfoo@latest eval dans le terminal pour mesurer le taux de respect des consignes.`yaml
description: "Backend Agent Skills Validation Suite"
prompts:
`
Pour le déploiement, combinez une stratégie de développement basée sur le tronc (trunk-based development) utilisant des branches à courte durée de vie avec des tags Git (v1.2.0). Si l'agent se comporte de manière erronée en production, vous pouvez immédiatement revenir à la version précédente à l'aide de la commande git checkout tags/v1.1.0 -b hotfix/rollback.