20+ Einstellungen, die 80 % der Einrichtungskosten für Hermes Agent sparen

AAI LABS
Computing/SoftwareManagementInternet Technology

Transcript

00:00:00Seit wir Hermes in die Finger bekommen haben, haben wir eine Menge Workflows damit erstellt, und für die längste Zeit
00:00:04lief alles davon über GPT-Modelle durch unser OpenAI-Abonnement. Das funktionierte anfangs gut.
00:00:09Aber unser ganzes Team nutzt Hermes und jeder hat seine eigenen Flows eingerichtet, und bei so vielen
00:00:14Leuten, die es gleichzeitig benutzen, stießen wir immer wieder an die Nutzungsgrenzen. Das ließ unsere Arbeit einfach stoppen.
00:00:18Also sind wir zu OpenRouter gewechselt. Das hat das Limit-Problem, vor dem wir standen, zwar behoben, aber es führte zu einem neuen
00:00:24Problem. OpenRouter berechnet jeden einzelnen Token, und zum ersten Mal konnten wir genau sehen, was
00:00:29Hermes uns kostete. Die Zahl war viel höher, als wir erwartet hatten, und das Seltsame war,
00:00:34dass das meiste nicht von uns kam, die es aktiv nutzten. Das meiste stammte von Aufgaben, die Leute
00:00:39falsch eingerichtet hatten. Also machten wir uns daran, diese Rechnung zu senken, aber wir waren nicht bereit, Kompromisse bei der Ausgabequalität einzugehen.
00:00:44Also gingen wir alle Einstellungen durch und fanden die, die die Kosten senkten, ohne Hermes in irgendeiner Weise
00:00:49schlechter zu machen. Und falls du zum ersten Mal hier bist: Wir sind ein Softwareunternehmen und das ist unser Kanal AI Labs,
00:00:54wo wir zeigen, wie man Prozesse mit KI optimiert, genau wie wir unsere eigenen optimiert haben.
00:00:59In diesem Video gehen wir also jede einzelne Einstellung durch, die wir geändert haben, wie das unsere
00:01:03Workflows verändert hat und wie viel es uns tatsächlich gespart hat. Bevor wir dazu kommen, Kosten bei Hermes zu sparen,
00:01:08müssen wir erst herausfinden, was die Tokens eigentlich auffrisst. Was du für Hermes bezahlst, hängt davon ab,
00:01:12wie viele Tokens es verwendet. Und Tokens sind im Grunde die Bausteine der Wörter, die das Modell liest und
00:01:17schreibt. Jedes Modell baut auf den Tokens auf, die du eingibst, und den Tokens, die du zurückbekommst. Aber die Eingabe besteht nicht nur aus
00:01:22deinem Prompt. Sie deckt auch den System-Prompt und die gesamte Konversation ab, die du bisher hattest,
00:01:27zusammen mit ein paar anderen Dingen, die bei jeder Nachricht mitgesendet werden. Dazu gehört der Header jeder Fähigkeit,
00:01:31die du hinzugefügt hast, was im Grunde der Name und die Beschreibung ist, die immer geladen wird, plus die MCP-Tools,
00:01:36die du eingerichtet hast, sowie das Gedächtnis und die Benutzerdateien. All dies trägt zu deinen Eingabe-Tokens bei, und die Fähigkeiten
00:01:41sind ein großer Teil davon. Hermes kommt mit 90 vorinstallierten Fähigkeiten, und diese Zahl wächst nur, je länger
00:01:46du es benutzt. Das liegt daran, dass es jeden Workflow, der sich lohnt wiederzuverwenden, in eine neue Fähigkeit verwandelt. Also fügt jede von ihnen
00:01:51zu deinen Kosten pro Nachricht hinzu. Und es sind nicht nur die Skill-Header. Hermes scannt deine Konversationen
00:01:56nach Möglichkeiten, eine neue Fähigkeit zu entwickeln, und das verbraucht auch Tokens. Hermes hat auch ein selbstentwickelndes Gedächtnis.
00:02:03Es geht ständig deine Konversationen durch, um spezifische Details über dich herauszuziehen, und schreibt
00:02:07diese in das Gedächtnis. Es aktualisiert dieses Gedächtnis von selbst, damit es den Kontext über dich halten und seine zukünftigen
00:02:13Antworten maßschneidern kann. Und nichts davon ist kostenlos, denn die sich entwickelnden Fähigkeiten und das automatisch aktualisierende Gedächtnis sind beide
00:02:19Token-fressend, die du am Ende bezahlst. Ein weiterer großer Punkt ist, dass Hermes rund um die Uhr läuft. Es ist kein Agent,
00:02:25den man einmal startet und einmal laufen lässt, so wie wir das mit Cloud Code tun. Du kannst es auf einem lokalen
00:02:30Server ausführen, wie den, den wir bereits für unser Team eingerichtet haben, oder auf einem VPS, was im Grunde ein Server ist, den du
00:02:35mietest und selbst betreibst, damit der Rest deines Teams darauf zugreifen kann. Weil Hermes immer an ist, laufen viele
00:02:40Aufgaben im Hintergrund. Das ist es, was deine Nutzung in die Höhe treibt, wenn du sie nicht unter Kontrolle hältst.
00:02:45Ein einzelner Durchlauf einer dieser Aufgaben ist billig, aber sobald sie sich wiederholt oder du viele ähnliche
00:02:50Jobs eingerichtet hast, summieren sich die Kosten. Obendrein sind die MCP-Tools und Hooks, die du eingerichtet hast, auch in das Kontextfenster
00:02:56geladen, also verbrauchen sie auch Tokens. Und wenn du Ziele auf Hermes ausführst, kostet dich das ebenfalls
00:03:01Geld. Das Gute ist, Hermes bietet dir eine Möglichkeit, all das zu verfolgen. Es speichert jede Information zur Token-Nutzung
00:03:07in einer Datenbank im Stammordner. Und du kannst jeden Agenten, mit dem du arbeitest, bitten, diese Datenbank zu
00:03:13durchsuchen und dir eine detaillierte Aufschlüsselung zu geben. Der Agent kann den gesamten Weg durch die
00:03:17Datenbank zurückverfolgen bis zu dem Zeitpunkt, als du Hermes zum ersten Mal installiert hast. Von dort aus kann er dir sagen, wie viele Sitzungen du
00:03:22ausgeführt, wie viele Tokens du verwendet und was das alles gekostet hat. Er wird deine Ausgaben im Detail auflisten,
00:03:27sodass du dich mit Claude zusammensetzen und herausfinden kannst, wie du dein Budget besser verwalten kannst. Hermes hat auch einen
00:03:31Insights-Befehl, der so ziemlich das Gleiche tut. Er gibt dir eine Kostenaufschlüsselung der letzten 30 Tage,
00:03:36und er sagt dir, was welcher Teil verbraucht und welche Tools und Fähigkeiten du am meisten genutzt hast. Er zeigt sogar
00:03:42deine Aktivitätsmuster und deine längsten Sitzungen. Jetzt weißt du also, was die Tokens auffrisst. Lass uns
00:03:47mit dem größten Punkt beginnen, und das ist das Modell selbst. Das Modell, mit dem du Hermes verbunden hast,
00:03:52treibt den Großteil deiner Rechnung. Hermes bietet dir viele Modelle an, mit denen du dich verbinden kannst. Wenn du also bereits für
00:03:56ein Abonnement bezahlst, wie das Code-Abonnement, das wir haben, kannst du Hermes direkt darüber ausführen. Sobald
00:04:01das eingerichtet ist, bezahlst du über das Abonnement, das du bereits hast, ohne dass zusätzliche Kosten oben drauf kommen.
00:04:06Nun möchtest du vielleicht das Gleiche mit dem Abonnement von Anthropic oder Gemini tun, aber obwohl Hermes
00:04:11sie als verfügbar auflistet, sind sie es tatsächlich nicht. Und du kannst Claude Code nicht direkt verwenden. Du benötigst ein
00:04:16separates API dafür, weil beide zählen, wenn man ihr Abonnement auf diese Weise nutzt, als Verstoß gegen ihre
00:04:21Richtlinien. Also ist für den Moment das Code-Abonnement deine beste Option. Wir haben selbst mit dem OpenAI-
00:04:26Abonnement begonnen, aber wir sind am Ende zu OpenRouter gewechselt, weil es uns ermöglichte, viel mehr
00:04:30Modelle unter einem einzigen API-Schlüssel zu erreichen, und es war am besten für die unternehmensweite Nutzung. Wenn du also bei OpenRouter
00:04:36bist wie wir, kannst du Kosten sparen, indem du den Pareto-Router benutzt. Er schaut sich an, was deine Aufgabe tatsächlich benötigt,
00:04:41und leitet sie an das richtige Modell für den Job weiter. Er hat 13 Modelle, aufgeteilt in verschiedene Stufen,
00:04:46von billig und einfach bis teuer und leistungsstark. Neben dem Anbieter gibt es Einstellungen in deiner
00:04:51config.yaml-Datei, die dir helfen, Tokens zu sparen. Hermes führt viele Hintergrundaufgaben aus, und standardmäßig
00:04:57ist das Modell für diese auf automatisch eingestellt. Das bedeutet, es greift auf dein Hauptmodell zurück, selbst für das kleine
00:05:02Zeug. Das sind sogenannte Hilfsaufgaben, im Grunde die kleinen Hintergrundjobs, die Hermes ausführt, und sie
00:05:07benötigen nicht das schwere Denken, für das dein Hauptmodell gebaut ist. Dinge wie das Lesen von Bildern, Suchen
00:05:11in deinen Fähigkeiten, das Laden von MCP-Tools und das Schreiben einer Profilbeschreibung laufen alle gut auf etwas
00:05:17Leichterem. Du kannst diese Aufgaben also auf ein billigeres Modell ausrichten, und so verbrennt dein Hauptmodell keine
00:05:21teuren Tokens für einfache Sachen. Die gleiche Idee gilt für Unteragenten, die wir bereits behandelt haben.
00:05:26Hermes kann mehrere Unteragenten spawnen und ihnen Aufgaben übergeben. Jeder läuft in seinem eigenen Kontextfenster und
00:05:32arbeitet für sich. Aber das ist Token-intensiv, weil jeder Unteragent im Grunde seine eigene Sitzung ist, die
00:05:38nur ihre Ergebnisse zurückmeldet, also summieren sich die Kosten schnell. Also kannst du ein billigeres Modell für Unteragenten festlegen,
00:05:43und du sparst jedes Mal, wenn einer hochgefahren wird. Welches Modell du auch verwendest, es gibt noch eine Sache, die es wert ist, angepasst zu werden,
00:05:48und das ist das Anstrengungsniveau. Es ist im Grunde, wie viel das Modell nachdenkt, bevor es antwortet. Wenn du es
00:05:53ganz auf Maximum drehst, erhältst du zwar eine bessere Ausgabe, aber du verbrennst auch mehr Tokens, sodass es am Ende
00:05:58mehr kostet. Also möchtest du das Anstrengungsniveau an die Aufgabe anpassen, die du gerade erledigst, und wenn die Aufgabe
00:06:03eine einfache ist, die nicht viel Denken erfordert, kannst du das Nachdenken komplett ausschalten. Aber bevor wir
00:06:08weitermachen, lass uns ein Wort von unserem Sponsor, Luma, hören. Wenn du kreative Arbeit leistest, ist der wirkliche Flaschenhals nicht
00:06:13Ideen. Es ist das Jonglieren mit acht verschiedenen KI-Tools für ein Projekt und das Verlieren des halben Tages nur durch deren Verwaltung.
00:06:19Luma behebt das mit agentischer KI. Normale KI unterstützt dich nur, aber die Agenten von Luma erschaffen tatsächlich
00:06:24mit dir, und sie verstehen die physische Welt, wie sich Dinge bewegen, verhalten und im Raum existieren, nicht nur
00:06:30Pixel. Du bringst den Geschmack und die Richtung, und die Agenten orchestrieren alles unter der Haube,
00:06:35halten den Kontext über das gesamte Projekt und ziehen für jeden Schritt die richtigen Modelle hinzu. Von der ersten
00:06:40Idee bis zum finalen Schnitt halten die Agenten das gesamte Projekt am Laufen, und es ist nie ein Prompt, eine Ausgabe.
00:06:45Du gestaltest die Arbeit mit ihnen Schritt für Schritt, verfeinerst, während du gehst, sodass du 10-mal mehr Ideen erkunden kannst
00:06:51ohne die 10-fache Arbeit, mit den besten Modellen an einem Ort statt 10 verstreuten Tabs. Erschaffe mit
00:06:56Luma, erhalte frühen Zugang unter dem Link unten oder scanne den QR-Code auf dem Bildschirm. Aber das Modell ist nicht das Einzige,
00:07:02das deine Tokens verbraucht. Das Kontextfenster tut es auch. Dein Hermes-Agent kommt mit einer ganzen Reihe von Tools und
00:07:07Fähigkeiten, und jede Nachricht, die du sendest, trägt all das zusammen mit der gesamten Konversationsgeschichte mit sich,
00:07:12die du bisher aufgebaut hast. Je länger eine Konversation läuft, desto mehr Geschichte gibt es
00:07:16bei jedem Turn zu senden, und das Kontextfenster wächst schnell, also ist es eine gute Angewohnheit, oft auf Komprimieren zu drücken.
00:07:21Was das bewirkt, ist das Starten einer frischen Sitzung, die auf einer Zusammenfassung von allem basiert, das bisher passiert ist.
00:07:26Du sparst eine Menge Tokens, und das Modell behält trotzdem den Kontext der Konversation, nur in einer viel
00:07:31schlankeren Form. Standardmäßig ist der Kompressionsschwellenwert auf 50 % eingestellt, was bedeutet, dass Hermes die
00:07:37Konversation komprimiert, sobald die Hälfte des Kontextfensters gefüllt wurde. Du kannst diesen Wert anpassen, und in den meisten
00:07:42Fällen ist es besser, ihn auf der niedrigeren Seite zu halten. Das reduziert die Anzahl der Nachrichten, die bei jedem Turn
00:07:47gesendet werden müssen, was hilft, die Kontextnutzung effizient zu halten und die Kosten jeder Nachricht zu senken.
00:07:52Nach dem Komprimieren lässt Hermes auch ein paar Tokens unkomprimiert und fügt sie hinzu, um mehr
00:07:58Kontext zu behalten, und das nennt man das Zielverhältnis. Du kannst es auf einen niedrigeren Prozentsatz einstellen, sodass weniger von der
00:08:03alten Konversation in das Kontextfenster übertragen wird und weniger Nachrichten bei jedem Turn gesendet werden.
00:08:08Du kannst auch steuern, wie viel von jedem Tool-Ergebnis tatsächlich in den Kontext gelangt. Damals, als wir auf
00:08:13dem OpenAI-Abonnement waren, stellten wir diese Werte hoch ein, damit Hermes keine Details verpasst, wenn Tool-Ausgaben
00:08:18abgeschnitten wurden, wie wir im vorherigen Video behandelt haben. Aber sobald wir zu OpenRouter gewechselt sind, mussten wir die
00:08:23Kosten genauer beobachten, also haben wir diese Werte wieder gesenkt. Wenn du eine einmalige Anweisung hast, die du
00:08:28nur für eine einzige Sitzung benötigst, schreibe sie nicht in die Hermes-Kontextdateien. Stattdessen kannst du einen
00:08:34ephemeren System-Prompt verwenden, der sie im Grunde nur zu dieser einen Sitzung hinzufügt und nichts weiter. Auf diese Weise
00:08:39kannst du die Anweisung verwenden, ohne dass sie Platz in den Kontextdateien verschwendet. Und wenn du lokale
00:08:44Systeme wie ein zweites Gehirn ausführst, wie wir dir bereits gezeigt haben, möchtest du, dass diese Informationen ordnungsgemäß organisiert sind. Auf diese Weise
00:08:49kann der Agent sie Stück für Stück laden, während er sie benötigt, anstatt zusätzliche Tokens zu ziehen, die er nicht braucht.
00:08:54Jenseits der Dateien, die du selbst erstellst, kannst du auch die Dateien reduzieren, auf die sich Hermes stützt, wie die
00:08:59Gedächtnisdateien und die Agentendateien. Diese sitzen die ganze Zeit in deinem Kontextfenster, also je kleiner
00:09:05sie sind, desto weniger stellen sie bei jeder Nachricht vor das Modell. Hermes lässt dich auch
00:09:10seine automatische Gedächtnisfunktion ausschalten, was es davon abhält, Gedächtnis zu sammeln, und die Gedächtnisdateien
00:09:14davon abhält, in deinem Kontextfenster zu landen. Das spart dir Geld, da weniger Tokens mit jeder Nachricht ausgehen.
00:09:20Aber das Ausschalten des automatischen Gedächtnisses bedeutet, eines der Features aufzugeben, die Hermes so gut machen in
00:09:25erster Linie. Also behalten wir es in unseren eigenen Workflows an, auch wenn es uns etwas kostet. Wir wollen, dass es
00:09:30Details über unser Unternehmen zieht und diesen Kontext über das gesamte Team teilt, da jeder es über Slack nutzt.
00:09:35Wenn Hermes etwas falsch macht, schreibe ihn nicht einfach wieder neu an. Verwende den Undo-Befehl, um
00:09:40einen Nachrichtenschritt zurückzugehen. Es ist kein vollständiger Rücklauf, der mehrere Nachrichten zurückgeht, aber er
00:09:45lässt dich die aktuellste Nachricht rückgängig machen. Das ist der bessere Schritt, denn von dort aus kannst du ihm einen frischen
00:09:50Prompt geben, der genau buchstabiert, was schief gelaufen ist und was zu vermeiden ist. Und wenn dir das Video bisher gefällt,
00:09:54abonniere den Kanal und drücke den Hype-Button. Diese kleine Geste der Unterstützung bedeutet uns viel.
00:10:00All das zu trimmen, senkt deine Nutzung, und deine Tools sind das Nächste, das du dir ansehen solltest. Jedes Tool, auf das dein
00:10:05Agent Zugriff hat, wird bei jeder Nachricht als Teil des Kontextfensters mitgesendet, also lohnt es sich, die Tools zu kürzen,
00:10:10die du tatsächlich nicht benutzt. Hermes kommt mit mehr als 17 Tools, und du kannst alle mit
00:10:15dem Hermes-Listenbefehl sehen. Um eines zu deaktivieren, kannst du entweder über die Desktop-App gehen oder den Tool-Deaktivierungsbefehl
00:10:20mit dem Namen des Tools ausführen, das du ausschalten möchtest. Zum Beispiel hat das AI-Labs-Profil, das wir für das gesamte Team
00:10:26eingerichtet haben, keine Arbeit an Codebasen erledigt, also brauchten wir dort überhaupt keine Codeausführung.
00:10:31Wir behalten ein separates Profil, das darauf spezialisiert ist. Wir haben es deaktiviert, zusammen mit allen anderen Tools, die wir nicht
00:10:36nutzten, sodass keines ohne Grund im Kontext blieb. Hermes kommt auch mit einer Menge Fähigkeiten,
00:10:41und die meisten von ihnen sind welche, die du wahrscheinlich nie benutzen wirst, also kannst du jede Fähigkeit ausschalten, die du nicht brauchst.
00:10:46Deine Skill-Liste enthält am Ende nur noch die, die du tatsächlich benutzt, statt einer langen Liste, die nur dort
00:10:51sitzt und den Kontext aufbläht. Das Gleiche gilt für deine MCP-Server. Jeder, den du verbindest, bringt seine eigene Menge an
00:10:56Tools in das Kontextfenster, also trenne alle Server, die du tatsächlich nicht nutzt, und bei den
00:11:01die du behältst, stelle sicher, dass die Tool-Suche auf automatisch gesetzt ist. Es funktioniert wie die Tool-Suchfunktion in Claude. Es
00:11:06lädt ein Tool nur dann, wenn es tatsächlich benötigt wird, anstatt sie die ganze Zeit alle im Kontextfenster
00:11:11zu behalten. Wenn deines nicht auf automatisch steht, schalte es um, damit du keine Tokens verschwendest und das Beste aus
00:11:16denen herausholst, die du tatsächlich ausgibst. Harte Limits sind eine weitere Möglichkeit, deine Token-Nutzung niedrig zu halten. Sie begrenzen, wie viel der
00:11:22Agent tun kann, bevor er anhalten muss. Das Erste ist, die maximalen Tokens des Modells auf eine spezifische Zahl festzulegen,
00:11:27was steuert, wie viele Tokens es als Ausgabe produzieren kann. Das spart dir bei den Ausgabekosten und drängt
00:11:33das Modell zu präziseren Antworten, statt zu schwafeln. Standardmäßig sind die maximalen Turns des Agenten auf 150 eingestellt.
00:11:39Das bedeutet, während er an einer Aufgabe arbeitet, kann er bis zu 150 Turns nehmen, um zu denken, Tools aufzurufen, die
00:11:46Ausgaben zu lesen und die Ergebnisse abzuwägen, bevor er fertig ist. Das Problem ist, dass wenn der Agent verwirrt wird,
00:11:51kann er all diese Turns durchbrennen, indem er den gesamten Kontext erneut sendet, während er versucht, etwas zu lösen.
00:11:56Also kannst du dies auf einen niedrigeren Wert senken. Wir haben unseren auf 60 gesetzt, damit der Agent keine Turns verschwendet,
00:12:01indem er an einem Problem hängen bleibt. Es gibt noch eine weitere Einstellung, die es wert ist, eingeschaltet zu werden, die vor
00:12:06Schleifenbildung schützt. Du kannst die Hard-Stop-Einstellung von falsch auf wahr umschalten, was den Agenten davon abhält, ohne
00:12:10Grund in einer Schleife zu laufen. Wenn er also stecken bleibt und keine Fortschritte macht, greift der harte Stopp und stoppt ihn,
00:12:15bevor er weiter mahlt. Dann gibt es noch deine Cron-Jobs. Im Grunde Aufgaben, die von selbst laufen,
00:12:21nach einem Zeitplan, die standardmäßig keine Begrenzungen für ihre maximalen Turns haben. Du kannst das auf eine spezifische
00:12:26Zahl festlegen, sodass es eine Obergrenze gibt, wie viele Turns ein Cron-Job nehmen kann. Das hält Hintergrundjobs davon ab, Tokens
00:12:31aufzubrauchen, und verhindert, dass sie für immer Kosten verursachen. Um mit dem Hermes-Agent zu beginnen,
00:12:36haben wir ein ganzes Starterpaket kuratiert, das in AI Labs Pro verfügbar ist, unserer Community.
00:12:41Dort bekommst du die Ressourcen, die Starterpakete und mehr, zusammen mit einem Ort, um mit
00:12:45einer Reihe von Gleichgesinnten zu interagieren, einschließlich unseres Teams. Wenn du also Wert in dem gefunden hast, was wir tun,
00:12:50und den Kanal unterstützen möchtest, ist dies der beste Weg. Der Link ist in der Beschreibung.
00:12:54Das bringt uns zum Ende dieses Videos. Wenn du den Kanal unterstützen und uns helfen möchtest, weiterhin
00:12:59Videos wie dieses zu machen, kannst du das mit dem Super-Thanks-Button unten tun. Wie immer, danke fürs
00:13:04Zuschauen und ich sehe dich im nächsten Video.

Key Takeaway

Die gezielte Optimierung von Hermes-Einstellungen wie Modellwahl, Kontextbegrenzung und Tool-Management senkt die Token-Kosten massiv, ohne die Ausgabequalität zu beeinträchtigen.

Highlights

  • Das manuelle Festlegen von Modellen für Hilfsaufgaben und Unteragenten verhindert, dass das Hauptmodell teure Tokens für einfache Vorgänge verbraucht.

  • Die Begrenzung der maximalen Turns von 150 auf 60 verhindert kostspielige Endlosschleifen bei verwirrten Agenten.

  • Das Deaktivieren nicht benötigter Fähigkeiten und das Trennen ungenutzter MCP-Server reduziert den Umfang des Kontextfensters bei jeder Nachricht.

  • Der Einsatz des Pareto-Routers bei OpenRouter ermöglicht die automatische Auswahl des kosteneffizientesten Modells für spezifische Aufgaben.

  • Häufiges Komprimieren der Konversationshistorie reduziert die Menge an Tokens, die bei jedem Turn gesendet werden müssen.

  • Das Ausführen von Hermes über bestehende Software-Abonnements vermeidet zusätzliche API-Kosten.

Timeline

Identifikation und Analyse der Kostenfaktoren

  • Die Kosten für Hermes korrelieren direkt mit der Menge der verarbeiteten Eingabe- und Ausgabe-Tokens.
  • System-Prompts, Konversationshistorie, Tool-Beschreibungen und das automatisch aktualisierende Gedächtnis belegen das Kontextfenster dauerhaft.
  • Hermes speichert Nutzungsinformationen in einer lokalen Datenbank, die zur detaillierten Kostenanalyse abgefragt werden kann.

Die Kosten steigen, weil der Agent ständig durch das gesamte Kontextfenster einschließlich geladener Fähigkeiten, MCP-Tools und Gedächtnisdateien läuft. Da Hermes kontinuierlich arbeitet, treiben vor allem wiederkehrende Hintergrundaufgaben und das automatische Anlegen neuer Fähigkeiten die Token-Nutzung in die Höhe. Die integrierte Analysefunktion bietet über Insights-Befehle oder direkte Datenbankabfragen Transparenz über die Ausgaben der letzten 30 Tage.

Optimierung der Modellwahl und Aufgabenzuweisung

  • Die Nutzung von bestehenden Software-Abonnements wie Code-Abos ist derzeit die kostengünstigste Methode.
  • Der Einsatz von OpenRouter in Kombination mit dem Pareto-Router leitet Aufgaben effizient an das jeweils günstigste Modell weiter.
  • Hilfsaufgaben und Unteragenten sollten explizit auf kostengünstigere Modelle zugewiesen werden, um das Hauptmodell zu entlasten.

Das Hauptmodell ist oft überdimensioniert für einfache Hintergrundaufgaben wie das Lesen von Bildern oder das Laden von Tools. Durch die Konfiguration in der config.yaml-Datei können diese Tätigkeiten auf leichtere Modelle umgestellt werden. Auch das Anstrengungsniveau sollte an die Komplexität der Aufgabe angepasst werden, um unnötige Token-Kosten durch übermäßiges 'Nachdenken' zu vermeiden.

Management von Kontext und Arbeitslast

  • Regelmäßiges Komprimieren der Konversation und die Anpassung der Kompressionsrate auf unter 50 % senkt die Kontextlast signifikant.
  • Nicht benötigte Tools und Fähigkeiten sollten deaktiviert werden, um Platz im Kontextfenster zu schaffen.
  • Die Senkung der maximalen Turns von 150 auf 60 sowie die Aktivierung von Hard-Stops verhindern unnötige Token-Verbräuche durch Schleifen.

Jede Nachricht an den Agenten sendet den gesamten Kontext mit, weshalb eine schlanke Tool-Liste und eine komprimierte Historie entscheidend sind. Ephemere System-Prompts für einmalige Anweisungen verhindern, dass diese dauerhaft Token-Kapazität binden. Zudem begrenzen harte Limits für Cron-Jobs und maximale Turn-Anzahlen die Gefahr, dass der Agent bei Problemen unkontrolliert Tokens verbraucht.

Community Posts

View all posts