20+ Einstellungen, die 80 % der Einrichtungskosten für Hermes Agent sparen
AAI LABS
Computing/SoftwareManagementInternet Technology
Transcript
00:00:00Seit wir Hermes in die Finger bekommen haben, haben wir eine Menge Workflows damit erstellt, und für die längste Zeit
00:00:04lief alles davon über GPT-Modelle durch unser OpenAI-Abonnement. Das funktionierte anfangs gut.
00:00:09Aber unser ganzes Team nutzt Hermes und jeder hat seine eigenen Flows eingerichtet, und bei so vielen
00:00:14Leuten, die es gleichzeitig benutzen, stießen wir immer wieder an die Nutzungsgrenzen. Das ließ unsere Arbeit einfach stoppen.
00:00:18Also sind wir zu OpenRouter gewechselt. Das hat das Limit-Problem, vor dem wir standen, zwar behoben, aber es führte zu einem neuen
00:00:24Problem. OpenRouter berechnet jeden einzelnen Token, und zum ersten Mal konnten wir genau sehen, was
00:00:29Hermes uns kostete. Die Zahl war viel höher, als wir erwartet hatten, und das Seltsame war,
00:00:34dass das meiste nicht von uns kam, die es aktiv nutzten. Das meiste stammte von Aufgaben, die Leute
00:00:39falsch eingerichtet hatten. Also machten wir uns daran, diese Rechnung zu senken, aber wir waren nicht bereit, Kompromisse bei der Ausgabequalität einzugehen.
00:00:44Also gingen wir alle Einstellungen durch und fanden die, die die Kosten senkten, ohne Hermes in irgendeiner Weise
00:00:49schlechter zu machen. Und falls du zum ersten Mal hier bist: Wir sind ein Softwareunternehmen und das ist unser Kanal AI Labs,
00:00:54wo wir zeigen, wie man Prozesse mit KI optimiert, genau wie wir unsere eigenen optimiert haben.
00:00:59In diesem Video gehen wir also jede einzelne Einstellung durch, die wir geändert haben, wie das unsere
00:01:03Workflows verändert hat und wie viel es uns tatsächlich gespart hat. Bevor wir dazu kommen, Kosten bei Hermes zu sparen,
00:01:08müssen wir erst herausfinden, was die Tokens eigentlich auffrisst. Was du für Hermes bezahlst, hängt davon ab,
00:01:12wie viele Tokens es verwendet. Und Tokens sind im Grunde die Bausteine der Wörter, die das Modell liest und
00:01:17schreibt. Jedes Modell baut auf den Tokens auf, die du eingibst, und den Tokens, die du zurückbekommst. Aber die Eingabe besteht nicht nur aus
00:01:22deinem Prompt. Sie deckt auch den System-Prompt und die gesamte Konversation ab, die du bisher hattest,
00:01:27zusammen mit ein paar anderen Dingen, die bei jeder Nachricht mitgesendet werden. Dazu gehört der Header jeder Fähigkeit,
00:01:31die du hinzugefügt hast, was im Grunde der Name und die Beschreibung ist, die immer geladen wird, plus die MCP-Tools,
00:01:36die du eingerichtet hast, sowie das Gedächtnis und die Benutzerdateien. All dies trägt zu deinen Eingabe-Tokens bei, und die Fähigkeiten
00:01:41sind ein großer Teil davon. Hermes kommt mit 90 vorinstallierten Fähigkeiten, und diese Zahl wächst nur, je länger
00:01:46du es benutzt. Das liegt daran, dass es jeden Workflow, der sich lohnt wiederzuverwenden, in eine neue Fähigkeit verwandelt. Also fügt jede von ihnen
00:01:51zu deinen Kosten pro Nachricht hinzu. Und es sind nicht nur die Skill-Header. Hermes scannt deine Konversationen
00:01:56nach Möglichkeiten, eine neue Fähigkeit zu entwickeln, und das verbraucht auch Tokens. Hermes hat auch ein selbstentwickelndes Gedächtnis.
00:02:03Es geht ständig deine Konversationen durch, um spezifische Details über dich herauszuziehen, und schreibt
00:02:07diese in das Gedächtnis. Es aktualisiert dieses Gedächtnis von selbst, damit es den Kontext über dich halten und seine zukünftigen
00:02:13Antworten maßschneidern kann. Und nichts davon ist kostenlos, denn die sich entwickelnden Fähigkeiten und das automatisch aktualisierende Gedächtnis sind beide
00:02:19Token-fressend, die du am Ende bezahlst. Ein weiterer großer Punkt ist, dass Hermes rund um die Uhr läuft. Es ist kein Agent,
00:02:25den man einmal startet und einmal laufen lässt, so wie wir das mit Cloud Code tun. Du kannst es auf einem lokalen
00:02:30Server ausführen, wie den, den wir bereits für unser Team eingerichtet haben, oder auf einem VPS, was im Grunde ein Server ist, den du
00:02:35mietest und selbst betreibst, damit der Rest deines Teams darauf zugreifen kann. Weil Hermes immer an ist, laufen viele
00:02:40Aufgaben im Hintergrund. Das ist es, was deine Nutzung in die Höhe treibt, wenn du sie nicht unter Kontrolle hältst.
00:02:45Ein einzelner Durchlauf einer dieser Aufgaben ist billig, aber sobald sie sich wiederholt oder du viele ähnliche
00:02:50Jobs eingerichtet hast, summieren sich die Kosten. Obendrein sind die MCP-Tools und Hooks, die du eingerichtet hast, auch in das Kontextfenster
00:02:56geladen, also verbrauchen sie auch Tokens. Und wenn du Ziele auf Hermes ausführst, kostet dich das ebenfalls
00:03:01Geld. Das Gute ist, Hermes bietet dir eine Möglichkeit, all das zu verfolgen. Es speichert jede Information zur Token-Nutzung
00:03:07in einer Datenbank im Stammordner. Und du kannst jeden Agenten, mit dem du arbeitest, bitten, diese Datenbank zu
00:03:13durchsuchen und dir eine detaillierte Aufschlüsselung zu geben. Der Agent kann den gesamten Weg durch die
00:03:17Datenbank zurückverfolgen bis zu dem Zeitpunkt, als du Hermes zum ersten Mal installiert hast. Von dort aus kann er dir sagen, wie viele Sitzungen du
00:03:22ausgeführt, wie viele Tokens du verwendet und was das alles gekostet hat. Er wird deine Ausgaben im Detail auflisten,
00:03:27sodass du dich mit Claude zusammensetzen und herausfinden kannst, wie du dein Budget besser verwalten kannst. Hermes hat auch einen
00:03:31Insights-Befehl, der so ziemlich das Gleiche tut. Er gibt dir eine Kostenaufschlüsselung der letzten 30 Tage,
00:03:36und er sagt dir, was welcher Teil verbraucht und welche Tools und Fähigkeiten du am meisten genutzt hast. Er zeigt sogar
00:03:42deine Aktivitätsmuster und deine längsten Sitzungen. Jetzt weißt du also, was die Tokens auffrisst. Lass uns
00:03:47mit dem größten Punkt beginnen, und das ist das Modell selbst. Das Modell, mit dem du Hermes verbunden hast,
00:03:52treibt den Großteil deiner Rechnung. Hermes bietet dir viele Modelle an, mit denen du dich verbinden kannst. Wenn du also bereits für
00:03:56ein Abonnement bezahlst, wie das Code-Abonnement, das wir haben, kannst du Hermes direkt darüber ausführen. Sobald
00:04:01das eingerichtet ist, bezahlst du über das Abonnement, das du bereits hast, ohne dass zusätzliche Kosten oben drauf kommen.
00:04:06Nun möchtest du vielleicht das Gleiche mit dem Abonnement von Anthropic oder Gemini tun, aber obwohl Hermes
00:04:11sie als verfügbar auflistet, sind sie es tatsächlich nicht. Und du kannst Claude Code nicht direkt verwenden. Du benötigst ein
00:04:16separates API dafür, weil beide zählen, wenn man ihr Abonnement auf diese Weise nutzt, als Verstoß gegen ihre
00:04:21Richtlinien. Also ist für den Moment das Code-Abonnement deine beste Option. Wir haben selbst mit dem OpenAI-
00:04:26Abonnement begonnen, aber wir sind am Ende zu OpenRouter gewechselt, weil es uns ermöglichte, viel mehr
00:04:30Modelle unter einem einzigen API-Schlüssel zu erreichen, und es war am besten für die unternehmensweite Nutzung. Wenn du also bei OpenRouter
00:04:36bist wie wir, kannst du Kosten sparen, indem du den Pareto-Router benutzt. Er schaut sich an, was deine Aufgabe tatsächlich benötigt,
00:04:41und leitet sie an das richtige Modell für den Job weiter. Er hat 13 Modelle, aufgeteilt in verschiedene Stufen,
00:04:46von billig und einfach bis teuer und leistungsstark. Neben dem Anbieter gibt es Einstellungen in deiner
00:04:51config.yaml-Datei, die dir helfen, Tokens zu sparen. Hermes führt viele Hintergrundaufgaben aus, und standardmäßig
00:04:57ist das Modell für diese auf automatisch eingestellt. Das bedeutet, es greift auf dein Hauptmodell zurück, selbst für das kleine
00:05:02Zeug. Das sind sogenannte Hilfsaufgaben, im Grunde die kleinen Hintergrundjobs, die Hermes ausführt, und sie
00:05:07benötigen nicht das schwere Denken, für das dein Hauptmodell gebaut ist. Dinge wie das Lesen von Bildern, Suchen
00:05:11in deinen Fähigkeiten, das Laden von MCP-Tools und das Schreiben einer Profilbeschreibung laufen alle gut auf etwas
00:05:17Leichterem. Du kannst diese Aufgaben also auf ein billigeres Modell ausrichten, und so verbrennt dein Hauptmodell keine
00:05:21teuren Tokens für einfache Sachen. Die gleiche Idee gilt für Unteragenten, die wir bereits behandelt haben.
00:05:26Hermes kann mehrere Unteragenten spawnen und ihnen Aufgaben übergeben. Jeder läuft in seinem eigenen Kontextfenster und
00:05:32arbeitet für sich. Aber das ist Token-intensiv, weil jeder Unteragent im Grunde seine eigene Sitzung ist, die
00:05:38nur ihre Ergebnisse zurückmeldet, also summieren sich die Kosten schnell. Also kannst du ein billigeres Modell für Unteragenten festlegen,
00:05:43und du sparst jedes Mal, wenn einer hochgefahren wird. Welches Modell du auch verwendest, es gibt noch eine Sache, die es wert ist, angepasst zu werden,
00:05:48und das ist das Anstrengungsniveau. Es ist im Grunde, wie viel das Modell nachdenkt, bevor es antwortet. Wenn du es
00:05:53ganz auf Maximum drehst, erhältst du zwar eine bessere Ausgabe, aber du verbrennst auch mehr Tokens, sodass es am Ende
00:05:58mehr kostet. Also möchtest du das Anstrengungsniveau an die Aufgabe anpassen, die du gerade erledigst, und wenn die Aufgabe
00:06:03eine einfache ist, die nicht viel Denken erfordert, kannst du das Nachdenken komplett ausschalten. Aber bevor wir
00:06:08weitermachen, lass uns ein Wort von unserem Sponsor, Luma, hören. Wenn du kreative Arbeit leistest, ist der wirkliche Flaschenhals nicht
00:06:13Ideen. Es ist das Jonglieren mit acht verschiedenen KI-Tools für ein Projekt und das Verlieren des halben Tages nur durch deren Verwaltung.
00:06:19Luma behebt das mit agentischer KI. Normale KI unterstützt dich nur, aber die Agenten von Luma erschaffen tatsächlich
00:06:24mit dir, und sie verstehen die physische Welt, wie sich Dinge bewegen, verhalten und im Raum existieren, nicht nur
00:06:30Pixel. Du bringst den Geschmack und die Richtung, und die Agenten orchestrieren alles unter der Haube,
00:06:35halten den Kontext über das gesamte Projekt und ziehen für jeden Schritt die richtigen Modelle hinzu. Von der ersten
00:06:40Idee bis zum finalen Schnitt halten die Agenten das gesamte Projekt am Laufen, und es ist nie ein Prompt, eine Ausgabe.
00:06:45Du gestaltest die Arbeit mit ihnen Schritt für Schritt, verfeinerst, während du gehst, sodass du 10-mal mehr Ideen erkunden kannst
00:06:51ohne die 10-fache Arbeit, mit den besten Modellen an einem Ort statt 10 verstreuten Tabs. Erschaffe mit
00:06:56Luma, erhalte frühen Zugang unter dem Link unten oder scanne den QR-Code auf dem Bildschirm. Aber das Modell ist nicht das Einzige,
00:07:02das deine Tokens verbraucht. Das Kontextfenster tut es auch. Dein Hermes-Agent kommt mit einer ganzen Reihe von Tools und
00:07:07Fähigkeiten, und jede Nachricht, die du sendest, trägt all das zusammen mit der gesamten Konversationsgeschichte mit sich,
00:07:12die du bisher aufgebaut hast. Je länger eine Konversation läuft, desto mehr Geschichte gibt es
00:07:16bei jedem Turn zu senden, und das Kontextfenster wächst schnell, also ist es eine gute Angewohnheit, oft auf Komprimieren zu drücken.
00:07:21Was das bewirkt, ist das Starten einer frischen Sitzung, die auf einer Zusammenfassung von allem basiert, das bisher passiert ist.
00:07:26Du sparst eine Menge Tokens, und das Modell behält trotzdem den Kontext der Konversation, nur in einer viel
00:07:31schlankeren Form. Standardmäßig ist der Kompressionsschwellenwert auf 50 % eingestellt, was bedeutet, dass Hermes die
00:07:37Konversation komprimiert, sobald die Hälfte des Kontextfensters gefüllt wurde. Du kannst diesen Wert anpassen, und in den meisten
00:07:42Fällen ist es besser, ihn auf der niedrigeren Seite zu halten. Das reduziert die Anzahl der Nachrichten, die bei jedem Turn
00:07:47gesendet werden müssen, was hilft, die Kontextnutzung effizient zu halten und die Kosten jeder Nachricht zu senken.
00:07:52Nach dem Komprimieren lässt Hermes auch ein paar Tokens unkomprimiert und fügt sie hinzu, um mehr
00:07:58Kontext zu behalten, und das nennt man das Zielverhältnis. Du kannst es auf einen niedrigeren Prozentsatz einstellen, sodass weniger von der
00:08:03alten Konversation in das Kontextfenster übertragen wird und weniger Nachrichten bei jedem Turn gesendet werden.
00:08:08Du kannst auch steuern, wie viel von jedem Tool-Ergebnis tatsächlich in den Kontext gelangt. Damals, als wir auf
00:08:13dem OpenAI-Abonnement waren, stellten wir diese Werte hoch ein, damit Hermes keine Details verpasst, wenn Tool-Ausgaben
00:08:18abgeschnitten wurden, wie wir im vorherigen Video behandelt haben. Aber sobald wir zu OpenRouter gewechselt sind, mussten wir die
00:08:23Kosten genauer beobachten, also haben wir diese Werte wieder gesenkt. Wenn du eine einmalige Anweisung hast, die du
00:08:28nur für eine einzige Sitzung benötigst, schreibe sie nicht in die Hermes-Kontextdateien. Stattdessen kannst du einen
00:08:34ephemeren System-Prompt verwenden, der sie im Grunde nur zu dieser einen Sitzung hinzufügt und nichts weiter. Auf diese Weise
00:08:39kannst du die Anweisung verwenden, ohne dass sie Platz in den Kontextdateien verschwendet. Und wenn du lokale
00:08:44Systeme wie ein zweites Gehirn ausführst, wie wir dir bereits gezeigt haben, möchtest du, dass diese Informationen ordnungsgemäß organisiert sind. Auf diese Weise
00:08:49kann der Agent sie Stück für Stück laden, während er sie benötigt, anstatt zusätzliche Tokens zu ziehen, die er nicht braucht.
00:08:54Jenseits der Dateien, die du selbst erstellst, kannst du auch die Dateien reduzieren, auf die sich Hermes stützt, wie die
00:08:59Gedächtnisdateien und die Agentendateien. Diese sitzen die ganze Zeit in deinem Kontextfenster, also je kleiner
00:09:05sie sind, desto weniger stellen sie bei jeder Nachricht vor das Modell. Hermes lässt dich auch
00:09:10seine automatische Gedächtnisfunktion ausschalten, was es davon abhält, Gedächtnis zu sammeln, und die Gedächtnisdateien
00:09:14davon abhält, in deinem Kontextfenster zu landen. Das spart dir Geld, da weniger Tokens mit jeder Nachricht ausgehen.
00:09:20Aber das Ausschalten des automatischen Gedächtnisses bedeutet, eines der Features aufzugeben, die Hermes so gut machen in
00:09:25erster Linie. Also behalten wir es in unseren eigenen Workflows an, auch wenn es uns etwas kostet. Wir wollen, dass es
00:09:30Details über unser Unternehmen zieht und diesen Kontext über das gesamte Team teilt, da jeder es über Slack nutzt.
00:09:35Wenn Hermes etwas falsch macht, schreibe ihn nicht einfach wieder neu an. Verwende den Undo-Befehl, um
00:09:40einen Nachrichtenschritt zurückzugehen. Es ist kein vollständiger Rücklauf, der mehrere Nachrichten zurückgeht, aber er
00:09:45lässt dich die aktuellste Nachricht rückgängig machen. Das ist der bessere Schritt, denn von dort aus kannst du ihm einen frischen
00:09:50Prompt geben, der genau buchstabiert, was schief gelaufen ist und was zu vermeiden ist. Und wenn dir das Video bisher gefällt,
00:09:54abonniere den Kanal und drücke den Hype-Button. Diese kleine Geste der Unterstützung bedeutet uns viel.
00:10:00All das zu trimmen, senkt deine Nutzung, und deine Tools sind das Nächste, das du dir ansehen solltest. Jedes Tool, auf das dein
00:10:05Agent Zugriff hat, wird bei jeder Nachricht als Teil des Kontextfensters mitgesendet, also lohnt es sich, die Tools zu kürzen,
00:10:10die du tatsächlich nicht benutzt. Hermes kommt mit mehr als 17 Tools, und du kannst alle mit
00:10:15dem Hermes-Listenbefehl sehen. Um eines zu deaktivieren, kannst du entweder über die Desktop-App gehen oder den Tool-Deaktivierungsbefehl
00:10:20mit dem Namen des Tools ausführen, das du ausschalten möchtest. Zum Beispiel hat das AI-Labs-Profil, das wir für das gesamte Team
00:10:26eingerichtet haben, keine Arbeit an Codebasen erledigt, also brauchten wir dort überhaupt keine Codeausführung.
00:10:31Wir behalten ein separates Profil, das darauf spezialisiert ist. Wir haben es deaktiviert, zusammen mit allen anderen Tools, die wir nicht
00:10:36nutzten, sodass keines ohne Grund im Kontext blieb. Hermes kommt auch mit einer Menge Fähigkeiten,
00:10:41und die meisten von ihnen sind welche, die du wahrscheinlich nie benutzen wirst, also kannst du jede Fähigkeit ausschalten, die du nicht brauchst.
00:10:46Deine Skill-Liste enthält am Ende nur noch die, die du tatsächlich benutzt, statt einer langen Liste, die nur dort
00:10:51sitzt und den Kontext aufbläht. Das Gleiche gilt für deine MCP-Server. Jeder, den du verbindest, bringt seine eigene Menge an
00:10:56Tools in das Kontextfenster, also trenne alle Server, die du tatsächlich nicht nutzt, und bei den
00:11:01die du behältst, stelle sicher, dass die Tool-Suche auf automatisch gesetzt ist. Es funktioniert wie die Tool-Suchfunktion in Claude. Es
00:11:06lädt ein Tool nur dann, wenn es tatsächlich benötigt wird, anstatt sie die ganze Zeit alle im Kontextfenster
00:11:11zu behalten. Wenn deines nicht auf automatisch steht, schalte es um, damit du keine Tokens verschwendest und das Beste aus
00:11:16denen herausholst, die du tatsächlich ausgibst. Harte Limits sind eine weitere Möglichkeit, deine Token-Nutzung niedrig zu halten. Sie begrenzen, wie viel der
00:11:22Agent tun kann, bevor er anhalten muss. Das Erste ist, die maximalen Tokens des Modells auf eine spezifische Zahl festzulegen,
00:11:27was steuert, wie viele Tokens es als Ausgabe produzieren kann. Das spart dir bei den Ausgabekosten und drängt
00:11:33das Modell zu präziseren Antworten, statt zu schwafeln. Standardmäßig sind die maximalen Turns des Agenten auf 150 eingestellt.
00:11:39Das bedeutet, während er an einer Aufgabe arbeitet, kann er bis zu 150 Turns nehmen, um zu denken, Tools aufzurufen, die
00:11:46Ausgaben zu lesen und die Ergebnisse abzuwägen, bevor er fertig ist. Das Problem ist, dass wenn der Agent verwirrt wird,
00:11:51kann er all diese Turns durchbrennen, indem er den gesamten Kontext erneut sendet, während er versucht, etwas zu lösen.
00:11:56Also kannst du dies auf einen niedrigeren Wert senken. Wir haben unseren auf 60 gesetzt, damit der Agent keine Turns verschwendet,
00:12:01indem er an einem Problem hängen bleibt. Es gibt noch eine weitere Einstellung, die es wert ist, eingeschaltet zu werden, die vor
00:12:06Schleifenbildung schützt. Du kannst die Hard-Stop-Einstellung von falsch auf wahr umschalten, was den Agenten davon abhält, ohne
00:12:10Grund in einer Schleife zu laufen. Wenn er also stecken bleibt und keine Fortschritte macht, greift der harte Stopp und stoppt ihn,
00:12:15bevor er weiter mahlt. Dann gibt es noch deine Cron-Jobs. Im Grunde Aufgaben, die von selbst laufen,
00:12:21nach einem Zeitplan, die standardmäßig keine Begrenzungen für ihre maximalen Turns haben. Du kannst das auf eine spezifische
00:12:26Zahl festlegen, sodass es eine Obergrenze gibt, wie viele Turns ein Cron-Job nehmen kann. Das hält Hintergrundjobs davon ab, Tokens
00:12:31aufzubrauchen, und verhindert, dass sie für immer Kosten verursachen. Um mit dem Hermes-Agent zu beginnen,
00:12:36haben wir ein ganzes Starterpaket kuratiert, das in AI Labs Pro verfügbar ist, unserer Community.
00:12:41Dort bekommst du die Ressourcen, die Starterpakete und mehr, zusammen mit einem Ort, um mit
00:12:45einer Reihe von Gleichgesinnten zu interagieren, einschließlich unseres Teams. Wenn du also Wert in dem gefunden hast, was wir tun,
00:12:50und den Kanal unterstützen möchtest, ist dies der beste Weg. Der Link ist in der Beschreibung.
00:12:54Das bringt uns zum Ende dieses Videos. Wenn du den Kanal unterstützen und uns helfen möchtest, weiterhin
00:12:59Videos wie dieses zu machen, kannst du das mit dem Super-Thanks-Button unten tun. Wie immer, danke fürs
00:13:04Zuschauen und ich sehe dich im nächsten Video.