7 Regeln, um Claude Fable 5.1 besser zu nutzen als 90 % der Leute

AAI LABS
Computing/Software

Transcript

00:00:00Fable 5.1 ist die neueste Version von Anthropic und eines der besten Modelle, die Sie derzeit
00:00:05nutzen können. Es verhält sich jedoch anders als die vorherigen Modelle, und es gibt ein paar kleine
00:00:09Dinge, die Sie bei der Zusammenarbeit ändern müssen. Denn wenn Sie es genauso wie die
00:00:13vorherigen Modelle verwenden, schöpfen Sie sein volles Potenzial nicht aus und erzielen möglicherweise sogar
00:00:18schlechtere Ergebnisse. Anthropic sagt zum Beispiel, dass dieses Modell am besten für lang laufende Aufgaben geeignet ist, aber es
00:00:23funktioniert nur dann gut, wenn Sie es auf eine bestimmte Weise anweisen. Und es gibt eine Einstellung, die
00:00:28Anthropic zufolge hochgedreht werden sollte, die die Ergebnisse aber tatsächlich verschlechtert. Wenn Sie zum ersten Mal hier sind:
00:00:32Wir sind ein Softwareunternehmen und das ist unser Kanal AI Labs. In diesem Video besprechen wir 7 Tipps,
00:00:37um das Beste aus Fable 5.1 herauszuholen. Bevor wir zu diesen Tipps kommen, müssen wir jedoch einige
00:00:42Dinge vorab über dieses neue Modell sagen. Mit der Veröffentlichung von Fable 5.1 behauptete Anthropic, dieses Modell sei
00:00:48viel besser darin, Aufgaben zu beenden. Aber Fable 5.1 leistet keine bessere Arbeit. Es schafft lediglich mehr Arbeit
00:00:54für weniger Geld. Das haben wir bei unseren eigenen Kundenprojekten gesehen. Wir haben Fable 5 und Fable 5.1 dieselben
00:01:00Aufgaben gegeben und jede davon mehrmals ausgeführt. Wir können keine Details zu den Projekten nennen, aber Fable 5
00:01:05hat bei den meisten Aufgaben bessere Arbeit geleistet, und Fable 5.1 war nur bei einer davon besser. Das war
00:01:10die schwierigste Aufgabe von allen, und bei dieser hat Fable 5.1 bessere Arbeit geleistet, war etwa 40 % schneller fertig und kostete deutlich
00:01:16weniger als die Hälfte. Fable 5.1 ist also stärker, wenn der Job schwieriger wird. Selbst bei den Aufgaben, bei denen seine
00:01:22Arbeit nicht besser war, lief es weiter. Fable 5 brach einige seiner Versuche vor dem Ende ab, während Fable
00:01:275.1 jeden einzelnen beendete. Zudem kostet es bei jeder Aufgabe weniger. Sie wissen vielleicht schon, dass Claude
00:01:33Code einen Befehl hat, der im Grunde schätzt, was Sie eine Sitzung gekostet hätte, wenn Sie pro Nutzung
00:01:38statt über ein Abonnement bezahlt hätten. Dieser Schätzung zufolge war Fable 5.1 etwa 47 % günstiger als
00:01:45Fable 5. Das liegt jedoch nicht daran, dass das Modell plötzlich weniger Token verbraucht. Es liegt daran, dass sich
00:01:50die Preise von Anthropic geändert haben. Bevor wir jedoch zu dieser Preisänderung kommen, müssen Sie eines wissen: Je länger
00:01:55die Aufgabe läuft, desto länger wird das Gespräch. Aus diesem Grund muss das Modell vor der Beantwortung eines neuen Prompts mehr
00:02:00lesen. Modelle erinnern sich nicht von einer Nachricht zur nächsten an das Gespräch.
00:02:05Jedes Mal, wenn ein Modell Ihnen eine weitere Antwort geben muss, muss daher das gesamte Gespräch erneut
00:02:10an es gesendet werden. Aber anstatt dasselbe Gespräch jedes Mal von Grund auf neu zu verarbeiten,
00:02:16speichert Claude eine Kopie der bereits verarbeiteten Teile und verwendet diese Kopie beim nächsten Prompt
00:02:21wieder. Im Grunde wird dies als gelesener Cache bezeichnet. Auch diese Cache-Lesevorgänge kosten Geld, sind jedoch im Vergleich
00:02:27zu den üblichen Eingaben und Ausgaben günstiger. Und bei Fable 5.1 hat Anthropic diesen Preis um 75 % gesenkt.
00:02:33Das Gespräch, das vor jeder Antwort erneut gesendet wird, kostet jetzt also wesentlich weniger. Diese Einsparung
00:02:39mag bei einem einzelnen Prompt gering erscheinen, da nicht viel Gesprächsverlauf erneut gesendet werden muss. Bei einer langen
00:02:44Aufgabe wird derselbe wachsende Gesprächsverlauf jedoch immer wieder gesendet, sodass die Ersparnis mit jeder Antwort des Modells wächst.
00:02:50Das deckt jedoch nur ab, was das Modell liest. Was das Modell schreibt, wird separat berechnet, und dieser
00:02:55Preis hat sich nicht geändert. Artificial Analysis, die Modelle testen und unabhängig bewerten, stellte fest, dass
00:03:01Fable 5.1 wesentlich mehr schrieb als Fable 5. Die Rechnung fiel also trotz der günstigeren Lesevorgänge höher aus. In ihren
00:03:07Tests erzeugte es etwa 1,7-mal mehr Ausgabe als Fable 5 und kostete pro Aufgabe etwa 20 % mehr.
00:03:14Anthropics Fable-Modelle verfügen über Sicherheitsleitplanken, also Regeln, die sie davon abhalten, bestimmte Arten
00:03:19von Aufgaben auszuführen. Und bei Fable 5.1 schränken diese Leitplanken laut Anthropic Claude-Code-Sitzungen
00:03:25etwa 60 % seltener ein. Wenn es jetzt jedoch eine dieser Leitplanken auslöst, wechselt Claude Code zu einem
00:03:31schwächeren Modell, ohne Sie zu informieren, und macht einfach weiter. Dieses schwächere Modell übernimmt dann den Rest der Sitzung,
00:03:36selbst wenn Ihre nächste Anfrage überhaupt nichts mit dem Auslöser zu tun hat. Statt einer Ablehnung erhalten Sie also
00:03:41schlechtere Arbeit und denken, Fable 5.1 hätte sie produziert. Das ist bereits jemandem passiert, der ein Spiel
00:03:46entwickelte, das eine Witzdatei mit dem Wort „biologisch“ enthielt. Das Projekt hatte überhaupt nichts mit Biologie zu tun,
00:03:51aber dieses eine Wort reichte aus, um das Modell zu wechseln, das die Arbeit bearbeitete. Wenn Ihr Projekt tatsächlich
00:03:55eines der Themen behandelt, die von diesen Leitplanken abgedeckt werden, wie Sicherheit oder Biologie, gibt es keine Einstellung und keine
00:04:00Formulierung, die dies verhindern kann. Das ist einfach ein Nachteil von Fable 5.1. Laut den Tests von Artificial Analysis
00:04:06schneidet Fable 5.1 bei der Genauigkeit besser ab als Fable 5, halluziniert aber auch häufiger, was passiert, wenn ein
00:04:13Modell die Antwort nicht kennt. Es erfindet dann eine und stellt sie als wahr dar. Wenn Fable 5.1 keine
00:04:18Antwort wusste, halluzinierte es in 72,6 % der Fälle. Bei Fable 5 war das in 63,6 % der Fall. Wenn ein Modell sagt,
00:04:26dass es etwas nicht weiß, ist das tatsächlich besser, als wenn es vorgibt, alles zu wissen, denn dann
00:04:31können Sie Dinge selbst überprüfen. Wenn es sich jedoch etwas ausdenkt und Sie ihm vertrauen, weil das Modell es gesagt
00:04:35hat, fließt diese erfundene Antwort direkt in Ihre Arbeit ein. Und das ist noch wichtiger, wenn Sie es
00:04:40für Recherchen oder zum Schreiben verwenden, da die Überprüfung später einen enormen Aufwand darstellt. Bevor wir jedoch zu
00:04:45den Tipps kommen, wäre es großartig, wenn Sie den Kanal abonnieren und den Hype-Button drücken. Diese kleine
00:04:50Geste der Unterstützung bedeutet uns sehr viel. Wenn Sie das alles gehört haben, werden Sie wahrscheinlich sagen, dass das
00:04:56ältere Modell in einigen Aspekten eindeutig besser ist. Das stimmt, aber gleichzeitig wird es bald
00:05:01das Standardmodell in den von Ihnen genutzten Apps sein. Aus diesem Grund müssen Sie den Tipps folgen, die wir
00:05:06besprechen werden. Andernfalls schöpfen Sie sein volles Potenzial nicht aus. Die erste Möglichkeit, Fable 5.1 tatsächlich
00:05:11besser zu nutzen, besteht darin, die Anstrengung („Effort“) zu verringern. Für diejenigen, die es nicht wissen: Effort ist die Einstellung,
00:05:16die festlegt, wie viel Arbeit das Modell investiert, bevor es Ihnen eine Antwort gibt. Und diese eine Einstellung beeinflusst
00:05:21sowohl die Qualität der Arbeit als auch die Kosten. Code Rabbit, die ein Tool zur Code-Überprüfung entwickeln,
00:05:26testeten Fable 5.1 bei ihrer echten Review-Arbeit und fanden heraus, dass es bei geringer Anstrengung 61 % der Probleme fand,
00:05:33verglichen mit 57,1 % bei hoher Anstrengung, und dabei auch noch etwa 3 Minuten schneller fertig war. Dasselbe haben wir
00:05:39beobachtet, als wir Fable 5.1 nutzten, um unserer Community-Website eine Funktion hinzuzufügen. Bei hoher Anstrengung verbrachte es
00:05:44sehr viel Zeit damit, bei einem Teil der Funktion hin und her zu springen, während es bei geringer Anstrengung alles fertigstellte und
00:05:49uns ein besseres Ergebnis lieferte. Wir haben bereits in unserem vorherigen Fable-Video zu geringer Anstrengung geraten, und nach der Nutzung
00:05:54von Fable 5.1 ist das nach wie vor unsere Empfehlung. Sie sollten also mit geringer Anstrengung beginnen und diese nur dann erhöhen, wenn das
00:06:00Ergebnis einen Grund dafür liefert. Andernfalls verschwenden Sie Zeit und Token für sehr wenig Gegenwert.
00:06:05Als Nächstes müssen Sie die Anweisungen entfernen, die Sie für ältere Modelle geschrieben haben. Diese
00:06:10Anweisungen verbleiben in Ihrem Setup, wenn Sie zu Fable 5.1 wechseln, obwohl das Verhalten, das sie
00:06:15korrigieren sollten, nicht mehr existiert. Fable 5.1 muss also weiterhin eine wachsende Liste von Korrekturen für Probleme befolgen, die es gar nicht hat.
00:06:21Sie verschwenden nur Ihr Limit, und einige davon verursachen mittlerweile neue Probleme. Wir haben dies in unserem
00:06:25vorherigen Video ebenfalls erwähnt. Nun fragen Sie sich vielleicht, wie Sie wissen sollen, welche Anweisung wichtig ist und
00:06:30welche nicht. Sie können es testen, indem Sie eine Anweisung aus Ihrer Claude.md entfernen und Claude dieselbe
00:06:36Art von Arbeit erneut übertragen. Wenn das Ergebnis ohne sie dasselbe ist, muss diese Anweisung dort nicht stehen. Aber Sie
00:06:41müssen nicht alles selbst erledigen. Claude Code verfügt über einen Befehl namens Claude API Prompt Audit, der
00:06:46diese Anweisungen für Sie findet. Sie müssen diesen Befehl im Terminal ausführen, und er überprüft alles, was Sie
00:06:51für Claude gespeichert haben. Anschließend zeigt er Ihnen, welche Anweisungen für ältere Modelle geschrieben wurden, und liefert Ihnen die exakten
00:06:56Änderungen, die er empfiehlt. Er ändert nichts eigenmächtig, sodass Sie die Liste zuerst überprüfen und nur
00:07:01den Änderungen zustimmen können, mit denen Sie einverstanden sind. Bevor wir zum nächsten Tip übergehen, hören wir ein Wort von unserem
00:07:06Sponsor Porkbun. Sie haben Ihre App endlich veröffentlicht, aber sie steckt auf einer zufälligen Standard-URL fest, und was sie
00:07:12wirklich braucht, ist eine eigene, richtige Domain. Hier kommt Porkbun ins Spiel, mit .app- und .dev-Domains, die speziell
00:07:18für Tech-Projekte entwickelt wurden. Eine .app-Domain ist perfekt für Ihre App oder Ihre SaaS-Landingpage,
00:07:23und .dev ist für Ihr Coding-Portfolio oder Ihre Dokumentation gedacht, sodass im selben Moment, in dem sie jemand sieht,
00:07:28klar ist, dass es sich um ein echtes Projekt handelt. Und das sind nicht nur schöne Namen. Jede .app- und .dev-Domain befindet sich
00:07:33auf der HSTS-Preload-Liste, was bedeutet, dass HTTPS bei jeder Verbindung automatisch und ohne Einrichtung aktiviert ist
00:07:39und ein kostenloses SSL-Zertifikat enthalten ist, sodass Ihre Website von Anfang an sicher ist. Das Beste daran:
00:07:45Sie erhalten Ihr erstes Jahr für nur 5,99 $ inklusive kostenlosem WHOIS-Datenschutz und ohne Aufpreise oder versteckte Gebühren.
00:07:52Nach dem ersten Jahr bleiben die Verlängerungspreise zum Selbstkostenpreis, sodass es langfristig günstig bleibt. Holen Sie sich Ihre Domain für 5,99 $
00:07:58unter [porkbun.com/ailabs26](https://www.google.com/search?q=https%3A%2F%2Fporkbun.com%2Failabs26). Der Link befindet sich unten in der Beschreibung.
00:08:03Anthropic verkauft Fable 5.1 für lange Aufgaben, die Sie laufen lassen können, ohne ständig zuzusehen, aber es
00:08:09pausiert dennoch, um vor einem Schritt um Erlaubnis zu bitten, der bereits durch Ihre ursprüngliche Anfrage abgedeckt war.
00:08:14Es stellt einfach eine Frage und wartet, und wenn niemand da ist, der antwortet, kommt Warten einem Stopp gleich.
00:08:19Dies geschieht, weil sein normales Verhalten davon ausgeht, dass Sie zusammen damit arbeiten. Deshalb besagt Anthropics
00:08:24Prompt-Leitfaden für Fable 5.1, dass Sie ihm im Prompt mitteilen müssen, dass niemand zuschaut
00:08:29und dass es mit allem fortfahren soll, was bereits durch Ihre Anfrage abgedeckt ist, solange es rückgängig gemacht werden kann.
00:08:34Das gibt dem Modell die Erlaubnis, einen langen Job zu beenden, ohne für unnötige Fragen anzuhalten.
00:08:39Fable 5.1 hat zudem die Angewohnheit, mehr Arbeit zu erledigen, als Sie verlangt haben.
00:08:43Wenn Sie es beispielsweise bitten, eine Funktion hinzuzufügen, bemerkt es möglicherweise ein anderes Problem in der Nähe und behebt dieses ebenfalls,
00:08:48oder es erweitert die Funktion über das von Ihnen beschriebene Maß hinaus. Das haben wir bei einem unserer Kundenprojekte gesehen,
00:08:53bei dem wir um eine Funktion baten und es zusätzlich Testdateien bearbeitete, die niemand anzufassen gebeten hatte.
00:08:58Das Problem dabei ist, dass diese zusätzlichen Änderungen Teile Ihres Produkts verändern können, die genau so bleiben sollten,
00:09:03wie sie waren. Wenn Sie Fable 5.1 also eine Aufgabe geben, sollten Sie ihm auch sagen, was es in Ruhe lassen soll,
00:09:08was bedeutet, dass es nur das ändert, was die Anfrage verlangt. Und wenn es ein anderes Problem bemerkt,
00:09:13erwähnt es das am Ende. Und als wir das bei unserem Projekt taten und ihm ausdrücklich sagten, nicht
00:09:18die Testdateien zu bearbeiten, arbeitete es nur an der gewünschten Funktion. Fable 5.1 hat noch eine Angewohnheit und die tritt
00:09:24immer auf, wenn es Dateien ändert. Wenn es an einer Aufgabe arbeitet und nur einen kleinen Teil einer Datei bearbeiten muss,
00:09:29schreibt es stattdessen die gesamte Datei neu, obwohl der Rest sich überhaupt nicht verändert.
00:09:33Das mag für Sie in Ordnung aussehen, weil Sie immer noch das richtige Ergebnis erhalten, aber jede einzelne dieser
00:09:38Zeilen kostet Output-Tokens, und wenn es mit vielen Dateien arbeitet, erschöpft das Ihr Limit viel schneller.
00:09:43Wir sahen dies bei unserem eigenen Second Brain, wo jede kleine Änderung mehr kostete, als sie sollte,
00:09:48weil es ständig Dateien umschrieb, die es hätte einfach bearbeiten können. Um das zu stoppen,
00:09:52müssen Sie Fable 5.1 sagen, dass es bei einer kleinen Änderung, die dasselbe Ergebnis liefert,
00:09:56nur diesen Teil bearbeiten soll. Das nächste Problem betrifft nicht, wie viel Fable 5.1 schreibt,
00:10:01sondern wie es schreibt. Wir haben das bereits bei Opus 5 gesehen, das viel von dem nutzte, was Anthropic als
00:10:06“gestelzten Schreibstil” bezeichnet. Für diejenigen, die es nicht wissen: “Gestelzter Schreibstil” liegt vor, wenn das Modell ausgefallene
00:10:11Phrasen und Metaphern verwendet, anstatt einfach zu sagen, was es meint. Anstatt zum Beispiel zu sagen, dass eine Einstellung
00:10:16eine Änderung wert ist, nennt das Modell es ein Rad, das es sich zu drehen lohnt. Und bei einer langen Rechercheaufgabe
00:10:20macht diese Art von Sprache es schwer, überhaupt den Punkt zu erkennen, den das Modell machen will.
00:10:24Nun, Fable 5.1 verwendet weniger davon als Opus 5 und Fable 5, und es verwendet auch weniger Standardphrasen und weniger
00:10:31unerklärten Jargon. Aber das Problem ist in seinem Schreibstil immer noch da, und im Vergleich zu Fable 5
00:10:36sind seine Sätze länger und haben weniger Absatzumbrüche, was es noch schwieriger macht, ihnen zu folgen.
00:10:41Man muss ihm also einfach sagen, dass es künstlichen Stil vermeiden soll, und damit behebt man beides. Genau das haben wir getan, als
00:10:46wir es für eine unserer eigenen Rechercheaufgaben ausgeführt haben, bei denen wir es eher zum Schreiben als zum Erstellen nutzten.
00:10:51Das Letzte ist die Art von Arbeit, die Sie Fable 5.1 geben. Alles, was wir bisher behandelt haben, dreht sich darum, mehr
00:10:56herauszuholen, aber die Art des Auftrags ist genauso wichtig, denn Fable 5.1 ist bei den großen Aufgaben am besten.
00:11:01Als wir die Aufgaben für unsere Projekte ausführten, hat Fable 5 bei der einfachsten Aufgabe tatsächlich bessere Arbeit geleistet,
00:11:07aber bei der schwersten hat Fable 5.1 bessere Arbeit geleistet, und es war etwa 40 % schneller fertig und kostete 58 % weniger.
00:11:14Große Aufgaben sind also das Gebiet, auf dem Fable 5.1 gewinnt, denn genau da kommt es darauf an, das Ganze ohne
00:11:19Stoppen zu Ende zu bringen. Deshalb sollten Sie eine Funktion nicht in viele kleine Prompts aufteilen und sie
00:11:23ihm Schritt für Schritt geben. Sie sollten ihm die gesamte Funktion geben und das gewünschte Ergebnis klar beschreiben,
00:11:28und dann werden Sie sehen, wie es die gesamte Funktion von alleine fertigstellt. Wenn Sie nun Zugriff auf all die Fähigkeiten
00:11:33und Workflows haben möchten, die wir Ihnen in unseren Videos zeigen, können Sie diese in AI Labs Pro erhalten, unserer Community.
00:11:38Wenn Sie also unseren Wert schätzen und den Kanal unterstützen möchten, ist dies der beste Weg dazu.
00:11:43Der Link ist in der Beschreibung. Damit sind wir am Ende dieses Videos angelangt. Wenn Sie den
00:11:48Kanal unterstützen und uns helfen möchten, weiterhin solche Videos zu machen, können Sie das über den Super Thanks-Button tun.
00:11:53Wie immer vielen Dank fürs Zusehen und bis zum nächsten Mal.

Key Takeaway

Fable 5.1 liefert bei großen und schwierigen Aufgaben bessere Ergebnisse, erfordert jedoch eine niedrigere Anstrengungseinstellung, das Entfernen veralteter Anweisungen und klare Vorgaben gegen das vollständige Umschreiben von Dateien.

Highlights

  • Fable 5.1 arbeitet bei komplexen Aufgaben etwa 40 % schneller und kostet weniger als die Hälfte im Vergleich zu Fable 5.

  • Das Modell halluziniert in 72,6 % der Fälle, wenn es eine Antwort nicht weiß.

  • Eine niedrige Anstrengungseinstellung („Effort“) findet 61 % der Code-Probleme, während eine hohe Anstrengungseinstellung nur 57,1 % erreicht.

  • Das Lesen von Cache-Daten ist bei Fable 5.1 um 75 % günstiger.

  • Fable 5.1 schreibt etwa 1,7-mal mehr Output und kostet pro Aufgabe rund 20 % mehr als der Vorgänger.

Timeline

Leistung und Kosten von Fable 5.1

  • Fable 5.1 eignet sich am besten für lang laufende und komplexe Aufgaben.
  • Das Modell erledigt mehr Arbeit für weniger Geld, auch wenn Fable 5 bei einfacheren Aufgaben präziser war.
  • Die Kosten für gelesene Caches wurden von Anthropic um 75 % gesenkt.

Fable 5.1 unterscheidet sich grundlegend von vorherigen Versionen. Bei einer sehr schwierigen Testaufgabe arbeitete Fable 5.1 etwa 40 % schneller und kostete weniger als die Hälfte. Zwar sanken die Kosten für gelesene Caches um 75 %, jedoch schreibt das Modell laut unabhängigen Tests etwa 1,7-mal mehr Text, was die Gesamtkosten pro Aufgabe um rund 20 % erhöht.

Sicherheitsleitplanken und Halluzinationen

  • Sicherheitsleitplanken schränken Sitzungen 60 % seltener ein, wechseln bei einem Auslöser jedoch unbemerkt zu einem schwächeren Modell.
  • Fable 5.1 halluziniert in 72,6 % der Fälle, wenn ihm eine Antwort nicht bekannt ist.

Wenn das Modell bestimmte Begriffe wie biologische Ausdrücke erkennt, schaltet Claude Code im Hintergrund auf ein schwächeres Modell um, ohne den Nutzer zu informieren. Zudem steigt die Halluzinationsrate auf 72,6 %, was die manuelle Überprüfung von Recherchen und Texten erschwert, da erfundene Fakten als wahr dargestellt werden.

Sieben Regeln zur Optimierung der Nutzung

  • Die Verringerung der Anstrengung („Effort“) verbessert die Qualität und reduziert die Bearbeitungszeit.
  • Veraltete Anweisungen aus älteren Modellen müssen aus den Konfigurationsdateien entfernt werden.
  • Fable 5.1 sollte die explizite Anweisung erhalten, nur die angeforderten Teile und nicht ganze Dateien umzuschreiben.

Um das volle Potenzial auszuschöpfen, empfiehlt sich eine niedrige Anstrengungseinstellung, da diese bei Code-Reviews bessere Ergebnisse liefert als eine hohe Stufe. Veraltete Prompt-Anweisungen verbrauchen unnötig Tokens und sollten bereinigt werden. Zudem neigt das Modell dazu, unveränderte Dateien komplett neu zu schreiben und zu viel Code zu erzeugen, weshalb klare Grenzen im Prompt notwendig sind.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video