Es ist vorbei... Das hat gerade die GPT 6 Astra gegen Fable 5.1 Debatte beendet
AAI LABS
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00Fable 5.1 und GPT-6 Astra wurden im Abstand von nur wenigen Tagen veröffentlicht und erhielten beide wirklich
00:00:05hohe Punktzahlen in Benchmarks. Astra erreichte beim AGI-Test sogar fast 100 %, was bisher noch keinem Modell
00:00:11auch nur annähernd gelungen ist. Wenn man sich diese Zahlen ansieht, würde man also erwarten, dass es
00:00:16beim eigenen Arbeitsaufwand hervorragend abschneidet. Doch das gute Abschneiden bei diesen Tests verrät nicht,
00:00:20wie gut ein Modell die ihm gestellten Aufgaben bewältigt, und wir wollten sehen, ob sich beide Modelle bei
00:00:25unserer eigenen Arbeit genauso gut schlagen. Da wir ein Softwareunternehmen sind, hatten wir bereits Projekte,
00:00:30an denen wir sie testen konnten. Also gaben wir beiden Modellen Arbeit aus diesen Projekten und überprüften,
00:00:35was sie fertigstellten. Wir ließen jedes Modell in mehreren Projekten antreten und bewerteten seine Leistung
00:00:41in verschiedenen Bereichen. Wir nutzten GPT-5.6 als Jurymodell, um die Ergebnisse zu beurteilen und zu benoten.
00:00:45Dieses Schiedsrichtermodell wusste nicht, welche Ergebnisse von Fable und welche von Astra stammten. Ein Modell
00:00:52erzielte eine Gesamtpunktzahl von 86 von 100, während das andere auf 84 kam. Das mag zwar nach einem
00:00:57kleinen Abstand aussehen, aber das insgesamt siegreiche Modell hat nicht jeden Teilbereich der Tests gewonnen
00:01:02und das andere schnitt in einigen Bereichen überraschend gut ab. Deshalb gehen wir nun durch, wie sich die
00:01:07einzelnen Modelle in unseren Tests geschlagen haben und wer in welcher Kategorie gewonnen hat, damit Sie wissen,
00:01:12wie sich diese Unterschiede auf Ihre eigenen Aufgaben auswirken. Bevor wir dazu übergehen, wie sich die
00:01:17Modelle geschlagen haben, wollen wir sie zunächst kurz vorstellen. Dieser Abschnitt ist nur für diejenigen
00:01:22gedacht, die sie noch nicht kennen – wer die Details bereits kennt, kann diesen Teil überspringen und direkt
00:01:27zum nächsten übergehen. Anthropic hat Fable 5.1 am 1. September veröffentlicht, und noch bevor Anthropic den
00:01:33Hype um die Veröffentlichung richtig genießen konnte, brachte OpenAI nur wenige Tage nach Fable GPT-6 Astra
00:01:37auf den Markt. Die Leute bauen wirklich interessante Produkte mit diesen Modellen, treiben sie an die Grenzen
00:01:43ihrer Leistungsfähigkeit und erzielen dabei überraschende Ergebnisse. Was die Preisgestaltung angeht, kosten
00:01:49beide Modelle genau gleich: 10 Dollar pro Million Input-Token und 50 Dollar pro Million Output-Token. Bei Fable
00:01:545.1 gibt es jedoch einen Unterschied: Anthropic hat den Preis für zwischengespeicherte Lesevorgänge (Cached
00:02:00Reads) um 75 % gesenkt. Wer sich mit Cached Reads nicht auskennt: Teile der Konversation, die das Modell
00:02:05bereits gelesen hat, werden zur Wiederverwendung gespeichert. Wenn Sie einen neuen Prompt senden, werden diese
00:02:10gespeicherten Teile wiederverwendet, anstatt sie noch einmal von Grund auf zu lesen – das nennt sich Cached Read.
00:02:14Diese Lesevorgänge machen die Wiederverwendung der Konversation bereits günstiger, und durch den gesenkten Preis
00:02:19wird es noch billiger. Das bedeutet jedoch nicht, dass Fable insgesamt ein günstigeres Modell ist, da die Gesamtrechnung
00:02:25von vielen weiteren Faktoren abhängt, auf die wir gleich noch eingehen werden. Fable-Modelle sind zwar schon
00:02:30länger in Claude Code integriert, aber Fable 5.1 ist nach wie vor nicht im Claude Pro-Tarif enthalten, sodass
00:02:36Sie es dort separat über Nutzungsguthaben bezahlen müssen. In den Max-Tarifen ist Fable 5.1 zwar enthalten,
00:02:41allerdings haben Fable-Modelle dort ein niedrigeres Limit als die übrigen Modelle. Andererseits behandelt OpenAI
00:02:47Astra nicht als ein solches separates Modell, da Astra Teil der normalen Codex-Limits von ChatGPT+ und Pro
00:02:52ist und Sie Ihr gesamtes Nutzungsguthaben für Astra aufbrauchen können. Nun sind diese Modelle wirklich
00:02:57fähig, an langen Aufgaben zu arbeiten, was bedeutet, dass Sie sie einfach auffordern können, ein großes
00:03:02Feature zu bauen, und sie die Schritte allein abarbeiten lassen. Wenn Sie diese Modelle jedoch an einer
00:03:09langen Aufgabe arbeiten lassen, spielt auch die Größe des Kontexts eine Rolle, den sie vorhalten können.
00:03:14Fable bietet Ihnen eine Million Token in Claude Code, während Astras Standard-Kontextfenster in Codex selbst bei
00:03:21Astra nur 272.000 Token beträgt, obwohl es über seine API ein viel größeres Fenster besitzt, das Fables Million
00:03:26sogar noch übertrifft. Das bekommen Sie in Codex vorerst jedoch nicht, da Codex standardmäßig selbst für Astra
00:03:31nur ein Kontextfenster von 272.000 Token verwendet. Nun haben diese Modelle ein Niveau erreicht, auf dem
00:03:36sie fortgeschrittene Recherchen durchführen können, weshalb OpenAI und Anthropic Sicherheitsleitplanken
00:03:41hinzugefügt haben, die einige ihrer Arbeitsweisen einschränken. Diese Einschränkungen wirken sich jedoch auf
00:03:45unterschiedliche Weise auf Ihre Arbeit aus, da jedes Modell anders reagiert, wenn sein Sicherheitssystem
00:03:51einen Befehl als unzulässig eingestuft hat. Wenn Astra an einen Teil der Aufgabe gelangt, der gegen seine Regeln
00:03:56verstößt, lehnt es die Aufgabe glatt ab und teilt Ihnen das mit. Andererseits wechselt Claude Code von
00:04:01Fable zu einem schwächeren Modell, wenn eine Anfrage gegen die Regeln verstößt. Viele Nutzer haben festgestellt,
00:04:06dass Claude Code das Modell gewechselt hatte, ohne dass sie es wussten. Wenn Claude Code nach diesem Wechsel
00:04:11weiterarbeitet, stammt das Ergebnis möglicherweise nicht mehr von Fable. Die erste Metrik, die wir gemessen
00:04:16haben, war die Qualität, die bewertet, wie gut die Arbeit des Modells tatsächlich ist. Für diesen Test haben
00:04:22wir mehrere Kundenprojekte verwendet, sodass wir die Details dieser Projekte nicht preisgeben können, aber wir
00:04:27können erklären, wie wir die Arbeit beurteilt haben und worin sich die Modelle unterschieden. Hinsichtlich
00:04:32der Sauberkeit und Strukturierung des Codes erzielte Fable 90 Punkte verglichen mit 78 Punkten bei Astra, weil
00:04:39es den Code für verschiedene Teile der App übersichtlicher voneinander getrennt hielt. Das erleichtert dem
00:04:44Modell das Verständnis der App bei späteren Änderungen, und Fable lag diesbezüglich bei allen getesteten
00:04:50Projekten vor Astra. Was den Umfang der erledigten Aufgaben angeht, erreichte Fable 91 Punkte gegenüber 84
00:04:55bei Astra, weil es auch Probleme behob, um deren Behebung wir gar nicht ausdrücklich gebeten hatten. Wir
00:05:00haben jedoch auch geprüft, ob die fertigen Funktionen ohne Korrekturanfragen fehlerfrei funktionierten; hierbei
00:05:08erreichte Astra 87 Punkte im Vergleich zu 85 Punkten bei Fable. Ein Teil von Astras Vorsprung rührte daher,
00:05:13dass es die Apps gründlicher überprüfte und mehr der bekannten Mängel behob. Wenn Fable seine Apps testete,
00:05:19entgingen ihm einige Fehlerquellen, sodass die fertigen Features noch einige Macken aufwiesen. Bezüglich
00:05:25des Nutzungserlebnisses der App erzielte Astra 89 Punkte im Vergleich zu 88 Punkten bei Fable, da es die
00:05:30verschiedenen Bereiche der Seite an intuitiveren und leichter auffindbaren Plätzen anordnete. Basierend auf
00:05:35allen genannten Tests betrug Fables Gesamtqualitätsnote 88, während Astra 84 Punkte erreichte, da Fable
00:05:41vollständigere Funktionen baute und seine Arbeit leichter abzuändern war. In puncto Qualität ist Fable
00:05:46somit der klare Sieger. Doch bevor wir zum nächsten Test kommen, hören wir ein Wort von unserem Sponsor Zapier.
00:05:52und Ihnen programmatischen Zugriff auf Zapiers Ökosystem mit über 9000 Apps bietet.
00:05:58wie Gmail, Slack und Notion verbinden möchte, strickt man jede Integration und jeden OAuth-Ablauf von Hand.
00:06:04Bevor man sich versieht, versinkt man in Authentifizierungscode und plötzlich bestehen die Integrationen aus
00:06:10dem halben Projekt. Genau hier kommt das Zapier-SDK ins Spiel. Es ist eine Code-Bibliothek, die Sie direkt
00:06:15in Ihrem Projekt in Claude Code oder Cursor ablegen und die Ihnen programmatischen Zugriff auf das Ökosystem
00:06:20von über 9000 Apps von Zapier gibt. Anstatt also jede Integration manuell zu erstellen, haben wir einfach
00:06:26die benötigten aufgerufen und weitergemacht. Mit ein paar Zeilen Code verschickte unsere App E-Mails und
00:06:31erstellte Notion-Seiten – ganz ohne API-Dokumentation und ohne lästige Authentifizierungsprobleme. Wenn wir
00:06:36eine benutzerdefinierte Eigenschaft in Notion aktualisieren mussten, für die es keine vorgefertigte Aktion
00:06:42gab, sprachen wir sie direkt über das SDK an. Es holt Sie dort ab, wo Sie ohnehin arbeiten. Wenn Sie es
00:06:47satt haben, Integrationen von Hand zu basteln, probieren Sie das Zapier-SDK aus. Der Link steht unten in
00:06:53der Beschreibung. Die nächste gemessene Metrik war, wie gut die Modelle mit lang laufenden Aufgaben
00:06:58umgehen konnten – also wie viel Arbeit sie eigenständig und mit minimaler Anleitung durch uns während des
00:07:03Prozesses erledigten. Wir haben auch geprüft, wie sie mit Problemen umgingen, die unterwegs auftauchten.
00:07:09Dazu gaben wir jedem Modell eine App-Idee vor und formulierten die Anfrage gemäß dessen Prompting-Leitfaden,
00:07:13damit es die besten Chancen hatte, die Arbeit gut auszuführen. Wir nannten keine spezifischen Details,
00:07:18sondern beschrieben lediglich, was die App leisten musste. Astra arbeitete etwa 32 Minuten lang und Fable
00:07:24etwa 44 Minuten. Astra stieß beim Erstellen und Prüfen seiner App zwar auf Fehler, bewältigte diese jedoch
00:07:30und arbeitete eigenständig an der Fehlerbehebung weiter, ohne dass wir es durch jedes Problem leiten
00:07:35mussten. Auch Fable stellte seine App fertig, ohne vorzeitig abzubrechen oder uns zu fragen, was als Nächstes
00:07:40zu tun ist, und führte Prüfungen für das Erstellte aus. Beide haben die Aufgabe also zu Ende geführt,
00:07:45aber wir haben uns die fertigen Apps auch angesehen, um zu sehen, womit sie uns zurückgelassen hatten. Astras
00:07:51App öffnete sich direkt mit einer Anmeldeseite ohne separate Startseite. Sobald wir uns angemeldet hatten,
00:07:56war das Layout übersichtlich und die App funktionierte, wenngleich sie immer noch die vertrauten Layouts
00:08:01bei langwierigen Aufgaben erreichte Estra 93 von 100 Punkten, verglichen mit Fables 90.
00:08:08da es sich nicht weit genug scrollen ließ, um den Abmelden-Button zu erreichen. Wir mussten herauszoomen,
00:08:13um diesen Button zu erreichen – etwas, das Astras eigene Prüfungen nicht entdeckt hatten. Fables App öffnete
00:08:18sich ebenfalls direkt mit einer Anmeldeseite, aber ihr Design wirkte weitaus generischer. Die Funktionen
00:08:23funkionierten, aber alles war so eng beieinander gepackt, dass die App schwer zu bedienen war und die
00:08:28wiederholten Farbverläufe diesen vertrauten KI-Look verstärkten. Sie passte sich zwar an kleinere Bildschirme
00:08:33an, verfügte aber dennoch über kein brauchbares Layout, auch wenn die Funktionen tiefgreifend waren. Wir
00:08:38hatten auch mehrere andere Apps und riesige Features auf diese Weise geplant und gebaut, wobei die Modelle
00:08:44sich selbst überlassen blieben. Für lang laufende Arbeiten erzielte Astra somit 93 von 100 Punkten im
00:08:50Vergleich zu Fables 90. Fable konzentrierte sich stärker darauf, die Funktionen zum Laufen zu bringen, es
00:08:55sei denn, wir hatten im Prompt angegeben, dass es auch den Schwerpunkt auf die Optik legen sollte. Astra
00:09:00Astras Version bot ein übersichtlicheres Layout mit klareren Unterschieden bei Schriftgröße und
00:09:05Farben, wodurch der Text leichter zu lesen war. Aber es gab viel weniger Bewegung; es fühlte sich zwar
00:09:10angenehmer fürs Auge an, bot aber nicht dasselbe Erlebnis wie Fables Design. Deswegen
00:09:14erzielte Fable bei der Interaktivität 94 Punkte, während Astra auf 85 kam. Als Nächstes ließen wir
00:09:20von jedem Modell eine Landingpage für ein Horrorspiel entwerfen. Fables Design nutzte einen
00:09:25animierten Leuchtturm für die Atmosphäre. Die Grafiken wurden als SVGs erstellt – also Bilder, die
00:09:31durch Code gezeichnet werden –, aber der Text hob sich aufgrund von Fables Größen- und Farbwahl
00:09:36nicht genug vom dunklen Hintergrund ab. Bei derselben Designaufgabe nutzte Astra das in Codex
00:09:42integrierte Bildgenerierungsmodell, um ein Bild zu erstellen, anstatt die Grafik per Code zu erzeugen.
00:09:47Außerdem erstellte es einen Teaser für das Spiel, obwohl wir gar nicht darum gebeten hatten. Und Astra
00:09:52lag bei der Wahl von Schriften und Farben vorn, wodurch sich der Text gut vom dunklen Hintergrund abhob.
00:09:57Für die Musikfestival-Website wiederholte Fables Version viele der Gestaltungsmerkmale, die wir von
00:10:03Opus kennen. Doch trotz dieser vertrauten Entscheidungen wirkte es, als habe Fable mehr Mühe
00:10:08hineingesteckt, der Seite einen eigenen Stil zu geben. Astra nutzte ein generiertes Konzertfoto,
00:10:13aber das Gesamtdesign wirkte generischer. Der letzte Vergleich war ein Einparkspiel, bei dem Fables
00:10:18Version wirklich gut gemacht war und der Rückspiegel uns half, die Position des Autos genauer
00:10:23einzuschätzen. Das Spiel hatte zwei Kameraansichten, aber beide hatten Probleme: Die eine zeigte
00:10:27die falsche Seite der Parklücke, während die andere nur eine Seite zeigte, statt uns einen
00:10:32vollständigen Blick auf die Straße zu geben. Das erschwerte es zu sehen, wohin das Auto bewegt wurde.
00:10:38Wären diese Kamerapositionen richtig gewesen, hätte sich das Spiel realistischer angefühlt. Astra bot
00:10:42drei feste Ansichten und fügte im Seitenpanel Fahrhinweise hinzu, was das Spiel benutzerfreundlicher
00:10:48machte. Die Kameraansichten waren deutlich besser als bei Fable. Dies waren allgemeine Tests, bei denen
00:10:53wir den Modellen nur sehr wenige Details vorgaben, sodass wir hier den eigenen Geschmack der
00:10:58Modelle sahen. Beide wiederholten Designentscheidungen aus ihren früheren Arbeiten, lieferten aber
00:11:04gute Ergebnisse. Mit etwas mehr Details zum gewünschten Look and Feel würden voraussichtlich beide
00:11:09gut designen. Nach reinem Geschmack gewann Astra also bei Optik und Usability, während Fable bei
00:11:15Animationen und Interaktivität vorne lag. Bevor wir zu Kosten und Geschwindigkeit kommen, würden wir
00:11:20uns freuen, wenn Sie den Kanal abonnieren und den Daumen-nach-oben-Button drücken. Diese kleine
00:11:25Unterstützung hilft uns enorm. Die nächste Metrik war die Effizienz, die die Arbeitskosten,
00:11:31die benötigte Zeit und die Häufigkeit der Werkzeugnutzung umfasste. Zu den Kosten ist zu sagen,
00:11:37dass wir nicht die API nutzten; es handelt sich also um Schätzungen basierend auf den verbrauchten Token.
00:11:47Wir führten die Tests in unserem gewohnten Abo aus. Über alle Testläufe hinweg beliefen sich Fables
00:11:52geschätzte Gesamtkosten auf 49,18 Dollar, verglichen mit 27,69 Dollar bei Astra, womit Astras
00:11:57Gesamtsumme etwa 44 Prozent niedriger lag. Fable generierte fast dreimal so viele Output-Token wie
00:12:03Astra, ganz im Sinne von Fables Prompt-Anleitung, die besagt, dass es dazu neigt, mehr zu schreiben als
00:12:09sechs Durchläufe verwendete der Hauptagent von Fable seine Tools 443-mal im Vergleich zu 287-mal bei Astra, was ebenfalls die
00:12:17Kosten erhöhte. Auch die Werkzeugnutzung treibt den Token-Verbrauch nach oben, da das Modell
00:12:23entscheidet, welches Tool es einsetzt, und dann die Ergebnisse liest, bevor es weiterarbeitet.
00:12:30Über alle sechs Läufe hinweg nutzte Fables Hauptagent seine Tools 443-mal im Vergleich zu Astras
00:12:35287-mal, was ebenfalls zu den Kosten beitrug. Bei den Kosten erzielte Astra 80 von 100 Punkten
00:12:40gegenüber Fables 66. Bei der Geschwindigkeit lag Astra mit 70 Punkten ebenfalls vor Fable mit 67.
00:12:44Die lang laufenden Aufgaben nahmen für Astra insgesamt rund 62 Minuten in Anspruch, verglichen mit
00:12:4973 Minuten bei Fable. Über die Wertungen für Kosten, Geschwindigkeit und Werkzeugeffizienz hinweg
00:12:53schnitt Astra also besser ab als Fable. Die nächste gemessene Metrik war das Befolgen von
00:12:58Anweisungen; wir prüften, wie gut die Modelle den Vorgaben beim Erstellen folgten und ob sie diese
00:13:04auch im weiteren Verlauf einhielten. Als wir Fable an einem Projekt arbeiten ließen, fügte es
00:13:09erreichte Astra 96 von 100 Punkten im Vergleich zu Fables 88. Was also die Befolgung der Anweisungen betrifft,
00:13:16obwohl unsere Anweisungen dies ausdrücklich untersagt hatten. Es ignorierte zudem eine Regel
00:13:21bezüglich des Erstellens oder Änderns von Dateien. Wir hatten ihm aufgetragen, Claudes eigene
00:13:27Dateibearbeitungstools zu verwenden, damit diese Änderungen protokolliert und leicht rückgängig zu
00:13:33machen sind, aber es erstellte stattdessen zwei Dateien durch Ausführen von Befehlen. Beim
00:13:37Befolgen von Anweisungen erzielte Astra 96 von 100 Punkten im Vergleich zu Fables 88. In dieser
00:13:42Hinsicht lag Astra in diesen Durchläufen also vorn. Als Nächstes maßen wir die Review-Qualität,
00:13:47indem wir den Modellen ein fehlerhaftes Projekt gaben und sie baten, diese Fehler zu finden.
00:13:52Zunächst gaben wir beiden denselben Code zum Überprüfen, in den absichtlich vier Fehler eingebaut
00:13:57waren, sodass wir wussten, was sie finden mussten. Fable fand alle vier und zudem fünf weitere
00:14:03Probleme, die wir nicht hinzugefügt hatten und die anschließend überprüft und bestätigt wurden.
00:14:08Astra fand zwei der vier von uns eingebauten Fehler, erklärte das Review jedoch trotzdem für
00:14:13abgeschlossen. Wir hatten auch drei verdächtig aussehende Stellen eingebaut, die eigentlich korrekt
00:14:19waren, um zu sehen, ob das Modell falsche Fehler melden würde. Keines der beiden stufte diese als
00:14:25Bugs ein, sodass der Unterschied hier in der Quantität der Funde lag und Fable das gründlichere
00:14:30Review lieferte. Als wir sie jedoch an einem größeren Projekt mit neun bestätigten Problemen
00:14:35testeten, behob Astra fünf, während Fable nur vier fand und reparierte. Astra erledigte also mehr
00:14:40der Korrekturen, obwohl beide einige Probleme ungelöst ließen. Für die Review-Qualität, die diese
00:14:45Korrekturen und die Überprüfung der sonstigen Arbeit einschloss, erhielt Fable 84 Punkte gegenüber
00:14:51Astras 78. Fable hatte beim Gesamt-Review also die Nase vorn, weil es insgesamt die stärkere
00:14:56Überprüfung lieferte. Basierend auf diesen Ergebnissen ist Astra in mehreren der getesteten
00:15:01Kategorien der klare Sieger, aber das bedeutet nicht, dass Fable ein schlechtes Modell ist,
00:15:05denn es lieferte bei den Aufgaben eine gute Leistung und lag bei mehreren nicht weit hinter Astra.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기