Es ist vorbei... Das hat gerade die GPT 6 Astra gegen Fable 5.1 Debatte beendet

AAI LABS
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Fable 5.1 und GPT-6 Astra wurden im Abstand von nur wenigen Tagen veröffentlicht und erhielten beide wirklich
00:00:05hohe Punktzahlen in Benchmarks. Astra erreichte beim AGI-Test sogar fast 100 %, was bisher noch keinem Modell
00:00:11auch nur annähernd gelungen ist. Wenn man sich diese Zahlen ansieht, würde man also erwarten, dass es
00:00:16beim eigenen Arbeitsaufwand hervorragend abschneidet. Doch das gute Abschneiden bei diesen Tests verrät nicht,
00:00:20wie gut ein Modell die ihm gestellten Aufgaben bewältigt, und wir wollten sehen, ob sich beide Modelle bei
00:00:25unserer eigenen Arbeit genauso gut schlagen. Da wir ein Softwareunternehmen sind, hatten wir bereits Projekte,
00:00:30an denen wir sie testen konnten. Also gaben wir beiden Modellen Arbeit aus diesen Projekten und überprüften,
00:00:35was sie fertigstellten. Wir ließen jedes Modell in mehreren Projekten antreten und bewerteten seine Leistung
00:00:41in verschiedenen Bereichen. Wir nutzten GPT-5.6 als Jurymodell, um die Ergebnisse zu beurteilen und zu benoten.
00:00:45Dieses Schiedsrichtermodell wusste nicht, welche Ergebnisse von Fable und welche von Astra stammten. Ein Modell
00:00:52erzielte eine Gesamtpunktzahl von 86 von 100, während das andere auf 84 kam. Das mag zwar nach einem
00:00:57kleinen Abstand aussehen, aber das insgesamt siegreiche Modell hat nicht jeden Teilbereich der Tests gewonnen
00:01:02und das andere schnitt in einigen Bereichen überraschend gut ab. Deshalb gehen wir nun durch, wie sich die
00:01:07einzelnen Modelle in unseren Tests geschlagen haben und wer in welcher Kategorie gewonnen hat, damit Sie wissen,
00:01:12wie sich diese Unterschiede auf Ihre eigenen Aufgaben auswirken. Bevor wir dazu übergehen, wie sich die
00:01:17Modelle geschlagen haben, wollen wir sie zunächst kurz vorstellen. Dieser Abschnitt ist nur für diejenigen
00:01:22gedacht, die sie noch nicht kennen – wer die Details bereits kennt, kann diesen Teil überspringen und direkt
00:01:27zum nächsten übergehen. Anthropic hat Fable 5.1 am 1. September veröffentlicht, und noch bevor Anthropic den
00:01:33Hype um die Veröffentlichung richtig genießen konnte, brachte OpenAI nur wenige Tage nach Fable GPT-6 Astra
00:01:37auf den Markt. Die Leute bauen wirklich interessante Produkte mit diesen Modellen, treiben sie an die Grenzen
00:01:43ihrer Leistungsfähigkeit und erzielen dabei überraschende Ergebnisse. Was die Preisgestaltung angeht, kosten
00:01:49beide Modelle genau gleich: 10 Dollar pro Million Input-Token und 50 Dollar pro Million Output-Token. Bei Fable
00:01:545.1 gibt es jedoch einen Unterschied: Anthropic hat den Preis für zwischengespeicherte Lesevorgänge (Cached
00:02:00Reads) um 75 % gesenkt. Wer sich mit Cached Reads nicht auskennt: Teile der Konversation, die das Modell
00:02:05bereits gelesen hat, werden zur Wiederverwendung gespeichert. Wenn Sie einen neuen Prompt senden, werden diese
00:02:10gespeicherten Teile wiederverwendet, anstatt sie noch einmal von Grund auf zu lesen – das nennt sich Cached Read.
00:02:14Diese Lesevorgänge machen die Wiederverwendung der Konversation bereits günstiger, und durch den gesenkten Preis
00:02:19wird es noch billiger. Das bedeutet jedoch nicht, dass Fable insgesamt ein günstigeres Modell ist, da die Gesamtrechnung
00:02:25von vielen weiteren Faktoren abhängt, auf die wir gleich noch eingehen werden. Fable-Modelle sind zwar schon
00:02:30länger in Claude Code integriert, aber Fable 5.1 ist nach wie vor nicht im Claude Pro-Tarif enthalten, sodass
00:02:36Sie es dort separat über Nutzungsguthaben bezahlen müssen. In den Max-Tarifen ist Fable 5.1 zwar enthalten,
00:02:41allerdings haben Fable-Modelle dort ein niedrigeres Limit als die übrigen Modelle. Andererseits behandelt OpenAI
00:02:47Astra nicht als ein solches separates Modell, da Astra Teil der normalen Codex-Limits von ChatGPT+ und Pro
00:02:52ist und Sie Ihr gesamtes Nutzungsguthaben für Astra aufbrauchen können. Nun sind diese Modelle wirklich
00:02:57fähig, an langen Aufgaben zu arbeiten, was bedeutet, dass Sie sie einfach auffordern können, ein großes
00:03:02Feature zu bauen, und sie die Schritte allein abarbeiten lassen. Wenn Sie diese Modelle jedoch an einer
00:03:09langen Aufgabe arbeiten lassen, spielt auch die Größe des Kontexts eine Rolle, den sie vorhalten können.
00:03:14Fable bietet Ihnen eine Million Token in Claude Code, während Astras Standard-Kontextfenster in Codex selbst bei
00:03:21Astra nur 272.000 Token beträgt, obwohl es über seine API ein viel größeres Fenster besitzt, das Fables Million
00:03:26sogar noch übertrifft. Das bekommen Sie in Codex vorerst jedoch nicht, da Codex standardmäßig selbst für Astra
00:03:31nur ein Kontextfenster von 272.000 Token verwendet. Nun haben diese Modelle ein Niveau erreicht, auf dem
00:03:36sie fortgeschrittene Recherchen durchführen können, weshalb OpenAI und Anthropic Sicherheitsleitplanken
00:03:41hinzugefügt haben, die einige ihrer Arbeitsweisen einschränken. Diese Einschränkungen wirken sich jedoch auf
00:03:45unterschiedliche Weise auf Ihre Arbeit aus, da jedes Modell anders reagiert, wenn sein Sicherheitssystem
00:03:51einen Befehl als unzulässig eingestuft hat. Wenn Astra an einen Teil der Aufgabe gelangt, der gegen seine Regeln
00:03:56verstößt, lehnt es die Aufgabe glatt ab und teilt Ihnen das mit. Andererseits wechselt Claude Code von
00:04:01Fable zu einem schwächeren Modell, wenn eine Anfrage gegen die Regeln verstößt. Viele Nutzer haben festgestellt,
00:04:06dass Claude Code das Modell gewechselt hatte, ohne dass sie es wussten. Wenn Claude Code nach diesem Wechsel
00:04:11weiterarbeitet, stammt das Ergebnis möglicherweise nicht mehr von Fable. Die erste Metrik, die wir gemessen
00:04:16haben, war die Qualität, die bewertet, wie gut die Arbeit des Modells tatsächlich ist. Für diesen Test haben
00:04:22wir mehrere Kundenprojekte verwendet, sodass wir die Details dieser Projekte nicht preisgeben können, aber wir
00:04:27können erklären, wie wir die Arbeit beurteilt haben und worin sich die Modelle unterschieden. Hinsichtlich
00:04:32der Sauberkeit und Strukturierung des Codes erzielte Fable 90 Punkte verglichen mit 78 Punkten bei Astra, weil
00:04:39es den Code für verschiedene Teile der App übersichtlicher voneinander getrennt hielt. Das erleichtert dem
00:04:44Modell das Verständnis der App bei späteren Änderungen, und Fable lag diesbezüglich bei allen getesteten
00:04:50Projekten vor Astra. Was den Umfang der erledigten Aufgaben angeht, erreichte Fable 91 Punkte gegenüber 84
00:04:55bei Astra, weil es auch Probleme behob, um deren Behebung wir gar nicht ausdrücklich gebeten hatten. Wir
00:05:00haben jedoch auch geprüft, ob die fertigen Funktionen ohne Korrekturanfragen fehlerfrei funktionierten; hierbei
00:05:08erreichte Astra 87 Punkte im Vergleich zu 85 Punkten bei Fable. Ein Teil von Astras Vorsprung rührte daher,
00:05:13dass es die Apps gründlicher überprüfte und mehr der bekannten Mängel behob. Wenn Fable seine Apps testete,
00:05:19entgingen ihm einige Fehlerquellen, sodass die fertigen Features noch einige Macken aufwiesen. Bezüglich
00:05:25des Nutzungserlebnisses der App erzielte Astra 89 Punkte im Vergleich zu 88 Punkten bei Fable, da es die
00:05:30verschiedenen Bereiche der Seite an intuitiveren und leichter auffindbaren Plätzen anordnete. Basierend auf
00:05:35allen genannten Tests betrug Fables Gesamtqualitätsnote 88, während Astra 84 Punkte erreichte, da Fable
00:05:41vollständigere Funktionen baute und seine Arbeit leichter abzuändern war. In puncto Qualität ist Fable
00:05:46somit der klare Sieger. Doch bevor wir zum nächsten Test kommen, hören wir ein Wort von unserem Sponsor Zapier.
00:05:52und Ihnen programmatischen Zugriff auf Zapiers Ökosystem mit über 9000 Apps bietet.
00:05:58wie Gmail, Slack und Notion verbinden möchte, strickt man jede Integration und jeden OAuth-Ablauf von Hand.
00:06:04Bevor man sich versieht, versinkt man in Authentifizierungscode und plötzlich bestehen die Integrationen aus
00:06:10dem halben Projekt. Genau hier kommt das Zapier-SDK ins Spiel. Es ist eine Code-Bibliothek, die Sie direkt
00:06:15in Ihrem Projekt in Claude Code oder Cursor ablegen und die Ihnen programmatischen Zugriff auf das Ökosystem
00:06:20von über 9000 Apps von Zapier gibt. Anstatt also jede Integration manuell zu erstellen, haben wir einfach
00:06:26die benötigten aufgerufen und weitergemacht. Mit ein paar Zeilen Code verschickte unsere App E-Mails und
00:06:31erstellte Notion-Seiten – ganz ohne API-Dokumentation und ohne lästige Authentifizierungsprobleme. Wenn wir
00:06:36eine benutzerdefinierte Eigenschaft in Notion aktualisieren mussten, für die es keine vorgefertigte Aktion
00:06:42gab, sprachen wir sie direkt über das SDK an. Es holt Sie dort ab, wo Sie ohnehin arbeiten. Wenn Sie es
00:06:47satt haben, Integrationen von Hand zu basteln, probieren Sie das Zapier-SDK aus. Der Link steht unten in
00:06:53der Beschreibung. Die nächste gemessene Metrik war, wie gut die Modelle mit lang laufenden Aufgaben
00:06:58umgehen konnten – also wie viel Arbeit sie eigenständig und mit minimaler Anleitung durch uns während des
00:07:03Prozesses erledigten. Wir haben auch geprüft, wie sie mit Problemen umgingen, die unterwegs auftauchten.
00:07:09Dazu gaben wir jedem Modell eine App-Idee vor und formulierten die Anfrage gemäß dessen Prompting-Leitfaden,
00:07:13damit es die besten Chancen hatte, die Arbeit gut auszuführen. Wir nannten keine spezifischen Details,
00:07:18sondern beschrieben lediglich, was die App leisten musste. Astra arbeitete etwa 32 Minuten lang und Fable
00:07:24etwa 44 Minuten. Astra stieß beim Erstellen und Prüfen seiner App zwar auf Fehler, bewältigte diese jedoch
00:07:30und arbeitete eigenständig an der Fehlerbehebung weiter, ohne dass wir es durch jedes Problem leiten
00:07:35mussten. Auch Fable stellte seine App fertig, ohne vorzeitig abzubrechen oder uns zu fragen, was als Nächstes
00:07:40zu tun ist, und führte Prüfungen für das Erstellte aus. Beide haben die Aufgabe also zu Ende geführt,
00:07:45aber wir haben uns die fertigen Apps auch angesehen, um zu sehen, womit sie uns zurückgelassen hatten. Astras
00:07:51App öffnete sich direkt mit einer Anmeldeseite ohne separate Startseite. Sobald wir uns angemeldet hatten,
00:07:56war das Layout übersichtlich und die App funktionierte, wenngleich sie immer noch die vertrauten Layouts
00:08:01bei langwierigen Aufgaben erreichte Estra 93 von 100 Punkten, verglichen mit Fables 90.
00:08:08da es sich nicht weit genug scrollen ließ, um den Abmelden-Button zu erreichen. Wir mussten herauszoomen,
00:08:13um diesen Button zu erreichen – etwas, das Astras eigene Prüfungen nicht entdeckt hatten. Fables App öffnete
00:08:18sich ebenfalls direkt mit einer Anmeldeseite, aber ihr Design wirkte weitaus generischer. Die Funktionen
00:08:23funkionierten, aber alles war so eng beieinander gepackt, dass die App schwer zu bedienen war und die
00:08:28wiederholten Farbverläufe diesen vertrauten KI-Look verstärkten. Sie passte sich zwar an kleinere Bildschirme
00:08:33an, verfügte aber dennoch über kein brauchbares Layout, auch wenn die Funktionen tiefgreifend waren. Wir
00:08:38hatten auch mehrere andere Apps und riesige Features auf diese Weise geplant und gebaut, wobei die Modelle
00:08:44sich selbst überlassen blieben. Für lang laufende Arbeiten erzielte Astra somit 93 von 100 Punkten im
00:08:50Vergleich zu Fables 90. Fable konzentrierte sich stärker darauf, die Funktionen zum Laufen zu bringen, es
00:08:55sei denn, wir hatten im Prompt angegeben, dass es auch den Schwerpunkt auf die Optik legen sollte. Astra
00:09:00Astras Version bot ein übersichtlicheres Layout mit klareren Unterschieden bei Schriftgröße und
00:09:05Farben, wodurch der Text leichter zu lesen war. Aber es gab viel weniger Bewegung; es fühlte sich zwar
00:09:10angenehmer fürs Auge an, bot aber nicht dasselbe Erlebnis wie Fables Design. Deswegen
00:09:14erzielte Fable bei der Interaktivität 94 Punkte, während Astra auf 85 kam. Als Nächstes ließen wir
00:09:20von jedem Modell eine Landingpage für ein Horrorspiel entwerfen. Fables Design nutzte einen
00:09:25animierten Leuchtturm für die Atmosphäre. Die Grafiken wurden als SVGs erstellt – also Bilder, die
00:09:31durch Code gezeichnet werden –, aber der Text hob sich aufgrund von Fables Größen- und Farbwahl
00:09:36nicht genug vom dunklen Hintergrund ab. Bei derselben Designaufgabe nutzte Astra das in Codex
00:09:42integrierte Bildgenerierungsmodell, um ein Bild zu erstellen, anstatt die Grafik per Code zu erzeugen.
00:09:47Außerdem erstellte es einen Teaser für das Spiel, obwohl wir gar nicht darum gebeten hatten. Und Astra
00:09:52lag bei der Wahl von Schriften und Farben vorn, wodurch sich der Text gut vom dunklen Hintergrund abhob.
00:09:57Für die Musikfestival-Website wiederholte Fables Version viele der Gestaltungsmerkmale, die wir von
00:10:03Opus kennen. Doch trotz dieser vertrauten Entscheidungen wirkte es, als habe Fable mehr Mühe
00:10:08hineingesteckt, der Seite einen eigenen Stil zu geben. Astra nutzte ein generiertes Konzertfoto,
00:10:13aber das Gesamtdesign wirkte generischer. Der letzte Vergleich war ein Einparkspiel, bei dem Fables
00:10:18Version wirklich gut gemacht war und der Rückspiegel uns half, die Position des Autos genauer
00:10:23einzuschätzen. Das Spiel hatte zwei Kameraansichten, aber beide hatten Probleme: Die eine zeigte
00:10:27die falsche Seite der Parklücke, während die andere nur eine Seite zeigte, statt uns einen
00:10:32vollständigen Blick auf die Straße zu geben. Das erschwerte es zu sehen, wohin das Auto bewegt wurde.
00:10:38Wären diese Kamerapositionen richtig gewesen, hätte sich das Spiel realistischer angefühlt. Astra bot
00:10:42drei feste Ansichten und fügte im Seitenpanel Fahrhinweise hinzu, was das Spiel benutzerfreundlicher
00:10:48machte. Die Kameraansichten waren deutlich besser als bei Fable. Dies waren allgemeine Tests, bei denen
00:10:53wir den Modellen nur sehr wenige Details vorgaben, sodass wir hier den eigenen Geschmack der
00:10:58Modelle sahen. Beide wiederholten Designentscheidungen aus ihren früheren Arbeiten, lieferten aber
00:11:04gute Ergebnisse. Mit etwas mehr Details zum gewünschten Look and Feel würden voraussichtlich beide
00:11:09gut designen. Nach reinem Geschmack gewann Astra also bei Optik und Usability, während Fable bei
00:11:15Animationen und Interaktivität vorne lag. Bevor wir zu Kosten und Geschwindigkeit kommen, würden wir
00:11:20uns freuen, wenn Sie den Kanal abonnieren und den Daumen-nach-oben-Button drücken. Diese kleine
00:11:25Unterstützung hilft uns enorm. Die nächste Metrik war die Effizienz, die die Arbeitskosten,
00:11:31die benötigte Zeit und die Häufigkeit der Werkzeugnutzung umfasste. Zu den Kosten ist zu sagen,
00:11:37dass wir nicht die API nutzten; es handelt sich also um Schätzungen basierend auf den verbrauchten Token.
00:11:47Wir führten die Tests in unserem gewohnten Abo aus. Über alle Testläufe hinweg beliefen sich Fables
00:11:52geschätzte Gesamtkosten auf 49,18 Dollar, verglichen mit 27,69 Dollar bei Astra, womit Astras
00:11:57Gesamtsumme etwa 44 Prozent niedriger lag. Fable generierte fast dreimal so viele Output-Token wie
00:12:03Astra, ganz im Sinne von Fables Prompt-Anleitung, die besagt, dass es dazu neigt, mehr zu schreiben als
00:12:09sechs Durchläufe verwendete der Hauptagent von Fable seine Tools 443-mal im Vergleich zu 287-mal bei Astra, was ebenfalls die
00:12:17Kosten erhöhte. Auch die Werkzeugnutzung treibt den Token-Verbrauch nach oben, da das Modell
00:12:23entscheidet, welches Tool es einsetzt, und dann die Ergebnisse liest, bevor es weiterarbeitet.
00:12:30Über alle sechs Läufe hinweg nutzte Fables Hauptagent seine Tools 443-mal im Vergleich zu Astras
00:12:35287-mal, was ebenfalls zu den Kosten beitrug. Bei den Kosten erzielte Astra 80 von 100 Punkten
00:12:40gegenüber Fables 66. Bei der Geschwindigkeit lag Astra mit 70 Punkten ebenfalls vor Fable mit 67.
00:12:44Die lang laufenden Aufgaben nahmen für Astra insgesamt rund 62 Minuten in Anspruch, verglichen mit
00:12:4973 Minuten bei Fable. Über die Wertungen für Kosten, Geschwindigkeit und Werkzeugeffizienz hinweg
00:12:53schnitt Astra also besser ab als Fable. Die nächste gemessene Metrik war das Befolgen von
00:12:58Anweisungen; wir prüften, wie gut die Modelle den Vorgaben beim Erstellen folgten und ob sie diese
00:13:04auch im weiteren Verlauf einhielten. Als wir Fable an einem Projekt arbeiten ließen, fügte es
00:13:09erreichte Astra 96 von 100 Punkten im Vergleich zu Fables 88. Was also die Befolgung der Anweisungen betrifft,
00:13:16obwohl unsere Anweisungen dies ausdrücklich untersagt hatten. Es ignorierte zudem eine Regel
00:13:21bezüglich des Erstellens oder Änderns von Dateien. Wir hatten ihm aufgetragen, Claudes eigene
00:13:27Dateibearbeitungstools zu verwenden, damit diese Änderungen protokolliert und leicht rückgängig zu
00:13:33machen sind, aber es erstellte stattdessen zwei Dateien durch Ausführen von Befehlen. Beim
00:13:37Befolgen von Anweisungen erzielte Astra 96 von 100 Punkten im Vergleich zu Fables 88. In dieser
00:13:42Hinsicht lag Astra in diesen Durchläufen also vorn. Als Nächstes maßen wir die Review-Qualität,
00:13:47indem wir den Modellen ein fehlerhaftes Projekt gaben und sie baten, diese Fehler zu finden.
00:13:52Zunächst gaben wir beiden denselben Code zum Überprüfen, in den absichtlich vier Fehler eingebaut
00:13:57waren, sodass wir wussten, was sie finden mussten. Fable fand alle vier und zudem fünf weitere
00:14:03Probleme, die wir nicht hinzugefügt hatten und die anschließend überprüft und bestätigt wurden.
00:14:08Astra fand zwei der vier von uns eingebauten Fehler, erklärte das Review jedoch trotzdem für
00:14:13abgeschlossen. Wir hatten auch drei verdächtig aussehende Stellen eingebaut, die eigentlich korrekt
00:14:19waren, um zu sehen, ob das Modell falsche Fehler melden würde. Keines der beiden stufte diese als
00:14:25Bugs ein, sodass der Unterschied hier in der Quantität der Funde lag und Fable das gründlichere
00:14:30Review lieferte. Als wir sie jedoch an einem größeren Projekt mit neun bestätigten Problemen
00:14:35testeten, behob Astra fünf, während Fable nur vier fand und reparierte. Astra erledigte also mehr
00:14:40der Korrekturen, obwohl beide einige Probleme ungelöst ließen. Für die Review-Qualität, die diese
00:14:45Korrekturen und die Überprüfung der sonstigen Arbeit einschloss, erhielt Fable 84 Punkte gegenüber
00:14:51Astras 78. Fable hatte beim Gesamt-Review also die Nase vorn, weil es insgesamt die stärkere
00:14:56Überprüfung lieferte. Basierend auf diesen Ergebnissen ist Astra in mehreren der getesteten
00:15:01Kategorien der klare Sieger, aber das bedeutet nicht, dass Fable ein schlechtes Modell ist,
00:15:05denn es lieferte bei den Aufgaben eine gute Leistung und lag bei mehreren nicht weit hinter Astra.

핵심 요약

GPT-6 Astra und Fable 5.1 liefern sich ein enges Rennen im Software-Engineering, wobei Fable 5.1 bei Code-Struktur und Qualität mit 86 zu 84 Punkten knapp gewinnt, während Astra bei Effizienz und Kosten deutlich vorne liegt.

하이라이트

  • GPT-6 Astra und Fable 5.1 wurden im September im Abstand von wenigen Tagen veröffentlicht und erzielten in Benchmarks extrem hohe Punktzahlen, wobei Astra beim AGI-Test fast 100 Prozent erreichte.

  • Fable 5.1 kostete in den Tests mit insgesamt 49,18 Dollar rund 44 Prozent mehr als GPT-6 Astra mit 27,69 Dollar, da Fable fast dreimal so viele Output-Token erzeugte.

  • In der Gesamtbewertung erreichte Fable 5.1 eine Punktzahl von 86 von 100 Punkten, während GPT-6 Astra knapp dahinter mit 84 Punkten abschnitt.

  • Fable erzielte beim Code-Umfang und der Sauberkeit mit 90 Punkten einen besseren Wert als Astra mit 78 Punkten, da es den Code übersichtlicher trennte.

  • GPT-6 Astra schnitt bei lang laufenden Aufgaben und der Ausführungsgeschwindigkeit mit 93 von 100 Punkten besser ab als Fable mit 90 Punkten.

  • Fable 5.1 fand bei der Code-Überprüfung alle vier absichtlich platzierten Fehler sowie fünf weitere Probleme, während Astra von den vier eingebauten Fehlern nur zwei entdeckte.

타임라인

Vergleichsrahmen und Vorstellungen der Modelle

  • Fable 5.1 und GPT-6 Astra wurden im September mit herausragenden Benchmark-Ergebnissen veröffentlicht.
  • Beide Modelle kosten identische 10 Dollar pro Million Input-Token und 50 Dollar pro Million Output-Token.
  • Anthropic senkte den Preis für zwischengespeicherte Lesevorgänge bei Fable 5.1 um 75 Prozent.

Die Modelle wurden anhand realer Softwareprojekte getestet, um festzustellen, wie sie im echten Arbeitsalltag abschneiden. Als Schiedsrichter diente GPT-5.6 als Blindtester. Während Fable 5.1 eine Million Token in Claude Code bereitstellt, verfügt Astra in Codex über ein Standard-Kontextfenster von 272.000 Token. Bei Sicherheitsverstößen reagieren die Modelle unterschiedlich: Astra lehnt unzulässige Aufgaben direkt ab, während Claude Code unbemerkt auf ein schwächeres Modell wechselt.

Qualitätsmetriken und Funktionsumfang

  • Fable 5.1 erreichte bei der Code-Sauberkeit 90 Punkte im Vergleich zu Astras 78 Punkten.
  • Fable erzielte beim Aufgabenumfang 91 Punkte, weil es zusätzliche Probleme ohne explizite Aufforderung behob.
  • Fables Gesamtnote in der Kategorie Qualität lag bei 88 Punkten gegenüber 84 Punkten bei Astra.

Die Code-Struktur von Fable hielt Teile der Anwendung sauberer getrennt, was spätere Änderungen erleichtert. Astra holte bei der fehlerfreien Ausführung direkt nach dem Erstellen mit 87 zu 85 Punkten einen leichten Vorsprung, da es Apps gründlicher überprüfte. Trotz Astras Vorzügen bei der Benutzeroberfläche sichert sich Fable den klaren Gesamtsieg in der Kategorie Qualität durch vollständigere Funktionen und leichter anpassbare Ergebnisse.

Lang laufende Aufgaben und Interaktivität

  • Astra arbeitete bei eigenständigen App-Entwicklungen rund 32 Minuten, während Fable 44 Minuten benötigte.
  • Für lang laufende Aufgaben erhielt Astra 93 von 100 Punkten, verglichen mit 90 Punkten für Fable.
  • Fable erzielte bei der Interaktivität und Animationen 94 Punkte, während Astra mit 85 Punkten abschnitt.

Beide Modelle bearbeiteten eigenständig komplexe App-Ideen ohne vorzeitigen Abbruch. Astra erzeugte übersichtlichere Layouts mit klaren Kontrasten bei Schriftgrößen und Farben. Bei Designaufgaben wie einer Horrorspiel-Landingpage nutzte Astra das integrierte Bildgenerierungsmodell, während Fable Grafiken per Code als SVGs erstellte. Nach individuellem Geschmack siegte Astra bei Optik und Usability, während Fable bei Animationen und interaktiven Elementen vorne lag.

Kosten, Geschwindigkeit und Anweisungsbefolgung

  • Fables geschätzte Gesamtkosten beliefen sich auf 49,18 Dollar, während Astra mit 27,69 Dollar rund 44 Prozent günstiger war.
  • Fables Hauptagent nutzte seine Tools in den Tests 443-mal im Vergleich zu 287-mal bei Astra.
  • Astra erzielte bei der Befolgung von Anweisungen 96 Punkte gegenüber 88 Punkten bei Fable.

Fable generierte fast dreimal so viele Output-Token wie Astra, was primär auf die interne Prompt-Anleitung zurückzuführen ist, ausführlicher zu schreiben. Bei der Geschwindigkeit benötigte Astra 62 Minuten für die Testläufe, während Fable 73 Minuten in Anspruch nahm. Bezüglich der Befolgung von Anweisungen missachtete Fable in einem Test eine ausdrückliche Vorgabe und erstellte Dateien über Befehle statt über die geforderten Dateibearbeitungstools. Bei der Review-Qualität fand Fable alle vier eingebauten Fehler plus fünf zusätzliche Probleme, wodurch es trotz Astras Vorteilen in anderen Disziplinen das gründlichere Review lieferte.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기