GPT-6 Astra ist da (Und sie ist besser als Fable 5.1?)

CChase AI
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Direkt nachdem Anthropic Fable 5.1 veröffentlicht hat, schlägt OpenAI zurück und veröffentlicht GPT-6 Astra.
00:00:07Schauen wir uns zu Beginn einige der Benchmarks für GPT-6 Astra an. Und vielen Dank an
00:00:10OpenAI, dass sie uns viel mehr Benchmarks zur Verfügung gestellt haben als Anthropic bei Fable
00:00:145.1. Was die Computernutzung angeht, räumt das Modell praktisch alles ab. Wir haben nicht einmal viele Daten
00:00:19dazu im Hinblick auf Fable 5.1. Wenn wir uns die professionellen Benchmarks ansehen, Dinge wie BenchCAD
00:00:24und BrowseComp, schlägt sich GPT-6 ebenfalls hervorragend. Der einzige Bereich, in dem es nicht gewinnt, ist der
00:00:31Artificial Analysis Intelligence Index, wo es 61,2 erreicht, verglichen mit 65,7 bei Fable 5.1.
00:00:38Als Nächstes haben wir das Programmieren. Und auch hier bietet sich ein ähnliches Bild. Entweder schlägt es Fable 5.1 oder es liegt
00:00:43Kopf an Kopf. Wenn wir uns speziell TerminalBench 4.0 ansehen, sehen wir einen enormen Sprung von GPT 5.6 Solo
00:00:49von 37,3 auf 57,7. Und wenn wir uns DeepSuite ansehen, was wahrscheinlich mein Lieblingstool für
00:00:55Code-Benchmarks ist, liegt der Fokus stark auf lang laufenden Agentenaufgaben. Es erreicht 74,1 %, was wiederum
00:01:02besser ist als alles andere auf dem Markt. GPT-6 dominiert zudem die akademischen Benchmarks sowie die
00:01:08Bereiche Wissenschaft und Gesundheit. Und wenn wir uns Cybersicherheits-Benchmarks ansehen – ich achte hierbei
00:01:13wieder vor allem auf 5.6 Solo –, gibt es gewaltige Sprünge: von 78,5 auf 100 %, von 55,9 auf bis zu 88,
00:01:225 % bei ExploitBench und sogar bis zu 39 %. Dies stellt also einen echten Technologiesprung gegenüber den Modellen der 5er-Reihe dar. Und hinsichtlich
00:01:27des langen Kontextfensters glänzt GPT-6 ebenfalls. 100 % im Acht-Nadel-Test bei 256k bis 512k
00:01:34Token. Das entspricht im Wesentlichen einem Viertel bis hin zu einem vollständig ausgelasteten Kontextfenster. Und wenn dieses Fenster von 512.000
00:01:41auf eine Million Token erweitert wird, erzielt es immer noch 96,3 %. Wenn Sie also jemand sind, der Ihrem
00:01:46KI-Modell Ihrer Wahl ständig Unmengen an Kontext füttert, wird GPT-6 in diesen Szenarien extrem gut abschneiden. Aber die reinen
00:01:51Benchmark-Ergebnisse reichen nicht aus. Wir müssen wissen, wie viel es kostet, diese Ergebnisse tatsächlich zu erzielen,
00:01:55denn Astra hat vielleicht den besten Score der Welt, aber wenn es zehnmal so viel kostet wie alles andere, was hat das
00:01:59für einen Sinn? Nun, zum Glück waren GPT-Modelle historisch gesehen sehr token-effizient. Wenn wir uns also
00:02:04hier den TerminalBench 4.0 Score ansehen, sehen wir, dass sich das bewahrheitet. GPT-6 Astra ist hier mit den Sternen markiert,
00:02:11und das Erste, was mir auffällt, ist, dass wir wie bei vielen dieser Modelle einen gewissen Effizienzverlust
00:02:16beobachten, wenn wir in der Aufwandsebene nach oben gehen. Wenn ich also von niedrig zu mittel und zu hoch wechsle, erhalte ich
00:02:23weiterhin bessere Ergebnisse bei einem einigermaßen linearen Kostenanstieg. Wenn ich jedoch von hoch zu extra hoch und schließlich zu max übergehe,
00:02:30erziele ich tatsächlich einen schlechteren Score bei höheren Kosten. Bei „hoch“ erhalte ich für 7,21 $ also eine
00:02:39Genauigkeit von 57,9 %. Wenn ich das direkt mit Fable 5.1 vergleiche und mich im Modus „hoch“ befinde, erziele ich eine Genauigkeit von 49,4 %
00:02:49bei 10,50 $. Es ist also teurer und schneidet schlechter ab. Nun erzielt Fable zwar einen recht hohen Score,
00:02:57wenn ich es auf den maximalen Aufwand von 55,8 stelle, aber das kostet mich 19,50 $. Für denselben Score
00:03:06von rund 55 % zahlt man bei Fable 5 also fast 20 $und bei GPT-6 Astra 7,20$. Es ist also unendlich viel günstiger
00:03:16bei im Wesentlichen derselben Genauigkeit. Und wenn wir uns Frontier Code 1.1 ansehen, zeigt sich ein ähnliches Muster,
00:03:22bei dem wir im oberen Bereich ähnliche Scores erzielen. Betrachten wir GPT-6 im Vergleich zu Fable 5.1
00:03:29oder Fable 5, hat Fable 5 in diesem Fall tatsächlich höher abgeschnitten. Aber es ist einfach viel teurer,
00:03:34diese Cloud-Modelle zu betreiben, wegen der Token-Effizienz von GPT-6 Astra. Nun gibt es einige Funktionen
00:03:39jenseits der Benchmarks, die OpenAI im Zusammenhang mit GPT-6 hervorhebt. Erstens bezeichnen sie es als
00:03:43das weltweit beste Computernutzungsmodell. Es gibt nun einige Benchmarks, die diese Art von
00:03:48Funktion testen, wie zum Beispiel die Agent's Last Exam. Und was zeigen sie uns, wie schon bei anderen Benchmarks?
00:03:52Sie zeigen, dass Astra sowohl bei der Genauigkeit als auch bei den API-Kosten, die man niemals
00:03:57außer Acht lassen darf, absolut glänzt. Aber fast noch wichtiger als die Genauigkeit ist die Geschwindigkeit. Codex bietet tatsächlich
00:04:01eine wirklich gute Computernutzung, besonders in Verbindung mit dem Sprachmodus. Und Astra soll
00:04:061,9-mal schneller sein als GPT-5.6, was großartig ist, wenn Sie das im vergangenen Monat ohnehin schon
00:04:11sehr intensiv genutzt haben. Ein weiterer genannter Punkt ist die Einhaltung von Vorlagen. Wenn man ihm also
00:04:15eine Vorlage für beispielsweise eine Präsentation gibt, wie man sie hier auf der linken Seite sieht, und es bittet,
00:04:20eine weitere Präsentation im selben Stil zu einem anderen Thema zu erstellen, erhält man
00:04:25etwas wie das auf der rechten Seite, ein Ergebnis, das den Stil sehr, sehr gut einhält. Wenn Sie also über
00:04:31irgendeine Vorlage verfügen, die Sie immer wieder verwenden – sei es für Präsentationen oder Webseiten –, und dies als
00:04:35Design-System für praktisch jede Art von Ausgabe betrachten, eignet sich GPT-6 dafür hervorragend. Das sehen Sie hier noch einmal
00:04:41anhand von Excel-Dokumenten und dem Dokumentdesign im Allgemeinen. Hier ist im Grunde das Referenzbild, das vorgegeben wurde.
00:04:46Das bekamen wir früher, und das ist das Ergebnis rechts, nachdem es dieses Referenzbild analysiert hat.
00:04:51Ein weiterer interessanter Punkt ist dieser Satz, in dem sie erwähnen, dass GPT-6 Astra
00:04:55stärkeres visuelles Urteilsvermögen für Websites, Spiele, Anwendungen und deren Rendering verleiht – sprich, sie
00:05:00behaupten, dass GPT-6 einen besseren Geschmack hat. Sie haben wahrscheinlich schon oft gehört, dass KI keinen Geschmack besitzt.
00:05:05Nun ja, sie sagen, GPT-6 schon. Seien wir ehrlich, es wird immer Probleme geben, wenn
00:05:10Geschmack immer Probleme geben, denn wenn man ihr einen schlechten Prompt gibt, kommt es unweigerlich zu einer Art
00:05:15Regression zum Mittelwert. Und wie dieser Mittelwert auch aussehen mag, die Leute werden ihn immer mit KI-
00:05:20Einheitsbrei assoziieren, ganz gleich, wie gut er tatsächlich ist. Sie zeigen hier jedoch einige Beispiele von
00:05:25einem Unreal-Engine-Rundgang, den sie erstellt haben, Blender-Modellierungen sowie einigen Standbildern. Eine wirklich coole Funktion,
00:05:31die sie mit Astra hinzufügen, sind Änderungen an der automatischen Datenkomprimierung, wenn sich das Kontextfenster füllt.
00:05:37Normalerweise wird das Kontextfenster voll, es komprimiert sich automatisch, erstellt eine Art Zusammenfassung
00:05:41von allem, worüber Sie in der letzten Sitzung gesprochen haben, und startet dann eine neue Sitzung.
00:05:46Das führt jedoch zu Problemen, da manchmal Details weggelassen werden. Astra behält nun aber Notizen über Kontext-
00:05:52fenster hinweg bei, anstatt nur eine einzige Zusammenfassung zu erstellen. Statt eines einzigen Dokuments führt es im Grunde eine Reihe
00:05:57verschiedener Haftnotizen darüber, was es für wichtig hält. Und darauf kann es jederzeit zurückgreifen,
00:06:01anstatt sich nur auf diesen einmaligen Schuss nach dem Motto „Hier ist eine Zusammenfassung, hoffentlich deckt das alles ab“ zu verlassen.
00:06:06Tatsächlich bleiben frühere Kontextfenster durchsuchbar. Es ist also nicht so, dass dies
00:06:12das einzige Dokument ist, das wir als Zusammenfassung haben, und wenn es nicht darin steht, sind wir aufgeschmissen. Das ist einfach nicht mehr
00:06:16der Fall. Dies ist allerdings ein experimentelles Feature. Sie müssen es also in der Codex-
00:06:20Konfiguration aktivieren, aber es wird in wenigen Wochen zum Standard werden. Was die Cybersicherheit betrifft,
00:06:24behandelt Astra dies ähnlich wie Anthropic Fable, indem sie sagen: Dieses Modell ist so
00:06:28mächtig, dass es eine Reihe von Exploits erstellen kann. Wenn es also den Eindruck hat, dass Sie versuchen,
00:06:33irgendeinen Exploit zu erstellen, wird es das schlichtweg nicht zulassen. Es wird dem nicht nachkommen und Ihr
00:06:37Problem nicht beantworten. Eine weitere großartige Verbesserung von GPT-6 im Vergleich zur 5er-Reihe ist eine geringere Halluzinationsrate.
00:06:42GPT-5.6 Sol und die 5.6-Modelle im Allgemeinen neigten im Vergleich zu anderen Frontier-Modellen
00:06:48tatsächlich zu recht vielen Halluzinationen. Im direkten Vergleich sehen wir jedoch, dass wir von einer
00:06:54Halluzinationsrate von rund 9,4 % auf sage und schreibe 2 % heruntergegangen sind. Ist Astra nun verfügbar?
00:07:01Nun, es ist für eine begrenzte Anzahl von Organisationen geöffnet. Und in den nächsten Tagen wird es im Grunde für
00:07:06jeden freigegeben. Was die API betrifft, so ist sie für Entwickler verfügbar. Und bezüglich des Preises gilt wiederum:
00:07:11Er entspricht der Preisgestaltung von Fable. Wir sprechen hier von 10 $pro Million Input-Token und 50$ pro Million Output-Token.
00:07:17Basierend auf den Zahlen liefert OpenAI uns also ein sehr solides Modell, das absolut mit dem Besten
00:07:22konkurrieren kann, was Anthropic zu bieten hat. Und das zu einem günstigeren Preis. Ich freue mich
00:07:26also riesig darauf, das auszuprobieren. Ich denke, der Wettbewerb unter den größten Akteuren hier
00:07:30ist letztendlich großartig für uns, die Endnutzer.

핵심 요약

GPT-6 Astra übertrifft frühere Modelle in Benchmarks und Computernutzung deutlich bei geringeren Kosten und einer Halluzinationsrate von nur 2 Prozent.

하이라이트

  • OpenAI veröffentlicht GPT-6 Astra als direkte Antwort auf Anthropic Fable 5.1.

  • TerminalBench 4.0 verzeichnet einen Punktesprung von 37,3 auf 57,7 im Vergleich zum Vorgängermodell.

  • DeepSuite erreicht bei lang laufenden Agentenaufgaben einen Wert von 74,1 Prozent.

  • Die Halluzinationsrate sinkt von 9,4 Prozent bei der 5er-Reihe auf 2 Prozent bei GPT-6.

  • Der Betrieb kostet bei ähnlicher Genauigkeit rund 7,20 Dollar im Vergleich zu 19,50 Dollar bei Konkurrenzmodellen.

타임라인

Benchmark-Ergebnisse und Leistungsvergleich

  • GPT-6 Astra dominiert fast alle Computernutzungs- und Programmier-Benchmarks.
  • TerminalBench 4.0 steigt von 37,3 auf 57,7.
  • DeepSuite erreicht 74,1 Prozent bei Agentenaufgaben.
  • Cybersicherheits-Benchmarks zeigen Sprünge bis zu 100 Prozent.

Das Modell schlägt Fable 5.1 in zahlreichen Disziplinen oder liegt gleichauf. Besonders im Bereich der Programmier- und Sicherheitsaufgaben zeigt sich ein technologischer Sprung gegenüber der 5er-Reihe. Auch das lange Kontextfenster erzielt im Acht-Nadel-Test starke Ergebnisse.

Kosten und Effizienz der Modelle

  • Höhere Aufwandsebenen steigern die Kosten linear, bringen jedoch in Extremstufen geringere Scores.
  • GPT-6 Astra erzielt 57,9 Prozent Genauigkeit für 7,21 Dollar.
  • Konkurrenzmodelle verlangen knapp 20 Dollar für vergleichbare Ergebnisse.
  • Die Token-Effizienz hält die Betriebskosten der Cloud-Modelle niedrig.

Die Kostenanalyse zeigt, dass maximale Aufwandsebenen zu schlechteren Ergebnissen bei höheren Preisen führen. GPT-6 Astra erweist sich als deutlich günstiger als Fable bei identischer oder besserer Genauigkeit.

Funktionen, Design und Kontextkomprimierung

  • Astra arbeitet 1,9-mal schneller als GPT-5.6.
  • Das Modell hält Design-Vorlagen und Stile für Präsentationen und Webseiten präzise ein.
  • Ein neues experimentelles Feature speichert Notizen über das gesamte Kontextfenster hinweg.
  • Die Halluzinationsrate sinkt von 9,4 auf 2 Prozent.

Neben reinen Benchmarks bietet Astra Verbesserungen beim visuellen Urteilsvermögen und der automatischen Datenkomprimierung. Statt einer einzigen Zusammenfassung führt das System durchsuchbare Notizen. Die API ist ab sofort für Entwickler verfügbar.

커뮤니티 글

모든 글 보기