스크립트
00:00:00Direkt nachdem Anthropic Fable 5.1 veröffentlicht hat, schlägt OpenAI zurück und veröffentlicht GPT-6 Astra.
00:00:07Schauen wir uns zu Beginn einige der Benchmarks für GPT-6 Astra an. Und vielen Dank an
00:00:10OpenAI, dass sie uns viel mehr Benchmarks zur Verfügung gestellt haben als Anthropic bei Fable
00:00:145.1. Was die Computernutzung angeht, räumt das Modell praktisch alles ab. Wir haben nicht einmal viele Daten
00:00:19dazu im Hinblick auf Fable 5.1. Wenn wir uns die professionellen Benchmarks ansehen, Dinge wie BenchCAD
00:00:24und BrowseComp, schlägt sich GPT-6 ebenfalls hervorragend. Der einzige Bereich, in dem es nicht gewinnt, ist der
00:00:31Artificial Analysis Intelligence Index, wo es 61,2 erreicht, verglichen mit 65,7 bei Fable 5.1.
00:00:38Als Nächstes haben wir das Programmieren. Und auch hier bietet sich ein ähnliches Bild. Entweder schlägt es Fable 5.1 oder es liegt
00:00:43Kopf an Kopf. Wenn wir uns speziell TerminalBench 4.0 ansehen, sehen wir einen enormen Sprung von GPT 5.6 Solo
00:00:49von 37,3 auf 57,7. Und wenn wir uns DeepSuite ansehen, was wahrscheinlich mein Lieblingstool für
00:00:55Code-Benchmarks ist, liegt der Fokus stark auf lang laufenden Agentenaufgaben. Es erreicht 74,1 %, was wiederum
00:01:02besser ist als alles andere auf dem Markt. GPT-6 dominiert zudem die akademischen Benchmarks sowie die
00:01:08Bereiche Wissenschaft und Gesundheit. Und wenn wir uns Cybersicherheits-Benchmarks ansehen – ich achte hierbei
00:01:13wieder vor allem auf 5.6 Solo –, gibt es gewaltige Sprünge: von 78,5 auf 100 %, von 55,9 auf bis zu 88,
00:01:225 % bei ExploitBench und sogar bis zu 39 %. Dies stellt also einen echten Technologiesprung gegenüber den Modellen der 5er-Reihe dar. Und hinsichtlich
00:01:27des langen Kontextfensters glänzt GPT-6 ebenfalls. 100 % im Acht-Nadel-Test bei 256k bis 512k
00:01:34Token. Das entspricht im Wesentlichen einem Viertel bis hin zu einem vollständig ausgelasteten Kontextfenster. Und wenn dieses Fenster von 512.000
00:01:41auf eine Million Token erweitert wird, erzielt es immer noch 96,3 %. Wenn Sie also jemand sind, der Ihrem
00:01:46KI-Modell Ihrer Wahl ständig Unmengen an Kontext füttert, wird GPT-6 in diesen Szenarien extrem gut abschneiden. Aber die reinen
00:01:51Benchmark-Ergebnisse reichen nicht aus. Wir müssen wissen, wie viel es kostet, diese Ergebnisse tatsächlich zu erzielen,
00:01:55denn Astra hat vielleicht den besten Score der Welt, aber wenn es zehnmal so viel kostet wie alles andere, was hat das
00:01:59für einen Sinn? Nun, zum Glück waren GPT-Modelle historisch gesehen sehr token-effizient. Wenn wir uns also
00:02:04hier den TerminalBench 4.0 Score ansehen, sehen wir, dass sich das bewahrheitet. GPT-6 Astra ist hier mit den Sternen markiert,
00:02:11und das Erste, was mir auffällt, ist, dass wir wie bei vielen dieser Modelle einen gewissen Effizienzverlust
00:02:16beobachten, wenn wir in der Aufwandsebene nach oben gehen. Wenn ich also von niedrig zu mittel und zu hoch wechsle, erhalte ich
00:02:23weiterhin bessere Ergebnisse bei einem einigermaßen linearen Kostenanstieg. Wenn ich jedoch von hoch zu extra hoch und schließlich zu max übergehe,
00:02:30erziele ich tatsächlich einen schlechteren Score bei höheren Kosten. Bei „hoch“ erhalte ich für 7,21 $ also eine
00:02:39Genauigkeit von 57,9 %. Wenn ich das direkt mit Fable 5.1 vergleiche und mich im Modus „hoch“ befinde, erziele ich eine Genauigkeit von 49,4 %
00:02:49bei 10,50 $. Es ist also teurer und schneidet schlechter ab. Nun erzielt Fable zwar einen recht hohen Score,
00:02:57wenn ich es auf den maximalen Aufwand von 55,8 stelle, aber das kostet mich 19,50 $. Für denselben Score
00:03:06von rund 55 % zahlt man bei Fable 5 also fast 20 $und bei GPT-6 Astra 7,20$. Es ist also unendlich viel günstiger
00:03:16bei im Wesentlichen derselben Genauigkeit. Und wenn wir uns Frontier Code 1.1 ansehen, zeigt sich ein ähnliches Muster,
00:03:22bei dem wir im oberen Bereich ähnliche Scores erzielen. Betrachten wir GPT-6 im Vergleich zu Fable 5.1
00:03:29oder Fable 5, hat Fable 5 in diesem Fall tatsächlich höher abgeschnitten. Aber es ist einfach viel teurer,
00:03:34diese Cloud-Modelle zu betreiben, wegen der Token-Effizienz von GPT-6 Astra. Nun gibt es einige Funktionen
00:03:39jenseits der Benchmarks, die OpenAI im Zusammenhang mit GPT-6 hervorhebt. Erstens bezeichnen sie es als
00:03:43das weltweit beste Computernutzungsmodell. Es gibt nun einige Benchmarks, die diese Art von
00:03:48Funktion testen, wie zum Beispiel die Agent's Last Exam. Und was zeigen sie uns, wie schon bei anderen Benchmarks?
00:03:52Sie zeigen, dass Astra sowohl bei der Genauigkeit als auch bei den API-Kosten, die man niemals
00:03:57außer Acht lassen darf, absolut glänzt. Aber fast noch wichtiger als die Genauigkeit ist die Geschwindigkeit. Codex bietet tatsächlich
00:04:01eine wirklich gute Computernutzung, besonders in Verbindung mit dem Sprachmodus. Und Astra soll
00:04:061,9-mal schneller sein als GPT-5.6, was großartig ist, wenn Sie das im vergangenen Monat ohnehin schon
00:04:11sehr intensiv genutzt haben. Ein weiterer genannter Punkt ist die Einhaltung von Vorlagen. Wenn man ihm also
00:04:15eine Vorlage für beispielsweise eine Präsentation gibt, wie man sie hier auf der linken Seite sieht, und es bittet,
00:04:20eine weitere Präsentation im selben Stil zu einem anderen Thema zu erstellen, erhält man
00:04:25etwas wie das auf der rechten Seite, ein Ergebnis, das den Stil sehr, sehr gut einhält. Wenn Sie also über
00:04:31irgendeine Vorlage verfügen, die Sie immer wieder verwenden – sei es für Präsentationen oder Webseiten –, und dies als
00:04:35Design-System für praktisch jede Art von Ausgabe betrachten, eignet sich GPT-6 dafür hervorragend. Das sehen Sie hier noch einmal
00:04:41anhand von Excel-Dokumenten und dem Dokumentdesign im Allgemeinen. Hier ist im Grunde das Referenzbild, das vorgegeben wurde.
00:04:46Das bekamen wir früher, und das ist das Ergebnis rechts, nachdem es dieses Referenzbild analysiert hat.
00:04:51Ein weiterer interessanter Punkt ist dieser Satz, in dem sie erwähnen, dass GPT-6 Astra
00:04:55stärkeres visuelles Urteilsvermögen für Websites, Spiele, Anwendungen und deren Rendering verleiht – sprich, sie
00:05:00behaupten, dass GPT-6 einen besseren Geschmack hat. Sie haben wahrscheinlich schon oft gehört, dass KI keinen Geschmack besitzt.
00:05:05Nun ja, sie sagen, GPT-6 schon. Seien wir ehrlich, es wird immer Probleme geben, wenn
00:05:10Geschmack immer Probleme geben, denn wenn man ihr einen schlechten Prompt gibt, kommt es unweigerlich zu einer Art
00:05:15Regression zum Mittelwert. Und wie dieser Mittelwert auch aussehen mag, die Leute werden ihn immer mit KI-
00:05:20Einheitsbrei assoziieren, ganz gleich, wie gut er tatsächlich ist. Sie zeigen hier jedoch einige Beispiele von
00:05:25einem Unreal-Engine-Rundgang, den sie erstellt haben, Blender-Modellierungen sowie einigen Standbildern. Eine wirklich coole Funktion,
00:05:31die sie mit Astra hinzufügen, sind Änderungen an der automatischen Datenkomprimierung, wenn sich das Kontextfenster füllt.
00:05:37Normalerweise wird das Kontextfenster voll, es komprimiert sich automatisch, erstellt eine Art Zusammenfassung
00:05:41von allem, worüber Sie in der letzten Sitzung gesprochen haben, und startet dann eine neue Sitzung.
00:05:46Das führt jedoch zu Problemen, da manchmal Details weggelassen werden. Astra behält nun aber Notizen über Kontext-
00:05:52fenster hinweg bei, anstatt nur eine einzige Zusammenfassung zu erstellen. Statt eines einzigen Dokuments führt es im Grunde eine Reihe
00:05:57verschiedener Haftnotizen darüber, was es für wichtig hält. Und darauf kann es jederzeit zurückgreifen,
00:06:01anstatt sich nur auf diesen einmaligen Schuss nach dem Motto „Hier ist eine Zusammenfassung, hoffentlich deckt das alles ab“ zu verlassen.
00:06:06Tatsächlich bleiben frühere Kontextfenster durchsuchbar. Es ist also nicht so, dass dies
00:06:12das einzige Dokument ist, das wir als Zusammenfassung haben, und wenn es nicht darin steht, sind wir aufgeschmissen. Das ist einfach nicht mehr
00:06:16der Fall. Dies ist allerdings ein experimentelles Feature. Sie müssen es also in der Codex-
00:06:20Konfiguration aktivieren, aber es wird in wenigen Wochen zum Standard werden. Was die Cybersicherheit betrifft,
00:06:24behandelt Astra dies ähnlich wie Anthropic Fable, indem sie sagen: Dieses Modell ist so
00:06:28mächtig, dass es eine Reihe von Exploits erstellen kann. Wenn es also den Eindruck hat, dass Sie versuchen,
00:06:33irgendeinen Exploit zu erstellen, wird es das schlichtweg nicht zulassen. Es wird dem nicht nachkommen und Ihr
00:06:37Problem nicht beantworten. Eine weitere großartige Verbesserung von GPT-6 im Vergleich zur 5er-Reihe ist eine geringere Halluzinationsrate.
00:06:42GPT-5.6 Sol und die 5.6-Modelle im Allgemeinen neigten im Vergleich zu anderen Frontier-Modellen
00:06:48tatsächlich zu recht vielen Halluzinationen. Im direkten Vergleich sehen wir jedoch, dass wir von einer
00:06:54Halluzinationsrate von rund 9,4 % auf sage und schreibe 2 % heruntergegangen sind. Ist Astra nun verfügbar?
00:07:01Nun, es ist für eine begrenzte Anzahl von Organisationen geöffnet. Und in den nächsten Tagen wird es im Grunde für
00:07:06jeden freigegeben. Was die API betrifft, so ist sie für Entwickler verfügbar. Und bezüglich des Preises gilt wiederum:
00:07:11Er entspricht der Preisgestaltung von Fable. Wir sprechen hier von 10 $pro Million Input-Token und 50$ pro Million Output-Token.
00:07:17Basierend auf den Zahlen liefert OpenAI uns also ein sehr solides Modell, das absolut mit dem Besten
00:07:22konkurrieren kann, was Anthropic zu bieten hat. Und das zu einem günstigeren Preis. Ich freue mich
00:07:26also riesig darauf, das auszuprobieren. Ich denke, der Wettbewerb unter den größten Akteuren hier
00:07:30ist letztendlich großartig für uns, die Endnutzer.