Warum du Jev keinesfalls verpassen solltest – erklärt in 9 Minuten
MMaximilian Schwarzmüller
컴퓨터/소프트웨어창업/스타트업AI/미래기술
스크립트
00:00:00Vor ein paar Stunden wurde ein neues KI-Modell veröffentlicht, und ich glaube wirklich, dass das ein echter Wendepunkt sein könnte.
00:00:07Ich weiß, ich weiß, wir bekommen fast jede Woche neue Modelle, aber ich rede hier nicht von einem neuen
00:00:13großen Sprachmodell. Stattdessen spreche ich von Jeff von Typesafe AI. Und ich weiß, das klingt
00:00:19wie ein persönlicher Assistent, wie ein Grog-Bot, wie Jeff eben, und es ist eine typesichere KI – das klingt
00:00:25wie eine TypeScript-Bibliothek, aber nichts davon trifft zu. Es ist eine neue Art von KI-Modell, es ist kein
00:00:31großes Sprachmodell, aber es scheint ein ziemlich schlaues Modell zu sein und es bietet uns etwas, das große Sprach-
00:00:39modelle uns nur bedingt bieten. Um das gleich mal vorwegzunehmen: Das Ganze ist übrigens nicht
00:00:44gesponsert oder so. Ihr könnt einfach auf deren Website typesafe.ai gehen, und dort könnt ihr euch
00:00:51in eine Warteliste eintragen. Das habe ich gestern Abend deutscher Zeit auch gemacht wie alle anderen und ich habe
00:00:56heute Morgen Zugang bekommen. Also bin ich jetzt hier. Was ist es denn nun? Die Idee ist, dass man ein Modell hat, bei dem es nicht um
00:01:04das Generieren von Text geht, sondern das Text verstehen kann. Man kann jeden beliebigen Text eingeben und ihm dann
00:01:12einige Optionen vorgeben. Hier ist zum Beispiel ein einfaches Beispiel: Ich habe ein paar Beispieltexte, das könnten E-Mails sein oder
00:01:21irgendwelche Chat-Nachrichten von Kunden. Man hat ja so einen Chat auf seiner Website, Kunden können Nachrichten senden,
00:01:28das könnten diese Nachrichten hier sein, und dann möchte man entscheiden, was man damit macht. Natürlich
00:01:34kann man sie durch ein großes Sprachmodell schleusen, aber das bringt ein paar Probleme mit sich: Erstens Prompt Injection,
00:01:40zweitens kann es ziemlich teuer werden, weil man ein relativ intelligentes Modell braucht, sodass man
00:01:48eine Menge Token verbraucht, da man alle Werkzeugbeschreibungen an dieses Modell übergeben muss,
00:01:54man muss dem Modell zusätzliche Informationen übergeben, natürlich die Kundennachricht,
00:02:00und dabei verbraucht man Token. Und drittens ist es relativ langsam. Diese modernen großen Sprach-
00:02:06modelle brauchen eben etwas Zeit für die Antwort. Jeff ist dagegen super schnell, wir reden hier
00:02:12über Millisekunden. Es läuft nicht lokal auf deinem Rechner, es ist immer noch in der Cloud, aber es ist super schnell und die Idee ist,
00:02:18dass man Jeff die Nachricht gibt. Hier „Frag Jeff“ ist im Grunde nur ich, wie ich diesen Client nutze und mit der KI rede.
00:02:26Man gibt ihr also diese Nachricht und man kann in der Tat auch komplexere strukturierte Daten übergeben, es muss also
00:02:32nicht nur ein String sein, und dann gibt man Informationen darüber, was mit dieser Nachricht geschehen soll,
00:02:39man stellt ihm quasi Fragen, um es genau zu sagen. Und es gibt drei Arten von Fragen: Es gibt
00:02:46Auswahlmöglichkeiten (Choices), Scoring und Ja/Nein-Fragen. Bei Auswahlmöglichkeiten ist es genau das, wonach es klingt:
00:02:53Man gibt ihm einige Optionen vor, und das KI-Modell gibt einem dann einen Konfidenzwert zurück, welche Option richtig ist.
00:02:58Score bedeutet, Sie lassen das Modell bewerten, Sie geben ihm einige
00:03:02Stufen sozusagen, und es erstellt basierend auf diesen Stufen eine Bewertung. Und „Now“ sind Ja-oder-Nein-Fragen.
00:03:10In diesem einfachen Beispiel erhalte ich also einige Nutzerrichtlinien oder -nachrichten, sende sie an das Modell,
00:03:15und definiere hier meine Fragen. Erste Frage: Welches Team sollte diese Nachricht bearbeiten? Und ich gebe
00:03:21ihm drei Optionen. Das bleibt völlig dir überlassen, man kann hier wirklich definieren, was man braucht, man kann
00:03:26weitere Optionen hinzufügen – im Moment glaube ich bis zu 10 –, und man beschreibt, worum es bei jeder Option geht. Ich habe also
00:03:33ein Abrechnungsteam und mache deutlich, dass es in diesem Team um die Bearbeitung von Gebühren, Rechnungsstellung und so weiter geht,
00:03:38und ich habe noch ein paar andere Teams in dieser Demo. Das ist also die erste Frage, die ich basierend auf
00:03:44dieser Kundennachricht an Jeff sende. Aber das ist noch nicht alles, man kann auch mehrere Fragen in einem Durchgang stellen.
00:03:49Wir könnten mehrere Auswahlmöglichkeiten haben, aber hier möchte ich aus jeder Kategorie eine zeigen. Ich habe also eine Auswahlfrage,
00:03:53ich habe eine Ja/Nein-Frage – ich möchte wissen, ob diese Nachricht Dringlichkeit ausdrückt –, und wir werden alle
00:04:00drei Nachrichten dadurch jagen, um für jede Nachricht zu sehen, ob sie dringlich ist. Und die dritte Art
00:04:07von Frage, die ich hier sende, ist eine Scoring-Frage, bei der ich wissen möchte, wie frustriert der Kunde
00:04:11erscheint. Wenn ich das hier so ausführe, sehen wir, dass das ausgeführt wird, und das geht wirklich schnell.
00:04:20Das wurde in die Cloud an das KI-Modell gesendet und verarbeitet und so weiter, aber es ist kein großes Sprach-
00:04:25modell involviert. Stattdessen kann man sehen: Für diese erste Kundennachricht war die Auswahl,
00:04:30dass sich das technische Team darum kümmern sollte, mit einem Konfidenzwert, der automatisch von Jeff erstellt wurde.
00:04:36Bei der Ja/Nein-Frage, ob es dringend ist: Ja, es ist hier ziemlich dringend, wir haben einen recht hohen Konfidenz-
00:04:42wert von fast eins, dass es dringend ist, und die Frustration ist ziemlich hoch, wie wir sehen. Die zweite
00:04:49Frage war, dass uns etwas doppelt berechnet wurde und wir eine sofortige Rückerstattung wollen, das sollte also an das
00:04:56Abrechnungsteam weitergeleitet werden. Jeff hat entschieden, dass es ziemlich dringend ist, und die Frustration ist auch ziemlich hoch. Und
00:05:03diese dritte Frage ist für das Vertriebsteam, sie ist nicht dringend und es ist keine Frustration darin enthalten. Nun,
00:05:09wie man sehen kann – oder zumindest ist das das, was ich hier sehe –, könnte das ziemlich nützlich sein. Wir können das mit
00:05:18großen Sprachmodellen bauen, aber ich habe dargelegt, wo deren Nachteile liegen. Das hier ist schnell und super
00:05:24günstig. Wir müssen über die Preise sprechen: Das kostet 42 Dollar pro Milliarde – Milliarde, nicht Millionen wie bei allen anderen
00:05:33Modellen –, Milliarde Input-Token, und Output-Token sind kostenlos. Output-Token kosten überhaupt nichts, das ist also weitaus
00:05:40billiger als all diese großen Sprachmodelle. Man kann eine Menge komplexer Fragen an Jeff senden und es kostet einen
00:05:49fast nichts. Und nochmals: Die Output-Token kosten wirklich nichts, es ist super schnell und es ist speziell
00:05:56für diese Entscheidungen entwickelt. Und wenn man darüber nachdenkt – und deshalb bin ich ziemlich begeistert davon –, wenn man
00:06:02darüber nachdenkt, läuft vieles von dem, was wir bauen, auf Entscheidungen hinaus. Jeder KI-Agent, den man baut, ist voller
00:06:08Entscheidungen: Welches Tool soll wann aufgerufen werden? Das sind alles Entscheidungen. Wie ich bereits erwähnt habe, kann man das natürlich
00:06:15mit großen Sprachmodellen kombinieren. Hier habe ich ein weiteres Beispiel, bei dem ich einen Assistenten baue und dort
00:06:22ein paar sehr einfache Tool-Aufrufe habe, bei denen wir sagen wir mal einen Smart-Home-Assistenten haben, mit dem wir
00:06:29das Licht in einem bestimmten Raum ausschalten oder einschalten können. Das ist also eine Dummy-Funktion dafür, ein Dummy-Tool dafür,
00:06:35bei dem wir aber für bestimmte Aufgaben vielleicht auch ein großes Sprachmodell verwenden möchten, denn wie gesagt, Jeff kann keinen
00:06:42Text verfassen. Immer wenn man also Text generieren muss, zum Beispiel eine Antwort-E-Mail für einen Kunden oder etwas
00:06:48in der Art, muss man ein großes Sprachmodell hinzuziehen. Und das kann man hier tun, ich verwende ein großes Sprach-
00:06:54modell und mache das mit dem AI SDK von Vercel. Ich verwende GPT 5.6 Terra bei mittlerem Thinking-Aufwand,
00:07:02also ist es relativ erschwinglich, und dann lasse ich Jeff die Entscheidungen treffen, welches Tool verwendet werden soll. Das ist also wieder Jeff, nicht das
00:07:10große Sprachmodell, aber dann führe ich diese Tools aus, und bei einigen Tools wird ein großes Sprachmodell verwendet
00:07:15und bei einigen Tools eben nicht. Und das ist wirklich der erstaunliche Teil: Wir bauen Systeme, bei denen wir
00:07:21ständig Entscheidungen treffen müssen, bei denen wir Dinge bewerten oder ständig Ja- und Nein-Fragen beantworten müssen,
00:07:26und im Moment verwenden wir dafür oft große Sprachmodelle. Und die sind
00:07:31gut, versteht mich nicht falsch. Ein Vorteil, den sie definitiv nach wie vor haben, ist zum Beispiel das Kontext-
00:07:36fenster. In der Dokumentation wird ein Budget von etwa 32.000 Text-Token erwähnt, die man in seinen
00:07:45Fragen hier übergeben kann. Man hat also solche Einschränkungen. In der Dokumentation gibt es auch einen vollständigen Artikel über die
00:07:50Unvollkommenheiten (Jaggedness) ihres aktuellen Spitzenmodells, wo es zum Beispiel bei Mathematik, Zahlen, Datum und Uhrzeit-
00:07:56vergleichen nicht gut ist. Es gibt also Aspekte, in denen es noch nicht gut ist. Nun, einerseits würde ich erwarten, dass es wie alle anderen KI-
00:08:05modelle in Zukunft besser wird und Probleme gelöst werden können. Und abgesehen davon ist es eben kein
00:08:12Entweder-Oder, sondern eine Ergänzung. Es kann ein schönes zusätzliches Werkzeug zusätzlich zu großen Sprachmodellen sein. Und wenn es
00:08:18genauso langsam und teuer wäre, würde ich den Nutzen nicht unbedingt sehen, aber das ist es nicht. Mit den
00:08:24Vorteilen, die es bietet, wirkt es wirklich vielversprechend. Nun, wir werden Langzeittests machen müssen, um es in der
00:08:32Produktion und bei komplexeren Anwendungsfällen zu sehen, um zu bewerten, ob es sehr fehleranfällig ist, ob es vielleicht sehr
00:08:40anfällig für Prompt Injection oder ähnliches ist, ob es unter solchen Problemen leiden kann, aber es sieht
00:08:47wirklich nützlich aus. Und im Gegensatz zu der ganzen Subquadratik-Sache, die vor ein paar Monaten
00:08:53passiert ist, ist das hier etwas, das man nutzen und testen kann. Es ist genau jetzt verfügbar, zumindest wenn man Zugang
00:08:57bekommt. Man kann sich in die Warteliste eintragen, und bei mir hat es dann nur ein paar Stunden gedauert, und es sieht wirklich
00:09:03nützlich aus. Ich denke, wir können wirklich tolle Programme und Systeme bauen, indem wir Jeff mit traditioneller
00:09:12Programmierung – also mit normalem deterministischem Code – und eben auch großen Sprachmodellen kombinieren und wirklich erstaunliche
00:09:20Dinge aus all dem erschaffen. Ja, ich hoffe, das ist ein schöner erster Eindruck und Überblick darüber, was Jeff ist. Trag dich in
00:09:27die Warteliste ein, wenn du selbst praktisch damit arbeiten möchtest, und stürz dich dann hinein und experimentiere damit!
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기