스크립트
00:00:00Thinking Machines, das 12-Milliarden-Startup der ehemaligen OpenAI-CTO Mira Moretti, hat gerade sein
00:00:05allererstes Modell veröffentlicht. Es hat 975 Milliarden Parameter, nutzt die Apache-2.0-Lizenz und die Gewichte sind
00:00:12vollständig auf Hugging Face für jeden zum Download verfügbar. Und obwohl es nicht mit Frontverlauf-Laboren
00:00:17wie Anthropic konkurriert, besteht das eigentliche Ziel darin, es speziell mit ihrer eigenen Plattform
00:00:22Tinker feinabzustimmen. Wenn Sie also ein Modell benötigen, das auf eine
00:00:25hochspezifische Aufgabe trainiert ist, ist dies möglicherweise genau das, wonach Sie suchen.
00:00:29Heute behandeln wir, warum Sie dieses Modell speziell verwenden möchten und alle Gründe für ein Fine-Tuning.
00:00:35Und es gibt eine superinteressante Art und Weise, wie dieses Modell Audio und Video verarbeitet, was ich so noch nie gesehen habe.
00:00:40Bleiben Sie also dran, wir werden das in diesem Video ebenfalls behandeln. Auf diesem Kanal beschäftigen wir uns
00:00:44ständig mit KI-Themen. Wenn Sie also auf dem Laufenden bleiben wollen, abonnieren Sie BetterStack.
00:00:52Thinking Machines macht kein Geheimnis daraus, dass ihr neues Modell im Grunde nicht so stark ist wie
00:00:57jedes x-beliebige allgemeine Modell auf dem Markt. Das erwähnen sie auch in ihrem Startbeitrag. Sie dämpfen also
00:01:01die Erwartungen und man sieht auch warum in den Benchmarks. Beim Befehlsbefolgen schlägt es GLM 5.2,
00:01:07mit 79,8 zu 73,3. Aber beim Terminal-Bench, bei dem Agenten eigenständig arbeiten, schneidet es mit
00:01:1463,8 zu 82,7 deutlich schlechter ab. Es ist also gut darin, Anweisungen zu befolgen, aber viel schwächer darin, Dinge selbstständig zu lösen.
00:01:21Es ist jedoch ein großartiger Ausgangspunkt, wenn Ihre Absicht ein Fine-Tuning ist. Unter der Haube handelt es sich um eine Mixture of Experts.
00:01:27Es gibt also insgesamt 975 Milliarden Parameter, aber jede Schicht enthält 256 einzigartige Experten und jedes Token
00:01:35wird nur an sechs von ihnen gesendet, was bedeutet, dass nur etwa 41 Milliarden Parameter zu einem
00:01:41bestimmten Zeitpunkt tatsächlich arbeiten. Es ist zudem multimodal. Bilder, Text und Audio fließen alle ein. Und die Art und Weise,
00:01:47wie das geschieht, unterscheidet sich stark von jedem Modell, das Sie bisher gesehen haben. Normalerweise gibt es,
00:01:52wenn ein Modell beispielsweise Audio verarbeitet, ein separates Sprachmodell vor dem Sprachmodell,
00:01:56das den Text transkribiert und dieses Transkript dann an das Sprachmodell übergibt. Bilder können genauso funktionieren.
00:02:02Ein Vision-Encoder betrachtet das Bild, erstellt eine Beschreibung dafür und übergibt diese dann an das Sprachmodell.
00:02:07Und das bedeutet natürlich, dass es dabei zu einer gewissen Form von Datenverlust kommt.
00:02:11Inkling macht das überhaupt nicht. Das Audio geht direkt als Spektrogramm ein, sodass die rohen Frequenzbänder des
00:02:16Tons in Abschnitte zerlegt werden. Bilder werden ebenfalls als 40x40-Pixel-Patches eingespeist. Beide wandern direkt in denselben
00:02:23Raum, in dem sich die Text-Tokens befinden, und das Modell verarbeitet sie alle zusammen. Es wird also nichts
00:02:28in Text komprimiert. Theoretisch sollte man also viel weniger Datenverlust und Komprimierung bei der Verarbeitung
00:02:35von insbesondere Audio und Video mit dem Inkling-Modell erhalten. Und im Vergleich zu den meisten
00:02:40Allzweckmodellen, die rohes Audio überhaupt nicht unterstützen, sticht Inkling deutlich hervor. Ob Sie
00:02:46überhaupt ein Fine-Tuning durchführen sollten, hängt von Ihren spezifischen Zielen ab. Die Faustregel lautet im Allgemeinen,
00:02:50dass Fine-Tuning einem Modell beibringt, wie es antworten soll, und nicht, was es wissen muss. Zum Beispiel Tonfall oder starre,
00:02:57strukturierte Ausgaben, bei denen Tausende von Beispielen im Kontext erforderlich wären, um die Ausgabe des Modells zu leiten,
00:03:02da die Übergabe tausender Beispiele über einen Prompt einfach unpraktisch wäre. Dazu kommen Kosten und Latenz-
00:03:08Destillation, bei denen die Ausführung einer engen Aufgabe mit einem allgemeinen Modell erheblich teurer wäre
00:03:13als das Fine-Tuning eines kleineren Modells. Grundsätzlich gilt: Wenn es eine Situation gibt, in der Sie Tausende von
00:03:18Beispielen benötigen, um eine ordentliche Ausgabe zu erhalten, dann könnte dies von Fine-Tuning profitieren. Aber wenn Sie möchten, dass das Modell
00:03:23Dinge weiß, die es nicht weiß, dann führen Sie kein Fine-Tuning durch. Es gibt tatsächlich eine gut zitierte Arbeit, die Retrieval
00:03:28gegen Fine-Tuning stellt und Retrieval gewinnt dabei durchgehend. Und wenn Sie ein besseres Schließen wünschen, kann Fine-Tuning
00:03:34das Ganze tatsächlich verschlechtern, weil es die Gedankenkette des Modells beeinträchtigt. Interessanterweise leiden kleinere Modelle
00:03:40darunter am meisten. Speziell für eng umrissene Aufgaben können die Ergebnisse des Fine-Tunings jedoch großartig sein. Wenn wir uns
00:03:46Harvey ansehen, die KI-Tools für Anwaltskanzleien entwickeln, haben sie ein kleines Modell darauf trainiert, Zitate aus juristischen Dokumenten herauszufiltern.
00:03:52Sie haben den F1-Wert gemessen, eine Metrik zur Bewertung der Leistung eines Klassifizierungsmodells. Durch das Fine-Tuning
00:03:58verbesserten sie sich von 0,56 auf 0,68. Im direkten Vergleich mit GPT-4.0 gewann oder teilte das kleinere Modell in 93 %
00:04:07der Fälle den ersten Platz. Und es lief sogar schneller. Thinking Machines zeigt sogar eine Demo, in der Inkling gezwungen wird,
00:04:12niemals den Buchstaben E zu verwenden, wobei man es buchstäblich dazu anregen kann, sich selbst über Tinker feinabzustimmen.
00:04:18Es erstellt daraufhin den Trainingsdatensatz und kann den gesamten Fine-Tuning-Prozess völlig automatisch ausführen.
00:04:24Das Ergebnis ist ein Modell mit einer schweren Epsilon-Phobie, und seltsamerweise ergeben die Antworten immer noch Sinn.
00:04:29Aber hierbei wird nicht das gesamte Modell neu trainiert. Tatsächlich verwenden Sie etwas namens LoRa,
00:04:32was für Low Rank Adaptation steht. Anstatt das gesamte Modell zu trainieren, friert LoRa die ursprünglichen
00:04:38Gewichte ein und fügt leichtgewichtige, kleinere Matrizen ein, um neue spezifische Daten zu erfassen. Dies bietet Vorteile
00:04:44hinsichtlich Kosten und Geschwindigkeit für das Post-Training im Vergleich zum feinen Anpassen eines gesamten Modells, was andernfalls
00:04:49wahrscheinlich schlicht unpraktisch wäre. Nun unterstützt Tinker bereits eine Reihe offener Modelle wie Qwen, Kimi, DeepSeek, Nvidias
00:04:55NemoTron und OpenAIs GPT OSS. Und Inkling ist eines der teureren, warum sollten Sie sich also überhaupt damit befassen?
00:05:02Nun, es gibt zwei Gründe, und wir haben sie bereits ein wenig beleuchtet. Der erste ist Audio. Von jedem
00:05:06Modell auf der Plattform verarbeitet Inkling als einziges überhaupt Audio. Viele von ihnen verarbeiten Bilder,
00:05:11Kimi und die meisten Qwen-Modelle kommen gut mit Vision zurecht, aber keines davon verarbeitet tatsächlich rohen
00:05:16Ton. Und sie haben auch drei Cookbook-Rezepte herausgebracht, wie Spracherkennung
00:05:20und Klassifizierung des Sprechstils. Das Modell kann Ihnen also sagen, wie etwas gesagt wurde, nicht nur, was gesagt
00:05:26wurde. Es gibt auch ein medizinisches Beispiel, das mit diktierten Rezepten trainiert wurde und dem Modell Medikamentennamen beibringt,
00:05:31die die meisten Modelle sonst verstümmeln würden. Der zweite Grund ist der Denkaufwand. Bei Inkling können Sie
00:05:36die Denktiefe als Zahl von null bis eins einstellen. Die meisten Modelle bieten Ihnen einen Schalter mit zwei bis drei Stufen. GPT OSS
00:05:42bietet beispielsweise niedrig, mittel und hoch, aber Inkling bietet Ihnen einen ganzen Schieberegler. Die große
00:05:47Frage ist also, ob Sie es tatsächlich verwenden sollten. Nun, wenn Sie möchten, dass ein Modell im Auslieferungszustand läuft, ist das hier
00:05:52wahrscheinlich nicht das Richtige. Das betonen sie auch selbst. Wenn Sie jedoch eine spezifische, hochvolumige
00:05:56Aufgabe haben, einige echte beschriftete Daten und eine Möglichkeit, die Ausgabe zu bewerten, gehört das Fine-Tuning eines kleinen, offenen Modells zu den
00:06:02am meisten unterschätzten Dingen, die Sie derzeit tun können. Und mit Plattformen wie Tinker ist es so viel einfacher.
00:06:07Ob Inkling das Richtige für Sie ist, hängt letztlich davon ab, womit Sie es füttern.
00:06:11Wenn Audio im Spiel ist, ist Inkling eine starke Wahl, und nichts anderes auf Tinker akzeptiert überhaupt rohes
00:06:16Audio im Moment. Und wenn Sie nach dem besten offenen Allzweckmodell im Moment suchen, haben wir gerade ein
00:06:21Video zu Kimi K3 gemacht, das Sie sich hier ansehen können, und das einige unglaubliche Ergebnisse erzielt hat. Aber ansonsten,
00:06:26vielen Dank fürs Zuschauen. Ich war Warren von BetterStack und wir sehen uns im nächsten Video.