Inkling: Dieses Open-Weight-Modell möchte feingetunt werden

BBetter Stack
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Thinking Machines, das 12-Milliarden-Startup der ehemaligen OpenAI-CTO Mira Moretti, hat gerade sein
00:00:05allererstes Modell veröffentlicht. Es hat 975 Milliarden Parameter, nutzt die Apache-2.0-Lizenz und die Gewichte sind
00:00:12vollständig auf Hugging Face für jeden zum Download verfügbar. Und obwohl es nicht mit Frontverlauf-Laboren
00:00:17wie Anthropic konkurriert, besteht das eigentliche Ziel darin, es speziell mit ihrer eigenen Plattform
00:00:22Tinker feinabzustimmen. Wenn Sie also ein Modell benötigen, das auf eine
00:00:25hochspezifische Aufgabe trainiert ist, ist dies möglicherweise genau das, wonach Sie suchen.
00:00:29Heute behandeln wir, warum Sie dieses Modell speziell verwenden möchten und alle Gründe für ein Fine-Tuning.
00:00:35Und es gibt eine superinteressante Art und Weise, wie dieses Modell Audio und Video verarbeitet, was ich so noch nie gesehen habe.
00:00:40Bleiben Sie also dran, wir werden das in diesem Video ebenfalls behandeln. Auf diesem Kanal beschäftigen wir uns
00:00:44ständig mit KI-Themen. Wenn Sie also auf dem Laufenden bleiben wollen, abonnieren Sie BetterStack.
00:00:52Thinking Machines macht kein Geheimnis daraus, dass ihr neues Modell im Grunde nicht so stark ist wie
00:00:57jedes x-beliebige allgemeine Modell auf dem Markt. Das erwähnen sie auch in ihrem Startbeitrag. Sie dämpfen also
00:01:01die Erwartungen und man sieht auch warum in den Benchmarks. Beim Befehlsbefolgen schlägt es GLM 5.2,
00:01:07mit 79,8 zu 73,3. Aber beim Terminal-Bench, bei dem Agenten eigenständig arbeiten, schneidet es mit
00:01:1463,8 zu 82,7 deutlich schlechter ab. Es ist also gut darin, Anweisungen zu befolgen, aber viel schwächer darin, Dinge selbstständig zu lösen.
00:01:21Es ist jedoch ein großartiger Ausgangspunkt, wenn Ihre Absicht ein Fine-Tuning ist. Unter der Haube handelt es sich um eine Mixture of Experts.
00:01:27Es gibt also insgesamt 975 Milliarden Parameter, aber jede Schicht enthält 256 einzigartige Experten und jedes Token
00:01:35wird nur an sechs von ihnen gesendet, was bedeutet, dass nur etwa 41 Milliarden Parameter zu einem
00:01:41bestimmten Zeitpunkt tatsächlich arbeiten. Es ist zudem multimodal. Bilder, Text und Audio fließen alle ein. Und die Art und Weise,
00:01:47wie das geschieht, unterscheidet sich stark von jedem Modell, das Sie bisher gesehen haben. Normalerweise gibt es,
00:01:52wenn ein Modell beispielsweise Audio verarbeitet, ein separates Sprachmodell vor dem Sprachmodell,
00:01:56das den Text transkribiert und dieses Transkript dann an das Sprachmodell übergibt. Bilder können genauso funktionieren.
00:02:02Ein Vision-Encoder betrachtet das Bild, erstellt eine Beschreibung dafür und übergibt diese dann an das Sprachmodell.
00:02:07Und das bedeutet natürlich, dass es dabei zu einer gewissen Form von Datenverlust kommt.
00:02:11Inkling macht das überhaupt nicht. Das Audio geht direkt als Spektrogramm ein, sodass die rohen Frequenzbänder des
00:02:16Tons in Abschnitte zerlegt werden. Bilder werden ebenfalls als 40x40-Pixel-Patches eingespeist. Beide wandern direkt in denselben
00:02:23Raum, in dem sich die Text-Tokens befinden, und das Modell verarbeitet sie alle zusammen. Es wird also nichts
00:02:28in Text komprimiert. Theoretisch sollte man also viel weniger Datenverlust und Komprimierung bei der Verarbeitung
00:02:35von insbesondere Audio und Video mit dem Inkling-Modell erhalten. Und im Vergleich zu den meisten
00:02:40Allzweckmodellen, die rohes Audio überhaupt nicht unterstützen, sticht Inkling deutlich hervor. Ob Sie
00:02:46überhaupt ein Fine-Tuning durchführen sollten, hängt von Ihren spezifischen Zielen ab. Die Faustregel lautet im Allgemeinen,
00:02:50dass Fine-Tuning einem Modell beibringt, wie es antworten soll, und nicht, was es wissen muss. Zum Beispiel Tonfall oder starre,
00:02:57strukturierte Ausgaben, bei denen Tausende von Beispielen im Kontext erforderlich wären, um die Ausgabe des Modells zu leiten,
00:03:02da die Übergabe tausender Beispiele über einen Prompt einfach unpraktisch wäre. Dazu kommen Kosten und Latenz-
00:03:08Destillation, bei denen die Ausführung einer engen Aufgabe mit einem allgemeinen Modell erheblich teurer wäre
00:03:13als das Fine-Tuning eines kleineren Modells. Grundsätzlich gilt: Wenn es eine Situation gibt, in der Sie Tausende von
00:03:18Beispielen benötigen, um eine ordentliche Ausgabe zu erhalten, dann könnte dies von Fine-Tuning profitieren. Aber wenn Sie möchten, dass das Modell
00:03:23Dinge weiß, die es nicht weiß, dann führen Sie kein Fine-Tuning durch. Es gibt tatsächlich eine gut zitierte Arbeit, die Retrieval
00:03:28gegen Fine-Tuning stellt und Retrieval gewinnt dabei durchgehend. Und wenn Sie ein besseres Schließen wünschen, kann Fine-Tuning
00:03:34das Ganze tatsächlich verschlechtern, weil es die Gedankenkette des Modells beeinträchtigt. Interessanterweise leiden kleinere Modelle
00:03:40darunter am meisten. Speziell für eng umrissene Aufgaben können die Ergebnisse des Fine-Tunings jedoch großartig sein. Wenn wir uns
00:03:46Harvey ansehen, die KI-Tools für Anwaltskanzleien entwickeln, haben sie ein kleines Modell darauf trainiert, Zitate aus juristischen Dokumenten herauszufiltern.
00:03:52Sie haben den F1-Wert gemessen, eine Metrik zur Bewertung der Leistung eines Klassifizierungsmodells. Durch das Fine-Tuning
00:03:58verbesserten sie sich von 0,56 auf 0,68. Im direkten Vergleich mit GPT-4.0 gewann oder teilte das kleinere Modell in 93 %
00:04:07der Fälle den ersten Platz. Und es lief sogar schneller. Thinking Machines zeigt sogar eine Demo, in der Inkling gezwungen wird,
00:04:12niemals den Buchstaben E zu verwenden, wobei man es buchstäblich dazu anregen kann, sich selbst über Tinker feinabzustimmen.
00:04:18Es erstellt daraufhin den Trainingsdatensatz und kann den gesamten Fine-Tuning-Prozess völlig automatisch ausführen.
00:04:24Das Ergebnis ist ein Modell mit einer schweren Epsilon-Phobie, und seltsamerweise ergeben die Antworten immer noch Sinn.
00:04:29Aber hierbei wird nicht das gesamte Modell neu trainiert. Tatsächlich verwenden Sie etwas namens LoRa,
00:04:32was für Low Rank Adaptation steht. Anstatt das gesamte Modell zu trainieren, friert LoRa die ursprünglichen
00:04:38Gewichte ein und fügt leichtgewichtige, kleinere Matrizen ein, um neue spezifische Daten zu erfassen. Dies bietet Vorteile
00:04:44hinsichtlich Kosten und Geschwindigkeit für das Post-Training im Vergleich zum feinen Anpassen eines gesamten Modells, was andernfalls
00:04:49wahrscheinlich schlicht unpraktisch wäre. Nun unterstützt Tinker bereits eine Reihe offener Modelle wie Qwen, Kimi, DeepSeek, Nvidias
00:04:55NemoTron und OpenAIs GPT OSS. Und Inkling ist eines der teureren, warum sollten Sie sich also überhaupt damit befassen?
00:05:02Nun, es gibt zwei Gründe, und wir haben sie bereits ein wenig beleuchtet. Der erste ist Audio. Von jedem
00:05:06Modell auf der Plattform verarbeitet Inkling als einziges überhaupt Audio. Viele von ihnen verarbeiten Bilder,
00:05:11Kimi und die meisten Qwen-Modelle kommen gut mit Vision zurecht, aber keines davon verarbeitet tatsächlich rohen
00:05:16Ton. Und sie haben auch drei Cookbook-Rezepte herausgebracht, wie Spracherkennung
00:05:20und Klassifizierung des Sprechstils. Das Modell kann Ihnen also sagen, wie etwas gesagt wurde, nicht nur, was gesagt
00:05:26wurde. Es gibt auch ein medizinisches Beispiel, das mit diktierten Rezepten trainiert wurde und dem Modell Medikamentennamen beibringt,
00:05:31die die meisten Modelle sonst verstümmeln würden. Der zweite Grund ist der Denkaufwand. Bei Inkling können Sie
00:05:36die Denktiefe als Zahl von null bis eins einstellen. Die meisten Modelle bieten Ihnen einen Schalter mit zwei bis drei Stufen. GPT OSS
00:05:42bietet beispielsweise niedrig, mittel und hoch, aber Inkling bietet Ihnen einen ganzen Schieberegler. Die große
00:05:47Frage ist also, ob Sie es tatsächlich verwenden sollten. Nun, wenn Sie möchten, dass ein Modell im Auslieferungszustand läuft, ist das hier
00:05:52wahrscheinlich nicht das Richtige. Das betonen sie auch selbst. Wenn Sie jedoch eine spezifische, hochvolumige
00:05:56Aufgabe haben, einige echte beschriftete Daten und eine Möglichkeit, die Ausgabe zu bewerten, gehört das Fine-Tuning eines kleinen, offenen Modells zu den
00:06:02am meisten unterschätzten Dingen, die Sie derzeit tun können. Und mit Plattformen wie Tinker ist es so viel einfacher.
00:06:07Ob Inkling das Richtige für Sie ist, hängt letztlich davon ab, womit Sie es füttern.
00:06:11Wenn Audio im Spiel ist, ist Inkling eine starke Wahl, und nichts anderes auf Tinker akzeptiert überhaupt rohes
00:06:16Audio im Moment. Und wenn Sie nach dem besten offenen Allzweckmodell im Moment suchen, haben wir gerade ein
00:06:21Video zu Kimi K3 gemacht, das Sie sich hier ansehen können, und das einige unglaubliche Ergebnisse erzielt hat. Aber ansonsten,
00:06:26vielen Dank fürs Zuschauen. Ich war Warren von BetterStack und wir sehen uns im nächsten Video.

핵심 요약

Inkling verarbeitet rohes Audio und Video ohne Datenverlust durch direkte Spektrogramm-Einspeisung und ist speziell für das automatisierte Finetuning über die Plattform Tinker konzipiert.

하이라이트

  • Thinking Machines veröffentlicht das Open-Weight-Modell Inkling mit 975 Milliarden Parametern unter der Apache-2.0-Lizenz auf Hugging Face.

  • Inkling setzt auf eine Mixture-of-Experts-Architektur, bei der jede Schicht 256 Experten enthält und pro Token nur sechs Experten aktiv sind, was 41 aktiven Milliarden Parametern entspricht.

  • Audio geht als rohes Spektrogramm und Bilder als 40x40-Pixel-Patches direkt in den Text-Token-Raum ein, ohne vorherige Transkription oder Komprimierung.

  • Das Finetuning erfolgt über Low Rank Adaptation (LoRa), wodurch ursprüngliche Gewichte eingefroren und leichtgewichtige Matrizen zur Erfassung spezifischer Daten eingefügt werden.

  • Inkling auf der Plattform Tinker unterstützt als einziges Modell die Verarbeitung von rohem Audio und bietet einen stufenlosen Regler für die Denktiefe von null bis eins.

타임라인

Veröffentlichung und Architektur von Inkling

  • Thinking Machines veröffentlicht das Modell Inkling mit 975 Milliarden Parametern und Apache-2.0-Lizenz auf Hugging Face.
  • Das Modell zielt primär auf das Finetuning über die eigene Plattform Tinker ab und erreicht beim Befehlsbefolgen 79,8 Punkte.
  • Im Terminal-Bench erreicht das Modell 63,8 Punkte und zeigt damit Schwächen beim selbstständigen Lösen von Agentenaufgaben.

Das von Mira Morettis Startup entwickelte Modell ist gezielt für spezialisierte Aufgaben ausgelegt. Benchmark-Ergebnisse zeigen eine hohe Zuverlässigkeit beim reinen Befolgen von Anweisungen, während eigenständige Problemlösungen im Vergleich zu anderen Systemen schwächer ausfallen.

Multimodale Verarbeitung ohne Datenverlust

  • Jede der Mixture-of-Experts-Schichten nutzt 256 Experten, von denen pro Token sechs aktiviert werden.
  • Audio wird als rohes Spektrogramm und Bilder als 40x40-Pixel-Patches direkt in den gemeinsamen Token-Raum eingespeist.
  • Der direkte Eingang verhindert den typischen Datenverlust durch vorgeschaltete Transkriptions- oder Beschreibungssysteme.

Unter der Haube arbeiten zu jedem Zeitpunkt nur rund 41 Milliarden der insgesamt 975 Milliarden Parameter. Durch den Verzicht auf Textkomprimierung bei Audio und visuellen Daten verarbeitet Inkling Rohdaten direkt im selben Raum wie Text.

Grundlagen und Methodik des Finetunings

  • Finetuning vermittelt einem Modell Antwortstrukturen und Tonalitäten, erweitert jedoch nicht die zugrundeliegende Wissensbasis.
  • Ein feingetuntes kleineres Modell übertrifft oder erreicht in 93 Prozent der Fälle GPT-4.0 bei juristischen Zitatfilterungen und arbeitet dabei schneller.
  • LoRa friert die ursprünglichen Gewichte ein und integriert kleine Matrizen, um Kosten und Rechenaufwand zu senken.

Das Finetuning eignet sich vor allem für strukturierte Ausgaben und spezifische Aufgaben, bei denen tausende Prompt-Beispiele unpraktisch wären. Automatisierte Prozesse über Tinker erstellen die notwendigen Trainingsdatensätze und führen die Anpassung eigenständig durch.

Plattform-Integration und Entscheidungshilfe

  • Inkling ist das einzige Modell auf Tinker, das rohes Audio verarbeitet und sprachliche Stile sowie medizinische Diktate klassifiziert.
  • Die Denktiefe lässt sich über einen stufenlosen Regler von null bis eins einstellen.
  • Das Modell eignet sich besonders für hochvolumige, spezifische Aufgaben mit vorhandenen beschrifteten Daten.

Trotz höherer Kosten bietet Inkling durch die native Audioverarbeitung und den flexiblen Tiefenregler Alleinstellungsmerkmale auf der Plattform. Für den reinen Allzweckbetrieb ohne spezifisches Training empfiehlt sich stattdessen die Nutzung von Standardmodellen.

커뮤니티 글

모든 글 보기