Von Grund auf neu bis SOTA: Training eines 3B State-Space-Vision-Modells — Krishna Prasad Srinivasan, Sarvam
AAI Engineer
Computing/SoftwareSmall Business/StartupsLanguages
Transcript
00:00:00Hallo zusammen, guten Tag, ich bin Krishna, General Manager bei Sarvam. Heute werde ich
00:00:24Ihnen erzählen, wie ein Modell mit 3 Milliarden Parametern, das klein genug für eine einzelne GPU ist,
00:00:32State-of-the-Art in Dokumenten-KI erreicht und hundertmal größere Modelle schlägt. Es ist auch ein etwas
00:00:42ungewöhnliches Modell in zweierlei Hinsicht: Erstens ist das Sprachmodell kein Standard-Transformer, und
00:00:49die gesamte Modellentwicklung, von den Daten über das Training bis zur Rechenleistung, erfolgte Ende-zu-Ende in Indien.
00:00:58Und das für Englisch sowie für 22 offizielle indische Sprachen, was meiner Meinung nach derzeit eine der schwierigsten Aufgaben
00:01:06im Bereich der Dokumenten-KI weltweit ist. So sind wir von Grund auf zu SOTA gelangt. Wer sind wir? Wir sind
00:01:15Sarvam, ein Unternehmen für souveräne Basismodelle in Indien. Wir arbeiten modalitätsübergreifend: Sprach-, Text- und
00:01:23Vision-Modelle. Bei Sprache haben wir Speech-to-Text- und Text-to-Speech-Modelle, bei Text haben wir Modelle mit 30 und 100
00:01:32Milliarden Parametern, und bei Vision ein Dokumenten-KI-Modell, über das wir
00:01:38heute sprechen werden. Indien fehlt weitgehend in der maschinenlesbaren Welt. Laut einer veröffentlichten
00:01:48Sprachverteilungsstudie sind indische Sprachen mit deutlich unter einem Prozent im Common-Crawl-Korpus vertreten, mit dem Spitzenmodelle
00:01:55trainiert werden. In verschiedenen Foren haben Sie vielleicht gehört, wie führende KI-Labors sagen,
00:02:04dass Indien vertreten sei. Indien ist einer ihrer größeren und schnell wachsenden Märkte, aber hinsichtlich der Daten fehlt Indien in den
00:02:16Spitzenmodellen, die heute trainiert werden, immer noch. Warum ist das so? Hauptsächlich nicht, weil es an Daten mangelt oder das Wissen nicht existiert, sondern weil die Daten nie digitalisiert wurden,
00:02:31und genau dieses Problem lösen wir bei Sarvam. Warum ist indische Dokumenten-KI so schwer?
00:02:38Erstens ist das Ziel die Extraktion von Wissen, nicht nur reine Textextraktion. Reinen Text ohne
00:02:49logischen Zusammenhang zu extrahieren, ist wertlos. Zweitens unterscheiden sich in indischen Schriften die Form der Wörter und die Sprache, die Sie sehen, stark von dem,
00:03:01was eine Maschine sieht. Indische Sprachen nutzen komplexe Unicodes, die zusammengesetzt werden. Um das korrekt hinzubekommen, muss das Sprachmodell in allen 22 Sprachen stark sein.
00:03:13Drittens gilt die Mehrheit der indischen Sprachen als ressourcenarm, weshalb es heute an Daten mangelt, um diese Modelle zu trainieren.
00:03:23Unsere Antwort darauf ist Sarvam Vision: Indiens erstes souveränes Vision-Language-Modell, von Grund auf neu entwickelt. Ein 3-Milliarden-Parameter-Modell mit State-Space-Architektur, Daten, Rechenleistung und Training komplett aus Indien.
00:03:40Als wir Ende 2025 mit der Arbeit begannen, waren die meisten VLMs im OCR-Bereich monolithische VLMs. Sie führten OCR auf Seitenebene durch, und wir sind damals das Wagnis eingegangen, uns stattdessen auf OCR auf Blockebene zu konzentrieren, ergänzt durch ein Dokumenten-Harness um das Modell.
00:04:02Viele Modelle, die seitdem Anfang 2026 veröffentlicht wurden, sind auf dieselbe Kombination aus Harness und kleinem Modell für OCR umgestiegen, was den Wert unseres gewählten Weges bestätigt.
00:04:17Sarvam Vision verfügt insbesondere über zwei Harness-Module – eines für das Layout und eines für das Lesen – sowie ein State-Space-VLM für OCR auf Blockebene.
00:04:29Warum nutzen wir heute State-Space und keinen Transformer?
00:04:36Die meisten heutigen OCR-Modelle wie allgemeine, quelloffene VLMs (z. B. Qwen, Gemma usw.) basieren auf Transformern.
00:04:45Wir haben einen alternativen Ansatz mit einem SSM gewählt. Warum?
00:04:50Beides sind grundlegend Sequenzmodelle, Transformer wie SSMs, aber mit sehr unterschiedlicher Mechanik.
00:04:57Bei einem Transformer bezieht sich jeder Token auf jeden anderen Token, wodurch der Rechenaufwand quadratisch mit der Sequenzlänge wächst.
00:05:06Das sind die L-mal-L-Interaktionen.
00:05:10Und der Speicherbedarf wächst ebenfalls mit der Sequenz.
00:05:13Auf der anderen Seite haben SSMs einen einzigen Zustand.
00:05:17Sie behalten durch die Sequenz hinweg einen einzigen Zustand bei und aktualisieren ihn Token für Token.
00:05:22Da der Rechenaufwand nur linear wächst, bleibt der Speicherbedarf bei SSMs konstant.
00:05:27Warum ist das nun die richtige Architektur für OCR?
00:05:32Das hängt von den Kompromissen ab, besonders bei langen Dokumenten mit bis zu 5.000 bis 10.000 visuellen Tokens pro Seite.
00:05:43Die quadratische Komplexität bei Rechenaufwand und Speicher wird für die Inferenz sehr teuer.
00:05:51Andererseits lässt sich OCR auf Blockebene mit leicht verlustbehaftetem Recall mittels SSMs rechtfertigen,
00:06:00um hohe Rechenkosten zu vermeiden, die durch Transformer entstehen.
00:06:08Wie trainiert man das nun konkret?
00:06:10Wir haben ein gestuftes Curriculum entwickelt, vier Stufen.
00:06:13Jede baut auf der vorherigen auf: Stufe eins ist reines Text-Pretraining.
00:06:1913 Billionen Tokens in Englisch, indischen Sprachen, Mathematik und Code.
00:06:25Das bildet das Sprach-Backbone mit 3 Milliarden Parametern.
00:06:29Ein starkes Sprachverständnis ermöglicht es dem Modell, verwischten oder mehrdeutigen Text im Bild aufzulösen,
00:06:38genauso wie Sie ein halb verschwommenes Wort lesen können,
00:06:41weil Sie wissen, welches Wort an dieser Stelle stehen müsste.
00:06:46Wir haben uns also darauf konzentriert, zuerst die Kompetenz des Sprachmodells aufzubauen,
00:06:51bevor das Modell überhaupt einen einzigen Pixel sieht.
00:06:54In Stufe zwei führen wir ein kontinuierliches Pretraining mit 300 Millionen Bild-Text-Paaren durch.
00:07:01Das vermittelt dem Sprachmodell allgemeine visuelle Fähigkeiten
00:07:05und lehrt es zu sehen, Pixel zu interpretieren und so weiter.
00:07:08Dann folgt Stufe drei, in der wir ein Supervised Fine-Tuning mit 100 Millionen OCR-Daten durchführen.
00:07:15Stufe drei konzentriert sich primär darauf, ein allgemeines VLM stark in OCR zu machen.
00:07:26Dazu gehören vielfältige Daten in allen 22 Sprachen sowie Englisch
00:07:32und die Einbindung aller Arten von Dokumentenelementen wie Tabellen,
00:07:39Gleichungen, handgeschriebene Dokumente und so weiter.
00:07:44Stufe vier ist Bestärkendes Lernen (RL), das hilft, die Grenzen dessen zu überwinden, was mit Supervised Fine-Tuning erreichbar ist.
00:07:54Sie sehen, das ist ein Standardrezept.
00:07:57Der eigentliche Wettbewerbsvorteil liegt jedoch in den beiden darunter liegenden Schichten:
00:08:02der Datenschicht und der Evaluierungsschicht.
00:08:05Das erste ist die Data Engine.
00:08:08Für die meisten der 22 Sprachen gibt es keine fertigen gelabelten Daten.
00:08:13Wenn keine gelabelten Daten existieren, ist der Aufbau der Data Engine schwierig.
00:08:18Und das haben wir umfassend getan.
00:08:21Wir haben Pipelines aufgebaut, um synthetische Daten und Daten aus echten Dokumenten zu erzeugen,
00:08:26und eine Pipeline entwickelt, um die Trainingsdaten kontinuierlich zu verbessern,
00:08:35basierend auf der Evaluierungsleistung und Ähnlichem.
00:08:37Wir schauen uns derzeit aktiv das Paradigma der RLMs an,
00:08:42während wir agentische Vision-Fähigkeiten für unsere Modelle in den kommenden Releases erforschen.
00:08:48Der zweite Vorteil sind die Evaluierungen.
00:08:51Man kann keinen State-of-the-Art erreichen, wenn man nicht messen kann, wie gut das Modell abschneidet.
00:08:57Wir haben umfangreiche Evaluierungen zusammengestellt, um sicherzustellen, dass das, was wir messen, wirklich SOTA ist
00:09:03und auch einen echten Nutzen für die Endanwender bietet.
00:09:09Ich möchte mir kurz eine Minute Zeit nehmen, um auf unsere RL-Pipeline einzugehen.
00:09:15Stufe vier, denn ein Großteil des Gewinns stammt im Grunde aus dem RL.
00:09:20Bei OCR ist die Korrektheit ein maschinenlesbares Problem, richtig?
00:09:24Es lassen sich viele Tests einrichten, um die Modelle zu belohnen und zu bewerten,
00:09:30für diese erzeugten Stichproben.
00:09:34Und in der Welt der deterministischen OCR
00:09:37sind diese alle maschinell überprüfbar.
00:09:40Daher gibt uns RL einen erheblichen Schub.
00:09:44Gruppe abfragen,
00:09:45mit Unittests bewerten,
00:09:47den zu schlagenden Durchschnittswert verstärken
00:09:51und den Prozess dann wiederholen.
00:09:53Das macht RL-VR für OCR sehr, sehr skalierbar.
00:09:57Nach all dem Training von Grund auf,
00:10:01und dem Datenaufwand, den wir betrieben haben,
00:10:03konnten wir SOTA in zwei der globalen englischen Benchmarks etablieren.
00:10:08Der eine ist OCR Bench
00:10:10und der andere Omnidoc Bench.
00:10:12Beim Start lagen wir bei 84,3 bei OCR
00:10:15und bei 93,2 bei Omnidoc Bench.
00:10:18Die Modelle, die seitdem erschienen sind,
00:10:22haben die Messlatte ein gutes Stück verschoben,
00:10:24und wir werden bald ein noch stärkeres Modell
00:10:26in den globalen Bestenlisten haben.
00:10:29Zweitens, und noch wichtiger:
00:10:31In 22 indischen Sprachen
00:10:34haben wir einen ungeschlagenen Vorsprung,
00:10:36selbst im Vergleich zu allen Spitzenmodellen
00:10:38wie Gemini,
00:10:40ChatGPT,
00:10:41Opus
00:10:42und so weiter.
00:10:43Und hier haben wir den Vorsprung deutlich ausgebaut
00:10:46und bleiben stark
00:10:48im Vergleich zu all diesen neueren Modellen,
00:10:50die herausgekommen sind.
00:10:52Nun zu Sarvam Vision Parse,
00:10:54unserer agentischen Dokumenten-KI-Workbench
00:10:57namens Akshar,
00:10:59wo wir
00:11:01agentische Digitalisierungen mit Human-in-the-Loop,
00:11:04Extraktionen
00:11:06und anschließendes Erfassen
00:11:07für verschiedene nachgelagerte Dokumenten-KI-Probleme ermöglichen.
00:11:11Wir liefern Konfidenzwerte,
00:11:13bieten Verankerung auf Blockebene
00:11:16und die Möglichkeit für agentisches Korrekturlesen usw.
00:11:22Benchmarks und SOTA sind das eine,
00:11:26sie haben ihre Daseinsberechtigung.
00:11:27Heute nutzen einige der größten Unternehmen der Welt,
00:11:30von Versicherungen über Banken
00:11:32und Behörden
00:11:33bis hin zu Organisationen für historische Archivierung,
00:11:36Sarvam Vision,
00:11:38um mehr als 35 Millionen Seiten
00:11:40auf Englisch
00:11:41und in 22 indischen Sprachen zu digitalisieren.
00:11:44Das Modell ist als API verfügbar,
00:11:48On-Premise
00:11:49und als agentische Plattform.
00:11:51Zusammenfassend lässt sich sagen:
00:11:54Bis vor vier Monaten
00:11:56gab es kein souveränes Modell aus Indien.
00:11:59Heute haben wir Sarvam Vision,
00:12:02das von Grund auf trainiert wurde
00:12:03und SOTA etabliert hat,
00:12:06zu einem Preis,
00:12:07der extrem wettbewerbsfähig ist
00:12:09im Vergleich zu allen anderen Lösungen,
00:12:11einschließlich Open- und Closed-Source.
00:12:14Zunächst haben wir damit begonnen, einige
00:12:16der schwierigsten Probleme
00:12:18für indischsprachige Dokumenten-KI zu lösen.
00:12:20In Kürze werden wir
00:12:22Mehrzweck-VLMs veröffentlichen,
00:12:24die zu weitaus mehr
00:12:26Visuell-Fähigkeiten in der Lage sind,
00:12:28Und freuen uns darauf,
00:12:30dass Sie alle unsere Modelle ausprobieren.
00:12:32Vielen Dank.
00:12:33Ich beantworte gerne Ihre Fragen.
00:12:35Ich beantworte gerne Ihre Fragen.
00:12:37Ich beantworte gerne Ihre Fragen.
00:12:38Ich beantworte gerne Ihre Fragen.
00:12:39Ich beantworte gerne Ihre Fragen.
00:12:39Ich beantworte gerne Ihre Fragen.
00:12:40Ja.
00:12:40Ich beantworte gerne Ihre Fragen.
00:12:41Ich beantworte gerne Ihre Fragen.
00:12:42Ja.
00:12:43Ich beantworte gerne Ihre Fragen.
00:12:44Ja.
00:12:45Ich beantworte gerne Ihre Fragen.
00:12:46Ja.
00:12:47Ja.
00:12:48Ja, absolut.
00:12:49Im Allgemeinen
00:12:50verbessert die Sprachkompetenz
00:12:51in den 22 Sprachen
00:12:53die englische Sprache
00:12:54ganz erheblich.
00:12:56Und das gilt
00:12:58für jede ressourcenarme Sprache,
00:12:59nicht nur für indische ressourcenarme Sprachen.
00:13:02Richtig.
00:13:27Wir gehen nicht wirklich in diese Richtung
00:13:29mit diesem Modell,
00:13:30da dies ein vision-fokussiertes Modell ist,
00:13:33bei dem wir uns darauf konzentrieren,
00:13:34Informationen
00:13:35oder Wissen aus Dokumenten zu extrahieren.
00:13:37Aber ja,
00:13:38es könnte
00:13:39einige Parallelen geben,
00:13:40um Modellen dabei zu helfen,
00:13:42allgemeine Sprachen zu nutzen,
00:13:44um auch das Programmieren
00:13:45zu beschleunigen.
00:13:46Aber ja,
00:13:47das gehört nicht zum
00:13:48Kern dieser Arbeit.
00:13:50Ja.
00:13:53Richtig.
00:13:54Es gibt also zwei Dinge.
00:14:11Wir erstellen künstliche Dokumente,
00:14:14synthetische Dokumente,
00:14:15wie sie genannt werden,
00:14:16für allgemeines Post-Training.
00:14:18Das beinhaltet
00:14:19SFT
00:14:20und RL.
00:14:21Jedoch,
00:14:22um auf Ihre spezifische Frage einzugehen,
00:14:23bezüglich RL,
00:14:24wir nicht...
00:14:25wir nicht...
00:14:26Sie können synthetische
00:14:27Dokumente
00:14:28auch dort generieren.
00:14:29Das Beste
00:14:30ist jedoch,
00:14:31echte Dokumente zu nehmen,
00:14:32die komplex genug sind,
00:14:33dass...
00:14:34dass sie Ihnen helfen, Unittests
00:14:35einzurichten
00:14:36oder verschiedene Arten
00:14:37von Belohnungen.
00:14:39Richtig.
00:14:40Nehmen wir an,
00:14:41eine Belohnung basierend auf
00:14:42der Zeichenrate
00:14:43oder eine Belohnung basierend auf
00:14:44der Tabellenstruktur
00:14:45oder einer mathematischen Gleichung
00:14:47oder etwas,
00:14:48das für eine Sprache relevant ist,
00:14:49oder Grammatikbelohnungen
00:14:50und so weiter.
00:14:51Und dann dem Modell
00:14:52helfen,
00:14:53sich iterativ
00:14:54zu verbessern,
00:14:55basierend auf
00:14:56Rollouts,
00:14:57die das Modell
00:14:58unter verschiedenen
00:14:58Einstellungen
00:14:59erzeugen kann.
00:15:00Ja.
00:15:01Ja.
00:15:20Haben Sie gesagt,
00:15:21Sie sind ein großer Fan von Chandra?
00:15:22Ja.
00:15:23Alles klar.
00:15:24Das stammt aus einem anderen Labor.
00:15:25Ich bin auch ein großer Fan
00:15:26des Labors,
00:15:27das Chandra entwickelt hat.
00:15:28Aber ja,
00:15:29zu Ihrer Frage
00:15:30zum Indic Benchmark:
00:15:31Ja,
00:15:32wir werden
00:15:33den Sarvam Indic Benchmark veröffentlichen,
00:15:34den wir
00:15:36für 22 Sprachen erstellt haben.
00:15:37Und er
00:15:38erstreckt sich
00:15:39über einen großen Zeitraum,
00:15:42beginnend in den 1800er Jahren
00:15:43bis heute.
00:15:44Und auch
00:15:45verschiedene Arten von Layouts,
00:15:46verschiedene Arten von
00:15:47Dokumenten
00:15:48in indischen Sprachen.
00:15:49Sie können sich
00:15:49Dokumente
00:15:50mit Prosa,
00:15:51Poesie,
00:15:52Literatur,
00:15:53Tabellen,
00:15:53Finanzen
00:15:54und all diesen Dingen vorstellen.
00:15:54Wir werden diesen Benchmark
00:15:55bald veröffentlichen,
00:15:56und zwar öffentlich
00:15:57ebenfalls.
00:15:57Auch öffentlich
00:15:59zugänglich.
00:16:00Also,
00:16:02Übersetzung ist hier wiederum...
00:16:02Transliteration ist hier wiederum
00:16:03nicht direkt beteiligt,
00:16:03denn bei OCR geht es uns um eine hochpräzise
00:16:05Extraktion.
00:16:07Richtig.
00:16:08Man möchte,
00:16:09man möchte,
00:16:09selbst wenn ein Fehler im Bild ist,
00:16:10dass dieser Fehler im Bild
00:16:11korrekt extrahiert wird und das Modell nicht
00:16:15nach Belieben Änderungen vornimmt.
00:16:18Daher ist das nicht direkt anwendbar,
00:16:19daher ist das nicht direkt anwendbar, aber ja, wir sehen viele Daten,
00:16:23viele Daten, die durch Transliteration jetzt selbst fürs OCR-Training
00:16:25reinkommen.
00:16:26Und es ist noch unklar, was man jetzt tun wird, und es ist noch unklar, was man tun wird.
00:16:28Möchte man das tun?
00:16:29Also,
00:16:29Transliteration ist hier wiederum nicht direkt beteiligt, denn bei OCR geht es uns um hochpräzise
00:16:33Extraktion.
00:16:35Richtig.
00:16:36Selbst wenn ein Fehler im Bild ist, möchte man, dass dieser Fehler korrekt extrahiert wird und nicht das
00:16:40Modell nach Belieben Änderungen vornimmt.
00:16:43Daher ist das nicht direkt anwendbar, aber ja, wir sehen viele Daten, die durch
00:16:49Transliteration jetzt sogar für das OCR-Training kommen, und es ist noch unklar, wie gut die Qualität dieser Daten ist und wie nützlich sie sind usw.
00:16:58Ja.
00:17:00Ja.
00:17:01Ja.
00:17:26Richtig.
00:17:27Es gibt ein paar Dinge zu bedenken.
00:17:29Erstens: Kein anderes Modell, ob führendes, proprietäres oder Open-Source-Modell, kommt gut mit komplexen indischen Sprachdokumenten zurecht.
00:17:39Richtig.
00:17:40Für ein Land mit 1,4 Milliarden Menschen möchte man also in der Lage sein, deren Alltag bei Problemen mit der Dokumentenverarbeitung zu unterstützen.
00:17:52Denn in Indien gibt es sehr viel Papierkram, richtig?
00:17:55Es ist ein aufstrebendes Land, das gerade erst digitalisiert wird, und es ist wichtig, dass überhaupt die Möglichkeiten zur Digitalisierung des Landes vorhanden sind.
00:18:05Zweitens haben wir auf der Trainingsseite speziell Daten erstellt, die für viele nachgelagerte Trainingsläufe hinzugefügt werden können.
00:18:18Wir stehen noch am Anfang, was KI als festen Bestandteil unseres Lebens angeht, und wir brauchen die Daten, um schließlich an einen Punkt zu gelangen, an dem wir...
00:18:31personalisierte Agenten in der Sprache haben können, die Sie bevorzugen, die ich bevorzuge, und wie auch immer man möchte.
00:18:38Um das alles zu tun, müssen wir irgendwo anfangen, und die Daten müssen erstellt werden. Wenn die Daten von guter Qualität sind, hilft das dem Modell, SOTA zu werden.
00:18:47Und wenn ein Modell SOTA ist, dann gilt das für Versicherungen, Regierungsbehörden und andere, denen Souveränität bei KI wichtig ist, richtig?
00:18:58Als Regierungsbehörde kann ich kein Modell woanders bereitstellen lassen, ohne zu wissen, wohin die Daten für die Transkriptionen fließen.
00:19:06Ich muss also kontrollieren können, wohin die Daten gesendet werden, wann sie verwendet werden, wie viel verwendet wird usw.
00:19:13Souveränität wird also extrem wichtig, und deshalb ist dieses Modell jetzt wirklich...
00:19:17Es ist erst vier Monate her, seit wir gestartet sind, und wir digitalisieren bereits 35 Millionen Seiten.
00:19:23Das zeigt, dass der Markt auf etwas Souveränes in diesem Bereich gewartet hat, das die KI-Digitalisierungswelle in Indien wirklich anstoßen kann.
00:19:32Hauptsächlich gibt es also drei Aspekte: einerseits die Souveränität, andererseits die Leistungsfähigkeit des Modells selbst und drittens die Daten, die zum Trainieren dieser Modelle erforderlich sind.
00:19:42Ja, es besteht zu 40 % aus indischen Sprachen und der Rest ist Englisch, bestehend aus Mathematik, Code usw.
00:20:03Alles klar.
00:20:07Alles klar.
00:20:08Ja.
00:20:09Eine ernsthafte Frage:
00:20:24Derzeit befinden sich die Bereitstellungen, die wir mit diesem Modell gemacht haben, in verschiedenen Phasen,
00:20:31in denen versucht wird, regionale Sprachen zusammen mit all den englischen und gemischtsprachigen Dokumenten zu digitalisieren.
00:20:39Daher werden wir bald mit dem Feedback trainieren können, das wir aus der aktuellen Bereitstellung erhalten.
00:20:48Ja, diese Pipeline haben wir ebenfalls gestartet.
00:20:50Und diese Pipeline haben wir ebenfalls gestartet.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video