Von Grund auf neu bis SOTA: Training eines 3B State-Space-Vision-Modells — Krishna Prasad Srinivasan, Sarvam

AAI Engineer
Computing/SoftwareSmall Business/StartupsLanguages

Transcript

00:00:00Hallo zusammen, guten Tag, ich bin Krishna, General Manager bei Sarvam. Heute werde ich
00:00:24Ihnen erzählen, wie ein Modell mit 3 Milliarden Parametern, das klein genug für eine einzelne GPU ist,
00:00:32State-of-the-Art in Dokumenten-KI erreicht und hundertmal größere Modelle schlägt. Es ist auch ein etwas
00:00:42ungewöhnliches Modell in zweierlei Hinsicht: Erstens ist das Sprachmodell kein Standard-Transformer, und
00:00:49die gesamte Modellentwicklung, von den Daten über das Training bis zur Rechenleistung, erfolgte Ende-zu-Ende in Indien.
00:00:58Und das für Englisch sowie für 22 offizielle indische Sprachen, was meiner Meinung nach derzeit eine der schwierigsten Aufgaben
00:01:06im Bereich der Dokumenten-KI weltweit ist. So sind wir von Grund auf zu SOTA gelangt. Wer sind wir? Wir sind
00:01:15Sarvam, ein Unternehmen für souveräne Basismodelle in Indien. Wir arbeiten modalitätsübergreifend: Sprach-, Text- und
00:01:23Vision-Modelle. Bei Sprache haben wir Speech-to-Text- und Text-to-Speech-Modelle, bei Text haben wir Modelle mit 30 und 100
00:01:32Milliarden Parametern, und bei Vision ein Dokumenten-KI-Modell, über das wir
00:01:38heute sprechen werden. Indien fehlt weitgehend in der maschinenlesbaren Welt. Laut einer veröffentlichten
00:01:48Sprachverteilungsstudie sind indische Sprachen mit deutlich unter einem Prozent im Common-Crawl-Korpus vertreten, mit dem Spitzenmodelle
00:01:55trainiert werden. In verschiedenen Foren haben Sie vielleicht gehört, wie führende KI-Labors sagen,
00:02:04dass Indien vertreten sei. Indien ist einer ihrer größeren und schnell wachsenden Märkte, aber hinsichtlich der Daten fehlt Indien in den
00:02:16Spitzenmodellen, die heute trainiert werden, immer noch. Warum ist das so? Hauptsächlich nicht, weil es an Daten mangelt oder das Wissen nicht existiert, sondern weil die Daten nie digitalisiert wurden,
00:02:31und genau dieses Problem lösen wir bei Sarvam. Warum ist indische Dokumenten-KI so schwer?
00:02:38Erstens ist das Ziel die Extraktion von Wissen, nicht nur reine Textextraktion. Reinen Text ohne
00:02:49logischen Zusammenhang zu extrahieren, ist wertlos. Zweitens unterscheiden sich in indischen Schriften die Form der Wörter und die Sprache, die Sie sehen, stark von dem,
00:03:01was eine Maschine sieht. Indische Sprachen nutzen komplexe Unicodes, die zusammengesetzt werden. Um das korrekt hinzubekommen, muss das Sprachmodell in allen 22 Sprachen stark sein.
00:03:13Drittens gilt die Mehrheit der indischen Sprachen als ressourcenarm, weshalb es heute an Daten mangelt, um diese Modelle zu trainieren.
00:03:23Unsere Antwort darauf ist Sarvam Vision: Indiens erstes souveränes Vision-Language-Modell, von Grund auf neu entwickelt. Ein 3-Milliarden-Parameter-Modell mit State-Space-Architektur, Daten, Rechenleistung und Training komplett aus Indien.
00:03:40Als wir Ende 2025 mit der Arbeit begannen, waren die meisten VLMs im OCR-Bereich monolithische VLMs. Sie führten OCR auf Seitenebene durch, und wir sind damals das Wagnis eingegangen, uns stattdessen auf OCR auf Blockebene zu konzentrieren, ergänzt durch ein Dokumenten-Harness um das Modell.
00:04:02Viele Modelle, die seitdem Anfang 2026 veröffentlicht wurden, sind auf dieselbe Kombination aus Harness und kleinem Modell für OCR umgestiegen, was den Wert unseres gewählten Weges bestätigt.
00:04:17Sarvam Vision verfügt insbesondere über zwei Harness-Module – eines für das Layout und eines für das Lesen – sowie ein State-Space-VLM für OCR auf Blockebene.
00:04:29Warum nutzen wir heute State-Space und keinen Transformer?
00:04:36Die meisten heutigen OCR-Modelle wie allgemeine, quelloffene VLMs (z. B. Qwen, Gemma usw.) basieren auf Transformern.
00:04:45Wir haben einen alternativen Ansatz mit einem SSM gewählt. Warum?
00:04:50Beides sind grundlegend Sequenzmodelle, Transformer wie SSMs, aber mit sehr unterschiedlicher Mechanik.
00:04:57Bei einem Transformer bezieht sich jeder Token auf jeden anderen Token, wodurch der Rechenaufwand quadratisch mit der Sequenzlänge wächst.
00:05:06Das sind die L-mal-L-Interaktionen.
00:05:10Und der Speicherbedarf wächst ebenfalls mit der Sequenz.
00:05:13Auf der anderen Seite haben SSMs einen einzigen Zustand.
00:05:17Sie behalten durch die Sequenz hinweg einen einzigen Zustand bei und aktualisieren ihn Token für Token.
00:05:22Da der Rechenaufwand nur linear wächst, bleibt der Speicherbedarf bei SSMs konstant.
00:05:27Warum ist das nun die richtige Architektur für OCR?
00:05:32Das hängt von den Kompromissen ab, besonders bei langen Dokumenten mit bis zu 5.000 bis 10.000 visuellen Tokens pro Seite.
00:05:43Die quadratische Komplexität bei Rechenaufwand und Speicher wird für die Inferenz sehr teuer.
00:05:51Andererseits lässt sich OCR auf Blockebene mit leicht verlustbehaftetem Recall mittels SSMs rechtfertigen,
00:06:00um hohe Rechenkosten zu vermeiden, die durch Transformer entstehen.
00:06:08Wie trainiert man das nun konkret?
00:06:10Wir haben ein gestuftes Curriculum entwickelt, vier Stufen.
00:06:13Jede baut auf der vorherigen auf: Stufe eins ist reines Text-Pretraining.
00:06:1913 Billionen Tokens in Englisch, indischen Sprachen, Mathematik und Code.
00:06:25Das bildet das Sprach-Backbone mit 3 Milliarden Parametern.
00:06:29Ein starkes Sprachverständnis ermöglicht es dem Modell, verwischten oder mehrdeutigen Text im Bild aufzulösen,
00:06:38genauso wie Sie ein halb verschwommenes Wort lesen können,
00:06:41weil Sie wissen, welches Wort an dieser Stelle stehen müsste.
00:06:46Wir haben uns also darauf konzentriert, zuerst die Kompetenz des Sprachmodells aufzubauen,
00:06:51bevor das Modell überhaupt einen einzigen Pixel sieht.
00:06:54In Stufe zwei führen wir ein kontinuierliches Pretraining mit 300 Millionen Bild-Text-Paaren durch.
00:07:01Das vermittelt dem Sprachmodell allgemeine visuelle Fähigkeiten
00:07:05und lehrt es zu sehen, Pixel zu interpretieren und so weiter.
00:07:08Dann folgt Stufe drei, in der wir ein Supervised Fine-Tuning mit 100 Millionen OCR-Daten durchführen.
00:07:15Stufe drei konzentriert sich primär darauf, ein allgemeines VLM stark in OCR zu machen.
00:07:26Dazu gehören vielfältige Daten in allen 22 Sprachen sowie Englisch
00:07:32und die Einbindung aller Arten von Dokumentenelementen wie Tabellen,
00:07:39Gleichungen, handgeschriebene Dokumente und so weiter.
00:07:44Stufe vier ist Bestärkendes Lernen (RL), das hilft, die Grenzen dessen zu überwinden, was mit Supervised Fine-Tuning erreichbar ist.
00:07:54Sie sehen, das ist ein Standardrezept.
00:07:57Der eigentliche Wettbewerbsvorteil liegt jedoch in den beiden darunter liegenden Schichten:
00:08:02der Datenschicht und der Evaluierungsschicht.
00:08:05Das erste ist die Data Engine.
00:08:08Für die meisten der 22 Sprachen gibt es keine fertigen gelabelten Daten.
00:08:13Wenn keine gelabelten Daten existieren, ist der Aufbau der Data Engine schwierig.
00:08:18Und das haben wir umfassend getan.
00:08:21Wir haben Pipelines aufgebaut, um synthetische Daten und Daten aus echten Dokumenten zu erzeugen,
00:08:26und eine Pipeline entwickelt, um die Trainingsdaten kontinuierlich zu verbessern,
00:08:35basierend auf der Evaluierungsleistung und Ähnlichem.
00:08:37Wir schauen uns derzeit aktiv das Paradigma der RLMs an,
00:08:42während wir agentische Vision-Fähigkeiten für unsere Modelle in den kommenden Releases erforschen.
00:08:48Der zweite Vorteil sind die Evaluierungen.
00:08:51Man kann keinen State-of-the-Art erreichen, wenn man nicht messen kann, wie gut das Modell abschneidet.
00:08:57Wir haben umfangreiche Evaluierungen zusammengestellt, um sicherzustellen, dass das, was wir messen, wirklich SOTA ist
00:09:03und auch einen echten Nutzen für die Endanwender bietet.
00:09:09Ich möchte mir kurz eine Minute Zeit nehmen, um auf unsere RL-Pipeline einzugehen.
00:09:15Stufe vier, denn ein Großteil des Gewinns stammt im Grunde aus dem RL.
00:09:20Bei OCR ist die Korrektheit ein maschinenlesbares Problem, richtig?
00:09:24Es lassen sich viele Tests einrichten, um die Modelle zu belohnen und zu bewerten,
00:09:30für diese erzeugten Stichproben.
00:09:34Und in der Welt der deterministischen OCR
00:09:37sind diese alle maschinell überprüfbar.
00:09:40Daher gibt uns RL einen erheblichen Schub.
00:09:44Gruppe abfragen,
00:09:45mit Unittests bewerten,
00:09:47den zu schlagenden Durchschnittswert verstärken
00:09:51und den Prozess dann wiederholen.
00:09:53Das macht RL-VR für OCR sehr, sehr skalierbar.
00:09:57Nach all dem Training von Grund auf,
00:10:01und dem Datenaufwand, den wir betrieben haben,
00:10:03konnten wir SOTA in zwei der globalen englischen Benchmarks etablieren.
00:10:08Der eine ist OCR Bench
00:10:10und der andere Omnidoc Bench.
00:10:12Beim Start lagen wir bei 84,3 bei OCR
00:10:15und bei 93,2 bei Omnidoc Bench.
00:10:18Die Modelle, die seitdem erschienen sind,
00:10:22haben die Messlatte ein gutes Stück verschoben,
00:10:24und wir werden bald ein noch stärkeres Modell
00:10:26in den globalen Bestenlisten haben.
00:10:29Zweitens, und noch wichtiger:
00:10:31In 22 indischen Sprachen
00:10:34haben wir einen ungeschlagenen Vorsprung,
00:10:36selbst im Vergleich zu allen Spitzenmodellen
00:10:38wie Gemini,
00:10:40ChatGPT,
00:10:41Opus
00:10:42und so weiter.
00:10:43Und hier haben wir den Vorsprung deutlich ausgebaut
00:10:46und bleiben stark
00:10:48im Vergleich zu all diesen neueren Modellen,
00:10:50die herausgekommen sind.
00:10:52Nun zu Sarvam Vision Parse,
00:10:54unserer agentischen Dokumenten-KI-Workbench
00:10:57namens Akshar,
00:10:59wo wir
00:11:01agentische Digitalisierungen mit Human-in-the-Loop,
00:11:04Extraktionen
00:11:06und anschließendes Erfassen
00:11:07für verschiedene nachgelagerte Dokumenten-KI-Probleme ermöglichen.
00:11:11Wir liefern Konfidenzwerte,
00:11:13bieten Verankerung auf Blockebene
00:11:16und die Möglichkeit für agentisches Korrekturlesen usw.
00:11:22Benchmarks und SOTA sind das eine,
00:11:26sie haben ihre Daseinsberechtigung.
00:11:27Heute nutzen einige der größten Unternehmen der Welt,
00:11:30von Versicherungen über Banken
00:11:32und Behörden
00:11:33bis hin zu Organisationen für historische Archivierung,
00:11:36Sarvam Vision,
00:11:38um mehr als 35 Millionen Seiten
00:11:40auf Englisch
00:11:41und in 22 indischen Sprachen zu digitalisieren.
00:11:44Das Modell ist als API verfügbar,
00:11:48On-Premise
00:11:49und als agentische Plattform.
00:11:51Zusammenfassend lässt sich sagen:
00:11:54Bis vor vier Monaten
00:11:56gab es kein souveränes Modell aus Indien.
00:11:59Heute haben wir Sarvam Vision,
00:12:02das von Grund auf trainiert wurde
00:12:03und SOTA etabliert hat,
00:12:06zu einem Preis,
00:12:07der extrem wettbewerbsfähig ist
00:12:09im Vergleich zu allen anderen Lösungen,
00:12:11einschließlich Open- und Closed-Source.
00:12:14Zunächst haben wir damit begonnen, einige
00:12:16der schwierigsten Probleme
00:12:18für indischsprachige Dokumenten-KI zu lösen.
00:12:20In Kürze werden wir
00:12:22Mehrzweck-VLMs veröffentlichen,
00:12:24die zu weitaus mehr
00:12:26Visuell-Fähigkeiten in der Lage sind,
00:12:28Und freuen uns darauf,
00:12:30dass Sie alle unsere Modelle ausprobieren.
00:12:32Vielen Dank.
00:12:33Ich beantworte gerne Ihre Fragen.
00:12:35Ich beantworte gerne Ihre Fragen.
00:12:37Ich beantworte gerne Ihre Fragen.
00:12:38Ich beantworte gerne Ihre Fragen.
00:12:39Ich beantworte gerne Ihre Fragen.
00:12:39Ich beantworte gerne Ihre Fragen.
00:12:40Ja.
00:12:40Ich beantworte gerne Ihre Fragen.
00:12:41Ich beantworte gerne Ihre Fragen.
00:12:42Ja.
00:12:43Ich beantworte gerne Ihre Fragen.
00:12:44Ja.
00:12:45Ich beantworte gerne Ihre Fragen.
00:12:46Ja.
00:12:47Ja.
00:12:48Ja, absolut.
00:12:49Im Allgemeinen
00:12:50verbessert die Sprachkompetenz
00:12:51in den 22 Sprachen
00:12:53die englische Sprache
00:12:54ganz erheblich.
00:12:56Und das gilt
00:12:58für jede ressourcenarme Sprache,
00:12:59nicht nur für indische ressourcenarme Sprachen.
00:13:02Richtig.
00:13:27Wir gehen nicht wirklich in diese Richtung
00:13:29mit diesem Modell,
00:13:30da dies ein vision-fokussiertes Modell ist,
00:13:33bei dem wir uns darauf konzentrieren,
00:13:34Informationen
00:13:35oder Wissen aus Dokumenten zu extrahieren.
00:13:37Aber ja,
00:13:38es könnte
00:13:39einige Parallelen geben,
00:13:40um Modellen dabei zu helfen,
00:13:42allgemeine Sprachen zu nutzen,
00:13:44um auch das Programmieren
00:13:45zu beschleunigen.
00:13:46Aber ja,
00:13:47das gehört nicht zum
00:13:48Kern dieser Arbeit.
00:13:50Ja.
00:13:53Richtig.
00:13:54Es gibt also zwei Dinge.
00:14:11Wir erstellen künstliche Dokumente,
00:14:14synthetische Dokumente,
00:14:15wie sie genannt werden,
00:14:16für allgemeines Post-Training.
00:14:18Das beinhaltet
00:14:19SFT
00:14:20und RL.
00:14:21Jedoch,
00:14:22um auf Ihre spezifische Frage einzugehen,
00:14:23bezüglich RL,
00:14:24wir nicht...
00:14:25wir nicht...
00:14:26Sie können synthetische
00:14:27Dokumente
00:14:28auch dort generieren.
00:14:29Das Beste
00:14:30ist jedoch,
00:14:31echte Dokumente zu nehmen,
00:14:32die komplex genug sind,
00:14:33dass...
00:14:34dass sie Ihnen helfen, Unittests
00:14:35einzurichten
00:14:36oder verschiedene Arten
00:14:37von Belohnungen.
00:14:39Richtig.
00:14:40Nehmen wir an,
00:14:41eine Belohnung basierend auf
00:14:42der Zeichenrate
00:14:43oder eine Belohnung basierend auf
00:14:44der Tabellenstruktur
00:14:45oder einer mathematischen Gleichung
00:14:47oder etwas,
00:14:48das für eine Sprache relevant ist,
00:14:49oder Grammatikbelohnungen
00:14:50und so weiter.
00:14:51Und dann dem Modell
00:14:52helfen,
00:14:53sich iterativ
00:14:54zu verbessern,
00:14:55basierend auf
00:14:56Rollouts,
00:14:57die das Modell
00:14:58unter verschiedenen
00:14:58Einstellungen
00:14:59erzeugen kann.
00:15:00Ja.
00:15:01Ja.
00:15:20Haben Sie gesagt,
00:15:21Sie sind ein großer Fan von Chandra?
00:15:22Ja.
00:15:23Alles klar.
00:15:24Das stammt aus einem anderen Labor.
00:15:25Ich bin auch ein großer Fan
00:15:26des Labors,
00:15:27das Chandra entwickelt hat.
00:15:28Aber ja,
00:15:29zu Ihrer Frage
00:15:30zum Indic Benchmark:
00:15:31Ja,
00:15:32wir werden
00:15:33den Sarvam Indic Benchmark veröffentlichen,
00:15:34den wir
00:15:36für 22 Sprachen erstellt haben.
00:15:37Und er
00:15:38erstreckt sich
00:15:39über einen großen Zeitraum,
00:15:42beginnend in den 1800er Jahren
00:15:43bis heute.
00:15:44Und auch
00:15:45verschiedene Arten von Layouts,
00:15:46verschiedene Arten von
00:15:47Dokumenten
00:15:48in indischen Sprachen.
00:15:49Sie können sich
00:15:49Dokumente
00:15:50mit Prosa,
00:15:51Poesie,
00:15:52Literatur,
00:15:53Tabellen,
00:15:53Finanzen
00:15:54und all diesen Dingen vorstellen.
00:15:54Wir werden diesen Benchmark
00:15:55bald veröffentlichen,
00:15:56und zwar öffentlich
00:15:57ebenfalls.
00:15:57Auch öffentlich
00:15:59zugänglich.
00:16:00Also,
00:16:02Übersetzung ist hier wiederum...
00:16:02Transliteration ist hier wiederum
00:16:03nicht direkt beteiligt,
00:16:03denn bei OCR geht es uns um eine hochpräzise
00:16:05Extraktion.
00:16:07Richtig.
00:16:08Man möchte,
00:16:09man möchte,
00:16:09selbst wenn ein Fehler im Bild ist,
00:16:10dass dieser Fehler im Bild
00:16:11korrekt extrahiert wird und das Modell nicht
00:16:15nach Belieben Änderungen vornimmt.
00:16:18Daher ist das nicht direkt anwendbar,
00:16:19daher ist das nicht direkt anwendbar, aber ja, wir sehen viele Daten,
00:16:23viele Daten, die durch Transliteration jetzt selbst fürs OCR-Training
00:16:25reinkommen.
00:16:26Und es ist noch unklar, was man jetzt tun wird, und es ist noch unklar, was man tun wird.
00:16:28Möchte man das tun?
00:16:29Also,
00:16:29Transliteration ist hier wiederum nicht direkt beteiligt, denn bei OCR geht es uns um hochpräzise
00:16:33Extraktion.
00:16:35Richtig.
00:16:36Selbst wenn ein Fehler im Bild ist, möchte man, dass dieser Fehler korrekt extrahiert wird und nicht das
00:16:40Modell nach Belieben Änderungen vornimmt.
00:16:43Daher ist das nicht direkt anwendbar, aber ja, wir sehen viele Daten, die durch
00:16:49Transliteration jetzt sogar für das OCR-Training kommen, und es ist noch unklar, wie gut die Qualität dieser Daten ist und wie nützlich sie sind usw.
00:16:58Ja.
00:17:00Ja.
00:17:01Ja.
00:17:26Richtig.
00:17:27Es gibt ein paar Dinge zu bedenken.
00:17:29Erstens: Kein anderes Modell, ob führendes, proprietäres oder Open-Source-Modell, kommt gut mit komplexen indischen Sprachdokumenten zurecht.
00:17:39Richtig.
00:17:40Für ein Land mit 1,4 Milliarden Menschen möchte man also in der Lage sein, deren Alltag bei Problemen mit der Dokumentenverarbeitung zu unterstützen.
00:17:52Denn in Indien gibt es sehr viel Papierkram, richtig?
00:17:55Es ist ein aufstrebendes Land, das gerade erst digitalisiert wird, und es ist wichtig, dass überhaupt die Möglichkeiten zur Digitalisierung des Landes vorhanden sind.
00:18:05Zweitens haben wir auf der Trainingsseite speziell Daten erstellt, die für viele nachgelagerte Trainingsläufe hinzugefügt werden können.
00:18:18Wir stehen noch am Anfang, was KI als festen Bestandteil unseres Lebens angeht, und wir brauchen die Daten, um schließlich an einen Punkt zu gelangen, an dem wir...
00:18:31personalisierte Agenten in der Sprache haben können, die Sie bevorzugen, die ich bevorzuge, und wie auch immer man möchte.
00:18:38Um das alles zu tun, müssen wir irgendwo anfangen, und die Daten müssen erstellt werden. Wenn die Daten von guter Qualität sind, hilft das dem Modell, SOTA zu werden.
00:18:47Und wenn ein Modell SOTA ist, dann gilt das für Versicherungen, Regierungsbehörden und andere, denen Souveränität bei KI wichtig ist, richtig?
00:18:58Als Regierungsbehörde kann ich kein Modell woanders bereitstellen lassen, ohne zu wissen, wohin die Daten für die Transkriptionen fließen.
00:19:06Ich muss also kontrollieren können, wohin die Daten gesendet werden, wann sie verwendet werden, wie viel verwendet wird usw.
00:19:13Souveränität wird also extrem wichtig, und deshalb ist dieses Modell jetzt wirklich...
00:19:17Es ist erst vier Monate her, seit wir gestartet sind, und wir digitalisieren bereits 35 Millionen Seiten.
00:19:23Das zeigt, dass der Markt auf etwas Souveränes in diesem Bereich gewartet hat, das die KI-Digitalisierungswelle in Indien wirklich anstoßen kann.
00:19:32Hauptsächlich gibt es also drei Aspekte: einerseits die Souveränität, andererseits die Leistungsfähigkeit des Modells selbst und drittens die Daten, die zum Trainieren dieser Modelle erforderlich sind.
00:19:42Ja, es besteht zu 40 % aus indischen Sprachen und der Rest ist Englisch, bestehend aus Mathematik, Code usw.
00:20:03Alles klar.
00:20:07Alles klar.
00:20:08Ja.
00:20:09Eine ernsthafte Frage:
00:20:24Derzeit befinden sich die Bereitstellungen, die wir mit diesem Modell gemacht haben, in verschiedenen Phasen,
00:20:31in denen versucht wird, regionale Sprachen zusammen mit all den englischen und gemischtsprachigen Dokumenten zu digitalisieren.
00:20:39Daher werden wir bald mit dem Feedback trainieren können, das wir aus der aktuellen Bereitstellung erhalten.
00:20:48Ja, diese Pipeline haben wir ebenfalls gestartet.
00:20:50Und diese Pipeline haben wir ebenfalls gestartet.

Key Takeaway

Das indische 3B-Parameter-Vision-Modell Sarvam Vision erreicht durch eine effiziente State-Space-Architektur und ein vierstufiges Curriculum den State-of-the-Art-Status bei der Dokumenten-KI für 22 ressourcenarme indische Sprachen.

Highlights

  • Ein KI-Modell mit 3 Milliarden Parametern schlägt bei der Verarbeitung von Dokumenten in 22 indischen Sprachen deutlich größere Sprachmodelle wie Gemini, ChatGPT und Opus.

  • Das Modell nutzt eine State-Space-Architektur (SSM) anstelle von Standard-Transformern, was für einen konstanten Speicherbedarf und linearen Rechenaufwand bei langen Dokumenten sorgt.

  • In indischen Sprachen liegt der Anteil maschinenlesbarer Daten im weltweiten Common-Crawl-Korpus bei unter einem Prozent.

  • Das Training basiert auf einem vierstufigen Curriculum: 13 Billionen Sprach-Tokens, 300 Millionen Bild-Text-Paare, 100 Millionen OCR-Datensätze und anschließendes Bestärkendes Lernen (RL).

  • Mehr als 35 Millionen Seiten in Englisch und 22 indischen Sprachen wurden mit dem System bereits für Banken, Versicherungen und Behörden digitalisiert.

Timeline

Herausforderungen der indischen Dokumenten-KI

  • Indische Sprachen machen deutlich unter einem Prozent des globalen Common-Crawl-Korpus aus.
  • Komplexe Unicode-Kombinationen in indischen Schriften erfordern ein starkes Sprachmodell für die korrekte Textextraktion.
  • Ein Hybrid-Ansatz aus OCR auf Blockebene und spezialisierten Harness-Modulen ersetzt riesige monolithische Seitenebenen-Modelle.

Indien fehlt weitgehend im maschinenlesbaren Datennetz, da historische und administrative Dokumente nie systematisch digitalisiert wurden. Reine Textextraktion ohne Kontext ist wirkungslos, weshalb das Ziel in der Extraktion von Wissen liegt. Zur Bewältigung dieser Aufgabe kombiniert Sarvam Vision zwei Harness-Module für Layout und Lesen mit einem kompakten Modell für die punktfreie OCR-Verarbeitung auf Blockebene.

Vorteile der State-Space-Architektur bei langen Dokumenten

  • Transformer erzeugen bei Sequenzlängen von 5.000 bis 10.000 visuellen Tokens pro Seite einen quadratischen Rechenaufwand.
  • State-Space-Modelle halten durchgehend einen einzigen Zustand aufrecht und skalieren den Rechenaufwand rein linear bei konstantem Speicherbedarf.
  • Das minimale Zugeständnis bei der Genauigkeit verringert die Rechenkosten während der Inferenz drastisch.

Klassische Vision-Language-Modelle setzen auf Transformer-Architekturen, bei denen jeder Token mit jedem anderen wechselwirkt. Dies führt bei umfangreichen Dokumentenseiten zu extrem hohen Kosten. SSMs aktualisieren ihren Zustand Token für Token. Für die Inferenz langer Dokumente bietet dieser Ansatz das optimale Verhältnis aus Ausführungsgeschwindigkeit und Speichereffizienz.

Das vierstufige Trainings-Curriculum und RL-Pipeline

  • Das Sprach-Backbone entsteht in Stufe eins durch Pretraining mit 13 Billionen Text-Tokens.
  • Ein kontinuierliches Pretraining mit 300 Millionen Bild-Text-Paaren vermittelt visuelle Fähigkeiten vor dem OCR-Fine-Tuning mit 100 Millionen Datenpunkten.
  • Bestärkendes Lernen nutzt automatisierte Unittests und maschinell überprüfbare Belohnungen zur Modelloptimierung.

Ein starkes Sprachverständnis ermöglicht es dem Modell, unleserlichen oder verwischten Text aus dem sprachlichen Kontext korrekt zu ergänzen. Auf Stufe vier nutzt die Pipeline deterministische Eigenschaften der Texterkennung: Die Ausgaben werden automatisch gegen Unittests und Metriken wie Zeichenfehlerquoten oder Tabellenstrukturen geprüft, was das Bestärkende Lernen hochgradig skalierbar macht.

Benchmark-Ergebnisse und Praxiseinsatz

  • Das Modell erzielte Werte von 84,3 im OCR Bench und 93,2 im Omnidoc Bench.
  • In 22 indischen Sprachen übertrifft das System etablierte Modelle wie Gemini, ChatGPT und Opus.
  • Unternehmen aus dem Finanz- und Archivsektor verarbeiteten bereits über 35 Millionen Dokumentenseiten.

Neben globalen Benchmark-Erfolgen liegt der Schwerpunkt auf der Souveränität indischer Dateninfrastrukturen. Banken, Versicherungen und Behörden nutzen das Modell als API, On-Premise-Installation oder über die Workbench Akshar. Der direkte Einsatz garantiert den Verbleib sensibler Transkriptionsdaten im Land.

Fragerunde: Datensynthese, Souveränität und Benchmarks

  • Sprachkompetenz in ressourcenarmen Sprachen verbessert indirekt auch die Verarbeitungsqualität englischer Texte.
  • Für das RL-Training werden bevorzugt echte, hochkomplexe Dokumente statt rein synthetischer Daten eingesetzt.
  • Ein öffentlich zugänglicher Indic Benchmark deckt historische Dokumente ab dem 19. Jahrhundert ab.

Das Training mit ressourcenarmen indischen Sprachen zeigt positive Transfer-Effekte auf das allgemeine Sprachverständnis. Die Trainingsdaten bestehen zu 40 Prozent aus indischen Sprachen und zu 60 Prozent aus Englisch, Mathematik sowie Code. Um die Souveränität zu wahren und maßgeschneiderte KI-Agenten zu ermöglichen, baut die Plattform kontinuierlich Rückmeldungen aus laufenden Bereitstellungen in neue Trainingsläufe ein.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video