С нуля до SOTA: Обучение модели компьютерного зрения на 3B параметров на базе State-Space — Кришна Прасад Шринивасан, Sarvam

AAI Engineer
Computing/SoftwareSmall Business/StartupsLanguages

Transcript

00:00:00Всем привет, добрый день! Меня зовут Кришна, я генеральный менеджер в Sarvam. Сегодня я
00:00:24расскажу вам, как модель с 3 миллиардами параметров, достаточно компактная для запуска на одной GPU,
00:00:32достигает уровня SOTA в анализе документов и обходит модели, превосходящие её по размеру в сотню раз. Это также слегка
00:00:42необычная модель в двух отношениях: во-первых, используемая языковая модель не является стандартным трансформером, и
00:00:49всей разработкой модели — от сбора данных и обучения до вычислительных ресурсов — занимались полностью в Индии, причем
00:00:58как для английского, так и для 22 официальных индийских языков. На мой взгляд, это одна из сложнейших задач
00:01:06по интеллектуальной обработке документов в мире на данный момент. Вот как мы прошли путь от нуля до SOTA. Кто мы такие? Мы —
00:01:15Sarvam, индийская компания по разработке суверенных базовых моделей. Мы работаем с различными модальностями: голосом, текстом и
00:01:23зрением. В сфере голоса у нас есть модели распознавания и синтеза речи; в сфере текста — модели на 30 миллиардов и 100
00:01:32миллиардов параметров; а в сфере зрения — модель для интеллектуального анализа документов, о которой мы
00:01:38сегодня и поговорим. Индия практически отсутствует в машиночитаемом мире. Согласно опубликованному
00:01:48исследованию распределения языков, существенно меньше одного процента корпуса Common Crawl, на котором обучаются передовые модели,
00:01:55приходится на индийские языки. Возможно, на различных форумах вы слышали от ведущих лабораторий, что
00:02:04Индия там присутствует, что Индия — один из их крупнейших и быстрорастущих рынков. Но с точки зрения данных Индии всё ещё нет
00:02:16в тех передовых моделях, которые обучаются каждый день. В чём же причина? В первую очередь не в отсутствии данных или знаний, а в том, что эти данные никогда не оцифровывались,
00:02:31они просто не переведены в цифру. И мы в Sarvam решаем именно эту проблему. Почему интеллектуальная обработка индийских документов — это сложно?
00:02:38Во-первых, нашей целью является извлечение знаний, а не просто чистого текста. Извлечение чистого текста без
00:02:49логической связности бессмысленно. Во-вторых, в индийской письменности начертание слов и сам язык сильно отличаются от того, что
00:03:01видит машина. Индийские языки используют сложный набор объединенных Юникод-символов. Чтобы сделать всё правильно, языковая модель должна отлично знать все 22 языка.
00:03:13В-третьих, большинство индийских языков считаются низкоресурсными, из-за чего сегодня остро ощущается нехватка данных для обучения таких моделей.
00:03:23Наш ответ на это — Sarvam Vision, первая суверенная визуально-языковая модель Индии, созданная с нуля. Это модель на 3 миллиарда параметров с архитектурой пространств состояний, где данные, вычисления и обучение — всё сделано в Индии.
00:03:40Когда мы начинали работу в конце 2025 года, большинство VLM в сфере OCR были монолитными. Они выполняли OCR на уровне всей страницы, а мы тогда сделали нестандартную ставку, сосредоточившись на OCR на уровне блоков и добавив вокруг модели обвязку для анализа документов.
00:04:02Многие модели, вышедшие с тех пор в начале 2026 года, пришли к той же парадигме «обвязка плюс малая модель» для OCR, что подтверждает высокую ценность выбранного нами направления.
00:04:17В частности, Sarvam Vision имеет два модуля обвязки: один для макета, а другой для порядка чтения, плюс VLM-модель пространств состояний для OCR на уровне блоков.
00:04:29Опять же, почему сегодня мы используем пространство состояний, а не трансформер?
00:04:36Большинство современных OCR-моделей, как и универсальные open-source VLM вроде Qwen, Gemma и т. д., основаны на трансформерах.
00:04:45Мы применили иной подход, использовав SSM. Почему?
00:04:50И трансформеры, и SSM фундаментально являются последовательными моделями, но с совершенно разными базовыми механиками.
00:04:57В трансформере каждый токен связывается с каждым другим токеном, из-за чего объем вычислений растет пропорционально квадрату длины последовательности.
00:05:06То есть это взаимодействия вида L на L.
00:05:10И расход памяти тоже растет вместе с длиной последовательности.
00:05:13С другой стороны, SSM имеют одно единое состояние.
00:05:17Они поддерживают единое состояние вдоль последовательности, обновляя его токен за токеном.
00:05:22Поскольку объем вычислений растет лишь линейно, расход памяти у SSM остается постоянным.
00:05:27Почему же это правильная архитектура для OCR?
00:05:32Всё упирается в компромиссы. Особенно для длинных документов, которые могут содержать от 5 000 до 10 000 визуальных токенов на страницу.
00:05:43И квадратичная сложность вычислений и памяти становится крайне дорогой при инференсе.
00:05:51С другой стороны, проведение блочного OCR с небольшими потерями точности полноты при помощи SSM абсолютно оправдано,
00:06:00поскольку это позволяет избежать высоких вычислительных затрат, присущих трансформерам.
00:06:08Итак, как же это всё обучать?
00:06:10Мы создали поэтапную учебную программу из четырех шагов.
00:06:13Каждый этап опирается на предыдущий. Первый этап — предобучение только на тексте.
00:06:1913 триллионов токенов на английском, индийских языках, математике и коде.
00:06:25Это формирует языковой каркас на 3 миллиарда параметров.
00:06:29Сильное языковое априорное знание позволяет модели распознать смазанный или нечеткий текст на изображении.
00:06:38Точно так же, как вы можете прочитать полуразмытое слово,
00:06:41потому что знаете, какое именно слово должно быть в этом месте.
00:06:46Поэтому сначала мы сосредоточились на развитии языковых возможностей модели,
00:06:51ещё до того, как модель увидит хотя бы один пиксель.
00:06:54На втором этапе мы проводим непрерывное предобучение на 300 миллионах пар «изображение-текст».
00:07:01Это обучает языковую модель общим визуальным способностям,
00:07:05учит её видеть, интерпретировать пиксели и так далее.
00:07:08Затем идет третий этап, где мы проводим тонкую настройку с учителем (SFT) на 100 миллионах примеров OCR.
00:07:15Третий этап в первую очередь нацелен на то, чтобы сделать из общей VLM-модели сильную модель OCR.
00:07:26Это включает в себя использование разнообразных данных на всех 22 языках и английском,
00:07:32а также включение различных компонентов документов, таких как таблицы,
00:07:39уравнения, рукописные документы и так далее.
00:07:44А четвертый этап — обучение с подкреплением, которое помогает преодолеть потолок результатов SFT.
00:07:54Здесь вы видите стандартный рецепт.
00:07:57Однако наше главное преимущество заключается в двух элементах ниже:
00:08:02слое данных и слое оценки (eval).
00:08:05Первый — это генератор данных.
00:08:08Для большинства из 22 языков нет готовых размеченных данных.
00:08:13А когда размеченных данных нет, построить процесс их подготовки становится трудно.
00:08:18И это именно то, над чем мы масштабно поработали.
00:08:21Мы создали конвейеры для генерации синтетических данных и данных из реальных документов,
00:08:26а также выстроили процесс непрерывного улучшения данных, используемых для обучения,
00:08:35на основе результатов оценки и других метрик.
00:08:37Сейчас мы активно изучаем парадигму RLM,
00:08:42исследуя агентские визуальные возможности для наших моделей в следующих релизах.
00:08:48Второе преимущество — это системы оценки.
00:08:51Нельзя достичь уровня SOTA, если вы не можете измерить качество работы вашей модели.
00:08:57Мы подготовили обширные бенчмарки, чтобы убедиться, что измеряем действительно уровень SOTA,
00:09:03и что это действительно имеет практическую ценность для конечных пользователей.
00:09:09Я хочу уделить минуту нашему конвейеру RL,
00:09:15четвертому этапу, так как основной прирост дает именно обучение с подкреплением.
00:09:20В OCR корректность распознавания — это машиночитаемая задача, верно?
00:09:24Можно настроить множество тестов для оценки моделей
00:09:30на сгенерированных вами сэмплах.
00:09:34А в мире детерминированного OCR
00:09:37всё это поддается автоматической проверке.
00:09:40Поэтому RL дает нам мощный буст:
00:09:44генерируем варианты,
00:09:45оцениваем юнит-тестами,
00:09:47закрепляем целевое значение выше среднего
00:09:51и повторяем процесс.
00:09:53И это делает RL-VR для OCR очень и очень масштабируемым.
00:09:57После всей проведенной работы по обучению с нуля
00:10:01и усилий по подготовке данных
00:10:03мы смогли установить SOTA в двух мировых английских бенчмарках:
00:10:08один из них — OCR Bench,
00:10:10а другой — Omnidoc Bench.
00:10:12На старте мы показали результат 84,3 на OCR Bench
00:10:15и 93,2 на Omnidoc Bench.
00:10:18Модели, вышедшие с тех пор,
00:10:22заметно продвинули планку,
00:10:24но скоро у нас появится более мощная модель
00:10:26и в мировой лидерборд.
00:10:29Во-вторых, и это самое главное,
00:10:31на 22 индийских языках
00:10:34мы удерживаем абсолютное лидерство,
00:10:36даже в сравнении со всеми передовыми моделями,
00:10:38такими как Gemini,
00:10:40ChatGPT,
00:10:41Opus
00:10:42и так далее.
00:10:43Здесь мы значительно увеличили отрыв
00:10:46и сохраняем сильные позиции
00:10:48по сравнению со всеми новыми моделями,
00:10:50появившимися на рынке.
00:10:52Sarvam Vision подкрепляет
00:10:54Parse — нашу рабочую среду для агентского анализа документов
00:10:57под названием Akshar,
00:10:59где мы обеспечиваем
00:11:01агентскую оцифровку с участием человека,
00:11:04а также извлечение
00:11:06и загрузку данных
00:11:07для различных прикладных задач обработки документов.
00:11:11Мы предоставляем оценки достоверности,
00:11:13поддерживаем привязку к блокам
00:11:16и возможность проведения агентской корректуры и других операций.
00:11:22Бенчмарки и статус SOTA — это одно,
00:11:26у них свое место.
00:11:27Сегодня крупнейшие предприятия мира —
00:11:30от страхования и банков
00:11:32до госсектора
00:11:33и организаций по сохранению исторического наследия —
00:11:36используют Sarvam Vision,
00:11:38чтобы оцифровать более 35 миллионов страниц
00:11:40на английском
00:11:41и 22 индийских языках.
00:11:44Модель доступна в виде API,
00:11:48локального решения (on-premise)
00:11:49и агентской платформы.
00:11:51В заключение:
00:11:54еще четыре месяца назад
00:11:56в Индии не было своей суверенной модели.
00:11:59Сегодня у нас есть Sarvam Vision,
00:12:02обученная с нуля
00:12:03и достигшая уровня SOTA
00:12:06по цене,
00:12:07которая крайне конкурентоспособна
00:12:09по сравнению с остальными решениями,
00:12:11включая открытые и проприетарные.
00:12:14Мы начали с решения
00:12:16самых сложных задач
00:12:18по анализу документов на индийских языках.
00:12:20Вскорости мы выпустим
00:12:22универсальные VLM,
00:12:24обладающие куда более широкими
00:12:26визуальными возможностями.
00:12:28И ждем с нетерпением,
00:12:30когда вы протестируете наши модели.
00:12:32Спасибо.
00:12:33Буду рад ответить на вопросы.
00:12:35С удовольствием отвечу на вопросы.
00:12:37Готов ответить на ваши вопросы.
00:12:38С радостью отвечу на вопросы.
00:12:39С удовольствием отвечу на ваши вопросы.
00:12:39Буду рад ответить на вопросы.
00:12:40Да.
00:12:40С удовольствием отвечу на любые вопросы.
00:12:41Готов ответить на ваши вопросы.
00:12:42Да.
00:12:43С радостью отвечу на вопросы.
00:12:44Да.
00:12:45Буду рад ответить на ваши вопросы.
00:12:46Да.
00:12:47Да.
00:12:48Да, абсолютно.
00:12:49В целом,
00:12:50языковая поддержка
00:12:51для 22 языков
00:12:53значительно улучшает
00:12:54английский язык,
00:12:56и это применимо
00:12:58к любому малоресурсному языку,
00:12:59а не только к индийским.
00:13:02Верно.
00:13:27Мы не совсем двигаемся в этом направлении
00:13:29с данной моделью,
00:13:30поскольку это модель с уклоном в зрение,
00:13:33где основной фокус
00:13:34сделан на извлечении информации
00:13:35или знаний из документов.
00:13:37Но да,
00:13:38здесь можно провести
00:13:39некоторые параллели
00:13:40с помощью моделям
00:13:42использовать общие языки
00:13:44для ускорения написания кода
00:13:45в том числе.
00:13:46Но да,
00:13:47это не входит
00:13:48в основную задачу этой работы.
00:13:50Да.
00:13:53Верно.
00:13:54Тут есть два момента.
00:14:11Мы создаем искусственные документы,
00:14:14синтетические документы,
00:14:15как их называют,
00:14:16для общего пост-обучения.
00:14:18Это включает в себя
00:14:19SFT
00:14:20и RL.
00:14:21Однако,
00:14:22возвращаясь к вашему вопросу
00:14:23по поводу RL,
00:14:24мы не...
00:14:25мы не...
00:14:26Вы можете генерировать
00:14:27синтетические документы
00:14:28и на этом этапе.
00:14:29Однако
00:14:30лучше всего
00:14:31брать реальные документы,
00:14:32достаточно сложные,
00:14:33чтобы
00:14:34они помогли настроить
00:14:35юнит-тесты
00:14:36или различные типы
00:14:37функций вознаграждения.
00:14:39Верно.
00:14:40Например,
00:14:41вознаграждение на основе
00:14:42посимвольной точности,
00:14:43или вознаграждение за
00:14:44структуру таблиц,
00:14:45или математические уравнения,
00:14:47или что-то еще,
00:14:48что имеет отношение
00:14:49к конкретному языку,
00:14:50например, грамматические правила,
00:14:51и так далее.
00:14:52А затем помогать
00:14:53модели
00:14:54итеративно улучшаться
00:14:55на основе
00:14:56результатов генераций,
00:14:57которые она производит
00:14:58при различных
00:14:58параметрах
00:14:59настройки.
00:15:00Да.
00:15:01Да.
00:15:20Вы сказали,
00:15:21что вы большой фанат Chandra?
00:15:22Да.
00:15:23Хорошо.
00:15:24Это разработка другой лаборатории.
00:15:25Я тоже поклонник
00:15:26лаборатории,
00:15:27которая создала Chandra.
00:15:28Но да,
00:15:29отвечая на ваш вопрос
00:15:30о бенчмарке Indic:
00:15:31да,
00:15:32мы опубликуем
00:15:33бенчмарк Sarvam Indic,
00:15:34который мы создали
00:15:36для 22 языков.
00:15:37И он
00:15:38охватывает
00:15:39огромный временной период,
00:15:42начиная с 1800-х годов
00:15:43и до наших дней.
00:15:44А также
00:15:45различные типы верстки,
00:15:46различные виды
00:15:47документов
00:15:48на индийских языках.
00:15:49Можете представить себе
00:15:49документы
00:15:50с прозой,
00:15:51поэзией,
00:15:52художественные произведения,
00:15:53таблицы,
00:15:53финансовые тексты
00:15:54и все прочее.
00:15:54Скоро мы выложим
00:15:55этот бенчмарк
00:15:56в открытый доступ.
00:15:57В открытый доступ
00:15:57в том числе.
00:15:59Итак,
00:16:00что касается...
00:16:02Перевод тут снова
00:16:02Транслитерация напрямую
00:16:03здесь не задействована,
00:16:03потому что в OCR важна точность
00:16:05извлечения данных.
00:16:07Верно?
00:16:08Вам нужно,
00:16:09чтобы даже
00:16:09если на изображении есть ошибка,
00:16:10эта ошибка с изображения
00:16:11была извлечена точь-в-точь, а не так, чтобы модель
00:16:15вносила правки по своему усмотрению.
00:16:18Поэтому это неприменимо напрямую,
00:16:19однако мы видим много данных,
00:16:23полученных через транслитерацию даже для
00:16:25обучения OCR,
00:16:26и пока еще нет единого мнения о том,
00:16:28стоит ли так делать.
00:16:29Итак,
00:16:29транслитерация напрямую здесь не задействована, ведь в OCR главное — высокая точность
00:16:33распознавания.
00:16:35Верно?
00:16:36Вам нужно, чтобы опечатка на скане была перенесена адекватно, а не
00:16:40исправлена моделью на свое усмотрение.
00:16:43Поэтому подход неприменим напрямую, но да, сейчас мы видим много данных, полученных
00:16:49путем транслитерации, даже для обучения OCR, и вопрос качества этих данных и их полезности остается открытым.
00:16:58Да.
00:17:00Да.
00:17:01Да.
00:17:26Верно.
00:17:27Здесь есть несколько аспектов.
00:17:29Во-первых, ни одна передовая проприетарная или открытая модель не справляется со сложными документами на индийских языках.
00:17:39Так?
00:17:40Поэтому для страны с населением 1,4 миллиарда человек нужно решать повседневные задачи интеллектуальной обработки документов,
00:17:52поскольку в Индии огромный объем бумажного документооборота.
00:17:55Это развивающаяся страна, где цифровизация идет прямо сейчас, и критически важно изначально иметь возможности для перевода процессов в цифру.
00:18:05Во-вторых, что касается обучения, мы сгенерировали данные, которые можно использовать для обучений на последующих этапах.
00:18:18Мы находимся в самом начале пути внедрения ИИ в нашу повседневную жизнь, и нам нужны базы данных, чтобы со временем прийти к тому,
00:18:31чтобы у нас были персональные агенты на том языке, который удобен вам или мне, в любой удобной форме.
00:18:38Чтобы добиться всего этого, нужно с чего-то начать и сформировать датасеты, а качественные данные как раз делают модель передовой.
00:18:47А если модель топовая, то все — от страховых компаний до госорганов — задумываются о суверенитете в сфере ИИ.
00:18:58Как госструктура, я не могу использовать модель, развернутую за рубежом, не зная, куда уходят данные расшифровок.
00:19:06Поэтому мне необходимо контролировать, куда отправляются данные, как и в каких объемах они используются.
00:19:13Так что суверенитет становится ключевым фактором, и поэтому наша модель сейчас...
00:19:17Прошло всего четыре месяца с момента запуска, а мы уже оцифровываем по 35 миллионов страниц.
00:19:23Это показывает, что рынок ждал суверенное решение, способное запустить волну ИИ-цифровизации в Индии.
00:19:32Так что выделяются три аспекта: суверенитет, возможности самой модели и данные, необходимые для обучения.
00:19:42Да, датасет на 40% состоит из индийских языков, а остальное — английский, математика, код и так далее.
00:20:03Хорошо.
00:20:07Понятно.
00:20:08Да.
00:20:09Серьезный вопрос.
00:20:24В настоящее время мы развернули эту модель в нескольких штатах,
00:20:31пытаясь оцифровать региональные языки наряду с англоязычными и смешанными документами.
00:20:39И скоро мы сможем проводить дообучение на основе обратной связи от текущего внедрения.
00:20:48Так что да, этот пайплайн мы тоже запустили.
00:20:50Да, мы запустили и этот процесс.

Key Takeaway

Компактная 3B модель Sarvam Vision на базе архитектуры пространств состояний обходит гигантские трансформеры и устанавливает SOTA в OCR для 22 индийских языков за счет эффективной работы с памятью, гибридной обвязки макета и автоматизированного обучения с подкреплением.

Highlights

  • Модель Sarvam Vision с 3 миллиардами параметров достигает уровня SOTA в обработке документов на 22 индийских языках и английском, работая на одной GPU.

  • Архитектура пространств состояний (SSM) сохраняет постоянный расход памяти и обеспечивает линейный рост вычислений, обходя квадратичную сложность трансформеров при обработке 5 000–10 000 токенов на страницу.

  • Индия представлена менее чем в 1% корпуса Common Crawl из-за отсутствия оцифрованных данных, а не из-за нехватки знаний.

  • Поэтапный процесс обучения включает 13 триллионов токенов на этапе языкового предобучения, 300 миллионов пар «изображение-текст», 100 миллионов примеров OCR и этап обучения с подкреплением (RL).

  • Применение обучения с подкреплением на базе автоматических юнит-тестов и детерминированных метрик обеспечивает основной прирост точности в задачах распознавания текста.

  • Sarvam Vision превосходит модели Gemini, ChatGPT и Claude Opus в задачах OCR на 22 индийских языках и используется коммерческими и государственными организациями для оцифровки более 35 миллионов страниц.

Timeline

Проблема оцифровки и дефицит индийских языков в ИИ

  • Индийские языки составляют менее одного процента данных в общедоступном корпусе Common Crawl.
  • Главная причина отсутствия индийских языков в передовых моделях заключается в отсутствии цифровых копий физических документов.
  • Интеллектуальный анализ индийских документов усложняется соединением Юникод-символов и дефицитом размеченных датасетов.

Существующие крупные языковые модели практически не содержат данных на индийских языках, несмотря на высокий статус рынка. Проблема заключается не в отсутствии информации, а в том, что исторический и текущий бумажный документооборот никогда не переводился в цифровой формат. Кроме того, письменность 22 официальных языков Индии использует специфические наборы Юникод-символов, требующие глубокого языкового контекста для корректного распознавания.

Преимущества архитектуры SSM перед трансформерами в OCR

  • Sarvam Vision использует архитектуру пространств состояний (SSM) вместо традиционных трансформеров.
  • Трансформеры требуют квадратичных вычислений и памяти формата L на L, что удорожает обработку длинных документов.
  • Модели SSM сохраняют единое состояние вдоль последовательности, требуя постоянного объема памяти и линейных вычислений.

Обработка одной страницы документа может генерировать от 5 000 до 10 000 визуальных токенов. При использовании стандартного механизма внимания в трансформерах затраты на вычислительные ресурсы и память растут квадратично, делая инференс невероятно дорогим. Архитектура SSM обновляет единое состояние токен за токеном, удерживая расход памяти на стабильном уровне и снижая аппаратные требования до одной GPU.

Четырехэтапный конвейер обучения и роль RL

  • Обучение начинается с языкового предобучения на 13 триллионах токенов без использования изображений.
  • Тонкая настройка с учителем (SFT) выполняется на 100 миллионах примеров OCR, содержащих таблицы, формулы и рукописный текст.
  • Обучение с подкреплением (RL) на основе автоматических юнит-тестов дает наибольший прирост точности модели.

Сильное языковое априорное знание, заложенное на первом этапе, позволяет модели достраивать размытые и нечеткие фрагменты текста на основе контекста. После прохождения этапа визуального предобучения (300 млн пар) и SFT (100 млн примеров) применяется обучение с подкреплением. Поскольку OCR является детерминированной машиночитаемой задачей, корректность структуры и текста проверяется авто-тестами, что делает процесс RL высокомасштабируемым.

Результаты в бенчмарках и практическое применение

  • Модель показала результаты 84,3 на OCR Bench и 93,2 на Omnidoc Bench.
  • Sarvam Vision удерживает абсолютное лидерство по точности OCR на 22 индийских языках, обходя Gemini и ChatGPT.
  • Платформа уже используется предприятиями и государственным сектором для оцифровки более 35 миллионов страниц.

Сочетание малой модели и специализированной обвязки для анализа макета и порядка чтения позволило побить мировые рекорды в распознавании текста. Модель интегрирована в агентскую среду Akshar и доступна через API и локальные (on-premise) установки. Это дает коммерческим и государственным структурам возможность оцифровывать документы без передачи конфиденциальных данных на зарубежные серверы.

Ответы на вопросы: генерация данных, суверенитет и бенчмарки

  • Датасет предобучения модели состоит на 40% из индийских языков и на 60% из английского языка, математики и кода.
  • Для этапа RL используются реальные сложные документы с функциями вознаграждения за точность символов и верстку.
  • Компания планирует выложить в открытый доступ созданный бенчмарк Sarvam Indic, охватывающий документы с 1800-х годов.

В ходе ответов на вопросы подчеркивается, что обучение на 22 языках взаимно усиливает качество распознавания, включая английский язык. Синтетические данные применяются преимущественно для SFT, в то время как для RL предпочтительны реальные исторические и современные документы со сложной версткой. Внедрение независимой суверенной модели критично для индийского рынка, где оцифровка государственных и банковских архивов требует строгого контроля над физическим нахождением данных.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video