Desde cero hasta el SOTA: entrenamiento de un modelo de visión de espacio de estados de 3B — Krishna Prasad Srinivasan, Sarvam
AAI Engineer
Computing/SoftwareSmall Business/StartupsLanguages
Transcript
00:00:00Hola a todos, buenas tardes. Soy Krishna, director general en Sarvam, y hoy
00:00:24les voy a contar cómo un modelo de 3000 millones de parámetros, lo bastante pequeño para ejecutarse en una sola GPU,
00:00:32alcanza el estado del arte en IA de documentos y supera a modelos 100 veces más grandes. También es un modelo
00:00:42un poco inusual en dos aspectos: en primer lugar, el modelo de lenguaje utilizado no es un Transformer estándar, y
00:00:49todo el desarrollo del modelo, desde los datos hasta el entrenamiento y el cómputo, se realizó de extremo a extremo en la India,
00:00:58tanto para el inglés como para los 22 idiomas oficiales de la India, que en mi opinión personal representan uno de los problemas de inteligencia
00:01:06documental más difíciles del mundo en este momento. Así es como pasamos desde cero hasta el SOTA. ¿Quiénes somos? Somos
00:01:15Sarvam, una empresa soberana de modelos fundacionales en la India. Trabajamos en distintas modalidades: voz, texto y
00:01:23visión. En voz, tenemos modelos de voz a texto y de texto a voz; en texto, tenemos modelos de 30 mil millones y 100
00:01:32mil millones de parámetros; y en visión, tenemos un modelo de inteligencia documental, que es de lo que
00:01:38vamos a hablar hoy. La India está prácticamente ausente del mundo legible por máquinas. Según un estudio publicado
00:01:48sobre distribución lingüística, mucho menos del 1 % del corpus de Common Crawl con el que se entrenan los modelos frontera
00:01:55tiene representación de los idiomas de la India. Ahora bien, en varios foros habrán oído decir a los laboratorios frontera que
00:02:04la India está presente, que es uno de sus mercados más grandes y de rápido crecimiento; sin embargo, la India sigue estando ausente en términos de datos en
00:02:16los modelos frontera que se entrenan hoy en día. ¿A qué se debe esto? Principalmente, no a una falta de datos o a que no exista el conocimiento, sino a que los datos nunca se han digitalizado,
00:02:31y en Sarvam estamos resolviendo ese problema. ¿Por qué es difícil la inteligencia documental para lenguas índicas?
00:02:38En primer lugar, el objetivo es la extracción de conocimiento, no simplemente la extracción de texto. Extraer texto puro sin
00:02:49coherencia lógica no sirve de nada. En segundo lugar, en las escrituras índicas, la forma de las palabras y el lenguaje que ves son muy diferentes de lo que
00:03:01ve una máquina. Es decir, las lenguas de la India tienen un conjunto complejo de caracteres Unicode fusionados; para hacerlo bien, el modelo de lenguaje debe ser fuerte en los 22 idiomas.
00:03:13En tercer lugar, la mayoría de los idiomas de la India se consideran de bajos recursos, por lo que hoy en día hay una gran escasez de datos para entrenar estos modelos.
00:03:23Nuestra respuesta a esto es Sarvam Vision, el primer modelo de lenguaje y visión soberano de la India creado desde cero; un modelo de 3000 millones de parámetros con arquitectura de espacio de estados, cuyos datos, cómputo y entrenamiento se realizaron en la India.
00:03:40Cuando comenzamos el trabajo inicial a finales de 2025, la mayoría de los VLM en el ámbito de OCR eran VLM monolíticos; realizaban OCR a nivel de página, y en ese momento tomamos una apuesta contraria al enfocarnos en el OCR a nivel de bloque, añadiendo un entorno de trabajo rígido para documentos alrededor del modelo.
00:04:02Muchos modelos lanzados recientemente en 2026 han convergido en el mismo paradigma de entorno rígido con modelo pequeño para OCR, lo que demuestra el gran valor del rumbo que tomamos.
00:04:17Sarvam Vision, en particular, cuenta con dos módulos de soporte: uno para la maquetación y otro para la lectura, junto con un VLM de modelo de espacio de estados para OCR a nivel de bloque.
00:04:29Una vez más, ¿por qué usamos espacio de estados y no un Transformer?
00:04:36La mayoría de los modelos OCR actuales, como los VLM generales o de código abierto como Qwen, Gemma, etc., se basan en Transformers.
00:04:45Nosotros optamos por un enfoque alternativo utilizando un SSM. ¿Por qué?
00:04:50Ambos son fundamentalmente modelos secuenciales, tanto los Transformers como los SSM, pero con mecánicas subyacentes muy diferentes.
00:04:57En un Transformer, cada token analiza a todos los demás tokens, por lo que el cómputo crece con el cuadrado de la longitud de la secuencia.
00:05:06Es decir, las interacciones de $L imes L$.
00:05:10Y la memoria también aumenta a medida que crece la secuencia.
00:05:13Por otro lado, los SSM tienen un solo estado.
00:05:17Mantiene un único estado a lo largo de la secuencia, actualizándolo token por token.
00:05:22Dado que el cómputo solo crece de manera lineal, la memoria se mantiene constante en los SSM.
00:05:27Ahora bien, ¿por qué es esta la arquitectura adecuada para el OCR?
00:05:32Realmente depende de las ventajas y desventajas; en particular para documentos largos, que pueden requerir entre 5000 y 10 000 tokens visuales por página.
00:05:43La complejidad cuadrática del cómputo y la memoria se vuelve muy costosa para la inferencia.
00:05:51Por otro lado, hacer OCR a nivel de bloque con una ligera pérdida en el exhaustividad usando SSMs es justificable
00:06:00para evitar los altos costos computacionales que imponen los Transformers.
00:06:08Entonces, ¿cómo se entrena esto realmente?
00:06:10Diseñamos un plan de estudio por etapas, cuatro etapas.
00:06:13Cada una se apoya en la anterior: la primera etapa es el preentrenamiento solo con texto.
00:06:1913 billones de tokens entre texto en inglés y lenguas índicas, matemáticas y código.
00:06:25Esto construye la base del modelo de lenguaje de 3000 millones de parámetros.
00:06:29Un conocimiento previo sólido del lenguaje es lo que permite al modelo resolver un texto borroso o ambiguo de la imagen,
00:06:38de la misma manera que uno puede leer una palabra entrecortada
00:06:41porque sabe qué palabra debería estar en el lugar correcto.
00:06:46Por lo tanto, nos enfocamos en desarrollar primero la competencia del modelo de lenguaje,
00:06:51antes de que el modelo vea siquiera un solo píxel.
00:06:54En la segunda etapa realizamos un preentrenamiento continuo con 300 millones de pares de imagen y texto.
00:07:01Esto le enseña al modelo de lenguaje capacidades generales de visión,
00:07:05y le enseña a ver, a interpretar píxeles, etc.
00:07:08Luego viene la tercera etapa, donde realizamos un ajuste fino supervisado en 100 millones de muestras de OCR.
00:07:15Esta tercera etapa se enfoca principalmente en lograr que un VLM general se vuelva sólido en OCR.
00:07:26Eso incluye tener datos diversos en los 22 idiomas y en inglés,
00:07:32así como incorporar todo tipo de componentes de documentos, como tablas,
00:07:39ecuaciones, documentos manuscritos, entre otros.
00:07:44Y la etapa cuatro es el aprendizaje por refuerzo, que ayuda a superar el límite de lo que el ajuste fino supervisado logra alcanzar.
00:07:54Aquí verán que esta es una receta estándar;
00:07:57sin embargo, la ventaja competitiva radica en las dos capas subyacentes:
00:08:02la capa de datos y la capa de evaluación.
00:08:05La primera es el motor de datos.
00:08:08Para la mayoría de los 22 idiomas, no hay datos etiquetados disponibles de inmediato.
00:08:13Cuando no existen datos etiquetados, construir el motor de datos se vuelve difícil.
00:08:18Y eso es algo que hemos hecho extensivamente.
00:08:21Hemos creado canalizaciones para generar datos sintéticos y datos de documentos reales,
00:08:26y también ayudamos a construir la canalización para mejorar continuamente los datos que se utilizan en el entrenamiento,
00:08:35en función del rendimiento de las evaluaciones, etc.
00:08:37Por lo tanto, actualmente estamos analizando de forma activa el paradigma de los RLM,
00:08:42a medida que exploramos las capacidades de visión agéntica para nuestros modelos en las próximas versiones.
00:08:48La segunda ventaja competitiva son las evaluaciones.
00:08:51No se puede alcanzar el estado del arte si no se puede medir qué tan bien funciona el modelo.
00:08:57Hemos organizado evaluaciones exhaustivas para garantizar que lo que medimos sea verdaderamente SOTA
00:09:03y verdaderamente significativo en términos de utilidad para los usuarios finales.
00:09:09Así que me gustaría detenerme un minuto en nuestra canalización de RL,
00:09:15la etapa cuatro, porque gran parte del avance proviene esencialmente del RL.
00:09:20En OCR, la precisión es un problema legible por máquina, ¿cierto?
00:09:24Se pueden configurar muchas pruebas para premiar y puntuar los modelos
00:09:30a partir de estas muestras que se crean.
00:09:34Y en el mundo del OCR determinista,
00:09:37todas son verificables por máquina.
00:09:40Por lo tanto, el RL nos da un gran impulso:
00:09:44se muestrea un grupo,
00:09:45se puntúa con pruebas unitarias,
00:09:47se refuerza cuál es el valor promedio a superar
00:09:51y luego se repite el proceso.
00:09:53Y esto hace que el RL-VR para OCR sea sumamente escalable.
00:09:57Ahora, después de todo el entrenamiento desde cero que hemos realizado
00:10:01y el esfuerzo en datos que hemos hecho,
00:10:03logramos establecer el SOTA en dos de las pruebas de rendimiento globales en inglés:
00:10:08una es OCRBench
00:10:10y la otra es OmniDocBench.
00:10:12En el lanzamiento alcanzamos 84,3 en OCRBench
00:10:15y 93,2 en OmniDocBench.
00:10:18Los modelos que se han lanzado desde entonces
00:10:22han avanzado bastante la frontera,
00:10:24y pronto tendremos un modelo más sólido
00:10:26también en la tabla de clasificación global.
00:10:29En segundo lugar, y más importante aún,
00:10:31en los 22 idiomas de la India
00:10:34mantenemos un liderazgo imbatible,
00:10:36incluso frente a todos los modelos frontera
00:10:38como Gemini,
00:10:40ChatGPT,
00:10:41Opus
00:10:42y demás.
00:10:43Y aquí es donde hemos ampliado notablemente la ventaja
00:10:46y nos mantenemos firmes
00:10:48en comparación con todos estos modelos más recientes
00:10:50que han surgido.
00:10:52Ahora bien, Sarvam Vision
00:10:54impulsa nuestra plataforma agéntica de inteligencia documental,
00:10:57llamada Akshar,
00:10:59donde facilitamos
00:11:01digitalizaciones agénticas con intervención humana,
00:11:04extracciones
00:11:06e ingestas
00:11:07para diversos problemas derivados de la inteligencia documental.
00:11:11Proporcionamos puntuaciones de confianza,
00:11:13ofrecemos fundamentación a nivel de bloques
00:11:16y también la capacidad de realizar correcciones agénticas, etc.
00:11:22Ahora, las evaluaciones y el SOTA son una cosa,
00:11:26tienen su lugar.
00:11:27Hoy, algunas de las empresas más grandes del mundo,
00:11:30desde aseguradoras y bancos
00:11:32hasta gobiernos
00:11:33y organizaciones de preservación histórica,
00:11:36están utilizando Sarvam Vision
00:11:38para digitalizar más de 35 millones de páginas
00:11:40en inglés
00:11:41y en los 22 idiomas de la India.
00:11:44El modelo está disponible mediante API,
00:11:48instalación local
00:11:49y a través de la plataforma agéntica.
00:11:51Así que, en conclusión,
00:11:54hasta hace cuatro meses
00:11:56no existía ningún modelo soberano originario de la India.
00:11:59Hoy contamos con Sarvam Vision,
00:12:02que se entrenó desde cero
00:12:03y ha alcanzado el SOTA
00:12:06a un precio
00:12:07extremadamente competitivo
00:12:09frente a todas las demás soluciones,
00:12:11incluidas las de código abierto y cerrado.
00:12:14Primero comenzamos resolviendo
00:12:16algunos de los problemas más difíciles
00:12:18para la inteligencia documental en idiomas de la India.
00:12:20Pronto estaremos lanzando
00:12:22VLM de propósito general
00:12:24capaces de ofrecer muchas más
00:12:26capacidades de visión,
00:12:28Y esperamos que
00:12:30todos ustedes prueben nuestros modelos.
00:12:32Muchas gracias.
00:12:33Estaré encantado de responder cualquier pregunta.
00:12:35Estaré encantado de responder cualquier pregunta.
00:12:37Estaré encantado de responder cualquier pregunta.
00:12:38Estaré encantado de responder cualquier pregunta.
00:12:39Estaré encantado de responder cualquier pregunta.
00:12:39Estaré encantado de responder cualquier pregunta.
00:12:40Sí.
00:12:40Estaré encantado de responder cualquier pregunta.
00:12:41Estaré encantado de responder cualquier pregunta.
00:12:42Sí.
00:12:43Estaré encantado de responder cualquier pregunta.
00:12:44Sí.
00:12:45Estaré encantado de responder cualquier pregunta.
00:12:46Sí.
00:12:47Sí.
00:12:48Sí, totalmente.
00:12:49En general,
00:12:50la capacidad lingüística
00:12:51de los 22 idiomas
00:12:53mejora el inglés
00:12:54por un margen bastante amplio.
00:12:56Y esto se aplica
00:12:58a cualquier idioma con pocos recursos,
00:12:59no solo a los idiomas indios.
00:13:02De acuerdo.
00:13:27No vamos exactamente en esa dirección
00:13:29con este modelo,
00:13:30porque es un modelo enfocado en la visión
00:13:33donde nos centramos
00:13:34en extraer información
00:13:35o conocimiento de documentos.
00:13:37Pero sí,
00:13:38podría haber
00:13:39ciertos paralelismos
00:13:40para ayudar a los modelos
00:13:42a usar lenguajes generales
00:13:44para agilizar la programación
00:13:45también.
00:13:46Pero bueno,
00:13:47eso no forma parte del
00:13:48alcance de este trabajo.
00:13:50Sí.
00:13:53De acuerdo.
00:13:54Hay dos aspectos a considerar.
00:14:11Creamos documentos artificiales,
00:14:14documentos sintéticos
00:14:15como se les suele llamar,
00:14:16para el posentrenamiento general,
00:14:18lo que incluye
00:14:19SFT
00:14:20y RL.
00:14:21Sin embargo,
00:14:22respondiendo a su pregunta específica
00:14:23sobre RL,
00:14:24nosotros no...
00:14:25no hacemos...
00:14:26Se pueden generar
00:14:27documentos sintéticos
00:14:28ahí también,
00:14:29pero
00:14:30lo más recomendable
00:14:31es utilizar documentos del mundo real,
00:14:32lo suficientemente complejos
00:14:33que...
00:14:34que ayuden a diseñar
00:14:35pruebas unitarias
00:14:36o distintos tipos
00:14:37de recompensas.
00:14:39Claro,
00:14:40por ejemplo,
00:14:41una recompensa basada en
00:14:42la tasa de caracteres,
00:14:43o basada en
00:14:44la estructura de tablas,
00:14:45o en una ecuación matemática,
00:14:47o algo
00:14:48que sea pertinente
00:14:49para un idioma,
00:14:50como recompensas gramaticales,
00:14:51entre otras cosas,
00:14:52y así ayudar
00:14:53al modelo
00:14:54a mejorar de forma iterativa
00:14:55según
00:14:56las iteraciones
00:14:57que el modelo es capaz
00:14:58de generar
00:14:58en diferentes
00:14:59configuraciones.
00:15:00Sí.
00:15:01Sí.
00:15:20¿Dijiste que eras
00:15:21un gran fan de Chandra?
00:15:22Sí.
00:15:23Entendido.
00:15:24Ese proyecto es de otro laboratorio.
00:15:25Yo también soy un gran admirador
00:15:26del laboratorio
00:15:27que desarrolló Chandra.
00:15:28Pero sí,
00:15:29respecto a tu pregunta
00:15:30sobre el benchmark índico,
00:15:31sí,
00:15:32publicaremos
00:15:33el Sarvam Indic Benchmark
00:15:34que hemos desarrollado
00:15:36para 22 idiomas,
00:15:37el cual
00:15:38abarca
00:15:39un periodo de tiempo muy extenso,
00:15:42desde el siglo XIX
00:15:43hasta la época actual,
00:15:44e incluye también
00:15:45diversos tipos de formatos
00:15:46y varias clases de
00:15:47documentos
00:15:48en lenguas de la India.
00:15:49Imaginaos
00:15:49documentos
00:15:50con prosa,
00:15:51poesía,
00:15:52literatura,
00:15:53tablas,
00:15:53finanzas
00:15:54y todo ese tipo de contenidos.
00:15:54Pronto lanzaremos
00:15:55ese benchmark
00:15:56de forma pública
00:15:57también,
00:15:57de acceso público
00:15:59asimismo.
00:16:00Así que...
00:16:02la traducción tampoco está...
00:16:02la transliteración tampoco está
00:16:03directamente involucrada aquí,
00:16:03ya que en el OCR nos importa la extracción
00:16:05de alta fidelidad,
00:16:07¿de acuerdo?
00:16:08Quieres...
00:16:09quieres...
00:16:09incluso si hay un error en la imagen,
00:16:10quieres que ese error en la imagen
00:16:11se extraiga correctamente y que el modelo no esté
00:16:15haciendo cambios a su antojo.
00:16:18Por lo tanto, no es aplicable directamente,
00:16:19por lo tanto no es aplicable directamente, pero sí vemos muchísimos datos
00:16:23que provienen de la transliteración incluso para el entrenamiento
00:16:25de OCR actualmente.
00:16:26Y la cuestión aún no se ha decidido sobre lo que vas a hacer, aún se está debatiendo qué hacer.
00:16:28¿Quieres hacer eso?
00:16:29Así que...
00:16:29La transliteración tampoco está involucrada de forma directa aquí porque en OCR buscamos alta fidelidad
00:16:33en la extracción,
00:16:35¿verdad?
00:16:36Quieres que, incluso si hay un error en una imagen, ese fallo se extraiga tal cual y que no esté el
00:16:40modelo haciendo modificaciones según le parezca.
00:16:43Por eso no aplica de forma directa, pero sí es cierto que vemos muchos datos que se obtienen mediante
00:16:49transliteración incluso para entrenar OCR ahora, y aún se está evaluando la calidad de esos datos y hasta qué punto son útiles, etc.
00:16:58Sí.
00:17:00Sí.
00:17:01Sí.
00:17:26De acuerdo.
00:17:27Hay algunos aspectos que se deben considerar.
00:17:29El primero es que ningún otro modelo, ya sea comercial avanzado o de código abierto, funciona bien con documentos complejos en idiomas indios,
00:17:39¿cierto?
00:17:40Por lo tanto, para un país con 1400 millones de habitantes, se busca resolver los problemas cotidianos de inteligencia documental
00:17:52porque hay muchísimos trámites en papel en la India, ¿no?
00:17:55Es un país en constante desarrollo que aún se está digitalizando mientras hablamos, y es fundamental que la capacidad de digitalizar el país exista desde el principio.
00:18:05En segundo lugar, en cuanto al entrenamiento, lo que hemos hecho en particular es generar datos que puedan agregarse a múltiples procesos posteriores.
00:18:18Así pues, estamos en una etapa muy temprana para que la IA forme parte habitual de nuestras vidas, y necesitamos empezar a generar datos para llegar con el tiempo a un punto en el que podamos
00:18:31disponer de agentes personalizados en el idioma de tu preferencia, en el que yo prefiera o como queramos.
00:18:38Así que para hacer todo esto hay que empezar por algún sitio y se deben crear los datos; si estos son de calidad, ayudan a que el modelo alcance el estado del arte (SOTA).
00:18:47Y si un modelo es SOTA, beneficia desde aseguradoras hasta organismos gubernamentales y otras entidades que se preocupan por la soberanía en la IA, ¿verdad?
00:18:58Como entidad gubernamental, no puedo permitirme desplegar un modelo en el extranjero sin saber a dónde van los datos de las transcripciones.
00:19:06Por tanto, debo ser capaz de controlar dónde se envían los datos, cuándo y en qué medida se utilizan, etc.
00:19:13De modo que la soberanía se vuelve crucial y, por ello, este modelo realmente representa ahora...
00:19:17Quiero decir, hace apenas cuatro meses que lo lanzamos y ya estamos digitalizando 35 millones de páginas.
00:19:23Esto demuestra que el mercado esperaba una solución soberana en este ámbito que pudiera impulsar con fuerza la ola de digitalización mediante IA en la India.
00:19:32Así que sí, se resume principalmente en tres aspectos: la soberanía, la capacidad del modelo en sí y los datos necesarios para entrenarlos.
00:19:42Sí, contiene un 40 % de idiomas indios y el resto es inglés, abarcando matemáticas, código, etc.
00:20:03Muy bien.
00:20:07Perfecto.
00:20:08Sí.
00:20:09Una pregunta seria.
00:20:24Actualmente, los despliegues que hemos realizado con este modelo se encuentran en distintos estados,
00:20:31buscando digitalizar idiomas regionales junto con todos los documentos en inglés y mixtos.
00:20:39Por lo tanto, pronto podremos reentrenar con los comentarios que recibamos de la implementación actual.
00:20:48Así que sí, ya hemos puesto en marcha ese flujo de trabajo también.
00:20:50Y también hemos iniciado ese proceso de trabajo.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video