Desalineación de modalidad y atribución de originalidad en videos de formato corto — Aditya Gautam, Meta

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00Aditya Rahm: Hola a todos, soy Aditya y vamos a hablar de dos problemas principales
00:00:17que ocurren en las plataformas de vídeos cortos.
00:00:20Hablaremos de cómo abordamos estas cuestiones a gran escala.
00:00:25Para empezar, lo primero es entender cuáles son las características de
00:00:28los datos con los que trabajamos, cuáles son los dos problemas principales en los que
00:00:33estamos trabajando y qué sistemas multiagente usamos para resolverlos a escala.
00:00:39Qué tipo de VLM especializados a pequeña escala podemos crear para resolver cada problema
00:00:46agéntico, cómo construimos esos agentes, cuáles son las distintas formas de
00:00:50optimizarlo, por ejemplo, para hacerlo escalable a altísimo nivel, y luego veremos
00:00:56la evaluación desde una perspectiva holística de 360 grados, no solo como una métrica de precisión y exhaustividad.
00:01:00¿Qué hay ahí fuera?
00:01:01¿Cómo entendemos todo el flujo multiagente, tanto a nivel de LLM, herramientas, MCP y demás,
00:01:08absolutamente todo?
00:01:09Luego abordaremos las técnicas de optimización específicas para visión y
00:01:14específicas para datos, que nos darán la inteligencia necesaria para saber que realmente
00:01:20no hace falta aplicar este flujo inteligente a todos los vídeos, sino que podemos determinar el pequeño
00:01:25conjunto de vídeos candidatos para este proceso.
00:01:29Y concluiremos con las conclusiones principales.
00:01:32Los datos del mundo real son muy caóticos.
00:01:34Hablamos de escalas de más de 100 millones y de un volumen enorme de contenido viral.
00:01:39Hay muchísimo contenido malintencionado.
00:01:42La gente intenta manipular el sistema.
00:01:43Hay mucho texto multilingüe en las pantallas, en los vídeos y en las imágenes.
00:01:48Y los datos son sumamente dinámicos.
00:01:50Cambian constantemente, de un mes a otro.
00:01:52Aparecen nuevas herramientas de IA y de todo tipo.
00:01:54Por tanto, es extremadamente dinámico.
00:01:57Eso implica que hay serios problemas de desviación de datos entre otras cuestiones asociadas a los vídeos.
00:02:00Además, sabemos que no hay una referencia absoluta clara para el problema que intentamos resolver.
00:02:05Así que estos son problemas habituales en los conjuntos de datos de vídeo reales.
00:02:10El primer problema que abordaremos es la falta de alineación modal,
00:02:14empezando por la intermodal, que es un problema bastante resuelto.
00:02:19Puedes usar un modelo CLIP.
00:02:20Puedes tener distintas modalidades en imágenes, vídeos, audio, texto,
00:02:25y calcular exactamente la similitud del coseno en esos incrustamientos.
00:02:29Así que este es un problema mucho más sencillo.
00:02:31De lo que vamos a hablar es de cómo tratamos los problemas intramodales.
00:02:37Imaginemos que tenemos un vídeo.
00:02:39Tenemos un vídeo largo.
00:02:40Y de repente ves algo, un anuncio, propaganda, algo político,
00:02:45o algo fuera de lugar que no debería estar ahí según lo que seleccionaste.
00:02:49Entonces, ¿cómo analizamos los pequeños fragmentos del vídeo, entendemos el problema
00:02:54y detectamos dónde hay una anomalía o una conducta maliciosa
00:02:59que no debería estar ahí desde un principio?
00:03:01Este es el primer problema, que exige una comprensión granular profunda, tanto visual
00:03:05como de vídeo, para ver qué sucede a nivel de clip y de fotograma.
00:03:10El segundo problema es identificar el contenido no original.
00:03:14En la economía actual, con las herramientas de IA disponibles, es facilísimo duplicar contenido.
00:03:19Cuando alguien sube un vídeo, vemos que se copia, se transforma,
00:03:25y con las nuevas herramientas resulta cada vez más sencillo alterar estos vídeos.
00:03:29Entonces, ¿cómo detectamos este tipo de contenido no original?
00:03:33¿Cómo identificamos la fuente del vídeo?
00:03:35Esto genera problemas de atribución, créditos y un desequilibrio en el ecosistema.
00:03:41Produce un gran cansancio en los usuarios al ver infinidad de vídeos repetitivos que no deberían estar ahí.
00:03:47Pasando al sistema multiagente, la primera pregunta es por qué recurrir a un enfoque multiagente
00:03:54en vez de un solo agente o un solo LLM, y la razón es la alta complejidad del problema.
00:03:57Requiere nodos muy especializados y una comprensión puntual en cada fase: recuperación,
00:04:04análisis de contenido y razonamiento.
00:04:07Si pudieras resolver el problema con un único agente o LLM, no haría falta emplear sistemas multiagente.
00:04:14Así es como estructuramos el núcleo central y cómo planteamos la descomposición de este problema.
00:04:22Primero se pasa un vídeo con su ID y toda la información a un agente revisor.
00:04:28Este es el agente central.
00:04:29Básicamente, actúa como el orquestador.
00:04:31Imagina que funciona como una pasarela API que descompone las señales y determina qué ocurre en la imagen.
00:04:38Lo que hace este componente es recurrir al agente perceptor, el cual puede considerarse
00:04:46como un experto VLM muy sofisticado que dispone de múltiples herramientas de imagen y vídeo.
00:04:52El agente perceptor toma el ID del agente revisor y extrae el vídeo de la base de datos.
00:05:01Lo divide en partes más pequeñas mediante distintas herramientas, incrustamientos semánticos y análisis de variaciones temporales.
00:05:08Esto excede un poco el alcance de esta charla, pero es nuestra técnica para evitar trabajar a una tasa de fotogramas fija.
00:05:17En su lugar, detectamos dónde ocurren los cambios temporales y comprimimos los fotogramas similares en uno o dos.
00:05:23Luego, el agente perceptor obtiene los datos del clip y sus incrustamientos, recopilando etiquetas, OCR y todo el contenido presente,
00:05:34la descripción en lenguaje natural y las marcas de tiempo entre fotogramas para definir estos metadatos.
00:05:41A continuación, envía esa información al revisor.
00:05:43El revisor analiza toda la estructura temporal del objeto JSON crudo enviado por el perceptor, junto con incrustamientos, IDs semánticos, etiquetas u OCR.
00:05:52Con ello realiza un análisis temporal.
00:05:55Comprueba si, por ejemplo, del primer fotograma al 360, o durante los primeros seis segundos, el vídeo trataba de deportes,
00:06:05y nota que de repente, del segundo 6 al 6,5, o entre ciertos fotogramas, la temática cambia bruscamente a algo político.
00:06:14Así, solo con examinar los metadatos, el agente revisor logra entender, interpretar y precisar qué anomalía surge en
00:06:22el espacio temporal.
00:06:23Una vez hecho esto, determina si se trata de una falta de alineación modal o si hay un problema mayor involucrado.
00:06:30Así que el agente revisor consulta al agente recuperador y le indica: “Este es el vídeo que estoy analizando.
00:06:36Estos son algunos metadatos que ya he desduplicado y procesado.
00:06:41Ahora dame información sobre clips similares disponibles en el corpus”.
00:06:47El agente recuperador revisa las señales del perceptor y los metadatos del clip y del vídeo completo para indexarlos de forma adaptativa en distintas bases de datos.
00:06:57Por ejemplo, para los temas se puede usar un índice invertido con temas y múltiples vídeos.
00:07:02Para los incrustamientos se emplean bases de datos vectoriales estándar.
00:07:06Y para las entidades extraídas se usan bases de datos orientadas a grafos, donde el revisor evalúa las bases de datos, las entidades y los metadatos.
00:07:16Esto permite indexarlos para que, durante la inferencia en tiempo real, se puedan identificar clips, entidades y temas similares para recuperar y mejorar la exhaustividad.
00:07:28Pasando a los agentes individuales, ya hemos mencionado al perceptor.
00:07:32Examina todo el vídeo, hace una descomposición temporal en pequeños clips mediante incrustamientos semánticos y algoritmos, y ajusta el VLM para emitir datos concretos
00:07:45e información muy granular sobre cada clip y sobre el vídeo completo.
00:07:51Dado que trabajamos a gran escala, no podemos limitarnos a usar los VLM genéricos del mercado.
00:07:56Es necesario aplicar compresión y métodos rentables para ejecutar estos modelos sobre miles de millones de fotogramas.
00:08:05Por ello recurrimos a preentrenamiento, ajuste fino, destilación de conocimiento y cuantización para desplegar y solucionar tareas con
00:08:13VLM sumamente especializados para este problema específico.
00:08:16A continuación detallaremos brevemente este punto.
00:08:19El agente recuperador es el que explicamos anteriormente a alto nivel.
00:08:22Lo que hace en el procesamiento fuera de línea es tomar todas las señales descompuestas previamente por el perceptor,
00:08:29usando esa biblioteca para llevar a cabo un análisis fuera de línea masivo.
00:08:34Por ejemplo, utilizando un clúster Ray o una arquitectura similar.
00:08:37Una vez obtenidos esos metadatos, procede a indexarlos en diversas bases de datos.
00:08:42Realiza agrupamientos periódicos fuera de línea para hallar contenidos similares y asignar IDs de incrustación y de clúster a cada clip y vídeo.
00:08:50Estos datos son los que utiliza luego la inferencia en tiempo real para encontrar vídeos parecidos.
00:08:56En el proceso en tiempo real, se le pasa una consulta o ID de clip junto con sus metadatos.
00:09:01El sistema determina qué contenidos del corpus guardan relación con esa consulta.
00:09:06E identifica los elementos que presentan mayor nivel de similitud.
00:09:09Así, consulta las bases de datos, localiza clips y autores afines, y recupera información de metadatos.
00:09:16Reordena a esos candidatos y utiliza algunas herramientas, por ejemplo, la puntuación de spam de modelos tradicionales, como la puntuación de clasificación,
00:09:24para ver cuáles son los candidatos que podrían ser spam, cuáles podrían no ser de alta calidad y ese tipo de cosas.
00:09:29Y una vez que tiene esos mejores N candidatos, se los devuelve al Revisor.
00:09:33Y el Revisor es donde realmente procesa: “Estas son mis señales de contenido principal y embeddings de fragmentos.
00:09:39Estos son videos similares entregados por el Recuperador.
00:09:42Déjame pensarlo y ver si necesito volver a consultar y obtener más datos del Recuperador”.
00:09:48Ahí es donde el Revisor tiene todas las señales temporales de un solo fragmento.
00:09:52Tiene toda la información sobre fragmentos similares, comprensión, autores parecidos y demás.
00:09:58También cuenta con información en tiempo real sobre cómo interactúan los usuarios con este video:
00:10:03¿qué tipo de reportes o comentarios hay, cuál es el sentimiento de esos comentarios?, ¿de acuerdo?
00:10:13Muchas de estas señales, que suelen pasarse por alto en las procesadas de forma offline, los VLM y otros agentes,
00:10:18también se incorporan para detectar si hay un cambio en el sentimiento.
00:10:22¿Qué respuesta estoy obteniendo en tiempo real?
00:10:25Existen diferentes herramientas para comprender el video, no solo desde la perspectiva del contenido
00:10:30o la semántica, sino desde la perspectiva de la interacción del usuario.
00:10:36Esas señales son sumamente importantes.
00:10:38Una vez definido este trabajo y todo lo demás, construimos este marco basado en agentes.
00:10:44En cada uno de estos marcos, los tres agentes funcionan impulsados por
00:10:50VLM especializados y VLM a pequeña escala.
00:10:54Hablaremos primero del preentrenamiento.
00:10:58En la mayoría de los casos se ve un preentrenamiento estándar:
00:11:01ajustas un poco tu Vision Transformer por aquí y por allá y lo dejas listo para tu propósito específico.
00:11:08El problema es que estos VLM disponibles externamente, los modelos base o de primera línea,
00:11:14están entrenados con conjuntos de datos de la web muy limpios, pulidos y bien ajustados.
00:11:20Sin embargo, los datos internos para un propósito específico no tienen esas mismas características.
00:11:26Son desordenados.
00:11:27Son generados por usuarios.
00:11:28Son específicos para tu flujo de trabajo.
00:11:30Eso significa que debes preentrenar con esos tokens de imagen y lenguaje para ajustar tu Vision Transformer desde cero
00:11:37y evaluar si hay una diferencia entre un ajuste fino habitual o entrenarlo desde cero.
00:11:42Ahí es donde el preentrenamiento resulta útil.
00:11:44Es algo más costoso, pero si logra marcar una diferencia, funciona realmente bien.
00:11:50Lo segundo es el ajuste fino por instrucciones, donde abordamos dos problemas.
00:11:54Tenemos ciertas políticas y directrices.
00:11:57Conocemos el contenido y las señales disponibles, y el modelo se entrena y ajusta en ese conjunto de datos específico con una
00:12:04salida definida (un esquema JSON) para detectar desalineaciones de modalidad,
00:12:10duplicación de puntuaciones y otros razonamientos de cadena de pensamiento proporcionados por el agente Revisor.
00:12:16Aquí tenemos un fragmento de video.
00:12:17Tenemos un codificador visual que ya hemos preentrenado un poco.
00:12:21Ahora le aplicamos un poco más de entrenamiento.
00:12:23Hay un proyector situado entre el Vision Transformer y los modelos de lenguaje,
00:12:27el cual sirve básicamente como puente entre ambos.
00:12:30Y luego obtenemos la salida según los datos de ajuste fino por instrucciones que tenemos de este lado.
00:12:35Esta es la parte clave para aumentar el rendimiento del modelo en tu dominio específico.
00:12:45El contexto consiste en definir un rol, una política y las herramientas disponibles para
00:12:50fundamentar eso en los metadatos y demás elementos existentes.
00:12:54Ofrécele todo de forma muy breve dentro del contexto, y deja que determine cuál es la
00:13:01hemos creado para definir exactamente los aspectos de modalidad y los diferentes problemas detectados,
00:13:06así como los distintos razonamientos de cadena de pensamiento que debería incluir el modelo
00:13:12y cómo se ve la salida para un revisor humano.
00:13:15Se trata de un conjunto de datos de muy alta calidad
00:13:21con el que estamos realizando el ajuste fino para diferentes agentes, ¿de acuerdo?
00:13:27Una vez terminado el preentrenamiento para comprender la parte visual u otras modalidades de los videos,
00:13:33pasamos al ajuste fino para enseñarle a procesar y proporcionar el contexto y la salida
00:13:38en el formato exacto en que deseamos trabajar el conjunto de datos. La siguiente fase es la de DPO,
00:13:44una técnica ampliamente utilizada en el posentrenamiento para afinar los modelos
00:13:51hacia un área, dominio o comprensión de políticas específicas. No obstante, esta técnica también
00:13:58se aprovecha mucho en producción para identificar qué muestras no están obteniendo
00:14:02buenos resultados mediante tus sistemas multiagente y tus LLM.
00:14:11Lo que se puede hacer es tomar ese conjunto de datos que llega de producción,
00:14:17donde ocurren muchas inferencias, extraer una submuestra de estos datos de producción,
00:14:23pasarla por un LLM evaluador entrenado internamente con datos etiquetados por humanos, y luego
00:14:29recurrir a la cola de revisión humana para evaluar el rendimiento real del sistema.
00:14:36Una vez hecho esto, si el rendimiento es excelente y supera el umbral de predicción establecido
00:14:40(por ejemplo, un 95% para cada problema), perfecto. Pero si no es así, significa que debe haber
00:14:47tiene que haber una forma de aprender de esas muestras donde el modelo no dio la talla.
00:14:52Ahí es donde entra la revisión humana. Analiza todas las trazas existentes de cada agente,
00:14:57las llamadas a LLM, MCP, y determina dónde estuvo el fallo. ¿Acaso fue un problema
00:15:02de razonamiento en la cadena de pensamiento? ¿O falló la recuperación porque se usaron herramientas incorrectas?
00:15:08Así que realizas todas esas validaciones y entiendes cada nodo y punto clave, tanto a nivel
00:15:14de inteligencia del modelo como a nivel de resistencia de la infraestructura, e identificas las mejoras
00:15:20que debes implementar en esas muestras clasificadas de forma errónea por nuestro sistema.
00:15:28Una vez obtenido esto, identificas las muestras positivas y negativas, defines qué ajustar,
00:15:34y reentrenas el modelo para lograr una versión optimizada. Es un proceso de mejora continua
00:15:40donde revisamos muestras, reentrenamos y perfeccionamos modelos, generando un nuevo conjunto de datos
00:15:46a partir de la producción para identificar si hubo desviación o entender qué está ejecutando
00:15:53el modelo. Este control humano es una constante donde se toman muestras diarias
00:15:58de producción para evaluar el desempeño del modelo y del evaluador basado en LLM.
00:16:05Por temas de costos y para operar a esta escala, no podemos recurrir a modelos VLM estándar
00:16:14de vanguardia, ya que carecen de escalabilidad y exigen una alta inferencia y complejidad,
00:16:20cuando nuestro objetivo es resolver un problema extremadamente específico. No me interesa si el modelo resuelve
00:16:25código; solo busco solucionar mi dominio específico. Eso es lo único relevante. Al ser un proceso interno
00:16:31sin exposición directa al cliente, aplicaría destilación de conocimiento dentro y fuera de la política de entrenamiento,
00:16:37junto con una cuantización experimental para analizar si conviene trabajar
00:16:41en 4 bits o en punto flotante bfloat16. Luego, elaboraría una tabla comparativa
00:16:47con distintos tamaños de destilación y niveles de cuantización para determinar dónde
00:16:54el rendimiento cumple las expectativas y genera ahorros significativos en cómputo
00:17:00y costos de inferencia en producción. Esta optimización resulta fundamental porque,
00:17:07aunque la solución al problema sea efectiva, en entorno de producción debe ser escalable
00:17:13y económicamente viable; no basta con usar cualquier alternativa comercial disponible,
00:17:21ya que atendemos una necesidad muy concreta. Volviendo a la evaluación,
00:17:27lo principal es el éxito de la tarea. Son aspectos binarios: la modalidad se ejecuta
00:17:31o no se ejecuta, hay alineación o no la hay. Métricas como precisión, exhaustividad y F1 son
00:17:37las idóneas para medir este éxito. Sin embargo, buscamos evaluar el sistema de forma integral,
00:17:42sin centrarnos solo en el resultado final, sino analizando el rendimiento de cada nodo,
00:17:47la latencia y precisión del sistema de búsqueda, y la eficacia del razonamiento.
00:17:53¿Cómo se desarrolla la cadena de pensamiento en cada nivel de agente o donde aplique
00:17:59dicho razonamiento (como el agente revisor en nuestro caso)? ¿Cuál es la calidad del mismo?
00:18:04¿Hay sobreprocesamiento? ¿Podemos reducir el presupuesto de cómputo asegurando que el modelo
00:18:09mantenga un buen desempeño? ¿O conviene aumentar el presupuesto de planificación y razonamiento
00:18:16para que problemas complejos obtengan una precisión y un rendimiento notablemente superiores?
00:18:22Contar con una asignación adaptativa de presupuesto para el razonamiento resulta determinante.
00:18:29Por otro lado, está la robustez: qué casos límite detectamos, cuáles son las tasas de error
00:18:34y en qué nodos o puntos ocurren. Podría ser un fallo en la llamada a una herramienta,
00:18:39en la etapa de recuperación, o deficiencias en el propio LLM. Adicionalmente,
00:18:45evaluamos la eficiencia del sistema, no solo enfocándonos en la calidad de la respuesta,
00:18:51sino examinando el costo en tokens de cada aspecto. ¿Qué LLM estamos invocando?
00:18:56¿Es posible optimizar más el LLM para reducir costos? ¿Qué nivel de eficiencia
00:19:01y latencia presentan tanto los agentes individuales como el sistema en su conjunto?
00:19:08En cuanto al LLM evaluador, sabemos que en todo sistema predictivo existe una pérdida de ajuste
00:19:14en los datos, especialmente al procesar contenido generado por usuarios. Por ello, medimos cómo responde
00:19:20nuestro LLM evaluador frente a las métricas del equipo de validación humana. ¿Existe desviación?
00:19:25¿Se requiere reentrenar el LLM evaluador con los nuevos datos etiquetados? ¿O cómo abordamos
00:19:30esos aspectos? En cuanto a la optimización, aplicamos técnicas de reducción espacio-temporal,
00:19:35analizando fotogramas similares para comprimirlos en una sola representación. Esto reduce
00:19:41drásticamente el procesamiento total de los videos. Una segunda técnica consiste en implementar
00:19:47memoria caché para contenidos virales recurrentes, evitando que una misma entrada
00:19:52recorra toda la cadena de procesamiento. Si el nivel de similitud es alto, se omite el sistema
00:19:57multiagente y se emite la respuesta directa. El tercer factor clave
00:20:01es el purgado de metadatos. Esto permite acotar el espacio de búsqueda entre múltiples candidatos
00:20:07utilizando metadatos, como temáticas o creadores con un historial verificado.
00:20:12Esto evita tener que procesar todas las imágenes y videos provenientes de un creador
00:20:18que cuenta con un alto índice de autenticidad, excelente desempeño,
00:20:22alta calidad de video y buen nivel de interacción. Estos metadatos
00:20:27permiten filtrar contenido de antemano para descartar videos antes de que ingresen al sistema.
00:20:33Estas reglas son de gran utilidad. Como conclusión principal de esta sesión,
00:20:42la descomposición es la clave: hay que desglosar el problema según sea necesario. La optimización adaptativa
00:20:50es vital para asegurar el retorno de inversión y la viabilidad económica. Una evaluación rigurosa es esencial;
00:20:56todo el funcionamiento depende de ella, siendo la base de su arquitectura y de sus modelos VLM.
00:21:02Por último, monitorear predicciones y realizar mejoras cualitativas resulta indispensable para la sostenibilidad a largo plazo.
00:21:08Con esto concluyo la presentación. Muchas gracias por su atención.

Key Takeaway

La detección eficiente de inconsistencias intramodales y contenido duplicado en videos cortos a escala de 100 millones requiere descomponer el problema en un sistema multiagente especializado, combinando VLM pequeños optimizados con filtrado previo por metadatos y memoria caché.

Highlights

  • Los datos de videos de formato corto a gran escala superan los 100 millones de elementos y sufren problemas severos de desviaciones dinámicas y contenido malintencionado.

  • Un sistema multiagente compuesto por un perceptor, un revisor y un recuperador resuelve la desalineación intramodal y la duplicación de contenido no original.

  • El agente perceptor evita procesar fotogramas a tasa fija al comprimir secuencias similares mediante análisis de variaciones temporales e incrustamientos semánticos.

  • El uso de memoria caché en contenidos virales recurrentes y el filtrado por metadatos evitan que videos legítimos o duplicados frecuentes recorran todo el flujo de inferencia.

  • Para operar a escala de miles de millones de fotogramas, se requiere ajustar Vision Transformers mediante preentrenamiento específico, destilación de conocimiento y cuantización a 4 bits o bfloat16.

Timeline

Desafíos de los datos de video en el mundo real

  • El volumen de contenido en plataformas de video corto supera los 100 millones de elementos dinámicos y multilingües.
  • La falta de una referencia absoluta clara dificulta la resolución directa de anomalías en el contenido.
  • El contenido cambia constantemente de un mes a otro debido a la aparición de nuevas herramientas de generación por IA.

Los datos del mundo real presentan un alto nivel de ruido, texto multilingüe superpuesto en pantalla y manipulaciones malintencionadas. La rápida evolución de las herramientas de creación automatizada genera variaciones constantes que provocan desviaciones de datos. Ante la ausencia de un conjunto de verdad absoluta, el procesamiento requiere métodos capaces de adaptarse a patrones cambiantes sin depender de reglas fijas.

Falta de alineación modal y problemas de atribución de originalidad

  • La alineación intermodal se resuelve mediante cálculo de similitud del coseno sobre incrustamientos CLIP.
  • La desalineación intramodal requiere detectar inserciones fuera de contexto o anomalías dentro de un mismo video.
  • El contenido no original genera cansancio en la audiencia y desequilibrios en la atribución de créditos a creadores.

Mientras que comparar modalidades distintas como texto y audio es un problema resuelto con modelos de espacio de representación compartido, el análisis de incoherencias dentro del propio video exige una comprensión granular a nivel de clip. La facilidad para duplicar y alterar videos mediante IA produce una saturación de duplicados en las plataformas. Detectar la fuente original de un video permite restaurar el equilibrio en la distribución de créditos y mejorar la retención del usuario.

Arquitectura y funcionamiento del sistema multiagente

  • El agente revisor actua como orquestador central que analiza las señales temporales del contenido.
  • El agente perceptor comprime fotogramas similares y extrae metadatos mediante herramientas de VLM, OCR y lenguaje natural.
  • El agente recuperador consulta índices invertidos, bases de datos vectoriales y grafos de entidades para hallar candidatos similares.

La alta complejidad del problema impide el uso de un solo modelo del lenguaje, exigiendo nodos especializados en percepción, análisis y recuperación. El perceptor descompone el video analizando cambios temporales para evitar trabajar con una tasa de fotogramas fija y envía objetos JSON estructurados al revisor. Posteriormente, el revisor analiza la secuencia temporal para identificar saltos temáticos injustificados y solicita al recuperador una lista reordenada de videos similares, integrando además señales de interacción del usuario en tiempo real.

Entrenamiento, optimización y cuantización de VLM especializados

  • El preentrenamiento desde cero del Vision Transformer adapta el modelo a datos desordenados generados por usuarios.
  • El ajuste fino por instrucciones utiliza esquemas JSON definidos para guiar el razonamiento en cadena de pensamiento.
  • La combinación de destilación de conocimiento y cuantización reduce drásticamente el costo de computación en producción.

Los modelos de lenguaje y visión comerciales están optimizados para datos limpios de la web, por lo que resultan ineficientes para el procesamiento interno de contenido sintético o ruidoso. Aplicar un conector proyectado entre el codificador visual y el LLM permite estructurar la salida según directrices estrictas de evaluación. La implementación de optimizaciones como DPO con revisión humana y pruebas comparativas entre 4 bits y bfloat16 asegura la viabilidad económica del sistema sin degradar la precisión temática.

Evaluación holística e ingeniería de rendimiento

  • El éxito del sistema se mide mediante métricas tradicionales de precisión, exhaustividad y puntuación F1.
  • La asignación adaptativa de presupuesto de razonamiento previene el sobreprocesamiento en tareas sencillas.
  • El uso de caché para videos virales y el filtrado por reputación de creadores evita procesar pipelines completos innecesariamente.

Una evaluación integral implica medir la latencia de búsqueda, la robustez ante casos límite y el costo en tokens de cada llamada a los agentes. Reducir la dimensión espacio-temporal agrupando fotogramas idénticos disminuye la carga total de trabajo. Asimismo, omitir el análisis multiagente para creadores con alto índice de autenticidad o para videos virales almacenados en caché reduce los costos operativos y consolida la sostenibilidad del sistema a largo plazo.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video