Desalineación de modalidad y atribución de originalidad en videos de formato corto — Aditya Gautam, Meta
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00Aditya Rahm: Hola a todos, soy Aditya y vamos a hablar de dos problemas principales
00:00:17que ocurren en las plataformas de vídeos cortos.
00:00:20Hablaremos de cómo abordamos estas cuestiones a gran escala.
00:00:25Para empezar, lo primero es entender cuáles son las características de
00:00:28los datos con los que trabajamos, cuáles son los dos problemas principales en los que
00:00:33estamos trabajando y qué sistemas multiagente usamos para resolverlos a escala.
00:00:39Qué tipo de VLM especializados a pequeña escala podemos crear para resolver cada problema
00:00:46agéntico, cómo construimos esos agentes, cuáles son las distintas formas de
00:00:50optimizarlo, por ejemplo, para hacerlo escalable a altísimo nivel, y luego veremos
00:00:56la evaluación desde una perspectiva holística de 360 grados, no solo como una métrica de precisión y exhaustividad.
00:01:00¿Qué hay ahí fuera?
00:01:01¿Cómo entendemos todo el flujo multiagente, tanto a nivel de LLM, herramientas, MCP y demás,
00:01:08absolutamente todo?
00:01:09Luego abordaremos las técnicas de optimización específicas para visión y
00:01:14específicas para datos, que nos darán la inteligencia necesaria para saber que realmente
00:01:20no hace falta aplicar este flujo inteligente a todos los vídeos, sino que podemos determinar el pequeño
00:01:25conjunto de vídeos candidatos para este proceso.
00:01:29Y concluiremos con las conclusiones principales.
00:01:32Los datos del mundo real son muy caóticos.
00:01:34Hablamos de escalas de más de 100 millones y de un volumen enorme de contenido viral.
00:01:39Hay muchísimo contenido malintencionado.
00:01:42La gente intenta manipular el sistema.
00:01:43Hay mucho texto multilingüe en las pantallas, en los vídeos y en las imágenes.
00:01:48Y los datos son sumamente dinámicos.
00:01:50Cambian constantemente, de un mes a otro.
00:01:52Aparecen nuevas herramientas de IA y de todo tipo.
00:01:54Por tanto, es extremadamente dinámico.
00:01:57Eso implica que hay serios problemas de desviación de datos entre otras cuestiones asociadas a los vídeos.
00:02:00Además, sabemos que no hay una referencia absoluta clara para el problema que intentamos resolver.
00:02:05Así que estos son problemas habituales en los conjuntos de datos de vídeo reales.
00:02:10El primer problema que abordaremos es la falta de alineación modal,
00:02:14empezando por la intermodal, que es un problema bastante resuelto.
00:02:19Puedes usar un modelo CLIP.
00:02:20Puedes tener distintas modalidades en imágenes, vídeos, audio, texto,
00:02:25y calcular exactamente la similitud del coseno en esos incrustamientos.
00:02:29Así que este es un problema mucho más sencillo.
00:02:31De lo que vamos a hablar es de cómo tratamos los problemas intramodales.
00:02:37Imaginemos que tenemos un vídeo.
00:02:39Tenemos un vídeo largo.
00:02:40Y de repente ves algo, un anuncio, propaganda, algo político,
00:02:45o algo fuera de lugar que no debería estar ahí según lo que seleccionaste.
00:02:49Entonces, ¿cómo analizamos los pequeños fragmentos del vídeo, entendemos el problema
00:02:54y detectamos dónde hay una anomalía o una conducta maliciosa
00:02:59que no debería estar ahí desde un principio?
00:03:01Este es el primer problema, que exige una comprensión granular profunda, tanto visual
00:03:05como de vídeo, para ver qué sucede a nivel de clip y de fotograma.
00:03:10El segundo problema es identificar el contenido no original.
00:03:14En la economía actual, con las herramientas de IA disponibles, es facilísimo duplicar contenido.
00:03:19Cuando alguien sube un vídeo, vemos que se copia, se transforma,
00:03:25y con las nuevas herramientas resulta cada vez más sencillo alterar estos vídeos.
00:03:29Entonces, ¿cómo detectamos este tipo de contenido no original?
00:03:33¿Cómo identificamos la fuente del vídeo?
00:03:35Esto genera problemas de atribución, créditos y un desequilibrio en el ecosistema.
00:03:41Produce un gran cansancio en los usuarios al ver infinidad de vídeos repetitivos que no deberían estar ahí.
00:03:47Pasando al sistema multiagente, la primera pregunta es por qué recurrir a un enfoque multiagente
00:03:54en vez de un solo agente o un solo LLM, y la razón es la alta complejidad del problema.
00:03:57Requiere nodos muy especializados y una comprensión puntual en cada fase: recuperación,
00:04:04análisis de contenido y razonamiento.
00:04:07Si pudieras resolver el problema con un único agente o LLM, no haría falta emplear sistemas multiagente.
00:04:14Así es como estructuramos el núcleo central y cómo planteamos la descomposición de este problema.
00:04:22Primero se pasa un vídeo con su ID y toda la información a un agente revisor.
00:04:28Este es el agente central.
00:04:29Básicamente, actúa como el orquestador.
00:04:31Imagina que funciona como una pasarela API que descompone las señales y determina qué ocurre en la imagen.
00:04:38Lo que hace este componente es recurrir al agente perceptor, el cual puede considerarse
00:04:46como un experto VLM muy sofisticado que dispone de múltiples herramientas de imagen y vídeo.
00:04:52El agente perceptor toma el ID del agente revisor y extrae el vídeo de la base de datos.
00:05:01Lo divide en partes más pequeñas mediante distintas herramientas, incrustamientos semánticos y análisis de variaciones temporales.
00:05:08Esto excede un poco el alcance de esta charla, pero es nuestra técnica para evitar trabajar a una tasa de fotogramas fija.
00:05:17En su lugar, detectamos dónde ocurren los cambios temporales y comprimimos los fotogramas similares en uno o dos.
00:05:23Luego, el agente perceptor obtiene los datos del clip y sus incrustamientos, recopilando etiquetas, OCR y todo el contenido presente,
00:05:34la descripción en lenguaje natural y las marcas de tiempo entre fotogramas para definir estos metadatos.
00:05:41A continuación, envía esa información al revisor.
00:05:43El revisor analiza toda la estructura temporal del objeto JSON crudo enviado por el perceptor, junto con incrustamientos, IDs semánticos, etiquetas u OCR.
00:05:52Con ello realiza un análisis temporal.
00:05:55Comprueba si, por ejemplo, del primer fotograma al 360, o durante los primeros seis segundos, el vídeo trataba de deportes,
00:06:05y nota que de repente, del segundo 6 al 6,5, o entre ciertos fotogramas, la temática cambia bruscamente a algo político.
00:06:14Así, solo con examinar los metadatos, el agente revisor logra entender, interpretar y precisar qué anomalía surge en
00:06:22el espacio temporal.
00:06:23Una vez hecho esto, determina si se trata de una falta de alineación modal o si hay un problema mayor involucrado.
00:06:30Así que el agente revisor consulta al agente recuperador y le indica: “Este es el vídeo que estoy analizando.
00:06:36Estos son algunos metadatos que ya he desduplicado y procesado.
00:06:41Ahora dame información sobre clips similares disponibles en el corpus”.
00:06:47El agente recuperador revisa las señales del perceptor y los metadatos del clip y del vídeo completo para indexarlos de forma adaptativa en distintas bases de datos.
00:06:57Por ejemplo, para los temas se puede usar un índice invertido con temas y múltiples vídeos.
00:07:02Para los incrustamientos se emplean bases de datos vectoriales estándar.
00:07:06Y para las entidades extraídas se usan bases de datos orientadas a grafos, donde el revisor evalúa las bases de datos, las entidades y los metadatos.
00:07:16Esto permite indexarlos para que, durante la inferencia en tiempo real, se puedan identificar clips, entidades y temas similares para recuperar y mejorar la exhaustividad.
00:07:28Pasando a los agentes individuales, ya hemos mencionado al perceptor.
00:07:32Examina todo el vídeo, hace una descomposición temporal en pequeños clips mediante incrustamientos semánticos y algoritmos, y ajusta el VLM para emitir datos concretos
00:07:45e información muy granular sobre cada clip y sobre el vídeo completo.
00:07:51Dado que trabajamos a gran escala, no podemos limitarnos a usar los VLM genéricos del mercado.
00:07:56Es necesario aplicar compresión y métodos rentables para ejecutar estos modelos sobre miles de millones de fotogramas.
00:08:05Por ello recurrimos a preentrenamiento, ajuste fino, destilación de conocimiento y cuantización para desplegar y solucionar tareas con
00:08:13VLM sumamente especializados para este problema específico.
00:08:16A continuación detallaremos brevemente este punto.
00:08:19El agente recuperador es el que explicamos anteriormente a alto nivel.
00:08:22Lo que hace en el procesamiento fuera de línea es tomar todas las señales descompuestas previamente por el perceptor,
00:08:29usando esa biblioteca para llevar a cabo un análisis fuera de línea masivo.
00:08:34Por ejemplo, utilizando un clúster Ray o una arquitectura similar.
00:08:37Una vez obtenidos esos metadatos, procede a indexarlos en diversas bases de datos.
00:08:42Realiza agrupamientos periódicos fuera de línea para hallar contenidos similares y asignar IDs de incrustación y de clúster a cada clip y vídeo.
00:08:50Estos datos son los que utiliza luego la inferencia en tiempo real para encontrar vídeos parecidos.
00:08:56En el proceso en tiempo real, se le pasa una consulta o ID de clip junto con sus metadatos.
00:09:01El sistema determina qué contenidos del corpus guardan relación con esa consulta.
00:09:06E identifica los elementos que presentan mayor nivel de similitud.
00:09:09Así, consulta las bases de datos, localiza clips y autores afines, y recupera información de metadatos.
00:09:16Reordena a esos candidatos y utiliza algunas herramientas, por ejemplo, la puntuación de spam de modelos tradicionales, como la puntuación de clasificación,
00:09:24para ver cuáles son los candidatos que podrían ser spam, cuáles podrían no ser de alta calidad y ese tipo de cosas.
00:09:29Y una vez que tiene esos mejores N candidatos, se los devuelve al Revisor.
00:09:33Y el Revisor es donde realmente procesa: “Estas son mis señales de contenido principal y embeddings de fragmentos.
00:09:39Estos son videos similares entregados por el Recuperador.
00:09:42Déjame pensarlo y ver si necesito volver a consultar y obtener más datos del Recuperador”.
00:09:48Ahí es donde el Revisor tiene todas las señales temporales de un solo fragmento.
00:09:52Tiene toda la información sobre fragmentos similares, comprensión, autores parecidos y demás.
00:09:58También cuenta con información en tiempo real sobre cómo interactúan los usuarios con este video:
00:10:03¿qué tipo de reportes o comentarios hay, cuál es el sentimiento de esos comentarios?, ¿de acuerdo?
00:10:13Muchas de estas señales, que suelen pasarse por alto en las procesadas de forma offline, los VLM y otros agentes,
00:10:18también se incorporan para detectar si hay un cambio en el sentimiento.
00:10:22¿Qué respuesta estoy obteniendo en tiempo real?
00:10:25Existen diferentes herramientas para comprender el video, no solo desde la perspectiva del contenido
00:10:30o la semántica, sino desde la perspectiva de la interacción del usuario.
00:10:36Esas señales son sumamente importantes.
00:10:38Una vez definido este trabajo y todo lo demás, construimos este marco basado en agentes.
00:10:44En cada uno de estos marcos, los tres agentes funcionan impulsados por
00:10:50VLM especializados y VLM a pequeña escala.
00:10:54Hablaremos primero del preentrenamiento.
00:10:58En la mayoría de los casos se ve un preentrenamiento estándar:
00:11:01ajustas un poco tu Vision Transformer por aquí y por allá y lo dejas listo para tu propósito específico.
00:11:08El problema es que estos VLM disponibles externamente, los modelos base o de primera línea,
00:11:14están entrenados con conjuntos de datos de la web muy limpios, pulidos y bien ajustados.
00:11:20Sin embargo, los datos internos para un propósito específico no tienen esas mismas características.
00:11:26Son desordenados.
00:11:27Son generados por usuarios.
00:11:28Son específicos para tu flujo de trabajo.
00:11:30Eso significa que debes preentrenar con esos tokens de imagen y lenguaje para ajustar tu Vision Transformer desde cero
00:11:37y evaluar si hay una diferencia entre un ajuste fino habitual o entrenarlo desde cero.
00:11:42Ahí es donde el preentrenamiento resulta útil.
00:11:44Es algo más costoso, pero si logra marcar una diferencia, funciona realmente bien.
00:11:50Lo segundo es el ajuste fino por instrucciones, donde abordamos dos problemas.
00:11:54Tenemos ciertas políticas y directrices.
00:11:57Conocemos el contenido y las señales disponibles, y el modelo se entrena y ajusta en ese conjunto de datos específico con una
00:12:04salida definida (un esquema JSON) para detectar desalineaciones de modalidad,
00:12:10duplicación de puntuaciones y otros razonamientos de cadena de pensamiento proporcionados por el agente Revisor.
00:12:16Aquí tenemos un fragmento de video.
00:12:17Tenemos un codificador visual que ya hemos preentrenado un poco.
00:12:21Ahora le aplicamos un poco más de entrenamiento.
00:12:23Hay un proyector situado entre el Vision Transformer y los modelos de lenguaje,
00:12:27el cual sirve básicamente como puente entre ambos.
00:12:30Y luego obtenemos la salida según los datos de ajuste fino por instrucciones que tenemos de este lado.
00:12:35Esta es la parte clave para aumentar el rendimiento del modelo en tu dominio específico.
00:12:45El contexto consiste en definir un rol, una política y las herramientas disponibles para
00:12:50fundamentar eso en los metadatos y demás elementos existentes.
00:12:54Ofrécele todo de forma muy breve dentro del contexto, y deja que determine cuál es la
00:13:01hemos creado para definir exactamente los aspectos de modalidad y los diferentes problemas detectados,
00:13:06así como los distintos razonamientos de cadena de pensamiento que debería incluir el modelo
00:13:12y cómo se ve la salida para un revisor humano.
00:13:15Se trata de un conjunto de datos de muy alta calidad
00:13:21con el que estamos realizando el ajuste fino para diferentes agentes, ¿de acuerdo?
00:13:27Una vez terminado el preentrenamiento para comprender la parte visual u otras modalidades de los videos,
00:13:33pasamos al ajuste fino para enseñarle a procesar y proporcionar el contexto y la salida
00:13:38en el formato exacto en que deseamos trabajar el conjunto de datos. La siguiente fase es la de DPO,
00:13:44una técnica ampliamente utilizada en el posentrenamiento para afinar los modelos
00:13:51hacia un área, dominio o comprensión de políticas específicas. No obstante, esta técnica también
00:13:58se aprovecha mucho en producción para identificar qué muestras no están obteniendo
00:14:02buenos resultados mediante tus sistemas multiagente y tus LLM.
00:14:11Lo que se puede hacer es tomar ese conjunto de datos que llega de producción,
00:14:17donde ocurren muchas inferencias, extraer una submuestra de estos datos de producción,
00:14:23pasarla por un LLM evaluador entrenado internamente con datos etiquetados por humanos, y luego
00:14:29recurrir a la cola de revisión humana para evaluar el rendimiento real del sistema.
00:14:36Una vez hecho esto, si el rendimiento es excelente y supera el umbral de predicción establecido
00:14:40(por ejemplo, un 95% para cada problema), perfecto. Pero si no es así, significa que debe haber
00:14:47tiene que haber una forma de aprender de esas muestras donde el modelo no dio la talla.
00:14:52Ahí es donde entra la revisión humana. Analiza todas las trazas existentes de cada agente,
00:14:57las llamadas a LLM, MCP, y determina dónde estuvo el fallo. ¿Acaso fue un problema
00:15:02de razonamiento en la cadena de pensamiento? ¿O falló la recuperación porque se usaron herramientas incorrectas?
00:15:08Así que realizas todas esas validaciones y entiendes cada nodo y punto clave, tanto a nivel
00:15:14de inteligencia del modelo como a nivel de resistencia de la infraestructura, e identificas las mejoras
00:15:20que debes implementar en esas muestras clasificadas de forma errónea por nuestro sistema.
00:15:28Una vez obtenido esto, identificas las muestras positivas y negativas, defines qué ajustar,
00:15:34y reentrenas el modelo para lograr una versión optimizada. Es un proceso de mejora continua
00:15:40donde revisamos muestras, reentrenamos y perfeccionamos modelos, generando un nuevo conjunto de datos
00:15:46a partir de la producción para identificar si hubo desviación o entender qué está ejecutando
00:15:53el modelo. Este control humano es una constante donde se toman muestras diarias
00:15:58de producción para evaluar el desempeño del modelo y del evaluador basado en LLM.
00:16:05Por temas de costos y para operar a esta escala, no podemos recurrir a modelos VLM estándar
00:16:14de vanguardia, ya que carecen de escalabilidad y exigen una alta inferencia y complejidad,
00:16:20cuando nuestro objetivo es resolver un problema extremadamente específico. No me interesa si el modelo resuelve
00:16:25código; solo busco solucionar mi dominio específico. Eso es lo único relevante. Al ser un proceso interno
00:16:31sin exposición directa al cliente, aplicaría destilación de conocimiento dentro y fuera de la política de entrenamiento,
00:16:37junto con una cuantización experimental para analizar si conviene trabajar
00:16:41en 4 bits o en punto flotante bfloat16. Luego, elaboraría una tabla comparativa
00:16:47con distintos tamaños de destilación y niveles de cuantización para determinar dónde
00:16:54el rendimiento cumple las expectativas y genera ahorros significativos en cómputo
00:17:00y costos de inferencia en producción. Esta optimización resulta fundamental porque,
00:17:07aunque la solución al problema sea efectiva, en entorno de producción debe ser escalable
00:17:13y económicamente viable; no basta con usar cualquier alternativa comercial disponible,
00:17:21ya que atendemos una necesidad muy concreta. Volviendo a la evaluación,
00:17:27lo principal es el éxito de la tarea. Son aspectos binarios: la modalidad se ejecuta
00:17:31o no se ejecuta, hay alineación o no la hay. Métricas como precisión, exhaustividad y F1 son
00:17:37las idóneas para medir este éxito. Sin embargo, buscamos evaluar el sistema de forma integral,
00:17:42sin centrarnos solo en el resultado final, sino analizando el rendimiento de cada nodo,
00:17:47la latencia y precisión del sistema de búsqueda, y la eficacia del razonamiento.
00:17:53¿Cómo se desarrolla la cadena de pensamiento en cada nivel de agente o donde aplique
00:17:59dicho razonamiento (como el agente revisor en nuestro caso)? ¿Cuál es la calidad del mismo?
00:18:04¿Hay sobreprocesamiento? ¿Podemos reducir el presupuesto de cómputo asegurando que el modelo
00:18:09mantenga un buen desempeño? ¿O conviene aumentar el presupuesto de planificación y razonamiento
00:18:16para que problemas complejos obtengan una precisión y un rendimiento notablemente superiores?
00:18:22Contar con una asignación adaptativa de presupuesto para el razonamiento resulta determinante.
00:18:29Por otro lado, está la robustez: qué casos límite detectamos, cuáles son las tasas de error
00:18:34y en qué nodos o puntos ocurren. Podría ser un fallo en la llamada a una herramienta,
00:18:39en la etapa de recuperación, o deficiencias en el propio LLM. Adicionalmente,
00:18:45evaluamos la eficiencia del sistema, no solo enfocándonos en la calidad de la respuesta,
00:18:51sino examinando el costo en tokens de cada aspecto. ¿Qué LLM estamos invocando?
00:18:56¿Es posible optimizar más el LLM para reducir costos? ¿Qué nivel de eficiencia
00:19:01y latencia presentan tanto los agentes individuales como el sistema en su conjunto?
00:19:08En cuanto al LLM evaluador, sabemos que en todo sistema predictivo existe una pérdida de ajuste
00:19:14en los datos, especialmente al procesar contenido generado por usuarios. Por ello, medimos cómo responde
00:19:20nuestro LLM evaluador frente a las métricas del equipo de validación humana. ¿Existe desviación?
00:19:25¿Se requiere reentrenar el LLM evaluador con los nuevos datos etiquetados? ¿O cómo abordamos
00:19:30esos aspectos? En cuanto a la optimización, aplicamos técnicas de reducción espacio-temporal,
00:19:35analizando fotogramas similares para comprimirlos en una sola representación. Esto reduce
00:19:41drásticamente el procesamiento total de los videos. Una segunda técnica consiste en implementar
00:19:47memoria caché para contenidos virales recurrentes, evitando que una misma entrada
00:19:52recorra toda la cadena de procesamiento. Si el nivel de similitud es alto, se omite el sistema
00:19:57multiagente y se emite la respuesta directa. El tercer factor clave
00:20:01es el purgado de metadatos. Esto permite acotar el espacio de búsqueda entre múltiples candidatos
00:20:07utilizando metadatos, como temáticas o creadores con un historial verificado.
00:20:12Esto evita tener que procesar todas las imágenes y videos provenientes de un creador
00:20:18que cuenta con un alto índice de autenticidad, excelente desempeño,
00:20:22alta calidad de video y buen nivel de interacción. Estos metadatos
00:20:27permiten filtrar contenido de antemano para descartar videos antes de que ingresen al sistema.
00:20:33Estas reglas son de gran utilidad. Como conclusión principal de esta sesión,
00:20:42la descomposición es la clave: hay que desglosar el problema según sea necesario. La optimización adaptativa
00:20:50es vital para asegurar el retorno de inversión y la viabilidad económica. Una evaluación rigurosa es esencial;
00:20:56todo el funcionamiento depende de ella, siendo la base de su arquitectura y de sus modelos VLM.
00:21:02Por último, monitorear predicciones y realizar mejoras cualitativas resulta indispensable para la sostenibilidad a largo plazo.
00:21:08Con esto concluyo la presentación. Muchas gracias por su atención.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video