Désalignement de modalité et attribution de l'originalité dans les vidéos au format court — Aditya Gautam, Meta
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00Aditya Rahm : Bonjour à tous, je suis Aditya, et nous allons parler de deux problèmes principaux
00:00:17qui surviennent sur les plateformes de formats courts.
00:00:20Nous allons voir comment gérer ces situations à grande échelle.
00:00:25Pour commencer, nous allons d'abord comprendre quelles sont les caractéristiques
00:00:28des données à traiter, les deux problèmes majeurs sur lesquels nous travaillons,
00:00:33et les systèmes multi-agents conçus pour résoudre ces problèmes à grande échelle.
00:00:39Quels sont les petits VLM spécialisés à développer pour chaque tâche agentique,
00:00:46comment concevoir ces agents, et quelles méthodes permettent de les optimiser
00:00:50pour assurer une montée en charge massive ? Nous examinerons ensuite
00:00:56l'évaluation de manière globale à 360°, et pas seulement sous l'angle précision-rappel.
00:01:00Que trouve-t-on actuellement ?
00:01:01Comment appréhender tout le pipeline multi-agents, des LLM aux outils, MCP et tout le reste.
00:01:08Absolument tout ce qui existe.
00:01:09Puis nous aborderons les techniques d'optimisation spécifiques à la vision et aux données,
00:01:14qui nous fournissent l'intelligence nécessaire pour comprendre qu'il n'est pas utile
00:01:20d'appliquer ce flux intelligent à toutes les vidéos, mais qu'on peut cibler
00:01:25un petit ensemble de vidéos candidates pour ces opérations.
00:01:29Enfin, nous conclurons par les points clés à retenir.
00:01:32Dans la réalité, les données sont très désordonnées.
00:01:34On parle d'échelles de plus de 100 millions de contenus, avec beaucoup de contenu viral.
00:01:39Il y a énormément de contenus malveillants.
00:01:42Certains essaient de contourner le système.
00:01:43On trouve beaucoup de textes multilingues à l'écran, dans les vidéos et les images.
00:01:48Et les données sont très dynamiques.
00:01:50Elles évoluent sans cesse, d'un mois à l'autre.
00:01:52De nouveaux outils d'IA apparaissent continuellement.
00:01:54C'est donc extrêmement dynamique.
00:01:57Cela entraîne de nombreux problèmes de dérive et autres difficultés liées aux données vidéo.
00:02:00De plus, il n'y a pas de vérité terrain évidente pour le problème que nous cherchons à résoudre.
00:02:05Ce sont des défis classiques rencontrés sur des jeux de données vidéo réels.
00:02:10Le premier problème que nous allons aborder concerne le désalignement de modalité,
00:02:14à commencer par l'intermodalité, qui est un problème déjà bien résolu.
00:02:19On peut utiliser un modèle CLIP.
00:02:20On extrait la modalité d'images, de vidéos, d'audio ou de texte,
00:02:25puis on calcule la similitude cosinus sur ces plongements pour analyser la cohérence.
00:02:29C'est donc un problème relativement simple.
00:02:31Nous allons plutôt voir comment traiter les problèmes d'intramodalité.
00:02:37Imaginez par exemple une vidéo.
00:02:39Vous avez une vidéo assez longue.
00:02:40Soudain, vous voyez apparaître une pub, un message politique, de la propagande
00:02:45ou un élément indésirable par rapport au contenu sur lequel vous avez cliqué.
00:02:49Comment analyser précisément ces court-métrages ou segments pour comprendre ce problème,
00:02:54et détecter les anomalies ou les comportements d'affrontement malveillants
00:02:59qui n'ont pas leur place ici ?
00:03:01Ce premier problème exige une compréhension très fine de la vision
00:03:05et de la vidéo, afin de savoir ce qui se passe au niveau de chaque clip et de chaque image.
00:03:10Le second problème consiste à détecter le contenu non original.
00:03:14Dans l'économie actuelle, avec les outils IA disponibles, il est très facile de dupliquer du contenu.
00:03:19Quand quelqu'un publie une vidéo, on constate qu'elle est copiée, transformée,
00:03:25et ces outils rendent la modification des vidéos de plus en plus simple.
00:03:29Dès lors, comment détecter ce type de contenu non original ?
00:03:33Comment identifier la source originale de la vidéo ?
00:03:35Cela pose de vrais problèmes d'attribution, de droits et de déséquilibre de l'écosystème.
00:03:41Beaucoup de lassitude chez les utilisateurs, avec énormément de vidéos répétitives qui ne devraient même pas être là.
00:03:47Pour en venir au système multi-agents, la première question est : pourquoi passer au multi-agents
00:03:54et non à un agent ou LLM unique ? Parce que le problème est très complexe.
00:03:57Il nécessite des nœuds très spécialisés et une forme de compréhension à chaque étape : recherche,
00:04:04compréhension du contenu, puis raisonnement.
00:04:07Et si vous pouvez résoudre un problème avec un seul agent ou LLM, inutile de recourir à des systèmes multi-agents.
00:04:14Voici donc comment le cerveau centralisé conçoit la décomposition de ce problème.
00:04:22D'abord, vous transmettez une vidéo et son identifiant à un agent évatuateur.
00:04:28C'est un agent centralisé.
00:04:29C'est essentiellement l'orchestrateur.
00:04:31Considérez-le comme une passerelle API chargée de décomposer les signaux et d'analyser l'image.
00:04:38Ce qu'il fait, c'est solliciter l'agent percepteur, lequel est considéré
00:04:46comme un expert VLM très sophistiqué disposant de nombreux outils d'image et vidéo.
00:04:52L'agent percepteur récupère l'identifiant auprès de l'agent évaluateur et extrait la vidéo de la base de données.
00:05:01Il la découpe en parties plus petites via divers outils, des plongements sémantiques et les changements temporels.
00:05:08C'est un peu hors sujet ici, mais notre technique garantit qu'on ne travaille pas à une fréquence d'images fixe.
00:05:17On repère où le changement temporel a lieu et on compresse ces images similaires en une ou deux images.
00:05:23Ensuite, l'agent percepteur extrait les données du clip et du plongement vidéo : tags, OCR, tout ce qui s'y trouve,
00:05:34la description en langage naturel, ainsi que les horodatages et l'intervalle d'images associés à ces métadonnées.
00:05:41Il transmet ces données à l'évaluateur.
00:05:43L'évaluateur examine l'objet JSON brut fourni par le percepteur, avec les plongements, identifiants sémantiques, tags, OCR, etc.
00:05:52Et il réalise une analyse temporelle.
00:05:55Il constate par exemple que de la première image à l'image 360, soit jusqu'à 6 secondes, la vidéo traitait de sport.
00:06:05Puis soudainement, de 6 à 6,5 secondes, entre telles images, le contenu bascule sur un sujet politique.
00:06:14Rien qu'en observant les métadonnées, l'agent évaluateur parvient à comprendre et à détecter l'anomalie dans cet
00:06:22espace temporel.
00:06:23Une fois cela fait, il détermine s'il s'agit d'un désalignement de modalité ou d'un problème plus vaste.
00:06:30L'agent évaluateur contacte l'agent chercheur et lui dit : « Voici la vidéo que j'analyse.
00:06:36Voici quelques métadonnées que j'ai déjà dédupliquées et post-traitées.
00:06:41Donne-moi des informations sur les clips similaires disponibles dans le corpus. »
00:06:47L'agent chercheur prend les signaux du percepteur, les métadonnées globales et par clip, et les indexe de façon adaptative.
00:06:57Par exemple, les thèmes peuvent utiliser un index inversé regroupant thèmes et vidéos.
00:07:02Pour les plongements, il s'agira de bases de données vectorielles classiques.
00:07:06Et pour les entités extraites, nous avons des bases graphes où l'agent évaluateur identifie bases, entités et métadonnées.
00:07:16Il les indexe pour qu'en temps réel, il puisse retrouver les clips, entités et thèmes similaires afin d'améliorer le rappel.
00:07:28Pour en revenir aux agents individuels, nous avons parlé du percepteur.
00:07:32Il analyse la vidéo, la découpe en courts clips selon le plongement sémantique et des algorithmes, puis affine le VLM pour extraire des infos
00:07:45très concrètes et granulaires sur chaque clip et sur l'ensemble de la vidéo.
00:07:51Travaillant à très grande échelle, nous ne pouvons pas nous contenter des VLM standard du marché.
00:07:56Il faut compresser et optimiser les coûts pour faire tourner ces modèles sur des milliards d'images.
00:08:05C'est là qu'interviennent le pré-entraînement, le fine-tuning, la distillation de connaissances et la quantification pour déployer un VLM
00:08:13ultra-spécialisé pour ce problème précis.
00:08:16Nous en reparlerons brièvement.
00:08:19L'agent chercheur est celui que nous avons évoqué dans les grandes lignes.
00:08:22En traitement hors ligne, il prend tous les signaux décomposés par l'agent percepteur en différé.
00:08:29Plutôt qu'un agent, voyez cela comme l'utilisation d'une bibliothèque pour faire une analyse hors ligne à grande échelle.
00:08:34Par exemple, sur un cluster Ray ou équivalent.
00:08:37Une fois toutes ces métadonnées obtenues, il les indexe dans différentes bases de données.
00:08:42Il effectue un clustering hors ligne périodique pour trouver le contenu similaire et définir les ID de plongement et de cluster.
00:08:50Ce sont ces données qu'utilise l'inférence en ligne pour trouver des vidéos similaires.
00:08:56En ligne, à partir d'une requête, d'un ID de clip et des métadonnées,
00:09:01il identifie dans le corpus ce qui ressemble à cet élément.
00:09:06Il recherche les éléments ayant la plus forte similarité.
00:09:09Il scrute les bases de données, trouve des clips et auteurs similaires ainsi que diverses métadonnées.
00:09:16Classe à nouveau ces candidats et utilise des outils comme les scores de spam traditionnels, comme un score de classificateur,
00:09:24pour repérer les candidats potentiellement indésirables ou de faible qualité.
00:09:29Une fois ces meilleurs candidats sélectionnés, il les renvoie à l'agent réviseur.
00:09:33Et c'est là que le réviseur traite les signaux du contenu principal et les plongements d'extraits.
00:09:39Voici des vidéos similaires fournies par le récuprateur.
00:09:42Réfléchissons-y : faut-il en régénérer et obtenir plus de données du récupérateur ?
00:09:48Le réviseur dispose ainsi de tous les signaux temporels d'un seul extrait.
00:09:52Il possède toutes les informations sur les extraits similaires, la compréhension et les auteurs similaires.
00:09:58Il détient aussi des informations en temps réel sur la façon dont les utilisateurs interagissent avec la vidéo.
00:10:03Quel type de signalements ou de commentaires y a-t-il, et quel est le sentiment général de ces commentaires ?
00:10:13Ainsi, de nombreux signaux ignorés par les données hors ligne, les VLM et d'autres agents,
00:10:18sont intégrés pour vérifier s'il y a un changement de sentiment.
00:10:22Quelle est la réponse obtenue en temps réel ?
00:10:25Divers outils permettent de comprendre la vidéo, non seulement par son contenu
00:10:30et d'un point de vue sémantique, mais aussi à travers l'interaction de l'utilisateur.
00:10:36Ces signaux sont vraiment très importants.
00:10:38Une fois ce travail accompli, nous construisons ce cadre agentique.
00:10:44Dans ce cadre, chacun des trois agents est propulsé par des VLM spécialisés
00:10:50et, d'une certaine manière, des VLM à petite échelle.
00:10:54Nous allons donc d'abord parler de l'entraînement préalable.
00:10:58Dans la plupart des cas, on réalise un entraînement préalable.
00:11:01On affine un peu son transformeur visuel ici et là pour l'adapter à un usage spécifique.
00:11:08Le problème est que les VLM disponibles sur le marché, ces modèles fondateurs de pointe,
00:11:14sont entraînés sur des jeux de données web très propres, parfaitement optimisés et nettoyés.
00:11:20Mais les données internes pour un usage précis n'ont pas du tout les mêmes caractéristiques.
00:11:26Elles sont désordonnées.
00:11:27Elles sont générées par les utilisateurs.
00:11:28Elles sont destinées à votre flux de travail spécifique.
00:11:30Cela signifie qu'il faut effectuer un pré-entraînement sur ces jetons d'image et de texte pour affiner le transformeur visuel depuis zéro,
00:11:37afin de vérifier s'il existe une différence entre l'affiner ou l'entraîner de zéro.
00:11:42C'est là que le pré-entraînement s'avère utile.
00:11:44C'est un peu coûteux, mais si cela apporte un gain, cela fonctionne extrêmement bien.
00:11:50La deuxième étape est l'affinage par instructions, où se posent deux problèmes.
00:11:54Nous avons certaines politiques et consignes.
00:11:57On connaît le contenu et les signaux, et le modèle s'ajuste sur ce jeu de données spécifique avec un
00:12:04format de sortie précis (comme un schéma JSON) pour repérer le désalignement de modalité,
00:12:10la duplication de scores ou d'autres raisonnements par chaîne de pensée fournis par l'agent réviseur.
00:12:16Nous avons donc un extrait vidéo.
00:12:17Nous avons un encodeur visuel déjà légèrement pré-entraîné.
00:12:21Nous poussons maintenant un peu plus son entraînement.
00:12:23Il y a un projecteur placé entre le transformeur visuel et les modèles de langage,
00:12:27qui sert essentiellement de passerelle entre eux.
00:12:30Ensuite, le résultat dépend des données d'affinage par instructions dont nous disposons de ce côté.
00:12:35C'est une étape cruciale pour améliorer les performances du modèle sur votre domaine spécifique.
00:12:45En somme, le contexte définit un rôle, une politique, les outils disponibles pour
00:12:50ancrer cela dans certaines métadonnées, ainsi que les autres éléments accessibles.
00:12:54Fournissez l'ensemble de façon très synthétique dans le contexte, puis laissez-le identifier
00:13:01les étiquettes structurées trouvées. Ces étiquettes sont créées en interne : c'est là que
00:13:06nous avons défini la nature exacte des modalités, les différents problèmes observés,
00:13:12les raisonnements par chaîne de pensée intégrés au modèle,
00:13:15et l'apparence du résultat pour un réviseur humain. Il s'agit d'un jeu de données
00:13:21de très haute qualité utilisé pour affiner les différents agents. Une fois le
00:13:27pré-entraînement terminé pour appréhender la vision et les autres modalités des vidéos,
00:13:33nous passons à l'affinage pour lui faire comprendre et fournir le contexte et les résultats
00:13:38selon la structure souhaitée pour le traitement. L'étape suivante est la phase DPO.
00:13:44Cette technique est très utilisée lors du post-entraînement pour affiner nos modèles
00:13:51dans un domaine, un secteur ou une politique spécifique. Mais elle est aussi
00:13:58très utile en production pour identifier les échantillons qui posent
00:14:02problème à vos systèmes multi-agents et vos LLM.
00:14:11Ce qu'on peut faire, c'est prélever un sous-échantillon de ce jeu de données de production,
00:14:17où ont lieu de nombreuses inférences, et le soumettre à un LLM juge entraîné en interne
00:14:23sur des données annotées par des humains. On utilise ensuite une file de révision humaine
00:14:29pour évaluer les performances réelles du système. À partir de là,
00:14:36si les performances sont excellentes et dépassent le seuil de prédiction fixé
00:14:40(par exemple 95 % pour chaque problème), c'est parfait. Sinon, cela signifie qu'il faut
00:14:47trouver un moyen d'apprendre des échantillons où le modèle a échoué. C'est là
00:14:52qu'intervient l'humain dans la boucle. Il analyse toutes les traces laissées par les agents,
00:14:57les appels LLM et le MCP pour localiser l'erreur. S'agit-il d'un souci de chaîne de pensée
00:15:02ou de mauvais outils appelés ? La recherche a-t-elle échoué ? Toutes ces
00:15:08validations et la compréhension de chaque point d'accroche, tant au niveau de l'intelligence du modèle
00:15:14qu'au niveau de sa robustesse, permettent d'identifier les améliorations à apporter
00:15:20à ces échantillons mal traités par le système. Une fois ces éléments
00:15:28en main (échantillons positifs, négatifs et points à mettre à jour), on réentraîne
00:15:34le modèle pour optimiser ses performances. Il s'agit d'un processus d'amélioration continue
00:15:40où l'on étudie ces échantillons, réentraîne et améliore les modèles en créant un jeu de données
00:15:46issu de la production pour détecter d'éventuelles dérives ou analyser le comportement
00:15:53du modèle. L'intervention humaine est donc constante, avec un échantillonnage quotidien
00:15:58de la production pour évaluer le modèle et le LLM juge.
00:16:05En raison du coût et des contraintes d'échelle, impossible d'utiliser des VLM de pointe standards,
00:16:14car ils manquent d'évolutivité et exigent une inférence lourde et une grande complexité.
00:16:20De plus, notre problème est très spécifique : peu importe que le modèle sache coder,
00:16:25seul notre domaine d'application compte. Ce modèle n'est pas exposé aux clients,
00:16:31c'est un outil interne. Je privilégie donc une distillation de connaissances sur et hors politique,
00:16:37combinée à de la quantification expérimentale pour déterminer si le format 4-bit
00:16:41ou le Bfloat est le plus efficace. Un tableau comparatif des différentes tailles
00:16:47de distillation et de quantification permet d'évaluer où la performance reste à la hauteur
00:16:54et où se font les gains de calcul et d'économies de ressources lors de l'inférence
00:17:00en production grâce à ces optimisations. C'est un point absolument crucial : la solution
00:17:07développée fonctionne, mais elle doit être évolutive et rentable en production.
00:17:13Elle ne peut pas être un simple produit prêt à l'emploi du marché,
00:17:21car nous résolvons un problème très spécifique. Concernant l'évaluation,
00:17:27le premier critère est la réussite de la tâche. Il s'agit de valeurs binaires : l'alignement
00:17:31de modalité a-t-il lieu ou non ? La précision, le rappel et le score F1 sont des métriques évidentes
00:17:37pour mesurer le succès. Mais nous voulons évaluer le système de manière globale,
00:17:42pas seulement le résultat final : comment chaque nœud se comporte, quelle est l'efficacité du système
00:17:47de recherche, sa latence, son rappel, et notre capacité à raisonner. Quel est le raisonnement
00:17:53par chaîne de pensée produit par ces modèles à chaque niveau agentique concerné
00:17:59(en l'occurrence, l'agent réviseur) ? Et quelle est sa qualité ? Le modèle
00:18:04sur-réfléchit-il ? Peut-on réduire le budget de calcul quelque part tout en garantissant
00:18:09un bon travail ? Ou faut-il l'augmenter pour la planification et le raisonnement
00:18:16afin de s'assurer que le problème complexe traité obtienne de bien meilleures
00:18:22performances et une meilleure précision ? Avoir une allocation adaptative du budget de raisonnement est donc
00:18:29essentiel. Vient ensuite la robustesse : quels sont les cas limites et les taux d'erreur observés ?
00:18:34À quels nœuds et points d'ancrage surviennent-ils ? S'agit-il d'un appel d'outil défaillant,
00:18:39d'un problème de recherche ou d'un LLM peu performant ? Enfin, nous évaluons
00:18:45l'efficacité du système en examinant non seulement la qualité des résultats,
00:18:51mais aussi chaque aspect du coût en jetons des LLM appelés. Peut-on les optimiser
00:18:56davantage pour réduire les coûts ? Quelle est l'efficacité constatée et la latence
00:19:01de chaque agent, ainsi que du système global ? Concernant le LLM juge,
00:19:08tout système de prédiction subit une dérive des données, surtout avec du contenu
00:19:14généré par les utilisateurs. On analyse donc le comportement de ce LLM juge utilisé pour l'évaluation
00:19:20par rapport à la file de révision humaine. Y a-t-il une dérive ? Faut-il le réentraîner
00:19:25sur un nouveau jeu de données fourni par l'équipe d'annotation ? Pour l'optimisation,
00:19:30nous appliquons une réduction spatio-temporelle qui repère les images similaires
00:19:35et les compresse en un seul élément, ce qui réduit considérablement le temps de traitement
00:19:41des vidéos. Le deuxième levier est la mise en cache : lorsqu'un contenu viral émergent
00:19:47apparaît, inutile de faire repasser ce même contenu
00:19:52à travers tout le pipeline. Un score de similarité élevé permet de contourner
00:19:57le système multi-agents et de trancher directement. La troisième méthode, très importante,
00:20:01est l'élagage des métadonnées. Il s'agit de réduire le nombre de candidats selon
00:20:07certaines métadonnées, comme des sujets ou des créateurs ayant déjà un très bon historique.
00:20:12Inutile de traiter toutes les images et vidéos d'un créateur
00:20:18qui bénéficie d'un score d'authenticité très élevé et de très bons résultats,
00:20:22avec une haute qualité vidéo et un bon engagement. Ces métadonnées permettent
00:20:27de filtrer les vidéos qui ne devraient même pas être envoyées aux systèmes. Ces indicateurs
00:20:33s'avèrent très utiles. En conclusion, les points clés à retenir sont les suivants :
00:20:42la décomposition est essentielle : décomposez le problème dès que nécessaire. L'optimisation adaptative
00:20:50est cruciale pour le ROI et la maîtrise des coûts. Une évaluation rigoureuse est capitale :
00:20:56tout en dépend, c'est le socle de l'ensemble de votre système et de vos VLM. Enfin, le suivi des prédictions
00:21:02et l'amélioration qualitative sont indispensables pour assurer la viabilité à long terme.
00:21:08C'est sur ces mots que je me conlus. Merci beaucoup pour votre attention.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video