Desalinhamento Mododal e Atribuição de Originalidade em Vídeos Curtos — Aditya Gautam, Meta

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00Aditya Rahm: Olá a todos, eu sou o Aditya e vamos falar sobre dois problemas principais
00:00:17que acontecem nas plataformas de vídeos curtos.
00:00:20Vamos falar sobre como lidamos com essas coisas em grande escala.
00:00:25Para começar, primeiro vamos entender quais são as características
00:00:28dos dados com os quais estamos lidando, quais são os dois problemas principais em que estamos
00:00:33trabalhando e quais são os sistemas multiagentes para resolver esses problemas em escala.
00:00:39Quais são os diferentes VLMs especializados de pequena escala que podemos construir para resolver cada
00:00:46problema de agente individual, como construímos esses agentes, quais são as diferentes formas de
00:00:50otimizá-los para torná-los escaláveis em altíssima escala e, depois, veremos
00:00:56a avaliação de forma holística, em 360 graus, e não apenas como uma revocação de precisão.
00:01:00O que existe por aí?
00:01:01Como entendemos todo o pipeline multiagente, tanto no nível de LLM, ferramentas, MCP e tudo mais,
00:01:08tudo o que há disponível.
00:01:09E depois entraremos nas técnicas de otimização que são muito específicas de visão e
00:01:14específicas de dados, que nos darão inteligência para perceber que realmente não
00:01:20precisamos aplicar esse fluxo inteligente para todos os vídeos; podemos identificar qual é o pequeno
00:01:25conjunto de vídeos candidatos a esse processo.
00:01:29E concluiremos com os principais aprendizados.
00:01:32Os dados da vida real são muito desorganizados.
00:01:34Estamos falando de uma escala de mais de 100 milhões e muito conteúdo viral.
00:01:39Há muito conteúdo malicioso.
00:01:42As pessoas estão tentando burlar o sistema.
00:01:43Há muitos textos multilíngues nas telas, nos vídeos e nas imagens.
00:01:48E os dados são muito dinâmicos.
00:01:50Eles mudam constantemente, mês a mês.
00:01:52Surgem diferentes ferramentas de IA, tudo novidade.
00:01:54Então é algo extremamente dinâmico.
00:01:57Isso significa que há muitos problemas de desvio (drift) e outras questões associadas aos dados de vídeo.
00:02:00E sabemos que não há uma referência absoluta (ground truth) clara para o problema que tentamos resolver.
00:02:05Esses são os problemas existentes nos conjuntos de dados de vídeo do mundo real.
00:02:10O primeiro problema que abordaremos é o desalinhamento de modalidade,
00:02:14começando pela intermodalidade, que já é um problema bem resolvido.
00:02:19Você pode usar um modelo CLIP.
00:02:20Pode ter modalidades em imagens, vídeos, áudio, texto,
00:02:25e calcular a similaridade de cosseno nesses embeddings para descobrir.
00:02:29Portanto, esse é um problema bem mais simples.
00:02:31O que vamos discutir é como lidamos com os problemas de intramodalidade.
00:02:37Pense nisso como um vídeo.
00:02:39Temos um vídeo longo.
00:02:40E de repente você vê algo, um anúncio, uma pauta, algo político,
00:02:45ou algo que não deveria estar ali quando você clicou no vídeo.
00:02:49Como analisamos esses pequenos trechos do vídeo, entendemos o problema
00:02:54e identificamos onde há uma anomalia ou um comportamento malicioso
00:02:59que nem deveria estar ali para começar?
00:03:01Esse é o primeiro problema, que exige muita compreensão detalhada, visão computacional,
00:03:05e compreensão de vídeo para ver o que está acontecendo no nível de cada trecho e quadro.
00:03:10O segundo problema é identificar conteúdos não originais.
00:03:14Na economia atual, com as ferramentas de IA disponíveis, é muito fácil duplicar conteúdo.
00:03:19Quando alguém envia um vídeo, vemos que ele é copiado, transformado,
00:03:25e com essas ferramentas fica cada vez mais fácil transformar esses vídeos.
00:03:29Então, como detectamos esse tipo de conteúdo não original?
00:03:33Como descobrimos a fonte do vídeo?
00:03:35Isso causou problemas de atribuição, direitos autorais e desequilíbrio no ecossistema.
00:03:41Isso gera cansaço no usuário, pois vemos muitos vídeos repetitivos que não deveriam estar ali.
00:03:47Passando para o sistema multiagente, a primeira questão é por que usar multiagentes
00:03:54em vez de um único agente ou LLM. Porque o problema é muito complexo.
00:03:57Ele exige nós muito especializados e um entendimento aprofundado em cada etapa de recuperação,
00:04:04compreensão de conteúdo e raciocínio.
00:04:07E se for possível resolver o problema com um só agente ou LLM, não há necessidade de usar sistemas multiagentes.
00:04:14Aqui está o cérebro centralizado, como estamos pensando e como ocorre a decomposição desse problema.
00:04:22Primeiro, você tem um vídeo, um ID de vídeo e tudo mais enviado para um agente revisor.
00:04:28Ele é um agente centralizado.
00:04:29É basicamente o orquestrador.
00:04:31Pense nele como um gateway de API fazendo a decomposição de sinais e identificando o que acontece na imagem.
00:04:38O que esse agente faz é acionar o agente perceptor, e o perceptor pode ser considerado
00:04:46um especialista em VLM muito sofisticado, com várias ferramentas de imagem e vídeo à disposição.
00:04:52O agente perceptor pega o ID do agente revisor e busca o vídeo no banco de dados.
00:05:01Ele o decompõe em partes menores usando ferramentas, embeddings semânticos e variações temporais que ocorrem.
00:05:08Isso vai um pouco além do escopo desta palestra, mas é a nossa técnica para garantir que não façamos isso a uma taxa de quadros fixa.
00:05:17Identificamos onde ocorreu a mudança temporal e comprimimos esses quadros semelhantes em um ou dois quadros.
00:05:23Em seguida, o agente perceptor obtém os dados no nível de trecho e de embeddings, reúne informações como tags, OCR e o que mais houver,
00:05:34a descrição em linguagem natural e os carimbos de data/hora indicando de qual quadro a qual quadro esses metadados pertencem.
00:05:41Ele envia esses dados para o revisor.
00:05:43O revisor analisará o objeto JSON temporal fornecido pelo perceptor em estado bruto, com embeddings, IDs semânticos, tags, OCR e tudo mais.
00:05:52E faz uma análise temporal.
00:05:55Ele percebe que do primeiro quadro até o quadro 360, ou até os seis segundos, era um vídeo sobre esportes.
00:06:05E de repente, dos 6 aos 6,5 segundos, nesses quadros específicos, o conteúdo muda para algo político.
00:06:14Apenas analisando os metadados, o agente revisor consegue entender, compreender e identificar exatamente qual anomalia surgiu
00:06:22nesse espaço temporal.
00:06:23Ao fazer isso, ele determina se trata de um desalinhamento de modalidade ou de um problema maior.
00:06:30Então o agente revisor conversa com o agente de recuperação e diz: “Este é o vídeo que estou analisando.
00:06:36Estes são alguns metadados que já reduzi e processei.
00:06:41Agora me dê informações sobre trechos semelhantes disponíveis no acervo.”
00:06:47O agente de recuperação analisa os sinais do perceptor e os metadados do trecho e do vídeo completo, indexando-os adaptativamente em bancos de dados.
00:06:57Por exemplo, os tópicos podem usar um índice invertido com tópicos e vários vídeos.
00:07:02Para os embeddings, utilizamos os bancos de dados vetoriais disponíveis.
00:07:06E para diferentes entidades extraídas, usamos bancos de dados em grafo onde o agente revisor identifica bancos de dados, entidades e metadados.
00:07:16Vou indexar isso para que, em tempo de inferência online, eu descubra para um trecho quais são os trechos, entidades e tópicos semelhantes disponíveis para melhorar a revocação.
00:07:28Analisando cada agente individualmente, já falamos do perceptor.
00:07:32Ele analisa todo o vídeo, faz a decomposição temporal em trechos com base nos embeddings semânticos e algoritmos, e ajusta o VLM para emitir informações concretas
00:07:45e detalhadas sobre cada trecho e sobre o vídeo inteiro.
00:07:51Como trabalhamos em grande escala, não podemos usar apenas os VLMs padrão do mercado.
00:07:56É preciso haver compressão e uma forma viável financeiramente para rodar esses modelos em bilhões de quadros.
00:08:05É aí que entram o pré-treinamento, o ajuste fino, a destilação de conhecimento e a quantização para implantar e resolver VLMs muito
00:08:13especializados para esse problema específico.
00:08:16E falaremos brevemente sobre isso.
00:08:19O agente de recuperação é aquele que mencionamos em alto nível.
00:08:22No processamento offline, todos os sinais decompostos pelo perceptor de forma offline
00:08:29são analisados em grande escala usando essa biblioteca em vez do agente.
00:08:34Por exemplo, usando um cluster Ray ou algo semelhante.
00:08:37Com todos esses metadados reunidos, ele basicamente os indexa em diferentes bancos de dados.
00:08:42Realiza um agrupamento (clustering) offline periódico para achar conteúdos similares, definindo o ID do embedding e do cluster para cada trecho e vídeo.
00:08:50Esses dados são usados pela inferência online para encontrar vídeos semelhantes.
00:08:56E, no modo online, ao receber uma consulta ou ID de trecho com os metadados,
00:09:01ele identifica no acervo quais itens são parecidos com ele.
00:09:06Quais são os diferentes elementos que possuem alta similaridade.
00:09:09Ele busca nos bancos de dados, encontra trechos, autores semelhantes e outros detalhes de metadados.
00:09:16Reclassifique esses candidatos e use algumas das ferramentas sobre, por exemplo, a pontuação de span de modelo tradicional, como uma pontuação classificada,
00:09:24para ver quais são os diferentes candidatos que podem ser spam, que podem não ser de alta qualidade e essas coisas por aí.
00:09:29E uma vez que tenha esses principais candidatos, ele os devolve ao revisor.
00:09:33E o revisor é onde ele realmente processa, estes são meus principais sinais de conteúdo e embeddings de clipe.
00:09:39Estes são vídeos semelhantes fornecidos pelo Retriever.
00:09:42Deixe-me pensar sobre isso e se preciso recriar e obter mais dados do Retriever.
00:09:48Então é aí que o revisor tem todos os sinais temporais de um único clipe.
00:09:52Ele tem todas as informações de clipes semelhantes, compreensão e quais são os autores semelhantes e outras coisas.
00:09:58Também possui informações em tempo real sobre como os usuários estão realmente interagindo com este vídeo.
00:10:03Quais são os diferentes tipos de denúncias ou, como os comentários, qual é o sentimento desses comentários por aí, certo?
00:10:13Então, muitos desses sinais que são realmente perdidos pelos sinais offline e pelos VLMs e outros tipos de agentes,
00:10:18são na verdade também incorporados para ver se há uma mudança ocorrendo no sentimento.
00:10:22Qual é a resposta que estou obtendo em tempo real?
00:10:25Portanto, existem diferentes ferramentas disponíveis para isso para realmente entender o vídeo, não apenas pelo conteúdo
00:10:30e pela perspectiva semântica, mas entendendo pela perspectiva de interação do usuário.
00:10:36Esses sinais são muito, muito importantes.
00:10:38Então, uma vez que temos esse trabalho e tudo, construímos essa estrutura agêntica.
00:10:44E cada uma dessas estruturas agênticas, todos esses três agentes são, na verdade, alimentados por
00:10:50VLMs especializados e VLMs de pequena escala de certa forma.
00:10:54Então vamos falar sobre o pré-treinamento primeiro.
00:10:58Agora, na maioria dos casos, você vê que, ok, você tem um pré-treinamento.
00:11:01Você ajusta seu transformer de visão um pouco aqui e ali e basicamente o ajusta para seu propósito específico.
00:11:08A questão é que esses VLMs, o que temos lá fora e disponíveis, o modelo fundacional, os modelos front-end,
00:11:14eles são treinados em um conjunto de dados muito limpo, muito bom, dados muito focados na web, muito bem ajustados, limpos e tudo.
00:11:20Mas os dados internos para um propósito específico não têm as mesmas características de dados.
00:11:26Eles são confusos.
00:11:27São gerados por usuários.
00:11:28São para o seu fluxo de trabalho específico.
00:11:30Isso significa que você precisa pré-treinar nesses tokens de imagem e linguagem para ajustar seu transformer de visão do zero
00:11:37e ver se há um delta entre o ajuste fino e o ajuste do zero.
00:11:42É aí que o pré-treinamento é útil.
00:11:44É um pouco caro, mas se conseguir um delta, isso realmente funciona muito bem.
00:11:50O segundo é o ajuste fino de instrução, onde temos dois problemas.
00:11:54Temos certas políticas e certas diretrizes.
00:11:57Nós conhecemos o conteúdo disponível, o sinal disponível, e ele entende e o ajusta naquele conjunto de dados em particular com um
00:12:04resultado em particular, que é um esquema, como um esquema JSON, para entender qual é o desalinhamento de modalidade ou
00:12:10a duplicação de pontuações e outros raciocínios em cadeia de pensamento fornecidos pelo agente revisor.
00:12:16Então aqui temos um videoclipe.
00:12:17Temos um codificador de visão, que já pré-treinamos um pouco.
00:12:21Tipo, agora estamos fazendo um pouco mais de treinamento nele.
00:12:23Há um projetor, que fica entre o transformer de visão e os modelos de linguagem,
00:12:27e é na verdade basicamente uma ponte entre eles.
00:12:30E então temos nossa saída dependendo de quais são os dados de ajuste fino de instrução que temos deste lado.
00:12:35Então esta é a parte crítica para realmente fazer o desempenho do seu modelo aumentar para o seu domínio específico.
00:12:45Então o contexto é basicamente você ter uma função, você ter uma política, quais são as ferramentas disponíveis para
00:12:50fundamentar isso em alguns dos metadados, e quais são as outras coisas disponíveis por aí.
00:12:54Dê tudo isso de maneira muito breve ao contexto, e deixe-o descobrir o que o
00:13:01rótulo de estrutura você encontrou. Esses rótulos são, na verdade, rótulos internos. Estes são aqueles onde
00:13:06nós criamos coisas como o que exatamente são as modalidades, quais são os diferentes problemas que estamos vendo,
00:13:12quais são os diferentes raciocínios em cadeia de pensamento que deveriam estar lá no modelo,
00:13:15e como a saída se parece para um revisor humano. Então este é como um conjunto de dados de altíssima
00:13:21qualidade no qual o estamos ajustando para diferentes agentes, certo? Então, uma vez que tenhamos concluído o
00:13:27pré-treinamento apenas para entender o aspecto de visão ou os outros aspectos de modalidade dos vídeos,
00:13:33então entramos no ajuste fino para fazê-lo entender e fornecer o contexto e a saída
00:13:38da maneira que gostaríamos de realmente processar o conjunto de dados. Portanto, a próxima fase é a fase de DPO,
00:13:44que é basicamente esta técnica usada muito no pós-treinamento para realmente ajustar nossos modelos
00:13:51em um reino específico, domínio ou compreensão de política ou algo assim. Mas isso também pode
00:13:58ser muito usado na produção para realmente entender quais são as amostras que
00:14:02estão sendo avaliadas como não tão boas pelos seus sistemas multiagentes e pelos seus LLMs. Então, o que
00:14:11pode ser feito é, como você tem este conjunto de dados de produção que está surgindo, você tem muita
00:14:17inferência acontecendo, você pega uma subamostra desses dados que vêm da produção, passa isso
00:14:23por um LLM como juiz que é treinado internamente no conjunto de dados rotulado por humanos, e então você tem a
00:14:29fila de revisão humana para ver qual é o desempenho obtido no sistema real. Uma vez que você tem isso
00:14:36se o seu desempenho está sendo incrível e está acima do que quer que seja o seu limite de predição, digamos
00:14:4095 por cento para cada um dos problemas, é ótimo. Mas se não estiver, significa que há uma maneira,
00:14:47tem que haver uma maneira de aprender com essas amostras onde o modelo não se saiu bem. É aí que você
00:14:52tem um humano na fila. Ele entende aquilo, todos os vestígios que estão lá de todos os agentes,
00:14:57a chamada do LLM, o MCP, e descobriu onde o problema aconteceu. É tipo um raciocínio em cadeia
00:15:02de pensamento? Ou é tipo se algumas das ferramentas erradas fossem chamadas, a recuperação não funcionou? Então toda essa
00:15:08validação e basicamente compreensão de cada gancho e nó, tanto no nível de inteligência do modelo
00:15:14Além disso, em um nível de dificuldade, é o que você descobre e diz: ok, essas são as melhorias
00:15:20que preciso fazer nestas amostras, que foram amostradas incorretamente pelo nosso sistema. Então, assim que tiver
00:15:28isso, você terá uma amostra positiva, uma amostra negativa, o que precisa ser atualizado e é aí que você
00:15:34retreina seu modelo para ver o que, como podemos melhorá-lo mais. E esta é uma melhoria contínua
00:15:40onde estamos analisando essas amostras, retreinando, melhorando novamente os modelos e disponibilizando um novo conjunto de dados
00:15:46a partir das amostras de produção e tentando entender se houve desvio ou o que exatamente
00:15:53o modelo está fazendo. Portanto, esse humano no circuito é como uma coisa contínua de sempre, onde você tem uma
00:15:58amostragem diária da produção e tentamos entender como o modelo e o LLM como juiz estão se saindo.
00:16:05Então, devido ao custo e à capacidade de resolver nessa escala, não podemos usar o padrão como os modelos VLM
00:16:14de tamanhos de fronteira porque não é escalável, requer muita inferência, muita complexidade,
00:16:20e estamos resolvendo um problema muito específico. Tipo, eu realmente não me importo se o modelo pode resolver um problema
00:16:25de programação. Eu só me importo com o meu problema de domínio específico. É tudo o que me importa. Isso não fica exposto ao cliente,
00:16:31essa é uma coisa interna. Então, na verdade, eu faria uma destilação de conhecimento off-policy e on-policy
00:16:37e faria um pouco de quantização dependendo de alguns experimentos de quantização para entender
00:16:41se o trabalho em 4 bits, o fluxo cerebral, o que realmente funciona muito bem. Então eu teria uma tabela com
00:16:47diferentes tamanhos de destilações e quantização para entender e ver onde exatamente meu desempenho
00:16:54está no nível desejado e onde estou ganhando muita computação e economizando recursos e custos na
00:17:00produção de inferência ao fazer essa otimização. Portanto, isso é realmente crítico porque, como um problema,
00:17:07o que nós resolvemos, está tudo bem. Mas na produção, tem que ser escalável. Tem que ser
00:17:13econômico. Não pode ser apenas como algo que está fora do -- que está apenas no mercado
00:17:21porque estamos resolvendo um problema muito específico aqui. Voltando à avaliação, basicamente,
00:17:27primeiro é a tarefa de sucesso. Claro, essas são as coisas binárias. A modalidade acontece. Não
00:17:31acontece. Tipo, há alinhamento ou desalinhamento. Então, a precisão e a recuperação F1 são matrizes óbvias para
00:17:37entender o que é o sucesso da tarefa. Mas queremos olhar para o sistema de uma maneira muito holística,
00:17:42não apenas para a meta final, mas o que está acontecendo em cada nó, o quão bem o sistema de recuperação está
00:17:47funcionando, qual é a latência e a recuperação do sistema, e quão bem somos capazes de raciocinar sobre isso. Qual é a cadeia de
00:17:53raciocínio em cadeia de pensamento vinda desses modelos em cada nível agêntico ou onde quer que seus raciocínios sejam
00:17:59aplicáveis, o que basicamente é um agente revisor em nosso caso? E qual a qualidade disso? Isso é
00:18:04um excesso de pensamento? Podemos reduzir um orçamento em algum lugar para garantir que o modelo esteja realmente
00:18:09fazendo um bom trabalho com menos orçamento? Ou podemos aumentá-lo, o orçamento do planejamento ou do raciocínio
00:18:16das coisas, ter um orçamento mais alto e garantir que o problema complexo que estamos resolvendo
00:18:22talvez tenha um desempenho e uma precisão muito maiores. Portanto, ter um orçamento de raciocínio adaptável também é
00:18:29bastante importante. E então nós temos a robustez. Quais são os casos extremos que estamos vendo? Quais são as taxas de erro
00:18:34que estamos tendo? Quais são os diferentes nós e ganchos onde eles estão acontecendo? É como se uma chamada de ferramenta não estivesse
00:18:39funcionando muito bem? É uma parte de recuperação ou o LLM não está fazendo um bom trabalho ou esse tipo de coisa. E
00:18:45então temos a eficiência do sistema, onde não estamos olhando apenas para o desempenho da saída e
00:18:51tudo mais, mas estamos olhando para todos os aspectos do custo do token, qual LLM estão chamando? Podemos
00:18:56otimizar o LLM um pouco mais para realmente economizar o custo? Qual é a eficiência que estamos vendo e a
00:19:01latência de cada agente e de todo o sistema combinados? Em seguida, temos o LLM como juiz, onde vemos
00:19:08que, como em qualquer sistema de predição, sempre há um desvio de dados acontecendo, especialmente quando você
00:19:14tem conteúdo gerado pelo usuário. Então, como nosso LLM como juiz, que é usado para avaliação e tudo,
00:19:20está se saindo em relação à fila humana? Está ocorrendo um desvio? Precisamos retreinar nosso LLM como um
00:19:25juiz no novo conjunto de dados, que está vindo da equipe de rotulagem? Ou como realmente lidamos com essas partes? Na
00:19:30otimização, temos a otimização de redução espaço-temporal, que na verdade analisa o quadro,
00:19:35que são semelhantes e apenas os comprime em um único aspecto. Isso reduz o processamento total dos
00:19:41vídeos em grande medida. O segundo é, basicamente, você tem um cache, você tem um conteúdo viral
00:19:47que está basicamente surgindo, e você não quer ter o mesmo conteúdo lá fora,
00:19:52passando por todo o pipeline. E é aí que você tem uma pontuação de alta similaridade e apenas pula
00:19:57o sistema multiagente e simplesmente toma uma decisão sobre isso. O terceiro, que é realmente importante,
00:20:01é a poda de metadados. Aqui é onde nós realmente reduzimos o espaço de muitos candidatos com base em
00:20:07alguns dos metadados, por exemplo, alguns tópicos e algum criador que já tenha um registro muito bom.
00:20:12Isso significa que nós realmente não precisamos processar todas essas imagens, todos os vídeos do criador,
00:20:18que tem uma pontuação de alta autenticidade muito boa, que estão se saindo muito bem nisso,
00:20:22onde a qualidade do vídeo é muito alta, o engajamento é bom. Esse tipo de coisa, metadados é algo
00:20:27que pode ser usado para filtrar o vídeo, que não deveria nem ir para os sistemas. Então, algumas dessas
00:20:33sinalizações seriam úteis. Então a última conclusão que basicamente podemos tirar desta sala é que,
00:20:42tipo, a decomposição ou T é a chave, ou decompor um problema conforme e quando necessário. A otimização adaptativa
00:20:50é muito importante para o ROI e a viabilidade de custos. Uma boa avaliação é primordial. Tudo para dentro e para fora
00:20:56depende disso. Esta é a base de todo o seu sistema e de todos os VLMs. E o monitoramento de predição
00:21:02e a melhoria qualitativa são realmente essenciais para garantir que isso seja sustentável a longo prazo.
00:21:08Com isso, eu encerro. Muito obrigado por ouvirem.

Key Takeaway

A detecção de desalinhamento modal e duplicatas em escala de centenas de milhões exige uma arquitetura multiagente com VLMs especializados, otimização espaço-temporal e um ciclo contínuo de avaliação humana com DPO.

Highlights

  • A análise intramodal em vídeos curtos identifica anomalias temporais e inserções maliciosas quadro a quadro em uma escala superior a 100 milhões de conteúdos.

  • O pipeline multiagente divide o processamento entre um agente revisor orquestrador, um perceptor especializado e um agente de recuperação de dados históricos.

  • A compressão espaço-temporal reduz a redundância eliminando taxas fixas de amostragem de quadros e fundindo variações semelhantes em quadros únicos.

  • O treinamento de VLMs proprietários exige pré-treinamento do zero no codificador de visão para superar o desalinhamento de modelos genéricos treinados em dados limpos.

  • A filtragem prévia por poda de metadados e o uso de caches de similaridade evitam o reprocessamento dispendioso de vídeos virais e criadores confiáveis.

Timeline

Desafios em Dados de Vídeo Curto em Grande Escala

  • Plataformas de vídeos curtos processam mais de 100 milhões de envios com alto grau de ruído e mutabilidade.
  • O conteúdo gerado por usuários apresenta texto multilíngue em tela, edições maliciosas e ausência de uma referência absoluta clara.
  • A evolução mensal de ferramentas de IA acelera o surgimento de desvios de dados nos modelos de detecção.

Os dados de vídeo no mundo real diferem drasticamente dos conjuntos de dados limpos da internet. A presença de edições maliciosas para burlar algoritmos e a rápida atualização de ferramentas de geração sintética exigem sistemas de análise dinâmica. A falta de rotulagem perfeita torna o monitoramento de desvios um requisito contínuo.

Desalinhamento Intramodal e Atribuição de Originalidade

  • A similaridade de cosseno em embeddings CLIP resolve apenas o desalinhamento intermodal simples.
  • O desalinhamento intramodal requer a identificação de trechos anômalos ou anúncios não autorizados inseridos no meio do vídeo.
  • A proliferação de ferramentas de IA facilita a cópia e transformação não autorizada de vídeos de terceiros.

Enquanto associar texto a imagem é um problema resolvido com embeddings comuns

Community Posts

No posts yet. Be the first to write about this video!

Write about this video