Construindo a Camada de Contexto de Documentos para Agentes de IA — Jerry Liu, LlamaIndex
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00sabe, sendo atualizados continuamente no seu SharePoint, só para busca em base de conhecimento RAG.
00:00:04Nesses casos, você obviamente quer que não seja super impreciso,
00:00:08mas se ficar um pouco desformatado, tudo bem também, porque no fim, se tiver um
00:00:12agente suficientemente bom, ele sempre pode se aprofundar no documento e trazer a
00:00:16informação certa com as citações e o embasamento corretos. Então, para isso, poder
00:00:20criar algum tipo de pipeline de indexação offline escalável que tenha as melhores restrições de custo
00:00:25é algo ideal. Mas uma coisa sobre abordagens baseadas em VLM é que,
00:00:31sabe, elas geralmente não são muito rápidas, e acho que muitas vezes, se tiver uploads de arquivos em tempo real,
00:00:36digamos que você esteja usando o Cloud Cowork, envie 1.000 documentos e precise
00:00:41processá-los em um minuto, ter um monte de VLMs processando isso em escala é realmente difícil
00:00:47para praticamente qualquer serviço de OCR existente, e para ser justo, isso inclui o nosso também. Eu
00:00:52acho que, no geral, também existe uma certa necessidade de uma solução de altíssima velocidade,
00:00:57para que você possa realmente processar coisas em tempo real, mesmo se tiver um processamento com VLM
00:01:03mais aprofundado para inspeção e análise visual detalhadas. É o que eu chamo de
00:01:08estar no fluxo do agente. Além do LlamaParse, que é o nosso serviço comercial
00:01:12voltado para processamento e extração de documentos, também criamos esta ferramenta chamada LightParse.
00:01:17Ela é surpreendentemente muito, muito boa. Não sei se vocês acompanharam algumas threads no Twitter,
00:01:21mas ela é baseada em Rust. É o parser open source mais rápido do mercado. É totalmente
00:01:27gratuito e sem pegadinhas. Acho que a licença é MIT ou Apache. E
00:01:33ela é basicamente o parser de Markdown mais preciso existente que não usa VLM ou
00:01:37qualquer tipo de modelo mais avançado. Isso é bem legal porque você pode usá-la
00:01:43como padrão no fluxo de agentes assistentes. Digamos que esteja enviando vários documentos
00:01:48para o Cloud Code, Cloud Codework, Codex, e queira processar mil PDFs extremamente
00:01:53rápido. Você sempre pode fazer isso. E depois equipar um parser baseado em VLM, como o LlamaParse
00:01:59ou outros modelos de ponta, como uma ferramenta. Então, esses agentes vão fazer uma varredura
00:02:04rápida em todos os documentos primeiro. Apenas analisar todo o contexto com extrema
00:02:09eficiência. E depois, se precisarem se aprofundar em uma página com tabelas ou
00:02:13gráficos e entender os valores de forma mais detalhada, usarão uma ferramenta baseada em VLM, de processamento
00:02:19mais lento, para garantir a leitura correta das informações. Isso está disponível
00:02:22como uma skill instalável com um clique. Complementa qualquer outra ferramenta de OCR
00:02:27mais avançada baseada em VLM que queira usar. Nós a projetamos para ser o mais rápida possível e fácil de
00:02:32conectar ao seu agente de IA favorito.
00:02:35Eu passei bem rápido por boa parte disso, mas basicamente dedicamos
00:02:42muito tempo na camada de parsing. Há também outros componentes gerais envolvendo a camada
00:02:47semântica e de armazenamento em termos de extração e busca de documentos e, claro,
00:02:51fluxos de trabalho com documentos. Por conta do tempo, acho que vou pular algumas áreas
00:02:57pouco exploradas, como formatos de documentos nativos para agentes, hill-climbing como serviço e outras. Mas compartilharei
00:03:01o conjunto completo de slides online. Em relação à camada semântica e de armazenamento,
00:03:06além do parsing de documentos, muitos casos de uso também exigem o retorno de informações estruturadas
00:03:12em escala a partir de documentos. Quer esteja processando um milhão de faturas, relatórios de despesas,
00:03:16recibos ou sinistros, você precisa garantir o retorno de
00:03:21dados estruturados que possam ser inseridos num banco de dados ou sistema interno. A maioria desses casos de uso
00:03:26gira em torno de como automatizar os fluxos de trabalho que
00:03:31as pessoas costumam fazer ao digitalizar papéis e digitar dados. Seja
00:03:36com faturas, sinistros, contratos, recibos ou outros. Nós também criamos essas
00:03:41funcionalidades dentro do LlamaParse. Vários dos nossos recursos são otimizados para oferecer
00:03:47baixo custo com altíssima precisão. E você obtém citações detalhadas
00:03:52de volta ao documento de origem para cada dado extraído. Claro, você pode rodar isso em
00:03:56pipelines em escala com pontuações de confiança. Além de poder sinalizar
00:04:02se temos certeza sobre determinado valor antes de inseri-lo em algum
00:04:06sistema de software. Há também a busca em documentos, que é um conjunto expandido de ferramentas,
00:04:12envolvendo recuperação, BM25, grep, busca vetorial, leitura e rolagem. Todas essas funcionalidades estão
00:04:19disponíveis em nossas plataformas comerciais e em soluções open source. Mas eu queria
00:04:23dar um panorama geral dos conceitos atuais. Vou pular esta seção sobre os próximos passos e ir direto para o final. Sei que estourando um pouco o tempo, então agradeço muito pela presença de todos. Deixe-me só
00:04:36chegar nessa parte rapidamente. Ah, certo. Vou pular esta parte e colocá-la online. Nosso estande é o LG 47, caso queiram dar uma passada lá. E vamos realizar um grande torneio de pickleball hoje. Muito obrigado pelo tempo de vocês.
00:05:06Obrigado.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video