Construindo a Camada de Contexto de Documentos para Agentes de IA — Jerry Liu, LlamaIndex

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00sabe, sendo atualizados continuamente no seu SharePoint, só para busca em base de conhecimento RAG.
00:00:04Nesses casos, você obviamente quer que não seja super impreciso,
00:00:08mas se ficar um pouco desformatado, tudo bem também, porque no fim, se tiver um
00:00:12agente suficientemente bom, ele sempre pode se aprofundar no documento e trazer a
00:00:16informação certa com as citações e o embasamento corretos. Então, para isso, poder
00:00:20criar algum tipo de pipeline de indexação offline escalável que tenha as melhores restrições de custo
00:00:25é algo ideal. Mas uma coisa sobre abordagens baseadas em VLM é que,
00:00:31sabe, elas geralmente não são muito rápidas, e acho que muitas vezes, se tiver uploads de arquivos em tempo real,
00:00:36digamos que você esteja usando o Cloud Cowork, envie 1.000 documentos e precise
00:00:41processá-los em um minuto, ter um monte de VLMs processando isso em escala é realmente difícil
00:00:47para praticamente qualquer serviço de OCR existente, e para ser justo, isso inclui o nosso também. Eu
00:00:52acho que, no geral, também existe uma certa necessidade de uma solução de altíssima velocidade,
00:00:57para que você possa realmente processar coisas em tempo real, mesmo se tiver um processamento com VLM
00:01:03mais aprofundado para inspeção e análise visual detalhadas. É o que eu chamo de
00:01:08estar no fluxo do agente. Além do LlamaParse, que é o nosso serviço comercial
00:01:12voltado para processamento e extração de documentos, também criamos esta ferramenta chamada LightParse.
00:01:17Ela é surpreendentemente muito, muito boa. Não sei se vocês acompanharam algumas threads no Twitter,
00:01:21mas ela é baseada em Rust. É o parser open source mais rápido do mercado. É totalmente
00:01:27gratuito e sem pegadinhas. Acho que a licença é MIT ou Apache. E
00:01:33ela é basicamente o parser de Markdown mais preciso existente que não usa VLM ou
00:01:37qualquer tipo de modelo mais avançado. Isso é bem legal porque você pode usá-la
00:01:43como padrão no fluxo de agentes assistentes. Digamos que esteja enviando vários documentos
00:01:48para o Cloud Code, Cloud Codework, Codex, e queira processar mil PDFs extremamente
00:01:53rápido. Você sempre pode fazer isso. E depois equipar um parser baseado em VLM, como o LlamaParse
00:01:59ou outros modelos de ponta, como uma ferramenta. Então, esses agentes vão fazer uma varredura
00:02:04rápida em todos os documentos primeiro. Apenas analisar todo o contexto com extrema
00:02:09eficiência. E depois, se precisarem se aprofundar em uma página com tabelas ou
00:02:13gráficos e entender os valores de forma mais detalhada, usarão uma ferramenta baseada em VLM, de processamento
00:02:19mais lento, para garantir a leitura correta das informações. Isso está disponível
00:02:22como uma skill instalável com um clique. Complementa qualquer outra ferramenta de OCR
00:02:27mais avançada baseada em VLM que queira usar. Nós a projetamos para ser o mais rápida possível e fácil de
00:02:32conectar ao seu agente de IA favorito.
00:02:35Eu passei bem rápido por boa parte disso, mas basicamente dedicamos
00:02:42muito tempo na camada de parsing. Há também outros componentes gerais envolvendo a camada
00:02:47semântica e de armazenamento em termos de extração e busca de documentos e, claro,
00:02:51fluxos de trabalho com documentos. Por conta do tempo, acho que vou pular algumas áreas
00:02:57pouco exploradas, como formatos de documentos nativos para agentes, hill-climbing como serviço e outras. Mas compartilharei
00:03:01o conjunto completo de slides online. Em relação à camada semântica e de armazenamento,
00:03:06além do parsing de documentos, muitos casos de uso também exigem o retorno de informações estruturadas
00:03:12em escala a partir de documentos. Quer esteja processando um milhão de faturas, relatórios de despesas,
00:03:16recibos ou sinistros, você precisa garantir o retorno de
00:03:21dados estruturados que possam ser inseridos num banco de dados ou sistema interno. A maioria desses casos de uso
00:03:26gira em torno de como automatizar os fluxos de trabalho que
00:03:31as pessoas costumam fazer ao digitalizar papéis e digitar dados. Seja
00:03:36com faturas, sinistros, contratos, recibos ou outros. Nós também criamos essas
00:03:41funcionalidades dentro do LlamaParse. Vários dos nossos recursos são otimizados para oferecer
00:03:47baixo custo com altíssima precisão. E você obtém citações detalhadas
00:03:52de volta ao documento de origem para cada dado extraído. Claro, você pode rodar isso em
00:03:56pipelines em escala com pontuações de confiança. Além de poder sinalizar
00:04:02se temos certeza sobre determinado valor antes de inseri-lo em algum
00:04:06sistema de software. Há também a busca em documentos, que é um conjunto expandido de ferramentas,
00:04:12envolvendo recuperação, BM25, grep, busca vetorial, leitura e rolagem. Todas essas funcionalidades estão
00:04:19disponíveis em nossas plataformas comerciais e em soluções open source. Mas eu queria
00:04:23dar um panorama geral dos conceitos atuais. Vou pular esta seção sobre os próximos passos e ir direto para o final. Sei que estourando um pouco o tempo, então agradeço muito pela presença de todos. Deixe-me só
00:04:36chegar nessa parte rapidamente. Ah, certo. Vou pular esta parte e colocá-la online. Nosso estande é o LG 47, caso queiram dar uma passada lá. E vamos realizar um grande torneio de pickleball hoje. Muito obrigado pelo tempo de vocês.
00:05:06Obrigado.

Key Takeaway

A arquitetura eficiente para processamento de documentos em agentes de IA combina a varredura ultra-rápida do parser em Rust LightParse com a inspeção pontual e precisa de tabelas complexas via LlamaParse.

Highlights

  • O LightParse é um parser de Markdown open source desenvolvido em Rust que opera sem o uso de modelos de visão e linguagem (VLMs).

  • Modelos de visão e linguagem enfrentam gargalos de velocidade ao processar grandes volumes de documentos em tempo real, como o envio de 1.000 PDFs em um minuto.

  • A estratégia ideal para agentes de IA combina uma varredura rápida via LightParse com a inspeção detalhada de páginas complexas usando LlamaParse.

  • O LlamaParse oferece extração de dados estruturados em escala para faturas, recibos e contratos, acompanhada de pontuações de confiança e citações diretas ao documento original.

Timeline

Desafios de escalabilidade no processamento visual de documentos

  • Pipelines de indexação offline escaláveis atendem bem a buscas em bases RAG sem exigir formatação perfeita.
  • Modelos de visão e linguagem (VLMs) não conseguem processar uploads massivos em tempo real devido à baixa velocidade de execução.
  • A análise detalhada de documentos exige o equilíbrio entre parsers de altíssima velocidade e motores visuais profundos.

Sistemas de busca em bases de conhecimento RAG lidam bem com pequenas imperfeições de formatação, pois agentes avançados conseguem navegar no contexto e extrair citações corretas. O gargalo surge no envio em tempo real de grandes volumes de arquivos, como o processamento de 1.000 documentos por minuto. Nesses cenários, os serviços tradicionais de OCR e VLMs não mantêm a velocidade necessária para o fluxo de trabalho dos agentes.

Arquitetura em duas camadas com LightParse e LlamaParse

  • O LightParse é o parser de Markdown open source mais rápido do mercado, construído em Rust e distribuído sob licenças MIT ou Apache.
  • Agentes de IA usam o LightParse para fazer uma leitura inicial ultra-rápida de todo o contexto documental.
  • Ferramentas baseadas em VLM como o LlamaParse entram em ação apenas quando o agente precisa interpretar tabelas e gráficos específicos.

O LightParse funciona como a camada primária de processamento em fluxos de assistentes de IA, permitindo a varredura instantânea de milhares de PDFs sem os custos e a lentidão dos modelos visuais. Quando o agente detecta páginas com tabelas, gráficos ou dados ambíguos, ele aciona dinamicamente o LlamaParse ou outro VLM como uma ferramenta especializada. Essa abordagem híbrida garante velocidade máxima no fluxo geral sem perder a precisão na leitura visual detalhada.

Extração estruturada de dados e ferramentas de busca em documentos

  • A extração estruturada automatiza a digitação de dados em processos corporativos envolvendo faturas, recibos e contratos.
  • O LlamaParse fornece citações diretas do documento de origem e atribui pontuações de confiança para cada dado extraído.
  • A camada de busca em documentos integra recuperação vetorial, BM25, grep, leitura e rolagem.

A automação de fluxos corporativos exige a conversão de papéis digitalizados em dados estruturados para inserção em bancos de dados internos. O LlamaParse realiza esse processo em escala para milhões de documentos, sinalizando o nível de certeza dos valores antes da gravação no sistema. A plataforma também disponibiliza um conjunto abrangente de ferramentas de busca que combina recuperação semântica e métodos tradicionais de varredura de texto.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video