Construyendo la Capa de Contexto de Documentos para Agentes de IA — Jerry Liu, LlamaIndex

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00ya sabes, actualizándose continuamente en tu SharePoint, simplemente para, no sé, búsquedas en bases
00:00:04de conocimiento RAG. En estos casos, obviamente quieres que no sea terriblemente impreciso,
00:00:08pero si falla un poco, también está bien, porque al final, si tienes un
00:00:12agente lo suficientemente bueno, siempre puede profundizar en el documento y extraer la
00:00:16información correcta con sus citas y fundamentación adecuadas. Así que, para esto, poder
00:00:20crear una canalización de indexación fuera de línea escalable que tenga los mejores límites de costes
00:00:25es algo óptimo. Sin embargo, algo a tener en cuenta sobre los enfoques basados en VLM es que,
00:00:31por lo general, no son muy rápidos, y creo que muchas veces, si tienes subidas de archivos
00:00:36en tiempo real, digamos que usas Cloud Cowork, subes 1000 documentos y necesitas
00:00:41procesarlos en un minuto, hacer que varios VLM los procesen a gran escala es algo realmente difícil
00:00:47para básicamente cualquier servicio de OCR del mercado, y siendo justos, eso incluye el nuestro. Creo
00:00:52que, en general, también existe la necesidad de contar con una solución de latencia extremadamente baja
00:00:57para poder procesar las cosas en tiempo real, incluso si se cuenta con un procesamiento VLM
00:01:03más profundo para una inspección y análisis visual más detallados. Y eso es a lo que me refiero
00:01:08con estar en el bucle del agente. Así que, además de LlamaParse, que es nuestro servicio comercial
00:01:12para procesamiento y extracción de documentos, también creamos una herramienta llamada LightParse.
00:01:17Sorprendentemente, es muy, muy buena. No sé si habéis estado siguiendo algunos hilos
00:01:21en Twitter, pero está basada en Rust. Es el analizador de código abierto más rápido del mercado. Es totalmente
00:01:27gratuito y básicamente sin condiciones de ningún tipo. Creo que tiene licencia MIT o Apache. Y
00:01:33es, básicamente, el analizador de markdown más preciso que existe sin usar un VLM ni
00:01:37ningún tipo de modelo más avanzado. Esto resulta genial porque se puede utilizar
00:01:43por defecto en el bucle del agente de asistencia. Pongamos que estás subiendo una serie de documentos
00:01:48a Cloud Code, Cloud Codework o Codex, y quieres que procese mil PDF de forma extremadamente
00:01:53rápida. Siempre puedes hacerlo. Y luego, equipar un analizador basado en VLM, como LlamaParse
00:01:59u otros modelos de vanguardia, como una herramienta. Así que lo que harán estos agentes es dar una pasada rápida
00:02:04rápida de todos los documentos primero. Es decir, escanear todo el contexto de manera sumamente
00:02:09eficiente. Y si de verdad necesita profundizar en una página con tablas,
00:02:13con gráficos, y requiere comprender mejor los valores, usará una herramienta basada en VLM, un procesamiento
00:02:19más lento, para asegurarse de leer bien la información. Esto está disponible
00:02:22como una habilidad instalable con un solo clic. Complementa cualquier otra herramienta de OCR basada en VLM
00:02:27más compleja que queráis usar. Y la hemos diseñado para que sea lo más rápida posible y fácil de
00:02:32integrar en vuestro agente de IA favorito.
00:02:35He pasado bastante rápido por todo esto, pero básicamente le hemos dedicado
00:02:42mucho tiempo a la capa de análisis. Hay otros componentes generales sobre la capa
00:02:47semántica y de almacenamiento en términos de extracción y búsqueda de documentos y, por supuesto, sobre los
00:02:51flujos de trabajo con documentos. Por falta de tiempo, omitiré algunas áreas sin explorar,
00:02:57como los formatos de documento nativos de agentes o el hill-climbing como servicio, entre otras. Pero compartiré
00:03:01todas las diapositivas en línea. Respecto a la capa semántica y de almacenamiento, más allá del
00:03:06análisis de documentos, muchos casos de uso requieren recuperar información estructurada
00:03:12a gran escala a partir de documentos. Ya sea que proceséis un millón de facturas, informes de gastos,
00:03:16recibos o reclamaciones, debéis aseguraros de obtener
00:03:21resultados estructurados que podáis introducir en una base de datos o sistema posterior. Muchos de estos casos
00:03:26de uso giran en torno a cómo automatizar gran parte de los procesos
00:03:31que suelen hacer las personas al escanear documentación y registrar datos. Ya sean,
00:03:36de nuevo, facturas, reclamaciones, contratos, recibos u otros. Hemos incorporado estas
00:03:41funciones dentro de LlamaParse. Muchas de nuestras funciones están optimizadas para ofrecer
00:03:47un bajo coste con una precisión extremadamente alta. Además, obtenéis citas detalladas que se remiten
00:03:52al documento de origen para cada dato extraído. Por supuesto, esto se puede ejecutar
00:03:56en la canalización a gran escala con puntuaciones de confianza. También es posible señalar
00:04:02si estamos seguros o no sobre un valor concreto antes de decidir integrarlo en algún tipo
00:04:06de sistema de software. También está la búsqueda de documentos, que es un conjunto ampliado de herramientas,
00:04:12como mencioné, en torno a recuperación, BM25, grep, búsqueda vectorial, lectura y desplazamiento. Todas estas funciones están
00:04:19disponibles en algunas de nuestras plataformas comerciales y en las opciones de código abierto. Pero también quería
00:04:23mostrar el panorama general de los conceptos actuales. Omitiré esta sección sobre los próximos pasos e iré directo al final. Sé que me he pasado un poco de tiempo, así que os agradezco mucho que hayáis estado aquí hoy. Y dejadme ver
00:04:36cómo ir a esta parte rápidamente. Ah, vale. Me voy a saltar esto. Lo subiré a la red. Nuestro stand es el LG 47, por si queréis pasaros. Y hoy organizamos un gran torneo de pickleball. Muchas gracias por vuestro tiempo.
00:05:06Muchas gracias.

Key Takeaway

La arquitectura óptima para agentes de IA combina el análisis ultrarrápido sin VLM de LightParse para el escaneo masivo de documentos con el procesamiento exhaustivo de LlamaParse solo cuando se requiere inspeccionar tablas y gráficos complejos.

Highlights

  • LightParse es un analizador de código abierto basado en Rust que ofrece la máxima velocidad de procesamiento de markdown sin recurrir a modelos de visión y lenguaje (VLM).

  • Los agentes de IA aceleran la revisión de miles de documentos mediante un escanéo inicial ultra rápido con LightParse, reservando el procesamiento pesado VLM para páginas complejas con tablas y gráficos.

  • LlamaParse integra la extracción masiva de datos en facturas, recibos y contratos, devolviendo puntuaciones de confianza y citas exactas asociadas al documento de origen.

Timeline

Estrategia de análisis en dos fases para agentes de IA

  • El procesamiento exclusivo mediante modelos de visión y lenguaje (VLM) resulta lento y costoso para ingestas masivas en tiempo real.
  • LightParse permite procesar miles de archivos PDF por minuto de forma gratuita y con latencia reducida.
  • Los agentes emplean un flujo híbrido que inspecciona primero el contexto general y solo activa herramientas VLM en páginas con datos complejos.

Las canalizaciones RAG tradicionales toleran cierto grado de imprecisión en las búsquedas fuera de línea, pero las cargas masivas en tiempo real colapsan los servicios OCR estándar basados en VLM. LightParse resuelve este cuello de botella al operar bajo código abierto en Rust como el analizador de markdown sin VLM más rápido del mercado. Al integrarse como una habilidad dentro del bucle del agente, este ejecuta una primera lectura veloz sobre el contexto global y recurre a LlamaParse solo al detectar contenido visual detallado, como tablas o gráficos.

Extracción de datos estructurados y funciones de búsqueda masiva

  • LlamaParse automatiza la conversión de facturas, contratos y reclamaciones en registros estructurados para bases de datos.
  • Cada dato extraído incluye un índice de confianza y citas directas al documento original.
  • El ecosistema combina recuperación vectorial, BM25, grep y capacidades de desplazamiento en un conjunto unificado de herramientas de búsqueda.

El procesamiento de grandes volúmenes de documentación administrativa exige extraer información estructurada con margen de error mínimo y costes contenidos. LlamaParse añade una capa semántica que valida cada dato extraído mediante puntuaciones de confianza antes de transferirlo a los sistemas de software de la empresa. Además, la plataforma incorpora herramientas avanzadas de recuperación documental que integran búsqueda vectorial y léxica tradicional para simplificar la localización de referencias exactas.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video