Construyendo la Capa de Contexto de Documentos para Agentes de IA — Jerry Liu, LlamaIndex
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00ya sabes, actualizándose continuamente en tu SharePoint, simplemente para, no sé, búsquedas en bases
00:00:04de conocimiento RAG. En estos casos, obviamente quieres que no sea terriblemente impreciso,
00:00:08pero si falla un poco, también está bien, porque al final, si tienes un
00:00:12agente lo suficientemente bueno, siempre puede profundizar en el documento y extraer la
00:00:16información correcta con sus citas y fundamentación adecuadas. Así que, para esto, poder
00:00:20crear una canalización de indexación fuera de línea escalable que tenga los mejores límites de costes
00:00:25es algo óptimo. Sin embargo, algo a tener en cuenta sobre los enfoques basados en VLM es que,
00:00:31por lo general, no son muy rápidos, y creo que muchas veces, si tienes subidas de archivos
00:00:36en tiempo real, digamos que usas Cloud Cowork, subes 1000 documentos y necesitas
00:00:41procesarlos en un minuto, hacer que varios VLM los procesen a gran escala es algo realmente difícil
00:00:47para básicamente cualquier servicio de OCR del mercado, y siendo justos, eso incluye el nuestro. Creo
00:00:52que, en general, también existe la necesidad de contar con una solución de latencia extremadamente baja
00:00:57para poder procesar las cosas en tiempo real, incluso si se cuenta con un procesamiento VLM
00:01:03más profundo para una inspección y análisis visual más detallados. Y eso es a lo que me refiero
00:01:08con estar en el bucle del agente. Así que, además de LlamaParse, que es nuestro servicio comercial
00:01:12para procesamiento y extracción de documentos, también creamos una herramienta llamada LightParse.
00:01:17Sorprendentemente, es muy, muy buena. No sé si habéis estado siguiendo algunos hilos
00:01:21en Twitter, pero está basada en Rust. Es el analizador de código abierto más rápido del mercado. Es totalmente
00:01:27gratuito y básicamente sin condiciones de ningún tipo. Creo que tiene licencia MIT o Apache. Y
00:01:33es, básicamente, el analizador de markdown más preciso que existe sin usar un VLM ni
00:01:37ningún tipo de modelo más avanzado. Esto resulta genial porque se puede utilizar
00:01:43por defecto en el bucle del agente de asistencia. Pongamos que estás subiendo una serie de documentos
00:01:48a Cloud Code, Cloud Codework o Codex, y quieres que procese mil PDF de forma extremadamente
00:01:53rápida. Siempre puedes hacerlo. Y luego, equipar un analizador basado en VLM, como LlamaParse
00:01:59u otros modelos de vanguardia, como una herramienta. Así que lo que harán estos agentes es dar una pasada rápida
00:02:04rápida de todos los documentos primero. Es decir, escanear todo el contexto de manera sumamente
00:02:09eficiente. Y si de verdad necesita profundizar en una página con tablas,
00:02:13con gráficos, y requiere comprender mejor los valores, usará una herramienta basada en VLM, un procesamiento
00:02:19más lento, para asegurarse de leer bien la información. Esto está disponible
00:02:22como una habilidad instalable con un solo clic. Complementa cualquier otra herramienta de OCR basada en VLM
00:02:27más compleja que queráis usar. Y la hemos diseñado para que sea lo más rápida posible y fácil de
00:02:32integrar en vuestro agente de IA favorito.
00:02:35He pasado bastante rápido por todo esto, pero básicamente le hemos dedicado
00:02:42mucho tiempo a la capa de análisis. Hay otros componentes generales sobre la capa
00:02:47semántica y de almacenamiento en términos de extracción y búsqueda de documentos y, por supuesto, sobre los
00:02:51flujos de trabajo con documentos. Por falta de tiempo, omitiré algunas áreas sin explorar,
00:02:57como los formatos de documento nativos de agentes o el hill-climbing como servicio, entre otras. Pero compartiré
00:03:01todas las diapositivas en línea. Respecto a la capa semántica y de almacenamiento, más allá del
00:03:06análisis de documentos, muchos casos de uso requieren recuperar información estructurada
00:03:12a gran escala a partir de documentos. Ya sea que proceséis un millón de facturas, informes de gastos,
00:03:16recibos o reclamaciones, debéis aseguraros de obtener
00:03:21resultados estructurados que podáis introducir en una base de datos o sistema posterior. Muchos de estos casos
00:03:26de uso giran en torno a cómo automatizar gran parte de los procesos
00:03:31que suelen hacer las personas al escanear documentación y registrar datos. Ya sean,
00:03:36de nuevo, facturas, reclamaciones, contratos, recibos u otros. Hemos incorporado estas
00:03:41funciones dentro de LlamaParse. Muchas de nuestras funciones están optimizadas para ofrecer
00:03:47un bajo coste con una precisión extremadamente alta. Además, obtenéis citas detalladas que se remiten
00:03:52al documento de origen para cada dato extraído. Por supuesto, esto se puede ejecutar
00:03:56en la canalización a gran escala con puntuaciones de confianza. También es posible señalar
00:04:02si estamos seguros o no sobre un valor concreto antes de decidir integrarlo en algún tipo
00:04:06de sistema de software. También está la búsqueda de documentos, que es un conjunto ampliado de herramientas,
00:04:12como mencioné, en torno a recuperación, BM25, grep, búsqueda vectorial, lectura y desplazamiento. Todas estas funciones están
00:04:19disponibles en algunas de nuestras plataformas comerciales y en las opciones de código abierto. Pero también quería
00:04:23mostrar el panorama general de los conceptos actuales. Omitiré esta sección sobre los próximos pasos e iré directo al final. Sé que me he pasado un poco de tiempo, así que os agradezco mucho que hayáis estado aquí hoy. Y dejadme ver
00:04:36cómo ir a esta parte rápidamente. Ah, vale. Me voy a saltar esto. Lo subiré a la red. Nuestro stand es el LG 47, por si queréis pasaros. Y hoy organizamos un gran torneo de pickleball. Muchas gracias por vuestro tiempo.
00:05:06Muchas gracias.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video