Créer la couche de contexte documentaire pour les agents IA — Jerry Liu, LlamaIndex
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00mis à jour en continu dans votre SharePoint, juste pour de la recherche RAG
00:00:04dans des bases de connaissances. Dans ces cas-là, vous voulez éviter que ce soit trop inexact,
00:00:08mais même si c'est un peu imparfait, ce n'est pas grave, car au final, si vous avez un
00:00:12agent suffisamment performant, il peut toujours creuser le document et faire ressortir
00:00:16la bonne information avec les bonnes citations et le bon ancrage. Donc, pour cela,
00:00:20créer un pipeline d'indexation hors ligne échelonnable avec les meilleures contraintes de coût
00:00:25est une approche optimale. Cependant, avec les approches basées sur les VLM,
00:00:31elles ne sont généralement pas très rapides. Et souvent, si vous avez des dépôts de fichiers
00:00:36en temps réel
00:00:41les traiter en une minute, faire traiter tout ça à grande échelle par plusieurs VLM est très difficile
00:00:47pour pratiquement tous les services d'OCR existants, et pour être tout à fait honnête, le nôtre inclus. Je
00:00:52pense qu'en général, il existe aussi un besoin pour une solution à très faible latence
00:00:57afin de pouvoir traiter les éléments en temps réel, même si vous disposez d'un traitement
00:01:03plus poussé par VLM pour de l'inspection et de l'analyse visuelles approfondies. Et donc, c'est ce que j'appelle
00:01:08être dans la boucle de l'agent. En plus de LlamaParse, qui est notre service commercial
00:01:12de traitement et d'extraction de documents, nous avons aussi créé cet outil appelé LightParse.
00:01:17Il est vraiment, vraiment excellent. Je ne sais pas si vous avez suivi quelques threads sur Twitter,
00:01:21mais il est écrit en Rust. C'est le parser open source le plus rapide disponible. Il est complètement
00:01:27gratuit, sans aucune restriction. Je crois qu'il est sous licence MIT ou Apache. Et
00:01:33c'est le parser Markdown le plus précis du marché parmi ceux qui n'utilisent pas de VLM ni
00:01:37de modèle plus lourd. C'est donc très appréciable, car vous pouvez l'utiliser
00:01:43par défaut dans la boucle de l'agent d'assistance. Admettons que vous importiez plein de documents
00:01:48dans Cloud Code, Cloud Codework, Codex, et que vous vouliez traiter un millier de PDF extrêmement
00:01:53vite, c'est possible. Et vous pouvez ensuite équiper un parser basé sur VLM, comme LlamaParse
00:01:59ou d’autres modèles de pointe, sous forme d'outil. Ce que ces agents vont faire, c'est d'abord un survol
00:02:04rapide de tous les documents. En gros, ils balayent l'ensemble du contexte de manière extrêmement
00:02:09efficace. Et ensuite, s'ils doivent vraiment analyser une page contenant des tableaux,
00:02:13des graphiques, et qu'ils ont besoin de mieux comprendre les valeurs, ils utiliseront un outil basé sur VLM,
00:02:19au traitement plus lent, pour s'assurer de bien lire l'information. C'est disponible
00:02:22sous forme de compétence installable en un clic. Cela complète n'importe quel autre outil d'OCR avancé
00:02:27basé sur VLM que vous voulez utiliser. Nous l'avons conçu pour qu'il soit le plus rapide possible et facile
00:02:32à intégrer à votre agent IA préféré.
00:02:35J'ai un peu survolé tout ça très rapidement, mais en gros, nous avons passé
00:02:42beaucoup de temps sur la couche de parsing. Il y a aussi d'autres composants globaux autour de la couche
00:02:47sémantique et de stockage pour l'extraction et la recherche de documents, et bien sûr,
00:02:51les flux de travail documentaire. Faute de temps, je vais passer sur certains domaines encore inexplorés,
00:02:57comme les formats de documents natifs pour agents ou le hill-climbing as a service. Mais je partagerai
00:03:01l'ensemble des diapositives en ligne. Concernant la couche sémantique et de stockage, en plus
00:03:06du parsing de documents, de nombreux cas d'usage nécessitent de récupérer des informations structurées
00:03:12à grande échelle à partir de documents. Que vous traitiez un million de factures, de notes de frais,
00:03:16de reçus ou de réclamations, vous devez vous assurer d'obtenir en retour
00:03:21des données structurées exploitables dans une base de données ou un système en aval. La plupart de ces cas d'usage
00:03:26tournent autour de la même question : comment automatiser une grande partie du travail
00:03:31effectué par des humains pour numériser des documents et saisir des données ? Qu'il s'agisse
00:03:36à nouveau de factures, de dossiers de réclamation, de contrats ou de reçus. Nous avons intégré ces
00:03:41fonctionnalités dans LlamaParse. Nombre de nos fonctionnalités sont optimisées pour
00:03:47offrir un faible coût tout en garantissant une précision très élevée. Vous obtenez des citations précises
00:03:52qui renvoient directement au document source pour chaque donnée extraite. Et bien sûr, vous pouvez exécuter cela
00:03:56dans le pipeline à grande échelle avec des scores de confiance, et ainsi être en mesure de signaler
00:04:02si nous sommes certains ou non d'une valeur avant de l'intégrer dans un
00:04:06système logiciel. Il y a aussi la recherche documentaire, un ensemble d'outils élargi,
00:04:12incluant la recherche d'information, BM25, grep, la recherche vectorielle, la lecture et le défilement.
00:04:19Toutes ces fonctionnalités sont disponibles dans nos plateformes commerciales et nos offres open source.
00:04:23Je voulais simplement donner un aperçu des concepts actuels. Je vais sauter la section sur les prochaines étapes et aller directement à la fin. Je sais que j'ai un peu dépassé le temps imparti, alors merci beaucoup pour votre attention. Permettez-moi juste de...
00:04:36Comment accéder à cette partie rapidement... Ah voilà, je vais passer cette partie et la mettre en ligne. Notre stand est le LG 47 si vous souhaitez passer nous voir. Et nous organisons un grand tournoi de pickleball aujourd'hui. Merci pour votre temps.
00:05:06Merci.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video