Aufbau des Document Context Layer für KI-Agenten — Jerry Liu, LlamaIndex
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00wissen Sie, wie sie in Ihrem SharePoint ständig aktualisiert werden, genau wie für RAG-Wissensbasis-
00:00:04Suchen. In solchen Fällen möchte man natürlich, dass es nicht völlig ungenau ist,
00:00:08aber selbst wenn es ein wenig fehlerhaft ist, ist das auch in Ordnung, denn am Ende, wenn man einen
00:00:12ausreichend guten Agenten hat, kann er immer tiefer in das Dokument eintauchen und die richtigen
00:00:16Informationen mit den passenden Zitaten und Fundstellen hervorholen. Für solche Anwendungsfälle ist
00:00:20die Erstellung einer skalierbaren Offline-Indizierungspipeline mit den besten Kostenbeschränkungen
00:00:25optimal. Eine Sache bei VLM-basierten Ansätzen ist jedoch, dass sie
00:00:31in der Regel nicht sehr schnell sind. Und ich denke, wenn man oft Echtzeit-
00:00:36Datei-Uploads hat – sagen wir, Sie nutzen Cloud Cowork, laden 1.000 Dokumente hoch und müssen
00:00:41diese innerhalb einer Minute verarbeiten –, dann ist die Verarbeitung im großen Maßstab durch etliche VLMs wirklich schwer
00:00:47für im Grunde jeden einzelnen OCR-Dienst da draußen. Und um fair zu sein, schließt das unseren eigenen mit ein. Ich
00:00:52denke, generell gibt es auch einen Bedarf an einer Lösung mit extrem geringer Latenz,
00:00:57damit man Inhalte tatsächlich in Echtzeit verarbeiten kann, selbst wenn man eine tiefere VLM-gestützte
00:01:03Verarbeitung für eine umfassendere visuelle Prüfung und Analyse nutzt. Genau das meine ich
00:01:08mit dem Verbleib in der Agenten-Schleife. Neben LlamaParse, unserem kommerziellen Dienst
00:01:12für Dokumentenverarbeitung und -extraktion, haben wir auch dieses Tool namens LightParse entwickelt.
00:01:17Es ist überraschend gut. Ich weiß nicht, ob Sie einige der Twitter-Threads
00:01:21verfolgt haben, aber es ist in Rust geschrieben. Es ist der schnellste Open-Source-Parser da draußen. Es ist völlig
00:01:27kostenlos und ohne jegliche Bedingungen. Ich glaube, es steht unter MIT- oder Apache-Lizenz. Und
00:01:33es ist im Grunde der genauste Markdown-Parser auf dem Markt, der ohne VLM oder
00:01:37eine andere Art von tieferem Modell auskommt. Das ist ziemlich praktisch, weil man es
00:01:43als Standard in der Schleife des Assistenzagenten verwenden kann. Nehmen wir an, Sie laden eine Reihe von Dokumenten
00:01:48in Cloud Code, Cloud Codework oder Codex hoch. Und Sie möchten, dass tausend PDFs extrem
00:01:53schnell verarbeitet werden. Das können Sie jederzeit tun. Und dann können Sie einen VLM-basierten Parser wie LlamaParse
00:01:59oder andere Spitzenmodelle als Werkzeug einbinden. Diese Agenten machen zuerst einen schnellen
00:02:04Durchlauf über alle Dokumente. Sie überfliegen den gesamten Kontext extrem
00:02:09effizient. Und wenn sie tatsächlich tiefer in eine Seite mit Tabellen oder
00:02:13Diagrammen eintauchen müssen, um die Werte genauer zu verstehen, nutzen sie ein VLM-basiertes Tool mit langsamerer
00:02:19Verarbeitung, um sicherzustellen, dass die Informationen korrekt gelesen werden. Dies ist
00:02:22als Skill mit einem Klick installierbar. Es ergänzt jede andere tiefgreifende VLM-basierte OCR-Lösung,
00:02:27die Sie verwenden möchten. Wir haben es so konzipiert, dass es so schnell wie möglich ist und sich leicht
00:02:32in Ihren bevorzugten KI-Agenten einbinden lässt.
00:02:35Ich bin jetzt ziemlich schnell durch einiges davon durchgegangen, aber im Grunde haben wir
00:02:42viel Zeit auf die Parsing-Ebene verwendet. Es gibt auch andere allgemeine Komponenten rund um die
00:02:47Semantik- und Speicherebene im Hinblick auf Dokumentenextraktion und -suche sowie natürlich
00:02:51Dokumenten-Workflows. Aus Zeitgründen überspringe ich wohl einige der unerschlossenen
00:02:57Bereiche wie agentennative Dokumentformate, Hill-Climbing-as-a-Service und anderes. Aber ich werde
00:03:01die vollständigen Folien online teilen. Was die Semantik- und Speicherebene betrifft: Neben
00:03:06dem Parsen von Dokumenten erfordern viele Anwendungsfälle auch das Erfassen strukturierter Informationen
00:03:12im großen Maßstab aus Dokumenten. Egal, ob Sie eine Million Rechnungen, Spesenabrechnungen,
00:03:16Belege oder Schadensmeldungen verarbeiten – Sie müssen sicherstellen, dass Sie tatsächlich
00:03:21strukturierte Ausgaben erhalten, die Sie in eine nachgelagerte Datenbank oder ein System einspeisen können. Viele dieser
00:03:26Anwendungsfälle drehen sich im Grunde um die Frage, wie man Arbeitsschritte automatisieren kann,
00:03:31die typischerweise von Menschen beim Scannen von Dokumenten und bei der Dateneingabe erledigt werden. Ob
00:03:36es sich dabei wieder um Rechnungen, Anträge, Verträge, Quittungen oder Sonstiges handelt. Wir haben diese
00:03:41Funktionen ebenfalls in LlamaParse integriert. Viele unserer Funktionen sind darauf ausgelegt,
00:03:47geringe Kosten bei extrem hoher Genauigkeit zu bieten. Zudem erhält man detaillierte Quellennachweise
00:03:52bis zurück zum Quelldokument für jeden extrahierten Wert. Und das lässt sich natürlich
00:03:56in der Pipeline im großen Maßstab mit Konfidenzwerten ausführen. Man kann auch genau kennzeichnen,
00:04:02ob wir uns bei einem bestimmten Wert sicher sind, bevor wir entscheiden, ihn in ein
00:04:06Software-System zu übernehmen. Es gibt auch die Dokumentensuche, im Grunde ein erweitertes Toolset,
00:04:12wie erwähnt rund um Information Retrieval, BM25, Grep, Vektorsuche, Lesen und Scrollen. Alle diese Funktionen
00:04:19sind in einigen unserer kommerziellen Plattformen sowie in Open-Source-Angeboten verfügbar. Ich wollte aber auch
00:04:23ein Bild der allgemeinen Konzepte vermitteln, die es heute gibt. Ich überspringe also den Abschnitt über die Zukunft und gehe direkt zum Ende. Ich weiß, dass ich die Zeit etwas überschritten habe, daher vielen Dank für Ihre Zeit heute. Und lassen Sie mich kurz...
00:04:36...schauen, wie ich schnell zu diesem Teil komme. Ah, richtig. Ich überspringe diesen Teil und stelle ihn online. Unser Stand ist bei LG 47, falls Sie vorbeischauen möchten. Und wir veranstalten heute ein riesiges Pickleball-Turnier. Vielen Dank für Ihre Aufmerksamkeit.
00:05:06Vielen Dank.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video