Aufbau des Document Context Layer für KI-Agenten — Jerry Liu, LlamaIndex

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00wissen Sie, wie sie in Ihrem SharePoint ständig aktualisiert werden, genau wie für RAG-Wissensbasis-
00:00:04Suchen. In solchen Fällen möchte man natürlich, dass es nicht völlig ungenau ist,
00:00:08aber selbst wenn es ein wenig fehlerhaft ist, ist das auch in Ordnung, denn am Ende, wenn man einen
00:00:12ausreichend guten Agenten hat, kann er immer tiefer in das Dokument eintauchen und die richtigen
00:00:16Informationen mit den passenden Zitaten und Fundstellen hervorholen. Für solche Anwendungsfälle ist
00:00:20die Erstellung einer skalierbaren Offline-Indizierungspipeline mit den besten Kostenbeschränkungen
00:00:25optimal. Eine Sache bei VLM-basierten Ansätzen ist jedoch, dass sie
00:00:31in der Regel nicht sehr schnell sind. Und ich denke, wenn man oft Echtzeit-
00:00:36Datei-Uploads hat – sagen wir, Sie nutzen Cloud Cowork, laden 1.000 Dokumente hoch und müssen
00:00:41diese innerhalb einer Minute verarbeiten –, dann ist die Verarbeitung im großen Maßstab durch etliche VLMs wirklich schwer
00:00:47für im Grunde jeden einzelnen OCR-Dienst da draußen. Und um fair zu sein, schließt das unseren eigenen mit ein. Ich
00:00:52denke, generell gibt es auch einen Bedarf an einer Lösung mit extrem geringer Latenz,
00:00:57damit man Inhalte tatsächlich in Echtzeit verarbeiten kann, selbst wenn man eine tiefere VLM-gestützte
00:01:03Verarbeitung für eine umfassendere visuelle Prüfung und Analyse nutzt. Genau das meine ich
00:01:08mit dem Verbleib in der Agenten-Schleife. Neben LlamaParse, unserem kommerziellen Dienst
00:01:12für Dokumentenverarbeitung und -extraktion, haben wir auch dieses Tool namens LightParse entwickelt.
00:01:17Es ist überraschend gut. Ich weiß nicht, ob Sie einige der Twitter-Threads
00:01:21verfolgt haben, aber es ist in Rust geschrieben. Es ist der schnellste Open-Source-Parser da draußen. Es ist völlig
00:01:27kostenlos und ohne jegliche Bedingungen. Ich glaube, es steht unter MIT- oder Apache-Lizenz. Und
00:01:33es ist im Grunde der genauste Markdown-Parser auf dem Markt, der ohne VLM oder
00:01:37eine andere Art von tieferem Modell auskommt. Das ist ziemlich praktisch, weil man es
00:01:43als Standard in der Schleife des Assistenzagenten verwenden kann. Nehmen wir an, Sie laden eine Reihe von Dokumenten
00:01:48in Cloud Code, Cloud Codework oder Codex hoch. Und Sie möchten, dass tausend PDFs extrem
00:01:53schnell verarbeitet werden. Das können Sie jederzeit tun. Und dann können Sie einen VLM-basierten Parser wie LlamaParse
00:01:59oder andere Spitzenmodelle als Werkzeug einbinden. Diese Agenten machen zuerst einen schnellen
00:02:04Durchlauf über alle Dokumente. Sie überfliegen den gesamten Kontext extrem
00:02:09effizient. Und wenn sie tatsächlich tiefer in eine Seite mit Tabellen oder
00:02:13Diagrammen eintauchen müssen, um die Werte genauer zu verstehen, nutzen sie ein VLM-basiertes Tool mit langsamerer
00:02:19Verarbeitung, um sicherzustellen, dass die Informationen korrekt gelesen werden. Dies ist
00:02:22als Skill mit einem Klick installierbar. Es ergänzt jede andere tiefgreifende VLM-basierte OCR-Lösung,
00:02:27die Sie verwenden möchten. Wir haben es so konzipiert, dass es so schnell wie möglich ist und sich leicht
00:02:32in Ihren bevorzugten KI-Agenten einbinden lässt.
00:02:35Ich bin jetzt ziemlich schnell durch einiges davon durchgegangen, aber im Grunde haben wir
00:02:42viel Zeit auf die Parsing-Ebene verwendet. Es gibt auch andere allgemeine Komponenten rund um die
00:02:47Semantik- und Speicherebene im Hinblick auf Dokumentenextraktion und -suche sowie natürlich
00:02:51Dokumenten-Workflows. Aus Zeitgründen überspringe ich wohl einige der unerschlossenen
00:02:57Bereiche wie agentennative Dokumentformate, Hill-Climbing-as-a-Service und anderes. Aber ich werde
00:03:01die vollständigen Folien online teilen. Was die Semantik- und Speicherebene betrifft: Neben
00:03:06dem Parsen von Dokumenten erfordern viele Anwendungsfälle auch das Erfassen strukturierter Informationen
00:03:12im großen Maßstab aus Dokumenten. Egal, ob Sie eine Million Rechnungen, Spesenabrechnungen,
00:03:16Belege oder Schadensmeldungen verarbeiten – Sie müssen sicherstellen, dass Sie tatsächlich
00:03:21strukturierte Ausgaben erhalten, die Sie in eine nachgelagerte Datenbank oder ein System einspeisen können. Viele dieser
00:03:26Anwendungsfälle drehen sich im Grunde um die Frage, wie man Arbeitsschritte automatisieren kann,
00:03:31die typischerweise von Menschen beim Scannen von Dokumenten und bei der Dateneingabe erledigt werden. Ob
00:03:36es sich dabei wieder um Rechnungen, Anträge, Verträge, Quittungen oder Sonstiges handelt. Wir haben diese
00:03:41Funktionen ebenfalls in LlamaParse integriert. Viele unserer Funktionen sind darauf ausgelegt,
00:03:47geringe Kosten bei extrem hoher Genauigkeit zu bieten. Zudem erhält man detaillierte Quellennachweise
00:03:52bis zurück zum Quelldokument für jeden extrahierten Wert. Und das lässt sich natürlich
00:03:56in der Pipeline im großen Maßstab mit Konfidenzwerten ausführen. Man kann auch genau kennzeichnen,
00:04:02ob wir uns bei einem bestimmten Wert sicher sind, bevor wir entscheiden, ihn in ein
00:04:06Software-System zu übernehmen. Es gibt auch die Dokumentensuche, im Grunde ein erweitertes Toolset,
00:04:12wie erwähnt rund um Information Retrieval, BM25, Grep, Vektorsuche, Lesen und Scrollen. Alle diese Funktionen
00:04:19sind in einigen unserer kommerziellen Plattformen sowie in Open-Source-Angeboten verfügbar. Ich wollte aber auch
00:04:23ein Bild der allgemeinen Konzepte vermitteln, die es heute gibt. Ich überspringe also den Abschnitt über die Zukunft und gehe direkt zum Ende. Ich weiß, dass ich die Zeit etwas überschritten habe, daher vielen Dank für Ihre Zeit heute. Und lassen Sie mich kurz...
00:04:36...schauen, wie ich schnell zu diesem Teil komme. Ah, richtig. Ich überspringe diesen Teil und stelle ihn online. Unser Stand ist bei LG 47, falls Sie vorbeischauen möchten. Und wir veranstalten heute ein riesiges Pickleball-Turnier. Vielen Dank für Ihre Aufmerksamkeit.
00:05:06Vielen Dank.

Key Takeaway

Ein zweistufiger Hybrid-Ansatz aus dem extrem schnellen Rust-basierten LightParse für das Erstüberfliegen und VLM-Parsern wie LlamaParse für komplexe Elemente ermöglicht die latenz- und kosteneffiziente Verarbeitung von Tausenden Dokumenten in KI-Agenten-Pipelines.

Highlights

  • LightParse ist ein unter MIT- oder Apache-Lizenz stehender Open-Source-Markdown-Parser in Rust, der ohne VLM-Modelle arbeitet.

  • Für die Echtzeit-Verarbeitung von 1.000 Dokumenten in unter einer Minute sind reine VLM- und OCR-Ansätze aufgrund hoher Latenzen ungeeignet.

  • Der zweistufige Hybrid-Ansatz nutzt LightParse für ein schnelles Erstüberfliegen aller Dokumente und schaltet VLM-Parser wie LlamaParse nur bei komplexen Tabellen oder Diagrammen zu.

  • LlamaParse bietet strukturierte Datenextraktion im großen Maßstab für Rechnungen und Anträge mit Quellennachweisen und Konfidenzwerten.

  • Erweiterte Such- und Retrieval-Funktionen umfassen BM25, Grep, Vektorsuche sowie Lese- und Scroll-Tools.

Timeline

Echtzeitanforderungen und Grenzen rein VLM-basierter Dokumentenverarbeitung

  • Skalierbare Offline-Indizierungspiping-Systeme eignen sich für klassische RAG-Wissensbasen mit flexiblen Fehlertoleranzen.
  • VLM-basierte OCR-Dienste weisen hohe Latenzen auf und scheitern an der Verarbeitung von 1.000 Dokumenten pro Minute.
  • Anwendungen mit Echtzeit-Uploads erfordern eine Verarbeitungslösung mit extrem geringer Latenz innerhalb der Agenten-Schleife.

Für typische RAG-Anwendungsfälle im SharePoint reicht eine kosteneffiziente Offline-Indizierung aus, da ein intelligenter KI-Agent fehlerhafte Daten durch tieferes Nachfassen korrigieren kann. Bei direkten Interaktionen wie der Verarbeitung von 1.000 hochgeladenen Dokumenten in Cloud Cowork innerhalb einer Minute stoßen reine VLM-gestützte Ansätze jedoch an ihre Geschwindigkeitsgrenzen. Um eine nahtlose Arbeit in der Agenten-Schleife zu gewährleisten, ist eine primäre Verarbeitungsebene mit minimaler Latenz zwingend erforderlich.

Zweistufige Parsing-Architektur mit LightParse und LlamaParse

  • LightParse ist ein kostenloser, lizenzfreier Open-Source-Markdown-Parser in Rust mit hoher Verarbeitungsgeschwindigkeit.
  • KI-Agenten nutzen LightParse als Standard-Skill für das blitzschnelle Überfliegen großer Dokumentenmengen.
  • VLM-basiertes LlamaParse dient als optionales Zusatzwerkzeug für das genaue Auslesen visueller Elemente wie Tabellen.

LightParse arbeitet ohne komplexe Deep-Learning-Modelle und bietet dadurch maximale Geschwindigkeit bei hoher Genauigkeit für Markdown-Konvertierungen. In der Praxis führt der KI-Agent zuerst einen extrem schnellen Scan über alle eingehenden Dateien mit LightParse durch. Erst wenn der Agent auf spezifische Seiten mit komplexen Tabellen oder Diagrammen stößt, ruft er rechenintensivere VLM-Parser als spezialisiertes Werkzeug auf.

Strukturierte Extraktion, Dokumentensuche und Plattformfunktionen

  • LlamaParse ermöglicht die automatische Extraktion strukturierter Daten aus Rechnungen, Quittungen und Anträgen im Millionenmaßstab.
  • Jeder extrahierte Datenpunkt wird mit Quellennachweisen aus dem Originaldokument und Konfidenzwerten für Folgesysteme versehen.
  • Integrierte Suchwerkzeuge vereinen BM25, Vektorsuche, Grep sowie Lese- und Scrollfunktionen.

Neben dem reine Parsing bietet LlamaParse Funktionen zur Automatisierung manueller Dateneingaben aus Schadensmeldungen, Verträgen und Spesenabrechnungen. Durch die Bereitstellung exakter Zitate und Konfidenzwerte lässt sich steuern, welche Daten ohne menschliche Überprüfung direkt in nachgelagerte Datenbanken übernommen werden. Ergänzt wird die Plattform durch Such- und Retrieval-Funktionalitäten über Open-Source- und kommerzielle Schnittstellen.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video