Von Ingestion zu Agenten: Wie KI-Teams auf Document Intelligence aufbauen — Adit Abraham, Reducto
Transcript
00:00:00Hallo, können mich alle hören? Super. Wir haben hier kurze 20 Minuten, also möchte ich direkt einsteigen und
00:00:20zur Sache kommen. Mein Name ist Deet, ich bin Mitgründer und CEO von Reducto, und heute wollten wir sprechen
00:00:25über einen, wie ich finde, wirklich praktischen, aber vielleicht weniger sexy Aspekt beim Bauen von Agenten, die in der Praxis tatsächlich funktionieren: Daten. Ich bin sicher, Sie haben heute schon viele Vorträge über Daten gesehen. Wir haben uns vor allem darauf konzentriert, Infrastruktur für alle zu bauen, die mit einigen der schwierigsten Datenquellen arbeiten: unstrukturierte Bilder, PDFs, Tabellenkalkulationen – alles, was Menschen täglich nutzen. Hat jemand von Ihnen Reducto schon genutzt oder getestet? Cool.
00:00:55Als hilfreicher Kontext zu Beginn: Wir sind eine agentische Dokumentenverarbeitungsplattform. Wir helfen vielen der führenden AI-Teams weltweit beim Bau von AI-Anwendungen und -Workflows, je nach Ziel.
00:01:08Dazu gehören viele der AI-Natives, die Sie heute wahrscheinlich gesehen haben: die Harveys, Ligors und Rogos dieser Welt, aber auch einige der größten Konzerne weltweit. Und das ist ein wichtiger Kontext für unser Thema.
00:01:19Wir arbeiten mit den größten Tech-Unternehmen, globalen Finanzinstituten und Versicherungen – Akteuren mit Jahrzehnten an historischen Daten, die früher außerhalb von Demos extrem schwer zu nutzen waren.
00:01:34Über all diese Unternehmen hinweg haben wir mittlerweile viele Milliarden Dokumente verarbeitet. Bei dem Pluszeichen am Ende bin ich etwas faul geworden, aber die Zahl ändert sich ständig, also belassen wir es dabei.
00:01:46Das Wichtigste, was wir daraus gelernt haben – und worauf ich mich heute konzentrieren möchte –, ist aber gar nicht das Produkt von Reducto selbst.
00:01:51Es sind die Feinheiten unserer Erkenntnisse, die Sie hoffentlich mitnehmen und in Ihre eigene Arbeit einbringen können.
00:01:58Ich denke, ein Großteil unserer Arbeit und unserer Erkenntnisse fällt in diesen breiteren thematischen Kontext: Der Umfang von AI-Anwendungen hat sich stark verändert.
00:02:07Von reinen Informationssynthese-Produkten hin zu echten Agenten, die Arbeit erledigen.
00:02:13Und dabei haben wir festgestellt, dass es einige Dinge gibt, über die es sich zu sprechen lohnt.
00:02:16Erstens: Die Problemstellung selbst, der Engpass, vor dem man steht, und warum PDFs im Speziellen so schwierig sind – auch wenn Sie auf Twitter vermutlich zwei Dutzend verschiedene PDF-Verarbeitungstools gesehen haben.
00:02:26Wo wir Stärken und Schwächen verschiedener Tools sehen.
00:02:31Wir glauben, dass es für traditionelle CV im Vergleich zu VLMs den richtigen Ort und Zeitpunkt gibt.
00:02:35Und noch interessanter: Die zweite Hälfte dieses Vortrags wird sich auf die nächste Stufe konzentrieren.
00:02:40Was unserer Erfahrung nach möglich wird, wenn man Agenten in der Schleife hat.
00:02:43Dinge, die wir durch den Einsatz von Testumgebungen für verschiedene Aufgabenstellungen herausgefunden haben.
00:02:47Und unsere Erkenntnisse zu Themen wie Evaluierungen beim Übergang von RAG zu echten Agentenprodukten.
00:02:53Aber ich beginne mit dem ersten Punkt – etwas, das vermutlich schon oft betont wurde.
00:02:58Wenn man vor einigen Jahren auf der AI Engineer war, war das Wort, das man in jedem einzelnen Vortrag hörte: RAG.
00:03:04Und jeder baute irgendeine Form von RAG-Anwendung.
00:03:07Eine Zeit lang waren im Grunde alle Anwendungen eine Form von Informationssynthese, richtig?
00:03:12Man holte Informationen aus irgendeinem Kontext – sei es ein perfekter Prompt oder eine vom Nutzer hochgeladene Datei.
00:03:19Und dann hatte man so etwas wie ein Suchprodukt.
00:03:22Man hatte eine Unternehmenssuche.
00:03:23Man hatte einen Chatbot, der einfache Fragen und Antworten auf Basis der Inhalte lieferte.
00:03:27Und das war's.
00:03:28Aber heute lautet das Modewort, das Sie wahrscheinlich schon eine Million Mal gehört haben: Agenten.
00:03:34Und die Entwickler unter Ihnen haben wahrscheinlich schon Claude Code oder ein ähnliches Tool genutzt, um viele End-to-End-Aufgaben zu erledigen.
00:03:41Und genau dieser Wandel vollzieht sich nun in allen Bereichen der Büroarbeit.
00:03:46Ob im Finanzwesen, in Versicherungen oder im Gesundheitswesen – Menschen beginnen, autonome Entscheidungen zu treffen.
00:03:51Sie versuchen, komplette Arbeitsergebnisse zu erstellen – nicht nur Fragen aus einer PDF zu beantworten, sondern PDFs auch zu generieren und zu verändern.
00:03:58Und das ist eine völlig andere Perspektive.
00:04:00Die benötigten Werkzeuge und die auftretenden Probleme ändern sich stark im Vergleich zum reinen Aufbau einer Information-Retrieval-Plattform.
00:04:06Und der gemeinsame Kern bei all dem ist: Es wird zu einem noch wichtigeren Problem, das gelöst werden muss, sobald man diese mehrstufigen Pipelines einsetzt.
00:04:18Wenn man nur Fragen und Antworten verarbeitet, gibt es natürlich ein Risiko, das rein mit der Antwort zusammenhängt.
00:04:24Aber wenn Agenten mehrere Entscheidungen treffen, die sich über eine Reihe von Dateien hinweg aufsummieren, und sie mehrere Datenquellen heranziehen, wird das Risiko fehlerhafter Eingaben in der Pipeline extrem hoch.
00:04:36Und genau darauf konzentrieren wir uns.
00:04:38Denn am Ende des Tages kommt ein Großteil des Werts von Sprachmodell-Tools in der Realität nur in dem Kontext zum Tragen, in dem man diese Intelligenz anwendet.
00:04:48In vielen Unternehmen sind Daten unstrukturiert, verstreut und multimodal.
00:04:53Es gibt nicht diesen sauber organisierten Datenbestand.
00:04:56Man hat verschiedene Teams und Abteilungen, die Dinge in Google Drive, Box und sonst wo ablegen.
00:05:04Man hat Datenformate, die von Haus aus unstrukturiert sind.
00:05:07Man weiß nicht unbedingt, was sich im gesamten Informationsbestand befindet.
00:05:11Und daraus entstehen allerlei nachgelagerte Probleme.
00:05:14Manche Probleme betreffen die Genauigkeit von Parsing und Extraktion – was definitiv wichtig ist.
00:05:18Es geht aber auch um Fragen wie: Rufen Sie den richtigen Kontext ab?
00:05:22Es geht darum, wie Sie tatsächlich mit diesem Kontext interagieren und Änderungen daran vornehmen.
00:05:27Und worauf Reducto und andere in diesem Bereich immer wieder hinweisen: PDFs sind überraschenderweise immer noch ein sehr schweres Problem.
00:05:36Ich weiß nicht, ob jemand von Ihnen Surge verfolgt – ein Datenlabor, das mit vielen Foundation-Model-Unternehmen zusammenarbeitet.
00:05:42Sie haben diesen wirklich tollen Benchmark namens GDP PDF, bei dem selbst Spitzenmodelle aktueller Bauart nur bei etwa 30 % liegen.
00:05:52Und das basiert auf der Frage: Können Modelle Inhalte in Dokumenten wie PDFs durchgehen und darauf basierend echte Entscheidungen treffen?
00:06:01Der Grund, warum sie so schwer sind – ich komme gleich auf diesen Benchmark zurück – liegt darin, dass das PDF-Dateiformat sehr alt ist und für einen ganz anderen Zweck entwickelt wurde.
00:06:11Ich habe tatsächlich Leute getroffen, die sich schon länger mit PDF-Verarbeitung beschäftigen, als ich auf der Welt bin.
00:06:16Ich habe Entwickler getroffen, die in den frühen 1990ern an Druckertreibern gearbeitet haben, um PDFs zu drucken.
00:06:21Und genau das war das Ziel.
00:06:22Man wollte das, was auf den ursprünglichen Dokumenten war, getreu darstellen und am Ende druckbar machen.
00:06:30Viele der heutigen Überlegungen drehen sich gar nicht darum.
00:06:33Letztlich wollen wir eine Markdown-Darstellung – etwas, worüber Agenten effektiv logisch nachdenken können.
00:06:39Und in der realen Welt kodieren Menschen so viel Kontext rein visuell.
00:06:44Der durchschnittliche Finanzanalyst, der frisch von der Uni im Investmentbanking anfängt, überlegt nicht, ob ein Agent diese Folien lesen kann.
00:06:54Er erstellt diese extrem kreativen Folien.
00:06:57Sie haben sicher schon die Softbank-Folien mit der Gans gesehen, die Eier legt.
00:07:01Diese Details zählen.
00:07:02Richtig?
00:07:03Viele Daten, über die Sie nachdenken müssen, sind tabellarische Strukturen, die vielleicht keine klaren Gitterlinien haben und verbundene Zellen trennen.
00:07:10Sie haben Dinge wie Liniendiagramme und Grafiken.
00:07:12Sie haben unleserliche Handschriften, die selbst ich als Mensch oft kaum entziffern könnte.
00:07:17Und genau diese Art von Problem müssen Sie lösen, wenn Sie sich mit diesem Long Tail befassen.
00:07:22Wir haben das Unternehmen 2023 gegründet, weil wir das Gefühl hatten, dass hier ein technologischer Quantensprung möglich war.
00:07:29Wenn man früher über ein PDF-Verarbeitungsproblem nachdachte, war das meist eine abgewandelte Form einer NLP-Pipeline.
00:07:37Man machte einen einfachen OCR-Durchlauf und versuchte dann, diesen Text nachzubearbeiten.
00:07:41Das funktionierte, solange man sehr konsistente Layouts hatte.
00:07:44Richtig?
00:07:45Wenn man wusste, dass ein W2-Formular immer wie ein W2 aussieht, ist das ein abgegrenzter Problemraum, für den man Vorlagen erstellen kann.
00:07:51Aber VLMs sind interessant, weil sie von Grund auf horizontal aufgebaut sind.
00:07:56Zum ersten Mal hat man den Ansatz: Lies das Dokument so, wie es ein Mensch tun würde.
00:08:01Man kann den Ansatz verfolgen, den Long Tail abzudecken.
00:08:04Wir haben festgestellt, dass sie für Dinge wie handschriftlichen Text unglaublich gut sind – auf eine Weise, wie es traditionelle OCR nie war.
00:08:12Die Kehrseite ist jedoch, dass wir sie nicht für eine Universallösung halten.
00:08:16Wenn man dieses Problem in großem Maßstab löst, als Unternehmen mit hunderten Millionen Dokumenten,
00:08:21gibt es allerlei sekundäre Überlegungen wie Determinismus.
00:08:25Die Effizienz der Verarbeitung ist extrem wichtig.
00:08:27Deshalb sehen wir, dass traditionelle CV bei manchen Dingen immer noch sehr, sehr stark ist.
00:08:33Das wurde stark unterschätzt, während die Forschung zu autonomen Fahrzeugen Fortschritte gemacht hat.
00:08:37Techniken wie Objekterkennung sind heute viel ausgefeilter als noch vor zehn Jahren.
00:08:42Wir stellen fest, dass Modelle mit unter 100 Millionen Parametern extrem effektiv sind, um etwa das Layout eines Dokuments zu erkennen.
00:08:48Man kommt sehr, sehr weit, ohne überhaupt ein großes Foundation-Modell zu benötigen.
00:08:52Und das sind Modelle, die tatsächlich auf der CPU laufen können.
00:08:54Man kann sie im großen Maßstab ausführen.
00:08:55Man kann auf Regionsebene genau verstehen, welche Stellen bei der Verarbeitung schwierig sind.
00:09:00Und VLMs bringen dieses Konzept der Semantik ein.
00:09:03Man kann die Fehler, die in der Pipeline wahrscheinlich entstehen, gezielt identifizieren und korrigieren.
00:09:09Ausgehend von dieser Idee der Semantik: Wenn man das Problem zerlegt und genau weiß, wo die nuancierten Stellen liegen,
00:09:18wenn man den Text auf der Seite segmentiert hat und weiß, wo sich Handschrift befindet,
00:09:21kann man das Konzept eines Agenten in der Schleife einführen.
00:09:25Während früher ein menschliches Prüfteam Fehler manuell annotiert und korrigiert hätte,
00:09:29können VLMs nun dieses Konzept von sogenannter agentischer OCR bieten.
00:09:33Für uns sieht das im Grunde so aus: Wer schon mal ein Tool wie Cursor genutzt hat, das schnelle Anpassungen in der IDE vornimmt,
00:09:41kennt das Prinzip des Speculative Decoding, bei dem Änderungen auf Token-Ebene an der Ausgabe vorgenommen werden.
00:09:45Ein ähnliches Prinzip lässt sich hier anwenden, statt einfach nur OCR an Gemini zu schicken,
00:09:51einen schönen Prompt zu schreiben und nett darum zu bitten, nicht zu stark vom Original abzuweichen.
00:09:56Denn wir stellen fest: Wenn man diese Art von Next-Token-Prediction nutzt,
00:09:58entstehen völlig neue Fehlerfälle, bei denen sehr intelligente Modelle
00:10:02plötzlich Korrekturen vornehmen, die nicht mehr dem tatsächlichen Dokument entsprechen.
00:10:05Sie sehen das Wort “Gesamtsumme”, und falls einem Menschen in der Tabelle ein Fehler unterlaufen ist,
00:10:08rechnen die Modelle die Werte in der Tabelle manchmal selbstständig zusammen.
00:10:13Was man eigentlich möchte, ist, die gewünschten Anpassungen auf Token-Ebene zu korrigieren.
00:10:16Vielleicht verwechselt man einen Punkt mit einem Komma oder eine Null mit einem O –
00:10:19solche Details sind extrem wichtig.
00:10:21Und das ist die Frage: Wie stellen wir genau das dar, was ein Mensch gesehen hätte,
00:10:25wenn er dieses Dokument gelesen hätte?
00:10:27Wir betrachten agentische OCR also analog zum Human-in-the-Loop-Prinzip:
00:10:34Die ersten Eingaben durchlaufen einen CV- plus VLM-Parsing-Schritt,
00:10:39aber dann schließt sich eine Verifizierungs- und Korrekturschicht an, die zu einem hochgradig verlässlichen Ergebnis führt.
00:10:44Ich habe aber bereits erwähnt, dass das Spektrum der Probleme für uns nicht nur aus Parsing und Extraktion besteht.
00:10:50Vieles davon bedeutet, dass man die Details der eigenen Pipeline gründlich durchdenken muss,
00:10:56selbst wenn man eine hervorragende Dokument-zu-Markdown-Pipeline besitzt.
00:10:59Ein gutes Beispiel dafür: Wer schon einmal eine RAG-Plattform gebaut hat,
00:11:04hat sich vermutlich Gedanken über Dinge wie Tabellen gemacht.
00:11:07Es gibt viele Dinge, die sich in Formaten wie Markdown gut kodieren lassen.
00:11:13Aber bei einer Tabelle wie dieser, in der verbundene Zellen viel Bedeutung tragen,
00:11:18ist es entscheidend, diese Struktur zu bewahren.
00:11:20Und das liegt nicht an den Grenzen des Modells.
00:11:22LLMs können die HTML-Struktur derselben Tabelle unglaublich gut analysieren,
00:11:26aber man verschwendet dabei viele Tokens, und das wird schnell teuer.
00:11:29Am anderen Ende des Spektrums
00:11:31möchte man einfache Tabellen wahrscheinlich nicht in HTML kodieren,
00:11:35weil man dann viele überflüssige HTML-Tags hat.
00:11:38Wir haben das Ganze deshalb als dynamische Aufgabe betrachtet:
00:11:42Bei einer einfachen Tabelle können wir die Daten gut in Markdown abbilden.
00:11:47Bei einer komplexeren Tabelle ist HTML eventuell die bessere Wahl.
00:11:50Aber Sprachmodelle sollten nicht der einzige Faktor in der Pipeline sein.
00:11:55Wenn Sie mit Embeddings arbeiten,
00:11:57stehen Sie vor dem Folgeproblem des Informationsabrufs (Retrieval).
00:12:01Dieselbe Tabelle von vorhin
00:12:03sieht in der HTML-Darstellung extrem unübersichtlich aus.
00:12:08Der Großteil dieses Ausschnitts besteht nur aus HTML-Tags,
00:12:11die lediglich die Dokumentenstruktur beschreiben.
00:12:14Das Problem ist: Während in manchen Pauschal-Evaluierungen
00:12:17Inhalte vorkommen, die dem Modell die Arbeit abzunehmen versuchen,
00:12:22indem sie genau angeben, wonach gesucht wird,
00:12:24zählt ein Mensch in der Realität nicht die Werte einer Tabelle auf.
00:12:28Er fragt einfach: "Wie hat sich der Umsatz verändert?"
00:12:30Und setzt voraus, dass bei Relevanz die richtige Tabelle abgerufen wird.
00:12:34Sprachmodelle können solche Texte zwar gut verarbeiten,
00:12:37aber beim Durchsuchen großer Datenmengen
00:12:39tun sich Embedding-Modelle schwer, diesen natürlichen Prompt
00:12:44mit dem Wirrwarr aus HTML-Tags und Zahlen zu verknüpfen.
00:12:47Ein hocheffektiver Schritt mit sehr wenig Aufwand
00:12:51ist daher eine Darstellung, die speziell für das Embedding-Modell optimiert ist.
00:12:55Für dieselbe Tabelle
00:12:56erstellt man eine fließtextbasierte Beschreibung,
00:12:58um das Beste aus beiden Welten zu vereinen.
00:13:00Für die logische Analyse im Modell
00:13:02nutzt man die HTML-Tabellenform,
00:13:04und für das präzise Auffinden der richtigen Abschnitte
00:13:07greift man auf den Fließtext-Block zurück.
00:13:12Darüber hinaus gibt es viele Aufgaben abseits von purem Parsen und Extrahieren.
00:13:18="Die Branche hat sich lange auf das Parsen und Extrahieren konzentriert,"
00:13:22weil dort das Potenzial für Verbesserungen enorm ist.
00:13:25Ich habe vorhin den GDP-PDF-Benchmark erwähnt,
00:13:30der sehr anschaulich zeigt, welche Fortschritte
00:13:34durch eine optimierte Daten-Pipeline möglich sind.
00:13:37Verwendet man denselben Benchmark,
00:13:40den wir bei Fable leider nicht testen konnten,
00:13:43da unser Zugang gesperrt wurde,
00:13:46und übergibt anderen Modellen neben der Original-PDF
00:13:50auch eine strukturierte Fassung der PDF –
00:13:52wie die geparsten Ergebnisse hier –, zeigt sich modellübergreifend,
00:13:55egal ob bei Gemini, Anthropic oder OpenAI,
00:13:58dass bessere Eingaben direkt die Leistung des LLMs steigern.
00:14:04Das geht so weit, dass Modelle wie GPT-4.5 und Opus
00:14:09ein System wie Fable direkt übertreffen.
00:14:12Nicht nur bei der Genauigkeit: Durch die besseren Eingaben
00:14:17benötigen die Modelle auch weniger Reasoning-Tokens.
00:14:20Sie verbringen weniger Zeit mit der Datenstrukturierung und fokussieren sich auf das Ergebnis.
00:14:24Dadurch sinkt die Latenz,
00:14:27und sie gelangen schneller zur korrekten Antwort.
00:14:30Doch selbst wenn eine solche Pipeline steht
00:14:33und alles in der Parsing-Schicht
00:14:37überprüft wurde, erfordert die menschliche Arbeit weiterhin,
00:14:41die Bandbreite der Dokumente im Bestand zu verstehen,
00:14:44sie der richtigen Pipeline zuzuweisen, das Problem zu zerlegen
00:14:48oder am Ende die Dokumente zu bearbeiten.
00:14:51Wir haben daher versucht, das Kernproblem so anzugehen:
00:14:54Wie stellt man sicher, dass jede Interaktion des Sprachmodells
00:14:57mit dem Dokument so effektiv ist, als würde ein Mensch es bearbeiten?
00:15:00Beim Ausfüllen eines Formulars: Wie garantiert man Präzision
00:15:03an den einzelnen Feldern?
00:15:05Ein hervorragendes Beispiel auf der Orchestrierungsebene
00:15:08ist die Klassifizierung und Aufteilung – eine oft unterschätzte Methode,
00:15:12um die maximale Leistung aus einem LLM herauszuholen.
00:15:14Natürlich kann man einfach beliebig viel Kontext übergeben.
00:15:17Für einen einfachen Nadel-im-Heuhaufen-Test
00:15:19mag das ausreichen.
00:15:20In der Praxis leidet die Qualität jedoch spürbar,
00:15:24ganz abgesehen von den Token-Kosten, wenn man zu viel hineingibt.
00:15:28Stattdessen lässt sich ein enormer Leistungsgewinn erzielen,
00:15:33wenn man gezielt festlegt, wie die richtigen Dokumente
00:15:36der passenden Pipeline zugewiesen werden.
00:15:38Selbst bei langen Dokumenten muss sichergestellt sein,
00:15:41dass nur wirklich relevante Abschnitte übergeben werden.
00:15:43Wir sehen Anwendungsfälle mit physischer Post,
00:15:47bei denen Briefpakete Hunderte von Seiten umfassen können.
00:15:50Man weiß vorher nicht genau, was darin enthalten ist.
00:15:53Manchmal wurden Inhalte manuell durcheinandergewürfelt.
00:15:57Überlässt man diese Sortierung dem Modell, lenkt es das
00:16:01nur von der eigentlichen Zielaufgabe ab –
00:16:03sei es das Extrahieren von Daten aus der Post,
00:16:05deren Analyse oder das Treffen einer Entscheidung.
00:16:10Wie schon erwähnt, halte ich den zweiten Teil
00:16:13für den noch spannenderen Aspekt:
00:16:16Wenn die erste Ebene der Klassifizierung und Aufteilung steht
00:16:20und die Sortierung gelöst ist.
00:16:22Was uns als Team besonders begeistert,
00:16:26sind Agenten-Frameworks als extrem spannendes neues Feld,
00:16:29um bisher ungelöste, komplexe Probleme zu bewältigen.
00:16:34Ein gutes Beispiel, auf das ich gleich eingehe,
00:16:37sind Liniendiagramme.
00:16:39Wir arbeiten mit einigen der größten Hedgefonds der Welt zusammen,
00:16:41und Liniendiagramme waren historisch gesehen
00:16:43extrem schwierig, erstens, weil sie als Bild vorliegen.
00:16:46Zweitens gibt es eine hohe Detailtiefe auf Pixelebene,
00:16:49die bei einem traditionellen Vision-Encoder
00:16:52meist verloren geht.
00:16:53Man erhält zwar den groben Verlauf der Umsatzentwicklung,
00:16:55aber keine exakten einzelnen Datenpunkte.
00:16:57Wir haben uns daher gefragt, wie wir Agenten
00:17:00die passenden Werkzeuge an die Hand geben können,
00:17:04um genau dieses spezifische Problem zu lösen.
00:17:05Beim Auslesen von Diagrammen enthält die Grafik links
00:17:09eine riesige Datentabelle.
00:17:11Versuchte man, jeden einzelnen Pixel manuell zu erfassen,
00:17:14wäre das extrem aufwendig.
00:17:16Für ein Modell wiederum ist es schwer, den Verlauf
00:17:19der Verbindungslinien dazwischen auch nur annähernd zu schätzen.
00:17:22Kein Modell kann das direkt auf Anhieb
00:17:24in einem einzigen Durchgang lösen.
00:17:25Was Sie rechts sehen, ist die Rekonstruktion
00:17:28einer Markdown-Tabelle, die wir aus dem ursprünglichen
00:17:30aus dem ursprünglichen Liniendiagramm.
00:17:32Und der einzige Weg, wie wir das geschafft haben,
00:17:34war ein Agent mit allen möglichen Werkzeugen.
00:17:36Er hat einen eigenen Code-Interpreter.
00:17:37Er kann das von ihm erstellte Diagramm visualisieren.
00:17:40Und er geht schrittweise vor.
00:17:41Er findet immer wieder Fehler im Liniendiagramm,
00:17:45bis er das Endergebnis erreicht.
00:17:47Das gilt auch für Probleme wie die strukturierte Extraktion,
00:17:51wo wir schon seit Weile diese Funktion
00:17:53vom Dokument zur strukturierten Ausgabe haben.
00:17:55Aber man kann noch einen Schritt weitergehen,
00:17:57indem man eine Agenten-Umgebung für genau diese Aufgabe nutzt.
00:18:00Ein übergeordneter Agent kann Validierungskriterien festlegen,
00:18:03denen die Unter-Agenten folgen.
00:18:05Wenn Sie also ein Formular wie ein CBP-Formular haben,
00:18:09das Zehntausende von Feldern hat,
00:18:11ist das genau die Art von Problem, bei der man
00:18:13viele unbemerkte Fehler findet.
00:18:15Zum Beispiel, dass Inhalte oder Zeilen verloren gehen.
00:18:17MicroOne hat heute Morgen einen sehr guten Benchmark
00:18:20in diesem Bereich veröffentlicht, der eine Aufspaltung
00:18:23des Marktes zeigt.
00:18:24Spitzenmodelle mit maximaler Logik sind extrem präzise.
00:18:28Wenn sie eine Zeile extrahiert haben,
00:18:30ist sie höchstwahrscheinlich nicht halluziniert.
00:18:31Sie haben es also wirklich korrekt erfasst.
00:18:33Aber sie lassen unbemerkt viele Inhalte im Benchmark aus.
00:18:37Die Vollständigkeit leidet hier sehr.
00:18:39Auf der anderen Seite hinken viele spezialisierte Dokumentenverarbeitungsdienste
00:18:42den Spitzenmodellen bei der Präzision hinterher,
00:18:46schließen aber die Lücke bei der Trefferquote.
00:18:48Es gab also schon immer diese Art von Zielkonflikt.
00:18:51Und nur mit einer Agenten-Umgebung konnten wir
00:18:54das lokale Maximum aus Präzision und Vollständigkeit
00:18:57für diese Art von Aufgabe finden.
00:19:00Der letzte und vielleicht wichtigste Punkt dieses Vortrags ist,
00:19:04dass Evaluationen am Ende des Tages allen Entscheidungen
00:19:09zugrunde liegen sollten.
00:19:10Das war ein zentraler Teil unserer Produktphilosophie.
00:19:12Das gilt sowohl für fertige Datensätze, die man evaluiert,
00:19:16als auch für Dinge wie Echtzeit-Überwachung im Betrieb.
00:19:19Denn Ihre Produktionsdaten werden sich unterscheiden
00:19:21von allem, was Sie in Ihren Testsets haben.
00:19:25Und ich denke, es ist wirklich wichtig, Evaluationen
00:19:28nicht nur als reine Gesamtschau zu betrachten,
00:19:30sondern die besten Teams, mit denen wir arbeiten,
00:19:33prüfen sie im Detail für jeden Schritt ihrer Pipeline.
00:19:36Der erste Punkt ist sicherzustellen,
00:19:38dass die Eingaben für Ihre Pipeline hervorragend sind.
00:19:40Natürlich sollten Sie Dinge wie Ihre Parsing-Pipeline evaluieren.
00:19:43Aber selbst perfektes Parsing bringt bei einer schlechten Retrieval-Pipeline
00:19:47nichts, wenn Sie nicht den richtigen Kontext übergeben.
00:19:50Deshalb ist es wichtig, dass Sie Details wie
00:19:52Ihre Retrieval-Pipeline durchdenken,
00:19:54Ihre Formatierung am Ende der Pipeline,
00:19:56und letztendlich das Wichtigste:
00:19:58Können Sie die Leistung des End-Agenten verbessern?
00:20:03Ich schließe mit einem Ausblick darauf, wohin wir uns bewegen
00:20:06und wohin sich die Branche entwickelt.
00:20:08Das Wichtigste ist: Wenn Agenten immer besser werden,
00:20:12kann man von den deterministischen Pipelines abweichen,
00:20:15die man vor ein paar Jahren noch genutzt hätte.
00:20:17Viele unserer Kunden erstellen im Grunde ein Dateisystem,
00:20:20durch das der Agent navigieren kann,
00:20:22und lassen den Agenten entscheiden, welche Tools er nutzen möchte.
00:20:25Wir erstellen also ein CLI, wo man keine Ende-zu-Ende-Pipeline baut,
00:20:28bei der Dokumente immer demselben festen Ablauf folgen,
00:20:32sondern der Agent entscheidet, ob er ein bestimmtes Dokument lesen muss,
00:20:35und man teilt das in zwei Teile auf.
00:20:38Eines ist ein Inhaltsfeld, das der Agent nach Bedarf lesen kann,
00:20:41das andere sind alle Metadaten, die man benötigt.
00:20:44Wenn Sie Quellenangaben machen, möchten Sie vielleicht Bounding Boxes
00:20:47und so weiter.
00:20:50Den Teil überspringe ich beim Bearbeiten.
00:20:52Ich denke, hier wird sehr interessante Arbeit geleistet.
00:20:54Einiges haben wir bereits veröffentlicht, aber in den nächsten Monaten
00:20:57werden Sie sehen, wie wir uns immer mehr der Dokumentengenerierung zuwenden.
00:21:01Als Zusammenfassung für heute – und ich schätze Ihre Zeit sehr –
00:21:04erstens: Ich empfehle dringend, das Parsing-Problem zu zerlegen.
00:21:08Soweit möglich, sollten Sie das richtige Tool für die richtige Aufgabe wählen,
00:21:11um das Optimum aus Genauigkeit, Kosten und Latenz zu erreichen.
00:21:16Zweitens: Agentenbasierte Verifizierung ist der größte Fortschritt in der Branche seit Langem,
00:21:21und eine tolle Chance, um sicherzustellen, dass Ihre Pipelines in der Praxis funktionieren.
00:21:26Drittens: Es erfordert wenig Aufwand, bietet aber viel Potenzial durch Details
00:21:31wie das Formatieren der Daten für den Konsumenten.
00:21:34Viertens: Es ist extrem wichtig, nicht nur an die Datenverarbeitung zu denken,
00:21:39sondern an die Datenorchestrierung.
00:21:41Sie sollten daher Werkzeuge zum Klassifizieren und Aufteilen nutzen,
00:21:44um Ihre Pipeline zu erweitern.
00:21:46Fünftens: Stellen Sie sicher, dass Sie auf jeder Stufe evaluieren.
00:21:49Und sechstens: Überlegen Sie, wie der nächste Schritt für Sie aussieht,
00:21:52denn die meisten erfolgreichen Unternehmen weichen heute stark davon ab,
00:21:56was wir vor zwei oder drei Jahren gemacht haben.
00:21:59Wenn Sie Fragen haben, können Sie sich jederzeit gerne melden.
00:22:03Meine E-Mail ist einfach vorname@reducto.ai.
00:22:06Sie können uns auch über unsere Website erreichen, wenn wir Ihnen helfen können.
00:22:10Vielen Dank.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video