Die unvernünftige Wirksamkeit von BM25 für agentische Suche — Jo Kristian Bergum, Hornet.dev
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00Schön, hier zu sein. Ich bin Joe Burgum, CEO von Hornet Dev, und ich spreche heute über
00:00:19die erstaunliche Effektivität von BM25 für agentische Suche. Wer von Ihnen hat schon von
00:00:24BM25 gehört? Ist das neu für Sie oder...? Oh, einige, das ist super. Ich verfolge auch die WM.
00:00:32Norwegen spielt in der zweiten Halbzeit gegen die Elfenbeinküste. Norwegen führt, also sehr gut.
00:00:37Ja. Bei Hornet entwickeln wir Retrieval-Infrastruktur für Agenten, und ich beschäftige mich schon
00:00:46sehr lange mit Such- und Information-Retrieval-Problemen. Wie Sie an meinen grauen Haaren sehen, bin ich
00:00:52seit über 20 Jahren in diesem Bereich tätig. Heute spreche ich darüber, warum diese rund
00:00:5930 Jahre alte lexikalische Bewertungsfunktion ein starkes Comeback feiert. Zuerst erkläre ich kurz,
00:01:08was ich unter agentischer Suche bzw. agentischem Retrieval verstehe, und definiere das für Sie.
00:01:14Meine Definition ist, dass agentische Suche im Grunde die Suche innerhalb einer Agentenschleife ist.
00:01:22Ein Agent versucht, eine Aufgabe zu lösen, etwa Code zu schreiben, tiefgehende Recherchen anzustellen
00:01:28oder was auch immer. Dabei hat der Agent einen gewissen Informationsbedarf,
00:01:34um diese Aufgabe erfolgreich zu erledigen. Man braucht im Wesentlichen drei Dinge,
00:01:41um ein gutes agentisches Suchsystem zu bauen: ein leistungsfähiges Modell, das
00:01:47Werkzeuge nutzen und Suchanfragen formulieren kann. Außerdem braucht man eine Umgebung um das Modell,
00:01:55die steuert, wie Retrieval- und Suchfunktionen bereitgestellt werden. Es gibt dafür verschiedene
00:02:01Ansätze, etwa über Tool Calling oder einen Code-Modus. Ido hat vorhin gezeigt,
00:02:08was ich als Code-Modus zur Einbindung von Retrieval-Infrastruktur bezeichne. Das ist die Umgebung.
00:02:14Und man braucht eine Retrieval-Engine, um Suchen effizient durchzuführen, möglicherweise über
00:02:23Milliarden von Dokumenten hinweg. Zur Definition von BM25: BM25 steht für “Best Match 25”.
00:02:33Forscher haben damals zahlreiche Experimente durchgeführt, und Experiment Nummer 25
00:02:38erwies sich als das beste. Das ist der Hintergrund des Namens. Es ist im Grunde eine Bewertungsfunktion.
00:02:44Man hat eine Suchanfrage und ein Dokument und berechnet einen Wert
00:02:50aus der Interaktion zwischen den Begriffen der Anfrage und des Dokuments. Man erhält einen Score
00:02:55und hofft, dass dieser Wert ein guter Indikator für die Relevanz des Dokuments
00:03:01bezüglich der Anfrage ist. Um BM25 zu berechnen, könnte man alle Dokumente einzeln bewerten
00:03:08und dann die besten K Dokumente ermitteln. Seit 30 oder 40 Jahren
00:03:14beschäftigt man sich damit, diese Art von Top-K-Retrieval durch Algorithmen zu beschleunigen. Wir investieren auch viel darin.
00:03:22Ich zeige dazu noch etwas, aber BM25 ist die Funktion, und es gibt Wege, Top-K-Retrieval zu beschleunigen.
00:03:30BM25 hat sich nicht verändert. Es ist dieselbe Funktion, aber die Veränderung liegt im wesentlich mächtigeren Nutzer.
00:03:38Edo sprach über Allgemeinwissen. Heutige LLMs besitzen enormes Allgemeinwissen. Sie kennen Entitäten, Unternehmen, Daten und vieles mehr.
00:03:50Durch die Nutzung dieses impliziten Wissens im parametrischen Modell werden sie extrem gut im Suchen.
00:04:01Das ist der eigentliche Wandel, der BM25 wieder relevanter macht.
00:04:09BM25 diente früher meist als Baseline-Funktion. In der IR-Forschung nutzte man stets BM25 als Vergleichswert,
00:04:17um daraufhin komplexe, fortschrittliche neuronale Modelle damit zu vergleichen.
00:04:24Interessant ist auch, wie wir Suchen früher evaluiert haben: Man betrachtete 10 blaue Links, überflog sie und berechnete Metriken.
00:04:34Vieles davon fällt nun weg, da der Agent enorm leistungsfähig ist und viel mehr Anfragen formulieren kann als ein Mensch.
00:04:45Systeme nur anhand einer einzelnen Suchanfrage zu bewerten, verliert daher an Bedeutung.
00:04:53Dies ist einer meiner Lieblings-Benchmarks. Ich spreche gerne über Benchmarks.
00:04:59BrowseComp Plus ist ein Benchmark für Deep Research aus einem Papier vom letzten Jahr mit genau 830 Fragen.
00:05:13Das sind Rätselaufgaben. Vergleichbar mit einem Pub-Quiz. Gibt es Pub-Quizzes in den USA?
00:05:19Ja, super. Es sind also eher rätselartige, recht lange Fragen.
00:05:23Das Protokoll dieses Benchmarks sieht vor, dass man ein Modell hat,
00:05:31das ein einfaches Suchwerkzeug erhält. Es nimmt einen Suchstring entgegen und liefert Textausschnitte an das Modell zurück.
00:05:40Der Korpus umfasst etwa 100.000 bis 105.000 Webdokumente, ist also eher klein.
00:05:47Für die Gesamtgenauigkeit gibt es zu jeder Frage eine Referenzantwort, um zu prüfen, ob die Schleife exakt diese Antwort liefert.
00:06:02Aber warum brauchen wir Retrieval? Ich vergleiche Kontextfenster gerne mit Diskettenspeichern, da ich aus den 80ern stamme.
00:06:11Damals haben wir Spiele noch von Disketten auf unseren Computern installiert.
00:06:15Sie sind alle noch so jung und kennen diese Nostalgie wohl kaum, aber auf eine Diskette passten etwa 1,4 Megabyte Daten.
00:06:26Bei aktuellen Modellen liegt die Grenze, ab der die Qualität nachlässt, meiner Meinung nach bei etwa 350.000 Token.
00:06:34Das entspricht genau einer Diskette voll Daten.
00:06:38Man braucht also Retrieval, um genau die Informationen zu holen, die in das Kontextfenster passen müssen.
00:06:47BrowseComp Plus zeigt deutlich, wie stark die Retrieval-Qualität die Gesamtgenauigkeit der Aufgabe beeinflusst.
00:06:57Die Gesamtgenauigkeit bedeutet hier: Kann das Modell mit dem Suchwerkzeug die Frage beantworten?
00:07:05Diese rätselartige Frage.
00:07:07Wenn man die zur Beantwortung nötigen Belegdokumente direkt künstlich
00:07:16in das Kontextfenster des Modells einfügt, ist die Genauigkeit sehr hoch.
00:07:21Logisches Schlussfolgern ist also nicht der Engpass.
00:07:23Liegen die Belege vorab vor, beantwortet das Modell die Frage mit hoher Genauigkeit, selbst GPT-4.
00:07:33Statte man das Modell jedoch über die Systemumgebung mit einem Retrieval-Tool aus, sinkt die Genauigkeit,
00:07:39da sie nun von der Umgebung, der Fähigkeit des Modells zur Suchformulierung
00:07:44und der Retrieval-Qualität des Suchsystems abhängt.
00:07:49Das ist ein wichtiger Punkt: Selbst bei perfekten Modellen auf AGI-Niveau,
00:07:57die keinerlei Fehler machen,
00:08:00ist man weiterhin auf ein Kontextfenster von der Größe einer Diskette beschränkt.
00:08:04Man muss also entscheiden, was in dieses Fenster gelangt.
00:08:07Retrieval bleibt daher extrem relevant, wie die vorherige Folie gezeigt hat.
00:08:13Im BrowseComp-Plus-Datensatz wird aus jeder dieser Rätselfragen ein eigener Suchverlauf.
00:08:20Das Modell führt die Anfrage aus, liest die Antwort, formuliert die Anfrage um
00:08:27und fährt fort, bis das Kontextfenster voll ist oder die Antwort gefunden wurde.
00:08:36Wir haben diese Suchverläufe genauer untersucht,
00:08:44um zu sehen, wie GPT-5 Suchanfragen formuliert.
00:08:49Dabei haben wir viele interessante Aspekte entdeckt,
00:08:52die wir auch in einem aktuellen Blogbeitrag beschrieben haben.
00:08:55Sie finden ihn auf hornet.dev.
00:08:57Wir vergleichen das gerne mit den alten AOL-Suchprotokollen.
00:09:02AOL war früher ein Dienst mit einer eigenen Suchoberfläche.
00:09:08Dort wurde versehentlich eine große Stichprobe realer Websuchanfragen veröffentlicht.
00:09:17Diese waren sehr kurz.
00:09:19Ich habe mir auch neuere Suchprotokolle angesehen:
00:09:22Menschliche Nutzer suchen nach wie vor meist nur mit wenigen Begriffen.
00:09:27GPT-5 hingegen ist ein viel mächtigerer Nutzer.
00:09:31Es verfügt über Allgemeinwissen
00:09:32und kann im Handumdrehen sehr lange Anfragen formulieren.
00:09:35Es nutzt zahlreiche Syntaxoperatoren, die aus...
00:09:40aus der Websuche gelernt wurden, wie site-Operatoren, Phrasen etc.
00:09:45Das ist eine völlig neue Art von Arbeitslast.
00:09:52Zu BM25: BM25 hat im Wesentlichen zwei Hyperparameter,
00:09:57die verschiedene Aspekte der Bewertungsfunktion steuern.
00:10:01Ich erwähnte bereits die Notwendigkeit einer Baseline.
00:10:04Dazu wurde meist BM25 genutzt.
00:10:06Auch BrowseComp Plus enthält eine Baseline mit BM25.
00:10:10Es stellte sich jedoch heraus, dass diese Baseline schrecklich ist.
00:10:14Betrachtet man komplexere Methoden wie Embedding-Modelle,
00:10:20erscheinen diese im ursprünglichen Paper als deutlich überlegenes Retrieval-Paradigma gegenüber BM25.
00:10:26Neuere Forschungen zeigen jedoch, dass die Parameter in der BrowseComp-Plus-Studie
00:10:33für derart lange Dokumente ungeeignet waren.
00:10:37Die Frage lautet daher: Welches BM25 meint man eigentlich?
00:10:40Denn das hat drastische Auswirkungen auf die Gesamtgenauigkeit in diesem speziellen Benchmark.
00:10:50Warum ist BM25 mit diesem neuen Nutzertyp nun so mächtig?
00:10:56Ich habe das Allgemeinwissen des Nutzers erwähnt und dass er schneller
00:11:00und gezielter tippen kann.
00:11:02Exakter Begriffsabgleich bleibt weiterhin hochrelevant,
00:11:06da das Modell Namen, Entitäten, Postleitzahlen oder Artikelnummern kennt.
00:11:12Das lässt sich schwer mit Embedding-Modellen abbilden, die alle Token
00:11:17in ein festes Vokabular kodieren.
00:11:21Es ist zudem relativ günstig, besonders wenn man die Kosten für Embedding-Inferenz bedenkt.
00:11:27Manche dieser Modelle haben 8 Milliarden Parameter, und man muss Text kodieren,
00:11:32wofür man eine eigene Infrastruktur aufbauen muss.
00:11:36BM25 ist simpel und das Ökosystem bietet hervorragende Werkzeuge.
00:11:43Es ist also direkt einsatzbereit.
00:11:45Zudem kann das Modell Ergebnisse leicht prüfen und nachvollziehen, warum eine spezifische Anfrage
00:11:51genau dieses Resultat geliefert hat.
00:11:54Weil man nach exakten Begriffen, Phrasen und Ähnlichem sucht,
00:11:58was dem Modell hilft, Suchanfragen neu zu formulieren.
00:12:03Das sind also die drei Hauptpunkte.
00:12:06Kommen wir nun zu den aktuelleren Themen rund um „Was man alles braucht“.
00:12:11Das ist eine sehr neue Studie aus Waterloo von Jimmy Lins Forschungsgruppe.
00:12:17Sie leisten hervorragende Arbeit in der Information-Retrieval-Forschung und bei agentischer Suche.
00:12:23Sie haben ein neues Paper veröffentlicht, das ich sehr schätze.
00:12:26Es heißt „Scaling Direct Corpus Interaction via Dynamic Workspace Expansion“.
00:12:32Ich werde das kurz genauer erläutern.
00:12:34Stellen Sie sich vor, Sie möchten eine Websuch-Infrastruktur für Agenten aufbauen.
00:12:39Viele Unternehmen tun das zurzeit.
00:12:41Wir arbeiten ebenfalls mit einigen dieser Firmen zusammen, um Infrastruktur für diesen Anwendungsfall
00:12:47bereitzustellen.
00:12:48Dabei hat man es potenziell mit Milliarden von Dokumenten zu tun.
00:12:53Das passt natürlich nicht in das Kontextfenster.
00:12:55Man braucht also definitiv Retrieval.
00:12:57Und BM25 ist eine gute Grundlage.
00:12:59Damit lassen sich Informationen abrufen.
00:13:03Das Ergebnis kann man sich wie eine Suchergebnisseite, eine SERP, für Agenten vorstellen.
00:13:15Man platziert die abgerufenen Dokumente in einem Workspace.
00:13:20Organisiert man diesen Workspace wie ein Dateisystem, bringt das dieselben Vorteile wie bei Skills.
00:13:29Man erreicht schrittweise Offenlegung, indem man den Dokumenttitel
00:13:35sowie einen kurzen Textausschnitt für das Modell bereitstellt.
00:13:39Das Modell kann dann entscheiden: „Ich muss mehr von dem Dokument lesen.“
00:13:43Dabei nutzt es all die grundlegenden Tools, in denen es bereits sehr gut ist.
00:13:48Sie alle nutzen Coding-Agenten.
00:13:49Sie kennen also grep, ripgrep, sed, awk und ähnliches zur Kontextverwaltung.
00:13:55Hier erhält man die Vorteile beider Welten.
00:13:58Zudem kombiniert man Sandbox-, Retrieval-Infrastruktur, VFS, Bash und vieles mehr.
00:14:05Das ist extrem spannend,
00:14:06da es all diese neu entstehenden Paradigmen zusammenführt.
00:14:11Ich bin wirklich begeistert von dieser Richtung.
00:14:14Es ist sozusagen auch ein Kniff,
00:14:16um genau das zu nutzen, was die Modelle aktuell gut können.
00:14:19Denn alle führenden LLM-Entwickler optimieren ihre Modelle auf Programmierung, Bash und Tool-Nutzung.
00:14:27Richtest du deine Gesamtaufgabe an dieser Entwicklung aus,
00:14:31wird ein neues Modell auch in diesem Bereich automatisch besser sein.
00:14:37Sobald wir AGI erreichen, nutzen Modelle vielleicht direkt den Browser, wir werden sehen.
00:14:41Derzeit ist dies jedoch ein enorm mächtiger Ansatz zum Aufbau von Retrieval-Infrastruktur und agentischen Suchsystemen.
00:14:53Was die Evaluierung betrifft –
00:14:55ich habe das vorhin schon erwähnt:
00:14:57Im klassischen Information Retrieval hatte man eine Anfrage, eine Rangliste, berechnete nDCG und verglich die Werte.
00:15:07Das ist kaum noch relevant, wenn der Nutzer ein Agent ist. Dieser kann Anfragen neu formulieren,
00:15:12weitere Suchen durchführen, Anfragen erweitern und vieles mehr.
00:15:17Vieles aus der klassischen Information-Retrieval-Evaluierung ist damit gewissermaßen überholt.
00:15:23Prüfen Sie stattdessen, ob das Modell die gestellte Aufgabe lösen kann, zum Beispiel:
00:15:30Liefert es bei der Fragebeantwortung die richtige Antwort?
00:15:35Wir bei Hornet setzen auf BM25 als ein Basiselement. Unser Ziel ist es,
00:15:42die beste und effizienteste Möglichkeit zur Evaluierung von BM25 zu bieten. Ich halte es für einen extrem starken,
00:15:51fundamentalen Baustein. Diese Grafik vergleicht anonymisierte Suchmaschinen mit Hornet
00:15:59auf derselben Hardware mit 100 Millionen Webdokumenten auf einem einzelnen Knoten.
00:16:07Wie Sie sehen, bietet Hornet eine deutlich effizientere Implementierung als andere Engine-Systeme
00:16:13und erzielt mehr Durchsatz für dieselben Kosten. Das bedeutet für viele Firmen, die aktuell
00:16:19Websuch-Infrastrukturen aufbauen, erhebliche Einsparungen.
00:16:24Was zeigt die Y-Achse?
00:16:26Die Y-Achse zeigt QPS, Entschuldigung.
00:16:32Die Y-Achse zeigt – oh, Verzeihung, die Y-Achse zeigt die Latenz.
00:16:40Vier Kernaussagen aus diesem Vortrag: Es gibt einen neuen Nutzertyp. Er ist leistungsfähiger, tippt und liest schneller, kann Suchanfragen neu formulieren und verfügt über umfangreiches Allgemeinwissen, was einfache Tools wie grep und BM25 noch mächtiger macht.
00:17:03Das ist Punkt eins. Punkt zwei: Welches BM25 meint man eigentlich?
00:17:07Es gibt Unterschiede bei Implementierung, Leistung und Parametern. Bedenken Sie das.
00:17:14Und warum ist es für agentische Suche so effektiv? Weil es für das Modell nachvollziehbar ist. Es kann die Ergebnisse sehen und mit grep kombinieren, da beide auf exakten Treffern basieren.
00:17:27Die Kombination aus beidem bildet ein äußerst starkes Paradigma für agentisches Retrieval.
00:17:39Es gibt viele Quellen. Der Vortrag und die Folien werden, glaube ich, noch veröffentlicht.
00:17:47Wenn es Ihnen nicht gefallen hat, können Sie mir auf X schreiben.
00:17:55Für Publikumsfragen ist leider keine Zeit mehr, aber sprechen Sie mich auf der Konferenz gerne an. Am besten erreichen Sie mich über mein X-Konto.
00:18:08Das war's.
00:18:25Bis zum nächsten Mal.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video