Die Frontier KI-Inferenz-Cloud für Agenten — Byung-Gon (Gon) Chun, FriendliAI
AAI Engineer
컴퓨터/소프트웨어창업/스타트업AI/미래기술
스크립트
00:00:00Fangen wir an. Hallo zusammen. Vielen Dank fürs Kommen. Es ist später Nachmittag am letzten Tag, daher weiß ich das wirklich zu schätzen.
00:00:25Ich bin Gon, Gründer und CEO von Friendly AI. Heute möchte ich über agentische Inferenz sprechen. Ich gehe zunächst darauf ein, was sich geändert hat, warum das wichtig ist und wie wir die Inferenz-Cloud für Agenten neu aufbauen.
00:00:40Bevor wir ins Detail gehen, möchte ich Friendly AI kurz vorstellen. Friendly AI ist die führende KI-Inferenz-Cloud für Agenten.
00:00:50Skaliert, schneller, günstiger und zuverlässiger. Wir sind aus einem Forschungsteam der Seoul National University hervorgegangen, und diese Forschungswurzeln prägen uns bis heute.
00:01:02Wir sind das Team, das Continuous Batching erfunden hat – die Inferenz-Optimierung, die mittlerweile branchenweit Standard ist –, und unsere ORCA-Arbeit inspirierte vLLM, ein weitverbreitetes Open-Source-Framework.
00:01:15Heute sind wir weltweit tätig, mit Hauptsitz in San Francisco und einem Team in Seoul, um modernste Inferenz zu skalieren.
00:01:24Wie Sie wissen, ist 2026 das Jahr, in dem Agenten massiv in die Produktion gehen, angetrieben durch zwei Trends, die zusammenkommen.
00:01:33Erstens: Agenten wachsen exponentiell. KI-Agenten sorgen für eine explosionsartige Verbreitung in Software, Betriebsabläufen und Wissensarbeit.
00:01:45Zweitens: Open-Weight-Modelle haben die Speerspitze erreicht und machen Agenten wirtschaftlich. Sie können mittlerweile mit geschlossenen Spitzenmodellen mithalten, was bedeutet, dass Sie Agenten auf Spitzenniveau mit Open-Weight-Modellen zu viel geringeren Token-Kosten betreiben können.
00:02:00Lassen Sie mich zeigen, dass Open-Weight-Modelle mittlerweile stark genug für diese Art von echten Agenten-Workflows sind.
00:02:13Hier haben wir zwei Modellen exakt dieselbe Aufgabe gestellt: das Erstellen eines Tower-Defense-Spiels mit einem Coding-Agenten.
00:02:19Links sehen Sie GLM 5.2, ein Open-Weight-Modell auf Friendly AI. Rechts sehen Sie Anthropics Opus 4.8.
00:02:29Der wichtige Punkt ist nicht, dass die Ausgaben identisch sind. Der Punkt ist, dass beide die Aufgabe auf einem Niveau lösen, das eindeutig nutzbar ist.
00:02:38Für viele Agenten-Workflows haben Open-Weight-Modelle die Qualitätsschwelle überschritten, aber die Wirtschaftlichkeit unterscheidet sich stark.
00:02:49Für dieselbe Aufgabe kostet Opus 4.8 etwa 1,50 Dollar. GLM 5.2 auf Friendly AI kostet 0,27 Dollar – also 5,6-mal günstiger.
00:03:03Das ist also das Versprechen, das ich vorhin erwähnt habe. Open-Weight-Modelle bieten Ihnen Agenten in Spitzenqualität zu einem Bruchteil der Kosten.
00:03:12Aber die Modellkosten sind nur ein Teil der Geschichte. Damit Agenten tatsächlich schnell und zuverlässig sind, muss sich der Inferenz-Stack selbst verändern.
00:03:22Schauen wir uns also an, was in einem agentischen Workflow tatsächlich passiert.
00:03:28Werfen wir zunächst einen Blick auf die Veränderungen im Workload. In der Vergangenheit war Chat die vorherrschende Nutzung.
00:03:34Die Basiseinheit war eine Anfrage. Eine Person stellt eine Frage, das Modell antwortet, und die Person liest es.
00:03:41Latenz bedeutete: Wie schnell habe ich eine Antwort erhalten? Bei Agenten ist das anders. Die Basiseinheit ist eine Aufgabe.
00:03:49Eine Aufgabe kann viele Modellaufrufe und viele Tool-Aufrufe umfassen und eine Weile autonom laufen.
00:03:58Der Nutzer kümmert sich also nicht wirklich um die Latenz einer einzelnen Anfrage.
00:04:04Den Nutzer interessiert, wann die gesamte Aufgabe abgeschlossen ist.
00:04:08Das bedeutet, wir müssen auf Aufgaben optimieren, nicht nur auf einzelne Anfragen.
00:04:16Betrachten wir agentische Workloads genauer. Ein Agent führt im Grunde eine Sitzung aus, die aus Aufgaben besteht.
00:04:23Jede Aufgabe läuft typischerweise in einer Schleife. Zuerst plant sie, was meistens einen LLM-Aufruf bedeutet.
00:04:29Dann handelt sie, vielleicht durch den Aufruf eines Tools. Dann beobachtet sie das Ergebnis und fügt dieses wieder dem Kontext hinzu.
00:04:38Und das wiederholt sich, bis die Aufgabe erledigt ist.
00:04:41Wir wechseln also ständig zwischen LLM-Inferenz und einer oder mehreren Nicht-LLM-Tool-Ausführungen ab.
00:04:50Es gibt also eine Lücke zwischen LLM-Aufrufen. Ein Agent kann auch Sub-Agenten erstellen und diese parallel ausführen.
00:05:01Agenteneingaben unterscheiden sich ebenfalls stark vom Chat. Das Diagramm hier zeigt die Verteilung der Prompt- und Abschlusslängen unserer internen Coding-Agenten-Läufe mit GLM 5.2, die wir täglich nutzen.
00:05:15Sie sind viel länger. Sie wachsen im Laufe der Aufgabe, da jede Beobachtung wieder an den Kontext angehängt wird.
00:05:25Hier gibt es ein wichtiges Muster. Aufeinanderfolgende Agentenschritte teilen sich meist ein riesiges Präfix.
00:05:32Wenn wir dasselbe Präfix jedes Mal neu berechnen, verbrennen wir viel Rechenleistung für Arbeit, die wir bereits erledigt haben.
00:05:40Das ist also eine der größten Chancen bei der agentischen Inferenz.
00:05:46Wie tokenhungrig sind Agenten also?
00:05:49Betrachten wir nun ein Beispiel für eine langfristige Aufgabe wie Deep Research.
00:05:53Wir haben das vLLM-Speculative-Decoding-Framework mit KiloCode und GLM 5.2 auf Friendly AI erklärt.
00:06:02Es gibt mehrere Phasen, und jede Phase besteht aus Sub-Agenten, die mehrere Inferenz- und Tool-Aufrufe ausführen.
00:06:12Es führt also Dutzende oder sogar Hunderte von Inferenzschritten aus, manchmal über Minuten oder Stunden hinweg.
00:06:19Und der gemeinsame Kontext wächst die ganze Zeit weiter.
00:06:23Für den Benutzer ist nicht die Latenz eines einzelnen Tokens oder Aufrufs wichtig.
00:06:28Wichtig ist, wann meine Aufgabe abgeschlossen ist.
00:06:35Agentische Inferenz ist also nicht einfach nur Chat mit mehr Anfragen.
00:06:39Es ist ein anderes Problem. Der Kontext wächst mit der Zeit.
00:06:43Tool-Arbeiten sind zwischen Modellaufrufe verschachtelt.
00:06:46Die Anzahl der Modellaufrufe hängt von der Eingabe ab.
00:06:49Man kann also nicht wirklich nach einem festen Anfragerratenplan planen.
00:06:55Und die echte Metrik ist die End-to-End-Aufgabenlatenz, nicht die Latenz einer einzelnen Anfrage.
00:07:02Wie machen wir das also? Ich zeige Ihnen die wichtigste Ingenieurskunst dahinter.
00:07:23Hier ist die Architekturkarte dazu, wie wir darüber denken.
00:07:27Wir haben den Stack Schicht für Schicht um agentische Workloads herum aufgebaut.
00:07:33Es gibt vier große Säulen, auf die ich heute eingehen werde.
00:07:37Präfix-Caching, Key-Value- (kurz KV-) Cache-Management, Cache-bewusstes Routing, Agenten-bewusste Optimierung.
00:07:48Und natürlich brauchen wir im Unterbau Optimierungen auf Modellebene wie Sparse Attention für lange Kontexte,
00:07:56Techniken zur Reduzierung von Fehlern, schnelle Decoder, ausfallsicheres Serving und mehr.
00:08:02In diesem Vortrag werde ich mich auf die vier Säulen konzentrieren.
00:08:05Beginnen wir mit dem Präfix-Caching.
00:08:09Da Agentenschritte ein großes Präfix gemeinsam haben, berechnen wir Key-Value für das Präfix einmal und cachen es.
00:08:17In späteren Schritten verwenden wir dann die gecachten Key-Values wieder und verarbeiten nur das neue Suffix.
00:08:23Das Lesen aus dem Cache ist viel günstiger als die Neuberechnung des Prefills,
00:08:27wodurch sich die Zeit bis zum ersten Token verkürzt und die Rechenlast bei jedem Schritt verringert wird.
00:08:33Je länger die Aufgabe bei Agenten läuft, desto wertvoller wird dies.
00:08:41Aber Caching funktioniert nur, wenn der KV-Cache tatsächlich hineinpasst und effizient verschoben werden kann.
00:08:48Deshalb benötigen wir ein starkes KV-Cache-Management.
00:08:52Wir nutzen paged Memory Management, um mehr aktive Kontexte in jeden GPU-Speicher zu packen.
00:08:59Wir verwenden KV-Quantisierung, um den Speicherbedarf zu reduzieren.
00:09:04Wir nutzen hierarchisches Caching über GPU-Speicher, Host-Speicher und Festplatte hinweg, damit wir über die GPU-Limits hinausgehen können.
00:09:13Und wir nutzen zudem verteiltes Caching, sodass ein Präfix über Replikate hinweg bedient werden kann, nicht nur innerhalb einer Instanz.
00:09:26Auf globaler Cluster-Ebene wird Routing extrem wichtig.
00:09:29Ein naibiver Load Balancer verteilt Anfragen vielleicht gleichmäßig auf GPU-Cluster, aber das kann die Cache-Lokalität zerstören.
00:09:38Ein Cache-bewusster Router im globalen Maßstab tut etwas Klügeres.
00:09:42Er sendet eine Anfrage an einen Pod, der das richtige Präfix bereits im Cache hat, wodurch ein teures Prefill zu einem Cache-Hit wird.
00:09:51Gleichzeitig muss er dennoch die Last ausgleichen, damit kein einzelner Pod zum Hotspot wird.
00:09:58In diesem Beispiel gehen die beiden Anfragen von Aufgabe A an denselben Pod, um die Cache-Lokalität zu wahren.
00:10:08Der nächste Baustein ist die Agenten-bewusste Optimierung.
00:10:11Und das ist die nächste Grenze der Agenten-Inferenz.
00:10:16Heutzutage planen die meisten Systeme jeden LLM-Aufruf so, als wäre er unabhängig.
00:10:21Sie verstehen nicht wirklich, dass dieser Aufruf Teil eines längeren Agentenprogramms ist.
00:10:27Aber wenn der Optimierer den Kontext auf Agentenebene kennt, kann er bessere Entscheidungen treffen.
00:10:33Zum Beispiel das Unterbrechen (Preemption) der richtigen Arbeit, das spekulative Vorab-Befüllen (Prefill) des Kontexts für einen wahrscheinlich nächsten Schritt oder eine bessere Entscheidung zur Cache-Verdrängung basierend auf dem Kontext auf Agentenebene.
00:10:48Das Ziel ist also, die End-to-End-Aufgabenlatenz zu reduzieren, nicht nur einen Aufruf schnell aussehen zu lassen.
00:10:58Wenn wir all das zusammenfügen, ist das das Ergebnis.
00:11:01Wir verwenden dasselbe Modell, GLM 5.2, mit KiloCode, um ein einfaches Handyspiel zu erstellen.
00:11:07Wir haben dieselbe Aufgabe mit den Modell-APIs von Friendly AI und einem anderen bekannten Inferenzanbieter ausgeführt.
00:11:14Wie Sie sehen können, schließt Friendly AI dieselbe Aufgabe End-to-End viel schneller ab, dank unseres agentenzentrierten Cloud-Designs.
00:11:24Was schaltet das in der Praxis frei?
00:11:29Einen stärkeren Produktions-Agenten-Stack.
00:11:32Nehmen Sie einen Agenten, den Sie bereits mögen.
00:11:35Binden Sie nun Open-Weight-Spitzenmodelle wie GLM 5.2, MiniMax und Kimi ein, die auf Friendly AI bereitgestellt werden.
00:11:43Das Modell bietet Ihnen Fähigkeiten auf Spitzenniveau und eine bessere Wirtschaftlichkeit.
00:11:49Friendly AI gibt Ihnen die Geschwindigkeit, Zuverlässigkeit und End-to-End-Aufgabenleistung, die in der Produktion benötigt werden.
00:11:56Diese Kombination aus Qualität, Geschwindigkeit, Zuverlässigkeit und Kosten macht Agenten in der Produktion tatsächlich nützlich und wirtschaftlich.
00:12:06Friendly AI unterstützt derzeit Teams in der Produktion – von KI-nativen Start-ups bis hin zu globalen Unternehmen.
00:12:15Ich möchte hier einige davon hervorheben.
00:12:20Kilo ist ein äußerst beliebtes agentisches KI-Coding-Tool, das Millionen von Nutzern bedient.
00:12:27LG ist ein globaler Konzern, dessen Geschäftsbereiche von Elektronik über Gesundheitswesen bis hin zu Energie reichen.
00:12:35Sehr unterschiedliche Unternehmen, aber sie alle benötigen dasselbe.
00:12:39Schnelle, zuverlässige und kostengünstige agentische Inferenz.
00:12:45Dieses Testimonial unseres Kunden Kilo sagt eigentlich alles.
00:12:50Im vergangenen Jahr hat KiloCode mehrere Inferenzanbieter getestet, die sowohl offene als auch geschlossene Modelle hosten.
00:12:56In einem Split-Test der GLM-5-Nutzung im Vergleich zu anderen Drittanbietern und der direkten Nutzung von Model Lab G.AI
00:13:05war Friendly AI durchgehend siebenmal schneller bei einer deutlich geringeren Fehlerquote.
00:13:12Heute ist Friendly AI eine Kernkomponente des Kilo-Stacks.
00:13:17Und Sie können dies so nutzen, wie es zu Ihrem Stack passt.
00:13:23Model API ist der schnellste Weg, um zu beginnen.
00:13:26Wichtigste Open-Weight-Spitzenmodelle über unsere serverlose API.
00:13:29Dedizierte Endpunkte bieten Ihnen eine eigene isolierte Bereitstellung mit garantierten SLAs für Produktions-Workloads.
00:13:36Und BYOG (Bring Your Own GPU) ermöglicht es Ihnen, Friendly Inference auf Ihrer eigenen Infrastruktur auszuführen.
00:13:44Derselbe Stack, drei Bereitstellungswege.
00:13:49Zusammenfassend gibt es drei Dinge zu beachten.
00:13:53Erstens: Open-Weight-Spitzenmodelle machen Produktionsagenten wirtschaftlich skalierbar.
00:13:59Zweitens: Agenten sind nicht nur Chat mit mehr Rechenkernen.
00:14:03Agentische Inferenz erfordert die Optimierung der End-to-End-Aufgabenlatenz unter Berücksichtigung der von mir genannten Herausforderungen.
00:14:10Drittens: Friendly AI ist als Inferenz-Cloud für Agentenwelten konzipiert.
00:14:16Schnelle, zuverlässige und kostengünstige agentische Inferenz.
00:14:23Vielen Dank für Ihre Teilnahme an meiner Session.
00:14:25Wenn Sie Agenten entwickeln, probieren Sie Open-Weight-Spitzenmodelle noch heute auf Friendly AI aus.
00:14:30Sie können in wenigen Minuten bei Friendly AI starten.
00:14:34Und vielen Dank.
00:14:35Ich werde nach der Session noch da sein.
00:14:37Vielen Dank.
00:14:38Vielen Dank.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기