Cloud Inferens AI Perintis untuk Agen — Byung-Gon (Gon) Chun, FriendliAI

AAI Engineer
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00Mari kita mulai. Halo semuanya. Terima kasih sudah datang. Ini adalah sore hari di hari terakhir, jadi saya sangat mengapresiasinya.
00:00:25Saya Gon, pendiri dan CEO Friendly AI. Hari ini saya ingin membahas tentang inferensi agen. Pertama-tama saya akan menjelaskan apa yang berubah, mengapa itu penting, dan bagaimana kami membangun kembali cloud inferensi untuk agen.
00:00:40Sebelum kita membahas lebih dalam, izinkan saya memperkenalkan Friendly AI secara singkat. Friendly AI adalah cloud inferensi AI terdepan untuk agen.
00:00:50Skala besar, lebih cepat, lebih murah, dan lebih andal. Kami lahir dari tim riset di Seoul National University, dan akar riset tersebut masih mendefinisikan siapa kami.
00:01:02Kami adalah tim yang menciptakan continuous batching, optimasi inferensi yang kini menjadi standar di seluruh industri, dan karya ORCA kami menginspirasi vLLM, kerangka kerja open-source yang digunakan secara luas.
00:01:15Hari ini kami beroperasi secara global, berantorkan pusat di San Francisco dengan tim di Seoul untuk mengeskalasi inferensi terdepan.
00:01:24Seperti yang Anda tahu, 2026 adalah tahun di mana agen masuk ke produksi secara masif, dan ini didorong oleh dua tren yang saling melengkapi.
00:01:33Pertama, pertumbuhan agen eksponensial. Agen AI mendorong adopsi yang sangat pesat di seluruh perangkat lunak, operasional, dan pekerjaan pengetahuan.
00:01:45Kedua, model open-weight telah mencapai tingkat terdepan dan membuat agen menjadi ekonomis. Kemampuannya kini menyaingi model tertutup terdepan, yang berarti Anda dapat menjalankan agen berkualitas tinggi dengan model terbuka pada biaya token yang jauh lebih rendah.
00:02:00Tunjukkan bahwa model open-weight kini cukup tangguh untuk jenis alur kerja agen nyata seperti ini.
00:02:13Di sini kami memberikan tugas yang persis sama, membangun game tower defense menggunakan agen koding, kepada dua model.
00:02:19Di sebelah kiri adalah GLM 5.2, model open-weight yang berjalan di Friendly AI. Di sebelah kanan adalah Opus 4.8 dari Anthropic.
00:02:29Poin pentingnya bukanlah hasil keluarnya identik. Poin utamanya adalah keduanya menyelesaikan tugas pada tingkat yang jelas-jelas dapat digunakan.
00:02:38Untuk banyak alur kerja agen, model open-weight telah melampaui ambang batas kualitas, tetapi nilainya secara ekonomis sangat berbeda.
00:02:49Untuk tugas yang sama, Opus 4.8 memakan biaya sekitar $1,50. GLM 5.2 di Friendly AI memakan biaya $0,27, alias 5,6 kali lebih murah.
00:03:03Jadi inilah potensi besar yang saya sebutkan tadi. Model open-weight memberi Anda agen berkualitas terdepan dengan sebagian kecil biaya.
00:03:12Namun biaya model hanyalah sebagian dari cerita. Agar agen benar-benar cepat dan andal, tumpukan teknologi inferensinya sendiri harus berubah.
00:03:22Mari kita lihat apa yang sebenarnya terjadi di dalam beban kerja agen.
00:03:28Pertama, mari kita lihat perubahan pada beban kerja. Di masa lalu, penggunaan dominan adalah percakapan (chat).
00:03:34Unit dasarnya adalah permintaan (request). Seseorang mengajukan pertanyaan, model menjawab, dan orang tersebut membacanya.
00:03:41Latensi berarti seberapa cepat saya mendapatkan satu tanggapan. Agen itu berbeda. Unit dasarnya adalah tugas (task).
00:03:49Suatu tugas bisa melibatkan banyak panggilan model, banyak pemanggilan alat, dan dapat berjalan secara otonom untuk beberapa waktu.
00:03:58Jadi pengguna tidak begitu peduli tentang latensi dari satu permintaan individu.
00:04:04Pengguna peduli tentang kapan seluruh tugas selesai.
00:04:08Itu berarti kita harus melakukan optimasi untuk tugas, bukan sekadar permintaan individu.
00:04:16Mari kita lihat beban kerja agen secara lebih dekat. Sebuah agen sebenarnya menjalankan sesi yang terdiri dari beberapa tugas.
00:04:23Setiap tugas biasanya berjalan dalam satu ikal (loop). Pertama, ia membuat rencana, yang biasanya berarti panggilan LLM.
00:04:29Kemudian ia bertindak, mungkin dengan memanggil suatu alat. Lalu ia mengamati hasilnya dan menambahkan itu kembali ke dalam konteks.
00:04:38Dan proses ini terus diulang sampai tugas selesai.
00:04:41Jadi kita terus-menerus berganti antara inferensi LLM dan satu atau lebih eksekusi alat non-LLM.
00:04:50Sehingga ada jeda di antara panggilan LLM. Agen juga dapat membuat sub-agen dan menjalankannya secara paralel.
00:05:01Input agen juga terlihat sangat berbeda dari percakapan biasa. Grafik di sini menunjukkan distribusi panjang prompt dan penyelesaian dari eksekusi agen koding internal kami menggunakan GLM 5.2, yang kami gunakan sehari-hari.
00:05:15Ukurannya jauh lebih panjang. Ukurannya berkembang seiring berjalannya tugas karena setiap pengamatan dilampirkan kembali ke dalam konteks.
00:05:25Ada pola penting di sini. Langkah-langkah agen yang berurutan biasanya berbagi awalan (prefix) yang sangat besar.
00:05:32Jika kita menghitung ulang awalan yang sama setiap saat, kita membuang banyak komputasi untuk pekerjaan yang sudah kita lakukan.
00:05:40Jadi ini adalah salah satu peluang terbesar dalam inferensi agen.
00:05:46Lantas seberapa lapar token-kah para agen ini?
00:05:49Sekarang mari kita lihat contoh tugas berjangka panjang seperti riset mendalam (deep research).
00:05:53Kami menjelaskan kerangka kerja spec decoding di vLLM menggunakan Kilo Code dengan GLM 5.2 di Friendly AI.
00:06:02Ada beberapa tahapan dan setiap tahapan terdiri dari sub-agen yang menjalankan banyak inferensi dan pemanggilan alat.
00:06:12Sehingga ia mungkin menjalankan puluhan atau bahkan ratusan langkah inferensi, terkadang selama berturut-turut dalam menit atau jam.
00:06:19Dan konteks bersama tersebut terus berkembang sepanjang waktu.
00:06:23Bagi pengguna, yang penting bukanlah latensi dari satu token atau satu panggilan.
00:06:28Yang penting adalah kapan tugas saya selesai.
00:06:35Jadi inferensi agen bukan sekadar percakapan biasa dengan lebih banyak permintaan.
00:06:39Ini adalah masalah yang berbeda. Konteksnya terus berkembang seiring waktu.
00:06:43Pengerjaan alat diselingi di antara panggilan-panggilan model.
00:06:46Jumlah panggilan model bergantung pada input yang diberikan.
00:06:49Jadi Anda tidak bisa benar-benar merencanakan berdasarkan tingkat permintaan yang tetap.
00:06:55Dan metrik yang sebenarnya adalah latensi tugas secara end-to-end, bukan latensi dari satu permintaan tunggal.
00:07:02Lalu bagaimana kita melakukannya? Izinkan saya menunjukkan rekayasa kunci di baliknya.
00:07:23Berikut adalah peta rekayasa tentang bagaimana kami memikirkannya.
00:07:27Kami membangun tumpukan teknologi ini lapis demi lapis di sekitar beban kerja agen.
00:07:33Ada empat pilar besar yang akan saya bahas hari ini.
00:07:37Prefix caching, manajemen cache key-value (singkatnya KV), cache-aware routing, serta optimasi agent-aware.
00:07:48Dan, tentu saja, di bawahnya, kita memerlukan optimasi tingkat model seperti sparse attention untuk konteks yang panjang,
00:07:56teknik untuk mengurangi kesalahan, kernel cepat, penyajian yang tangguh, dan banyak lagi.
00:08:02Dalam presentasi ini, saya akan berfokus pada empat pilar tersebut.
00:08:05Mari kita mulai dengan prefix caching.
00:08:09Karena langkah-langkah agen berbagi prefix yang besar, kita menghitung nilai KV untuk prefix sekali saja dan menyimpannya di cache.
00:08:17Kemudian pada langkah-langkah berikutnya, kita menggunakan kembali nilai KV dari cache dan hanya memproses akhiran (suffix) baru.
00:08:23Membaca dari cache jauh lebih murah daripada menghitung ulang prefill,
00:08:27sehingga ini meningkatkan time-to-first-token dan mengurangi komputasi di setiap langkah.
00:08:33Dan semakin lama tugas berjalan pada agen, semakin berharga hal ini.
00:08:41Namun caching hanya berfungsi jika cache KV benar-benar muat dan dapat berpindah secara efisien.
00:08:48Jadi kita memerlukan manajemen cache KV yang kuat.
00:08:52Kami menggunakan manajemen memori bergaya Google untuk memuat lebih banyak konteks aktif ke dalam setiap memori GPU.
00:08:59Kami menggunakan kuantisasi KV untuk mengurangi jejak memori.
00:09:04Kami menggunakan caching hierarkis di seluruh memori GPU, memori host, dan disk, sehingga kami dapat melampaui batas GPU.
00:09:13Dan kami juga menggunakan caching terdistribusi sehingga satu prefix dapat dilayani di seluruh replika, bukan hanya di dalam satu instansi.
00:09:26Pada skala klaster global, pengarahan (routing) menjadi sangat penting.
00:09:29Penyeimbang beban sederhana mungkin membagi permintaan secara merata di seluruh klaster GPU, tetapi itu dapat merusak lokalitas cache.
00:09:38Router yang cerdas terhadap cache pada skala global melakukan hal yang lebih pintar.
00:09:42Router tersebut mengirimkan permintaan ke pod yang sudah menyimpan prefix yang tepat di cache, mengubah prefill berat menjadi hit cache sederhana.
00:09:51Di saat yang sama, ia tetap harus menyeimbangkan beban, agar satu pod tidak menjadi terlalu panas (overloaded).
00:09:58Dalam contoh ini, dua permintaan dari tugas A dikirim ke pod satu yang sama demi lokalitas cache.
00:10:08Komponen berikutnya adalah optimasi agent-aware.
00:10:11Dan ini adalah lini terdepan berikutnya dalam inferensi agen.
00:10:16Saat ini, sebagian besar sistem menjadwalkan setiap panggilan LLM seolah-olah bersifat independen.
00:10:21Sistem tidak benar-benar memahami bahwa panggilan ini adalah bagian dari program agen yang lebih panjang.
00:10:27Tetapi jika pengoptimal memahami konteks tingkat agen, ia dapat membuat keputusan yang lebih baik.
00:10:33Misalnya, menghentikan pekerjaan yang tepat (preempting), secara spekulatif mengisi konteks untuk langkah berikutnya yang mungkin terjadi, atau membuat keputusan pengosongan cache yang lebih baik berdasarkan konteks agen.
00:10:48Jadi tujuannya adalah mengurangi latensi tugas end-to-end, bukan sekadar membuat satu panggilan terlihat cepat.
00:10:58Ketika kita menggabungkan semua ini, inilah hasilnya.
00:11:01Kami menggunakan model yang sama, GLM 5.2, dengan Kilo Code untuk membuat game seluler sederhana.
00:11:07Kami menjalankan tugas yang sama dengan API model Friendly AI dan penyedia inferensi terkenal lainnya.
00:11:14Seperti yang Anda lihat, Friendly AI menyelesaikan tugas yang sama secara end-to-end dengan lebih cepat, berkat desain cloud kami yang berpusat pada agen.
00:11:24Jadi, apa yang bisa dibuka oleh hal ini dalam praktiknya?
00:11:29Tumpukan teknologi produksi agen yang lebih kuat.
00:11:32Gunakan agen yang sudah Anda sukai.
00:11:35Sekarang, hubungkan model open-weight terdepan seperti GLM 5.2, Minimax, dan Kimi yang disajikan di Friendly AI.
00:11:43Model tersebut memberi Anda kemampuan kualitas terdepan dengan nilai ekonomi yang lebih baik.
00:11:49Friendly AI memberi Anda kecepatan, keandalan, dan performa tugas end-to-end yang dibutuhkan dalam produksi.
00:11:56Kombinasi tersebut—kualitas, kecepatan, keandalan, dan biaya—itulah yang membuat agen benar-benar berguna dan ekonomis dalam produksi.
00:12:06Friendly AI saat ini mendukung tim-tim dalam tahap produksi mulai dari startup AI-native hingga perusahaan global.
00:12:15Saya ingin menyoroti beberapa di antaranya di sini.
00:12:20Kilo adalah alat koding AI agen yang sangat populer yang melayani jutaan pengguna.
00:12:27LG adalah perusahaan global yang bisnisnya berkisar dari elektronik, layanan kesehatan, hingga energi.
00:12:35Perusahaan-perusahaan yang sangat berbeda, tetapi mereka semua membutuhkan hal yang sama.
00:12:39Inferensi agen yang cepat, andal, dan hemat biaya.
00:12:45Testimoni dari klien kami, Kilo, ini menjelaskan semuanya.
00:12:50Selama setahun terakhir, Kilo Code telah menguji beberapa penyedia inferensi yang meng-host model terbuka maupun tertutup.
00:12:56Dalam pengujian terpisah dari penggunaan GLM 5 dibandingkan dengan penyedia pihak ketiga lainnya dan penggunaan langsung dari Model Lab G.AI,
00:13:05Friendly AI secara konsisten tujuh kali lebih cepat dengan tingkat kesalahan yang jauh lebih rendah.
00:13:12Hari ini, Friendly AI adalah komponen inti dari tumpukan teknologi Kilo.
00:13:17Dan Anda dapat menggunakannya sesuai dengan kebutuhan tumpukan teknologi Anda.
00:13:23API model adalah cara tercepat untuk memulai.
00:13:26Model Openweight terdepan yang dapat diakses melalui API serverless kami.
00:13:29Dedicated Endpoint memberi Anda penerapan terisolasi sendiri dengan SLA yang dijamin untuk beban kerja produksi.
00:13:36Dan BYOG, bawa GPU Anda sendiri, memungkinkan Anda menjalankan inferensi ramah lingkungan di infrastruktur Anda sendiri.
00:13:44Tumpukan teknologi yang sama, tiga cara penerapannya.
00:13:49Sebagai penutup, ada tiga hal yang perlu diingat.
00:13:53Pertama, model Openweight terdepan membuat agen produksi dapat dieskalasi secara ekonomis.
00:13:59Kedua, agen bukan sekadar percakapan biasa dengan lebih banyak panggilan.
00:14:03Inferensi agen memerlukan optimasi latensi tugas end-to-end dengan tantangan yang telah saya sebutkan.
00:14:10Ketiga, Friendly AI dibangun sebagai cloud inferensi untuk dunia tersebut.
00:14:16Inferensi agen yang cepat, andal, dan hemat biaya.
00:14:23Terima kasih telah menghadiri sesi saya.
00:14:25Jika Anda sedang membangun agen, cobalah model Openweight terdepan di Friendly AI hari ini,
00:14:30Anda dapat memulainya di Friendly AI dalam hitungan menit.
00:14:34Dan terima kasih.
00:14:35Saya akan berada di sekitar sini setelah sesi selesai.
00:14:37Terima kasih.
00:14:38Terima kasih.

Key Takeaway

Pengoptimalan inferensi agen berbasis model open-weight melalui prefix caching, manajemen memori KV, dan routing cerdas memangkas biaya hingga 5,6 kali lipat serta mempercepat latensi tugas end-to-end secara signifikan dibanding tumpukan inferensi tradisional.

Highlights

  • Penggunaan model open-weight GLM 5.2 untuk membangun game tower defense memakan biaya $0,27, alias 5,6 kali lebih murah dibanding Opus 4.8 dari Anthropic yang seharga $1,50.

  • Langkah-langkah agen yang berurutan berbagi prefix yang sangat besar, sehingga perhitungan ulang prefix yang sama membuang banyak komputasi.

  • Perluasan memori GPU dilakukan dengan manajemen memori bergaya Google, kuantisasi KV, caching hierarkis, serta caching terdistribusi.

  • Uji coba independen oleh Kilo Code menunjukkan Friendly AI konsisten 7 kali lebih cepat dengan tingkat kesalahan yang jauh lebih rendah dibanding penyedia lain.

  • Tiga opsi penerapan infrastruktur Friendly AI mencakup API serverless, Dedicated Endpoint ber-SLA, dan Bring Your Own GPU (BYOG).

Timeline

Perkembangan Model Open-Weight dan Efisiensi Biaya Agen AI

  • Friendly AI lahir dari tim riset Seoul National University yang menciptakan continuous batching dan karya ORCA.
  • Model open-weight telah mencapai kualitas setara model tertutup terdepan untuk menyelesaikan alur kerja agen nyata.
  • Penggunaan model open-weight memangkas biaya eksekusi tugas agen secara drastis.

Continuous batching dari tim riset Friendly AI kini menjadi standar industri yang juga menginspirasi kerangka kerja vLLM. Pada tahun 2026, agen AI masuk ke tahap produksi secara masif seiring peningkatan kemampuan model open-weight. Pengujian pembangunan game tower defense menunjukkan bahwa GLM 5.2 di Friendly AI menyelesaikan tugas sekelas Opus 4.8 dari Anthropic, namun dengan biaya $0,27 dibandingkan $1,50.

Karakteristik Beban Kerja Agen dan Tantangan Latensi

  • Unit dasar beban kerja agen adalah tugas berjangka panjang, bukan sekadar permintaan percakapan tunggal.
  • Proses agen mengalami pergantian berulang antara panggilan LLM dan eksekusi alat non-LLM.
  • Langkah-langkah agen yang berurutan menghasilkan konteks yang terus membengkak dan berbagi prefix berukuran besar.

Beban kerja agen berbeda dari aplikasi chat biasa karena pengguna berfokus pada waktu penyelesaian seluruh tugas, bukan latensi per respons individu. Setiap tugas terdiri dari ikal perancangan, tindakan pemanggilan alat, dan pengamatan yang dimasukkan kembali ke dalam konteks. Tugas seperti riset mendalam memicu puluhan hingga ratusan langkah inferensi, sehingga penghitungan ulang prefix pada setiap langkah menjadi pemborosan komputasi yang besar.

Empat Pilar Arsitektur Cloud Inferensi Khusus Agen

  • Prefix caching menyimpan nilai KV dari prefix untuk menghindari prefill berulang pada suffix baru.
  • Manajemen cache KV mengombinasikan kuantisasi, caching hierarkis, dan caching terdistribusi untuk melampaui batas GPU.
  • Cache-aware routing mengarahkan permintaan ke pod GPU yang sudah menyimpan prefix terkait.
  • Optimasi agent-aware mengendalikan preemption dan penyiapan konteks spekulatif berdasarkan program agen.

Prefix caching mempercepat time-to-first-token dengan hanya memproses suffix baru. Manajemen memori bergaya Google bersama kuantisasi KV dan caching hierarkis (GPU, host, disk) memuat lebih banyak konteks aktif secara efisien. Router cerdas menjaga lokasi cache di tingkat klaster global tanpa membebankan satu pod secara berlebihan, sementara optimasi agent-aware mengurangi latensi total tugas end-to-end melalui pemahaman alur program agen.

Implementasi Produksi dan Opsi Penerapan Infrastruktur

  • Infrastruktur Friendly AI mempercepat pembuatan aplikasi seluler secara end-to-end dibanding penyedia inferensi lain.
  • Kilo Code mencatat kecepatan 7 kali lebih tinggi dan tingkat kesalahan yang lebih rendah menggunakan Friendly AI.
  • Terdapat tiga model penyediaan infrastruktur untuk berbagai skala kebutuhan produksi.

Pengujian pembuatan game seluler dengan GLM 5.2 menunjukkan penyelesaian tugas end-to-end yang lebih cepat pada Friendly AI. Perusahaan seperti Kilo Code dan LG memanfaatkan tumpukan teknologi ini untuk melayani jutaan pengguna serta operasional global. Layanan ini dapat diakses melalui API serverless, Dedicated Endpoint bergaransi SLA, atau penyebaran pada infrastruktur mandiri melalui Bring Your Own GPU (BYOG).

Community Posts

No posts yet. Be the first to write about this video!

Write about this video