Cloud Inferens AI Perintis untuk Agen — Byung-Gon (Gon) Chun, FriendliAI
AAI Engineer
Computing/SoftwareSmall Business/StartupsInternet Technology
Transcript
00:00:00Mari kita mulai. Halo semuanya. Terima kasih sudah datang. Ini adalah sore hari di hari terakhir, jadi saya sangat mengapresiasinya.
00:00:25Saya Gon, pendiri dan CEO Friendly AI. Hari ini saya ingin membahas tentang inferensi agen. Pertama-tama saya akan menjelaskan apa yang berubah, mengapa itu penting, dan bagaimana kami membangun kembali cloud inferensi untuk agen.
00:00:40Sebelum kita membahas lebih dalam, izinkan saya memperkenalkan Friendly AI secara singkat. Friendly AI adalah cloud inferensi AI terdepan untuk agen.
00:00:50Skala besar, lebih cepat, lebih murah, dan lebih andal. Kami lahir dari tim riset di Seoul National University, dan akar riset tersebut masih mendefinisikan siapa kami.
00:01:02Kami adalah tim yang menciptakan continuous batching, optimasi inferensi yang kini menjadi standar di seluruh industri, dan karya ORCA kami menginspirasi vLLM, kerangka kerja open-source yang digunakan secara luas.
00:01:15Hari ini kami beroperasi secara global, berantorkan pusat di San Francisco dengan tim di Seoul untuk mengeskalasi inferensi terdepan.
00:01:24Seperti yang Anda tahu, 2026 adalah tahun di mana agen masuk ke produksi secara masif, dan ini didorong oleh dua tren yang saling melengkapi.
00:01:33Pertama, pertumbuhan agen eksponensial. Agen AI mendorong adopsi yang sangat pesat di seluruh perangkat lunak, operasional, dan pekerjaan pengetahuan.
00:01:45Kedua, model open-weight telah mencapai tingkat terdepan dan membuat agen menjadi ekonomis. Kemampuannya kini menyaingi model tertutup terdepan, yang berarti Anda dapat menjalankan agen berkualitas tinggi dengan model terbuka pada biaya token yang jauh lebih rendah.
00:02:00Tunjukkan bahwa model open-weight kini cukup tangguh untuk jenis alur kerja agen nyata seperti ini.
00:02:13Di sini kami memberikan tugas yang persis sama, membangun game tower defense menggunakan agen koding, kepada dua model.
00:02:19Di sebelah kiri adalah GLM 5.2, model open-weight yang berjalan di Friendly AI. Di sebelah kanan adalah Opus 4.8 dari Anthropic.
00:02:29Poin pentingnya bukanlah hasil keluarnya identik. Poin utamanya adalah keduanya menyelesaikan tugas pada tingkat yang jelas-jelas dapat digunakan.
00:02:38Untuk banyak alur kerja agen, model open-weight telah melampaui ambang batas kualitas, tetapi nilainya secara ekonomis sangat berbeda.
00:02:49Untuk tugas yang sama, Opus 4.8 memakan biaya sekitar $1,50. GLM 5.2 di Friendly AI memakan biaya $0,27, alias 5,6 kali lebih murah.
00:03:03Jadi inilah potensi besar yang saya sebutkan tadi. Model open-weight memberi Anda agen berkualitas terdepan dengan sebagian kecil biaya.
00:03:12Namun biaya model hanyalah sebagian dari cerita. Agar agen benar-benar cepat dan andal, tumpukan teknologi inferensinya sendiri harus berubah.
00:03:22Mari kita lihat apa yang sebenarnya terjadi di dalam beban kerja agen.
00:03:28Pertama, mari kita lihat perubahan pada beban kerja. Di masa lalu, penggunaan dominan adalah percakapan (chat).
00:03:34Unit dasarnya adalah permintaan (request). Seseorang mengajukan pertanyaan, model menjawab, dan orang tersebut membacanya.
00:03:41Latensi berarti seberapa cepat saya mendapatkan satu tanggapan. Agen itu berbeda. Unit dasarnya adalah tugas (task).
00:03:49Suatu tugas bisa melibatkan banyak panggilan model, banyak pemanggilan alat, dan dapat berjalan secara otonom untuk beberapa waktu.
00:03:58Jadi pengguna tidak begitu peduli tentang latensi dari satu permintaan individu.
00:04:04Pengguna peduli tentang kapan seluruh tugas selesai.
00:04:08Itu berarti kita harus melakukan optimasi untuk tugas, bukan sekadar permintaan individu.
00:04:16Mari kita lihat beban kerja agen secara lebih dekat. Sebuah agen sebenarnya menjalankan sesi yang terdiri dari beberapa tugas.
00:04:23Setiap tugas biasanya berjalan dalam satu ikal (loop). Pertama, ia membuat rencana, yang biasanya berarti panggilan LLM.
00:04:29Kemudian ia bertindak, mungkin dengan memanggil suatu alat. Lalu ia mengamati hasilnya dan menambahkan itu kembali ke dalam konteks.
00:04:38Dan proses ini terus diulang sampai tugas selesai.
00:04:41Jadi kita terus-menerus berganti antara inferensi LLM dan satu atau lebih eksekusi alat non-LLM.
00:04:50Sehingga ada jeda di antara panggilan LLM. Agen juga dapat membuat sub-agen dan menjalankannya secara paralel.
00:05:01Input agen juga terlihat sangat berbeda dari percakapan biasa. Grafik di sini menunjukkan distribusi panjang prompt dan penyelesaian dari eksekusi agen koding internal kami menggunakan GLM 5.2, yang kami gunakan sehari-hari.
00:05:15Ukurannya jauh lebih panjang. Ukurannya berkembang seiring berjalannya tugas karena setiap pengamatan dilampirkan kembali ke dalam konteks.
00:05:25Ada pola penting di sini. Langkah-langkah agen yang berurutan biasanya berbagi awalan (prefix) yang sangat besar.
00:05:32Jika kita menghitung ulang awalan yang sama setiap saat, kita membuang banyak komputasi untuk pekerjaan yang sudah kita lakukan.
00:05:40Jadi ini adalah salah satu peluang terbesar dalam inferensi agen.
00:05:46Lantas seberapa lapar token-kah para agen ini?
00:05:49Sekarang mari kita lihat contoh tugas berjangka panjang seperti riset mendalam (deep research).
00:05:53Kami menjelaskan kerangka kerja spec decoding di vLLM menggunakan Kilo Code dengan GLM 5.2 di Friendly AI.
00:06:02Ada beberapa tahapan dan setiap tahapan terdiri dari sub-agen yang menjalankan banyak inferensi dan pemanggilan alat.
00:06:12Sehingga ia mungkin menjalankan puluhan atau bahkan ratusan langkah inferensi, terkadang selama berturut-turut dalam menit atau jam.
00:06:19Dan konteks bersama tersebut terus berkembang sepanjang waktu.
00:06:23Bagi pengguna, yang penting bukanlah latensi dari satu token atau satu panggilan.
00:06:28Yang penting adalah kapan tugas saya selesai.
00:06:35Jadi inferensi agen bukan sekadar percakapan biasa dengan lebih banyak permintaan.
00:06:39Ini adalah masalah yang berbeda. Konteksnya terus berkembang seiring waktu.
00:06:43Pengerjaan alat diselingi di antara panggilan-panggilan model.
00:06:46Jumlah panggilan model bergantung pada input yang diberikan.
00:06:49Jadi Anda tidak bisa benar-benar merencanakan berdasarkan tingkat permintaan yang tetap.
00:06:55Dan metrik yang sebenarnya adalah latensi tugas secara end-to-end, bukan latensi dari satu permintaan tunggal.
00:07:02Lalu bagaimana kita melakukannya? Izinkan saya menunjukkan rekayasa kunci di baliknya.
00:07:23Berikut adalah peta rekayasa tentang bagaimana kami memikirkannya.
00:07:27Kami membangun tumpukan teknologi ini lapis demi lapis di sekitar beban kerja agen.
00:07:33Ada empat pilar besar yang akan saya bahas hari ini.
00:07:37Prefix caching, manajemen cache key-value (singkatnya KV), cache-aware routing, serta optimasi agent-aware.
00:07:48Dan, tentu saja, di bawahnya, kita memerlukan optimasi tingkat model seperti sparse attention untuk konteks yang panjang,
00:07:56teknik untuk mengurangi kesalahan, kernel cepat, penyajian yang tangguh, dan banyak lagi.
00:08:02Dalam presentasi ini, saya akan berfokus pada empat pilar tersebut.
00:08:05Mari kita mulai dengan prefix caching.
00:08:09Karena langkah-langkah agen berbagi prefix yang besar, kita menghitung nilai KV untuk prefix sekali saja dan menyimpannya di cache.
00:08:17Kemudian pada langkah-langkah berikutnya, kita menggunakan kembali nilai KV dari cache dan hanya memproses akhiran (suffix) baru.
00:08:23Membaca dari cache jauh lebih murah daripada menghitung ulang prefill,
00:08:27sehingga ini meningkatkan time-to-first-token dan mengurangi komputasi di setiap langkah.
00:08:33Dan semakin lama tugas berjalan pada agen, semakin berharga hal ini.
00:08:41Namun caching hanya berfungsi jika cache KV benar-benar muat dan dapat berpindah secara efisien.
00:08:48Jadi kita memerlukan manajemen cache KV yang kuat.
00:08:52Kami menggunakan manajemen memori bergaya Google untuk memuat lebih banyak konteks aktif ke dalam setiap memori GPU.
00:08:59Kami menggunakan kuantisasi KV untuk mengurangi jejak memori.
00:09:04Kami menggunakan caching hierarkis di seluruh memori GPU, memori host, dan disk, sehingga kami dapat melampaui batas GPU.
00:09:13Dan kami juga menggunakan caching terdistribusi sehingga satu prefix dapat dilayani di seluruh replika, bukan hanya di dalam satu instansi.
00:09:26Pada skala klaster global, pengarahan (routing) menjadi sangat penting.
00:09:29Penyeimbang beban sederhana mungkin membagi permintaan secara merata di seluruh klaster GPU, tetapi itu dapat merusak lokalitas cache.
00:09:38Router yang cerdas terhadap cache pada skala global melakukan hal yang lebih pintar.
00:09:42Router tersebut mengirimkan permintaan ke pod yang sudah menyimpan prefix yang tepat di cache, mengubah prefill berat menjadi hit cache sederhana.
00:09:51Di saat yang sama, ia tetap harus menyeimbangkan beban, agar satu pod tidak menjadi terlalu panas (overloaded).
00:09:58Dalam contoh ini, dua permintaan dari tugas A dikirim ke pod satu yang sama demi lokalitas cache.
00:10:08Komponen berikutnya adalah optimasi agent-aware.
00:10:11Dan ini adalah lini terdepan berikutnya dalam inferensi agen.
00:10:16Saat ini, sebagian besar sistem menjadwalkan setiap panggilan LLM seolah-olah bersifat independen.
00:10:21Sistem tidak benar-benar memahami bahwa panggilan ini adalah bagian dari program agen yang lebih panjang.
00:10:27Tetapi jika pengoptimal memahami konteks tingkat agen, ia dapat membuat keputusan yang lebih baik.
00:10:33Misalnya, menghentikan pekerjaan yang tepat (preempting), secara spekulatif mengisi konteks untuk langkah berikutnya yang mungkin terjadi, atau membuat keputusan pengosongan cache yang lebih baik berdasarkan konteks agen.
00:10:48Jadi tujuannya adalah mengurangi latensi tugas end-to-end, bukan sekadar membuat satu panggilan terlihat cepat.
00:10:58Ketika kita menggabungkan semua ini, inilah hasilnya.
00:11:01Kami menggunakan model yang sama, GLM 5.2, dengan Kilo Code untuk membuat game seluler sederhana.
00:11:07Kami menjalankan tugas yang sama dengan API model Friendly AI dan penyedia inferensi terkenal lainnya.
00:11:14Seperti yang Anda lihat, Friendly AI menyelesaikan tugas yang sama secara end-to-end dengan lebih cepat, berkat desain cloud kami yang berpusat pada agen.
00:11:24Jadi, apa yang bisa dibuka oleh hal ini dalam praktiknya?
00:11:29Tumpukan teknologi produksi agen yang lebih kuat.
00:11:32Gunakan agen yang sudah Anda sukai.
00:11:35Sekarang, hubungkan model open-weight terdepan seperti GLM 5.2, Minimax, dan Kimi yang disajikan di Friendly AI.
00:11:43Model tersebut memberi Anda kemampuan kualitas terdepan dengan nilai ekonomi yang lebih baik.
00:11:49Friendly AI memberi Anda kecepatan, keandalan, dan performa tugas end-to-end yang dibutuhkan dalam produksi.
00:11:56Kombinasi tersebut—kualitas, kecepatan, keandalan, dan biaya—itulah yang membuat agen benar-benar berguna dan ekonomis dalam produksi.
00:12:06Friendly AI saat ini mendukung tim-tim dalam tahap produksi mulai dari startup AI-native hingga perusahaan global.
00:12:15Saya ingin menyoroti beberapa di antaranya di sini.
00:12:20Kilo adalah alat koding AI agen yang sangat populer yang melayani jutaan pengguna.
00:12:27LG adalah perusahaan global yang bisnisnya berkisar dari elektronik, layanan kesehatan, hingga energi.
00:12:35Perusahaan-perusahaan yang sangat berbeda, tetapi mereka semua membutuhkan hal yang sama.
00:12:39Inferensi agen yang cepat, andal, dan hemat biaya.
00:12:45Testimoni dari klien kami, Kilo, ini menjelaskan semuanya.
00:12:50Selama setahun terakhir, Kilo Code telah menguji beberapa penyedia inferensi yang meng-host model terbuka maupun tertutup.
00:12:56Dalam pengujian terpisah dari penggunaan GLM 5 dibandingkan dengan penyedia pihak ketiga lainnya dan penggunaan langsung dari Model Lab G.AI,
00:13:05Friendly AI secara konsisten tujuh kali lebih cepat dengan tingkat kesalahan yang jauh lebih rendah.
00:13:12Hari ini, Friendly AI adalah komponen inti dari tumpukan teknologi Kilo.
00:13:17Dan Anda dapat menggunakannya sesuai dengan kebutuhan tumpukan teknologi Anda.
00:13:23API model adalah cara tercepat untuk memulai.
00:13:26Model Openweight terdepan yang dapat diakses melalui API serverless kami.
00:13:29Dedicated Endpoint memberi Anda penerapan terisolasi sendiri dengan SLA yang dijamin untuk beban kerja produksi.
00:13:36Dan BYOG, bawa GPU Anda sendiri, memungkinkan Anda menjalankan inferensi ramah lingkungan di infrastruktur Anda sendiri.
00:13:44Tumpukan teknologi yang sama, tiga cara penerapannya.
00:13:49Sebagai penutup, ada tiga hal yang perlu diingat.
00:13:53Pertama, model Openweight terdepan membuat agen produksi dapat dieskalasi secara ekonomis.
00:13:59Kedua, agen bukan sekadar percakapan biasa dengan lebih banyak panggilan.
00:14:03Inferensi agen memerlukan optimasi latensi tugas end-to-end dengan tantangan yang telah saya sebutkan.
00:14:10Ketiga, Friendly AI dibangun sebagai cloud inferensi untuk dunia tersebut.
00:14:16Inferensi agen yang cepat, andal, dan hemat biaya.
00:14:23Terima kasih telah menghadiri sesi saya.
00:14:25Jika Anda sedang membangun agen, cobalah model Openweight terdepan di Friendly AI hari ini,
00:14:30Anda dapat memulainya di Friendly AI dalam hitungan menit.
00:14:34Dan terima kasih.
00:14:35Saya akan berada di sekitar sini setelah sesi selesai.
00:14:37Terima kasih.
00:14:38Terima kasih.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video