Berapa lama kemampuan agen bertahan sebelum melupakan instruksi Anda? — Laurie Voss, Arize AI
AAI Engineer
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00-
00:00:12Baiklah, halo semuanya.
00:00:15Terima kasih sudah datang ke sini untuk obrolan yang seru dan berbau kutu buku ini.
00:00:20Obrolan ini punya judul yang panjang banget,
00:00:22jadi biar kuberitahu versi singkatnya di awal.
00:00:23Kamu menulis file keterampilan dan memenuhinya dengan berbagai instruksi.
00:00:27Pada titik tertentu, modelnya berhenti melacak semuanya.
00:00:31Pertanyaannya, di mana titik itu?
00:00:33Pada titik apa kamu menaruh terlalu banyak instruksi
00:00:35di dalam file keterampilanmu?
00:00:36Dan jawabannya sudah berubah drastis dalam setahun terakhir.
00:00:40Aku Laurie, Kepala Hubungan Pengembang di Arise AI.
00:00:44Di masa lalu, aku ikut mendirikan NPM Inc.
00:00:46Jadi beberapa dari kalian mungkin mengenalku dari zaman JavaScript.
00:00:48Akhir-akhir ini, aku banyak menghabiskan waktu memikirkan AI
00:00:50dan cara mengujinya.
00:00:53Beberapa bulan lalu, aku berada di konferensi AI di Miami,
00:00:55yang merupakan konferensi yang bagus.
00:00:57Dan aku sedang mendengarkan presentasi dari Dexter Horthy.
00:00:59Presentasinya bagus.
00:01:00Sama sekali tidak membahas topik ini.
00:01:02Namun saat ia memberikan presentasi itu,
00:01:04ia menyebutkan secara sepintas
00:01:06bahwa sebuah agen dapat mengikuti hingga sekitar 200 instruksi
00:01:10sebelum ia mulai melupakan instruksi-instruksi tersebut.
00:01:13Lalu ia melanjutkan presentasinya,
00:01:15dan itu benar-benar hanya sekadar sisipan.
00:01:17Dan ia menyebutkan bahwa angka itu berasal dari tahun 2025,
00:01:20jadi situasinya mungkin sudah lebih baik sekarang.
00:01:22Dan aku berhenti mendengarkan sejenak
00:01:25karena aku berpikir, 200 instruksi
00:01:27bukanlah jumlah instruksi yang banyak sama sekali, kan?
00:01:31File keterampilan yang layak akan langsung melewati 200 instruksi
00:01:33hampir seketika.
00:01:35Jika pengguna berkata X, lakukan Y,
00:01:37selalu sertakan bagian tentang Z,
00:01:39jangan pernah gunakan frasa W,
00:01:40setiap hal itu adalah instruksi yang terpisah.
00:01:42Dan jika modelnya diam-diam berhenti melacaknya setelah 200,
00:01:45itu adalah batasan yang sangat ketat
00:01:47pada kompleksitas dari apa yang bisa kamu bangun.
00:01:49Jadi aku ingin tahu dari mana dia mendapatkan angka itu terlebih dahulu,
00:01:52dan aku ingin tahu apakah itu benar.
00:01:55Jadi kalian tahu perasaan yang kumaksud.
00:01:57Kamu menulis file keterampilan yang besar dan indah,
00:01:58berhalaman-halaman aturan, kasus khusus, nada, pemformatan.
00:02:00Kamu menyerahkannya kepada agen.
00:02:01Agen itu mengerjakannya.
00:02:03Dan kamu melihat hasilnya lalu berkata,
00:02:05apakah ia benar-benar memerhatikan?
00:02:07Apakah ia benar-benar mengikuti semua aturan ini?
00:02:09Ataukah ia hanya melakukan apa yang diinginkannya
00:02:11dan memberikan tiruan yang mirip
00:02:14dari apa yang kuharapkan?
00:02:16Kamu tidak bisa benar-benar memastikannya, atau bisa?
00:02:18Pembahasan lebih lanjut nanti.
00:02:20Jadi kamu hidup dengan kecemasan tingkat rendah ini
00:02:23setiap kali kamu menekan tombol jalankan.
00:02:24Dan perasaan itulah yang menjadi fokus penelitian ini
00:02:27serta apa yang coba kita cari tahu apakah bisa dihindari.
00:02:30Jadi ini janjiku untuk 18 menit ke depan.
00:02:33Aku akan menunjukkan dari mana angka 200 itu berasal,
00:02:36apakah itu masih benar,
00:02:37dan berapa angka yang sebenarnya hari ini,
00:02:39karena angkanya telah bergeser sejauh satu orde besaran.
00:02:41Dan kemudian kita akan membahas apa artinya itu
00:02:44untuk kalian bawa pulang.
00:02:46Seberapa panjang keterampilan dan prompt Anda sebenarnya bisa dibuat,
00:02:49serta perubahan apa yang harus Anda lakukan
00:02:51pada alur kerja Anda sebagai hasilnya.
00:02:54Jadi angka 200 bukanlah sekadar cerita rakyat.
00:02:57Angka itu berasal dari tolok ukur nyata bernama IfScale,
00:02:59dari sebuah makalah oleh seseorang yang namanya akan salah kuucapkan,
00:03:03Jaroslawicz, bersama para rekan penulisnya tahun lalu.
00:03:06Dan pengujiannya sangat sederhana.
00:03:10Beginilah cara kerja IfScale.
00:03:12Anda meminta model untuk menulis laporan bisnis,
00:03:14dan Anda memberinya daftar kata-kata spesifik
00:03:16yang harus disertakan secara tepat di dalam laporan tersebut.
00:03:19Sertakan kata persis pelanggan,
00:03:20sertakan kata persis pendapatan,
00:03:22dan seterusnya sebanyak kata yang Anda inginkan.
00:03:24Setiap kata tersebut adalah instruksi yang harus dipatuhinya.
00:03:27Dan kemudian Anda menghitung berapa banyak kata pasti itu yang muncul.
00:03:32Jadi karena pengujiannya begitu sederhana,
00:03:34Anda hanya perlu mengingat dua angka.
00:03:36Pertama adalah kepadatan, yang kita sebut n.
00:03:38Itu adalah berapa banyak aturan yang kita bicarakan sekaligus.
00:03:41Dan yang kedua adalah akurasi,
00:03:42yaitu persentase dari aturan-aturan tersebut
00:03:43yang benar-benar dapat diikutinya.
00:03:46Sekarang Anda mungkin berkata bahwa menyertakan kata acak dalam laporan
00:03:50tidak sama dengan mengikuti instruksi sungguhan,
00:03:52dan itu cukup masuk akal, dan kita akan membahasnya.
00:03:55Tetapi kata kunci hanyalah sebuah proksi.
00:03:57Menyertakan kata pendapatan memiliki bentuk tugas yang sama
00:04:01seperti menyertakan bagian tentang penetapan harga, bukan?
00:04:02Atau jangan pernah gunakan frasa ini.
00:04:04Itu adalah batasan terpisah yang diberi nama
00:04:06yang telah Anda beritahukan kepada agen untuk dipatuhi.
00:04:09Jika sebuah model tidak dapat melacak 200 kata dalam satu prompt,
00:04:11ia pasti akan kesulitan
00:04:13dengan 200 instruksi yang lebih rumit.
00:04:16Jadi kalaupun ada, kinerjanya akan lebih buruk.
00:04:20Jadi angka ini adalah batas maksimal.
00:04:22Angka ini adalah batas tertinggi yang bisa Anda capai.
00:04:23Jika Anda memberinya instruksi yang lebih rumit,
00:04:25angkanya kemungkinan besar akan semakin turun.
00:04:27Dan 200 adalah batas maksimal yang sangat rendah.
00:04:30Jadi sebelum mengejar model-model baru,
00:04:32Anda harus melakukan sains yang baik,
00:04:33yang berarti Anda harus mereplikasi hasil yang lama
00:04:36dan memastikan bahwa batas 200 itu benar.
00:04:39Jadi aku menjalankan ulang tolok ukur aslinya.
00:04:42Makalah aslinya menguji sekumpulan model,
00:04:45dan model-model lahir serta mati dengan sangat cepat.
00:04:47Sehingga pada saat aku sempat melakukan pengujian ini,
00:04:50hanya tiga dari model dalam kumpulan asli
00:04:52dari 10 model yang mereka gunakan
00:04:54yang masih tersedia melalui jenis API apa pun.
00:04:57Model-model itu adalah GPT 4.1, Claude Sonnet 4,
00:04:59dan Gemini 2.5 Pro.
00:05:01Itu adalah model-model yang tersedia 12 bulan lalu,
00:05:03yang masih tersedia sekarang.
00:05:05Dan itulah mengapa kami menguji ketiga model tersebut,
00:05:07karena itulah yang tersisa.
00:05:08Dan sejak pertama kali aku mempublikasikan penelitian ini
00:05:11beberapa minggu lalu,
00:05:12satu dari ketiga model tersebut telah dipensiunkan.
00:05:14Jadi ini adalah waktu terakhir yang memungkinkan
00:05:16bagiku untuk menjalankan pengujian ini.
00:05:17Jadi dari jajaran itu, kita sekarang tinggal menyisakan dua.
00:05:20Makanya, jangan terlalu terikat dengan model-model Anda.
00:05:22Jadi ini adalah hasil yang kami dapatkan saat mereplikasi
00:05:25temuan if scale yang asli.
00:05:27Yaitu akurasi pada sumbu vertikal.
00:05:29Jadi itu dimulai dari 100% dan mulai menurun.
00:05:32Dan kemudian jumlah aturan berjalan ke atas di sepanjang bagian bawah
00:05:35pada skala logaritmik.
00:05:36Jadi setiap kali mencapai setengah jalan,
00:05:37jumlah aturan yang ditanganinya telah berlipat ganda.
00:05:42Jadi pada 500 aturan, Anda kehilangan 30, 40, 50% darinya.
00:05:46Kurva kami cocok dengan hasil pada makalah asli
00:05:49dalam batas derau, jadi temuan itu nyata.
00:05:52Setahun yang lalu, di sekitar 200 hingga 300 aturan,
00:05:55model-model mutakhir mulai berantakan.
00:05:57Itu adalah batas yang sangat rendah.
00:06:00Jadi itulah garis dasar kita, dan sekarang tibalah bagian yang seru
00:06:03ketika kita mengambil tes yang persis sama
00:06:05dan mengarahkannya ke batas kemampuan saat ini,
00:06:07atau lebih tepatnya, apa yang menjadi batas saat itu
00:06:09ketika saya menjalankan tes ini.
00:06:10Jadi saya menjalankan GPT 5.5, Claude Opus 4.7,
00:06:13karena 4.8 rilis seminggu setelah saya menjalankan tes ini,
00:06:17Gemini 3.1 Pro, dan Deep Seek V4 Pro.
00:06:20Jadi saya memberi mereka prompt yang sama, kata-kata yang sama,
00:06:22semuanya sama, dan saya langsung menghadapi masalah,
00:06:25yaitu mereka berhasil melakukannya dengan sempurna.
00:06:27Mereka semua langsung mendapat nilai 100% pada tes ini,
00:06:30benar-benar tanpa bug.
00:06:34Jadi kita telah membuat tes untuk menemukan batas atasnya,
00:06:36dan model-model tersebut menembus batas itu begitu saja
00:06:37tanpa menyadari bahwa batas itu ada.
00:06:40Dan itu adalah masalah, karena tolok ukur tersebut
00:06:42ditulis untuk mencapai puncaknya pada 500 kata,
00:06:43jadi saya harus mengubah tolok ukurnya
00:06:45agar dapat menemukan batas atas yang baru.
00:06:47Jadi saya menggeser targetnya, saya memberikan lebih banyak kata untuk disertakan.
00:06:50Saya melipatgandakannya dari 500 menjadi 1.000,
00:06:52saya melipatgandakannya lagi dari 1.000 menjadi 2.000,
00:06:55dan saya terus melakukannya sampai mencapai kosakata
00:06:5610.000 kata, dan di situlah saya mulai menemukan batas kemampuan
00:07:00dari apa yang dapat dilakukan model saat ini.
00:07:03Jadi izinkan saya menampilkan, ini adalah slide utamanya,
00:07:06ini adalah hasilnya.
00:07:07Ingat, skala logaritmik pada sumbu x di sana.
00:07:12Jadi naik dari 500 ke 1.000 ke 5.000 ke 10.000.
00:07:16Jadi tampaknya skala itu jatuh dari tebing,
00:07:18padahal itu sebenarnya terjadi dalam rentang sekitar 1.000 angka.
00:07:20Namun lihat seberapa jauh ke kanan kurva baru ini bergeser
00:07:25sebelum mereka melengkung.
00:07:26Setahun yang lalu, mereka mulai gagal pada 200 hingga 300 instruksi,
00:07:29dan sekarang, tergantung pada modelnya, batasannya mendekati 2.000,
00:07:32dan untuk yang terbaik, mencapai hingga 5.000 instruksi
00:07:36sebelum mereka mulai jatuh dari tebing.
00:07:38Jadi dalam waktu sekitar 12 bulan, model mutakhir menjadi hampir 10 kali
00:07:41lebih baik dalam mengikuti instruksi secara bersamaan.
00:07:44Itulah temuan utamanya, dan ada banyak nuansa
00:07:47yang perlu kita bahas.
00:07:49Kapasitas untuk melacak 2.000 batasan bernama dalam satu prompt
00:07:53kini sudah ada.
00:07:55Dan itu sangat menarik karena saya pikir,
00:07:57saya tidak tahu apakah orang lain merasakan hal yang sama,
00:07:59tetapi rasanya bagi saya seperti lompatan dari, Anda tahu,
00:08:04GPT 5.1 ke GPT 5.5 agak bersifat inkremental, bukan?
00:08:07Rasanya kita tidak menjadi 10 kali lipat lebih baik,
00:08:09tetapi ini adalah tes yang benar-benar penting untuk hal yang sangat praktis,
00:08:14seperti seberapa panjang file keterampilan saya nantinya?
00:08:17Dan dalam kurun waktu setahun, kita menjadi 10 kali lipat lebih baik.
00:08:21Dan hal yang membuat saya takjub adalah tolok ukur ini
00:08:23usianya hampir satu tahun.
00:08:25Setahun kemudian, 500 hanyalah galat pembulatan,
00:08:27dan ini terus bergerak di bawah kaki saya.
00:08:29Saya menguji 4.7, Opus 4.8 bahkan lebih baik lagi.
00:08:35Jadi grafik ini sudah sedikit kedaluwarsa,
00:08:36yang justru merupakan inti dari semuanya.
00:08:37Jika Anda menetapkan asumsi teknik Anda
00:08:39tentang bagaimana file keterampilan seharusnya bekerja,
00:08:41tentang seberapa panjang prompt Anda,
00:08:44dan Anda melakukannya lebih dari sekitar enam bulan lalu,
00:08:46maka Anda sekarang sudah keliru,
00:08:48dan Anda mungkin harus merancang ulang cara kerja Anda.
00:08:52Namun ada hal lain dari cerita ini
00:08:54karena cara model-model tersebut gagal
00:08:59berubah secara drastis
00:09:00dan cara mereka gagal itu sangat penting.
00:09:02Bagian ini adalah temuan yang sama sekali tak terduga
00:09:06ketika saya mulai menjalankan eksperimen tersebut.
00:09:07Dan itu sempat mengacaukan tes saya pada mulanya
00:09:10karena mode kegagalan yang lama itu membosankan.
00:09:13Mereka hanya melupakan instruksi
00:09:14dan saya bisa mengukur berapa banyak instruksi
00:09:16yang mereka ingat atau lupakan.
00:09:17Tetapi model yang baru berantakan dengan cara mereka sendiri yang aneh,
00:09:20yang sangat khas.
00:09:22Jadi izinkan saya memperkenalkan bagaimana keempat model ini gagal.
00:09:26Deep Seek 4 adalah model tradisional.
00:09:29Ia hanya melupakan berbagai hal.
00:09:30Tidak ada drama apa pun.
00:09:31Ia mulai melupakan instruksi sekitar 750 aturan,
00:09:35dan pada 2.000 aturan, ia membuang hampir separuhnya.
00:09:38Jadi ia hanya lupa, yang sejujurnya merupakan mode kegagalan
00:09:41yang paling saya percaya karena dapat diprediksi.
00:09:43Sangat mudah untuk diukur.
00:09:44Dan model-model lainnya tidak begitu kooperatif.
00:09:48Opus 4.7 akan memutuskan secara berulang kali
00:09:52bahwa tes tersebut berbahaya.
00:09:54Dan apa yang dilakukannya adalah menolak
00:09:57pada tingkat API untuk menyelesaikan tes tersebut.
00:09:59Saya tidak tahu ada respons API
00:10:01yang bisa Anda dapatkan dari Claude yang isinya seperti,
00:10:03tidak, saya bisa melakukan ini, tapi saya tidak mau.
00:10:06Tapi itu jelas merupakan respons tingkat API
00:10:09yang didukung oleh Claude karena mereka sangat peduli
00:10:10tentang keselamatan, dan saya mulai mendapatkan respons itu
00:10:13sepanjang waktu.
00:10:15Dan alasan hal itu terjadi
00:10:16adalah karena Claude memiliki pengklasifikasi keamanan yang sangat sensitif.
00:10:19Dan jika Anda memasukkan kombinasi kata tertentu,
00:10:22seperti katakanlah antraks dan sianida,
00:10:24ia memutuskan bahwa seluruh permintaan itu berbahaya
00:10:26dan langsung membatalkannya.
00:10:27Dan jika Anda ingat apa yang dilakukan tes saya,
00:10:29tes saya melemparkan 5.000 hingga 10.000 kata acak
00:10:33ke dalam file instruksi.
00:10:35Oleh karena itu, kata-kata yang saya pilih secara acak mengandung
00:10:38berbagai macam hal yang tampak berbahaya
00:10:39jika dikombinasikan menurut filter keamanan.
00:10:41Dan akibatnya ia terus membatalkan dengan dalih saya meminta
00:10:43membuat bom atau semacamnya.
00:10:47Jadi kami harus, agar Claude mau bekerja sama,
00:10:52saya harus mengambil semua kata saya
00:10:54dan menjalankannya melalui filter keamanan OpenAI
00:10:56serta menyaring semua kata yang tampak bermasalah
00:10:58agar ia bisa memprosesnya sampai tuntas.
00:10:59Begitu saya memberikannya, Claude melakukannya dengan sangat baik.
00:11:03Namun mode kegagalannya adalah Claude lebih mungkin
00:11:05memutuskan bahwa apa yang Anda lakukan berbahaya sejak awal,
00:11:08bahkan pada 200 atau 300 instruksi sekalipun
00:11:11jika apa yang Anda kerjakan, Anda tahu,
00:11:13mengandung hal apa pun yang berkaitan dengan saran medis
00:11:15karena masalah medis sering kali memiliki kegunaan ganda.
00:11:17Bisa berbahaya, bisa pula aman.
00:11:20Jadi mode kegagalan yang ketiga adalah Gemini 3.1 Pro.
00:11:24Gemini sangat tangguh sepenuhnya sampai 5.000 instruksi.
00:11:28Ia bekerja dengan sangat baik.
00:11:30Benar-benar salah satu yang terbaik pada grafik tersebut.
00:11:32Dan melewati itu, semuanya menjadi aneh.
00:11:35Ia tidak melupakan instruksinya.
00:11:37Ia merasa kewalahan oleh instruksi tersebut.
00:11:39Apa yang dilakukannya adalah ia menggunakan token penalaran
00:11:44untuk memastikan bahwa ia mengikuti
00:11:45semua instruksi secara bersamaan.
00:11:46Dan ketika jumlah instruksi menjadi sangat banyak,
00:11:48it uses all of its thinking tokens.
00:11:50It uses its entire token budget thinking
00:11:53and then it doesn't give any output.
00:11:55It's, it gets to like nine, you know,
00:11:57if you've given it 10,000 tokens worth,
00:11:59it'll get 9,500 tokens worth of thinking
00:12:02and then give you a 500 word response,
00:12:04which doesn't contain any of the tokens.
00:12:07So it thinks itself into a corner
00:12:09and runs out of room to actually answer,
00:12:10which is very expensive and totally unhelpful,
00:12:13which is kind of on brand, isn't it?
00:12:19Which, you know, I would never say that out loud.
00:12:23And finally comes the winner, which is GPT 5.5.
00:12:26GPT 5.5 is the best of the lot, 99% accuracy,
00:12:29all the way out to 5,000 rules.
00:12:32But if you push it far enough,
00:12:33it is by far the weirdest of the bunch.
00:12:35Because it doesn't refuse outright,
00:12:37it doesn't silently forget.
00:12:38Instead, what it does is it gets frustrated
00:12:41and tells you that the test is stupid.
00:12:45It starts the report, it gets a few,
00:12:47like that's the thing,
00:12:48it doesn't start out just saying no.
00:12:50It starts the report,
00:12:51it starts writing the report,
00:12:52and like 500 words into the report,
00:12:54it's like, no, this is dumb.
00:12:55I'm not gonna do this.
00:12:56And then it politely tells you this is dumb.
00:12:58I'm not going to do this anymore.
00:13:00That is the actual response that it gave me.
00:13:02But that was like 5,000 words into this business report
00:13:05that I told it to generate.
00:13:08So it's not wrong, right?
00:13:10I was asking for a coherent business report
00:13:12that on no particular subject
00:13:14that contains 5,000 random words.
00:13:17You're right, GPT.
00:13:19This is a stupid thing to ask for.
00:13:23Which is a deeply unreasonable request,
00:13:25and GPT called this out on it.
00:13:27But it still counts as a failure in the test.
00:13:29Because the half-finished report that it gives you
00:13:31is missing most of the keywords,
00:13:32and it is also the hardest one to detect.
00:13:35Because Claude bails immediately.
00:13:36Claude says, no,
00:13:37I'm not going to do this.
00:13:39Deep Seek does its best.
00:13:41But GPT does what looks like a good job,
00:13:44unless you read all the way to the end of the report,
00:13:46where it says, no, actually,
00:13:47I'm going to bail because this is stupid.
00:13:51So if you step back and look at the four together,
00:13:53Deep Seek quietly forgets.
00:13:54Claude gets scared and refuses.
00:13:56Gemini overthinks itself into silence.
00:13:58And GPT 5.5 finishes half of the job,
00:14:00and tells you that the rest of it is beneath it.
00:14:04And the point isn't which one of these is funniest.
00:14:07Although it is genuinely a little funny.
00:14:09The point is that, did it follow my instructions,
00:14:12no longer has one failure mode.
00:14:14It has four different ways that it can fail.
00:14:16And you can't recognize that failure unless you know
00:14:19which model you're dealing with and what its pattern of failure is going to be.
00:14:23So the models got 10x better.
00:14:27They fail in funny ways.
00:14:29Why should you care when you get back to your desk?
00:14:31Because three things have changed to your workflow.
00:14:34The first is that a year ago, the smart move was to keep every skills file very, very short.
00:14:39Under 200 instructions, then point off to sub-skills and a whole Byzantine labyrinth of additional skills files and sub-files and things like that.
00:14:50And you are compressing your instructions to fit into a very small available space and you don't need to do that anymore.
00:14:57Your skills files can be very long.
00:14:59Number two is that if your use case needs a hundred specific rules or 300, you can just put them all in the prompt.
00:15:06You don't have to lie awake wondering which ones the model silently ignored.
00:15:12And if you've been thinking about your own lived experience of using models, you probably recognize this.
00:15:21You've discovered that you've got less worried about how long your prompt is going to get, because the models have genuinely got 10x better at following your prompts.
00:15:322,000 named constraints is an entire style guide, right?
00:15:35It's every brand rule, every legal disclaimer.
00:15:38A year ago, you'd have had to shard that across a dozen specialized agents and hope that your specialized agents are handing off to each other cleanly.
00:15:46But now you can ignore that.
00:15:48But the third thing is the big one.
00:15:50The question used to be, can the model even do this?
00:15:53And the answer is now firmly yes.
00:15:55Well, reasonably firmly.
00:15:58Is it worth the cost is the new question.
00:16:01Because you can include 10,000 words of -- sorry, 10,000 different instructions into your prompt, but that is going to be an enormous prompt.
00:16:07It's going to be a very expensive prompt.
00:16:09It's going to be a very slow prompt.
00:16:10So what used to be a hard wall that you would run against has now become a soft trade-off of, is it worth me adding all of these extra instructions if it's going to give me more cost and more latency?
00:16:19And now, some caveats to head off the Q&A.
00:16:25First and most important, I mentioned this earlier, this is a proxy task, including random words in a fake business report, is evidence that long-skills file works.
00:16:38It is not the same as proof that a long-skills file works.
00:16:41Also, the models hit the wall at wildly different points, anywhere from 750 to 9,000-plus, so you have to pick your model very carefully.
00:16:49What our test doesn't do is measure whether the model reasoned clearly over a giant prompt.
00:16:57So, the good news is since I did my research several weeks ago, a whole bunch of people have piled in on this, and now there's good research.
00:17:05Actual scientists have got involved and done -- Chroma has done context rot work across 18 models, showing that accuracy on long inputs can fall 30 to 50 percent well before you hit the context window limit.
00:17:21And the weird part of their finding was that coherent, well-structured text is more likely to hit that failure mode than if you just put your instructions into a random order and shuffle them in.
00:17:33I don't know why that's the case, I'd have to read their report.
00:17:37So, the model can track 2,000, 5,000, possibly 10,000 instructions, but it's not necessarily going to reason clearly over them.
00:17:46It's not necessarily -- if those instructions conflict, if there is tension between them, it's not necessarily going to get that right.
00:17:53And then there's the other one I mentioned briefly.
00:17:56Claude's refusals are annoying, but they are loud.
00:18:00You get an error, you know it failed.
00:18:02GPT's polite half-finished report is much more dangerous because it looks like a real answer.
00:18:07You have to read the whole thing to notice that it gave up quietly halfway, which means that you can't trust the output.
00:18:13It means you have to read the output every single time to make sure whether or not it's working.
00:18:17So, the model will accept your 2,000 rules and it will hand you back something that looks, at least to begin with, confident and polished, but could be bailing out halfway through.
00:18:30So, as an aside, people always ask me how much did all of this cost me.
00:18:34It cost me $209 to run all of these queries.
00:18:372,300 calls across seven models came to $209.
00:18:43It turns out novel research doesn't cost very much.
00:18:46And this is the part of the talk where I was saying that you have to check this stuff in production because you can't trust that your model isn't going to silently fail.
00:18:55So, you knew I was going to mention evals eventually because I work at Arise and this is where I do that.
00:19:01But there are plenty of plugs for Arise.
00:19:03So, I'm just going to say one true thing, which is that if you are building a real AI application and you are giving it genuinely tricky tasks,
00:19:10you are going to run into one or more of these failure modes with a Frontier model.
00:19:14And unless it's Claude telling you just to fuck off at the API level, the only way to know that something went wrong is monitoring your outputs with another LLM.
00:19:23That is an eval and that is what Arise does and I'll leave it at that.
00:19:27I already mentioned that there's been new research since we did our own.
00:19:30Here's another important one.
00:19:31A paper landed testing 46 models called Revisiting the Reliability of Language Models in Instruction Following,
00:19:37which you can bet made my ears perk up after I did that research myself.
00:19:41And they found something uncomfortable, which is that a model can ace a benchmark like ours and still be wildly unreliable.
00:19:47Because if you reword the same instruction in a slightly different way, it can make a radical difference to how well it follows those instructions.
00:19:56So the model can follow 2,000 instructions and it can do it really well.
00:20:00But if you put the same instructions, the same 2,000 instructions in a different order, it can suddenly make the model much worse at following those instructions.
00:20:08And how exactly to do that, what is the correct order of instructions to give your model such that it follows them perfectly as opposed to getting confused is still research that is being done.
00:20:19So capacity went up, but reliability is still a problem.
00:20:24And then this is just a little brag because I was happy about it, like I'm not a scientist, I did some research.
00:20:31And then a whole bunch of other actual scientists piled in and did real science on the same question.
00:20:36There's now a whole bunch of benchmarks that have shown up to measure this same question.
00:20:40Firebench, CCRbench, Guidebench are all trying to measure the same thing.
00:20:44How well models follow a lot of real, messy constraints at once.
00:20:49And now the whole field is looking at it, so if you want better science than my, you know, 10,000 random words, the real science exists now.
00:20:58So that gets me to where I will leave you.
00:21:00A year ago, the hard part of writing a skill was fitting everything in without the model losing the plot.
00:21:05That was a compression problem and the compression problem is gone.
00:21:08The model will hold your 2,000 instructions just fine.
00:21:11The new hard part is knowing whether it actually did what you said, and that is a verification problem.
00:21:16A verification problem doesn't get solved by writing a better prompt.
00:21:20It gets solved by checking the output every time the same way that you would test any other code, which is to say an eval.
00:21:26The ceiling moved by 10x in one year.
00:21:29So go back and check the assumptions that you made six months ago about how big your prompts should be, how big your instructions can get, because they might already be wrong.
00:21:41So that is the talk.
00:21:42If you want all of the code and all of the data, it is at this GitHub URL.
00:21:48And this other QR code is something marketing made me insert.
00:21:51We are having a World Cup watch party tonight at 5:00 p.m.
00:21:55You can come to our party.
00:21:56That link is to the Luma that will get you into the party.
00:22:01I hope this talk has given you some novel information or at least a couple of laughs, and thank you so much for your time and attention.
00:22:07Thank you.
00:22:08Thank you."
}
]
target_segments = [item for item in data if 284 <= item["index"] <= 439]
print(f
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기