Model Open Source Ini Memperbaiki Kelemahan Terbesar AI (ThinkingCap)
BBetter Stack
Computing/SoftwareSmall Business/Startups
Transcript
00:00:00Ini adalah pertanyaan yang sama yang diajukan ke model dasar yang sama.
00:00:03Perhatikan penghitung token di sini.
00:00:05Salah satunya menghabiskan banyak waktu untuk bernalar tentang pertanyaan tersebut,
00:00:09sementara yang satu lagi sudah menyelesaikan tugasnya.
00:00:12Dan jika kita memeriksa kedua keluaran tersebut, jawaban atas pertanyaannya pada dasarnya sama.
00:00:16Tetapi model di sebelah kanan membuang jauh lebih banyak token untuk mencapai kesimpulan yang sama.
00:00:21Dan itu cukup keren, karena satu-satunya perbedaan antara kedua model ini
00:00:24adalah model di sebelah kiri menjalankan Thinking Cap,
00:00:27versi kustom yang disempurnakan dari model yang sama,
00:00:31yang bertujuan untuk memastikan Anda mendapatkan keluaran dengan kualitas yang sama
00:00:34sambil mengorbankan lebih sedikit token dan mendapatkan jawaban Anda dua kali lebih cepat.
00:00:39Jadi dalam video hari ini, kita akan melihat Thinking Cap,
00:00:42melihat cara kerjanya, lalu kita akan mengujinya sendiri
00:00:45untuk melihat apakah ini benar-benar pendekatan baru untuk menyempurnakan model AI.
00:00:50Ini akan sangat menyenangkan, jadi mari kita langsung bahas.
00:00:57Sebelum kita membahas Thinking Cap, mari kita putar kembali waktu sejenak untuk melihat bagaimana kita bisa sampai di sini.
00:01:03Model pertama yang tersedia secara luas, GPT-3, diluncurkan kembali pada tahun 2020,
00:01:09dan pada akhir tahun 2022,
00:01:11ChatGPT memperkenalkan GPT 3.5 kepada masyarakat umum untuk pertama kalinya.
00:01:17Saat itulah hubungan kebanyakan orang dengan AI benar-benar dimulai.
00:01:21GPT-4 menyusul pada tahun 2023, yang merupakan lonjakan kemampuan lainnya,
00:01:25tetapi pada dasarnya masih memiliki gagasan yang sama.
00:01:28Prediksikan token berikutnya dan jawab segera.
00:01:31Namun kemudian, pada September 2024, OpenAI merilis o1,
00:01:37dan ini adalah model pertama yang menggunakan mode berpikir sebelum menjawab.
00:01:42Jadi alih-alih langsung mengirimkan respons,
00:01:45model ini menghabiskan waktu dan token ekstra untuk menalar masalah tersebut terlebih dahulu.
00:01:49Pergeseran arsitektur tunggal itu memulai era model penalaran.
00:01:54DeepSeek-R1 menyusul beberapa bulan kemudian
00:01:56dan membawa gagasan yang sama ke dunia sumber terbuka.
00:02:00Dan dengan cukup cepat,
00:02:01penalaran menjadi hal yang dikirimkan oleh setiap pembuat model AI utama.
00:02:05Tetapi sekarang, sedikit lebih dari setahun kemudian,
00:02:08kita mulai melihat tren sebaliknya muncul.
00:02:11Model yang disempurnakan secara khusus untuk berpikir lebih sedikit, bukan lebih banyak.
00:02:15Bisa dibilang, kita kembali ke dasar,
00:02:17hanya dengan segala sesuatu yang kita pelajari dari era penalaran yang disertakan.
00:02:21Tetapi masalahnya adalah ini.
00:02:22Pergeseran menuju pemikiran yang lebih mendalam itu memecahkan satu masalah dan diam-diam menciptakan masalah baru.
00:02:28Tidak ada seorang pun yang benar-benar mengajari model-model ini kapan harus berhenti berpikir.
00:02:31Jika Anda menanyakan sesuatu yang benar-benar sederhana kepada model penalaran,
00:02:34model itu akan tetap menghabiskan ribuan token,
00:02:37menurunkan kembali hal-hal yang sudah ditemukannya tiga kalimat lalu,
00:02:41menyatakan kembali poin yang sama dengan kata-kata yang sedikit berbeda,
00:02:44atau dalam skenario terburuk, model itu akan mulai berulang-ulang.
00:02:48Dan maksud saya itu hampir secara harfiah.
00:02:50Izinkan saya menunjukkan kepada Anda salah satu contoh paling konyol yang pernah saya temui.
00:02:54Ini adalah Claude 3.5 Flash.
00:02:56Dan ketika saya menguji model penalaran ini,
00:02:58saya hanya mengirimkan satu kata kepadanya, halo.
00:03:01Dan lihat apa yang dilakukannya dengan itu.
00:03:03Model itu menghabiskan beberapa paragraf untuk memperdebatkan apakah ia diharuskan memperkenalkan dirinya dengan nama model persisnya,
00:03:09apakah selalu menggunakan nama yang tepat saat memperkenalkan diri berarti ia harus memperkenalkan diri setiap saat atau hanya saat ia memilih untuk melakukannya.
00:03:19Kemudian ia menimbang apakah menyebutkan tanggal hari ini itu relevan.
00:03:22Dan akhirnya, setelah semua itu, ia sampai pada tanggapan yang dapat diketik oleh siapa pun di antara kita dalam waktu sekitar dua detik.
00:03:28Halo, saya Claude 3.5 Flash.
00:03:31Bagaimana saya dapat membantu Anda hari ini?
00:03:33Jadi itu bukanlah penalaran yang sesungguhnya.
00:03:35Itu adalah model yang dilatih untuk berpikir, tetapi tidak pernah dilatih untuk mengetahui kapan proses berpikir itu selesai.
00:03:41Sekarang, BottleCap AI adalah sebuah perusahaan rintisan asal Eropa yang berfokus khusus pada pembuatan inferensi yang lebih efisien.
00:03:47Dan apa yang mereka lakukan dengan Thinking Cap sejujurnya sangat cerdas.
00:03:51Jadi mereka mengambil model Qwen 2.5, versi 27 miliar parameter,
00:03:55dan mereka tidak mencoba membuatnya lebih pintar serta tidak mengajarinya keterampilan baru atau mengubah kepribadiannya ataupun menyentuh perilaku keselamatannya.
00:04:04Satu-satunya hal yang ingin mereka ubah adalah berapa banyak daya komputasi yang dihabiskannya untuk mendapatkan jawaban yang sebenarnya sudah mampu ia berikan.
00:04:11Dan itu terdengar sederhana, tetapi sebenarnya lebih sulit dari kelihatannya.
00:04:15Jadi cara malas untuk membuat model lebih cepat adalah dengan memotong penalaran begitu saja.
00:04:20Memaksanya berhenti setelah jumlah token tertentu, terlepas dari apakah ia benar-benar sudah selesai atau belum.
00:04:25Itu pasti akan mengurangi jumlah token.
00:04:27Tetapi hal itu juga akan membuat model lebih sering salah karena terkadang ia benar-benar membutuhkan langkah-langkah tambahan tersebut.
00:04:34Jadi tantangan teknik yang sesungguhnya di sini bukanlah membuatnya lebih singkat.
00:04:38Melainkan membuatnya lebih singkat tanpa secara diam-diam membuatnya menjadi lebih bodoh.
00:04:42Dan beginilah cara mereka melakukannya.
00:04:44Berawal dari pos pemeriksaan dasar model Qwen 2.5 berparameter 27 miliar,
00:04:48mereka melatihnya pada sekumpulan masalah pilihan yang mencakup berbagai domain dan tingkat kesulitan.
00:04:55Dan alih-alih memberi penghargaan kepada model karena mendapatkan jawaban yang benar,
00:04:58mereka memberinya penghargaan karena mendapatkan jawaban yang benar secara efisien.
00:05:02Karena jika sebuah model hanya diberi penghargaan atas kebenaran, menjadi bertele-tele tidak memerlukan biaya apa pun.
00:05:08Tidak ada insentif untuk berhenti berpikir lebih awal.
00:05:10Tetapi dengan secara eksplisit menghargai efisiensi di samping kebenaran,
00:05:14model tersebut belajar mengenali kapan ia sudah memiliki cukup hal untuk menetapkan suatu jawaban.
00:05:19Sebagai hasilnya, mereka mendapatkan model yang berperilaku hampir persis sama dengan model aslinya.
00:05:23Sekarang mari kita lihat angka-angkanya karena di sinilah hal itu menjadi menarik.
00:05:27Di 12 tolok ukur di luar domain, yang berarti masalah yang bukan bagian dari data pelatihan,
00:05:33Thinking Cap memangkas token pemikirannya dengan rata-rata sebesar 45,8%.
00:05:37Dan tingkat akurasinya hampir tidak berubah.
00:05:40Angka tersebut bergeser kurang dari satu persen secara rata-rata.
00:05:43Dan pada tolok ukur yang merupakan bagian dari domain pelatihan,
00:05:46pengurangan tokennya bahkan lebih besar, hampir mencapai 58%.
00:05:49Dan khusus pada GSM8K, akurasinya justru meningkat dari 93,3% menjadi 96,5%.
00:05:58Dan mereka juga melacak sesuatu yang disebut tingkat pengulangan.
00:06:00Seberapa sering sebuah model terjebak mengulang-ngulang penalaran yang sama berulang kali tanpa mencapai konvergensi,
00:06:06seperti yang baru saja kita lihat pada contoh Claude 3.5 Flash itu.
00:06:10Angka itu juga turun pada sebagian besar tolok ukur,
00:06:12yang memberi tahu kita bahwa banyak penalaran tambahan yang dilakukan model-model ini sebenarnya tidak pernah produktif.
00:06:18Itu hanyalah kebisingan yang kebetulan tampak seperti sebuah upaya.
00:06:21Baiklah, angka-angka di atas kertas adalah satu hal, tetapi mari kita uji sendiri.
00:06:26Jadi saya menjalankan pengujian ini pada mesin dengan kartu grafis RTX 5090 dan RAM 64 gigabita.
00:06:32Dan saya akan menanyakan pertanyaan yang sama kepada kedua model tersebut.
00:06:35Berapakah bilangan bulat positif terkecil n sedemikian rupa sehingga n faktorial memiliki tepat 100 angka nol di belakangnya?
00:06:42Dan untuk mendapatkan jawaban atas pertanyaan ini, model harus menggunakan rumus Legendre,
00:06:47yang dalam hal ini untuk pertanyaan tertentu akan menghasilkan jawaban 405.
00:06:51Hanya ada satu jawaban yang benar.
00:06:53Tidak ada jalan tengah.
00:06:55Jadi jika kita mendapatkan 405, maka kita tahu bahwa model telah menjawab dengan benar.
00:07:00Baiklah, pertama-tama mari kita jalankan model kuantisasi standar Qwen 2.5 dengan 27 miliar parameter
00:07:05dan lihat kinerjanya.
00:07:07Dan seperti yang bisa Anda lihat sejak awal, kecepatan tokennya tidak terlalu buruk.
00:07:12Kecepatannya rata-rata sekitar 60 token per detik.
00:07:14Tetapi lihat berapa banyak proses berpikir yang dilakukan model ini.
00:07:17Ini benar-benar konyol.
00:07:20Kita sudah melewati satu menit sekarang, dan model itu masih terus mengeluarkan token hanya untuk bagian penalaran.
00:07:26Saya harus mempercepat pratinjau di sini karena total waktunya berjalan lebih dari dua menit.
00:07:30Namun demikian, pada akhirnya, kita memang mendapatkan hasil yang benar, yaitu 405, yang bagus.
00:07:37Tetapi lihat total waktu yang berlalu.
00:07:39Waktunya adalah 140 detik.
00:07:41Dan lihat pengeluaran tokennya.
00:07:43Lebih dari 7.000 token dihabiskan hanya untuk penalaran saja, dan hanya sekitar 900 token yang benar-benar dihabiskan untuk mencetak jawabannya.
00:07:52Jadi contoh ini dengan jelas menunjukkan betapa berlebihan dan konyolnya Qwen menalar setiap permintaan.
00:07:59Sekarang mari kita beralih ke versi Thinking Cap dari model yang sama.
00:08:02Dan perlu dicatat, kita menggunakan model 27 miliar parameter yang sama dengan kuantisasi yang sama.
00:08:08Dan seperti yang bisa Anda lihat di sini, kita baru berjalan 20 detik, dan kita sudah selesai dengan penalarannya.
00:08:13Dan hanya 9 detik kemudian, kita mendapatkan jawabannya, yang dalam hal ini juga benar, yaitu 405.
00:08:19Dan lihat betapa kontras perbedaannya.
00:08:21Kita tidak hanya menghabiskan kurang dari 2.000 token secara total, di mana hanya 1.100 yang dialokasikan untuk penalaran,
00:08:30tetapi kita juga mendapatkan kecepatan token per detik yang sedikit lebih cepat yaitu 62 token per detik.
00:08:36Jadi dalam setiap metrik, model ini mengungguli model dasar Qwen 2.5 dengan telak.
00:08:42Model ini lebih cepat, lebih efisien, menghabiskan lebih sedikit token, dan memberi Anda jawaban benar yang sama.
00:08:48Jadi ini adalah peningkatan yang cukup mengesankan.
00:08:51Dan inilah detail dari laporan mereka yang harus saya sebutkan, karena ini benar-benar kecelakaan yang lucu.
00:08:57Tujuan awal mereka adalah hanya memperpendek jejak pemikiran, yaitu bagian penalaran,
00:09:02sambil menjaga jawaban akhir agar panjangnya tetap persis sama seperti sebelumnya.
00:09:06Tetapi mereka mengalami kutu (bug).
00:09:07Pengecilan itu secara tidak sengaja diterapkan pada jawaban akhir juga, bukan hanya pada pemikirannya.
00:09:12Jadi mereka memperbaiki kutu tersebut, tetapi rupanya, secara internal, semua orang justru lebih menyukai versi yang mengandung kutu itu.
00:09:18Jadi teori mereka adalah manusia merasa lelah menulis jawaban yang panjang, sehingga kita secara alami meringkas apa yang kita ucapkan.
00:09:25Dan model-model ini tidak pernah memiliki rasa lelah semacam itu yang tertanam di dalamnya hingga sekarang.
00:09:29Jadi mereka akhirnya tetap merilis versi ringkas yang rusak tersebut, dan menyimpan versi yang benar secara teknis untuk rilis di masa mendatang.
00:09:37Jadi begitu lah, teman-teman.
00:09:38Itulah inti dari Thinking Cap.
00:09:40Saya rasa kesimpulan besar dari semua ini adalah kita selalu percaya bahwa semakin banyak model berpikir, semakin cerdas mereka.
00:09:48Sedangkan Thinking Cap baru saja membuktikan bahwa hal itu tidak selalu benar.
00:09:53Begitu Anda benar-benar melatihnya, Anda bisa mendapatkan keluaran berkualitas sama dengan biaya yang jauh lebih murah, tanpa ada yang dikorbankan.
00:10:01Jika Anda ingin mencoba model ini sendiri, model ini tersedia secara gratis di Hugging Face di bawah lisensi Apache 2.0.
00:10:08Dan saya ingin mendengar pendapat kalian, teman-teman.
00:10:10Apa pendapat Anda tentang pendekatan baru ini?
00:10:12Apakah Anda melihat kelebihan atau kekurangan dari teknik ini?
00:10:15Beri tahu kami di kolom komentar di bawah ini.
00:10:17Dan, kawan-kawan, jika Anda menyukai jenis analisis teknis seperti ini, beri tahu saya dengan mengeklik tombol suka di bawah video.
00:10:23Dan juga, jangan lupa untuk berlangganan saluran kami.
00:10:26Ini adalah Andres dari BetterStack, dan sampai jumpa di video berikutnya.