Model Open Source Ini Memperbaiki Kelemahan Terbesar AI (ThinkingCap)

BBetter Stack
Computing/SoftwareSmall Business/Startups

Transcript

00:00:00Ini adalah pertanyaan yang sama yang diajukan ke model dasar yang sama.
00:00:03Perhatikan penghitung token di sini.
00:00:05Salah satunya menghabiskan banyak waktu untuk bernalar tentang pertanyaan tersebut,
00:00:09sementara yang satu lagi sudah menyelesaikan tugasnya.
00:00:12Dan jika kita memeriksa kedua keluaran tersebut, jawaban atas pertanyaannya pada dasarnya sama.
00:00:16Tetapi model di sebelah kanan membuang jauh lebih banyak token untuk mencapai kesimpulan yang sama.
00:00:21Dan itu cukup keren, karena satu-satunya perbedaan antara kedua model ini
00:00:24adalah model di sebelah kiri menjalankan Thinking Cap,
00:00:27versi kustom yang disempurnakan dari model yang sama,
00:00:31yang bertujuan untuk memastikan Anda mendapatkan keluaran dengan kualitas yang sama
00:00:34sambil mengorbankan lebih sedikit token dan mendapatkan jawaban Anda dua kali lebih cepat.
00:00:39Jadi dalam video hari ini, kita akan melihat Thinking Cap,
00:00:42melihat cara kerjanya, lalu kita akan mengujinya sendiri
00:00:45untuk melihat apakah ini benar-benar pendekatan baru untuk menyempurnakan model AI.
00:00:50Ini akan sangat menyenangkan, jadi mari kita langsung bahas.
00:00:57Sebelum kita membahas Thinking Cap, mari kita putar kembali waktu sejenak untuk melihat bagaimana kita bisa sampai di sini.
00:01:03Model pertama yang tersedia secara luas, GPT-3, diluncurkan kembali pada tahun 2020,
00:01:09dan pada akhir tahun 2022,
00:01:11ChatGPT memperkenalkan GPT 3.5 kepada masyarakat umum untuk pertama kalinya.
00:01:17Saat itulah hubungan kebanyakan orang dengan AI benar-benar dimulai.
00:01:21GPT-4 menyusul pada tahun 2023, yang merupakan lonjakan kemampuan lainnya,
00:01:25tetapi pada dasarnya masih memiliki gagasan yang sama.
00:01:28Prediksikan token berikutnya dan jawab segera.
00:01:31Namun kemudian, pada September 2024, OpenAI merilis o1,
00:01:37dan ini adalah model pertama yang menggunakan mode berpikir sebelum menjawab.
00:01:42Jadi alih-alih langsung mengirimkan respons,
00:01:45model ini menghabiskan waktu dan token ekstra untuk menalar masalah tersebut terlebih dahulu.
00:01:49Pergeseran arsitektur tunggal itu memulai era model penalaran.
00:01:54DeepSeek-R1 menyusul beberapa bulan kemudian
00:01:56dan membawa gagasan yang sama ke dunia sumber terbuka.
00:02:00Dan dengan cukup cepat,
00:02:01penalaran menjadi hal yang dikirimkan oleh setiap pembuat model AI utama.
00:02:05Tetapi sekarang, sedikit lebih dari setahun kemudian,
00:02:08kita mulai melihat tren sebaliknya muncul.
00:02:11Model yang disempurnakan secara khusus untuk berpikir lebih sedikit, bukan lebih banyak.
00:02:15Bisa dibilang, kita kembali ke dasar,
00:02:17hanya dengan segala sesuatu yang kita pelajari dari era penalaran yang disertakan.
00:02:21Tetapi masalahnya adalah ini.
00:02:22Pergeseran menuju pemikiran yang lebih mendalam itu memecahkan satu masalah dan diam-diam menciptakan masalah baru.
00:02:28Tidak ada seorang pun yang benar-benar mengajari model-model ini kapan harus berhenti berpikir.
00:02:31Jika Anda menanyakan sesuatu yang benar-benar sederhana kepada model penalaran,
00:02:34model itu akan tetap menghabiskan ribuan token,
00:02:37menurunkan kembali hal-hal yang sudah ditemukannya tiga kalimat lalu,
00:02:41menyatakan kembali poin yang sama dengan kata-kata yang sedikit berbeda,
00:02:44atau dalam skenario terburuk, model itu akan mulai berulang-ulang.
00:02:48Dan maksud saya itu hampir secara harfiah.
00:02:50Izinkan saya menunjukkan kepada Anda salah satu contoh paling konyol yang pernah saya temui.
00:02:54Ini adalah Claude 3.5 Flash.
00:02:56Dan ketika saya menguji model penalaran ini,
00:02:58saya hanya mengirimkan satu kata kepadanya, halo.
00:03:01Dan lihat apa yang dilakukannya dengan itu.
00:03:03Model itu menghabiskan beberapa paragraf untuk memperdebatkan apakah ia diharuskan memperkenalkan dirinya dengan nama model persisnya,
00:03:09apakah selalu menggunakan nama yang tepat saat memperkenalkan diri berarti ia harus memperkenalkan diri setiap saat atau hanya saat ia memilih untuk melakukannya.
00:03:19Kemudian ia menimbang apakah menyebutkan tanggal hari ini itu relevan.
00:03:22Dan akhirnya, setelah semua itu, ia sampai pada tanggapan yang dapat diketik oleh siapa pun di antara kita dalam waktu sekitar dua detik.
00:03:28Halo, saya Claude 3.5 Flash.
00:03:31Bagaimana saya dapat membantu Anda hari ini?
00:03:33Jadi itu bukanlah penalaran yang sesungguhnya.
00:03:35Itu adalah model yang dilatih untuk berpikir, tetapi tidak pernah dilatih untuk mengetahui kapan proses berpikir itu selesai.
00:03:41Sekarang, BottleCap AI adalah sebuah perusahaan rintisan asal Eropa yang berfokus khusus pada pembuatan inferensi yang lebih efisien.
00:03:47Dan apa yang mereka lakukan dengan Thinking Cap sejujurnya sangat cerdas.
00:03:51Jadi mereka mengambil model Qwen 2.5, versi 27 miliar parameter,
00:03:55dan mereka tidak mencoba membuatnya lebih pintar serta tidak mengajarinya keterampilan baru atau mengubah kepribadiannya ataupun menyentuh perilaku keselamatannya.
00:04:04Satu-satunya hal yang ingin mereka ubah adalah berapa banyak daya komputasi yang dihabiskannya untuk mendapatkan jawaban yang sebenarnya sudah mampu ia berikan.
00:04:11Dan itu terdengar sederhana, tetapi sebenarnya lebih sulit dari kelihatannya.
00:04:15Jadi cara malas untuk membuat model lebih cepat adalah dengan memotong penalaran begitu saja.
00:04:20Memaksanya berhenti setelah jumlah token tertentu, terlepas dari apakah ia benar-benar sudah selesai atau belum.
00:04:25Itu pasti akan mengurangi jumlah token.
00:04:27Tetapi hal itu juga akan membuat model lebih sering salah karena terkadang ia benar-benar membutuhkan langkah-langkah tambahan tersebut.
00:04:34Jadi tantangan teknik yang sesungguhnya di sini bukanlah membuatnya lebih singkat.
00:04:38Melainkan membuatnya lebih singkat tanpa secara diam-diam membuatnya menjadi lebih bodoh.
00:04:42Dan beginilah cara mereka melakukannya.
00:04:44Berawal dari pos pemeriksaan dasar model Qwen 2.5 berparameter 27 miliar,
00:04:48mereka melatihnya pada sekumpulan masalah pilihan yang mencakup berbagai domain dan tingkat kesulitan.
00:04:55Dan alih-alih memberi penghargaan kepada model karena mendapatkan jawaban yang benar,
00:04:58mereka memberinya penghargaan karena mendapatkan jawaban yang benar secara efisien.
00:05:02Karena jika sebuah model hanya diberi penghargaan atas kebenaran, menjadi bertele-tele tidak memerlukan biaya apa pun.
00:05:08Tidak ada insentif untuk berhenti berpikir lebih awal.
00:05:10Tetapi dengan secara eksplisit menghargai efisiensi di samping kebenaran,
00:05:14model tersebut belajar mengenali kapan ia sudah memiliki cukup hal untuk menetapkan suatu jawaban.
00:05:19Sebagai hasilnya, mereka mendapatkan model yang berperilaku hampir persis sama dengan model aslinya.
00:05:23Sekarang mari kita lihat angka-angkanya karena di sinilah hal itu menjadi menarik.
00:05:27Di 12 tolok ukur di luar domain, yang berarti masalah yang bukan bagian dari data pelatihan,
00:05:33Thinking Cap memangkas token pemikirannya dengan rata-rata sebesar 45,8%.
00:05:37Dan tingkat akurasinya hampir tidak berubah.
00:05:40Angka tersebut bergeser kurang dari satu persen secara rata-rata.
00:05:43Dan pada tolok ukur yang merupakan bagian dari domain pelatihan,
00:05:46pengurangan tokennya bahkan lebih besar, hampir mencapai 58%.
00:05:49Dan khusus pada GSM8K, akurasinya justru meningkat dari 93,3% menjadi 96,5%.
00:05:58Dan mereka juga melacak sesuatu yang disebut tingkat pengulangan.
00:06:00Seberapa sering sebuah model terjebak mengulang-ngulang penalaran yang sama berulang kali tanpa mencapai konvergensi,
00:06:06seperti yang baru saja kita lihat pada contoh Claude 3.5 Flash itu.
00:06:10Angka itu juga turun pada sebagian besar tolok ukur,
00:06:12yang memberi tahu kita bahwa banyak penalaran tambahan yang dilakukan model-model ini sebenarnya tidak pernah produktif.
00:06:18Itu hanyalah kebisingan yang kebetulan tampak seperti sebuah upaya.
00:06:21Baiklah, angka-angka di atas kertas adalah satu hal, tetapi mari kita uji sendiri.
00:06:26Jadi saya menjalankan pengujian ini pada mesin dengan kartu grafis RTX 5090 dan RAM 64 gigabita.
00:06:32Dan saya akan menanyakan pertanyaan yang sama kepada kedua model tersebut.
00:06:35Berapakah bilangan bulat positif terkecil n sedemikian rupa sehingga n faktorial memiliki tepat 100 angka nol di belakangnya?
00:06:42Dan untuk mendapatkan jawaban atas pertanyaan ini, model harus menggunakan rumus Legendre,
00:06:47yang dalam hal ini untuk pertanyaan tertentu akan menghasilkan jawaban 405.
00:06:51Hanya ada satu jawaban yang benar.
00:06:53Tidak ada jalan tengah.
00:06:55Jadi jika kita mendapatkan 405, maka kita tahu bahwa model telah menjawab dengan benar.
00:07:00Baiklah, pertama-tama mari kita jalankan model kuantisasi standar Qwen 2.5 dengan 27 miliar parameter
00:07:05dan lihat kinerjanya.
00:07:07Dan seperti yang bisa Anda lihat sejak awal, kecepatan tokennya tidak terlalu buruk.
00:07:12Kecepatannya rata-rata sekitar 60 token per detik.
00:07:14Tetapi lihat berapa banyak proses berpikir yang dilakukan model ini.
00:07:17Ini benar-benar konyol.
00:07:20Kita sudah melewati satu menit sekarang, dan model itu masih terus mengeluarkan token hanya untuk bagian penalaran.
00:07:26Saya harus mempercepat pratinjau di sini karena total waktunya berjalan lebih dari dua menit.
00:07:30Namun demikian, pada akhirnya, kita memang mendapatkan hasil yang benar, yaitu 405, yang bagus.
00:07:37Tetapi lihat total waktu yang berlalu.
00:07:39Waktunya adalah 140 detik.
00:07:41Dan lihat pengeluaran tokennya.
00:07:43Lebih dari 7.000 token dihabiskan hanya untuk penalaran saja, dan hanya sekitar 900 token yang benar-benar dihabiskan untuk mencetak jawabannya.
00:07:52Jadi contoh ini dengan jelas menunjukkan betapa berlebihan dan konyolnya Qwen menalar setiap permintaan.
00:07:59Sekarang mari kita beralih ke versi Thinking Cap dari model yang sama.
00:08:02Dan perlu dicatat, kita menggunakan model 27 miliar parameter yang sama dengan kuantisasi yang sama.
00:08:08Dan seperti yang bisa Anda lihat di sini, kita baru berjalan 20 detik, dan kita sudah selesai dengan penalarannya.
00:08:13Dan hanya 9 detik kemudian, kita mendapatkan jawabannya, yang dalam hal ini juga benar, yaitu 405.
00:08:19Dan lihat betapa kontras perbedaannya.
00:08:21Kita tidak hanya menghabiskan kurang dari 2.000 token secara total, di mana hanya 1.100 yang dialokasikan untuk penalaran,
00:08:30tetapi kita juga mendapatkan kecepatan token per detik yang sedikit lebih cepat yaitu 62 token per detik.
00:08:36Jadi dalam setiap metrik, model ini mengungguli model dasar Qwen 2.5 dengan telak.
00:08:42Model ini lebih cepat, lebih efisien, menghabiskan lebih sedikit token, dan memberi Anda jawaban benar yang sama.
00:08:48Jadi ini adalah peningkatan yang cukup mengesankan.
00:08:51Dan inilah detail dari laporan mereka yang harus saya sebutkan, karena ini benar-benar kecelakaan yang lucu.
00:08:57Tujuan awal mereka adalah hanya memperpendek jejak pemikiran, yaitu bagian penalaran,
00:09:02sambil menjaga jawaban akhir agar panjangnya tetap persis sama seperti sebelumnya.
00:09:06Tetapi mereka mengalami kutu (bug).
00:09:07Pengecilan itu secara tidak sengaja diterapkan pada jawaban akhir juga, bukan hanya pada pemikirannya.
00:09:12Jadi mereka memperbaiki kutu tersebut, tetapi rupanya, secara internal, semua orang justru lebih menyukai versi yang mengandung kutu itu.
00:09:18Jadi teori mereka adalah manusia merasa lelah menulis jawaban yang panjang, sehingga kita secara alami meringkas apa yang kita ucapkan.
00:09:25Dan model-model ini tidak pernah memiliki rasa lelah semacam itu yang tertanam di dalamnya hingga sekarang.
00:09:29Jadi mereka akhirnya tetap merilis versi ringkas yang rusak tersebut, dan menyimpan versi yang benar secara teknis untuk rilis di masa mendatang.
00:09:37Jadi begitu lah, teman-teman.
00:09:38Itulah inti dari Thinking Cap.
00:09:40Saya rasa kesimpulan besar dari semua ini adalah kita selalu percaya bahwa semakin banyak model berpikir, semakin cerdas mereka.
00:09:48Sedangkan Thinking Cap baru saja membuktikan bahwa hal itu tidak selalu benar.
00:09:53Begitu Anda benar-benar melatihnya, Anda bisa mendapatkan keluaran berkualitas sama dengan biaya yang jauh lebih murah, tanpa ada yang dikorbankan.
00:10:01Jika Anda ingin mencoba model ini sendiri, model ini tersedia secara gratis di Hugging Face di bawah lisensi Apache 2.0.
00:10:08Dan saya ingin mendengar pendapat kalian, teman-teman.
00:10:10Apa pendapat Anda tentang pendekatan baru ini?
00:10:12Apakah Anda melihat kelebihan atau kekurangan dari teknik ini?
00:10:15Beri tahu kami di kolom komentar di bawah ini.
00:10:17Dan, kawan-kawan, jika Anda menyukai jenis analisis teknis seperti ini, beri tahu saya dengan mengeklik tombol suka di bawah video.
00:10:23Dan juga, jangan lupa untuk berlangganan saluran kami.
00:10:26Ini adalah Andres dari BetterStack, dan sampai jumpa di video berikutnya.

Key Takeaway

Model sumber terbuka Thinking Cap mengurangi token penalaran sebesar hingga 58% dan mempercepat waktu respons secara drastis tanpa mengorbankan akurasi jawaban.

Highlights

  • Thinking Cap adalah versi kustom dari Qwen 2.5 dengan 27 miliar parameter yang disempurnakan untuk berpikir lebih efisien.

  • Model ini memangkas token pemikiran sebesar 45,8% pada 12 tolok ukur di luar domain tanpa perubahan akurasi yang signifikan.

  • Pada tolok ukur GSM8K, tingkat akurasi meningkat dari 93,3% menjadi 96,5% setelah menggunakan metode ini.

  • Pengujian pada soal matematika menemukan bahwa model dasar memerlukan waktu 140 detik dengan 7.000 token penalaran, sedangkan Thinking Cap hanya memerlukan waktu 29 detik dengan 1.100 token.

  • Model ini tersedia secara gratis di Hugging Face di bawah lisensi Apache 2.0.

Timeline

Perbandingan Kinerja Model Penalaran

  • Dua model dasar yang identik menghasilkan jawaban akhir yang sama tetapi menghabiskan jumlah token yang sangat berbeda.
  • Model di sebelah kiri menjalankan Thinking Cap untuk mendapatkan kualitas keluaran yang sama dengan token yang lebih sedikit dan waktu dua kali lebih cepat.

Perbandingan langsung menunjukkan perbedaan efisiensi antara model standar dan model yang telah disempurnakan. Sifat penalaran yang berlebihan sering kali membuat model membuang banyak token untuk kesimpulan yang serupa.

Evolusi Model AI dan Masalah Baru

  • OpenAI merilis model o1 pada September 2024 sebagai model pertama yang menggunakan mode berpikir sebelum menjawab.
  • Model penalaran sering kali menghabiskan ribuan token untuk mengulang poin yang sama karena tidak tahu kapan harus berhenti berpikir.

Perkembangan model AI bergeser dari prediksi token langsung ke era penalaran mendalam. Namun, kelemahan utamanya adalah ketiadaan mekanisme penghentian yang membuat model terjebak dalam perdebatan internal yang tidak produktif.

Pendekatan Pelatihan BottleCap AI

  • BottleCap AI menggunakan model Qwen 2.5 berparameter 27 miliar tanpa mengubah kepribadian atau perilaku keselamatannya.
  • Model dilatih untuk menghargai efisiensi di samping kebenaran agar mengenali waktu yang cukup untuk menetapkan jawaban.

Tantangan teknis terbesar adalah membuat proses berpikir menjadi lebih singkat tanpa menurunkan akurasi model. Penghargaan terhadap efisiensi mencegah model menjadi terlalu bertele-tele dalam memberikan respons.

Metrik Kinerja dan Tolok Ukur

  • Thinking Cap memangkas token pemikiran sebesar 45,8% pada 12 tolok ukur di luar domain dengan pergeseran akurasi kurang dari satu persen.
  • Pengurangan token mencapai hampir 58% pada domain pelatihan, sementara akurasi pada tolok ukur GSM8K naik ke 96,5%.

Angka-angka menunjukkan bahwa sebagian besar penalaran tambahan pada model standar hanyalah kebisingan yang tidak produktif. Penurunan tingkat pengulangan membuktikan efektivitas metode pelatihan baru ini.

Pengujian Praktis pada Perangkat Keras

  • Pengujian menggunakan pertanyaan matematika faktorial dengan rumus Legendre pada mesin ber-GPU RTX 5090.
  • Model dasar memerlukan 140 detik dengan 7.000 token penalaran, sedangkan Thinking Cap menyelesaikan jawaban yang benar dalam 29 detik dengan kurang dari 2.000 token total.

Pengujian empiris membuktikan keunggulan telak model ini dalam hal kecepatan dan efisiensi komputasi. Kedua model menghasilkan jawaban yang sama, tetapi versi Thinking Cap bekerja jauh lebih cepat.

Kutukan Bug yang Dipertahankan dan Ketersediaan

  • Sebuah kutu perangkat lunak secara tidak sengaja memangkas panjang jawaban akhir, yang kemudian disukai oleh para pengembang karena mirip kelelahan manusia.
  • Model ini dapat diunduh secara gratis di Hugging Face di bawah lisensi Apache 2.0.

Kesalahan teknis yang tidak disengaja justru menghasilkan fitur ringkas yang diadopsi secara permanen. Temuan ini mengubah keyakinan bahwa model yang berpikir lebih lama pasti lebih cerdas.

Community Posts

View all posts