스크립트
00:00:00Thinking Machines, startup senilai 12 miliar dolar dari mantan CTO OpenAI Mira Moretti, baru saja meluncurkan
00:00:05model pertamanya. Model ini memiliki 975 miliar parameter, berlisensi Apache 2.0, dan bobotnya tersedia
00:00:12di Hugging Face untuk diunduh siapa saja. Meskipun tidak bersaing dengan laboratorium frontier
00:00:17seperti Anthropic, tujuan utamanya adalah untuk disetel khusus (fine-tuned) menggunakan platformnya sendiri,
00:00:22yaitu Tinker. Jadi, jika Anda memerlukan model yang dilatih untuk tugas yang sangat spesifik,
00:00:25maka ini mungkin persis seperti yang Anda cari. Hari ini kita akan membahas alasan mengapa Anda ingin menggunakan
00:00:29model ini secara khusus dan semua alasan mengapa Anda ingin melakukan fine-tuning. Dan ada cara yang sangat
00:00:35menarik bagaimana model ini memproses audio dan visual, yang belum pernah saya lihat sebelumnya. Jadi, tetaplah
00:00:40di sini karena kita akan membahasnya juga dalam video ini. Dan kita membahas topik AI secara terus-menerus di
00:00:44saluran ini. Jadi, jika Anda ingin tetap mendapatkan informasi terbaru, berlanggananlah ke BetterStack.
00:00:52Thinking Machines sangat terbuka tentang fakta bahwa model baru mereka tidak sekuat pada dasarnya
00:00:57model umum apa pun di pasaran. Dan mereka mengatakan ini dalam postingan peluncurannya. Jadi, mereka hanya mengelola
00:01:01ekspektasi dan Anda dapat melihat alasannya pada tolok ukur (benchmark). Pada kepatuhan instruksi, model ini mengalahkan GLM 5.2,
00:01:0779,8 berbanding 73,3. Tetapi pada terminal bench, tempat agen pergi dan benar-benar melakukan pekerjaan, model ini kalah telak
00:01:14dengan 63,8 berbanding 82,7. Jadi, model ini bagus dalam mengikuti perintah, tetapi jauh lebih lemah dalam menyelesaikan masalah sendiri.
00:01:21Meskipun demikian, ini adalah titik awal yang bagus jika niat Anda adalah melakukan fine-tuning. Di balik hood, ini adalah campuran
00:01:27pakar (mixture of experts). Jadi, ada 975 miliar parameter secara total, tetapi setiap lapisan menampung 256 pakar unik dan setiap token
00:01:35hanya dikirim ke enam di antaranya, yang berarti hanya sekitar 41 miliar parameter yang melakukan pekerjaan pada waktu
00:01:41tertentu. Model ini juga multi-modal. Jadi, gambar, teks, dan audio semuanya masuk. Dan cara kerjanya jauh
00:01:47berbeda dari model apa pun yang pernah Anda lihat sebelumnya. Biasanya, ketika sebuah model menangani audio, misalnya,
00:01:52ada model ucapan terpisah di depan model bahasa yang mentranskripsikan teks lalu
00:01:56meneruskan transkrip tersebut ke model bahasa. Gambar dapat bekerja dengan cara yang sama. Encoder visi melihat
00:02:02gambar tersebut lalu membuat deskripsi untuk gambar itu dan kemudian meneruskannya ke model bahasa.
00:02:07Dan tentu saja, melakukan ini berarti akan ada beberapa bentuk kehilangan data di sepanjang jalan.
00:02:11Inkling tidak melakukan hal tersebut. Audio masuk langsung sebagai spektrogram, sehingga pita frekuensi mentah dari
00:02:16suara dibagi-bagi ke dalam bagian. Gambar juga dimasukkan sebagai potongan 40 kali 40 piksel. Keduanya langsung dimasukkan ke
00:02:23ruang yang sama tempat token teks berada dan model mengunyah semuanya secara bersamaan. Jadi tidak ada yang
00:02:28diciutkan menjadi teks. Secara teoritis, Anda seharusnya mendapatkan lebih sedikit kehilangan data dan kompresi saat memproses
00:02:35hal-hal seperti audio dan visual secara khusus dengan model Inkling. Dan faktanya, dibandingkan dengan sebagian besar
00:02:40model generalis yang sama sekali tidak mendukung audio mentah, Inkling jelas menonjol. Sekarang, apakah Anda
00:02:46bahkan harus melakukan fine-tuning bergantung pada tujuan spesifik Anda. Aturan praktisnya umumnya adalah
00:02:50fine-tuning mengajarkan model cara menjawab, bukan apa yang harus diketahui. Misalnya, nada suara atau output terstruktur
00:02:57yang kaku di mana ribuan contoh akan diperlukan dalam konteks untuk memandu output model
00:03:02karena meneruskan ribuan contoh melalui prompt tidak akan praktis. Biaya dan latensi juga
00:03:08menjadi pertimbangan distilasi di mana melakukan tugas sempit dengan model umum akan jauh lebih mahal
00:03:13daripada melakukan fine-tuning pada model yang lebih kecil. Pada dasarnya, jika ada situasi di mana Anda memerlukan ribuan
00:03:18contoh untuk mendapatkan output yang layak, maka itu dapat mengambil manfaat dari fine-tuning. Tetapi jika Anda memerlukan model untuk mengetahui
00:03:23hal-hal yang tidak diketahuinya, maka jangan lakukan fine-tuning. Sebenarnya ada makalah yang banyak dikutip yang menempatkan temu balik (retrieval)
00:03:28berhadapan dengan fine-tuning dan temu balik secara konsisten menang. Dan jika Anda ingin penalaran yang lebih baik, maka fine-tuning dapat
00:03:34membuatnya lebih buruk karena menurunkan rantai pemikiran (chain of thought) model. Dan menariknya, model yang lebih kecil
00:03:40paling menderita. Namun khusus untuk pekerjaan sempit, hasil dari fine-tuning bisa sangat bagus. Jika kita mengambil
00:03:46Harvey yang membangun alat AI untuk firma hukum, mereka melatih model kecil untuk menarik kutipan dari dokumen hukum.
00:03:52Mereka mengukur nilai F1-nya, yaitu metrik yang digunakan untuk mengevaluasi kinerja model klasifikasi. Dan fine-tuning
00:03:58membawa mereka dari 0,56 ke 0,68. Dan berhadapan langsung dengan GPT-4o, model yang lebih kecil menang atau seri 93%
00:04:07dari waktu ke waktu. Dan kinerjanya bahkan lebih cepat. Thinking Machines bahkan memperlihatkan demo yang memaksa Inkling untuk tidak pernah
00:04:12menggunakan huruf E, di mana Anda dapat secara harfiah memerintahkannya untuk melakukan fine-tuning sendiri melalui Tinker. Model itu kemudian pergi dan
00:04:18membuat dataset pelatihan dan dapat menjalankan seluruh proses fine-tuning secara sepenuhnya otomatis. Dan
00:04:24hasil dari ini adalah model yang memiliki fobia huruf e yang parah dan entah bagaimana responsnya tetap masuk akal.
00:04:29Tetapi Anda tidak melatih ulang seluruh model di sini. Anda sebenarnya menggunakan sesuatu bernama LoRa,
00:04:32yang singkatan dari low rank adaptation. Alih-alih melatih seluruh model, LoRa membekukan bobot asli
00:04:38dan menyuntikkan matriks berukuran lebih kecil yang ringan untuk menangkap data spesifik yang baru. Ini memberikan keunggulan
00:04:44biaya dan kecepatan untuk pascapelatihan dibandingkan dengan melakukan fine-tuning pada seluruh model, yang kemungkinan besar tidak akan praktis.
00:04:49Sekarang Tinker sudah mendukung sejumlah model terbuka seperti Qwen, Kimi, DeepSeek, NemoTron dari Nvidia,
00:04:55dan GPT OSS dari OpenAI. Dan Inkling adalah salah satu yang lebih mahal, jadi mengapa Anda harus repot-repot menggunakannya?
00:05:02Nah, ada dua alasan dan kita telah membahasnya sedikit. Yang pertama adalah audio. Dari setiap
00:05:06model di platform ini, Inkling adalah satu-satunya yang menerima audio sama sekali. Banyak di antaranya memproses gambar,
00:05:11Kimi dan sebagian besar model Qwen menangani visi dengan baik, tetapi tidak satupun dari mereka yang benar-benar menangani
00:05:16suara mentah. Dan mereka juga telah merilis tiga resep buku panduan untuk menyertainya, seperti pengenalan ucapan
00:05:20dan klasifikasi gaya bicara. Jadi model tersebut dapat memberi tahu Anda bagaimana sesuatu diucapkan, bukan hanya apa yang
00:05:26diucapkan. Dan ada juga contoh medis yang dilatih pada resep yang didiktekan, mengajarkannya nama-nama obat yang
00:05:31sebagian besar model lain akan salah ucapkan. Yang kedua adalah upaya berpikir (thinking effort). Inkling memungkinkan Anda mengatur seberapa keras model itu
00:05:36berpikir sebagai angka dari nol hingga satu. Sebagian besar model memberi Anda sakelar dengan dua hingga tiga pengaturan. GPT OSS
00:05:42memberi Anda tingkat rendah, sedang, dan tinggi, misalnya, tetapi Inkling memberi Anda seluruh penggeser (slider). Jadi pertanyaan
00:05:47besarnya adalah, haruskah Anda benar-benar menggunakannya? Nah, jika Anda ingin model berjalan apa adanya, maka ini mungkin
00:05:52bukan untuk Anda. Dan mereka sendiri terbuka tentang hal itu. Tetapi jika Anda memiliki pekerjaan bervolume tinggi yang sempit,
00:05:56beberapa data berlabel nyata, dan cara untuk menilai output, melakukan fine-tuning pada model terbuka kecil adalah salah satu
00:06:02hal paling diremehkan yang dapat Anda lakukan sekarang. Dan dengan platform seperti Tinker, itu jauh lebih mudah.
00:06:07Dan apakah Inkling adalah model yang harus Anda coba benar-benar bergantung pada apa yang Anda masukkan ke dalamnya.
00:06:11Jika ada audio yang masuk, Inkling adalah pilihan yang kuat dan tidak ada hal lain di Tinker yang bahkan menerima audio
00:06:16mentah saat ini. Dan jika Anda mencari model generalis terbuka terbaik saat ini, kami baru saja membuat
00:06:21video tentang Kimi K3 yang dapat Anda tonton di sini, dan itu telah memberikan beberapa hasil yang luar biasa. Namun demikian,
00:06:26terima kasih telah menonton. Saya Warren dari BetterStack dan sampai jumpa di video berikutnya.