Inkling: Model Open-Weight Ini Dirancang untuk Fine-Tuning

BBetter Stack
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Thinking Machines, startup senilai 12 miliar dolar dari mantan CTO OpenAI Mira Moretti, baru saja meluncurkan
00:00:05model pertamanya. Model ini memiliki 975 miliar parameter, berlisensi Apache 2.0, dan bobotnya tersedia
00:00:12di Hugging Face untuk diunduh siapa saja. Meskipun tidak bersaing dengan laboratorium frontier
00:00:17seperti Anthropic, tujuan utamanya adalah untuk disetel khusus (fine-tuned) menggunakan platformnya sendiri,
00:00:22yaitu Tinker. Jadi, jika Anda memerlukan model yang dilatih untuk tugas yang sangat spesifik,
00:00:25maka ini mungkin persis seperti yang Anda cari. Hari ini kita akan membahas alasan mengapa Anda ingin menggunakan
00:00:29model ini secara khusus dan semua alasan mengapa Anda ingin melakukan fine-tuning. Dan ada cara yang sangat
00:00:35menarik bagaimana model ini memproses audio dan visual, yang belum pernah saya lihat sebelumnya. Jadi, tetaplah
00:00:40di sini karena kita akan membahasnya juga dalam video ini. Dan kita membahas topik AI secara terus-menerus di
00:00:44saluran ini. Jadi, jika Anda ingin tetap mendapatkan informasi terbaru, berlanggananlah ke BetterStack.
00:00:52Thinking Machines sangat terbuka tentang fakta bahwa model baru mereka tidak sekuat pada dasarnya
00:00:57model umum apa pun di pasaran. Dan mereka mengatakan ini dalam postingan peluncurannya. Jadi, mereka hanya mengelola
00:01:01ekspektasi dan Anda dapat melihat alasannya pada tolok ukur (benchmark). Pada kepatuhan instruksi, model ini mengalahkan GLM 5.2,
00:01:0779,8 berbanding 73,3. Tetapi pada terminal bench, tempat agen pergi dan benar-benar melakukan pekerjaan, model ini kalah telak
00:01:14dengan 63,8 berbanding 82,7. Jadi, model ini bagus dalam mengikuti perintah, tetapi jauh lebih lemah dalam menyelesaikan masalah sendiri.
00:01:21Meskipun demikian, ini adalah titik awal yang bagus jika niat Anda adalah melakukan fine-tuning. Di balik hood, ini adalah campuran
00:01:27pakar (mixture of experts). Jadi, ada 975 miliar parameter secara total, tetapi setiap lapisan menampung 256 pakar unik dan setiap token
00:01:35hanya dikirim ke enam di antaranya, yang berarti hanya sekitar 41 miliar parameter yang melakukan pekerjaan pada waktu
00:01:41tertentu. Model ini juga multi-modal. Jadi, gambar, teks, dan audio semuanya masuk. Dan cara kerjanya jauh
00:01:47berbeda dari model apa pun yang pernah Anda lihat sebelumnya. Biasanya, ketika sebuah model menangani audio, misalnya,
00:01:52ada model ucapan terpisah di depan model bahasa yang mentranskripsikan teks lalu
00:01:56meneruskan transkrip tersebut ke model bahasa. Gambar dapat bekerja dengan cara yang sama. Encoder visi melihat
00:02:02gambar tersebut lalu membuat deskripsi untuk gambar itu dan kemudian meneruskannya ke model bahasa.
00:02:07Dan tentu saja, melakukan ini berarti akan ada beberapa bentuk kehilangan data di sepanjang jalan.
00:02:11Inkling tidak melakukan hal tersebut. Audio masuk langsung sebagai spektrogram, sehingga pita frekuensi mentah dari
00:02:16suara dibagi-bagi ke dalam bagian. Gambar juga dimasukkan sebagai potongan 40 kali 40 piksel. Keduanya langsung dimasukkan ke
00:02:23ruang yang sama tempat token teks berada dan model mengunyah semuanya secara bersamaan. Jadi tidak ada yang
00:02:28diciutkan menjadi teks. Secara teoritis, Anda seharusnya mendapatkan lebih sedikit kehilangan data dan kompresi saat memproses
00:02:35hal-hal seperti audio dan visual secara khusus dengan model Inkling. Dan faktanya, dibandingkan dengan sebagian besar
00:02:40model generalis yang sama sekali tidak mendukung audio mentah, Inkling jelas menonjol. Sekarang, apakah Anda
00:02:46bahkan harus melakukan fine-tuning bergantung pada tujuan spesifik Anda. Aturan praktisnya umumnya adalah
00:02:50fine-tuning mengajarkan model cara menjawab, bukan apa yang harus diketahui. Misalnya, nada suara atau output terstruktur
00:02:57yang kaku di mana ribuan contoh akan diperlukan dalam konteks untuk memandu output model
00:03:02karena meneruskan ribuan contoh melalui prompt tidak akan praktis. Biaya dan latensi juga
00:03:08menjadi pertimbangan distilasi di mana melakukan tugas sempit dengan model umum akan jauh lebih mahal
00:03:13daripada melakukan fine-tuning pada model yang lebih kecil. Pada dasarnya, jika ada situasi di mana Anda memerlukan ribuan
00:03:18contoh untuk mendapatkan output yang layak, maka itu dapat mengambil manfaat dari fine-tuning. Tetapi jika Anda memerlukan model untuk mengetahui
00:03:23hal-hal yang tidak diketahuinya, maka jangan lakukan fine-tuning. Sebenarnya ada makalah yang banyak dikutip yang menempatkan temu balik (retrieval)
00:03:28berhadapan dengan fine-tuning dan temu balik secara konsisten menang. Dan jika Anda ingin penalaran yang lebih baik, maka fine-tuning dapat
00:03:34membuatnya lebih buruk karena menurunkan rantai pemikiran (chain of thought) model. Dan menariknya, model yang lebih kecil
00:03:40paling menderita. Namun khusus untuk pekerjaan sempit, hasil dari fine-tuning bisa sangat bagus. Jika kita mengambil
00:03:46Harvey yang membangun alat AI untuk firma hukum, mereka melatih model kecil untuk menarik kutipan dari dokumen hukum.
00:03:52Mereka mengukur nilai F1-nya, yaitu metrik yang digunakan untuk mengevaluasi kinerja model klasifikasi. Dan fine-tuning
00:03:58membawa mereka dari 0,56 ke 0,68. Dan berhadapan langsung dengan GPT-4o, model yang lebih kecil menang atau seri 93%
00:04:07dari waktu ke waktu. Dan kinerjanya bahkan lebih cepat. Thinking Machines bahkan memperlihatkan demo yang memaksa Inkling untuk tidak pernah
00:04:12menggunakan huruf E, di mana Anda dapat secara harfiah memerintahkannya untuk melakukan fine-tuning sendiri melalui Tinker. Model itu kemudian pergi dan
00:04:18membuat dataset pelatihan dan dapat menjalankan seluruh proses fine-tuning secara sepenuhnya otomatis. Dan
00:04:24hasil dari ini adalah model yang memiliki fobia huruf e yang parah dan entah bagaimana responsnya tetap masuk akal.
00:04:29Tetapi Anda tidak melatih ulang seluruh model di sini. Anda sebenarnya menggunakan sesuatu bernama LoRa,
00:04:32yang singkatan dari low rank adaptation. Alih-alih melatih seluruh model, LoRa membekukan bobot asli
00:04:38dan menyuntikkan matriks berukuran lebih kecil yang ringan untuk menangkap data spesifik yang baru. Ini memberikan keunggulan
00:04:44biaya dan kecepatan untuk pascapelatihan dibandingkan dengan melakukan fine-tuning pada seluruh model, yang kemungkinan besar tidak akan praktis.
00:04:49Sekarang Tinker sudah mendukung sejumlah model terbuka seperti Qwen, Kimi, DeepSeek, NemoTron dari Nvidia,
00:04:55dan GPT OSS dari OpenAI. Dan Inkling adalah salah satu yang lebih mahal, jadi mengapa Anda harus repot-repot menggunakannya?
00:05:02Nah, ada dua alasan dan kita telah membahasnya sedikit. Yang pertama adalah audio. Dari setiap
00:05:06model di platform ini, Inkling adalah satu-satunya yang menerima audio sama sekali. Banyak di antaranya memproses gambar,
00:05:11Kimi dan sebagian besar model Qwen menangani visi dengan baik, tetapi tidak satupun dari mereka yang benar-benar menangani
00:05:16suara mentah. Dan mereka juga telah merilis tiga resep buku panduan untuk menyertainya, seperti pengenalan ucapan
00:05:20dan klasifikasi gaya bicara. Jadi model tersebut dapat memberi tahu Anda bagaimana sesuatu diucapkan, bukan hanya apa yang
00:05:26diucapkan. Dan ada juga contoh medis yang dilatih pada resep yang didiktekan, mengajarkannya nama-nama obat yang
00:05:31sebagian besar model lain akan salah ucapkan. Yang kedua adalah upaya berpikir (thinking effort). Inkling memungkinkan Anda mengatur seberapa keras model itu
00:05:36berpikir sebagai angka dari nol hingga satu. Sebagian besar model memberi Anda sakelar dengan dua hingga tiga pengaturan. GPT OSS
00:05:42memberi Anda tingkat rendah, sedang, dan tinggi, misalnya, tetapi Inkling memberi Anda seluruh penggeser (slider). Jadi pertanyaan
00:05:47besarnya adalah, haruskah Anda benar-benar menggunakannya? Nah, jika Anda ingin model berjalan apa adanya, maka ini mungkin
00:05:52bukan untuk Anda. Dan mereka sendiri terbuka tentang hal itu. Tetapi jika Anda memiliki pekerjaan bervolume tinggi yang sempit,
00:05:56beberapa data berlabel nyata, dan cara untuk menilai output, melakukan fine-tuning pada model terbuka kecil adalah salah satu
00:06:02hal paling diremehkan yang dapat Anda lakukan sekarang. Dan dengan platform seperti Tinker, itu jauh lebih mudah.
00:06:07Dan apakah Inkling adalah model yang harus Anda coba benar-benar bergantung pada apa yang Anda masukkan ke dalamnya.
00:06:11Jika ada audio yang masuk, Inkling adalah pilihan yang kuat dan tidak ada hal lain di Tinker yang bahkan menerima audio
00:06:16mentah saat ini. Dan jika Anda mencari model generalis terbuka terbaik saat ini, kami baru saja membuat
00:06:21video tentang Kimi K3 yang dapat Anda tonton di sini, dan itu telah memberikan beberapa hasil yang luar biasa. Namun demikian,
00:06:26terima kasih telah menonton. Saya Warren dari BetterStack dan sampai jumpa di video berikutnya.

핵심 요약

Inkling menawarkan pemrosesan audio mentah dan visual langsung dalam model open-weight 975 miliar parameter yang dirancang khusus untuk fine-tuning otomatis melalui platform Tinker.

하이라이트

  • Thinking Machines meluncurkan model Inkling berbobot terbuka dengan 975 miliar parameter total, berlisensi Apache 2.0, dan tersedia di Hugging Face.

  • Model ini menggunakan arsitektur mixture of experts yang mengaktifkan 6 dari 256 pakar unik per token atau setara dengan 41 miliar parameter aktif.

  • Inkling memproses input audio mentah langsung sebagai spektrogram dan gambar sebagai potongan 40 kali 40 piksel ke dalam ruang yang sama dengan token teks tanpa kompresi perantara.

  • Penerapan fine-tuning menggunakan metode LoRa (low rank adaptation) membekukan bobot asli dan menyuntikkan matriks ringan berukuran lebih kecil.

  • Platform Tinker mendukung proses fine-tuning otomatis di mana model dapat membuat dataset pelatihannya sendiri dan menjalankan seluruh proses tanpa intervensi manual.

타임라인

Spesifikasi Dasar dan Arsitektur Model

  • Thinking Machines merilis model Inkling dengan 975 miliar parameter total di bawah lisensi Apache 2.0.
  • Tolok ukur menunjukkan skor kepatuhan instruksi mencapai 79,8 sementara terminal bench mencatat angka 63,8.
  • Arsitektur campuran pakar (mixture of experts) hanya mengaktifkan sekitar 41 miliar parameter pada waktu tertentu.

Model baru ini dirancang untuk disetel secara khusus melalui platform Tinker daripada bersaing langsung dengan laboratorium frontier. Meskipun memiliki keterbatasan dalam menyelesaikan masalah mandiri di terminal, model ini unggul dalam mengikuti perintah dasar. Struktur internalnya membagi 256 pakar unik ke dalam setiap lapisan dengan alokasi enam pakar per token.

Pemrosesan Multimodal Tanpa Kompresi Perantara

  • Audio masuk langsung sebagai spektrogram dengan pita frekuensi mentah yang terbagi ke dalam bagian.
  • Gambar dimasukkan sebagai potongan berukuran 40 kali 40 piksel ke dalam ruang token teks yang sama.
  • Pendekatan ini menghilangkan model ucapan atau encoder visi terpisah untuk menghindari kehilangan data.

Metode penanganan data multimodal pada Inkling berbeda dari model konvensional yang biasanya mengubah audio dan gambar menjadi teks terlebih dahulu. Pemrosesan langsung ke ruang token yang sama meminimalkan kompresi dan kehilangan data. Fitur ini menempatkan Inkling di posisi unik dibandingkan model generalis lain yang mengabaikan dukungan audio mentah.

Strategi dan Batasan Fine-Tuning

  • Aturan praktis fine-tuning berfokus pada pengajaran cara menjawab alih-alih menambahkan pengetahuan baru.
  • Penerapan pada alat hukum Harvey meningkatkan nilai metrik F1 dari 0,56 menjadi 0,68.
  • Fine-tuning otomatis via Tinker memungkinkan pembuatan dataset dan eksekusi pelatihan tanpa intervensi manual.

Fine-tuning efektif untuk tugas sempit, nada suara, atau output terstruktur yang membutuhkan ribuan contoh panduan, tetapi tidak cocok untuk menambah informasi faktual baru. Penggunaan temu balik (retrieval) lebih diandalkan untuk memasukkan pengetahuan baru karena fine-tuning dapat menurunkan rantai pemikiran model. Hasil uji coba menunjukkan model kecil yang disetel khusus mampu melampaui performa model yang lebih besar pada tugas spesifik.

Keunggulan Inkling Dibandingkan Model Lain

  • Penerapan LoRa membekukan bobot asli dan menyuntikkan matriks ringan untuk efisiensi biaya dan kecepatan.
  • Inkling menjadi satu-satunya model di platform Tinker yang menerima input audio mentah secara langsung.
  • Pengatur upaya berpikir (thinking effort slider) menyediakan rentang nilai penuh dari nol hingga satu.

Meskipun memiliki biaya operasional yang lebih tinggi di platform Tinker dibandingkan model seperti Qwen atau Kimi, Inkling unggul dalam pemrosesan audio dan kontrol tingkat berpikir yang presisi. Resep buku panduan yang menyertainya mendukung pengenalan ucapan dan klasifikasi gaya bicara untuk istilah medis yang kompleks. Model ini sangat direkomendasikan untuk pekerjaan sempit bervolume tinggi yang memiliki data berlabel nyata.

커뮤니티 글

모든 글 보기