Kimi K3 Selevel Fable... (mereka harus khawatir)

BBetter Stack
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Kimi K3 telah hadir dan sejujurnya, yang satu ini cukup mengejutkan. Model ini tidak hanya menyamai Opus dan
00:00:04GPT 5.5, tetapi juga menyamai Fable dan GPT 5.6. Model terbuka tidak tertinggal sejauh yang kita
00:00:10duga sebelumnya. Mari kita lihat. Mari mulai dengan pengumumannya. Kimi K3 adalah model dengan 2,8 triliun
00:00:19parameter yang dibangun di atas Kimi Delta Retention and Attention Residuals dengan kemampuan
00:00:24visi bawaan dan jendela konteks 1 juta token. Ini adalah model kelas 3 triliun terbuka pertama di dunia
00:00:29yang dirancang untuk kecerdasan mutakhir dalam pengodean jangka panjang, pekerjaan pengetahuan, dan penalaran.
00:00:34Pada semua tolok ukur yang mereka tunjukkan di blog ini, Kimi K3 tertinggal di belakang Fable
00:00:38dan GPT 5.6 Soul atau bahkan mengungguli mereka di beberapa area lain. Ini adalah lompatan yang sangat gila
00:00:43yang menurut saya tidak banyak diprediksi orang. Namun, ini jelas berdasarkan tolok ukur mereka sendiri, jadi mari kita lihat
00:00:47kecerdasan buatan dan tolok ukur pihak ketiga kita, dan saya senang mengatakan hasilnya cukup
00:00:52cocok. Pada tolok ukur ini kita bisa melihat bahwa sekitar 80% dari Anda yang menonton ini belum berlangganan
00:00:56jadi silakan klik tombol berlangganan itu jika Anda ingin tetap mendapatkan informasi terbaru tentang segala hal terkait pengembangan perangkat lunak
00:01:00dan AI. Namun, mari beralih ke tolok ukur yang sebenarnya, dimulai dengan indeks pengodean yang mencetak skor 76,2 pada
00:01:06tolok ukur ini, yaitu 0,3 poin di belakang Fable 5 dan sedikit lebih tinggi dari GPT 5.5, lebih dari Opus 4.8, dan
00:01:12lebih dari GPT 5.6 Luna dan hanya sedikit kalah dari GPT 5.6 Soul dan Terra. Lihatlah lompatan yang mereka
00:01:19buat dari model mereka sebelumnya. Jika kita kemudian melihat indeks agen, ceritanya sama.
00:01:23Model ini berada di urutan ketiga, hanya kalah dari Fable dan Soul, tetapi itu benar-benar masih mengesankan dan Anda
00:01:29sudah terbiasa dengan ini sekarang, tetapi hasilnya persis sama pada indeks kecerdasan juga. Jadi bahkan pihak
00:01:32ketiga tolok ukur mengonfirmasi bahwa model ini luar biasa. Sayangnya, kita belum memiliki hasil deep SWE saat
00:01:38rekaman ini dibuat, tetapi jika kita melihat tolok ukur kita sendiri, Anda dapat melihat bahwa model ini kembali menempati posisi ketiga.
00:01:42Model ini tampaknya terlalu bagus untuk menjadi kenyataan. Satu-satunya kekurangan yang dapat saya temukan pada model ini adalah
00:01:46bahwa model ini sedikit mahal. Kecuali Anda memiliki superkomputer di rumah Anda, saya rasa Anda
00:01:50tidak akan menjalankan model ini secara lokal, jadi jika Anda menggunakan API, harganya sebenarnya $3 untuk
00:01:54satu juta token input dan $15 untuk satu juta token output. Ini adalah peningkatan yang cukup besar dari Kimi K 2.6
00:02:00dan harganya sekitar sama dengan Sonic 5 saat diskon itu berakhir, tetapi lebih murah daripada Fable 5,
00:02:06Opus, dan GPT 5.6. Harga API juga bukan segalanya, jadi jika kita melihatnya dalam praktik dengan biaya
00:02:12per tugas di sini, sebenarnya mirip dengan GPT 5.6 Soul dan harganya sekitar setengah dari Opus 4.8 dan tentu saja
00:02:17lebih murah daripada Fable dan Sonic 5. Jadi, model ini kompetitif dengan model-model tertutup mutakhir tersebut, tetapi
00:02:22bagi Anda yang menyukai model terbuka karena sedikit lebih murah, model ini mungkin
00:02:26tidak cocok untuk Anda. GLM 5.2 adalah pilihan terbaik kedua di sini dan harganya setengahnya. Ini juga bukan
00:02:31model tercepat yang pernah ada, tetapi bagi saya, tampaknya cukup kompetitif untuk tingkat kecerdasan ini.
00:02:36Secara keseluruhan, sejujurnya cukup sulit untuk mengatakan sesuatu yang negatif tentang model ini, jadi mari kita langsung
00:02:40masuk dan melihat beberapa pengujian lokal saya. Tes pertama yang saya berikan kepada model-model ini adalah membuatkan saya
00:02:44permainan balap Formula 1 lengkap dalam 3.js yang semuanya ada dalam satu file index.html dan ini adalah Kimi K3 yang berjalan
00:02:50melalui Open Router. Saya juga mengujinya di Kimi Code, CLI itu, hanya untuk melihat apakah harness-nya mengubah
00:02:56apa pun. Anda bisa melihat di bawah sini bahwa model ini berpikir selama 14 menit sebelum memulai dan secara keseluruhan butuh waktu
00:03:0035 menit untuk membuat aplikasi web 3.js ini dan menghabiskan $1,24 dalam token API. Dan hasil yang saya dapatkan
00:03:06cukup mengesankan. Jelas ini tidak memiliki akses ke aset eksternal apa pun, jadi ia melakukan yang terbaik dalam membuat
00:03:11model-model ini. Namun, lintasannya memang berfungsi. Kita memiliki pembalap AI kita dan mereka tampaknya bisa mengitari
00:03:16lintasan. Anda bisa melihat penghalang sebenarnya berfungsi sehingga saya tidak bisa menembusnya. Posisi kita terus diperbarui.
00:03:21Kita memiliki peta yang diperbarui. Kita memiliki waktu saat ini yang diperbarui serta putaran juga. Saya telah melakukan
00:03:25satu putaran penuh dan mengonfirmasi bahwa semuanya berfungsi. Jadi ini hasil yang cukup bagus untuk apa yang diberikan Kimi K3 kepada kita.
00:03:30Seperti yang saya katakan, saya juga menguji harness yang berbeda. Jadi ini adalah Kimi K3 tetapi di Kimi Code. Dan yang satu ini
00:03:35menurut saya terlihat sedikit lebih bagus. Model ini melakukan pekerjaan yang lebih baik dengan aset meskipun itu hanya
00:03:39panduan gaya. Ada sedikit lag di sana dengan model-model tersebut tetapi penanganannya sedikit lebih baik.
00:03:43Kontrolnya masih terbalik dan sebenarnya tampaknya menjadi pola di banyak aplikasi 3.js ini
00:03:48karena suatu alasan. Namun sekali lagi, semua ini tertangani dengan sangat baik dan memiliki fitur seperti keluar
00:03:52dari lintasan akan memperlambat saya. Dan ya, model ini juga melakukan pekerjaan yang cukup mengesankan. Tapi sekarang mari kita
00:03:57bandingkan ini dengan model-model mutakhir. Kita memiliki Fable 5 di sini dalam Claude Code yang berada pada pengaturan maksimal dan butuh waktu
00:04:0144 menit untuk membuat aplikasi 3.js saya. Kemudian kita juga memiliki GPT 5.6 Soul pada pengaturan maksimal juga. Dan ini
00:04:07butuh waktu 18 menit. Ini adalah hasil yang diberikan Fable kepada saya. Jadi kita memiliki Fable GP di sini. Dan saya akan mengatakan
00:04:12bahwa itu terlihat sedikit lebih bagus mungkin. Namun sekali lagi, semua ini hanyalah pilihan gaya. Dan kontrolnya
00:04:17sebenarnya tidak terbalik dalam yang satu ini. Ada juga sedikit goyangan kamera yang menurut saya adalah gaya
00:04:22yang bagus. Dan sekali lagi semuanya tampak berfungsi dalam yang satu ini seperti semua yang lain. Saya telah menguji melakukan
00:04:26satu putaran penuh dari ini sesulit apa pun itu. Kita juga memiliki beberapa tabrakan di sini seperti yang bisa Anda lihat. Tapi ya
00:04:31semuanya tampak berfungsi dan cukup sebanding dengan apa yang diberikan Kimi K3 kepada kita. Ceritanya serupa
00:04:35dengan GPT 5.6 Soul. Seperti yang Anda lihat, kita memiliki permainan yang berfungsi di sini. Meskipun saya akan mencatat bahwa jalan di sini
00:04:40adalah rumput. Itu tidak benar-benar merendernya. Dan semuanya tampak berfungsi. Kontrolnya
00:04:44terbalik pada yang satu ini juga. Dan kita juga memiliki beberapa aset yang terbalik. Saya tidak tahu mengapa model-model ini
00:04:48tampaknya suka melakukan itu. Satu-satunya yang tidak melakukannya adalah Fable. Dan juga lintasan di sini menjadi sedikit
00:04:53kacau. Jadi ini sebenarnya satu-satunya yang tidak membuatkan saya lintasan yang berfungsi. Sebagai perbandingan terakhir,
00:04:57saya juga memeriksa apa yang akan diberikan GLM 5.2 kepada saya karena itu adalah model terbuka terbaik berikutnya. Dan yang satu ini
00:05:02berpikir selama 5 menit 58 detik. Meskipun tidak menyelesaikannya dalam satu prompt. Sebenarnya ada
00:05:07beberapa bug. Jadi saya harus kembali dengan prompt lain. Bahkan ketika saya akhirnya membuat permainan berjalan
00:05:11Anda bisa melihat bahwa ada banyak bug di sini. Pertama-tama kita tidak memulai dengan cara yang benar di lintasan.
00:05:15Dan tidak ada lintasan untuk memulai. Dan juga terlihat jauh lebih buruk daripada yang lain.
00:05:20Jadi ada sedikit peningkatan ketika kita beralih ke Kimi K3. Namun beralih ke tes 2. Saya meminta
00:05:25dasbor manajemen keuangan pribadi. Ini akan membangun aplikasi full stack dengan front
00:05:29end dan back end. Satu-satunya hal yang saya katakan tidak saya inginkan adalah autentikasi. Dan saya juga memintanya untuk memasukkan beberapa data.
00:05:33Saya melakukan ini lagi di open router dengan K3. Dan kemudian juga di Kimi code. Jadi ini ada di open
00:05:38router. Dan Anda bisa melihat totalnya butuh 56 menit untuk membuatkan saya aplikasi tersebut. Dan juga menghabiskan
00:05:43biaya $1,30 bagi saya. Namun ini adalah hasil yang mereka berikan. Dan sejujurnya saya tidak bisa benar-benar mengeluh tentang ini.
00:05:48Ini persis seperti yang saya minta. Ini adalah dasbor manajemen keuangan pribadi. Menurut saya tampilannya
00:05:53terlihat sangat bagus juga. Dan kita memiliki semua fitur seperti halaman tambahan di sini. Dan saya telah
00:05:57memeriksa penambahan dana dan pengiriman uang. Semuanya berfungsi. Jadi model ini telah melakukan pekerjaan yang sangat baik. Sekarang saya juga
00:06:01selalu ingin tahu alat apa yang digunakannya untuk menyelesaikan tugas tersebut. Karena saya sebenarnya tidak memberikannya
00:06:05instruksi tentang tumpukan teknologi apa yang digunakan dalam prompt. Anda bisa melihat untuk front end di sini, model ini menggunakan
00:06:09react dan react dom. Itu tidak benar-benar menggunakan router atau semacamnya. Sebenarnya ia membangun
00:06:12sistem tampilannya sendiri. Jadi saya mungkin akan lebih suka jika Anda menggunakan sesuatu seperti react router,
00:06:16tan stack atau next.js. Dan kemudian di back end ia juga membangun servernya sendiri. Saya percaya
00:06:21yang satu ini menggunakan express.js seperti yang bisa kita lihat di bawah sini. Tapi kemudian ia juga membangun basis datanya hanya menggunakan
00:06:26file JSON. Tidak menggunakan SQLite atau semacamnya atau drizzle yang mungkin ingin saya
00:06:31lihat jika kita ingin menskalakan aplikasi ini di masa depan. Tapi sekali lagi jelas saya tahu bahwa saya bisa
00:06:35memberikan itu dalam prompt. Tapi saya selalu suka melihat apa yang akan mereka pilih sebagai default. Ini adalah
00:06:38hasil yang sebenarnya saya dapatkan menggunakan K3 melalui Kimi code. Dan Anda bisa melihat yang satu ini sebenarnya sedikit lebih sederhana.
00:06:43Hanya satu halaman dan tidak memiliki bilah samping kita. Sekali lagi semua fitur berfungsi dan memiliki
00:06:47tampilan yang cukup mirip dengan apa yang kita dapatkan dari open router. Namun melihat kodenya,
00:06:51saya sebenarnya lebih suka apa yang diberikan Kimi code kepada kita di sini dengan K3. Ini memiliki front end yang cukup mirip di mana
00:06:55hanya menggunakan react dan tidak ada pustaka perutean. Tapi servernya sebenarnya menggunakan basis data. Anda bisa melihat
00:06:59ia dibangun dengan express di sini. Kita sebenarnya memiliki basis data keuangan dan sebenarnya menggunakan node
00:07:04SQLite. Sekarang jika Anda membandingkan ini dengan model mutakhir lagi, yang satu ini adalah Fable 5 di Claude code.
00:07:08Anda bisa melihat ia bekerja selama 56 menit pada upaya maksimal itu. Dan kemudian saya juga memiliki GPT 5.6 soul max
00:07:13di mana ia berpikir selama 31 menit untuk membuat aplikasi tersebut. Ini adalah apa yang diberikan Fable 5 kepada kita dan
00:07:17sejujurnya desainnya cukup mirip. Maksud saya tidak banyak lagi yang bisa Anda lakukan dengan
00:07:21dasbor keuangan pribadi. Dan semua fitur berfungsi di sini. Ini sebenarnya menggunakan sedikit
00:07:25gaya yang berbeda untuk font yang sering saya lihat dilakukan Fable dan Opus akhir-akhir ini. Mereka tampaknya
00:07:29melatihnya kembali untuk menjauh dari beberapa tampilan AI sebelumnya yang mereka miliki dan mereka sedang membangun
00:07:34tampilan AI baru. Dan ini tampaknya adalah yang mereka pilih. Saya akan mengatakan grafik ini sebenarnya sedikit
00:07:38lebih tidak berguna daripada yang kita dapatkan dari Kimi K3. Tapi secara keseluruhan tampilannya cukup mirip dan berfungsi
00:07:43pada dasarnya sama. Bahkan kodenya cukup mirip. Anda bisa melihat ia memilih React untuk front
00:07:47end dan ia tidak benar-benar menggunakan router juga. Ia menulis miliknya sendiri. Dan kemudian juga di basis data ia
00:07:51berhasil menggunakan basis data dengan benar. Jadi kita menggunakan Node SQL dalam yang satu ini juga. Dan untuk
00:07:57server yang sebenarnya, hanya menjalankan Express 2. Namun beralih ke GPT 5.6 soul. Yang satu ini sedikit
00:08:02aneh. Ini jelas desain favorit saya di antara semuanya. Dan sekali lagi semua fitur
00:08:06berfungsi. Beri tahu saya jika Anda setuju bahwa ini adalah desain terbaik. Tapi bagian anehnya ada pada kodenya.
00:08:11Ini jelas merupakan kode aplikasi paling lengkap yang pernah kita lihat dalam contoh-contoh ini. Model ini
00:08:15sebenarnya membangun aplikasi NextJS lengkap dan menggunakan Drizzle persis seperti yang akan saya lakukan. Dan ia menggunakan NextJS
00:08:20juga untuk front end serta server. Tapi bagian yang menurut saya sedikit aneh adalah bahwa ia
00:08:24memilih untuk meng-host-nya di Cloudflare yang tidak aneh dengan sendirinya, tetapi ia juga menggunakan for Next. Dan itu tidak
00:08:29necessarily bahwa saya tidak akan merekomendasikan itu. Saya hanya berpikir itu sedikit belum teruji. Dan cukup
00:08:33baru yang menunjukkan bahwa mereka sebenarnya mendorong GPT 5.6 soul untuk menggunakan ini. Dan saya hanya bisa berspekulasi tentang
00:08:38mengapa, tetapi tampaknya mungkin karena begitulah cara situs ChatGPT sebenarnya bekerja. Anda bisa
00:08:42melihat di sini sebenarnya memutuskan untuk meng-host ini untuk saya di fitur situs ChatGPT itu meskipun saya tidak memintanya
00:08:47untuk melakukannya. Secara pribadi saya tidak terlalu menyukai itu ketika saya sedang mengodekan aplikasi. Saya tidak ingin
00:08:50itu meng-host-nya untuk saya. Saya lebih suka menangani semua itu sendiri. Tapi saya bisa saja meminta itu dalam
00:08:54prompt. Saya lebih suka jika saya harus memintanya untuk meng-host-nya daripada sebaliknya.
00:08:58Hasil akhir yang saya miliki di sini adalah GLM 5.2 dan yang satu ini telah melakukan hal yang cukup mirip dengan apa yang dilakukan Kimi K3
00:09:04di Kimi Code di mana ia hanya membangun halaman tunggal ini. Tapi sekali lagi semua fitur berfungsi dan saya memang
00:09:08berpikir desain ini cukup bagus. GLM 5.2 sebenarnya membutuhkan waktu 15 menit untuk melakukan ini dan Anda bisa melihat harganya
00:09:13satu dolar sebelas sen bagi saya. Untuk kode yang sebenarnya GLM 5.2 memilih untuk menempuh jalur Next.js juga
00:09:19yang sebenarnya saya sukai. Tapi ia memang membangun penyimpanan sendiri alih-alih menggunakan basis data. Jadi semua ini
00:09:24hanya ada di memori dalam JavaScript. Jadi dari tes singkat saya di sana, saya pikir Kimi K3 memang berdiri bersama Fable
00:09:29dan GPT 5.6 Sol dan memenuhi hype yang diberikan tolok ukur kepadanya. Dan sejujurnya mulai
00:09:33cukup sulit untuk menunjukkan kepada Anda betapa kuatnya model-model ini dalam demonstrasi video. Anda cenderung
00:09:38harus menggunakannya selama satu minggu dalam basis kode produksi untuk benar-benar melihat kualitas
00:09:42kodenya. Jika Anda memiliki ide untuk tes yang bisa saya tunjukkan dalam video yang sebenarnya
00:09:46menguji model-model ini dengan tes yang sulit, beri tahu saya di komentar di bawah. Saya juga ingin
00:09:50menunjukkan beberapa contoh yang mereka miliki di blog teknologi mereka. Anda bisa melihat Kimi
00:09:53K3 membangun permainan ini di sini tetapi memang memiliki alat lain untuk benar-benar menghasilkan aset ini sehingga koboi dan
00:09:58kuda itu tidak dihasilkan oleh K3. Mereka berasal dari tempat lain. Anda bisa melihat ia telah melakukan pekerjaan yang sangat baik
00:10:03dengan ini dalam 3GS. Dan hal lain yang gila adalah desain chip ini. Anda bisa melihat sebagai bukti konsep awal
00:10:08Kimi K3 merancang chip untuk melayani model nano yang dibangun di atas arsitekturnya sendiri. Dalam satu
00:10:13kali jalan otonom 48 jam K3 membangun, mengoptimalkan, dan memverifikasi chip menggunakan alat sumber terbuka. Jadi semoga
00:10:19Anda telah melihat bahwa model ini benar-benar luar biasa dan pasti akan menjadi pukulan bagi
00:10:23laboratorium tertutup mutakhir ini. Atau setidaknya akan terjadi saat mereka benar-benar merilis bobotnya. Mereka belum
00:10:27merilisnya tetapi mereka memang berencana untuk melakukannya. Jadi saya harap kita melihatnya segera. Apa pendapat Anda
00:10:32tentang ini? Apakah Anda berharap lab Tiongkok akan menyusul secepat ini? Dan apakah model ini menarik bagi Anda?
00:10:36Beri tahu saya di komentar di bawah. Sambil Anda di sana, berlanggananlah. Dan seperti biasa, sampai jumpa di video berikutnya.

핵심 요약

Kimi K3 merupakan model terbuka dengan 2,8 triliun parameter yang performa pengodean dan penalaran logikanya setara dengan model tertutup kelas atas seperti Fable dan GPT 5.6.

하이라이트

  • Kimi K3 memiliki 2,8 triliun parameter dan jendela konteks sebesar 1 juta token.

  • Indeks pengodean Kimi K3 mencapai skor 76,2, berada tepat di belakang Fable 5.

  • Biaya API Kimi K3 sebesar $3 per satu juta token input dan $15 per satu juta token output.

  • Pengembangan aplikasi web 3.js dengan Kimi K3 memakan waktu 35 menit dengan biaya API sebesar $1,24.

  • Kimi K3 mampu melakukan perancangan, optimasi, dan verifikasi chip secara otonom selama 48 jam menggunakan alat sumber terbuka.

타임라인

Spesifikasi dan Performa Benchmarking Kimi K3

  • Model ini dibangun di atas arsitektur Kimi Delta Retention and Attention Residuals.
  • Kimi K3 menempati posisi ketiga dalam indeks pengodean, indeks agen, dan indeks kecerdasan di bawah Fable dan Soul.
  • Kemampuan model mencakup pengodean jangka panjang, penalaran, dan visi bawaan.

Kimi K3 diperkenalkan sebagai model terbuka pertama di dunia dengan parameter kelas 3 triliun. Pengujian tolok ukur pihak ketiga mengonfirmasi skor indeks pengodean sebesar 76,2, yang menempatkannya di posisi kompetitif dibandingkan model tertutup seperti Fable 5 dan GPT 5.6.

Analisis Biaya dan Efisiensi API

  • Biaya input API dipatok pada $3 per juta token dan $15 per juta token output.
  • Struktur harga ini lebih ekonomis dibandingkan Fable 5, Opus 4.8, dan GPT 5.6.
  • GLM 5.2 tetap menjadi alternatif yang lebih murah dengan biaya setengah dari Kimi K3.

Meskipun harganya lebih tinggi dibandingkan model terbuka lain seperti GLM 5.2, Kimi K3 menawarkan rasio biaya per tugas yang kompetitif dibandingkan model tertutup mutakhir. Penggunaan API menjadi opsi utama mengingat besarnya kebutuhan komputasi model ini untuk dijalankan secara lokal.

Uji Coba Praktis: Pengembangan Aplikasi

  • Pembuatan game balap 3.js membutuhkan waktu 35 menit dengan biaya $1,24.
  • Dasbor manajemen keuangan diselesaikan dalam 56 menit dengan biaya $1,30.
  • Model ini secara mandiri memilih tumpukan teknologi seperti React dan Express.js dalam pembuatan aplikasi.

Pengujian mencakup pembuatan game balap Formula 1 dan dasbor keuangan full-stack. Hasil menunjukkan bahwa Kimi K3 mampu menghasilkan kode fungsional, meskipun terkadang memerlukan instruksi spesifik terkait penggunaan pustaka atau metode basis data tertentu agar sesuai dengan standar produksi.

Kemampuan Otonom dan Proyek Masa Depan

  • Kimi K3 berhasil merancang chip secara otonom dalam siklus 48 jam.
  • Perilisan bobot model secara terbuka direncanakan di masa depan.
  • Performa model dalam basis kode produksi dianggap setara dengan model tertutup kelas atas.

Selain pengembangan perangkat lunak, Kimi K3 menunjukkan kemampuan dalam tugas teknis berat seperti verifikasi desain chip. Pengembang berkomitmen untuk merilis bobot model ini ke publik, yang diprediksi akan menjadi tantangan besar bagi dominasi laboratorium AI tertutup.

커뮤니티 글

모든 글 보기