스크립트
00:00:00Kimi K3 telah hadir dan sejujurnya, yang satu ini cukup mengejutkan. Model ini tidak hanya menyamai Opus dan
00:00:04GPT 5.5, tetapi juga menyamai Fable dan GPT 5.6. Model terbuka tidak tertinggal sejauh yang kita
00:00:10duga sebelumnya. Mari kita lihat. Mari mulai dengan pengumumannya. Kimi K3 adalah model dengan 2,8 triliun
00:00:19parameter yang dibangun di atas Kimi Delta Retention and Attention Residuals dengan kemampuan
00:00:24visi bawaan dan jendela konteks 1 juta token. Ini adalah model kelas 3 triliun terbuka pertama di dunia
00:00:29yang dirancang untuk kecerdasan mutakhir dalam pengodean jangka panjang, pekerjaan pengetahuan, dan penalaran.
00:00:34Pada semua tolok ukur yang mereka tunjukkan di blog ini, Kimi K3 tertinggal di belakang Fable
00:00:38dan GPT 5.6 Soul atau bahkan mengungguli mereka di beberapa area lain. Ini adalah lompatan yang sangat gila
00:00:43yang menurut saya tidak banyak diprediksi orang. Namun, ini jelas berdasarkan tolok ukur mereka sendiri, jadi mari kita lihat
00:00:47kecerdasan buatan dan tolok ukur pihak ketiga kita, dan saya senang mengatakan hasilnya cukup
00:00:52cocok. Pada tolok ukur ini kita bisa melihat bahwa sekitar 80% dari Anda yang menonton ini belum berlangganan
00:00:56jadi silakan klik tombol berlangganan itu jika Anda ingin tetap mendapatkan informasi terbaru tentang segala hal terkait pengembangan perangkat lunak
00:01:00dan AI. Namun, mari beralih ke tolok ukur yang sebenarnya, dimulai dengan indeks pengodean yang mencetak skor 76,2 pada
00:01:06tolok ukur ini, yaitu 0,3 poin di belakang Fable 5 dan sedikit lebih tinggi dari GPT 5.5, lebih dari Opus 4.8, dan
00:01:12lebih dari GPT 5.6 Luna dan hanya sedikit kalah dari GPT 5.6 Soul dan Terra. Lihatlah lompatan yang mereka
00:01:19buat dari model mereka sebelumnya. Jika kita kemudian melihat indeks agen, ceritanya sama.
00:01:23Model ini berada di urutan ketiga, hanya kalah dari Fable dan Soul, tetapi itu benar-benar masih mengesankan dan Anda
00:01:29sudah terbiasa dengan ini sekarang, tetapi hasilnya persis sama pada indeks kecerdasan juga. Jadi bahkan pihak
00:01:32ketiga tolok ukur mengonfirmasi bahwa model ini luar biasa. Sayangnya, kita belum memiliki hasil deep SWE saat
00:01:38rekaman ini dibuat, tetapi jika kita melihat tolok ukur kita sendiri, Anda dapat melihat bahwa model ini kembali menempati posisi ketiga.
00:01:42Model ini tampaknya terlalu bagus untuk menjadi kenyataan. Satu-satunya kekurangan yang dapat saya temukan pada model ini adalah
00:01:46bahwa model ini sedikit mahal. Kecuali Anda memiliki superkomputer di rumah Anda, saya rasa Anda
00:01:50tidak akan menjalankan model ini secara lokal, jadi jika Anda menggunakan API, harganya sebenarnya $3 untuk
00:01:54satu juta token input dan $15 untuk satu juta token output. Ini adalah peningkatan yang cukup besar dari Kimi K 2.6
00:02:00dan harganya sekitar sama dengan Sonic 5 saat diskon itu berakhir, tetapi lebih murah daripada Fable 5,
00:02:06Opus, dan GPT 5.6. Harga API juga bukan segalanya, jadi jika kita melihatnya dalam praktik dengan biaya
00:02:12per tugas di sini, sebenarnya mirip dengan GPT 5.6 Soul dan harganya sekitar setengah dari Opus 4.8 dan tentu saja
00:02:17lebih murah daripada Fable dan Sonic 5. Jadi, model ini kompetitif dengan model-model tertutup mutakhir tersebut, tetapi
00:02:22bagi Anda yang menyukai model terbuka karena sedikit lebih murah, model ini mungkin
00:02:26tidak cocok untuk Anda. GLM 5.2 adalah pilihan terbaik kedua di sini dan harganya setengahnya. Ini juga bukan
00:02:31model tercepat yang pernah ada, tetapi bagi saya, tampaknya cukup kompetitif untuk tingkat kecerdasan ini.
00:02:36Secara keseluruhan, sejujurnya cukup sulit untuk mengatakan sesuatu yang negatif tentang model ini, jadi mari kita langsung
00:02:40masuk dan melihat beberapa pengujian lokal saya. Tes pertama yang saya berikan kepada model-model ini adalah membuatkan saya
00:02:44permainan balap Formula 1 lengkap dalam 3.js yang semuanya ada dalam satu file index.html dan ini adalah Kimi K3 yang berjalan
00:02:50melalui Open Router. Saya juga mengujinya di Kimi Code, CLI itu, hanya untuk melihat apakah harness-nya mengubah
00:02:56apa pun. Anda bisa melihat di bawah sini bahwa model ini berpikir selama 14 menit sebelum memulai dan secara keseluruhan butuh waktu
00:03:0035 menit untuk membuat aplikasi web 3.js ini dan menghabiskan $1,24 dalam token API. Dan hasil yang saya dapatkan
00:03:06cukup mengesankan. Jelas ini tidak memiliki akses ke aset eksternal apa pun, jadi ia melakukan yang terbaik dalam membuat
00:03:11model-model ini. Namun, lintasannya memang berfungsi. Kita memiliki pembalap AI kita dan mereka tampaknya bisa mengitari
00:03:16lintasan. Anda bisa melihat penghalang sebenarnya berfungsi sehingga saya tidak bisa menembusnya. Posisi kita terus diperbarui.
00:03:21Kita memiliki peta yang diperbarui. Kita memiliki waktu saat ini yang diperbarui serta putaran juga. Saya telah melakukan
00:03:25satu putaran penuh dan mengonfirmasi bahwa semuanya berfungsi. Jadi ini hasil yang cukup bagus untuk apa yang diberikan Kimi K3 kepada kita.
00:03:30Seperti yang saya katakan, saya juga menguji harness yang berbeda. Jadi ini adalah Kimi K3 tetapi di Kimi Code. Dan yang satu ini
00:03:35menurut saya terlihat sedikit lebih bagus. Model ini melakukan pekerjaan yang lebih baik dengan aset meskipun itu hanya
00:03:39panduan gaya. Ada sedikit lag di sana dengan model-model tersebut tetapi penanganannya sedikit lebih baik.
00:03:43Kontrolnya masih terbalik dan sebenarnya tampaknya menjadi pola di banyak aplikasi 3.js ini
00:03:48karena suatu alasan. Namun sekali lagi, semua ini tertangani dengan sangat baik dan memiliki fitur seperti keluar
00:03:52dari lintasan akan memperlambat saya. Dan ya, model ini juga melakukan pekerjaan yang cukup mengesankan. Tapi sekarang mari kita
00:03:57bandingkan ini dengan model-model mutakhir. Kita memiliki Fable 5 di sini dalam Claude Code yang berada pada pengaturan maksimal dan butuh waktu
00:04:0144 menit untuk membuat aplikasi 3.js saya. Kemudian kita juga memiliki GPT 5.6 Soul pada pengaturan maksimal juga. Dan ini
00:04:07butuh waktu 18 menit. Ini adalah hasil yang diberikan Fable kepada saya. Jadi kita memiliki Fable GP di sini. Dan saya akan mengatakan
00:04:12bahwa itu terlihat sedikit lebih bagus mungkin. Namun sekali lagi, semua ini hanyalah pilihan gaya. Dan kontrolnya
00:04:17sebenarnya tidak terbalik dalam yang satu ini. Ada juga sedikit goyangan kamera yang menurut saya adalah gaya
00:04:22yang bagus. Dan sekali lagi semuanya tampak berfungsi dalam yang satu ini seperti semua yang lain. Saya telah menguji melakukan
00:04:26satu putaran penuh dari ini sesulit apa pun itu. Kita juga memiliki beberapa tabrakan di sini seperti yang bisa Anda lihat. Tapi ya
00:04:31semuanya tampak berfungsi dan cukup sebanding dengan apa yang diberikan Kimi K3 kepada kita. Ceritanya serupa
00:04:35dengan GPT 5.6 Soul. Seperti yang Anda lihat, kita memiliki permainan yang berfungsi di sini. Meskipun saya akan mencatat bahwa jalan di sini
00:04:40adalah rumput. Itu tidak benar-benar merendernya. Dan semuanya tampak berfungsi. Kontrolnya
00:04:44terbalik pada yang satu ini juga. Dan kita juga memiliki beberapa aset yang terbalik. Saya tidak tahu mengapa model-model ini
00:04:48tampaknya suka melakukan itu. Satu-satunya yang tidak melakukannya adalah Fable. Dan juga lintasan di sini menjadi sedikit
00:04:53kacau. Jadi ini sebenarnya satu-satunya yang tidak membuatkan saya lintasan yang berfungsi. Sebagai perbandingan terakhir,
00:04:57saya juga memeriksa apa yang akan diberikan GLM 5.2 kepada saya karena itu adalah model terbuka terbaik berikutnya. Dan yang satu ini
00:05:02berpikir selama 5 menit 58 detik. Meskipun tidak menyelesaikannya dalam satu prompt. Sebenarnya ada
00:05:07beberapa bug. Jadi saya harus kembali dengan prompt lain. Bahkan ketika saya akhirnya membuat permainan berjalan
00:05:11Anda bisa melihat bahwa ada banyak bug di sini. Pertama-tama kita tidak memulai dengan cara yang benar di lintasan.
00:05:15Dan tidak ada lintasan untuk memulai. Dan juga terlihat jauh lebih buruk daripada yang lain.
00:05:20Jadi ada sedikit peningkatan ketika kita beralih ke Kimi K3. Namun beralih ke tes 2. Saya meminta
00:05:25dasbor manajemen keuangan pribadi. Ini akan membangun aplikasi full stack dengan front
00:05:29end dan back end. Satu-satunya hal yang saya katakan tidak saya inginkan adalah autentikasi. Dan saya juga memintanya untuk memasukkan beberapa data.
00:05:33Saya melakukan ini lagi di open router dengan K3. Dan kemudian juga di Kimi code. Jadi ini ada di open
00:05:38router. Dan Anda bisa melihat totalnya butuh 56 menit untuk membuatkan saya aplikasi tersebut. Dan juga menghabiskan
00:05:43biaya $1,30 bagi saya. Namun ini adalah hasil yang mereka berikan. Dan sejujurnya saya tidak bisa benar-benar mengeluh tentang ini.
00:05:48Ini persis seperti yang saya minta. Ini adalah dasbor manajemen keuangan pribadi. Menurut saya tampilannya
00:05:53terlihat sangat bagus juga. Dan kita memiliki semua fitur seperti halaman tambahan di sini. Dan saya telah
00:05:57memeriksa penambahan dana dan pengiriman uang. Semuanya berfungsi. Jadi model ini telah melakukan pekerjaan yang sangat baik. Sekarang saya juga
00:06:01selalu ingin tahu alat apa yang digunakannya untuk menyelesaikan tugas tersebut. Karena saya sebenarnya tidak memberikannya
00:06:05instruksi tentang tumpukan teknologi apa yang digunakan dalam prompt. Anda bisa melihat untuk front end di sini, model ini menggunakan
00:06:09react dan react dom. Itu tidak benar-benar menggunakan router atau semacamnya. Sebenarnya ia membangun
00:06:12sistem tampilannya sendiri. Jadi saya mungkin akan lebih suka jika Anda menggunakan sesuatu seperti react router,
00:06:16tan stack atau next.js. Dan kemudian di back end ia juga membangun servernya sendiri. Saya percaya
00:06:21yang satu ini menggunakan express.js seperti yang bisa kita lihat di bawah sini. Tapi kemudian ia juga membangun basis datanya hanya menggunakan
00:06:26file JSON. Tidak menggunakan SQLite atau semacamnya atau drizzle yang mungkin ingin saya
00:06:31lihat jika kita ingin menskalakan aplikasi ini di masa depan. Tapi sekali lagi jelas saya tahu bahwa saya bisa
00:06:35memberikan itu dalam prompt. Tapi saya selalu suka melihat apa yang akan mereka pilih sebagai default. Ini adalah
00:06:38hasil yang sebenarnya saya dapatkan menggunakan K3 melalui Kimi code. Dan Anda bisa melihat yang satu ini sebenarnya sedikit lebih sederhana.
00:06:43Hanya satu halaman dan tidak memiliki bilah samping kita. Sekali lagi semua fitur berfungsi dan memiliki
00:06:47tampilan yang cukup mirip dengan apa yang kita dapatkan dari open router. Namun melihat kodenya,
00:06:51saya sebenarnya lebih suka apa yang diberikan Kimi code kepada kita di sini dengan K3. Ini memiliki front end yang cukup mirip di mana
00:06:55hanya menggunakan react dan tidak ada pustaka perutean. Tapi servernya sebenarnya menggunakan basis data. Anda bisa melihat
00:06:59ia dibangun dengan express di sini. Kita sebenarnya memiliki basis data keuangan dan sebenarnya menggunakan node
00:07:04SQLite. Sekarang jika Anda membandingkan ini dengan model mutakhir lagi, yang satu ini adalah Fable 5 di Claude code.
00:07:08Anda bisa melihat ia bekerja selama 56 menit pada upaya maksimal itu. Dan kemudian saya juga memiliki GPT 5.6 soul max
00:07:13di mana ia berpikir selama 31 menit untuk membuat aplikasi tersebut. Ini adalah apa yang diberikan Fable 5 kepada kita dan
00:07:17sejujurnya desainnya cukup mirip. Maksud saya tidak banyak lagi yang bisa Anda lakukan dengan
00:07:21dasbor keuangan pribadi. Dan semua fitur berfungsi di sini. Ini sebenarnya menggunakan sedikit
00:07:25gaya yang berbeda untuk font yang sering saya lihat dilakukan Fable dan Opus akhir-akhir ini. Mereka tampaknya
00:07:29melatihnya kembali untuk menjauh dari beberapa tampilan AI sebelumnya yang mereka miliki dan mereka sedang membangun
00:07:34tampilan AI baru. Dan ini tampaknya adalah yang mereka pilih. Saya akan mengatakan grafik ini sebenarnya sedikit
00:07:38lebih tidak berguna daripada yang kita dapatkan dari Kimi K3. Tapi secara keseluruhan tampilannya cukup mirip dan berfungsi
00:07:43pada dasarnya sama. Bahkan kodenya cukup mirip. Anda bisa melihat ia memilih React untuk front
00:07:47end dan ia tidak benar-benar menggunakan router juga. Ia menulis miliknya sendiri. Dan kemudian juga di basis data ia
00:07:51berhasil menggunakan basis data dengan benar. Jadi kita menggunakan Node SQL dalam yang satu ini juga. Dan untuk
00:07:57server yang sebenarnya, hanya menjalankan Express 2. Namun beralih ke GPT 5.6 soul. Yang satu ini sedikit
00:08:02aneh. Ini jelas desain favorit saya di antara semuanya. Dan sekali lagi semua fitur
00:08:06berfungsi. Beri tahu saya jika Anda setuju bahwa ini adalah desain terbaik. Tapi bagian anehnya ada pada kodenya.
00:08:11Ini jelas merupakan kode aplikasi paling lengkap yang pernah kita lihat dalam contoh-contoh ini. Model ini
00:08:15sebenarnya membangun aplikasi NextJS lengkap dan menggunakan Drizzle persis seperti yang akan saya lakukan. Dan ia menggunakan NextJS
00:08:20juga untuk front end serta server. Tapi bagian yang menurut saya sedikit aneh adalah bahwa ia
00:08:24memilih untuk meng-host-nya di Cloudflare yang tidak aneh dengan sendirinya, tetapi ia juga menggunakan for Next. Dan itu tidak
00:08:29necessarily bahwa saya tidak akan merekomendasikan itu. Saya hanya berpikir itu sedikit belum teruji. Dan cukup
00:08:33baru yang menunjukkan bahwa mereka sebenarnya mendorong GPT 5.6 soul untuk menggunakan ini. Dan saya hanya bisa berspekulasi tentang
00:08:38mengapa, tetapi tampaknya mungkin karena begitulah cara situs ChatGPT sebenarnya bekerja. Anda bisa
00:08:42melihat di sini sebenarnya memutuskan untuk meng-host ini untuk saya di fitur situs ChatGPT itu meskipun saya tidak memintanya
00:08:47untuk melakukannya. Secara pribadi saya tidak terlalu menyukai itu ketika saya sedang mengodekan aplikasi. Saya tidak ingin
00:08:50itu meng-host-nya untuk saya. Saya lebih suka menangani semua itu sendiri. Tapi saya bisa saja meminta itu dalam
00:08:54prompt. Saya lebih suka jika saya harus memintanya untuk meng-host-nya daripada sebaliknya.
00:08:58Hasil akhir yang saya miliki di sini adalah GLM 5.2 dan yang satu ini telah melakukan hal yang cukup mirip dengan apa yang dilakukan Kimi K3
00:09:04di Kimi Code di mana ia hanya membangun halaman tunggal ini. Tapi sekali lagi semua fitur berfungsi dan saya memang
00:09:08berpikir desain ini cukup bagus. GLM 5.2 sebenarnya membutuhkan waktu 15 menit untuk melakukan ini dan Anda bisa melihat harganya
00:09:13satu dolar sebelas sen bagi saya. Untuk kode yang sebenarnya GLM 5.2 memilih untuk menempuh jalur Next.js juga
00:09:19yang sebenarnya saya sukai. Tapi ia memang membangun penyimpanan sendiri alih-alih menggunakan basis data. Jadi semua ini
00:09:24hanya ada di memori dalam JavaScript. Jadi dari tes singkat saya di sana, saya pikir Kimi K3 memang berdiri bersama Fable
00:09:29dan GPT 5.6 Sol dan memenuhi hype yang diberikan tolok ukur kepadanya. Dan sejujurnya mulai
00:09:33cukup sulit untuk menunjukkan kepada Anda betapa kuatnya model-model ini dalam demonstrasi video. Anda cenderung
00:09:38harus menggunakannya selama satu minggu dalam basis kode produksi untuk benar-benar melihat kualitas
00:09:42kodenya. Jika Anda memiliki ide untuk tes yang bisa saya tunjukkan dalam video yang sebenarnya
00:09:46menguji model-model ini dengan tes yang sulit, beri tahu saya di komentar di bawah. Saya juga ingin
00:09:50menunjukkan beberapa contoh yang mereka miliki di blog teknologi mereka. Anda bisa melihat Kimi
00:09:53K3 membangun permainan ini di sini tetapi memang memiliki alat lain untuk benar-benar menghasilkan aset ini sehingga koboi dan
00:09:58kuda itu tidak dihasilkan oleh K3. Mereka berasal dari tempat lain. Anda bisa melihat ia telah melakukan pekerjaan yang sangat baik
00:10:03dengan ini dalam 3GS. Dan hal lain yang gila adalah desain chip ini. Anda bisa melihat sebagai bukti konsep awal
00:10:08Kimi K3 merancang chip untuk melayani model nano yang dibangun di atas arsitekturnya sendiri. Dalam satu
00:10:13kali jalan otonom 48 jam K3 membangun, mengoptimalkan, dan memverifikasi chip menggunakan alat sumber terbuka. Jadi semoga
00:10:19Anda telah melihat bahwa model ini benar-benar luar biasa dan pasti akan menjadi pukulan bagi
00:10:23laboratorium tertutup mutakhir ini. Atau setidaknya akan terjadi saat mereka benar-benar merilis bobotnya. Mereka belum
00:10:27merilisnya tetapi mereka memang berencana untuk melakukannya. Jadi saya harap kita melihatnya segera. Apa pendapat Anda
00:10:32tentang ini? Apakah Anda berharap lab Tiongkok akan menyusul secepat ini? Dan apakah model ini menarik bagi Anda?
00:10:36Beri tahu saya di komentar di bawah. Sambil Anda di sana, berlanggananlah. Dan seperti biasa, sampai jumpa di video berikutnya.