Opus 5 Beats Fable... at Half the Price?
BBetter Stack
Computing/SoftwareBusiness NewsInternet Technology
Transcript
00:00:00Anthropic baru saja merilis Claude Opus 5, dan model ini bisa jadi lebih baik dari Fable meskipun
00:00:04harganya separuhnya. Jika benar, ini akan jadi model favorit baru saya, mari kita cari tahu.
00:00:13Beginilah cara mereka mendeskripsikan Opus 5. Opus 5 adalah model yang cermat dan proaktif yang
00:00:18mendekati kecerdasan terdepan Claude Fable 5 dengan separuh harga. Pada evaluasi pengodean dan kerja pengetahuan
00:00:23seperti Frontier Bench dan GDP Val, Opus 5 menjadi standar tercanggih baru yang masih
00:00:28di belakang Mythos 5 dalam tugas keamanan siber. Opus 5 dirancang untuk digunakan setiap hari, bekerja lebih
00:00:33efisien daripada model lain, dan menjadi model bawaan baru di Claude Max serta model terkuat
00:00:38pada paket Claude Pro. Setelah ini, mereka menampilkan hasil tolok ukur, dan Opus 5 unggul di banyak aspek,
00:00:43meskipun Fable 5 ada di sana, dan keunggulannya pun tidak sedikit. Menurut
00:00:47mereka, Opus 5 hampir 10% lebih baik di Frontier Bench dibanding Fable 5, tapi salah satu yang paling mengejutkan bagi saya
00:00:52adalah skornya di Arc AGI. Opus 4.8 meraih 1,5% di sini, sedangkan Sol meraih 7,8%, yang merupakan skor tertinggi
00:01:00sebelumnya, tetapi Opus 5 meraih 30,2%. Tim di balik tolok ukur ini menunjukkan bahwa Opus memiliki
00:01:06kemampuan baru yang belum pernah mereka lihat pada model lain, di mana ia mengubah tes ini menjadi
00:01:10notasi aljabar untuk melakukan penalaran logis tingkat lanjut. Ini sangat mengesankan.
00:01:15Omong-omong, jika Anda bertanya-tanya mengapa Fable tidak ada di sini, itu karena kebijakan retensi data
00:01:19Fable. Arc AGI tidak ingin mengambil risiko membocorkan detail tolok ukur tersebut ke Anthropic, tetapi
00:01:24kabar baiknya, Opus 5 tidak memiliki persyaratan retensi data untuk akses umum. Hal itu akan
00:01:29membuat banyak orang sangat senang. Selanjutnya, mari kita lihat tolok ukur pihak ketiga dari
00:01:33Artificial Analysis. Pada indeks pengodean, Opus 5 berada di urutan kedua, hanya kalah 0,3 poin dari GPT 5.6 Sol
00:01:39Extra High, tetapi berhasil mengalahkan Fable sebesar 1,5 poin, dan menunjukkan peningkatan pesat dibanding Opus 4.8.
00:01:45Apresiasi untuk Kimi K3 di sini karena berhasil bersaing dengan nama-nama besar. Saya sempat membuat video tentang itu
00:01:49saat dirilis, jadi pastikan Anda berlangganan agar tetap terinformasi dengan kabar AI dan
00:01:52pengembang. Jika kita melihat indeks agen, Opus 5 justru memimpin
00:01:57di sini, sedikit lebih unggul dari Fable 5 dan mengalahkan model Sol dari OpenAI. Hal yang sama
00:02:02juga terjadi pada indeks kecerdasan, di mana Opus 5 memimpin di sana. Jadi dari segi performa,
00:02:06Opus 5 tampak seperti model yang sangat bagus, dan sejujurnya, saya cukup terkejut. Dulu saya
00:02:11memperkirakan Fable bakal jadi fokus utama mereka sekarang, dan Opus akan menjadi semacam model Sonic
00:02:15baru, tetapi sekarang Fable dan Opus tampak hampir seimbang, setidaknya sampai kita memperhitungkan
00:02:19harganya. Jika kita melihat biaya penyelesaian tugas pada Artificial Analysis, Opus
00:02:235 sebenarnya 72 sen lebih murah daripada Fable 5, dan hanya sedikit lebih mahal dari
00:02:28Opus 4.8. Menurut saya, jika mencari efisiensi harga dan performa, GPT 5.6 Sol
00:02:33masih menjadi pemenang di sini, dengan biaya hampir separuh dari harga Opus 5. Anda bisa melihatnya
00:02:37pada grafik ini di mana kuadran hijau adalah yang paling menarik, model GPT berada tepat di sana,
00:02:42bersama Kimi K3, sedangkan model Anthropic memiliki bagian tersendiri di sisi harga yang lebih
00:02:46tinggi. Cursor Bench juga mencerminkan semua tolok ukur yang telah kita lihat. Di
00:02:50sini, Opus 5 Max mendapat skor yang hampir sama persis dengan Fable 5, tetapi Fable berbiaya $17 untuk
00:02:56tugas tersebut, sementara Opus berbiaya $8. Omong-omong, harganya sendiri sama dengan Opus 4.8, yaitu
00:03:01$5 untuk satu juta token input, dan $25 untuk satu juta token output, jadi jika Anda menyukai
00:03:06Opus 4.8, saya rasa tidak ada alasan bagi Anda untuk tidak menggunakan model ini. Sebagai penggemar
00:03:10Fable 5, saya sendiri pasti akan sering menggunakan Opus 5 untuk menghemat langganan
00:03:14dan kredit saya agar tidak cepat habis. Sejujurnya, perkiraan terbaik saya tentang Fable versus Opus
00:03:18adalah Fable masih akan menjadi model teratas jika Anda menginginkan penyelesaian masalah rumit jangka panjang,
00:03:23tetapi untuk 95% pekerjaan, Opus 5 kini bisa menggantikannya. Namun, mari kita lihat
00:03:28penerapannya secara langsung melalui beberapa pengujian lokal. Pengujian pertama yang saya lakukan adalah meminta model membuat
00:03:32game balap Formula 1 lengkap dalam satu berkas HTML menggunakan Three.js. Di akhir nanti saya akan membahas durasi pengerjaan
00:03:37setiap model serta biayanya pada API, tetapi mari kita lihat dulu
00:03:40hasilnya. Ini adalah hasil yang berikan Opus 5, dan harus saya akui bahwa saya sangat
00:03:45terkesan dengan model ini. Model ini tidak menggunakan aset eksternal atau semacamnya. Semuanya
00:03:50dikerjakan oleh Opus 5, dan semuanya terlihat sangat bagus. Tata letak treknya memang sedikit terbalik,
00:03:55tetapi kendalinya sangat baik. Waktu putaran, posisi, dan urutannya berfungsi dengan baik,
00:03:59semuanya berjalan lancar. Ya, kita memang mengemudi di bawah rumput di sini, tetapi tabrakannya berfungsi,
00:04:03dan sebenarnya ada lintasan di bawah rumput ini, jadi saya bisa memperbaikinya dengan mudah lewat perintah.
00:04:07Selain itu, jebakan kerikilnya juga berfungsi sangat baik. Sejujurnya, saya sangat terkesan dengan
00:04:12hasil dari Opus 5 ini. Menurut saya, mobil-mobil F1 ini terlihat paling bagus dibanding yang lainnya.
00:04:16Namun, silakan Anda nilai sendiri. Ini adalah hasil yang berikan Fable. Menurut saya yang satu ini juga sangat
00:04:20bagus tata letak treknya, tetapi mobilnya sedikit lebih sederhana dibanding buatan Opus 5.
00:04:25Saya sebenarnya menyukai efek goyangan kamera saat kita berbelok, dan sekali lagi, semua
00:04:28fitur lainnya berfungsi, seperti posisi dan waktu di lintasan. Jadi Fable 5 juga
00:04:33melakukan tugasnya dengan sangat baik, tetapi sejujurnya saya lebih menyukai buatan Opus. Ini adalah hasil
00:04:37yang saya dapatkan dari GPT 5.6 Sol pada performa maksimal. Model ini melakukan tugasnya dengan baik pada
00:04:43pemodelan dan sudut pandang kamera, tetapi Anda bisa melihat bahwa lintasannya tidak ada, dan beberapa
00:04:47asetnya terbalik. Selain itu, di tengah lintasan, jalurnya terputus. Hasilnya
00:04:51lebih buruk menurut saya dibanding Fable dan Opus. Saya yakin Opus masih
00:04:56menjadi pemenang di sini. Model terakhir yang saya uji adalah Kimi K3, dan inilah hasil yang ditiapkannya,
00:05:01dan sejujurnya, sangat mengesankan untuk sebuah model dengan bobot terbuka. Hasil pengerjaannya cukup baik,
00:05:05hampir mirip dengan GPT 5.6 Sol. Pembatasnya berfungsi, lintasannya berfungsi, dan hal-hal lain seperti
00:05:09posisi kendaraan semuanya berjalan baik. Model ini membuatkan game yang cukup bagus dalam satu kali percobaan. Jika kita lihat
00:05:14biaya dan waktu pengerjaannya, Opus 5 menghabiskan waktu 46 menit 51 detik
00:05:19untuk menyelesaikan game F1 tersebut, dan memakan biaya sekitar $12,99 jika menggunakan API. Jadi bagi saya,
00:05:25Opus 5 sebenarnya lebih mahal dibanding Fable pada kasus ini, dan setelah diperiksa, itu terjadi karena Opus 5
00:05:30menggunakan token lima kali lebih banyak. Saya sangat berharap ini hanya kasus khusus, karena tolok ukur lain tidak
00:05:35menunjukkan hal serupa. Perlu saya tambahkan bahwa saya menghitung biaya model Claude tersebut menggunakan alat penggunaan
00:05:39Claude Code, jadi mungkin ada sedikit ketidakakuratan karena Anda tidak mendapatkan harga pasti saat
00:05:44menggunakan langganan. Seperti yang saya katakan sebelumnya, model-model ini masih tergolong premium, jadi jika memilih
00:05:49yang seperti GPT 5.6, Anda akan mendapatkan model yang lebih cepat dan murah, tetapi hasilnya,
00:05:54menurut saya, lebih buruk. Mari kita coba pengujian lainnya. Kali ini, saya meminta mereka membuat dasbor
00:05:58manajemen keuangan pribadi, yang akan menjadi aplikasi full-stack dengan antarmuka depan dan sistem
00:06:02belakang, dan saya juga mencantumkan beberapa fitur yang bisa mereka tambahkan di sini. Inilah hasil yang saya dapatkan
00:06:06menggunakan Opus 5, dan sejujurnya, saya harus mengakui bahwa saya cukup terkesan. Saya sangat menyukai antarmuka ini, gaya
00:06:11seperti inilah yang saya sukai secara pribadi. Tulis di kolom komentar jika Anda juga menyukainya, dan semuanya
00:06:15berfungsi sepenuhnya. Saya sudah menguji semuanya dan berfungsi, dan kami memiliki halaman terpisah untuk setiap
00:06:20fitur yang saya minta di sini, dan sekali lagi, semua fitur berfungsi antara antarmuka depan dan
00:06:24sistem belakang, dan saya sangat suka gaya antarmuka yang dipilihnya. Menurut saya ini yang terbaik dari
00:06:28semuanya. Untuk kodenya sendiri, model ini menggunakan React dan React Router pada sistem depan, yang sangat
00:06:33saya sukai, dan di sistem belakang, model ini mendapat poin plus karena menggunakan basis data sungguhan. Model ini menggunakan
00:06:37Node SQLite untuk basis datanya, dan untuk servernya menggunakan Express. Ini adalah hasil
00:06:42yang diberikan Fable 5, dan saya lebih menyukai antarmuka Opus 5, tetapi yang satu ini juga tidak terlalu buruk,
00:06:48meskipun grafik-grafik ini agak tidak berguna. Grafik di bagian bawah ini cukup bagus, dan sekali lagi,
00:06:53semua fitur ini berfungsi. Menurut saya Opus 5 memberikan lebih banyak perhatian pada tampilan antarmuka, dan
00:06:57jelas lebih unggul di aspek itu. Dalam kodenya, Fable melakukan hal yang serupa dengan Opus 5, yaitu menggunakan
00:07:01React, tetapi model ini tidak memilih pustaka routing. Model ini justru membuat pustaka routing
00:07:05kecil sendiri. Saya sebenarnya lebih suka jika model tetap menggunakan sesuatu seperti React Router,
00:07:09lalu untuk basis datanya, Fable melakukan hal serupa dengan menggunakan Node SQLite di sini, dan yang satu ini
00:07:13juga dibangun di atas Express, jadi sistem belakangnya cukup mirip, tetapi menurut saya Opus memilih
00:07:18teknologi yang lebih baik untuk antarmuka depan. Ini yang diberikan GPT 5.6 Sol, dan harus saya akui bahwa yang satu ini sangat bagus
00:07:22desain antarmukanya. Sangat mampu menyaingi Opus. Hanya saja gayanya berbeda, jadi ini
00:07:26kemungkinan besar tergantung selera pribadi, tetapi saya sangat menyukai yang satu ini. Model ini melakukan pekerjaan luar biasa
00:07:31dalam merancang seluruh antarmuka, dan sekali lagi, semua fiturnya berfungsi, tetapi yang satu ini
00:07:35tidak menggunakan halaman terpisah untuk setiap fitur individual. Model ini hanya mengarahkan ke bagian
00:07:38halaman yang berbeda. Pilihan teknologinya juga paling unik dibanding yang lain. Model ini memilih NextJS dengan
00:07:43kombinasi Drizzle untuk basis datanya yang sangat saya sukai, dan itu pendekatan yang cukup tepat untuk
00:07:47aplikasi seperti ini. Namun, model ini juga menggunakan Cloudflare dan Vinext untuk proses hosting-nya, yang menurut saya
00:07:52agak aneh, karena seperti yang bisa Anda lihat, Vinext masih sangat baru dan belum teruji,
00:07:56dan mereka pasti memasukkan instruksi tertentu agar memaksanya menggunakan Cloudflare
00:08:00dan Vinext. Seperti yang saya sampaikan di video Kimi K3, itu mungkin terjadi karena seperti itulah cara kerja situs ChatGPT
00:08:04milik mereka sendiri. Terakhir, model yang saya uji adalah Kimi K3, dan inilah hasil yang kami
00:08:09dapatkan, dan menurut saya hasilnya sangat baik. Antarmuka ini mirip dengan apa yang biasa saya dapatkan dari
00:08:14GPT 5.4 atau 5.5, jadi menurut saya sedikit tertinggal dalam desain antarmuka, tetapi sekali lagi, semua
00:08:19fiturnya berfungsi, dan saya tidak bisa terlalu mengeluhkan antarmuka ini. Tampilannya melakukan persis sesuai permintaan saya.
00:08:24Namun, kodenya mendapat sedikit nilai minus dari saya. Model ini memilih React untuk antarmuka depan,
00:08:28dan sekali lagi, membuat pustaka routing sendiri seperti Fable, tetapi saat kita melihat servernya,
00:08:32model ini hanya memiliki server Express, dan tidak membangun basis data menggunakan Node SQLite
00:08:36atau semacamnya. Model ini sebenarnya hanya membangun basis data sendiri menggunakan JavaScript, sehingga menyimpan
00:08:40semuanya ke berkas JSON. Itu jelas bukan pendekatan yang saya inginkan.
00:08:44Mengenai waktu dan harga dari model-model tersebut pada tes keuangan itu, Fable adalah yang termahal,
00:08:48dengan biaya $30,79 dan membutuhkan waktu 56 menit 55 detik, tetapi pada Opus, harganya tampak
00:08:55cukup mendekati Fable, yaitu memakan biaya $29,82 dan membutuhkan waktu lebih lama yaitu 59 menit 15
00:09:02detik. Model GPT menawarkan harga yang sangat terjangkau sebagai perbandingan, harganya sekitar tiga setengah kali lebih
00:09:07murah, dan saya sangat berharap persaingan ini akan mulai menekan harga Anthropic ke bawah.
00:09:11Jadi ini sedikit beragam bagi saya. Tentu saja, saya hanya menjalankan setiap tes satu kali, dan hanya melakukan dua tes,
00:09:16sehingga saya berharap tolok ukur Artificial Analysis lebih akurat, di mana harga Opus
00:09:20sepertiga dari harga Fable, tetapi saya pasti harus menggunakannya lebih sering untuk membuktikannya
00:09:24kembali. Mungkin ini hanya masalah alat yang saya gunakan untuk mengukur biayanya. Poin tambahan lain untuk Opus
00:09:28adalah tingkat ketegangannya sedikit lebih rendah untuk pekerjaan keamanan siber dibanding Fable 5. Batasan pengamanannya cukup
00:09:33serupa dengan Opus 4.8, kecuali beberapa pengaman yang lebih kuat pada kisaran tugas siber
00:09:37tertentu. Tampaknya, sistem pengamanan akan mengizinkan Opus 5 menemukan kerentanan pada kode sumber,
00:09:42tetapi akan memblokir pemindaian kerentanan berbasis biner, serta pengujian penetrasi dan
00:09:46pembuatan eksploit. Pengujian mereka menemukan bahwa pengklasifikasi mereka melakukan intervensi sekitar 85% lebih jarang
00:09:51dibandingkan pada Fable 5. Jadi begitulah, persaingan model AI saat ini benar-benar sangat
00:09:55mengesankan. Kita punya GPT 5.6 yang menunjukkan bahwa harga bisa ditekan, kita punya model terbuka seperti Kimi
00:10:00yang menyaingi pemain besar dalam kecerdasan, dan kita punya Anthropic yang terus mendorong batas
00:10:04kecerdasan lebih jauh lagi. Apa model favorit Anda, dan apakah Anda tertarik dengan Opus?
00:10:09Tulis di kolom komentar di bawah, dan jangan lupa berlangganan. Seperti biasa, sampai jumpa di video berikutnya.