Opus 5 Beats Fable... at Half the Price?

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

Transcript

00:00:00Anthropic baru saja merilis Claude Opus 5, dan model ini bisa jadi lebih baik dari Fable meskipun
00:00:04harganya separuhnya. Jika benar, ini akan jadi model favorit baru saya, mari kita cari tahu.
00:00:13Beginilah cara mereka mendeskripsikan Opus 5. Opus 5 adalah model yang cermat dan proaktif yang
00:00:18mendekati kecerdasan terdepan Claude Fable 5 dengan separuh harga. Pada evaluasi pengodean dan kerja pengetahuan
00:00:23seperti Frontier Bench dan GDP Val, Opus 5 menjadi standar tercanggih baru yang masih
00:00:28di belakang Mythos 5 dalam tugas keamanan siber. Opus 5 dirancang untuk digunakan setiap hari, bekerja lebih
00:00:33efisien daripada model lain, dan menjadi model bawaan baru di Claude Max serta model terkuat
00:00:38pada paket Claude Pro. Setelah ini, mereka menampilkan hasil tolok ukur, dan Opus 5 unggul di banyak aspek,
00:00:43meskipun Fable 5 ada di sana, dan keunggulannya pun tidak sedikit. Menurut
00:00:47mereka, Opus 5 hampir 10% lebih baik di Frontier Bench dibanding Fable 5, tapi salah satu yang paling mengejutkan bagi saya
00:00:52adalah skornya di Arc AGI. Opus 4.8 meraih 1,5% di sini, sedangkan Sol meraih 7,8%, yang merupakan skor tertinggi
00:01:00sebelumnya, tetapi Opus 5 meraih 30,2%. Tim di balik tolok ukur ini menunjukkan bahwa Opus memiliki
00:01:06kemampuan baru yang belum pernah mereka lihat pada model lain, di mana ia mengubah tes ini menjadi
00:01:10notasi aljabar untuk melakukan penalaran logis tingkat lanjut. Ini sangat mengesankan.
00:01:15Omong-omong, jika Anda bertanya-tanya mengapa Fable tidak ada di sini, itu karena kebijakan retensi data
00:01:19Fable. Arc AGI tidak ingin mengambil risiko membocorkan detail tolok ukur tersebut ke Anthropic, tetapi
00:01:24kabar baiknya, Opus 5 tidak memiliki persyaratan retensi data untuk akses umum. Hal itu akan
00:01:29membuat banyak orang sangat senang. Selanjutnya, mari kita lihat tolok ukur pihak ketiga dari
00:01:33Artificial Analysis. Pada indeks pengodean, Opus 5 berada di urutan kedua, hanya kalah 0,3 poin dari GPT 5.6 Sol
00:01:39Extra High, tetapi berhasil mengalahkan Fable sebesar 1,5 poin, dan menunjukkan peningkatan pesat dibanding Opus 4.8.
00:01:45Apresiasi untuk Kimi K3 di sini karena berhasil bersaing dengan nama-nama besar. Saya sempat membuat video tentang itu
00:01:49saat dirilis, jadi pastikan Anda berlangganan agar tetap terinformasi dengan kabar AI dan
00:01:52pengembang. Jika kita melihat indeks agen, Opus 5 justru memimpin
00:01:57di sini, sedikit lebih unggul dari Fable 5 dan mengalahkan model Sol dari OpenAI. Hal yang sama
00:02:02juga terjadi pada indeks kecerdasan, di mana Opus 5 memimpin di sana. Jadi dari segi performa,
00:02:06Opus 5 tampak seperti model yang sangat bagus, dan sejujurnya, saya cukup terkejut. Dulu saya
00:02:11memperkirakan Fable bakal jadi fokus utama mereka sekarang, dan Opus akan menjadi semacam model Sonic
00:02:15baru, tetapi sekarang Fable dan Opus tampak hampir seimbang, setidaknya sampai kita memperhitungkan
00:02:19harganya. Jika kita melihat biaya penyelesaian tugas pada Artificial Analysis, Opus
00:02:235 sebenarnya 72 sen lebih murah daripada Fable 5, dan hanya sedikit lebih mahal dari
00:02:28Opus 4.8. Menurut saya, jika mencari efisiensi harga dan performa, GPT 5.6 Sol
00:02:33masih menjadi pemenang di sini, dengan biaya hampir separuh dari harga Opus 5. Anda bisa melihatnya
00:02:37pada grafik ini di mana kuadran hijau adalah yang paling menarik, model GPT berada tepat di sana,
00:02:42bersama Kimi K3, sedangkan model Anthropic memiliki bagian tersendiri di sisi harga yang lebih
00:02:46tinggi. Cursor Bench juga mencerminkan semua tolok ukur yang telah kita lihat. Di
00:02:50sini, Opus 5 Max mendapat skor yang hampir sama persis dengan Fable 5, tetapi Fable berbiaya $17 untuk
00:02:56tugas tersebut, sementara Opus berbiaya $8. Omong-omong, harganya sendiri sama dengan Opus 4.8, yaitu
00:03:01$5 untuk satu juta token input, dan $25 untuk satu juta token output, jadi jika Anda menyukai
00:03:06Opus 4.8, saya rasa tidak ada alasan bagi Anda untuk tidak menggunakan model ini. Sebagai penggemar
00:03:10Fable 5, saya sendiri pasti akan sering menggunakan Opus 5 untuk menghemat langganan
00:03:14dan kredit saya agar tidak cepat habis. Sejujurnya, perkiraan terbaik saya tentang Fable versus Opus
00:03:18adalah Fable masih akan menjadi model teratas jika Anda menginginkan penyelesaian masalah rumit jangka panjang,
00:03:23tetapi untuk 95% pekerjaan, Opus 5 kini bisa menggantikannya. Namun, mari kita lihat
00:03:28penerapannya secara langsung melalui beberapa pengujian lokal. Pengujian pertama yang saya lakukan adalah meminta model membuat
00:03:32game balap Formula 1 lengkap dalam satu berkas HTML menggunakan Three.js. Di akhir nanti saya akan membahas durasi pengerjaan
00:03:37setiap model serta biayanya pada API, tetapi mari kita lihat dulu
00:03:40hasilnya. Ini adalah hasil yang berikan Opus 5, dan harus saya akui bahwa saya sangat
00:03:45terkesan dengan model ini. Model ini tidak menggunakan aset eksternal atau semacamnya. Semuanya
00:03:50dikerjakan oleh Opus 5, dan semuanya terlihat sangat bagus. Tata letak treknya memang sedikit terbalik,
00:03:55tetapi kendalinya sangat baik. Waktu putaran, posisi, dan urutannya berfungsi dengan baik,
00:03:59semuanya berjalan lancar. Ya, kita memang mengemudi di bawah rumput di sini, tetapi tabrakannya berfungsi,
00:04:03dan sebenarnya ada lintasan di bawah rumput ini, jadi saya bisa memperbaikinya dengan mudah lewat perintah.
00:04:07Selain itu, jebakan kerikilnya juga berfungsi sangat baik. Sejujurnya, saya sangat terkesan dengan
00:04:12hasil dari Opus 5 ini. Menurut saya, mobil-mobil F1 ini terlihat paling bagus dibanding yang lainnya.
00:04:16Namun, silakan Anda nilai sendiri. Ini adalah hasil yang berikan Fable. Menurut saya yang satu ini juga sangat
00:04:20bagus tata letak treknya, tetapi mobilnya sedikit lebih sederhana dibanding buatan Opus 5.
00:04:25Saya sebenarnya menyukai efek goyangan kamera saat kita berbelok, dan sekali lagi, semua
00:04:28fitur lainnya berfungsi, seperti posisi dan waktu di lintasan. Jadi Fable 5 juga
00:04:33melakukan tugasnya dengan sangat baik, tetapi sejujurnya saya lebih menyukai buatan Opus. Ini adalah hasil
00:04:37yang saya dapatkan dari GPT 5.6 Sol pada performa maksimal. Model ini melakukan tugasnya dengan baik pada
00:04:43pemodelan dan sudut pandang kamera, tetapi Anda bisa melihat bahwa lintasannya tidak ada, dan beberapa
00:04:47asetnya terbalik. Selain itu, di tengah lintasan, jalurnya terputus. Hasilnya
00:04:51lebih buruk menurut saya dibanding Fable dan Opus. Saya yakin Opus masih
00:04:56menjadi pemenang di sini. Model terakhir yang saya uji adalah Kimi K3, dan inilah hasil yang ditiapkannya,
00:05:01dan sejujurnya, sangat mengesankan untuk sebuah model dengan bobot terbuka. Hasil pengerjaannya cukup baik,
00:05:05hampir mirip dengan GPT 5.6 Sol. Pembatasnya berfungsi, lintasannya berfungsi, dan hal-hal lain seperti
00:05:09posisi kendaraan semuanya berjalan baik. Model ini membuatkan game yang cukup bagus dalam satu kali percobaan. Jika kita lihat
00:05:14biaya dan waktu pengerjaannya, Opus 5 menghabiskan waktu 46 menit 51 detik
00:05:19untuk menyelesaikan game F1 tersebut, dan memakan biaya sekitar $12,99 jika menggunakan API. Jadi bagi saya,
00:05:25Opus 5 sebenarnya lebih mahal dibanding Fable pada kasus ini, dan setelah diperiksa, itu terjadi karena Opus 5
00:05:30menggunakan token lima kali lebih banyak. Saya sangat berharap ini hanya kasus khusus, karena tolok ukur lain tidak
00:05:35menunjukkan hal serupa. Perlu saya tambahkan bahwa saya menghitung biaya model Claude tersebut menggunakan alat penggunaan
00:05:39Claude Code, jadi mungkin ada sedikit ketidakakuratan karena Anda tidak mendapatkan harga pasti saat
00:05:44menggunakan langganan. Seperti yang saya katakan sebelumnya, model-model ini masih tergolong premium, jadi jika memilih
00:05:49yang seperti GPT 5.6, Anda akan mendapatkan model yang lebih cepat dan murah, tetapi hasilnya,
00:05:54menurut saya, lebih buruk. Mari kita coba pengujian lainnya. Kali ini, saya meminta mereka membuat dasbor
00:05:58manajemen keuangan pribadi, yang akan menjadi aplikasi full-stack dengan antarmuka depan dan sistem
00:06:02belakang, dan saya juga mencantumkan beberapa fitur yang bisa mereka tambahkan di sini. Inilah hasil yang saya dapatkan
00:06:06menggunakan Opus 5, dan sejujurnya, saya harus mengakui bahwa saya cukup terkesan. Saya sangat menyukai antarmuka ini, gaya
00:06:11seperti inilah yang saya sukai secara pribadi. Tulis di kolom komentar jika Anda juga menyukainya, dan semuanya
00:06:15berfungsi sepenuhnya. Saya sudah menguji semuanya dan berfungsi, dan kami memiliki halaman terpisah untuk setiap
00:06:20fitur yang saya minta di sini, dan sekali lagi, semua fitur berfungsi antara antarmuka depan dan
00:06:24sistem belakang, dan saya sangat suka gaya antarmuka yang dipilihnya. Menurut saya ini yang terbaik dari
00:06:28semuanya. Untuk kodenya sendiri, model ini menggunakan React dan React Router pada sistem depan, yang sangat
00:06:33saya sukai, dan di sistem belakang, model ini mendapat poin plus karena menggunakan basis data sungguhan. Model ini menggunakan
00:06:37Node SQLite untuk basis datanya, dan untuk servernya menggunakan Express. Ini adalah hasil
00:06:42yang diberikan Fable 5, dan saya lebih menyukai antarmuka Opus 5, tetapi yang satu ini juga tidak terlalu buruk,
00:06:48meskipun grafik-grafik ini agak tidak berguna. Grafik di bagian bawah ini cukup bagus, dan sekali lagi,
00:06:53semua fitur ini berfungsi. Menurut saya Opus 5 memberikan lebih banyak perhatian pada tampilan antarmuka, dan
00:06:57jelas lebih unggul di aspek itu. Dalam kodenya, Fable melakukan hal yang serupa dengan Opus 5, yaitu menggunakan
00:07:01React, tetapi model ini tidak memilih pustaka routing. Model ini justru membuat pustaka routing
00:07:05kecil sendiri. Saya sebenarnya lebih suka jika model tetap menggunakan sesuatu seperti React Router,
00:07:09lalu untuk basis datanya, Fable melakukan hal serupa dengan menggunakan Node SQLite di sini, dan yang satu ini
00:07:13juga dibangun di atas Express, jadi sistem belakangnya cukup mirip, tetapi menurut saya Opus memilih
00:07:18teknologi yang lebih baik untuk antarmuka depan. Ini yang diberikan GPT 5.6 Sol, dan harus saya akui bahwa yang satu ini sangat bagus
00:07:22desain antarmukanya. Sangat mampu menyaingi Opus. Hanya saja gayanya berbeda, jadi ini
00:07:26kemungkinan besar tergantung selera pribadi, tetapi saya sangat menyukai yang satu ini. Model ini melakukan pekerjaan luar biasa
00:07:31dalam merancang seluruh antarmuka, dan sekali lagi, semua fiturnya berfungsi, tetapi yang satu ini
00:07:35tidak menggunakan halaman terpisah untuk setiap fitur individual. Model ini hanya mengarahkan ke bagian
00:07:38halaman yang berbeda. Pilihan teknologinya juga paling unik dibanding yang lain. Model ini memilih NextJS dengan
00:07:43kombinasi Drizzle untuk basis datanya yang sangat saya sukai, dan itu pendekatan yang cukup tepat untuk
00:07:47aplikasi seperti ini. Namun, model ini juga menggunakan Cloudflare dan Vinext untuk proses hosting-nya, yang menurut saya
00:07:52agak aneh, karena seperti yang bisa Anda lihat, Vinext masih sangat baru dan belum teruji,
00:07:56dan mereka pasti memasukkan instruksi tertentu agar memaksanya menggunakan Cloudflare
00:08:00dan Vinext. Seperti yang saya sampaikan di video Kimi K3, itu mungkin terjadi karena seperti itulah cara kerja situs ChatGPT
00:08:04milik mereka sendiri. Terakhir, model yang saya uji adalah Kimi K3, dan inilah hasil yang kami
00:08:09dapatkan, dan menurut saya hasilnya sangat baik. Antarmuka ini mirip dengan apa yang biasa saya dapatkan dari
00:08:14GPT 5.4 atau 5.5, jadi menurut saya sedikit tertinggal dalam desain antarmuka, tetapi sekali lagi, semua
00:08:19fiturnya berfungsi, dan saya tidak bisa terlalu mengeluhkan antarmuka ini. Tampilannya melakukan persis sesuai permintaan saya.
00:08:24Namun, kodenya mendapat sedikit nilai minus dari saya. Model ini memilih React untuk antarmuka depan,
00:08:28dan sekali lagi, membuat pustaka routing sendiri seperti Fable, tetapi saat kita melihat servernya,
00:08:32model ini hanya memiliki server Express, dan tidak membangun basis data menggunakan Node SQLite
00:08:36atau semacamnya. Model ini sebenarnya hanya membangun basis data sendiri menggunakan JavaScript, sehingga menyimpan
00:08:40semuanya ke berkas JSON. Itu jelas bukan pendekatan yang saya inginkan.
00:08:44Mengenai waktu dan harga dari model-model tersebut pada tes keuangan itu, Fable adalah yang termahal,
00:08:48dengan biaya $30,79 dan membutuhkan waktu 56 menit 55 detik, tetapi pada Opus, harganya tampak
00:08:55cukup mendekati Fable, yaitu memakan biaya $29,82 dan membutuhkan waktu lebih lama yaitu 59 menit 15
00:09:02detik. Model GPT menawarkan harga yang sangat terjangkau sebagai perbandingan, harganya sekitar tiga setengah kali lebih
00:09:07murah, dan saya sangat berharap persaingan ini akan mulai menekan harga Anthropic ke bawah.
00:09:11Jadi ini sedikit beragam bagi saya. Tentu saja, saya hanya menjalankan setiap tes satu kali, dan hanya melakukan dua tes,
00:09:16sehingga saya berharap tolok ukur Artificial Analysis lebih akurat, di mana harga Opus
00:09:20sepertiga dari harga Fable, tetapi saya pasti harus menggunakannya lebih sering untuk membuktikannya
00:09:24kembali. Mungkin ini hanya masalah alat yang saya gunakan untuk mengukur biayanya. Poin tambahan lain untuk Opus
00:09:28adalah tingkat ketegangannya sedikit lebih rendah untuk pekerjaan keamanan siber dibanding Fable 5. Batasan pengamanannya cukup
00:09:33serupa dengan Opus 4.8, kecuali beberapa pengaman yang lebih kuat pada kisaran tugas siber
00:09:37tertentu. Tampaknya, sistem pengamanan akan mengizinkan Opus 5 menemukan kerentanan pada kode sumber,
00:09:42tetapi akan memblokir pemindaian kerentanan berbasis biner, serta pengujian penetrasi dan
00:09:46pembuatan eksploit. Pengujian mereka menemukan bahwa pengklasifikasi mereka melakukan intervensi sekitar 85% lebih jarang
00:09:51dibandingkan pada Fable 5. Jadi begitulah, persaingan model AI saat ini benar-benar sangat
00:09:55mengesankan. Kita punya GPT 5.6 yang menunjukkan bahwa harga bisa ditekan, kita punya model terbuka seperti Kimi
00:10:00yang menyaingi pemain besar dalam kecerdasan, dan kita punya Anthropic yang terus mendorong batas
00:10:04kecerdasan lebih jauh lagi. Apa model favorit Anda, dan apakah Anda tertarik dengan Opus?
00:10:09Tulis di kolom komentar di bawah, dan jangan lupa berlangganan. Seperti biasa, sampai jumpa di video berikutnya.

Key Takeaway

Claude Opus 5 menyamai performa Fable 5 pada 95% kasus penggunaan dengan biaya token yang sama seperti Opus 4.8, meski konsumsi token pada tugas pengodean kompleks masih relatif tinggi.

Highlights

  • Opus 5 mencatat skor 30,2% pada tolok ukur Arc AGI dengan mengubah soal tes menjadi notasi aljabar untuk melakukan penalaran logis.

  • Harga resmi API Opus 5 dipatok pada $5 per 1 juta token input dan $25 per 1 juta token output, sama persis dengan tarif Opus 4.8.

  • Dalam pembuatan aplikasi gim Three.js, Opus 5 memerlukan waktu 46 menit 51 detik dan menghabiskan biaya API sebesar $12,99.

  • Pembuatan dasbor keuangan full-stack menggunakan Opus 5 menghabiskan biaya $29,82 dengan durasi proses 59 menit 15 detik.

  • Sistem pengamanan Opus 5 mengintervensi proses pengujian siber 85% lebih jarang dibanding Fable 5, meski tetap memblokir pembuatan eksploit biner.

Timeline

Spesifikasi Dasar dan Performa Tolok Ukur Opus 5

  • Opus 5 menjadi model bawaan baru untuk paket Claude Max dan opsi terkuat di paket Claude Pro.
  • Model ini mencatat skor 30,2% pada Arc AGI, melonjak drastis dari Opus 4.8 yang berada di angka 1,5%.
  • Opus 5 tidak menerapkan kebijakan retensi data khusus untuk akses umum.

Opus 5 dirancang sebagai model cermat yang mendekati kapabilitas Fable 5 pada evaluasi pengodean dan kerja pengetahuan seperti Frontier Bench serta GDP Val. Peningkatan terbesar terlihat pada Arc AGI melalui metode konversi tes ke notasi aljabar. Ketiadaan batasan retensi data publik juga mempermudah pengujian terbuka tanpa risiko kebocoran data.

Posisi Indeks Evaluasi dan Struktur Biaya

  • Opus 5 memimpin pada Indeks Agen dan Indeks Kecerdasan Artificial Analysis.
  • Biaya pemrosesan Opus 5 mencapai $5 per 1 juta token input dan $25 per 1 juta token output.
  • Pada Cursor Bench, Opus 5 menyelesaikan tugas seharga $8, sedangkan Fable 5 membutuhkan $17.

Hasil evaluasi pihak ketiga menunjukkan Opus 5 berada di posisi kedua pada indeks pengodean, hanya selisih 0,3 poin di bawah GPT 5.6 Sol Extra High. Pada indeks agen dan kecerdasan, Opus 5 mengungguli Fable 5 serta model Sol dari OpenAI. Tarif resmi token berada di tingkat yang sama dengan Opus 4.8, menjadikannya opsi pengganti untuk mayoritas beban kerja harian.

Uji Praktis 1: Pembuatan Gim Balap Three.js

  • Opus 5 menghasilkan pemodelan mobil F1 berbasis Three.js paling detail tanpa aset luar.
  • Proses eksekusi Opus 5 memakan biaya API $12,99 dalam waktu 46 menit 51 detik.
  • Penggunaan token Opus 5 pada pengujian ini tercatat lima kali lebih banyak dibanding Fable 5.

Pengujian langsung pembuatan gim balap HTML tunggal menunjukkan detail visual Opus 5 lebih unggul dibanding Fable 5, GPT 5.6 Sol, dan Kimi K3. Namun, penggunaan alat pengukur Claude Code mencatat konsumsi token yang membengkak, sehingga biaya akhirnya melebihi perkiraan awal tolok ukur standar.

Uji Praktis 2: Dasbor Aplikasi Keuangan Full-Stack

  • Opus 5 mengimplementasikan basis data Node SQLite nyata dengan server Express dan React Router.
  • Biaya pembuatan aplikasi keuangan full-stack pada Opus 5 mencapai $29,82 dengan durasi 59 menit 15 detik.
  • GPT 5.6 Sol menghasilkan aplikasi serupa dengan biaya tiga setengah kali lebih murah.

Dalam pembuatan aplikasi keuangan full-stack, Opus 5 memilih arsitektur berbasis React Router dan Node SQLite dengan pemisahan halaman navigasi yang lengkap. Fable 5 menghabiskan biaya $30,79 dalam waktu 56 menit 55 detik untuk tugas serupa. Meskipun kualitas antarmuka Opus 5 sangat baik, model GPT 5.6 Sol menawarkan efisiensi biaya yang jauh lebih rendah.

Kebijakan Keamanan Siber dan Evaluasi Akhir

  • Sistem keamanan Opus 5 memblokir analisis biner dan pemindaian eksploitasi siber.
  • Tingkat intervensi klasifikasi keamanan Opus 5 berkurang 85% dibanding Fable 5.
  • Pemeriksaan kerentanan berbasis kode sumber tetap diizinkan oleh sistem pengaman.

Opus 5 memberikan kelonggaran lebih tinggi untuk analisis keamanan kode sumber dibandingkan Fable 5. Pengetatan hanya berlaku pada pembacaan biner dan eksekusi eksploitasi langsung. Integrasi performa tinggi dan kelonggaran batas pengaman ini menempatkan Opus 5 sebagai opsi utama untuk pekerjaan teknis harian.

Community Posts

View all posts