Transcript
00:00:00Claude Opus 5 baru saja dirilis, dan Anthropic mengklaim kita kini memiliki model yang mendekati
00:00:04performa Fable 5 dengan separuh biaya. Mari kita lihat apa yang mereka tawarkan.
00:00:09Mari kita lihat beberapa tolok ukurnya, dan angka-angkanya langsung terlihat luar biasa. Kita bisa melihat
00:00:14bahwa model ini mengalahkan Fable 5 dan jauh mengungguli Opus 4.8 di sejumlah pengujian, khususnya
00:00:20koding terminal berbasis agen, pekerjaan pengetahuan, dan pencarian agen. Model ini juga mengalahkan GPT 5.6
00:00:27di kategori-kategori tersebut. Satu-satunya area di mana Opus 5 kalah dari Fable 5 adalah
00:00:33penalaran multidisiplin, itu pun tidak beda jauh. Bahkan, Opus 5 mengalahkannya saat menggunakan alat, serta
00:00:39bidang hukum dan kesehatan. Namun di area lain, model ini unggul dari model teratas mereka. Dan jika angka-angka itu bisa
00:00:46dipercaya, ini sangat luar biasa. Di sini disebutkan, pada Cursor Bench 3.2 di tingkat usaha maksimum, model ini bekerja
00:00:51dalam selisih 0,5% dari skor puncak Fable 5, tetapi dengan separuh biaya per tugas. Luar biasa. Dan Anda bisa melihatnya tepat
00:00:57di sini. Opus 5 berwarna merah, Fable 5 berwarna oranye, dan di bawah sini yang berwarna biru adalah Opus 4.8.
00:01:03Jadi ya, pada usaha paling maksimum, Fable 5 memang memimpin, tetapi kebanyakan orang tidak benar-benar menggunakannya
00:01:08di tingkat maksimum. Mereka menggunakannya di tingkat tinggi atau ekstra tinggi. Dan saat kita melihat tingkat ekstra tinggi dan tinggi
00:01:13dibandingkan dengan Fable, kita mendapatkan hasil yang hampir sama dengan Opus 5, tetapi sekali lagi, dengan sekitar
00:01:17separuh biayanya. Dan di beberapa tolok ukur lainnya, seperti indeks agen koding Artificial Analysis,
00:01:23Opus 5 benar-benar mengalahkan Fable 5. Hal yang sama juga terjadi pada Frontier Bench.
00:01:27Model ini benar-benar mengungguli Fable padahal harganya lebih murah. Sekarang mari kita lihat beberapa tugas pekerjaan
00:01:32pengetahuan dan pemecahan masalah. Sekali lagi, menurut saya yang benar-benar luar biasa bukan hanya dinamika
00:01:37Fable 5 dan Opus 5 ini. Melainkan lompatan dari Opus 4.8 ke Opus 5. Semuanya
00:01:43di seluruh pengujian menunjukkan lompatan yang sangat, sangat besar. Sekali lagi, jika ini seperti masalah Sonnet
00:01:495 di mana kita melihat kinerjanya lebih baik dari model sebelumnya, namun harganya sangat
00:01:53mahal karena Sonnet 5 secara entah bagaimana menjadi model termahal saat kita meninjaunya
00:01:57berdasarkan tugasnya. Namun tidak demikian di sini. Opus tampaknya sangat efisien dalam penggunaan token dibandingkan dengan
00:02:03model lainnya. Dan kenyataan bahwa model ini bisa mengalahkan Fable 5, saya benar-benar tidak sangka.
00:02:07Peningkatan menarik lainnya adalah hasil visual. Ini adalah contoh Opus 5 yang sedang mengerjakan
00:02:13pemodelan terowongan angin. Dan di sebelah sini, model ini membangun artifak sel hewan interaktif 3D.
00:02:19Salah satu kelemahan Claude adalah ketidakmampuannya membuat gambar sendiri. Jadi
00:02:24kemampuannya untuk bekerja lebih baik dengan grafik SVG buatan 3D seperti grafik HTML ini adalah pencapaian besar.
00:02:31Peningkatan besar lainnya adalah klaim Anthropic bahwa model ini jauh lebih kuat dalam memverifikasi pekerjaannya
00:02:35dan melakukan iterasi secara cermat hingga berhasil. Apa artinya ini? Ini berarti saat kita menggunakan Opus 5
00:02:40pada tugas agen berjangka panjang, tugas-tugas yang bukan sekadar sekali jalan. Ini seperti siklus berulang, bukan? Ini
00:02:45seperti konsep rekayasa grafik yang sering dibicarakan orang. Apa pun yang membutuhkan
00:02:49Claude untuk memeriksa pekerjaannya terhadap tujuan yang kita berikan dan terus melakukannya secara berulang-ulang.
00:02:53Opus 5 jauh lebih baik daripada Opus 4.8 dalam hal tersebut. Dan satu contoh menarik
00:02:58contoh menarik di sini adalah Opus 5 diberi gambar bagian mesin dan diminta menulis kode untuk membuatnya kembali sebagai
00:03:03model FreeCAD 3D. Namun model tersebut tidak diberi cara untuk benar-benar melihat gambar itu. Jadi,
00:03:09model itu diminta mencapai tujuan tersebut tanpa diberi tahu cara spesifik untuk melakukannya. Jadi model itu secara mandiri
00:03:14menulis alur visi komputernya sendiri untuk mengambil geometri dari piksel mentah dan kemudian merekonstruksi seluruh
00:03:19bagian mesin tersebut. Sekali lagi, untuk tugas berjangka panjang yang diberi target pencapaian,
00:03:25Opus 5 jauh lebih baik daripada 4.8 dalam menyelesaikannya. Dalam hal perilaku yang menyimpang,
00:03:29model ini juga satu tingkat di atas semua model sebelumnya. Angka lebih rendah lebih baik di sini. Dan kita melihat peningkatan besar pada kemampuannya
00:03:35dari Opus 4.8 untuk menemukan kerentanan dan eksploit dalam kode sumber terbuka. Hal keren lainnya adalah sistem
00:03:40pengamanannya. Ini bukan skenario Fable di mana jika Anda menyebutkan sesuatu tentang biologi keamanan siber,
00:03:45aksesnya akan langsung dihentikan. Pembatas tersebut jauh tidak seketat Fable 5 pada Opus 5.
00:03:50Meskipun masih ada beberapa klasifikator di dalamnya, mereka mengatakan kemungkinannya 85% lebih kecil untuk benar-benar
00:03:56terpemicu dibandingkan Fable. Dan terakhir, hal terbesarnya adalah biaya. Seperti yang saya katakan, harganya separuh dari Fable.
00:04:01Harganya $5 per juta input dan $25 per juta output. Dan seperti yang kita lihat dari tolok ukur
00:04:07di grafik, ini adalah model yang relatif efisien dalam penggunaan token. Jadi saya sangat antusias untuk mencobanya
00:04:12karena jika angka-angka itu benar, kita seolah mendapatkan Fable yang lebih baik dengan separuh biaya.