Opus 5 Telah Hadir Dan LEBIH BAIK DARI FABLE?!

CChase AI
컴퓨터/소프트웨어경제 뉴스AI/미래기술

Transcript

00:00:00Claude Opus 5 baru saja dirilis, dan Anthropic mengklaim kita kini memiliki model yang mendekati
00:00:04performa Fable 5 dengan separuh biaya. Mari kita lihat apa yang mereka tawarkan.
00:00:09Mari kita lihat beberapa tolok ukurnya, dan angka-angkanya langsung terlihat luar biasa. Kita bisa melihat
00:00:14bahwa model ini mengalahkan Fable 5 dan jauh mengungguli Opus 4.8 di sejumlah pengujian, khususnya
00:00:20koding terminal berbasis agen, pekerjaan pengetahuan, dan pencarian agen. Model ini juga mengalahkan GPT 5.6
00:00:27di kategori-kategori tersebut. Satu-satunya area di mana Opus 5 kalah dari Fable 5 adalah
00:00:33penalaran multidisiplin, itu pun tidak beda jauh. Bahkan, Opus 5 mengalahkannya saat menggunakan alat, serta
00:00:39bidang hukum dan kesehatan. Namun di area lain, model ini unggul dari model teratas mereka. Dan jika angka-angka itu bisa
00:00:46dipercaya, ini sangat luar biasa. Di sini disebutkan, pada Cursor Bench 3.2 di tingkat usaha maksimum, model ini bekerja
00:00:51dalam selisih 0,5% dari skor puncak Fable 5, tetapi dengan separuh biaya per tugas. Luar biasa. Dan Anda bisa melihatnya tepat
00:00:57di sini. Opus 5 berwarna merah, Fable 5 berwarna oranye, dan di bawah sini yang berwarna biru adalah Opus 4.8.
00:01:03Jadi ya, pada usaha paling maksimum, Fable 5 memang memimpin, tetapi kebanyakan orang tidak benar-benar menggunakannya
00:01:08di tingkat maksimum. Mereka menggunakannya di tingkat tinggi atau ekstra tinggi. Dan saat kita melihat tingkat ekstra tinggi dan tinggi
00:01:13dibandingkan dengan Fable, kita mendapatkan hasil yang hampir sama dengan Opus 5, tetapi sekali lagi, dengan sekitar
00:01:17separuh biayanya. Dan di beberapa tolok ukur lainnya, seperti indeks agen koding Artificial Analysis,
00:01:23Opus 5 benar-benar mengalahkan Fable 5. Hal yang sama juga terjadi pada Frontier Bench.
00:01:27Model ini benar-benar mengungguli Fable padahal harganya lebih murah. Sekarang mari kita lihat beberapa tugas pekerjaan
00:01:32pengetahuan dan pemecahan masalah. Sekali lagi, menurut saya yang benar-benar luar biasa bukan hanya dinamika
00:01:37Fable 5 dan Opus 5 ini. Melainkan lompatan dari Opus 4.8 ke Opus 5. Semuanya
00:01:43di seluruh pengujian menunjukkan lompatan yang sangat, sangat besar. Sekali lagi, jika ini seperti masalah Sonnet
00:01:495 di mana kita melihat kinerjanya lebih baik dari model sebelumnya, namun harganya sangat
00:01:53mahal karena Sonnet 5 secara entah bagaimana menjadi model termahal saat kita meninjaunya
00:01:57berdasarkan tugasnya. Namun tidak demikian di sini. Opus tampaknya sangat efisien dalam penggunaan token dibandingkan dengan
00:02:03model lainnya. Dan kenyataan bahwa model ini bisa mengalahkan Fable 5, saya benar-benar tidak sangka.
00:02:07Peningkatan menarik lainnya adalah hasil visual. Ini adalah contoh Opus 5 yang sedang mengerjakan
00:02:13pemodelan terowongan angin. Dan di sebelah sini, model ini membangun artifak sel hewan interaktif 3D.
00:02:19Salah satu kelemahan Claude adalah ketidakmampuannya membuat gambar sendiri. Jadi
00:02:24kemampuannya untuk bekerja lebih baik dengan grafik SVG buatan 3D seperti grafik HTML ini adalah pencapaian besar.
00:02:31Peningkatan besar lainnya adalah klaim Anthropic bahwa model ini jauh lebih kuat dalam memverifikasi pekerjaannya
00:02:35dan melakukan iterasi secara cermat hingga berhasil. Apa artinya ini? Ini berarti saat kita menggunakan Opus 5
00:02:40pada tugas agen berjangka panjang, tugas-tugas yang bukan sekadar sekali jalan. Ini seperti siklus berulang, bukan? Ini
00:02:45seperti konsep rekayasa grafik yang sering dibicarakan orang. Apa pun yang membutuhkan
00:02:49Claude untuk memeriksa pekerjaannya terhadap tujuan yang kita berikan dan terus melakukannya secara berulang-ulang.
00:02:53Opus 5 jauh lebih baik daripada Opus 4.8 dalam hal tersebut. Dan satu contoh menarik
00:02:58contoh menarik di sini adalah Opus 5 diberi gambar bagian mesin dan diminta menulis kode untuk membuatnya kembali sebagai
00:03:03model FreeCAD 3D. Namun model tersebut tidak diberi cara untuk benar-benar melihat gambar itu. Jadi,
00:03:09model itu diminta mencapai tujuan tersebut tanpa diberi tahu cara spesifik untuk melakukannya. Jadi model itu secara mandiri
00:03:14menulis alur visi komputernya sendiri untuk mengambil geometri dari piksel mentah dan kemudian merekonstruksi seluruh
00:03:19bagian mesin tersebut. Sekali lagi, untuk tugas berjangka panjang yang diberi target pencapaian,
00:03:25Opus 5 jauh lebih baik daripada 4.8 dalam menyelesaikannya. Dalam hal perilaku yang menyimpang,
00:03:29model ini juga satu tingkat di atas semua model sebelumnya. Angka lebih rendah lebih baik di sini. Dan kita melihat peningkatan besar pada kemampuannya
00:03:35dari Opus 4.8 untuk menemukan kerentanan dan eksploit dalam kode sumber terbuka. Hal keren lainnya adalah sistem
00:03:40pengamanannya. Ini bukan skenario Fable di mana jika Anda menyebutkan sesuatu tentang biologi keamanan siber,
00:03:45aksesnya akan langsung dihentikan. Pembatas tersebut jauh tidak seketat Fable 5 pada Opus 5.
00:03:50Meskipun masih ada beberapa klasifikator di dalamnya, mereka mengatakan kemungkinannya 85% lebih kecil untuk benar-benar
00:03:56terpemicu dibandingkan Fable. Dan terakhir, hal terbesarnya adalah biaya. Seperti yang saya katakan, harganya separuh dari Fable.
00:04:01Harganya $5 per juta input dan $25 per juta output. Dan seperti yang kita lihat dari tolok ukur
00:04:07di grafik, ini adalah model yang relatif efisien dalam penggunaan token. Jadi saya sangat antusias untuk mencobanya
00:04:12karena jika angka-angka itu benar, kita seolah mendapatkan Fable yang lebih baik dengan separuh biaya.

Key Takeaway

Claude Opus 5 menawarkan kinerja yang mengungguli atau setara dengan Fable 5 pada tugas koding, pekerjaan pengetahuan, dan pencarian agen, namun dengan efisiensi token yang lebih tinggi dan separuh harga pengoperasian.

Highlights

  • Claude Opus 5 hadir dengan biaya $5 per juta token input dan $25 per juta token output, yang berarti separuh dari biaya Fable 5.

  • Pada Cursor Bench 3.2 dengan tingkat usaha maksimum, Opus 5 bekerja dalam selisih 0,5% dari skor puncak Fable 5.

  • Opus 5 mengalahkan Fable 5 pada tolok ukur indeks agen koding Artificial Analysis dan Frontier Bench.

  • Sistem pengaman Opus 5 memiliki kemungkinan 85% lebih kecil untuk terpemicu dibandingkan dengan Fable 5.

  • Opus 5 mampu menulis alur visi komputer secara mandiri untuk mengekstrak geometri dari piksel mentah dan merekonstruksi model FreeCAD 3D tanpa diberikan gambar secara langsung.

Timeline

Performa Tolok Ukur dan Perbandingan Biaya

  • Opus 5 mengungguli Fable 5, Opus 4.8, dan GPT 5.6 dalam koding terminal berbasis agen, pekerjaan pengetahuan, serta pencarian agen.
  • Fable 5 hanya memimpin tipis pada penalaran multidisiplin dan penggunaan usaha maksimum.
  • Opus 5 memberikan performa setara Fable 5 pada tingkat usaha tinggi dan ekstra tinggi dengan separuh biaya per tugas.

Pengujian pada Cursor Bench 3.2 menunjukkan bahwa Opus 5 mencatat performa dalam selisih 0,5% dari Fable 5 pada batas usaha tertinggi. Pada pengujian Indeks Agen Koding Artificial Analysis dan Frontier Bench, Opus 5 melampaui hasil Fable 5. Sebagian besar penggunaan pada tingkat usaha tinggi menghasilkan performa identik dengan efisiensi biaya ganda.

Efisiensi Token dan Kapabilitas Visual 3D

  • Lompatan kinerja dari Opus 4.8 ke Opus 5 terjadi secara signifikan di seluruh tolok ukur.
  • Opus 5 bekerja dengan efisiensi penggunaan token yang tinggi dibandingkan model sekelasnya.
  • Kemampuan pembuatan grafik SVG 3D interaktif dan HTML memfasilitasi pemodelan terowongan angin serta struktur sel hewan 3D.

Tidak seperti model lain yang mengalami lonjakan harga seiring peningkatan performa, Opus 5 mempertahankan penggunaan token yang sangat hemat. Ketiadaan fitur pembuat gambar bawaan diimbangi oleh peningkatan kemampuan menghasilkan grafik terstruktur seperti SVG 3D dan HTML interaktif.

Verifikasi Mandiri dan Eksekusi Tugas Agen Berjangka Panjang

  • Opus 5 secara mandiri memverifikasi pekerjaan dan melakukan iterasi berulang hingga mencapai target.
  • Model ini mampu membuat alur visi komputer sendiri untuk merekonstruksi bagian mesin menjadi kode FreeCAD 3D dari piksel mentah.
  • Kemampuan menyelesaikan tugas kompleks berjangka panjang mengalami peningkatan besar dibanding Opus 4.8.

Proses verifikasi mandiri memungkinkan Opus 5 menjalankan alur kerja rekursif untuk mencapai tujuan tanpa instruksi langkah demi langkah. Saat diuji rekonstruksi komponen mesin FreeCAD 3D tanpa akses langsung ke gambar visual, model ini secara mandiri merancang alur kerja pemrosesan piksel untuk membaca geometri.

Keamanan, Pembatasan Sistem, dan Struktur Harga API

  • Tingkat perilaku menyimpang pada Opus 5 lebih rendah dibandingkan seluruh model pendahulunya.
  • Sistem pengaman Opus 5 memiliki probabilitas pemicu 85% lebih rendah daripada Fable 5.
  • Tarif API Opus 5 ditetapkan sebesar $5 per juta token input dan $25 per juta token output.

Peningkatan deteksi kerentanan kode sumber terbuka berjalan sejajar dengan pelonggaran batasan ketat yang sebelumnya ada pada Fable 5. Akses pada topik sensitif seperti keamanan siber dan biologi tidak lagi langsung terhenti, sementara biaya penggunaan tetap berada pada separuh harga Fable 5.

Community Posts

View all posts