스크립트
00:00:00Anthropic baru saja merilis Sonnet 5, jadi mari kita bahas semua hal yang perlu Anda ketahui tentangnya.
00:00:04Jadi mari kita mulai dengan tolok ukurnya. Dan ingat, Sonnet 5 adalah model yang
00:00:08kurang kuat dan kurang mahal dibandingkan model seperti Opus dan pastinya Fable. Kita belum mendapatkan pembaruan
00:00:13sejak 4.6. Nah, membandingkan 5 dengan 4.6, kita melihat ini adalah lompatan besar dalam hal pengodean agen,
00:00:21penalaran multidisiplin, penggunaan komputer, dan pekerjaan berbasis pengetahuan. Jadi, peningkatan langsung di
00:00:26semua lini. Nah, saat kita membandingkannya dengan Opus 4.8, pertanyaannya bukan, apakah ini mendekati? Tapi seberapa jauh
00:00:32penurunannya? Dan jujur saja, penurunannya tidak seberapa. Bahkan, ia memiliki angka yang lebih baik
00:00:39dalam pekerjaan berbasis pengetahuan, yang cukup gila. Penggunaan komputer hanya tertinggal 2%, dan hanya
00:00:44tertinggal 2% dalam pengodean agen, dan hanya beberapa poin persentase di belakang dalam penalaran
00:00:49multidisiplin. Kesenjangan terbesar ada di sini dengan Sweebench Pro saat kita melihat 63 versus 69%.
00:00:56Tapi hei, Terminal Bench 2.1, 80 versus 82. Jadi ini bukan kesenjangan yang besar. Dan pembahasan
00:01:03tentang kinerja ini harus dilakukan dalam konteks harga. Ingat, Fable 5, Mythos 5,
00:01:08kita melihat $10 per token input, yang dua kali lipat dari Opus. Opus adalah $5 per juta token input.
00:01:16Dan untuk output, harganya $25. Jadi $5, $25. Untuk Sonnet 5, kita melihat $2. Jadi hanya 40% dari biaya
00:01:26Opus dalam token input. Dan untuk output, harganya $10. Jadi jauh lebih murah, kurang dari setengah biaya
00:01:34Opus. Namun saat kita melihat angkanya, itu cukup dekat. Jadi ini berita besar jika Anda seseorang yang
00:01:40tidak melakukan tugas-tugas yang sangat canggih dengan AI, Anda melakukannya untuk tugas-tugas rutin, dan Anda
00:01:46masih menginginkan kekuatan, yah, Sonnet 5 sekarang mengisi kesenjangan itu. Sekarang mari kita lihat grafik yang
00:01:51melampaui sekadar tolok ukur. Di sini kita melihat kinerja pencarian agen berdasarkan tingkat upaya, membandingkan
00:01:55Opus 4.8 dengan Sonnet 5 dan Sonnet 4.6. Jadi langsung saja, saya pikir Anda akan menyadari di sini, Sonnet 5, ada kesenjangan besar
00:02:04dalam tingkat kelulusan saat kita berpindah antar tingkat upaya. Jadi pada tingkat rendah, ia mencapai 55%. Tapi jika kita melihat
00:02:13tingkat rendah pada Sonnet 4.6, tingkat rendah pada Sonnet 4.6 sebenarnya berkinerja lebih baik. Namun dari segi biaya, jauh lebih murah.
00:02:19Kita pindah ke tingkat sedang, kita pada dasarnya mendapatkan kinerja yang sama seperti yang kita lihat dengan Sonnet 4.6,
00:02:25tetapi dengan diskon yang signifikan. Dan baru setelah kita pindah ke tingkat upaya tinggi, kita mulai melampaui
00:02:34Sonnet 4.6. Namun pada titik itu, kita mendapatkan kinerja yang lebih baik daripada Sonnet 4.6, tetapi dengan biaya yang
00:02:41seharusnya ada pada tingkat upaya rendah untuk Sonnet 4.6. Jadi semacam pembedaan tingkat upaya ini,
00:02:49saya pikir sangat penting karena bukan hanya, hei, Sonnet 5 lebih baik di semua lini, di mana tingkat rendah
00:02:53pada 5 belum tentu lebih baik daripada tingkat rendah pada 4.6. Tingkat rendah pada Sonnet 5 benar-benar hanya berarti ini akan menjadi super
00:02:59murah. Tapi dalam hal mendapatkan kinerja tingkat yang lebih tinggi, apa yang pernah kita lihat di masa lalu,
00:03:03mungkin perlu melakukan sesuatu yang berada di kisaran tinggi. Konon, saat kita berada di kisaran
00:03:08tinggi dengan Sonnet 5, kita membayar jumlah yang hampir sama dengan yang kita lakukan dengan Opus. Opus pada tingkat sedang
00:03:14dan tinggi biayanya sama dengan Sonnet pada tingkat tinggi, tetapi kita mendapatkan tingkat kelulusan yang lebih baik. Jadi ini semacam membawa
00:03:21banyak nuansa ke dalam diskusi ini. Apakah kita perlu menggunakan Sonnet 5 versus Opus 4.5 dan hal-hal seperti
00:03:27Pencarian Agen? Saya pikir itu sangat bergantung. Jika itu masalah yang lebih kompleks, pada akhirnya, Opus 4.8 mungkin
00:03:33lebih murah karena sangat efisien token dan Sonnet bukan pilihan yang tepat untuk pekerjaan itu.
00:03:38Namun, saat kita melakukan tugas-tugas yang tidak terlalu menantang bagi model AI ini, maka mungkin
00:03:44tidak masuk akal untuk menggunakan Opus 4.8 sama sekali. Saat itulah kita membawa Sonnet 5. Jadi saya pikir ini
00:03:49adalah tempat menarik yang kita tempati sekarang di mana ini semacam kasus demi kasus untuk model mana
00:03:54yang harus Anda gunakan. Nah, ini satu lagi yang menarik saat kita melihat penggunaan komputer agen. Nah, secara keseluruhan,
00:03:58untuk sebagian besar, Sonnet 5 mengalahkan Sonnet 4.6 dan melakukannya dengan biaya yang cukup rendah. Jadi
00:04:05Pencarian Agen, itu jelas tidak terjadi, tetapi penggunaan komputer agen, tiba-tiba,
00:04:09kita akan selalu menggunakan Sonnet 5 dibandingkan 4.6. Dan sekali lagi, ini kembali ke gagasan bahwa sekarang ini adalah kasus demi kasus
00:04:14untuk model mana yang harus Anda gunakan. Cukup menarik, lihat Opus. Opus High berkinerja
00:04:20lebih baik daripada Sonnet 5 Maks dan lebih murah. Jadi, maksud saya, Anda melihat ini dan Anda berpikir,
00:04:26wow, seperti, Opus sebenarnya cukup efisien untuk apa yang dilakukannya. Belum lagi ia mencapai tingkat yang lebih tinggi
00:04:30yang tidak bisa dicapai Sonnet. Jadi hal-hal untuk dipikirkan, jujur saja karena biaya per juta token
00:04:36lebih murah dengan Opus, akan ada banyak kasus di mana Opus masih yang terbaik. Sekarang, saya ingin menjadi
00:04:41model anthropic yang dirilis tanpa membicarakan perilaku yang tidak selaras. Kita bisa melihat ini adalah peningkatan
00:04:45dengan Sonnet 5, tetapi masih di bawah apa yang kita harapkan dengan Opus 4.8 dan Mythos Preview. Dan dari segi
00:04:50eksploitasi dan seluruh pertanyaan keamanan siber yang membuat Mythos hampir terkunci, itu bukan
00:04:55masalah atau sesuatu yang perlu Anda khawatirkan dengan kelas Sonnet. Jadi secara keseluruhan, saya tidak akan terlalu memperhatikan
00:04:59tolok ukur ini, sejujurnya. Semacam tolok ukur ini, semacam grafik ini memberi saya
00:05:05lebih banyak jeda karena pertanyaan yang menurut saya bukan Sonnet 5 versus 4.6. Kita hampir selalu akan
00:05:11menggunakan Sonnet 5. Ini Sonnet 5 versus Opus 4.8. Dan pertanyaannya adalah, apakah Opus sebenarnya lebih murah? Dan
00:05:18saya ingin melihat lebih banyak tes dan lebih banyak hal oleh anthropic yang menjabarkan seperti ini
00:05:24garis demarkasi antara, oke, Sonnet 5 bisa melakukan hal ini dengan baik dan lebih murah daripada
00:05:29Opus versus, hei, ini sekarang tugas yang lebih rumit. Opus sebenarnya akan lebih efisien daripada
00:05:34Sonnet dalam menyelesaikannya. Jadi hal-hal untuk dipikirkan, jelas merupakan nilai tambah. Saya pikir secara keseluruhan tingkat rendah
00:05:40pada Sonnet akan menjadi keuntungan karena bagi kita yang menggunakan token API untuk, Anda tahu,
00:05:46aplikasi kita atau hal-hal yang tidak ada dalam ekosistem Rencana Maks Claude, agak sulit untuk menggunakan
00:05:51Anthropic. Harganya sangat mahal. Dan saya sudah lama memberi tahu orang-orang, seperti, lihat saja
00:05:55OpenAI, Anda tahu, lihat beberapa model mini mereka karena itu sering kali lebih dari cukup untuk banyak
00:05:59pekerjaan orang. Nah, sekarang kita memiliki opsi tingkat menengah dengan Anthropic, yang merupakan nilai
00:06:05tambah. Jadi di situlah saya akan meninggalkan kalian hari ini. Ini tersedia di mana-mana. Saya pikir
00:06:09ini akan menjadi banyak percobaan dan kesalahan untuk mencari tahu di mana ini paling masuk akal. Jadi beri tahu saya
00:06:13apa pendapat Anda. Pastikan untuk memeriksa Chase AI Plus jika Anda ingin mendapatkan akses ke Kelas Master
00:06:17Kode Claude saya dan sampai jumpa.