Sonnet 5 Telah Hadir dan Siap Menyaingi Opus

CChase AI
컴퓨터/소프트웨어창업/스타트업경영/리더십

스크립트

00:00:00Anthropic baru saja merilis Sonnet 5, jadi mari kita bahas semua hal yang perlu Anda ketahui tentangnya.
00:00:04Jadi mari kita mulai dengan tolok ukurnya. Dan ingat, Sonnet 5 adalah model yang
00:00:08kurang kuat dan kurang mahal dibandingkan model seperti Opus dan pastinya Fable. Kita belum mendapatkan pembaruan
00:00:13sejak 4.6. Nah, membandingkan 5 dengan 4.6, kita melihat ini adalah lompatan besar dalam hal pengodean agen,
00:00:21penalaran multidisiplin, penggunaan komputer, dan pekerjaan berbasis pengetahuan. Jadi, peningkatan langsung di
00:00:26semua lini. Nah, saat kita membandingkannya dengan Opus 4.8, pertanyaannya bukan, apakah ini mendekati? Tapi seberapa jauh
00:00:32penurunannya? Dan jujur saja, penurunannya tidak seberapa. Bahkan, ia memiliki angka yang lebih baik
00:00:39dalam pekerjaan berbasis pengetahuan, yang cukup gila. Penggunaan komputer hanya tertinggal 2%, dan hanya
00:00:44tertinggal 2% dalam pengodean agen, dan hanya beberapa poin persentase di belakang dalam penalaran
00:00:49multidisiplin. Kesenjangan terbesar ada di sini dengan Sweebench Pro saat kita melihat 63 versus 69%.
00:00:56Tapi hei, Terminal Bench 2.1, 80 versus 82. Jadi ini bukan kesenjangan yang besar. Dan pembahasan
00:01:03tentang kinerja ini harus dilakukan dalam konteks harga. Ingat, Fable 5, Mythos 5,
00:01:08kita melihat $10 per token input, yang dua kali lipat dari Opus. Opus adalah $5 per juta token input.
00:01:16Dan untuk output, harganya $25. Jadi $5, $25. Untuk Sonnet 5, kita melihat $2. Jadi hanya 40% dari biaya
00:01:26Opus dalam token input. Dan untuk output, harganya $10. Jadi jauh lebih murah, kurang dari setengah biaya
00:01:34Opus. Namun saat kita melihat angkanya, itu cukup dekat. Jadi ini berita besar jika Anda seseorang yang
00:01:40tidak melakukan tugas-tugas yang sangat canggih dengan AI, Anda melakukannya untuk tugas-tugas rutin, dan Anda
00:01:46masih menginginkan kekuatan, yah, Sonnet 5 sekarang mengisi kesenjangan itu. Sekarang mari kita lihat grafik yang
00:01:51melampaui sekadar tolok ukur. Di sini kita melihat kinerja pencarian agen berdasarkan tingkat upaya, membandingkan
00:01:55Opus 4.8 dengan Sonnet 5 dan Sonnet 4.6. Jadi langsung saja, saya pikir Anda akan menyadari di sini, Sonnet 5, ada kesenjangan besar
00:02:04dalam tingkat kelulusan saat kita berpindah antar tingkat upaya. Jadi pada tingkat rendah, ia mencapai 55%. Tapi jika kita melihat
00:02:13tingkat rendah pada Sonnet 4.6, tingkat rendah pada Sonnet 4.6 sebenarnya berkinerja lebih baik. Namun dari segi biaya, jauh lebih murah.
00:02:19Kita pindah ke tingkat sedang, kita pada dasarnya mendapatkan kinerja yang sama seperti yang kita lihat dengan Sonnet 4.6,
00:02:25tetapi dengan diskon yang signifikan. Dan baru setelah kita pindah ke tingkat upaya tinggi, kita mulai melampaui
00:02:34Sonnet 4.6. Namun pada titik itu, kita mendapatkan kinerja yang lebih baik daripada Sonnet 4.6, tetapi dengan biaya yang
00:02:41seharusnya ada pada tingkat upaya rendah untuk Sonnet 4.6. Jadi semacam pembedaan tingkat upaya ini,
00:02:49saya pikir sangat penting karena bukan hanya, hei, Sonnet 5 lebih baik di semua lini, di mana tingkat rendah
00:02:53pada 5 belum tentu lebih baik daripada tingkat rendah pada 4.6. Tingkat rendah pada Sonnet 5 benar-benar hanya berarti ini akan menjadi super
00:02:59murah. Tapi dalam hal mendapatkan kinerja tingkat yang lebih tinggi, apa yang pernah kita lihat di masa lalu,
00:03:03mungkin perlu melakukan sesuatu yang berada di kisaran tinggi. Konon, saat kita berada di kisaran
00:03:08tinggi dengan Sonnet 5, kita membayar jumlah yang hampir sama dengan yang kita lakukan dengan Opus. Opus pada tingkat sedang
00:03:14dan tinggi biayanya sama dengan Sonnet pada tingkat tinggi, tetapi kita mendapatkan tingkat kelulusan yang lebih baik. Jadi ini semacam membawa
00:03:21banyak nuansa ke dalam diskusi ini. Apakah kita perlu menggunakan Sonnet 5 versus Opus 4.5 dan hal-hal seperti
00:03:27Pencarian Agen? Saya pikir itu sangat bergantung. Jika itu masalah yang lebih kompleks, pada akhirnya, Opus 4.8 mungkin
00:03:33lebih murah karena sangat efisien token dan Sonnet bukan pilihan yang tepat untuk pekerjaan itu.
00:03:38Namun, saat kita melakukan tugas-tugas yang tidak terlalu menantang bagi model AI ini, maka mungkin
00:03:44tidak masuk akal untuk menggunakan Opus 4.8 sama sekali. Saat itulah kita membawa Sonnet 5. Jadi saya pikir ini
00:03:49adalah tempat menarik yang kita tempati sekarang di mana ini semacam kasus demi kasus untuk model mana
00:03:54yang harus Anda gunakan. Nah, ini satu lagi yang menarik saat kita melihat penggunaan komputer agen. Nah, secara keseluruhan,
00:03:58untuk sebagian besar, Sonnet 5 mengalahkan Sonnet 4.6 dan melakukannya dengan biaya yang cukup rendah. Jadi
00:04:05Pencarian Agen, itu jelas tidak terjadi, tetapi penggunaan komputer agen, tiba-tiba,
00:04:09kita akan selalu menggunakan Sonnet 5 dibandingkan 4.6. Dan sekali lagi, ini kembali ke gagasan bahwa sekarang ini adalah kasus demi kasus
00:04:14untuk model mana yang harus Anda gunakan. Cukup menarik, lihat Opus. Opus High berkinerja
00:04:20lebih baik daripada Sonnet 5 Maks dan lebih murah. Jadi, maksud saya, Anda melihat ini dan Anda berpikir,
00:04:26wow, seperti, Opus sebenarnya cukup efisien untuk apa yang dilakukannya. Belum lagi ia mencapai tingkat yang lebih tinggi
00:04:30yang tidak bisa dicapai Sonnet. Jadi hal-hal untuk dipikirkan, jujur saja karena biaya per juta token
00:04:36lebih murah dengan Opus, akan ada banyak kasus di mana Opus masih yang terbaik. Sekarang, saya ingin menjadi
00:04:41model anthropic yang dirilis tanpa membicarakan perilaku yang tidak selaras. Kita bisa melihat ini adalah peningkatan
00:04:45dengan Sonnet 5, tetapi masih di bawah apa yang kita harapkan dengan Opus 4.8 dan Mythos Preview. Dan dari segi
00:04:50eksploitasi dan seluruh pertanyaan keamanan siber yang membuat Mythos hampir terkunci, itu bukan
00:04:55masalah atau sesuatu yang perlu Anda khawatirkan dengan kelas Sonnet. Jadi secara keseluruhan, saya tidak akan terlalu memperhatikan
00:04:59tolok ukur ini, sejujurnya. Semacam tolok ukur ini, semacam grafik ini memberi saya
00:05:05lebih banyak jeda karena pertanyaan yang menurut saya bukan Sonnet 5 versus 4.6. Kita hampir selalu akan
00:05:11menggunakan Sonnet 5. Ini Sonnet 5 versus Opus 4.8. Dan pertanyaannya adalah, apakah Opus sebenarnya lebih murah? Dan
00:05:18saya ingin melihat lebih banyak tes dan lebih banyak hal oleh anthropic yang menjabarkan seperti ini
00:05:24garis demarkasi antara, oke, Sonnet 5 bisa melakukan hal ini dengan baik dan lebih murah daripada
00:05:29Opus versus, hei, ini sekarang tugas yang lebih rumit. Opus sebenarnya akan lebih efisien daripada
00:05:34Sonnet dalam menyelesaikannya. Jadi hal-hal untuk dipikirkan, jelas merupakan nilai tambah. Saya pikir secara keseluruhan tingkat rendah
00:05:40pada Sonnet akan menjadi keuntungan karena bagi kita yang menggunakan token API untuk, Anda tahu,
00:05:46aplikasi kita atau hal-hal yang tidak ada dalam ekosistem Rencana Maks Claude, agak sulit untuk menggunakan
00:05:51Anthropic. Harganya sangat mahal. Dan saya sudah lama memberi tahu orang-orang, seperti, lihat saja
00:05:55OpenAI, Anda tahu, lihat beberapa model mini mereka karena itu sering kali lebih dari cukup untuk banyak
00:05:59pekerjaan orang. Nah, sekarang kita memiliki opsi tingkat menengah dengan Anthropic, yang merupakan nilai
00:06:05tambah. Jadi di situlah saya akan meninggalkan kalian hari ini. Ini tersedia di mana-mana. Saya pikir
00:06:09ini akan menjadi banyak percobaan dan kesalahan untuk mencari tahu di mana ini paling masuk akal. Jadi beri tahu saya
00:06:13apa pendapat Anda. Pastikan untuk memeriksa Chase AI Plus jika Anda ingin mendapatkan akses ke Kelas Master
00:06:17Kode Claude saya dan sampai jumpa.

핵심 요약

Sonnet 5 menawarkan keseimbangan biaya dan kinerja yang kompetitif untuk tugas rutin, meskipun Opus 4.8 tetap lebih efisien untuk masalah kompleks yang memerlukan tingkat upaya tinggi.

하이라이트

  • Sonnet 5 memiliki harga $2 per juta token input dan $10 per juta token output, yang berarti kurang dari setengah biaya Opus 4.8.

  • Kinerja Sonnet 5 dalam tugas berbasis pengetahuan melampaui Opus 4.8, sementara penggunaan komputer dan pengodean agen hanya tertinggal 2%.

  • Sonnet 5 mencatat skor 63% pada Sweebench Pro dibandingkan dengan 69% pada model Opus 4.8.

  • Pada tingkat upaya tinggi, biaya penggunaan Sonnet 5 mendekati biaya Opus 4.8, namun Opus tetap memberikan tingkat kelulusan yang lebih tinggi.

  • Penggunaan komputer agen menunjukkan Sonnet 5 mengungguli versi 4.6 secara konsisten dengan biaya yang lebih rendah.

타임라인

Perbandingan Kinerja Dasar dan Tolok Ukur

  • Sonnet 5 menunjukkan peningkatan di semua lini dibandingkan versi 4.6.
  • Kesenjangan kinerja antara Sonnet 5 dan Opus 4.8 sangat tipis dalam pengodean agen dan penalaran multidisiplin.

Sonnet 5 menghadirkan lompatan signifikan dalam penalaran multidisiplin dan penggunaan komputer dibanding pendahulunya. Dalam perbandingan dengan Opus 4.8, penurunannya minimal, dengan angka lebih baik dalam pekerjaan berbasis pengetahuan. Skor Sweebench Pro berada di angka 63% berbanding 69%, sementara Terminal Bench 2.1 mencapai 80% berbanding 82%.

Analisis Efisiensi Biaya

  • Biaya input Sonnet 5 adalah $2 per juta token, dibandingkan $5 untuk Opus 4.8.
  • Biaya output Sonnet 5 sebesar $10, kurang dari setengah biaya output Opus yang mencapai $25.

Struktur harga menjadi faktor penentu utama bagi pengguna tugas rutin. Dengan biaya hanya 40% dari token input Opus, Sonnet 5 menjadi opsi hemat biaya yang tetap mempertahankan kekuatan komputasi yang memadai untuk banyak skenario penggunaan.

Tingkat Upaya dan Pemilihan Model

  • Kinerja Sonnet 5 sangat bergantung pada tingkat upaya yang digunakan.
  • Opus 4.8 bisa menjadi lebih ekonomis daripada Sonnet 5 untuk masalah yang sangat kompleks karena efisiensi tokennya.

Pada tingkat upaya rendah, Sonnet 5 menawarkan efisiensi biaya tinggi. Namun, untuk tugas tingkat upaya tinggi, biaya Sonnet 5 setara dengan Opus, yang justru memberikan tingkat kelulusan lebih baik. Pemilihan model harus didasarkan pada kompleksitas kasus yang ditangani untuk mengoptimalkan biaya dan hasil.

Penggunaan Komputer dan Keamanan

  • Sonnet 5 secara konsisten mengungguli 4.6 dalam penggunaan komputer agen.
  • Masalah keamanan siber yang ada pada model seperti Mythos tidak menjadi perhatian utama pada kelas Sonnet.

Penggunaan komputer agen memberikan keunggulan pasti bagi Sonnet 5 dibandingkan versi 4.6. Selain itu, model ini menawarkan peningkatan perilaku yang tidak selaras meskipun masih di bawah standar Opus 4.8. Keberadaan opsi tingkat menengah ini mengisi celah bagi pengguna API yang membutuhkan kekuatan di luar ekosistem langganan.

커뮤니티 글

모든 글 보기