Fable 5.1 Adalah Model Terbaik yang Pernah Ada (Dan Lebih Murah dari Fable 5)

CChase AI
Computing/Software

Transcript

00:00:00Jadi Fable 5.1 sudah hadir, dan ini lebih baik, lebih murah,
00:00:02dan hari ini saya akan memberi tahu kalian
00:00:04semua yang perlu kalian ketahui tentangnya.
00:00:05Jadi yang utama adalah harga.
00:00:07Fable 5.1 akan menelan biaya sekitar 25% lebih murah dari Fable 5,
00:00:11dan ini karena mereka mengurangi harga
00:00:13pada pembacaan tembolok.
00:00:14Ini sangat besar jika Anda melakukan banyak pekerjaan agen yang berjalan lama,
00:00:19dan mereka secara khusus menyebutkan ini,
00:00:21dan pengurangan biaya Anda bisa mencapai 45%
00:00:23dalam kasus-kasus di mana Anda melakukan pekerjaan
00:00:24yang memiliki ribuan dan ribuan token,
00:00:27dan Anda bekerja dalam panjang jendela konteks
00:00:28sebesar 50, 60, 70%.
00:00:30Mereka memperbarui kebijakan retensi data mereka,
00:00:32mereka menerapkan itu secara bertahap untuk pelanggan enterprise mereka,
00:00:34dan berkaitan dengan pengaman,
00:00:35mereka mengurangi positif palsu,
00:00:37yang dulunya cukup menyebalkan
00:00:38pada Fable 5 asli,
00:00:40karena jika Anda menanyakan pertanyaan
00:00:41yang berkaitan dengan hal-hal seperti keamanan siber,
00:00:43Anda akan terus-menerus diblokir,
00:00:44dan dalam kasus ini, sekarang peluang positif palsu 60% lebih sedikit.
00:00:47Sekarang mari kita lihat tolok ukurnya.
00:00:49Secara keseluruhan, model ini mengalahkan Fable 5, Opus 5,
00:00:50dan GPT 5.6 dalam segala hal secara harfiah.
00:00:53Sekarang, beberapa lompatan nilainya cukup signifikan.
00:00:56Ketika kita melihat penelitian ilmiah berbasis agen,
00:00:58hasilnya dua kali lipat dari Fable 5.
00:01:00Pengodingan berbasis agen juga mengalami lonjakan besar.
00:01:03Kita beralih dari 42% pada Fable 5 menjadi 55,8 pada Fable 5.1.
00:01:05Saya ingat ketika kita melihat tolok ukur untuk Opus 5,
00:01:09kita agak kagum dengan apa yang bisa diberikan oleh Opus 5
00:01:11dalam hal angka mentah.
00:01:14Pada kenyataannya, saya pikir kebanyakan orang masih lebih menyukai Fable 5 daripada Opus 5,
00:01:16tetapi saya merasa perbandingan antara Fable 5 versus 5.1
00:01:19kemungkinan sedikit lebih akurat
00:01:23dalam hal rasanya
00:01:24ketika Anda benar-benar menggunakannya.
00:01:26Selain itu, sebagian besar peningkatan tolok ukur
00:01:28bersifat relatif bertahap.
00:01:29Kita berbicara tentang beberapa persen di sana-sini,
00:01:31dengan pengecualian alur kerja bisnis
00:01:32yang menggunakan tolok ukur otomatisasi.
00:01:34Sekarang, yang penting bukan hanya tolok ukurnya itu sendiri,
00:01:37tetapi berapa banyak yang kita bayar untuk skor semacam ini,
00:01:39dan perubahan seperti apa yang kita lihat
00:01:41ketika kita mengubah tingkat upaya?
00:01:43Karena itu selalu sangat menarik untuk dilihat,
00:01:44karena seringkali ketika kita melihat tingkat upaya sangat tinggi
00:01:46atau maksimum,
00:01:48kita benar-benar tidak mendapatkan hasil yang sepadan
00:01:49dibandingkan dengan tinggi atau bahkan sedang.
00:01:51Jadi yang kita miliki di sini adalah Terminal Bench 4.0.
00:01:53Kita memiliki Mythos 5.1 di bagian atas,
00:01:56Fable 5.1 di tengah,
00:01:59dan kemudian Mythos 5 di bawah sini,
00:02:00dan Anda dapat membayangkan Fable 5 sedikit di bawah Mythos.
00:02:02Jadi Fable 5.1 dan Mythos 5.1,
00:02:05tentunya merupakan lompatan besar dibandingkan dengan Mythos 5,
00:02:07dan harganya lebih murah.
00:02:10Dan yang sangat keren adalah ketika kita melihat sesuatu
00:02:12seperti tinggi, misalnya,
00:02:13yang saya rasa menjadi tempat sebagian besar orang berada,
00:02:15sering kali saya menggunakan tingkat sedang
00:02:16dalam kasus penggunaan Fable saya,
00:02:17Anda pada dasarnya,
00:02:20jika kita melihat tingkat sedang,
00:02:20kita menyamai output maksimum pada Mythos 5,
00:02:21tetapi alih-alih berharga $26,
00:02:25biayanya menjadi $7,80.
00:02:27Dan ketika kita beralih ke tinggi,
00:02:30dan kita membandingkan tinggi dengan katakanlah maksimum,
00:02:32Anda hanya melihat,
00:02:34berapa, perubahan 6% dalam hal output,
00:02:35namun biayanya $19,50 versus $10,50.
00:02:38Jadi yang sangat keren tentang model-model baru ini
00:02:42adalah Anda bisa mendapatkan kinerja yang sangat tinggi
00:02:43pada tingkat upaya menengah tersebut
00:02:45dan benar-benar menghemat biaya.
00:02:47Dan kita melihat pola yang sama berlaku
00:02:50pada tolok ukur lainnya, bukan?
00:02:52Ini adalah Humanity's Last Exam.
00:02:53Sekali lagi, kita tidak melihat peningkatan yang besar
00:02:55ketika kita melompat dari tinggi ke maksimum,
00:02:57namun kita memiliki kinerja yang sangat baik
00:02:59dengan biaya yang cukup wajar
00:03:00pada pengaturan tingkat menengah ini.
00:03:02Satu pengecualian adalah ketika kita melihat
00:03:04pengodingan agen pada Cursor Bench,
00:03:05Fable 5.1,
00:03:07kita melihat lonjakan yang cukup tinggi dari tinggi ke ekstra tinggi,
00:03:08tetapi sekali lagi, antara ekstra tinggi dan maksimum,
00:03:11tidak terlalu banyak.
00:03:13Tapi, Anda tahu, jika saya berada di tingkat tinggi,
00:03:14pada Fable 5.1,
00:03:15itu sama dengan berada di ekstra tinggi
00:03:17dengan Fable 5,
00:03:18namun dengan biaya kurang dari separuhnya.
00:03:20Jadi penghematan harga yang besar di sini,
00:03:22bahkan jika Anda bukan seseorang
00:03:24yang melakukan pekerjaan yang sangat kompleks.
00:03:25Jika Anda
00:03:27hanya bisa dibilang
00:03:29pengembang solo rata-rata,
00:03:30masalah Anda tidak begitu rumit,
00:03:32tetapi Anda suka menggunakan model mutakhir ini,
00:03:33sekarang Anda memiliki kemampuan
00:03:34untuk menurunkan tingkat upaya
00:03:36dan Anda hampir melakukan
00:03:37apa yang Anda lakukan sebelumnya
00:03:38dengan separuh biaya,
00:03:40yang keunggulannya luar biasa.
00:03:41Sekarang, penelitian ilmiah
00:03:42selalu menjadi nilai jual yang cukup besar
00:03:44dalam hal model Fable dan Mythos.
00:03:46Dan jadi dengan rilis 5.1,
00:03:48tidak ada perubahan di sana.
00:03:49Mereka banyak berbicara tentang desain molekuler,
00:03:51analisis dan pemodelan komputasi,
00:03:53serta biologi komputasi.
00:03:55Sekali lagi, ini adalah masalah yang lebih khusus
00:03:57yang diselesaikan oleh beberapa orang,
00:03:58tetapi selalu menarik untuk melihat
00:04:00apa yang terjadi di domain ini
00:04:01dibandingkan standar Anda,
00:04:03apa yang dilakukan model ini
00:04:03pada tolok ukur pengodingan agen ini.
00:04:05Dan seperti yang saya singgung di intro,
00:04:07telah ada beberapa perubahan
00:04:08dalam hal keamanan,
00:04:09keselamatan,
00:04:09dan penyelarasan.
00:04:11Gambaran besar,
00:04:12lebih sedikit positif palsu.
00:04:13Anda dapat mengajukan lebih banyak pertanyaan
00:04:14yang berkaitan dengan hal-hal seperti keamanan siber
00:04:15dan model ini cukup cerdas
00:04:16untuk tidak langsung panik
00:04:18dan mengirim Anda ke Opus
00:04:19apa pun yang terjadi.
00:04:20Jika Anda ingin menyelami lebih mendalam,
00:04:21secara mendalam tentang ini,
00:04:21mereka memiliki kartu sistem mereka
00:04:23yang selalu dapat Anda lihat.
00:04:24Ini, Anda tahu,
00:04:25beberapa ratus halaman materi,
00:04:27212 tepatnya,
00:04:28tetapi mereka memberikan ringkasan yang bagus di sini.
00:04:30Namun yang perlu Anda pedulikan
00:04:31hanyalah bahwa pengaman ini
00:04:32lebih tepat,
00:04:33sehingga lebih kecil kemungkinannya
00:04:34untuk menandai konten jinak
00:04:35dan langsung mengarahkan Anda
00:04:36ke model yang lebih rendah.
00:04:37Khusus untuk pertanyaan keamanan siber,
00:04:40pengguna Cloud Code
00:04:40dapat mengharapkan rata-rata
00:04:41intervensi 60% lebih sedikit
00:04:43per sesi
00:04:44dari pengaman ini,
00:04:46yang sangat bagus
00:04:46jika Anda bekerja
00:04:47pada aplikasi apa pun
00:04:48di mana Anda perlu mengajukan pertanyaan
00:04:49tentang praktik terbaik keamanan siber
00:04:51untuk kasus penggunaan khusus Anda.
00:04:53Mereka memang memiliki
00:04:53paragraf yang menarik di sini
00:04:54yang membahas
00:04:55mekanisme anti-distilasi,
00:04:57yang merupakan metode
00:04:58untuk pada dasarnya mengekstrak
00:04:59hal terbaik dari Fable 5
00:05:01dan Fable 5.1
00:05:02untuk digunakan di model lain.
00:05:03Ini adalah sebuah diskusi
00:05:04yang cukup besar
00:05:05kaitannya dengan
00:05:06model sumber terbuka.
00:05:07Anda mungkin sering mendengar
00:05:08tentang semua
00:05:08model sumber terbuka yang bagus ini
00:05:09yang dirilis,
00:05:10dan tidak ragu lagi
00:05:11mereka akan terus bermunculan
00:05:13seiring mereka disuling
00:05:14dari model-model terdepan ini.
00:05:15Jadi ini adalah jenis
00:05:17diskusi
00:05:17yang sebaiknya
00:05:18Anda perhatikan.
00:05:18Ini tidak terlalu berdampak pada Anda,
00:05:20pengguna akhir,
00:05:21tetapi ini adalah, Anda tahu,
00:05:22semacam hal tingkat atas di mana
00:05:23kita memiliki semua
00:05:24model sumber terbuka
00:05:25yang berasal dari China
00:05:26sementara banyak dari perusahaan
00:05:26terdepan berada di AS,
00:05:27dan selalu ada
00:05:28semacam, Anda tahu,
00:05:29anggapan bahwa semua
00:05:31model sumber terbuka ini
00:05:32sebenarnya hanya
00:05:32mengambil sumber dari hal-hal
00:05:33seperti Opus dan Fable.
00:05:35Mereka memberikan contoh
00:05:36tentang cara kerjanya
00:05:37di mana akun API baru
00:05:38tidak dapat mengedit konteks sebelumnya
00:05:39milik Claude
00:05:40untuk pada dasarnya mengekstrak
00:05:42cara berpikir Claude
00:05:43dan menghasilkan
00:05:44jawaban-jawabannya.
00:05:44Dan sekali lagi,
00:05:45ini khusus
00:05:46Dan sekali lagi,
00:05:46jadi jika Anda sudah memilikinya,
00:05:47sekali lagi,
00:05:48ini tidak akan terlalu berdampak pada Anda.
00:05:48Sekarang, dalam hal biaya
00:05:49dan ketersediaan,
00:05:50ketersediaan,
00:05:51fitur ini sudah tersedia
00:05:52di mana-mana sekarang.
00:05:52Biaya.
00:05:53Per token,
00:05:54jika Anda perhatikan,
00:05:55biayanya persis sama
00:05:56seperti Fable 5.
00:05:56Kita melihat $10
00:05:58per juta token input
00:05:58dan $50 per juta
00:05:59token output,
00:06:00tetapi pada kenyataannya,
00:06:02ketika Anda benar-benar menggunakannya
00:06:03untuk tugas tertentu,
00:06:04biayanya akan lebih murah
00:06:05karena pembacaan singgahan.
00:06:06Sekarang, jika Anda tidak tahu
00:06:07apa itu caching prompt,
00:06:08Anda dapat melihat video
00:06:09yang saya buat minggu lalu
00:06:10tentang hal tersebut.
00:06:12Pada dasarnya,
00:06:12ini sangat besar
00:06:14jika Anda adalah seseorang
00:06:14yang menjalankan tugas agen
00:06:16berdurasi panjang.
00:06:18Jadi Anda memiliki
00:06:18sesi yang sangat besar,
00:06:19banyak konteks,
00:06:20dan Anda menggunakannya
00:06:20secara terus-menerus.
00:06:23Anda tidak hanya menyuruhnya
00:06:23melakukan sesuatu
00:06:25lalu kembali keesokan harinya.
00:06:26Anda terus berbicara
00:06:27dan mengobrol
00:06:28dengannya.
00:06:29Jadi pembacaan singgahan ini
00:06:2975% lebih murah,
00:06:30yang merupakan perubahan besar,
00:06:31dan itulah yang menghasilkan
00:06:32biaya yang lebih rendah ini.
00:06:32Dan grafik ini
00:06:33menjelaskannya di sini.
00:06:35Biaya ini bisa menjadi sekitar 25% lebih murah
00:06:37untuk tugas normal,
00:06:39tetapi sekali lagi,
00:06:40beban kerja agen yang intensif
00:06:41bisa mencapai 45% lebih murah.
00:06:42Jadi sangat menyenangkan
00:06:42mendapatkan pembaruan
00:06:44untuk model Fable ini.
00:06:45Saya sangat menyukai Fable 5,
00:06:46meskipun rasanya biasa saja
00:06:47jika dibandingkan dengan Opus 5,
00:06:49tetapi bagi Anda
00:06:49yang telah mencoba langsung Fable,
00:06:50saya pikir Anda pasti setuju
00:06:51bahwa ada perubahan signifikan
00:06:53pada apa yang dihadirkan model ini
00:06:53dibandingkan semua hal lain
00:06:54yang pernah kita dapatkan
00:06:55dari Anthropic.
00:06:56Jadi memiliki sesuatu
00:06:57yang lebih baik
00:06:58dan lebih murah
00:06:59serta lebih sedikit yang perlu dikhawatirkan
00:07:01dalam hal batasan keamanan
00:07:02menurut saya adalah hal yang hebat.
00:07:03Jadi pastikan untuk mencobanya.
00:07:03Beri tahu saya
00:07:04pendapat Anda.
00:07:05Jadi memiliki sesuatu
00:07:06yang lebih baik
00:07:07dan lebih murah
00:07:09serta tidak terlalu mengkhawatirkan
00:07:10soal pembatasan,
00:07:11menurut saya itu hal yang luar biasa.
00:07:12Jadi pastikan untuk mencobanya,
00:07:13dan beri tahu saya pendapat Anda.

Key Takeaway

Model Fable 5.1 menghadirkan kinerja yang melampaui versi sebelumnya dan GPT 5.6 dengan penghematan biaya hingga 45% melalui optimalisasi pembacaan tembolok.

Highlights

  • Model Fable 5.1 menurunkan biaya pembacaan tembolok sebesar 75% dibandingkan versi sebelumnya.

  • Pengurangan biaya total mencapai 45% pada tugas agen berdurasi panjang dengan ribuan token.

  • Peluang positif palsu pada pengaman keamanan siber berkurang 60% pada Fable 5.1.

  • Kinerja pengodingan berbasis agen meningkat dari 42% pada Fable 5 menjadi 55,8 pada Fable 5.1.

  • Tingkat upaya menengah pada Fable 5.1 menyamai output maksimum Mythos 5 dengan biaya $7,80 alih-alih $26.

Timeline

Perubahan Harga dan Efisiensi Biaya

  • Fable 5.1 menelan biaya 25% lebih murah daripada Fable 5 secara keseluruhan.
  • Pengurangan biaya pembacaan tembolok mencapai 75%.
  • Pekerjaan agen dengan ribuan token menghasilkan penghematan biaya hingga 45%.

Penurunan harga berfokus pada pembacaan tembolok yang sangat krusial untuk pekerjaan agen berjalan lama. Pengguna tingkat menengah dapat menyamai output maksimum model lain dengan pengeluaran yang jauh lebih rendah. Penyesuaian tingkat upaya memungkinkan pengembang solo menekan biaya operasional secara signifikan tanpa mengorbankan kualitas keluaran.

Peningkatan Tolok Ukur dan Kinerja

  • Fable 5.1 mengungguli Fable 5, Opus 5, dan GPT 5.6 di berbagai tolok ukur.
  • Penelitian ilmiah berbasis agen mencatat hasil dua kali lipat lebih tinggi dari Fable 5.
  • Intervensi pengaman keamanan siber berkurang rata-rata 60% per sesi.

Lonjakan metrik terbesar terlihat pada penelitian ilmiah dan pengodingan agen. Pengaman keamanan yang lebih tepat mengurangi pemblokiran konten jinak secara drastis. Ketersediaan model ini sudah menyeluruh dengan struktur harga per token input dan output yang tetap, sementara penghematan nyata didapat dari efisiensi tembolok.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video