스크립트
00:00:00Anthropic merilis Claude Sonnet 5 minggu lalu dan cukup mengecewakan, tapi setidaknya Fable 5 kembali,
00:00:04walau mungkin di-nerf, dan oh, Claude Code mungkin memiliki kode mirip spyware di dalamnya untuk mendeteksi
00:00:09penggunaan dari China. Mari kita mulai. Saya akan mulai dengan Sonnet 5. Ini sebenarnya pembaruan Sonnet pertama dalam empat
00:00:18setengah bulan, dan Anthropic mengatakan ini dibuat sebagai model Sonnet mereka yang paling agenik,
00:00:22dengan performa yang mendekati Opus 4.8, namun dengan harga lebih murah. Harga menjadi hal yang sangat menarik
00:00:28dengan model ini, jadi kita akan membahasnya nanti. Tapi pertama, mari kita lihat tolok ukur
00:00:31yang disediakan Anthropic. Model ini mengalahkan pendahulunya di semua aspek, dan mendekati Opus di beberapa
00:00:35seperti Terminal Bench dan Computer Use, bahkan sedikit mengalahkan Opus dalam pekerjaan berbasis pengetahuan. Saya lebih suka melihat
00:00:40tolok ukur pihak ketiga, dan yang saya percaya berasal dari Artificial Analysis, dan pada
00:00:44indeks pengkodean, model ini tertinggal beberapa poin di belakang Opus, namun sedikit di depan GPT 5.4. Ini adalah
00:00:50lompatan yang sangat bagus dari pendahulunya, Sonnet 4.6. Hal yang sama juga terjadi pada Indeks Kecerdasan,
00:00:56terletak di antara GPT 5.5 dan GPT 5.4, namun menariknya, pada indeks agenik, ia justru mengungguli GPT 5.5.
00:01:03Jadi ketika mereka mengatakan di blog bahwa mereka bekerja keras pada kemampuan ageniknya,
00:01:06tampaknya itu membuahkan hasil. Dari tolok ukur, terlihat ini model yang cukup kompeten,
00:01:10dan jelas merupakan peningkatan dari Sonnet 4.6, tapi mari kita bicara soal elemen harganya.
00:01:14Untuk harga API, mereka memberikan harga diskon $2 per satu juta token input,
00:01:18dan $10 per satu juta token output, itu sampai tanggal 31 Agustus. Setelah itu akan kembali ke
00:01:23harga yang sama dengan model Sonnet lainnya, yaitu $3 per satu juta token input dan $15 per satu juta token
00:01:28output. Ini menempatkannya di sekitar Gemini 3.5 Flash dan GPT 5.6 Terra, jika kita mendapatkan akses ke sana,
00:01:34dan seperti yang mereka katakan, ini lebih murah dari Opus 4.8. Masalahnya adalah, dalam praktiknya, ini sama sekali
00:01:39tidak benar. Model ini sangat haus token. Ia menggunakan sekitar 69.000 token untuk menjalankan satu tugas di
00:01:45Indeks Kecerdasan Artificial Analysis, membuatnya lebih banyak daripada Sonnet 4.6, Opus 4.8, Fable 5, GPT 5.4,
00:01:52dan 5.5. Jika Anda melihatnya di kuadran ini, di mana hijau adalah tempat yang ideal, model ini berada
00:01:57sejauh mungkin dari model-model tersebut. Hal ini tentu berdampak pada biaya sebenarnya dari suatu tugas,
00:02:02dan Artificial Analysis menemukan bahwa Sonnet 5 ternyata lebih mahal daripada Opus 4.8 per tugas,
00:02:07hanya dikalahkan oleh Fable. Ditambah lagi, jika Anda mengambil model seperti GPT 5.5, yang sebenarnya berkinerja lebih baik pada sebagian besar
00:02:12tolok ukur, harganya setengah dari harga Sonnet 5. Perlu dicatat di sini bahwa Artificial Analysis
00:02:16sebenarnya menggunakan harga standar model tersebut dan bukan harga diskon, jadi saya sangat
00:02:20penasaran untuk melihat apakah Anthropic mencoba memperbaikinya dengan mungkin memperpanjang diskon tersebut atau membiarkannya
00:02:25menjadi harga permanen. Lebih buruk dari biaya per tugas, Artificial Analysis menemukan bahwa
00:02:29untuk menjalankan seluruh rangkaian pengujian mereka, Sonnet 5 menghabiskan biaya lebih banyak daripada Fable 5. Jadi, apa yang terjadi di sini? Bahkan pada
00:02:34Cursor Bench, jika Anda melihat Sonnet 5 High, harganya sekitar sama dengan Opus 4.8 untuk hasil yang
00:02:39serupa, dan saat Anda naik ke tingkat usaha yang lebih tinggi, Sonnet 5 Max mendapat skor lebih buruk daripada Opus 4.8 extra high sambil
00:02:44biayanya lebih mahal. Rasanya mereka perlu memperbarui atau memperbaiki sesuatu di sini, atau saya tidak melihat
00:02:48di mana letak kecocokan model ini. Ini sama sekali bukan model yang buruk dari segi kemampuan, hanya secara ekonomi, dan saya telah
00:02:54menjadi penggemar berat model Sonnet. Saya pikir mereka adalah yang pertama yang banyak dari kita gunakan sehari-hari,
00:02:58tapi selama beberapa bulan terakhir saya selalu menggunakan Opus 4.8, dan tidak ada dari semua ini yang membuat saya berubah pikiran.
00:03:02Apalagi dengan kembalinya Fable, Fable akan digunakan untuk tugas-tugas berat,
00:03:05dan Opus 4.8 untuk penggunaan sehari-hari, dan Sonnet untuk apa pun. Berbicara tentang Fable 5, kontrol ekspor
00:03:11telah dicabut, dan sekarang kembali tersedia bagi semua orang, terlepas dari kewarganegaraan Anda, tapi sayangnya Anda
00:03:15memiliki waktu seminggu untuk menggunakannya dalam batas paket Anda, atau setidaknya 50% dari batas paket Anda, dan setelah 7 Juli
00:03:20itu hanya akan tersedia melalui kredit penggunaan. Ada beberapa poin menarik di blog itu tentang
00:03:24larangan awal tersebut. Itu sebenarnya berasal dari dugaan jailbreak oleh peneliti Amazon yang berhasil
00:03:29meminta model untuk menemukan kerentanan keamanan, dan dalam satu kasus mendemonstrasikan cara mengeksploitasinya,
00:03:33tetapi saat menyelidiki ini, Anthropic menemukan bahwa banyak model seperti Claude Opus 4.8,
00:03:37GPT 5.5, dan Kimi K 2.7 dapat mengidentifikasi kerentanan yang persis sama seperti yang dilakukan Fable 5 dalam laporan tersebut,
00:03:43dan ketika sampai pada demonstrasi tentang cara mengeksploitasi satu kerentanan itu,
00:03:47setiap model yang diuji bisa melakukannya, termasuk Claude Haiku 4.5, Sonnet 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5, dan Kimi K 2.7. Jadi bagi saya sepertinya larangan itu cukup sia-sia
00:03:58dan yang benar-benar dicapai adalah Anthropic sekarang telah membuat perlindungan itu bahkan
00:04:02lebih ketat pada Fable, membuat banyak permintaan normal terblokir, dan dalam tweet pengumuman mereka,
00:04:06mereka sebenarnya mengatakan bahwa tugas rutin seperti debugging dan coding akan kembali ke Opus 4.8,
00:04:11tetapi seorang karyawan Anthropic kemudian mengoreksi ini dengan mengatakan seharusnya hanya sejumlah kecil.
00:04:14Tetapi tampaknya ini telah berdampak pada beberapa tolok ukur lebih dari yang lain, dengan klaim bahwa Fable sekarang telah
00:04:18di-nerf. Pada dasarnya ia lebih banyak kembali ke Opus 4.8, sehingga kinerjanya jauh lebih buruk pada tolok ukur
00:04:23ini. Mengenai topik serupa tentang kontrol ekspor dan larangan, beberapa orang memperhatikan bahwa Claude
00:04:27code sekarang memiliki beberapa upaya fingerprinting dengan cara yang sangat licik, dengan memodifikasi string tanggal
00:04:32prompt sistemnya. Ini adalah posting blog bagus yang membahas semua detailnya, dan saya akan meninggalkan ini
00:04:35tertaut di bawah, tapi ringkasannya adalah ada fungsi di Claude code yang memeriksa apakah zona waktu Anda ada di
00:04:40China. Jika ya, string tanggal Anda akan berubah dari menggunakan tanda hubung menjadi menggunakan garis miring. Kemudian ia juga akan
00:04:44memeriksa apakah URL berbasis API Anda cocok dengan daftar ini, atau apakah nama host berisi kata kunci lab AI tertentu
00:04:49seperti DeepSeq, Minimax, atau ZAI, dan jika ya, ia akan mengubah apostrof di 'today's' menjadi karakter
00:04:55Unicode berbeda yang pada dasarnya terlihat sama persis. Ini teknik yang sangat cerdas yang disebut steganografi,
00:05:00dan sebagian besar dari Anda tidak akan terpengaruh oleh ini. Ini pada dasarnya dimaksudkan untuk mencoba mendeteksi pengecer API,
00:05:03gateway Claude code yang tidak sah, dan serangan distilasi model. Saya tidak benar-benar memiliki
00:05:08masalah dengan mereka mencoba melakukan itu, saya hanya lebih suka mereka sedikit lebih jujur tentang hal-hal yang
00:05:12ada di Claude code, dan tidak mencoba menyembunyikannya dengan cara ini. Apakah menurut Anda itu masalah, dan apa pendapat Anda
00:05:16tentang Sonnet 5 dan kembalinya Fable? Beri tahu saya di komentar di bawah, atau apakah Anda sudah berlangganan,
00:05:20dan seperti biasa, sampai jumpa di video berikutnya.