Claude Sonnet 5 Mengecewakan... (Tapi Fable Kembali!)

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00Anthropic merilis Claude Sonnet 5 minggu lalu dan cukup mengecewakan, tapi setidaknya Fable 5 kembali,
00:00:04walau mungkin di-nerf, dan oh, Claude Code mungkin memiliki kode mirip spyware di dalamnya untuk mendeteksi
00:00:09penggunaan dari China. Mari kita mulai. Saya akan mulai dengan Sonnet 5. Ini sebenarnya pembaruan Sonnet pertama dalam empat
00:00:18setengah bulan, dan Anthropic mengatakan ini dibuat sebagai model Sonnet mereka yang paling agenik,
00:00:22dengan performa yang mendekati Opus 4.8, namun dengan harga lebih murah. Harga menjadi hal yang sangat menarik
00:00:28dengan model ini, jadi kita akan membahasnya nanti. Tapi pertama, mari kita lihat tolok ukur
00:00:31yang disediakan Anthropic. Model ini mengalahkan pendahulunya di semua aspek, dan mendekati Opus di beberapa
00:00:35seperti Terminal Bench dan Computer Use, bahkan sedikit mengalahkan Opus dalam pekerjaan berbasis pengetahuan. Saya lebih suka melihat
00:00:40tolok ukur pihak ketiga, dan yang saya percaya berasal dari Artificial Analysis, dan pada
00:00:44indeks pengkodean, model ini tertinggal beberapa poin di belakang Opus, namun sedikit di depan GPT 5.4. Ini adalah
00:00:50lompatan yang sangat bagus dari pendahulunya, Sonnet 4.6. Hal yang sama juga terjadi pada Indeks Kecerdasan,
00:00:56terletak di antara GPT 5.5 dan GPT 5.4, namun menariknya, pada indeks agenik, ia justru mengungguli GPT 5.5.
00:01:03Jadi ketika mereka mengatakan di blog bahwa mereka bekerja keras pada kemampuan ageniknya,
00:01:06tampaknya itu membuahkan hasil. Dari tolok ukur, terlihat ini model yang cukup kompeten,
00:01:10dan jelas merupakan peningkatan dari Sonnet 4.6, tapi mari kita bicara soal elemen harganya.
00:01:14Untuk harga API, mereka memberikan harga diskon $2 per satu juta token input,
00:01:18dan $10 per satu juta token output, itu sampai tanggal 31 Agustus. Setelah itu akan kembali ke
00:01:23harga yang sama dengan model Sonnet lainnya, yaitu $3 per satu juta token input dan $15 per satu juta token
00:01:28output. Ini menempatkannya di sekitar Gemini 3.5 Flash dan GPT 5.6 Terra, jika kita mendapatkan akses ke sana,
00:01:34dan seperti yang mereka katakan, ini lebih murah dari Opus 4.8. Masalahnya adalah, dalam praktiknya, ini sama sekali
00:01:39tidak benar. Model ini sangat haus token. Ia menggunakan sekitar 69.000 token untuk menjalankan satu tugas di
00:01:45Indeks Kecerdasan Artificial Analysis, membuatnya lebih banyak daripada Sonnet 4.6, Opus 4.8, Fable 5, GPT 5.4,
00:01:52dan 5.5. Jika Anda melihatnya di kuadran ini, di mana hijau adalah tempat yang ideal, model ini berada
00:01:57sejauh mungkin dari model-model tersebut. Hal ini tentu berdampak pada biaya sebenarnya dari suatu tugas,
00:02:02dan Artificial Analysis menemukan bahwa Sonnet 5 ternyata lebih mahal daripada Opus 4.8 per tugas,
00:02:07hanya dikalahkan oleh Fable. Ditambah lagi, jika Anda mengambil model seperti GPT 5.5, yang sebenarnya berkinerja lebih baik pada sebagian besar
00:02:12tolok ukur, harganya setengah dari harga Sonnet 5. Perlu dicatat di sini bahwa Artificial Analysis
00:02:16sebenarnya menggunakan harga standar model tersebut dan bukan harga diskon, jadi saya sangat
00:02:20penasaran untuk melihat apakah Anthropic mencoba memperbaikinya dengan mungkin memperpanjang diskon tersebut atau membiarkannya
00:02:25menjadi harga permanen. Lebih buruk dari biaya per tugas, Artificial Analysis menemukan bahwa
00:02:29untuk menjalankan seluruh rangkaian pengujian mereka, Sonnet 5 menghabiskan biaya lebih banyak daripada Fable 5. Jadi, apa yang terjadi di sini? Bahkan pada
00:02:34Cursor Bench, jika Anda melihat Sonnet 5 High, harganya sekitar sama dengan Opus 4.8 untuk hasil yang
00:02:39serupa, dan saat Anda naik ke tingkat usaha yang lebih tinggi, Sonnet 5 Max mendapat skor lebih buruk daripada Opus 4.8 extra high sambil
00:02:44biayanya lebih mahal. Rasanya mereka perlu memperbarui atau memperbaiki sesuatu di sini, atau saya tidak melihat
00:02:48di mana letak kecocokan model ini. Ini sama sekali bukan model yang buruk dari segi kemampuan, hanya secara ekonomi, dan saya telah
00:02:54menjadi penggemar berat model Sonnet. Saya pikir mereka adalah yang pertama yang banyak dari kita gunakan sehari-hari,
00:02:58tapi selama beberapa bulan terakhir saya selalu menggunakan Opus 4.8, dan tidak ada dari semua ini yang membuat saya berubah pikiran.
00:03:02Apalagi dengan kembalinya Fable, Fable akan digunakan untuk tugas-tugas berat,
00:03:05dan Opus 4.8 untuk penggunaan sehari-hari, dan Sonnet untuk apa pun. Berbicara tentang Fable 5, kontrol ekspor
00:03:11telah dicabut, dan sekarang kembali tersedia bagi semua orang, terlepas dari kewarganegaraan Anda, tapi sayangnya Anda
00:03:15memiliki waktu seminggu untuk menggunakannya dalam batas paket Anda, atau setidaknya 50% dari batas paket Anda, dan setelah 7 Juli
00:03:20itu hanya akan tersedia melalui kredit penggunaan. Ada beberapa poin menarik di blog itu tentang
00:03:24larangan awal tersebut. Itu sebenarnya berasal dari dugaan jailbreak oleh peneliti Amazon yang berhasil
00:03:29meminta model untuk menemukan kerentanan keamanan, dan dalam satu kasus mendemonstrasikan cara mengeksploitasinya,
00:03:33tetapi saat menyelidiki ini, Anthropic menemukan bahwa banyak model seperti Claude Opus 4.8,
00:03:37GPT 5.5, dan Kimi K 2.7 dapat mengidentifikasi kerentanan yang persis sama seperti yang dilakukan Fable 5 dalam laporan tersebut,
00:03:43dan ketika sampai pada demonstrasi tentang cara mengeksploitasi satu kerentanan itu,
00:03:47setiap model yang diuji bisa melakukannya, termasuk Claude Haiku 4.5, Sonnet 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5, dan Kimi K 2.7. Jadi bagi saya sepertinya larangan itu cukup sia-sia
00:03:58dan yang benar-benar dicapai adalah Anthropic sekarang telah membuat perlindungan itu bahkan
00:04:02lebih ketat pada Fable, membuat banyak permintaan normal terblokir, dan dalam tweet pengumuman mereka,
00:04:06mereka sebenarnya mengatakan bahwa tugas rutin seperti debugging dan coding akan kembali ke Opus 4.8,
00:04:11tetapi seorang karyawan Anthropic kemudian mengoreksi ini dengan mengatakan seharusnya hanya sejumlah kecil.
00:04:14Tetapi tampaknya ini telah berdampak pada beberapa tolok ukur lebih dari yang lain, dengan klaim bahwa Fable sekarang telah
00:04:18di-nerf. Pada dasarnya ia lebih banyak kembali ke Opus 4.8, sehingga kinerjanya jauh lebih buruk pada tolok ukur
00:04:23ini. Mengenai topik serupa tentang kontrol ekspor dan larangan, beberapa orang memperhatikan bahwa Claude
00:04:27code sekarang memiliki beberapa upaya fingerprinting dengan cara yang sangat licik, dengan memodifikasi string tanggal
00:04:32prompt sistemnya. Ini adalah posting blog bagus yang membahas semua detailnya, dan saya akan meninggalkan ini
00:04:35tertaut di bawah, tapi ringkasannya adalah ada fungsi di Claude code yang memeriksa apakah zona waktu Anda ada di
00:04:40China. Jika ya, string tanggal Anda akan berubah dari menggunakan tanda hubung menjadi menggunakan garis miring. Kemudian ia juga akan
00:04:44memeriksa apakah URL berbasis API Anda cocok dengan daftar ini, atau apakah nama host berisi kata kunci lab AI tertentu
00:04:49seperti DeepSeq, Minimax, atau ZAI, dan jika ya, ia akan mengubah apostrof di 'today's' menjadi karakter
00:04:55Unicode berbeda yang pada dasarnya terlihat sama persis. Ini teknik yang sangat cerdas yang disebut steganografi,
00:05:00dan sebagian besar dari Anda tidak akan terpengaruh oleh ini. Ini pada dasarnya dimaksudkan untuk mencoba mendeteksi pengecer API,
00:05:03gateway Claude code yang tidak sah, dan serangan distilasi model. Saya tidak benar-benar memiliki
00:05:08masalah dengan mereka mencoba melakukan itu, saya hanya lebih suka mereka sedikit lebih jujur tentang hal-hal yang
00:05:12ada di Claude code, dan tidak mencoba menyembunyikannya dengan cara ini. Apakah menurut Anda itu masalah, dan apa pendapat Anda
00:05:16tentang Sonnet 5 dan kembalinya Fable? Beri tahu saya di komentar di bawah, atau apakah Anda sudah berlangganan,
00:05:20dan seperti biasa, sampai jumpa di video berikutnya.

핵심 요약

Meskipun Sonnet 5 menunjukkan peningkatan performa agenik, model ini kurang efisien secara ekonomi karena konsumsi token yang tinggi, sementara Fable 5 kembali tersedia dengan batasan penggunaan yang lebih ketat setelah evaluasi keamanan.

하이라이트

  • Claude Sonnet 5 mengenakan biaya $2 per 1 juta token input dan $10 per 1 juta token output hingga 31 Agustus, sebelum naik menjadi $3 dan $15.

  • Sonnet 5 mengonsumsi sekitar 69.000 token untuk menyelesaikan satu tugas pada Indeks Kecerdasan Artificial Analysis, melampaui konsumsi token model lain seperti Opus 4.8 dan Fable 5.

  • Biaya per tugas untuk Sonnet 5 ternyata lebih tinggi dibandingkan Opus 4.8, kecuali saat dibandingkan dengan model Fable.

  • Fable 5 kembali tersedia bagi semua pengguna tanpa batasan kewarganegaraan, namun penggunaan dibatasi hingga 50% dari kuota paket hingga 7 Juli.

  • Claude code menerapkan teknik steganografi untuk mendeteksi penggunaan API tidak sah dan upaya distilasi model dengan memodifikasi karakter Unicode dalam prompt sistem berdasarkan zona waktu atau penyedia API.

타임라인

Analisis Performa dan Ekonomi Claude Sonnet 5

  • Sonnet 5 mengungguli model pendahulu dan GPT 5.5 pada tolok ukur indeks agenik.
  • Konsumsi token yang tinggi membuat biaya operasional per tugas Sonnet 5 lebih mahal daripada Opus 4.8.
  • Harga diskon API sebesar $2 untuk input dan $10 untuk output akan berakhir pada 31 Agustus.

Pembaruan Sonnet 5 diklaim sebagai model paling agenik dengan performa mendekati Opus 4.8. Namun, dalam praktik penggunaan nyata, model ini sangat haus akan token dibandingkan model kompetitor. Temuan dari Artificial Analysis menunjukkan bahwa biaya per tugas Sonnet 5 melampaui Opus 4.8, terutama karena efisiensi yang lebih rendah pada tolok ukur kompleks.

Kembalinya Fable 5 dan Masalah Keamanan

  • Fable 5 kini tersedia bagi pengguna umum tanpa pembatasan negara asal.
  • Penggunaan Fable 5 dibatasi hingga 50% dari kuota paket per minggu hingga 7 Juli.
  • Larangan awal pada Fable 5 dinilai tidak efektif karena model lain juga dapat mengidentifikasi kerentanan yang sama.

Setelah sempat ditarik akibat dugaan jailbreak terkait permintaan identifikasi kerentanan keamanan, Fable 5 kembali dibuka. Anthropic menemukan bahwa kemampuan untuk mendeteksi dan mengeksploitasi kerentanan tersebut sebenarnya dimiliki oleh hampir semua model besar lainnya. Akibatnya, langkah pembatasan saat ini difokuskan pada pengetatan perlindungan keamanan, yang berdampak pada penurunan performa Fable 5 pada beberapa tolok ukur.

Deteksi Penggunaan Claude Code

  • Claude code memodifikasi string tanggal dan karakter Unicode dalam prompt sistem sebagai bentuk fingerprinting.
  • Teknik steganografi ini digunakan untuk melacak pengecer API tidak sah dan serangan distilasi model.
  • Modifikasi dilakukan secara otomatis jika zona waktu terdeteksi berada di China atau jika API berasal dari penyedia tertentu.

Claude code menggunakan metode halus untuk mendeteksi asal-usul permintaan API. Dengan memodifikasi tanda baca dalam string tanggal atau mengubah karakter apostrof menjadi karakter Unicode yang identik secara visual, sistem ini dapat mengidentifikasi pengguna atau entitas yang mencurigakan. Praktik ini bertujuan untuk membatasi penyalahgunaan gateway API dan menjaga integritas model dari upaya distilasi.

커뮤니티 글

모든 글 보기