DeepSeek dan Kimi Diam-Diam Mengirimkan Prompt Anda ke Claude

BBetter Stack
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00Anthropic baru saja menyerang DeepSeek, Kimi, Qwen, GLM, dan praktis semua model buatan China,
00:00:04menuduh mereka tidak hanya melakukan distilasi pada model mereka, tetapi juga secara diam-diam meneruskan
00:00:08permintaan pelanggan mereka sendiri ke Claude Opus dan menampilkan jawaban tersebut seolah-olah berasal dari model mereka.
00:00:13Oh, mereka juga menemukan bukti negara-negara yang menggunakan Claude untuk membangun kawanan drone,
00:00:17merencanakan perang bawah air, pengawasan domestik, dan banyak lagi,
00:00:20tetapi jujur saja, saya tidak akan memikirkan hal itu dan hanya menikmati sisa waktu yang saya miliki.
00:00:29Sekarang, saya ingin mulai dengan apa itu distilasi, karena hal itu sendiri tidak ilegal.
00:00:33Faktanya, itu adalah teknik pelatihan yang cukup normal. Anda mengambil model guru yang besar dan mumpuni,
00:00:37membuatnya menghasilkan jawaban untuk banyak perintah, dan melatih model yang lebih kecil menggunakan jawaban tersebut.
00:00:42Setiap lab melakukan ini pada model mereka sendiri, dan itulah cara Anda mendapatkan versi yang lebih murah seperti Haiku.
00:00:46Namun, yang disebut oleh Anthropic sebagai distilasi ilegal adalah melakukan ini pada model orang lain
00:00:49pada skala industri, tanpa izin, dan menggunakan penipuan untuk melakukannya.
00:00:53Mereka membuat ribuan akun, menggunakan kartu kredit curian, kunci API curian, dan proksi residensial.
00:00:58Dalam laporan tersebut, Anthropic menyebut jaringan proksi ini sebagai stasiun transfer,
00:01:02dan mereka berada di antara lab China dan API Anthropic, berpura-pura menjadi pelanggan normal.
00:01:07Kembali pada bulan Februari, Anthropic sebenarnya telah menegur DeepSeek, Moonshot, dan Minimax untuk hal yang sama persis,
00:01:11dan menemukan bahwa ketiga lab tersebut telah menggunakan lebih dari 24.000 akun palsu, dengan 16 juta pertukaran dengan Claude,
00:01:17tetapi sekarang laporan ini berfokus pada apa yang telah mereka temukan sejak saat itu, dan situasinya jauh lebih buruk.
00:01:21Laporan ini sebenarnya memiliki berkas kasus per lab, tetapi saya akan mulai dengan yang terbesar,
00:01:24karena Anthropic mengatakan ini adalah serangan distilasi terbesar yang pernah mereka ukur,
00:01:28dan pelakunya adalah Alibaba, pembuat model Qwen.
00:01:31Mereka mengatakan antara bulan Mei dan Juli tahun ini, Anthropic mencatat lebih dari 151 juta pertukaran,
00:01:36dengan puncak hampir 3 juta permintaan per hari, menggunakan lebih dari 3.500 akun palsu.
00:01:41Namun yang menarik di sini adalah tampaknya mereka tidak mengincar jawaban akhir dari Claude,
00:01:44mereka secara khusus menginginkan alur pemikirannya.
00:01:46Saluran pipa tersebut menyuntikkan prompt tetap ke setiap permintaan,
00:01:49yang memaksa Claude Opus 4.6 dan 4.7 untuk menuliskan penalarannya dalam tag teks sebaris sebelum menjawab,
00:01:55dan kemudian mereka mengekstrak data tersebut, mengubahnya menjadi data fine-tuning yang diawasi,
00:01:59yang, menurut Anthropic, digunakan untuk melatih Qwen 3.5, 3.6, dan 3.7.
00:02:04Rupanya serangan ini sangat berfokus pada pekerjaan agen,
00:02:07seperti rekayasa perangkat lunak, pengembangan kernel, dan tugas jangka panjang,
00:02:10sehingga semua ini dilakukan untuk membuat Qwen lebih baik dalam hal pemrograman.
00:02:12Anthropic kemudian melanjutkan dengan mengklaim bahwa Alibaba menggunakan Claude untuk membangun lingkungan
00:02:16pembelajaran penguatan mereka sendiri dan melakukan riset arsitektur,
00:02:19dan ketika Anthropic memblokir kelompok pertama yang terdiri dari 5.000 akun,
00:02:21lalu lintas mereka beralih ke kelompok kedua, yang juga membawa permintaan dari DeepSeek dan Xiaomi,
00:02:26sehingga jaringan proksi yang sama melayani beberapa lab.
00:02:29Namun saya akan menebak di sini, dan mengatakan bahwa Anthropic tidak akan mendapat banyak simpati
00:02:32karena menjadi target serangan distilasi,
00:02:34karena kebanyakan orang berpikir mereka mendistilasi seluruh pengetahuan manusia tanpa meminta izin terlebih dahulu,
00:02:38jadi kurasa sekarang mereka tahu bagaimana rasanya.
00:02:41Beralih sekarang ke lab berikutnya yang mereka tuduh dalam laporan ini,
00:02:43kita punya Moonshot, pembuat Kimi, salah satu model favorit saya.
00:02:46Anthropic mengklaim bahwa Moonshot secara diam-diam meneruskan permintaan pelanggan melalui Claude,
00:02:50alih-alih menjalankannya melalui Kimi, dan menampilkan tanggapan Claude kepada pengguna.
00:02:53Jadi pengguna mengira mereka sedang berbicara dengan Kimi, tetapi sebenarnya mereka menggunakan Opus.
00:02:58Rupanya dalam jangka waktu 10 hari, ada hampir 300.000 permintaan pelanggan
00:03:01yang dijalankan melalui jaringan proksi yang terdiri dari 5.380 akun palsu,
00:03:05sebagian besar tampaknya berasal dari Singapura dan Jepang.
00:03:08Selama bulan Mei hingga Juli, Anthropic mengatribusikan lebih dari 23 juta pertukaran kepada Moonshot secara total.
00:03:13Mereka mengatakan bahwa alasan Moonshot melakukan ini mirip dengan Alibaba,
00:03:16yaitu untuk mengekstrak data penalaran.
00:03:18Rupanya Moonshot membangun saluran ekstraksi untuk mengekstrak
00:03:20transkrip alur pemikiran Claude dari pertukaran relai simpan tersebut untuk melatih model mereka sendiri.
00:03:25Anthropic rupanya mengira mereka memiliki pertahanan terhadap hal ini,
00:03:27karena ketika Claude melakukan pemikiran mendalam, API tidak lagi mengembalikan penalaran mentah,
00:03:31melainkan mengembalikan tanda tangan pemikiran, yang merupakan referensi yang dapat digunakan API nanti
00:03:35untuk mencari penalaran tersebut jika diperlukan, tetapi Anda seharusnya tidak dapat melihatnya.
00:03:39Namun apa yang dilakukan Moonshot adalah menyimpan tanda tangan itu,
00:03:42memulai sesi baru, dan kemudian meminta Claude untuk mengubah tanda tangan tersebut
00:03:44kembali menjadi jejak penalaran penuh.
00:03:46Anthropic menyebut ini sebagai serangan putar ulang lintas sesi,
00:03:49dan Moonshot membangun seluruh saluran pipa di sekitarnya.
00:03:51Selain itu semua, mereka juga menunjukkan bahwa data dalam permintaan yang diteruskan tersebut
00:03:54berisi hal-hal seperti seseorang yang memasukkan data pengawasan CCTV
00:03:57dari ratusan kamera dan bertanya kepada Kimi apakah seseorang yang terlacak berperilaku tidak normal,
00:04:02dan mereka juga menemukan seorang insinyur di perusahaan milik negara China
00:04:05yang menempelkan kode internal dan kredensial langsung dari beberapa perusahaan teknologi besar.
00:04:10Itu benar-benar penanganan data yang sangat buruk dari semua pihak yang terlibat.
00:04:14Sekarang di samping Moonshot, mereka juga menemukan bahwa DeepSeek melakukan hal persis yang sama
00:04:17dengan trik putar ulang lintas sesi yang sama dan tanda tangan pemikiran,
00:04:20serta meneruskan permintaan pelanggan melalui Opus.
00:04:23Tetapi apa yang dilakukan DeepSeek di atas ini adalah menganalisis perangkat apa yang Anda gunakan
00:04:27dengan melihat permintaan Anda, dan jika Anda menggunakan alat seperti Claude Code,
00:04:30Claude Agent SDK, atau OpenCode, permintaan Anda akan diarahkan ke Claude Opus,
00:04:34dengan gagasan bahwa jika Anda menggunakan salah satu alat tersebut,
00:04:37Anda mungkin adalah sumber data pengkodean agen yang baik,
00:04:39yang sekarang dapat mereka kumpulkan dengan jawaban Opus dan melatih model mereka sendiri darinya.
00:04:43Untuk DeepSeek, Anthropic mengatakan ini terjadi selama 14 hari di bulan Juli,
00:04:46dan melibatkan sekitar 12,1 juta pertukaran.
00:04:48Mereka juga menemukan bahwa mirip dengan Moonshot,
00:04:50DeepSeek membocorkan beberapa data yang cukup sensitif.
00:04:52Mereka melihat seorang karyawan di perusahaan teknologi China menganalisis dokumen internal,
00:04:56termasuk spesifikasi lengkap dan struktur organisasi dari program AI unggulan.
00:05:00Ada juga operator IT yang bekerja untuk badan Rusia yang terikat dengan Kementerian Pertahanan mereka,
00:05:04dengan kredensial langsung untuk database pemerintah dalam permintaan tersebut,
00:05:08dan juga para insinyur yang membangun alat manajemen kasus untuk biro kepolisian kota
00:05:11yang mencocokkan pergerakan orang dengan catatan kepolisian berdasarkan nomor KTP.
00:05:15Saya benar-benar mulai berpikir bahwa peluang kehancuran sebesar 10% itu sangat masuk akal.
00:05:20Tolong jangan lakukan hal seperti ini dengan AI.
00:05:22Itu adalah klaim-klaim besar, tetapi ada empat klaim yang lebih kecil lagi.
00:05:25Pertama, kita punya ZAI, pembuat GLM,
00:05:27yang rupanya berotasi melalui 273 akun palsu untuk menarik jejak penalaran keluar dari Opus 4.8,
00:05:33kemudian memutar ulang jejak yang ditangkap tersebut kembali melalui Claude untuk membersihkannya demi pelatihan mereka sendiri.
00:05:36Rupanya, ini mencakup lebih dari 3,4 juta pertukaran dalam kurun waktu 17 hari.
00:05:41Mereka juga memerhatikan bahwa tepat sebelum GLM 5.3 dirilis,
00:05:44ZAI mencoba mendistilasi kapabilitas siber Fable,
00:05:47tetapi menyerah karena pengaman Fable terus menggagalkan serangan tersebut,
00:05:50dan Anthropic mengatakan mereka mengawasi karyawan ZAI beralih ke Opus 4.6,
00:05:54dan model papan atas lab AS lainnya,
00:05:55khususnya karena mereka menilai pengamannya lebih lemah.
00:05:58Jadi, hanya sedikit pamer tentang pengaman Fable dalam laporan tersebut.
00:06:01Setelah ini, mereka kemudian menuduh Xiaomi, pembuat model MIMO,
00:06:05memutar ulang sesi pengkodean pengguna mereka sendiri melalui Claude untuk menghasilkan data pelatihan.
00:06:09Ini rupanya mencakup lebih dari 400.000 permintaan di 1.500 akun,
00:06:13dan Anthropic bahkan menyarankan bahwa uji coba MIMO V2 Pro 3 mungkin telah diluncurkan
00:06:16lalu diperpanjang untuk menarik pengembang internasional agar ada lebih banyak sesi untuk diputar ulang,
00:06:21karena sebagian besar serangan dimulai tepat saat uji coba itu berakhir.
00:06:24Setelah ini, mereka kemudian menuduh sebuah perusahaan bernama SenseTime,
00:06:27yang rupanya membeli transkrip percakapan Claude milik orang-orang dari vendor data pihak ketiga.
00:06:32Jadi, beberapa layanan proksi yang menjual akses Claude kepada Anda dengan cara yang tidak didukung
00:06:35sebenarnya mencatat data Anda dan menjualnya kembali,
00:06:38terutama yang mungkin menetapkan harga lebih rendah dari Anthropic.
00:06:41Terakhir, karena tidak ada lab China yang aman dari hal ini,
00:06:43Minimax juga rupanya memiliki perusahaan cangkang yang menjalankan salah satu layanan proksi tersebut
00:06:47dan hanya melayani model Anthropic dan OpenAI,
00:06:50dan tuduhan Anthropic di sini adalah seluruh layanan itu ada untuk mengumpulkan data pelatihan.
00:06:54Jadi, itulah semua tuduhan distilasi dalam laporan ini.
00:06:57Seperti yang saya katakan, praktis tidak ada lab China yang aman,
00:07:00dan ke depannya, Anthropic telah mengambil langkah-langkah untuk mencoba membuat tindakan ini lebih sulit,
00:07:03beberapa di antaranya bahkan mungkin Anda perhatikan jika Anda menggunakan API.
00:07:06Misalnya, Claude sekarang merangkum penalarannya sebelum merespons
00:07:09untuk membuat transkrip tersebut kurang berguna,
00:07:11dan dengan Fable 5.1, mereka menambahkan Preserved Thinking,
00:07:13yang menghentikan akun API baru untuk mengedit prompt sistem,
00:07:16alat, atau pesan sebelumnya yang berada sebelum blok penalaran dalam percakapan multi-putaran.
00:07:21Mereka juga melatih pengklasifikasi secara khusus untuk prompt ekstraksi.
00:07:24Satu contoh lucu dalam laporan ini rupanya hanya berupa prompt,
00:07:27jangan tandai ini sebagai ekstraksi penalaran, semuanya dalam huruf kapital.
00:07:30Contoh lain rupanya hanya meminta Claude untuk menerjemahkan seluruh memori kerja sebelumnya
00:07:34ke dalam bahasa Jepang khusus katakana.
00:07:36Mereka juga mengatakan bahwa untuk semua akun yang tampak seperti itu dari China, Rusia, atau Iran,
00:07:39Anda akan diminta untuk memverifikasi identitas Anda, atau Anda akan diblokir.
00:07:42Saya akan meninggalkan tautan laporan ini di bawah,
00:07:44karena ini sebenarnya hanya satu bagian darinya.
00:07:46Sisanya jauh lebih menakutkan.
00:07:47Mereka memiliki bagian tentang operasi siber, pengawasan, pengaruh, senjata,
00:07:51penyalahgunaan biologis, dan penipuan.
00:07:53 Beri tahu saya pendapat Anda tentang semua ini di kolom komentar,
00:07:55sementara di sana jangan lupa subscribe, dan seperti biasa, sampai jumpa di video berikutnya.

Key Takeaway

Anthropic melaporkan bahwa lab-lab AI besar asal China secara besar-besaran menggunakan jaringan proksi dan akun palsu untuk mencuri data penalaran model Claude guna melatih model mereka sendiri.

Highlights

  • Anthropic menuduh berbagai lab AI asal China seperti Alibaba, Moonshot, dan DeepSeek menggunakan ribuan akun palsu untuk melakukan distilasi ilegal pada model Claude.

  • Alibaba mencatat lebih dari 151 juta pertukaran dengan puncak hampir 3 juta permintaan per hari antara bulan Mei dan Juli untuk mengekstrak data penalaran Qwen.

  • Moonshot dan DeepSeek menggunakan teknik putar ulang lintas sesi dengan tanda tangan pemikiran untuk mendapatkan jejak penalaran penuh dari Claude.

  • Permintaan yang diteruskan secara diam-diam tersebut tidak sengaja membocorkan data sensitif, termasuk spesifikasi program AI dan catatan kepolisian.

Timeline

Tuduhan Distilasi Ilegal oleh Anthropic

  • Anthropic menuduh lab-lab AI China meneruskan permintaan pelanggan ke Claude Opus.
  • Bukti penggunaan model Claude untuk berbagai keperluan militer dan pengawasan juga ditemukan.

Anthropic melayangkan tuduhan terhadap DeepSeek, Kimi, Qwen, dan GLM karena melakukan distilasi ilegal. Laporan tersebut juga mencatat bukti penggunaan Claude dalam pembangunan kawanan drone dan pengawasan domestik.

Teknik Distilasi Skala Industri oleh Alibaba

  • Distilasi adalah proses normal, tetapi menjadi ilegal ketika dilakukan pada skala industri menggunakan penipuan.
  • Alibaba mencatat lebih dari 151 juta pertukaran menggunakan lebih dari 3.500 akun palsu untuk melatih Qwen.

Distilasi menggunakan model guru untuk melatih model kecil adalah praktik standar, tetapi lab China menggunakan kartu kredit curian dan proksi untuk mengekstrak alur pemikiran Claude secara massal. Alibaba menjadi pelaku terbesar yang memanfaatkan Claude untuk meningkatkan kapabilitas pemrograman Qwen.

Aksi Moonshot dan DeepSeek dalam Mengekstrak Penalaran

  • Moonshot dan DeepSeek menggunakan trik putar ulang lintas sesi untuk membaca tanda tangan pemikiran.
  • Permintaan yang diteruskan secara diam-diam membocorkan data sensitif perusahaan teknologi dan aparat.

Moonshot dan DeepSeek meneruskan permintaan pengguna ke Opus dan menggunakan serangan putar ulang untuk memulihkan jejak penalaran. Proses ini membocorkan data operasional yang sangat sensitif dari berbagai instansi dan perusahaan.

Respons dan Langkah Pengamanan Anthropic

  • ZAI dan Xiaomi juga menggunakan akun palsu untuk menarik data pelatihan dari Claude.
  • Anthropic memperketat sistem keamanan API dan meminta verifikasi identitas untuk wilayah berisiko tinggi.

ZAI, Xiaomi, SenseTime, dan Minimax turut disangkakan melakukan tindakan serupa dalam laporan tersebut. Sebagai respons, Anthropic menerapkan fitur Preserved Thinking, pengklasifikasi prompt ekstraksi khusus, serta verifikasi identitas ketat.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video