Cara Membuat Token Claude Code 20x LEBIH MURAH (& 4 Tips Penggunaan Lainnya)

CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00Anda mungkin membayar 20 kali lipat lebih mahal untuk token Cloud Code Anda tanpa menyadarinya.
00:00:05Memahami cara memaksimalkan token Cloud Code adalah salah satu hal terpenting
00:00:08keterampilan yang dapat Anda kuasai, dan ini jauh melampaui sekadar memasukkan baris ke dalam file Cloud.md Anda
00:00:14yang mengatakan, buatlah singkat. Karena jika Anda tidak mengerti cara kerja caching prompt,
00:00:19Anda bisa membayar jauh lebih mahal dari yang seharusnya. Jadi dalam video ini, saya akan memberi Anda lima
00:00:23cara berbeda untuk mengelola token Cloud Anda agar Anda benar-benar bisa memaksimalkan
00:00:27model papan atas ini. Sekarang, kiat nomor satu adalah yang paling penting. Ini akan menghemat lebih banyak uang
00:00:31dan penggunaan dibandingkan semua kiat lainnya jika digabungkan, yaitu memahami cara kerja caching prompt
00:00:37sebenarnya. Sekarang untuk memahami caching prompt, Anda perlu mengerti cara kerja token itu sendiri. Jadi kita akan
00:00:43melakukan ulasan singkat, sekitar 60 detik, agar kita memiliki pemahaman yang sama. Token adalah mata uang
00:00:47model bahasa besar, dan untuk semua maksud dan tujuan, ini agak disederhanakan, setiap
00:00:52kata sama dengan satu token. Jadi ketika Anda, pengguna, pada pesan pertama Anda ke Fable berkata, bagaimana kabar Anda hari ini,
00:01:00Anda telah mengirim lima token masukan. Sekarang ketika Fable membalas Anda dan berkata, kabar saya baik, terima kasih,
00:01:09ia telah memberi Anda empat token keluaran. Harganya berbeda. Faktanya, token keluaran, secara garis besar,
00:01:16berharga lima kali lipat dari harga token masukan. Sekarang kelima token masukan dan keempat token keluaran ini
00:01:23terakumulasi di dalam jendela konteks. Jika token adalah mata uangnya, maka jendela konteks adalah anggaran kita.
00:01:31Opus, Fable, Sonnet, semuanya memiliki anggaran satu juta token, jadi pada titik ini kita telah menggunakan
00:01:37sembilan dari satu juta token kita, tidak terlalu banyak. Sekarang yang menarik adalah saat kita mengirim pesan lanjutan
00:01:43setelah pesan pertama. Jadi pada pesan kedua kita, saya, sang pengguna, berkata, buatkan saya aplikasi, tanpa kesalahan,
00:01:50enam token masukan, kan? Saya hanya akan mengirimkan enam token masukan ke Anthropic dan Fable. Yah,
00:01:56tidak juga. Apa yang sebenarnya akan saya kirimkan adalah semuanya. Saya akan mengirimkan Anthropic
00:02:04seluruh percakapan ini hingga titik tersebut. Jadi saya tidak benar-benar mengirim enam token masukan, melainkan
00:02:11mengirim 16 token masukan karena saya akan mengirimkan lima token dari sini dan empat token dari sini karena
00:02:16ia akan mengambil keseluruhan pesan agar dapat memahami konteksnya. Dan untuk setiap
00:02:20pesan lanjutan hal itu akan terjadi, saya selalu mengirimkan keseluruhan percakapan
00:02:26sebelum pesan terakhir tersebut. Dan Anda dapat dengan cepat melihat bagaimana ini terakumulasi dengan sangat cepat sehingga
00:02:32Anda berbicara tentang 5.000, 10.000, 100.000 token masukan yang dikirim di setiap pesan. Dan Anda
00:02:37membayarnya. Sekarang, jika itu masalahnya, mengapa kita tidak langsung menghabiskan seluruh penggunaan kita
00:02:43seketika? Mengapa tidak semua orang membayar satu miliar dolar setiap kali mereka mencoba menggunakan sistem AI ini?
00:02:47Karena jelas kita mengirim pesan demi pesan. Jadi ada banyak sekali
00:02:51pesan gabungan yang dikirim ke server. Nah, solusinya di sini adalah sistem cache. Jadi ya,
00:02:57ketika saya mengirim pesan nomor dua di sini, saya memang mengirim semua ini. Namun apa yang telah dibuat
00:03:05pada titik ini adalah cache pesan. Dan untuk pesan kedua kita, cache pesan tersebut adalah dua pesan
00:03:12pertama ini. Saya ingin Anda menganggap cache pesan ini hanyalah dokumen yang ada di hadapan Claude
00:03:17yang berisi seluruh percakapan Anda hingga saat itu. Jadi kita punya Anda berbicara dengan Claude di sini,
00:03:23Anda sekarang sedang mengirim pesan nomor dua, yaitu buatkan saya aplikasi, tanpa kesalahan. Tetapi kita memiliki sistem
00:03:30cache. Jadi seluruh bagian ini, dua pesan pertama ini sekarang berada di dalam dokumen ini. Jadi apa
00:03:36yang dapat dilakukan oleh Claude dan Anthropic adalah mereka dapat membaca dokumen tersebut, membaca cache,
00:03:42melihat seluruh riwayat pesan hingga saat itu dengan tarif yang jauh lebih murah daripada jika Anda
00:03:47hanya mengirim semuanya sekaligus tanpa cache. Dan begitulah cara ia menghitung biayanya. Dan biaya ini
00:03:54penting karena sistem cache ini tidak bertahan selamanya. Yang perlu Anda pahami adalah ketika
00:04:00Anda dan Claude saling berbicara, dan kita memiliki dokumen cache ini di antara kita, yang berisi semua
00:04:06riwayat percakapan kita, yang dapat Anda baca dengan sangat murah, itu hanya menyimpannya selama satu jam.
00:04:11Jadi jika Anda dan Claude melakukan diskusi ini, Anda mengobrol bolak-balik berulang kali,
00:04:16maksudku, bolak-balik terus, lalu Anda pergi selama satu jam. Dan Anda memiliki
00:04:21dokumen sepanjang 500.000 token, percakapan 500.000 token. Setelah satu jam, ini akan hilang.
00:04:29Ini lenyap. Jadi ketika Anda mengirim pesan, entah itu yang ke-500.001, yah, tebak apa, Anda sekarang
00:04:38akan dikenakan tarif penuh untuk pesan 500.000 token, meskipun yang Anda katakan hanya, “Hei, ada apa?”
00:04:46Sekarang pahami ketika saya katakan cache ini hanya bertahan selama satu jam, maksud saya satu jam tanpa aktivitas. Jadi cache
00:04:52diperbarui setiap kali ada pesan. Jadi jika sudah 59 menit sejak pesan terakhir kita dan saya mengirim pesan lagi,
00:04:56Nah, mengapa hal ini sangat penting? Ya, karena biayanya. Saya sempat bahas
00:05:01di bagian pengantar, perbedaan antara pembacaan cache, alias membaca seluruh riwayat ini versus membaca 500.000
00:05:08pesan tanpa cache adalah perbedaan yang benar-benar 20 kali lipat. Dan ini tercermin dalam peningkatan harga
00:05:16pada dokumentasi. Jadi ingat, token keluaran, apa yang diberikan Claude kepada kita, itu tidak pernah berubah.
00:05:22Untuk Haiku, kita melihat $50 per juta token dan $25 untuk Opus. Tetapi token masukan
00:05:27adalah tempat berlangsungnya seluruh percakapan ini. Jadi kita selalu membicarakan token masukan dasar sebesar
00:05:33$10 per juta, tetapi itu agak kurang tepat karena pada kenyataannya, kita selalu melakukan penulisan cache.
00:05:40Jadi penulisan cache satu jam, yang merupakan hal yang Anda lakukan pada paket langganan, sebenarnya dua kali lipat lebih mahal.
00:05:47Jadi ketika kita menulis ke cache tersebut untuk pertama kalinya seperti pada pesan pertama, biayanya adalah $20 per
00:05:54juta token. Anda akan melihat penulisan cache lima menit di sini, tetapi itu sebenarnya hanya untuk orang-orang yang
00:05:59menggunakan API. Sekarang bandingkan itu dengan temuan cache, alias Anthropic hanya membaca dokumen yang ada di
00:06:05hadapannya, yang terus terakumulasi setiap jam dan disegarkan. Harganya $1, 20 kali lebih murah. Itu adalah
00:06:13perbedaan yang sangat drastis. Dan itulah mengapa semuanya ini, tips khusus ini, memahami caching prompt dan
00:06:18cara kerja sistem token menjadi sangat penting. Tidak ada hal yang akan saya bahas setelah titik ini
00:06:22yang akan memberikan peningkatan efisiensi yang mendekati tingkat ini. Tidak ada sama sekali.
00:06:29Sekarang mari kita kembali ke contoh percakapan 500.000 token yang sedang kita lakukan
00:06:35dengan Claude Code dan kita akan mengirimkan pesan lanjutan. Dalam skenario nomor satu, kita akan
00:06:40membayangkan kita memiliki sistem cache. Jadi riwayat percakapan 500k ini dicache dan saya mengirimkan
00:06:46pesan baru tersebut. Cara kerja harganya adalah sistem masih harus membaca seluruh riwayat percakapan ini
00:06:51ini. Dan itu dikenakan tarif $1 per juta token. Jadi biayanya bagi saya adalah 50 sen pada
00:06:58pesan berikutnya agar sistem membaca semuanya ditambah pesan baru. Jadi bayangkan pesan baru itu sepanjang seribu
00:07:05token. Pesan lanjutan sepanjang seribu token tersebut tidak dikenakan biaya $1 per juta. Melainkan dikenakan $20
00:07:14per juta. Jadi untuk seribu token, harganya berapa ya, sekitar dua sen atau semacam itu? Entahlah.
00:07:18Matematika saya mungkin meleset, intinya riwayat dihargai $1. Pesan barunya $20 karena ini dicache.
00:07:26Sekarang, saat berikutnya kita mengirim pesan, skenario yang sama, kecuali seribu token ini sekarang akan menjadi bagian dari
00:07:32dokumen cache tersebut. Cukup masuk akal. Oke. Itu skenario satu. Skenario dua, kita tidak memiliki cache. Kita menunggu satu jam
00:07:40untuk mengirimkannya. Benar-benar menunggu untuk mengirimnya. Nah, alih-alih harganya 50 sen, kita sekarang justru akan
00:07:47dikenai tarif pembacaan cache, maaf, tarif penulisan cache, yang perlu diingat adalah $20 per juta. Jadi berapa
00:07:54biaya yang harus dikeluarkan? Nah, sekarang satu pesan ini memakan biaya sekitar 10 dolar. Jadi dari 50 sen melonjak menjadi
00:08:0010 dolar hanya karena kita menunggu selama satu jam. Itulah konsekuensi dari tidak memahami
00:08:05hal ini. Sekarang, waktu bukan satu-satunya hal yang harus kita pikirkan terkait hilangnya cache. Ada
00:08:10ada hal lain yang akan menghapusnya sepenuhnya. Dan ini langsung dari dokumentasi Cloud Code.
00:08:14Jika Anda mengganti model, misalnya Anda menggunakan Sonnet lalu beralih ke Opus dan sudah mencapai 500.000 token,
00:08:20itu akan hilang. Cache diatur ulang. Tingkat upaya, mengubahnya. Mode cepat, menghubungkan atau memutuskan
00:08:26koneksi server MCP, plugin, menolak alat, memadatkan percakapan, atau sekadar memperbarui Cloud Code
00:08:32umum. Hal-hal tersebut akan mereset cache dan pesan Anda berikutnya akan menjadi 20 kali lebih mahal
00:08:38dari yang seharusnya. Jadi dengan semua penjelasan itu, apa yang sebenarnya bisa Anda lakukan dengan informasi ini?
00:08:42Apa yang Anda lakukan ketika berada dalam situasi di mana Anda harus meninggalkan percakapan
00:08:46yang berisi banyak informasi penting, tetapi Anda akan pergi selama lebih dari satu jam,
00:08:50atau Anda pergi selama satu jam lebih dan baru kembali lalu menyadari, wah, gawat,
00:08:54saya tidak memikirkan hal ini sebelumnya. Nah, itulah yang akan kita bahas pada tips nomor dua.
00:08:59Namun sebelumnya, sekilas pesan dari sponsor hari ini, yaitu saya sendiri. Jadi minggu ini, saya merilis versi yang sepenuhnya diperbarui
00:09:06dari Claude Code Masterclass di dalam Chase AI+. Banyak hal telah berubah sejak pertama kali saya meluncurkan
00:09:12ini. Saya selalu memperbaruinya. Namun pada dasarnya, kita telah berkembang jauh sejak bulan Maret saat saya pertama kali
00:09:19merilis hal ini. Jadi jika Anda adalah seseorang yang mencoba meningkatkan kemampuan AI Anda, seseorang yang pastinya
00:09:24tidak berasal dari latar belakang teknis dan Anda ingin panduan praktis untuk benar-benar tahu cara menggunakan alat ini
00:09:28dari nol serta sesuatu yang berfokus pada kasus penggunaan nyata, maka ini cocok untuk Anda. Konten ini ada di dalam
00:09:33Chase AI+. Terdapat tautan ke sana di komentar yang disematkan. Sekarang, tips nomor dua adalah tentang pilihan Anda
00:09:37ketika kita kehilangan cache. Kita telah pergi terlalu lama. Kita memiliki percakapan yang panjangnya dua,
00:09:42tiga, empat, lima ratus ribu token. Dan kita ingin tahu apa langkah selanjutnya yang harus diambil
00:09:47alih-alih membayar biaya yang luar biasa besar itu. Dan itu semua tergantung pada skenario yang Anda hadapi.
00:09:52Sekarang, opsi pertama kita adalah semacam opsi nuklir, yaitu cukup mengetikkan slash clear.
00:09:58Slash clear hanya akan menghapus seluruh riwayat percakapan. Dan ini tidak selalu hal yang buruk.
00:10:04Faktanya, jika Anda sedang mengerjakan basis kode tertentu, semacam proyek dengan
00:10:10banyak berkas dan banyak konteks, Anda mungkin sebaiknya langsung mengetikkan slash clear. Apa pun
00:10:15yang sedang Anda kerjakan, apa pun yang Anda bicarakan, kemungkinan besar ada bukti di dalam proyek itu sendiri
00:10:20tentang apa yang telah terjadi. Cloud Code dapat langsung melihatnya. Dan ketika Anda memulai percakapan baru
00:10:25dari awal, alat ini dapat merangkai kembali kepingan tersebut dan membawa Anda kembali ke posisi semula. Anda tidak perlu menjadi budak
00:10:31dari percakapan sebelumnya. Sekarang opsi kedua Anda adalah menggunakan pemadatan atau compaction. Terdapat fitur auto compact
00:10:38di dalam Cloud Code setelah Anda mencapai jumlah token tertentu. Saya menyarankan untuk tidak menunggu sampai
00:10:42titik itu karena ketika kita bekerja di kisaran enam, tujuh, delapan ratus ribu token, kita
00:10:47mulai berurusan dengan kebusukan konteks (context rot). Ini masih menjadi masalah pada model yang lebih besar dan lebih kuat ini,
00:10:51tetapi kita bisa mengetikkan slash compact kapan saja. Dan apa fungsinya bagi kita adalah ia akan membuat
00:10:57ringkasan dari apa yang telah kita bicarakan. Dan kemudian, untuk segala maksud dan tujuan, ia akan melakukan slash
00:11:03clear, tetapi memulai percakapan baru dengan ringkasan tersebut, semacam disimpan di dalam memori. Jadi,
00:11:10jika Anda memang memiliki hal-hal penting dalam percakapan itu, dan Anda merasa apa yang ada di dalam basis kode tidak
00:11:15cukup untuk memahaminya, laksanakan saja pemadatan, ketik slash compact. Alat ini akan memulai percakapan baru
00:11:20dengan ringkasan tersebut. Dan ringkasan itu hidup di dalam riwayat pesan. Sekarang opsi ketiga Anda
00:11:26sangat mirip dengan compact, yaitu menggunakan semacam alat serah terima (handoff) kustom. Ada banyak keterampilan
00:11:32serah terima kustom di luar sana. Saya memilikinya sendiri. Anda bisa mendapatkannya di dalam komunitas gratis saya. Dan perbedaan
00:11:38antara handoff dan compaction adalah tempat penyimpanan ringkasan tersebut. Jadi, jika saya melakukan handoff, yang dilakukannya
00:11:46sebenarnya adalah menyimpannya ke diska saya. Alat ini akan membuat berkas markdown aktual berisi ringkasan dengan
00:11:51apa pun yang saya inginkan di dalamnya. Dan kemudian saya dapat memulai percakapan baru dan berkata, Hei, Claude Code, tolong lihat
00:11:59dokumen handoff di diska tersebut agar kamu bisa memahami apa yang perlu kamu ketahui. Berbeda dengan compact,
00:12:04fitur itu tidak membuat berkas apa pun. Itu hanya berupa pesan di riwayat pesan dalam percakapan tertentu
00:12:10yang sedang Anda lakukan—perbedaannya tipis. Namun bagi sebagian orang, mereka menginginkan semacam berkas di
00:12:15diska. Dan seringkali itu berupa dokumen hidup yang terus diperbarui.
00:12:20Jadi, inilah ketiga pilihan Anda. Apakah Anda ingin menghapus semuanya dan mulai dari awal?
00:12:26Seringkali, cara ini sama sekali tidak masalah. Apakah Anda hanya ingin menggunakan fitur bawaan Claude dan memadatkannya serta
00:12:31membuat ringkasannya disuntikkan langsung? Atau Anda ingin ringkasan tersebut menjadi dokumen nyata yang bisa dilihat oleh Claude?
00:12:37Dalam kasus itu, gunakan handoff. Itulah ketiga pilihan Anda. Dan seringkali opsi-opsi ini lebih baik daripada sekadar
00:12:42mengirimkan pesan baru karena secara garis besar, Anda seharusnya tidak beroperasi dalam rentang 400, 500, 600.000
00:12:48token anyway. Sekarang, tip nomor tiga adalah tentang perutean model (model routing). Bagaimana kita memilih model yang tepat
00:12:53untuk suatu pekerjaan? Sehingga kita tidak selalu menggunakan Fable untuk semuanya. Bisakah kita menggunakan model yang lebih kecil, lebih murah, dan tidak terlalu pintar
00:12:59untuk tugas-tugas yang lebih sederhana? Jawabannya adalah ya. Dan kita dapat mendekati ini dengan beberapa cara berbeda.
00:13:04Kita bisa menggunakan model luar. Kita bisa beralih ke GPT, Sol. Kita bisa beralih ke GPT, Luna dan Terra, yang harganya baru saja
00:13:10menjadi sangat murah. Kita bisa menggunakan model lokal, atau kita punya pilihan jika ingin tetap berada di ekosistem Anthropic.
00:13:16Dan cara termudah untuk melakukan ini, menurut saya, adalah mode penasihat (advisor mode). Nah, apa yang Anda lihat di sini berasal dari postingan blog advisor
00:13:22asli yang dirilis beberapa bulan lalu. Jadi ini memperlihatkan Opus dan Sonnet, tetapi sistem yang sama
00:13:29tetap berlaku dengan model seperti Fable. Dan gagasannya adalah kita memiliki model pintar seperti Fable atau bahkan Opus yang bertindak sebagai penasihat
00:13:37bagi model yang lebih kecil seperti Sonnet dalam hal mengeksekusi tugas. Jadi model besar menyusun rencana, model
00:13:43kecil mengeksekusinya, dan model kecil tersebut dapat membagikan konteksnya kepada model yang lebih besar kapan pun
00:13:50ia menemui masalah. Dan model ini membanggakan hasil yang lebih baik dengan biaya yang lebih rendah. Dan untuk menyambungkan
00:13:54pembahasan kita sebelumnya tentang peng缓存an prompt (prompt caching), baik penasihat maupun eksekutor memiliki cache prompt mereka sendiri
00:14:01yang bekerja secara bersamaan. Sekarang, opsi kedua Anda adalah mendelegasikan tugas ke model di luar Claude Code.
00:14:06Salah satu yang mudah dilakukan adalah Codex. Ada plugin Codex untuk Claude Code, yang membuatnya sangat sederhana
00:14:12untuk memanggil Codex dari antarmuka Claude Code. Jadi Anda pada dasarnya bisa membuat Fable melakukan jenis
00:14:18advisor mode yang sama, tetapi alih-alih memanggil Opus atau Sonnet, ia memanggil model-model GPT. Ada
00:14:24repositori lain seperti Fable advisor ini yang melakukan hal persis seperti itu. Dan pada akhirnya cukup mudah untuk menyiapkan
00:14:31keterampilan Anda sendiri yang melakukan ini secara tepat. Dan jika Anda mencari model yang lebih murah itu, sekali lagi, saya sangat menyarankan
00:14:36untuk melihat model GPT, khususnya Luna dan Terra, karena A, biayanya telah berkurang secara signifikan,
00:14:41dan B, tidak ada model di keluarga Anthropic yang melakukan apa yang mereka lakukan
00:14:48pada tingkat harga tersebut. Anda bahkan bisa melangkah lebih jauh dan membawa beberapa model lokal jika
00:14:53tugas-tugasnya sesuai untuk itu. Sekarang, tip nomor four adalah tentang kebersihan Claude (Claude hygiene). Anda mungkin baru-baru ini melihat
00:14:57video yang beredar dari Boris Cherney, pencipta Claude Code, yang mengatakan,
00:15:01Anda harus menghapus berkas Claude.md Anda. Nah, apakah Anda benar-benar harus menghapus berkas Claude.md itu? Ya,
00:15:07tidak harus, tetapi yang perlu Anda lakukan, dan ini telah mengalami beberapa perubahan baru dalam beberapa
00:15:12minggu terakhir, adalah menjalankan perintah slash doctor. Dan apa hubungannya ini dengan token?
00:15:18Nah, pertama-tama, apa yang akan dilakukan oleh perintah ini di antara hal-hal lainnya—tetapi kita tetap membahas
00:15:23hal yang terkait dengan token—adalah ia akan memeriksa Claude.md Anda dan memangkas berkas ini.
00:15:30Cara kerja model-model ini, terutama model seri 5 ini, adalah mereka tidak membutuhkan begitu banyak
00:15:36instruksi. Jika Anda melihat apa yang dibuat orang untuk Claude.md tiga, enam, sembilan bulan
00:15:42lalu, panduannya sangat direktif dan sangat mendetail. Dan mungkin pada saat itu, argumen
00:15:46dapat dibuat bahwa mereka membutuhkannya. Hal itu tidak lagi berlaku sekarang. Jadi, Claude.md yang membengkak
00:15:53bukan hanya membuatnya lebih lambat, tetapi secara harfiah menguras token Anda. Dan slash doctor akan melihatnya
00:15:59dan menyingkirkan hal-hal di Claude.md Anda yang memang tidak perlu ada di sana. Kedua,
00:16:04perintah ini akan memeriksa hal-hal yang merusak konteks Anda atau membuat jendela konteks Anda membengkak.
00:16:10Karena bahkan ketika Anda memulai percakapan baru dan menjalankan slash context, ada hal-hal
00:16:15yang mengisinya. Sekarang, saya baru-baru ini menjalankan slash doctor, jadi saya telah menyingkirkan sebagian besar pembengkakan saya,
00:16:20tetapi seperti inilah jendela konteks saya tepat di awal percakapan tanpa ada pesan
00:16:25yang dikirim. Kita sudah menggunakan 40.000 token. Dan apa yang menghabiskan banyak hal ini? Nah, sebagian berasal dari
00:16:31hal-hal seperti skills, seperti yang bisa Anda lihat di sini. Sebagian mencakup hal-hal seperti prompt sistem serta
00:16:36berkas memori. Apa yang akan dilakukan slash doctor adalah ia akan melihat hal-hal seperti skills Anda,
00:16:41seperti MCP Anda, dan mulai memangkas yang tidak sering Anda gunakan. Apakah ini penghematan token yang besar?
00:16:47Tidak, tapi ini lumayan, ini berarti di batas-batas margin dan ini adalah perbaikan yang sangat sederhana. Tidak ada
00:16:53alasan untuk tidak melakukannya, terutama jika Anda adalah seseorang yang terus menumpuk 10 juta skills selama
00:16:58enam bulan terakhir dan belum benar-benar meninjaunya serta mulai memangkasnya, karena melakukan hal itu
00:17:03juga akan membuat skills Anda berjalan lebih efektif. Dan tidak akan ada kebingungan di pihak Claude
00:17:08mengenai skill mana yang harus dipanggil. Saya bertaruh Anda mungkin memiliki sekitar 10 skills di sana yang semuanya
00:17:12berkaitan dengan desain frontend dan Anda tidak membutuhkan semuanya. Jadi tip yang sangat sederhana dan mudah dieksekusi ini
00:17:17dalam hal kebersihan Claude Anda adalah salah satu yang tidak boleh dilewatkan. Cukup jalankan doctor. Dan itu
00:17:22membawa kita ke tip terakhir kita, yang menurut saya paling kurang efektif dari semuanya saat ini, tetapi itu
00:17:28adalah semacam keterampilan tambahan dan perancah (scaffolding) yang Anda lihat bertebaran di mana-mana.
00:17:33Yang paling populer akhir-akhir ini adalah ponytail, dan pada dasarnya ini mengurangi jumlah kode
00:17:38yang ditulis Claude sambil mempertahankan efektivitasnya dan oleh karena itu membuatnya lebih murah dan lebih cepat. Nah,
00:17:44saya membuat video tentang ini yang membandingkan angka-angka ini dengan apa yang sebenarnya terjadi di dunia nyata karena repositori GitHub
00:17:51hanya menunjukkan haiku 4.5, yang jelas sudah sangat ketinggalan jaman. Ketika saya menjalankan ini menggunakan Fable, angka-angkanya
00:17:56memang terbukti benar. Faktanya, angka-angka tersebut terlihat lebih baik lagi dengan model yang lebih baik. Sekarang saya menggunakan tolok ukur yang
00:18:01disediakan bersama repositori GitHub ini. Apa yang berhasil untuk Anda di dunia nyata mungkin sedikit berbeda tergantung pada
00:18:06kompleksitas proyek Anda. Tetapi ini adalah sesuatu yang dapat Anda tempelkan pada semua yang telah kita bicarakan sejauh ini
00:18:11jika Anda ingin terus mengurangi penggunaan token Anda. Hal lain yang akan sering Anda lihat adalah Caveman,
00:18:18yang hari ini mengklaim dapat mengurangi token keluaran Anda sebesar 65%. Ada banyak orang di luar sana yang
00:18:25juga berbicara tentang membuat baris tunggal (one-liners) di Claude MD, sesuatu yang sederhana seperti mengatakan be brief,
00:18:30yang juga akan mengurangi token keluaran Anda. Tapi ingat, token keluaran hanyalah satu bagian dari teka-teki.
00:18:36Dan teka-teki itu, untuk membawanya kembali ke diskusi awal kita, didominasi oleh prompt caching. Jadi jika
00:18:41Anda tidak mendapatkan hal lain dari video ini, saya harap Anda bisa memahami poin tersebut karena di situlah
00:18:46kita akan mengakhirinya hari ini. Jadi seperti biasa, beri tahu saya pendapat Anda. Pastikan untuk memeriksa
00:18:50ChaseAI Plus jika Anda ingin mendapatkan akses ke Claude Code Masterclass. Sekali lagi, ada pembaruan besar
00:18:55yang dirilis untuk itu minggu ini. Selain itu, sampai jumpa di lain kesempatan.

Key Takeaway

Pemahaman caching prompt dan pembersihan jendela konteks menurunkan biaya penggunaan Claude Code hingga 20 kali lipat.

Highlights

  • Token keluaran memiliki harga sekitar lima kali lipat lebih mahal daripada token masukan.

  • Caching prompt menghemat biaya hingga 20 kali lipat dibandingkan pengiriman tanpa cache.

  • Cache pesan standar bertahan selama satu jam tanpa aktivitas sebelum direset sepenuhnya.

  • Perintah slash clear dan slash compact mengakhiri percakapan mahal dengan riwayat token besar.

  • Perintah slash doctor memangkas berkas Claude.md yang membengkak dan menguras token.

Timeline

Mekanisme Caching Prompt dan Harga Token

  • Setiap kata dalam pesan masukan bernilai satu token.
  • Pesan lanjutan mengirimkan seluruh riwayat percakapan sebelumnya ke server.
  • Sistem cache membaca riwayat percakapan dengan tarif 20 kali lebih murah daripada pembacaan tanpa cache.

Token masukan dan keluaran membentuk anggaran jendela konteks sebesar satu juta token. Pengiriman pesan berulang kali mengakibatkan akumulasi data yang sangat cepat. Sistem cache menyimpan riwayat percakapan selama satu jam tanpa aktivitas. Melebihi batas waktu tersebut atau mengganti model akan mereset cache dan melipatgandakan biaya secara drastis.

Pengelolaan Skenario Kehilangan Cache

  • Perintah slash clear menghapus seluruh riwayat percakapan untuk memulai proyek dari awal.
  • Perintah slash compact merangkum percakapan sebelum memulai sesi baru dengan memori ringkas.
  • Alat handoff kustom menyimpan ringkasan ke dalam berkas markdown pada diska.

Kehilangan cache akibat jeda waktu yang terlalu lama memerlukan strategi penanganan alternatif selain membayar biaya penuh. Penghapusan total cocok digunakan ketika basis kode sudah memiliki bukti yang cukup. Pemadatan dan handoff mempertahankan konteks penting tanpa mempertahankan beban token yang berlebihan.

Perutean Model dan Kebersihan Claude

  • Mode penasihat menggunakan model besar untuk menyusun rencana dan model kecil untuk eksekusi tugas.
  • Perintah slash doctor memangkas berkas Claude.md dan membersihkan penumpukan skills.
  • Penggunaan alat tambahan seperti ponytail menekan jumlah kode yang ditulis tanpa mengurangi efektivitas.

Pemilihan model yang tepat mencegah ketergantungan pada satu model mahal untuk semua tugas. Pembersihan berkas konfigurasi secara berkala menghemat ruang jendela konteks sejak awal percakapan. Pemanfaatan kerangka kerja tambahan memaksimalkan efisiensi token secara keseluruhan.

Community Posts

View all posts