Cara Membuat Token Claude Code 20x LEBIH MURAH (& 4 Tips Penggunaan Lainnya)
CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology
Transcript
00:00:00Anda mungkin membayar 20 kali lipat lebih mahal untuk token Cloud Code Anda tanpa menyadarinya.
00:00:05Memahami cara memaksimalkan token Cloud Code adalah salah satu hal terpenting
00:00:08keterampilan yang dapat Anda kuasai, dan ini jauh melampaui sekadar memasukkan baris ke dalam file Cloud.md Anda
00:00:14yang mengatakan, buatlah singkat. Karena jika Anda tidak mengerti cara kerja caching prompt,
00:00:19Anda bisa membayar jauh lebih mahal dari yang seharusnya. Jadi dalam video ini, saya akan memberi Anda lima
00:00:23cara berbeda untuk mengelola token Cloud Anda agar Anda benar-benar bisa memaksimalkan
00:00:27model papan atas ini. Sekarang, kiat nomor satu adalah yang paling penting. Ini akan menghemat lebih banyak uang
00:00:31dan penggunaan dibandingkan semua kiat lainnya jika digabungkan, yaitu memahami cara kerja caching prompt
00:00:37sebenarnya. Sekarang untuk memahami caching prompt, Anda perlu mengerti cara kerja token itu sendiri. Jadi kita akan
00:00:43melakukan ulasan singkat, sekitar 60 detik, agar kita memiliki pemahaman yang sama. Token adalah mata uang
00:00:47model bahasa besar, dan untuk semua maksud dan tujuan, ini agak disederhanakan, setiap
00:00:52kata sama dengan satu token. Jadi ketika Anda, pengguna, pada pesan pertama Anda ke Fable berkata, bagaimana kabar Anda hari ini,
00:01:00Anda telah mengirim lima token masukan. Sekarang ketika Fable membalas Anda dan berkata, kabar saya baik, terima kasih,
00:01:09ia telah memberi Anda empat token keluaran. Harganya berbeda. Faktanya, token keluaran, secara garis besar,
00:01:16berharga lima kali lipat dari harga token masukan. Sekarang kelima token masukan dan keempat token keluaran ini
00:01:23terakumulasi di dalam jendela konteks. Jika token adalah mata uangnya, maka jendela konteks adalah anggaran kita.
00:01:31Opus, Fable, Sonnet, semuanya memiliki anggaran satu juta token, jadi pada titik ini kita telah menggunakan
00:01:37sembilan dari satu juta token kita, tidak terlalu banyak. Sekarang yang menarik adalah saat kita mengirim pesan lanjutan
00:01:43setelah pesan pertama. Jadi pada pesan kedua kita, saya, sang pengguna, berkata, buatkan saya aplikasi, tanpa kesalahan,
00:01:50enam token masukan, kan? Saya hanya akan mengirimkan enam token masukan ke Anthropic dan Fable. Yah,
00:01:56tidak juga. Apa yang sebenarnya akan saya kirimkan adalah semuanya. Saya akan mengirimkan Anthropic
00:02:04seluruh percakapan ini hingga titik tersebut. Jadi saya tidak benar-benar mengirim enam token masukan, melainkan
00:02:11mengirim 16 token masukan karena saya akan mengirimkan lima token dari sini dan empat token dari sini karena
00:02:16ia akan mengambil keseluruhan pesan agar dapat memahami konteksnya. Dan untuk setiap
00:02:20pesan lanjutan hal itu akan terjadi, saya selalu mengirimkan keseluruhan percakapan
00:02:26sebelum pesan terakhir tersebut. Dan Anda dapat dengan cepat melihat bagaimana ini terakumulasi dengan sangat cepat sehingga
00:02:32Anda berbicara tentang 5.000, 10.000, 100.000 token masukan yang dikirim di setiap pesan. Dan Anda
00:02:37membayarnya. Sekarang, jika itu masalahnya, mengapa kita tidak langsung menghabiskan seluruh penggunaan kita
00:02:43seketika? Mengapa tidak semua orang membayar satu miliar dolar setiap kali mereka mencoba menggunakan sistem AI ini?
00:02:47Karena jelas kita mengirim pesan demi pesan. Jadi ada banyak sekali
00:02:51pesan gabungan yang dikirim ke server. Nah, solusinya di sini adalah sistem cache. Jadi ya,
00:02:57ketika saya mengirim pesan nomor dua di sini, saya memang mengirim semua ini. Namun apa yang telah dibuat
00:03:05pada titik ini adalah cache pesan. Dan untuk pesan kedua kita, cache pesan tersebut adalah dua pesan
00:03:12pertama ini. Saya ingin Anda menganggap cache pesan ini hanyalah dokumen yang ada di hadapan Claude
00:03:17yang berisi seluruh percakapan Anda hingga saat itu. Jadi kita punya Anda berbicara dengan Claude di sini,
00:03:23Anda sekarang sedang mengirim pesan nomor dua, yaitu buatkan saya aplikasi, tanpa kesalahan. Tetapi kita memiliki sistem
00:03:30cache. Jadi seluruh bagian ini, dua pesan pertama ini sekarang berada di dalam dokumen ini. Jadi apa
00:03:36yang dapat dilakukan oleh Claude dan Anthropic adalah mereka dapat membaca dokumen tersebut, membaca cache,
00:03:42melihat seluruh riwayat pesan hingga saat itu dengan tarif yang jauh lebih murah daripada jika Anda
00:03:47hanya mengirim semuanya sekaligus tanpa cache. Dan begitulah cara ia menghitung biayanya. Dan biaya ini
00:03:54penting karena sistem cache ini tidak bertahan selamanya. Yang perlu Anda pahami adalah ketika
00:04:00Anda dan Claude saling berbicara, dan kita memiliki dokumen cache ini di antara kita, yang berisi semua
00:04:06riwayat percakapan kita, yang dapat Anda baca dengan sangat murah, itu hanya menyimpannya selama satu jam.
00:04:11Jadi jika Anda dan Claude melakukan diskusi ini, Anda mengobrol bolak-balik berulang kali,
00:04:16maksudku, bolak-balik terus, lalu Anda pergi selama satu jam. Dan Anda memiliki
00:04:21dokumen sepanjang 500.000 token, percakapan 500.000 token. Setelah satu jam, ini akan hilang.
00:04:29Ini lenyap. Jadi ketika Anda mengirim pesan, entah itu yang ke-500.001, yah, tebak apa, Anda sekarang
00:04:38akan dikenakan tarif penuh untuk pesan 500.000 token, meskipun yang Anda katakan hanya, “Hei, ada apa?”
00:04:46Sekarang pahami ketika saya katakan cache ini hanya bertahan selama satu jam, maksud saya satu jam tanpa aktivitas. Jadi cache
00:04:52diperbarui setiap kali ada pesan. Jadi jika sudah 59 menit sejak pesan terakhir kita dan saya mengirim pesan lagi,
00:04:56Nah, mengapa hal ini sangat penting? Ya, karena biayanya. Saya sempat bahas
00:05:01di bagian pengantar, perbedaan antara pembacaan cache, alias membaca seluruh riwayat ini versus membaca 500.000
00:05:08pesan tanpa cache adalah perbedaan yang benar-benar 20 kali lipat. Dan ini tercermin dalam peningkatan harga
00:05:16pada dokumentasi. Jadi ingat, token keluaran, apa yang diberikan Claude kepada kita, itu tidak pernah berubah.
00:05:22Untuk Haiku, kita melihat $50 per juta token dan $25 untuk Opus. Tetapi token masukan
00:05:27adalah tempat berlangsungnya seluruh percakapan ini. Jadi kita selalu membicarakan token masukan dasar sebesar
00:05:33$10 per juta, tetapi itu agak kurang tepat karena pada kenyataannya, kita selalu melakukan penulisan cache.
00:05:40Jadi penulisan cache satu jam, yang merupakan hal yang Anda lakukan pada paket langganan, sebenarnya dua kali lipat lebih mahal.
00:05:47Jadi ketika kita menulis ke cache tersebut untuk pertama kalinya seperti pada pesan pertama, biayanya adalah $20 per
00:05:54juta token. Anda akan melihat penulisan cache lima menit di sini, tetapi itu sebenarnya hanya untuk orang-orang yang
00:05:59menggunakan API. Sekarang bandingkan itu dengan temuan cache, alias Anthropic hanya membaca dokumen yang ada di
00:06:05hadapannya, yang terus terakumulasi setiap jam dan disegarkan. Harganya $1, 20 kali lebih murah. Itu adalah
00:06:13perbedaan yang sangat drastis. Dan itulah mengapa semuanya ini, tips khusus ini, memahami caching prompt dan
00:06:18cara kerja sistem token menjadi sangat penting. Tidak ada hal yang akan saya bahas setelah titik ini
00:06:22yang akan memberikan peningkatan efisiensi yang mendekati tingkat ini. Tidak ada sama sekali.
00:06:29Sekarang mari kita kembali ke contoh percakapan 500.000 token yang sedang kita lakukan
00:06:35dengan Claude Code dan kita akan mengirimkan pesan lanjutan. Dalam skenario nomor satu, kita akan
00:06:40membayangkan kita memiliki sistem cache. Jadi riwayat percakapan 500k ini dicache dan saya mengirimkan
00:06:46pesan baru tersebut. Cara kerja harganya adalah sistem masih harus membaca seluruh riwayat percakapan ini
00:06:51ini. Dan itu dikenakan tarif $1 per juta token. Jadi biayanya bagi saya adalah 50 sen pada
00:06:58pesan berikutnya agar sistem membaca semuanya ditambah pesan baru. Jadi bayangkan pesan baru itu sepanjang seribu
00:07:05token. Pesan lanjutan sepanjang seribu token tersebut tidak dikenakan biaya $1 per juta. Melainkan dikenakan $20
00:07:14per juta. Jadi untuk seribu token, harganya berapa ya, sekitar dua sen atau semacam itu? Entahlah.
00:07:18Matematika saya mungkin meleset, intinya riwayat dihargai $1. Pesan barunya $20 karena ini dicache.
00:07:26Sekarang, saat berikutnya kita mengirim pesan, skenario yang sama, kecuali seribu token ini sekarang akan menjadi bagian dari
00:07:32dokumen cache tersebut. Cukup masuk akal. Oke. Itu skenario satu. Skenario dua, kita tidak memiliki cache. Kita menunggu satu jam
00:07:40untuk mengirimkannya. Benar-benar menunggu untuk mengirimnya. Nah, alih-alih harganya 50 sen, kita sekarang justru akan
00:07:47dikenai tarif pembacaan cache, maaf, tarif penulisan cache, yang perlu diingat adalah $20 per juta. Jadi berapa
00:07:54biaya yang harus dikeluarkan? Nah, sekarang satu pesan ini memakan biaya sekitar 10 dolar. Jadi dari 50 sen melonjak menjadi
00:08:0010 dolar hanya karena kita menunggu selama satu jam. Itulah konsekuensi dari tidak memahami
00:08:05hal ini. Sekarang, waktu bukan satu-satunya hal yang harus kita pikirkan terkait hilangnya cache. Ada
00:08:10ada hal lain yang akan menghapusnya sepenuhnya. Dan ini langsung dari dokumentasi Cloud Code.
00:08:14Jika Anda mengganti model, misalnya Anda menggunakan Sonnet lalu beralih ke Opus dan sudah mencapai 500.000 token,
00:08:20itu akan hilang. Cache diatur ulang. Tingkat upaya, mengubahnya. Mode cepat, menghubungkan atau memutuskan
00:08:26koneksi server MCP, plugin, menolak alat, memadatkan percakapan, atau sekadar memperbarui Cloud Code
00:08:32umum. Hal-hal tersebut akan mereset cache dan pesan Anda berikutnya akan menjadi 20 kali lebih mahal
00:08:38dari yang seharusnya. Jadi dengan semua penjelasan itu, apa yang sebenarnya bisa Anda lakukan dengan informasi ini?
00:08:42Apa yang Anda lakukan ketika berada dalam situasi di mana Anda harus meninggalkan percakapan
00:08:46yang berisi banyak informasi penting, tetapi Anda akan pergi selama lebih dari satu jam,
00:08:50atau Anda pergi selama satu jam lebih dan baru kembali lalu menyadari, wah, gawat,
00:08:54saya tidak memikirkan hal ini sebelumnya. Nah, itulah yang akan kita bahas pada tips nomor dua.
00:08:59Namun sebelumnya, sekilas pesan dari sponsor hari ini, yaitu saya sendiri. Jadi minggu ini, saya merilis versi yang sepenuhnya diperbarui
00:09:06dari Claude Code Masterclass di dalam Chase AI+. Banyak hal telah berubah sejak pertama kali saya meluncurkan
00:09:12ini. Saya selalu memperbaruinya. Namun pada dasarnya, kita telah berkembang jauh sejak bulan Maret saat saya pertama kali
00:09:19merilis hal ini. Jadi jika Anda adalah seseorang yang mencoba meningkatkan kemampuan AI Anda, seseorang yang pastinya
00:09:24tidak berasal dari latar belakang teknis dan Anda ingin panduan praktis untuk benar-benar tahu cara menggunakan alat ini
00:09:28dari nol serta sesuatu yang berfokus pada kasus penggunaan nyata, maka ini cocok untuk Anda. Konten ini ada di dalam
00:09:33Chase AI+. Terdapat tautan ke sana di komentar yang disematkan. Sekarang, tips nomor dua adalah tentang pilihan Anda
00:09:37ketika kita kehilangan cache. Kita telah pergi terlalu lama. Kita memiliki percakapan yang panjangnya dua,
00:09:42tiga, empat, lima ratus ribu token. Dan kita ingin tahu apa langkah selanjutnya yang harus diambil
00:09:47alih-alih membayar biaya yang luar biasa besar itu. Dan itu semua tergantung pada skenario yang Anda hadapi.
00:09:52Sekarang, opsi pertama kita adalah semacam opsi nuklir, yaitu cukup mengetikkan slash clear.
00:09:58Slash clear hanya akan menghapus seluruh riwayat percakapan. Dan ini tidak selalu hal yang buruk.
00:10:04Faktanya, jika Anda sedang mengerjakan basis kode tertentu, semacam proyek dengan
00:10:10banyak berkas dan banyak konteks, Anda mungkin sebaiknya langsung mengetikkan slash clear. Apa pun
00:10:15yang sedang Anda kerjakan, apa pun yang Anda bicarakan, kemungkinan besar ada bukti di dalam proyek itu sendiri
00:10:20tentang apa yang telah terjadi. Cloud Code dapat langsung melihatnya. Dan ketika Anda memulai percakapan baru
00:10:25dari awal, alat ini dapat merangkai kembali kepingan tersebut dan membawa Anda kembali ke posisi semula. Anda tidak perlu menjadi budak
00:10:31dari percakapan sebelumnya. Sekarang opsi kedua Anda adalah menggunakan pemadatan atau compaction. Terdapat fitur auto compact
00:10:38di dalam Cloud Code setelah Anda mencapai jumlah token tertentu. Saya menyarankan untuk tidak menunggu sampai
00:10:42titik itu karena ketika kita bekerja di kisaran enam, tujuh, delapan ratus ribu token, kita
00:10:47mulai berurusan dengan kebusukan konteks (context rot). Ini masih menjadi masalah pada model yang lebih besar dan lebih kuat ini,
00:10:51tetapi kita bisa mengetikkan slash compact kapan saja. Dan apa fungsinya bagi kita adalah ia akan membuat
00:10:57ringkasan dari apa yang telah kita bicarakan. Dan kemudian, untuk segala maksud dan tujuan, ia akan melakukan slash
00:11:03clear, tetapi memulai percakapan baru dengan ringkasan tersebut, semacam disimpan di dalam memori. Jadi,
00:11:10jika Anda memang memiliki hal-hal penting dalam percakapan itu, dan Anda merasa apa yang ada di dalam basis kode tidak
00:11:15cukup untuk memahaminya, laksanakan saja pemadatan, ketik slash compact. Alat ini akan memulai percakapan baru
00:11:20dengan ringkasan tersebut. Dan ringkasan itu hidup di dalam riwayat pesan. Sekarang opsi ketiga Anda
00:11:26sangat mirip dengan compact, yaitu menggunakan semacam alat serah terima (handoff) kustom. Ada banyak keterampilan
00:11:32serah terima kustom di luar sana. Saya memilikinya sendiri. Anda bisa mendapatkannya di dalam komunitas gratis saya. Dan perbedaan
00:11:38antara handoff dan compaction adalah tempat penyimpanan ringkasan tersebut. Jadi, jika saya melakukan handoff, yang dilakukannya
00:11:46sebenarnya adalah menyimpannya ke diska saya. Alat ini akan membuat berkas markdown aktual berisi ringkasan dengan
00:11:51apa pun yang saya inginkan di dalamnya. Dan kemudian saya dapat memulai percakapan baru dan berkata, Hei, Claude Code, tolong lihat
00:11:59dokumen handoff di diska tersebut agar kamu bisa memahami apa yang perlu kamu ketahui. Berbeda dengan compact,
00:12:04fitur itu tidak membuat berkas apa pun. Itu hanya berupa pesan di riwayat pesan dalam percakapan tertentu
00:12:10yang sedang Anda lakukan—perbedaannya tipis. Namun bagi sebagian orang, mereka menginginkan semacam berkas di
00:12:15diska. Dan seringkali itu berupa dokumen hidup yang terus diperbarui.
00:12:20Jadi, inilah ketiga pilihan Anda. Apakah Anda ingin menghapus semuanya dan mulai dari awal?
00:12:26Seringkali, cara ini sama sekali tidak masalah. Apakah Anda hanya ingin menggunakan fitur bawaan Claude dan memadatkannya serta
00:12:31membuat ringkasannya disuntikkan langsung? Atau Anda ingin ringkasan tersebut menjadi dokumen nyata yang bisa dilihat oleh Claude?
00:12:37Dalam kasus itu, gunakan handoff. Itulah ketiga pilihan Anda. Dan seringkali opsi-opsi ini lebih baik daripada sekadar
00:12:42mengirimkan pesan baru karena secara garis besar, Anda seharusnya tidak beroperasi dalam rentang 400, 500, 600.000
00:12:48token anyway. Sekarang, tip nomor tiga adalah tentang perutean model (model routing). Bagaimana kita memilih model yang tepat
00:12:53untuk suatu pekerjaan? Sehingga kita tidak selalu menggunakan Fable untuk semuanya. Bisakah kita menggunakan model yang lebih kecil, lebih murah, dan tidak terlalu pintar
00:12:59untuk tugas-tugas yang lebih sederhana? Jawabannya adalah ya. Dan kita dapat mendekati ini dengan beberapa cara berbeda.
00:13:04Kita bisa menggunakan model luar. Kita bisa beralih ke GPT, Sol. Kita bisa beralih ke GPT, Luna dan Terra, yang harganya baru saja
00:13:10menjadi sangat murah. Kita bisa menggunakan model lokal, atau kita punya pilihan jika ingin tetap berada di ekosistem Anthropic.
00:13:16Dan cara termudah untuk melakukan ini, menurut saya, adalah mode penasihat (advisor mode). Nah, apa yang Anda lihat di sini berasal dari postingan blog advisor
00:13:22asli yang dirilis beberapa bulan lalu. Jadi ini memperlihatkan Opus dan Sonnet, tetapi sistem yang sama
00:13:29tetap berlaku dengan model seperti Fable. Dan gagasannya adalah kita memiliki model pintar seperti Fable atau bahkan Opus yang bertindak sebagai penasihat
00:13:37bagi model yang lebih kecil seperti Sonnet dalam hal mengeksekusi tugas. Jadi model besar menyusun rencana, model
00:13:43kecil mengeksekusinya, dan model kecil tersebut dapat membagikan konteksnya kepada model yang lebih besar kapan pun
00:13:50ia menemui masalah. Dan model ini membanggakan hasil yang lebih baik dengan biaya yang lebih rendah. Dan untuk menyambungkan
00:13:54pembahasan kita sebelumnya tentang peng缓存an prompt (prompt caching), baik penasihat maupun eksekutor memiliki cache prompt mereka sendiri
00:14:01yang bekerja secara bersamaan. Sekarang, opsi kedua Anda adalah mendelegasikan tugas ke model di luar Claude Code.
00:14:06Salah satu yang mudah dilakukan adalah Codex. Ada plugin Codex untuk Claude Code, yang membuatnya sangat sederhana
00:14:12untuk memanggil Codex dari antarmuka Claude Code. Jadi Anda pada dasarnya bisa membuat Fable melakukan jenis
00:14:18advisor mode yang sama, tetapi alih-alih memanggil Opus atau Sonnet, ia memanggil model-model GPT. Ada
00:14:24repositori lain seperti Fable advisor ini yang melakukan hal persis seperti itu. Dan pada akhirnya cukup mudah untuk menyiapkan
00:14:31keterampilan Anda sendiri yang melakukan ini secara tepat. Dan jika Anda mencari model yang lebih murah itu, sekali lagi, saya sangat menyarankan
00:14:36untuk melihat model GPT, khususnya Luna dan Terra, karena A, biayanya telah berkurang secara signifikan,
00:14:41dan B, tidak ada model di keluarga Anthropic yang melakukan apa yang mereka lakukan
00:14:48pada tingkat harga tersebut. Anda bahkan bisa melangkah lebih jauh dan membawa beberapa model lokal jika
00:14:53tugas-tugasnya sesuai untuk itu. Sekarang, tip nomor four adalah tentang kebersihan Claude (Claude hygiene). Anda mungkin baru-baru ini melihat
00:14:57video yang beredar dari Boris Cherney, pencipta Claude Code, yang mengatakan,
00:15:01Anda harus menghapus berkas Claude.md Anda. Nah, apakah Anda benar-benar harus menghapus berkas Claude.md itu? Ya,
00:15:07tidak harus, tetapi yang perlu Anda lakukan, dan ini telah mengalami beberapa perubahan baru dalam beberapa
00:15:12minggu terakhir, adalah menjalankan perintah slash doctor. Dan apa hubungannya ini dengan token?
00:15:18Nah, pertama-tama, apa yang akan dilakukan oleh perintah ini di antara hal-hal lainnya—tetapi kita tetap membahas
00:15:23hal yang terkait dengan token—adalah ia akan memeriksa Claude.md Anda dan memangkas berkas ini.
00:15:30Cara kerja model-model ini, terutama model seri 5 ini, adalah mereka tidak membutuhkan begitu banyak
00:15:36instruksi. Jika Anda melihat apa yang dibuat orang untuk Claude.md tiga, enam, sembilan bulan
00:15:42lalu, panduannya sangat direktif dan sangat mendetail. Dan mungkin pada saat itu, argumen
00:15:46dapat dibuat bahwa mereka membutuhkannya. Hal itu tidak lagi berlaku sekarang. Jadi, Claude.md yang membengkak
00:15:53bukan hanya membuatnya lebih lambat, tetapi secara harfiah menguras token Anda. Dan slash doctor akan melihatnya
00:15:59dan menyingkirkan hal-hal di Claude.md Anda yang memang tidak perlu ada di sana. Kedua,
00:16:04perintah ini akan memeriksa hal-hal yang merusak konteks Anda atau membuat jendela konteks Anda membengkak.
00:16:10Karena bahkan ketika Anda memulai percakapan baru dan menjalankan slash context, ada hal-hal
00:16:15yang mengisinya. Sekarang, saya baru-baru ini menjalankan slash doctor, jadi saya telah menyingkirkan sebagian besar pembengkakan saya,
00:16:20tetapi seperti inilah jendela konteks saya tepat di awal percakapan tanpa ada pesan
00:16:25yang dikirim. Kita sudah menggunakan 40.000 token. Dan apa yang menghabiskan banyak hal ini? Nah, sebagian berasal dari
00:16:31hal-hal seperti skills, seperti yang bisa Anda lihat di sini. Sebagian mencakup hal-hal seperti prompt sistem serta
00:16:36berkas memori. Apa yang akan dilakukan slash doctor adalah ia akan melihat hal-hal seperti skills Anda,
00:16:41seperti MCP Anda, dan mulai memangkas yang tidak sering Anda gunakan. Apakah ini penghematan token yang besar?
00:16:47Tidak, tapi ini lumayan, ini berarti di batas-batas margin dan ini adalah perbaikan yang sangat sederhana. Tidak ada
00:16:53alasan untuk tidak melakukannya, terutama jika Anda adalah seseorang yang terus menumpuk 10 juta skills selama
00:16:58enam bulan terakhir dan belum benar-benar meninjaunya serta mulai memangkasnya, karena melakukan hal itu
00:17:03juga akan membuat skills Anda berjalan lebih efektif. Dan tidak akan ada kebingungan di pihak Claude
00:17:08mengenai skill mana yang harus dipanggil. Saya bertaruh Anda mungkin memiliki sekitar 10 skills di sana yang semuanya
00:17:12berkaitan dengan desain frontend dan Anda tidak membutuhkan semuanya. Jadi tip yang sangat sederhana dan mudah dieksekusi ini
00:17:17dalam hal kebersihan Claude Anda adalah salah satu yang tidak boleh dilewatkan. Cukup jalankan doctor. Dan itu
00:17:22membawa kita ke tip terakhir kita, yang menurut saya paling kurang efektif dari semuanya saat ini, tetapi itu
00:17:28adalah semacam keterampilan tambahan dan perancah (scaffolding) yang Anda lihat bertebaran di mana-mana.
00:17:33Yang paling populer akhir-akhir ini adalah ponytail, dan pada dasarnya ini mengurangi jumlah kode
00:17:38yang ditulis Claude sambil mempertahankan efektivitasnya dan oleh karena itu membuatnya lebih murah dan lebih cepat. Nah,
00:17:44saya membuat video tentang ini yang membandingkan angka-angka ini dengan apa yang sebenarnya terjadi di dunia nyata karena repositori GitHub
00:17:51hanya menunjukkan haiku 4.5, yang jelas sudah sangat ketinggalan jaman. Ketika saya menjalankan ini menggunakan Fable, angka-angkanya
00:17:56memang terbukti benar. Faktanya, angka-angka tersebut terlihat lebih baik lagi dengan model yang lebih baik. Sekarang saya menggunakan tolok ukur yang
00:18:01disediakan bersama repositori GitHub ini. Apa yang berhasil untuk Anda di dunia nyata mungkin sedikit berbeda tergantung pada
00:18:06kompleksitas proyek Anda. Tetapi ini adalah sesuatu yang dapat Anda tempelkan pada semua yang telah kita bicarakan sejauh ini
00:18:11jika Anda ingin terus mengurangi penggunaan token Anda. Hal lain yang akan sering Anda lihat adalah Caveman,
00:18:18yang hari ini mengklaim dapat mengurangi token keluaran Anda sebesar 65%. Ada banyak orang di luar sana yang
00:18:25juga berbicara tentang membuat baris tunggal (one-liners) di Claude MD, sesuatu yang sederhana seperti mengatakan be brief,
00:18:30yang juga akan mengurangi token keluaran Anda. Tapi ingat, token keluaran hanyalah satu bagian dari teka-teki.
00:18:36Dan teka-teki itu, untuk membawanya kembali ke diskusi awal kita, didominasi oleh prompt caching. Jadi jika
00:18:41Anda tidak mendapatkan hal lain dari video ini, saya harap Anda bisa memahami poin tersebut karena di situlah
00:18:46kita akan mengakhirinya hari ini. Jadi seperti biasa, beri tahu saya pendapat Anda. Pastikan untuk memeriksa
00:18:50ChaseAI Plus jika Anda ingin mendapatkan akses ke Claude Code Masterclass. Sekali lagi, ada pembaruan besar
00:18:55yang dirilis untuk itu minggu ini. Selain itu, sampai jumpa di lain kesempatan.