Repositori Open Source Ini Memecahkan Masalah Terbesar Claude Code
CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology
Transcript
00:00:00Bisakah satu keterampilan tunggal membuat CloudCode jauh lebih efisien?
00:00:03Bisakah ini membuat CloudCode lebih cepat, lebih murah, dan menulis lebih sedikit kode
00:00:06namun tetap memberikan jenis hasil tingkat tinggi yang biasa kita dapatkan?
00:00:10Nah, itulah persisnya yang diklaim oleh Ponytail,
00:00:13dan hal itu menyebabkannya meraih 40.000 bintang hanya dalam tujuh hari setelah dirilis.
00:00:18Kini, Ponytail bukan alat pertama yang kita lihat mengklaim mampu melakukan hal seperti ini.
00:00:22Kita telah membahas Caveman di masa lalu, dan semua alat ini cenderung memiliki gagasan yang sama.
00:00:26Gagasannya adalah bahwa CloudCode secara alami bersifat bertele-tele,
00:00:29dan jika kita mengatakan kepadanya, hei, berhenti berbicara terlalu banyak,
00:00:32kita bisa mendapatkan jawaban yang jauh lebih ringkas yang pada akhirnya sama benarnya
00:00:36atau, seperti yang kita ingat pada Caveman, bahkan mungkin bisa lebih benar.
00:00:40Ponytail hanyalah versi terbaru dari hal tersebut,
00:00:42tetapi ini adalah versi yang mengklaim angka-angka yang lebih baik daripada apa pun yang pernah kita lihat di masa lalu.
00:00:45Dan kita bisa melihat angka-angka tersebut di sini.
00:00:47Kita dapat melihat baris kode versus token versus biaya dan versus waktu.
00:00:52Dan secara keseluruhan, warna abu-abu menjadi semacam garis dasar tanpa alat-alat ini
00:00:55dan hijau adalah Ponytail,
00:00:58Ponytail hampir memimpin di semua bidang atau berada sangat dekat.
00:01:03Sekarang, angka-angka yang Anda lihat di sini adalah agregat.
00:01:05Ini adalah rata-rata yang diambil dari sejumlah pengujian yang berbeda,
00:01:08dan ini juga dilakukan menggunakan Haiku 4.5.
00:01:11Dan jangan khawatir, nanti kita akan A, memvalidasi pengujian ini,
00:01:14melihat model nyata karena tidak satupun dari kita yang benar-benar menggunakan Haiku 4.5.
00:01:18Kita menggunakan Opus 4.8, jadi mari kita lihat seperti apa angka-angka itu.
00:01:20Dan dalam hal baris kode, itu sekitar 50% lebih sedikit baris.
00:01:24Dan jika kita melihat dari segi token, biaya, dan waktu,
00:01:27terdapat peningkatan sekitar 20% hingga 30% dibandingkan dengan garis dasar.
00:01:31Dan itu bukan jumlah yang sedikit,
00:01:32terutama ketika kita mengekstrapolasikannya ke sesuatu seperti Fable,
00:01:36yang biayanya sangat mahal.
00:01:37Jadi jika saya bisa memberi tahu Anda, hei, jika Anda menggunakan sesuatu seperti Fable,
00:01:40itu akan menjadi lebih cepat dan lebih murah.
00:01:42Nah, kita pasti akan menyukai itu, bukan?
00:01:43Sekarang, sebelum saya membahas cara kerjanya
00:01:45dan menunjukkan seperti apa skor tolok ukurnya,
00:01:47ketika saya mengujinya, sepatah kata singkat dari sponsor hari ini, yaitu saya.
00:01:50Jadi di dalam Chase AI+, saya memiliki Masterclass Claude Code,
00:01:53yang merupakan cara nomor satu untuk beralih dari nol menjadi pengembang AI,
00:01:56terutama jika Anda tidak berasal dari latar belakang teknis.
00:01:59Saya memperbarui ini setiap minggu,
00:02:01dan ini juga mencakup kelas master tentang codec
00:02:03dan cara membangun OS agen Anda sendiri.
00:02:06Anda dapat menemukan tautannya di komentar yang disematkan.
00:02:08Dan sekali lagi, saya memperbarui ini setiap minggu,
00:02:10dan kami berfokus pada kasus penggunaan nyata.
00:02:12Jadi jika Anda ingin mulai menguasai Claude Code,
00:02:15ini adalah tempat yang tepat untuk Anda.
00:02:16Jadi bagaimana cara kerja Ponytail?
00:02:17Nah, alat ini melalui proses enam langkah
00:02:19sebelum ia menuliskan kode.
00:02:20Jadi pertanyaan pertama adalah,
00:02:22apakah hal ini bahkan perlu untuk ada?
00:02:24Jika jawabannya tidak,
00:02:26yah, maka kita tidak perlu menulis kode untuk itu sama sekali.
00:02:28Relatif sudah jelas.
00:02:29Setelah itu, kita bertanya, apakah pustaka standar melakukannya?
00:02:33Jika jawabannya ya,
00:02:34kita akan menggunakan pustaka standar.
00:02:36Hal utama yang akan Anda lihat pada tolok ukur tersebut
00:02:38adalah ada contoh di mana Claude Code
00:02:41akan membuat ulang fitur dari awal yang sebenarnya sudah ada,
00:02:45baik di dalam beberapa jenis pustaka atau sebagai fitur platform.
00:02:49Jadi Claude Code memiliki masalah di mana,
00:02:51hei, roda sudah pernah diciptakan.
00:02:52Kita memiliki roda di sini dalam program ini.
00:02:53Dan hasilnya seperti, tahu nggak?
00:02:55Saya akan membuat roda dari awal.
00:02:56Dan karena itu,
00:02:57itulah cara Anda mendapatkan banyak kode
00:02:59ketika Anda sebenarnya tidak terlalu membutuhkannya.
00:03:01Itulah sesuatu yang Anda lihat berulang kali
00:03:03dalam tolok ukur ini.
00:03:04Dan untuk beralih sejenak,
00:03:05keenam langkah ini pada dasarnya menanyakan kepada Claude Code,
00:03:09seperti, hei, apakah fitur ini sudah ada secara natif?
00:03:12Apakah kita perlu membuat sesuatu yang kustom?
00:03:15Karena Claude suka membuat hal-hal yang kustom,
00:03:17bahkan jika ia tidak harus melakukannya.
00:03:18Jadi jika pustaka standar tidak melakukannya,
00:03:20maka ia mengatakan, hei, apakah ini fitur platform asli?
00:03:22Apakah ini dependensi yang terinstal?
00:03:24Bisakah ini dibuat dalam satu baris?
00:03:26Apakah kita harus bertele-tele?
00:03:27Dan jika ia melalui semua itu,
00:03:28dan pada dasarnya seperti, tidak, tidak, tidak, tidak, tidak,
00:03:30maka kita mengatakan, apa pun yang kamu tulis,
00:03:33cukup buat yang minimum dan berfungsi.
00:03:35Jangan berlebihan.
00:03:36Jangan buat itu jika kita tidak membutuhkannya.
00:03:37Dan jika kita memang membutuhkannya, buatlah sekecil mungkin.
00:03:40Jadi tujuannya di sini adalah membuat Claude Code menjadi malas,
00:03:42tetapi tidak lalai.
00:03:44Apa pun yang berkaitan dengan validasi batas kepercayaan,
00:03:47kehilangan data, penanganan, keamanan, dan aksesibilitas
00:03:48tidak pernah menjadi hal yang ditiadakan.
00:03:50Jadi ini cukup cerdas mengenai apa yang diterapkannya pada proses ini.
00:03:53Sekarang dalam hal instalasi, relatif sangat mudah.
00:03:55Anda tinggal menyalin perintah ini di sini.
00:03:57Dan saya akan menaruh tautan di deskripsi
00:03:58untuk repo ini, tentu saja,
00:04:00dan ini akan menginstalnya untuk Anda.
00:04:01Dan Anda juga dapat menggunakan ini untuk codec,
00:04:03atau benar-benar agen AI apa pun di luar sana.
00:04:05Ada beberapa perintah terkait Ponytail.
00:04:07Yaitu, light, full, ultra, dan off.
00:04:10Sekali lagi, sangat mengingatkan pada Caveman,
00:04:12seperti tingkat-tingkat dalam Caveman yang kita tuju.
00:04:14Kita dapat membuatnya meninjau kode kita.
00:04:16Kita dapat membuatnya mengaudit sebuah repo.
00:04:18Dan kemudian kita juga memiliki keterampilan debt, gain, dan help.
00:04:20Sekali lagi, Anda benar-benar dapat mempelajari ini secara mendalam
00:04:22jika Anda ingin melakukannya di dalam GitHub repo.
00:04:24Tetapi semua ini tidak terlalu penting
00:04:24jika tolok ukurnya tidak terbukti.
00:04:26Dan hal yang bagus tentang repo ini
00:04:28adalah mereka memberikan tolok ukurnya kepada kita.
00:04:29Kita dapat menjalankan ini sendiri.
00:04:31Dan tebak apa?
00:04:32Itulah persisnya yang saya lakukan.
00:04:34Anda dapat melakukan ini sendiri juga.
00:04:36Ada penjelasan lengkap
00:04:37tentang bagaimana mereka mendapatkan tolok ukur tersebut
00:04:39langsung di sini pada README.
00:04:40Dan itu juga memberi Anda kemampuan untuk mereproduksi ini.
00:04:43Dan jadi apa yang akan saya tunjukkan kepada Anda
00:04:44adalah angka-angka yang saya dapatkan
00:04:45ketika saya mereproduksi semua tolok ukur ini.
00:04:48Dan saya mereproduksinya tidak hanya dengan Haiku 4.5,
00:04:51yang merupakan apa yang Anda lihat di repo,
00:04:52tetapi juga melakukannya dengan Opus 4.8.
00:04:54Karena sekali lagi, tidak satupun dari kita yang menggunakan Haiku.
00:04:56Saya tidak begitu peduli dengan Haiku.
00:04:58Saya peduli dengan Opus.
00:05:00Dan hasilnya sejujurnya cukup menarik.
00:05:02Jadi ini pengujiannya, dan ini skornya.
00:05:04Anda melihat angka yang mereka publikasikan.
00:05:07Anda melihat uji coba kami dengan Haiku.
00:05:09Dan kemudian di sini di sebelah paling kanan
00:05:10adalah uji coba kami dengan Opus.
00:05:12Di bagian bawah, Anda memiliki agregatnya.
00:05:14Jadi 54%, ini sekali lagi, melihat pada baris kode.
00:05:17Ini adalah 54% lebih sedikit baris kode, menurut Ponytail.
00:05:21Ketika kami menjalankannya, itu adalah 56% pada Haiku.
00:05:24Jadi intinya persis sama.
00:05:27Dan pada Opus, angkanya adalah 71%.
00:05:29Jadi kita melihat penghematan yang lebih besar atau kode yang lebih efisien menggunakan Ponytail saat memakai Opus.
00:05:36Kenapa bisa begitu?
00:05:36Karena model-model yang lebih kuat ini suka berbicara, ya kan?
00:05:40Mereka suka bertele-tele.
00:05:41Sekali lagi, ini merujuk kembali ke Caveman.
00:05:43Kalian mungkin ingat salah satu studi yang dibahas di sana
00:05:45adalah gagasan bahwa model yang sangat bertele-tele suka berbicara banyak
00:05:50sampai-sampai terkadang mereka mengabaikan jawaban yang benar.
00:05:53Jadi cukup menarik dan sebenarnya seperti dorongan untuk hal ini.
00:05:57Dan ini menarik.
00:05:58Dan mereka membahas mengapa mereka menggunakan Haiku dalam pengujian yaitu karena biaya.
00:06:02Saya benar-benar berpikir mereka seharusnya melakukan seluruh hal ini dengan Opus
00:06:04karena ketika kami menjalankannya, Opus justru membuatnya terlihat lebih baik.
00:06:09Tahukah kalian, dan inilah model yang digunakan orang-orang.
00:06:11Jadi jika ada, mereka justru meremehkan efisiensinya dalam hal jumlah baris kode.
00:06:15Dan ini juga berlaku untuk biaya.
00:06:17Saat kami melihat Haiku 4.5, berapa total agregat pada pengujian kami?
00:06:21Kami melihat penurunan biaya sekitar 25% dibandingkan Opus 4.8, yaitu penurunan sebesar 53%,
00:06:28yang luar biasa.
00:06:30Biayanya 53% lebih murah bagi kita.
00:06:32Bayangkan jika ini adalah Fable.
00:06:33Dan kalian dapat melihat semua pengujian dan angka secara menyeluruh.
00:06:35Dan yang terendah adalah 13%.
00:06:38Dan dalam beberapa kasus, angkanya mencapai 73% untuk wizard multi-langkah.
00:06:42Sekarang kalian mungkin berpikir, apakah kita bahkan membutuhkan Opus untuk beberapa hal ini?
00:06:45Poin yang bagus.
00:06:45Tapi pahamilah apa yang sedang digambarkan di sini.
00:06:48Berapa biaya normalnya sebesar 1,39 dolar menggunakan Opus standar tanpa skill justru berbiaya 0,38 dolar
00:06:55menggunakan Ponytail.
00:06:57Dan jika kita melihat Haiku, model yang lebih kecil ini dalam beberapa kasus justru berbiaya lebih mahal menggunakan Ponytail.
00:07:04Jadi gagasan untuk memangkas baris kode dan membuatnya lebih efektif jauh lebih baik ketika kita membahas model yang lebih kuat.
00:07:11Dalam beberapa kasus, kita mendapatkan efek sebaliknya dengan model yang lebih kecil karena mereka memang sudah efisien karena sifatnya yang agak sederhana dan cepat.
00:07:18Kalian dapat melihat di sini pada tolok ukur penghitungan item, biayanya 21% lebih mahal untuk menggunakan Ponytail dengan Haiku.
00:07:27Sekarang kita berbicara tentang selisih dua sen, tapi intinya tetap sama.
00:07:31Semakin kuat modelnya, semakin efektif arsitektur ini.
00:07:34Dan saya ingin melihat seperti apa bentuknya jika menggunakan Fable.
00:07:37Sekali lagi, angka 53% bukan lelucon.
00:07:39Lalu bagaimana dengan kecepatan?
00:07:40Sekali lagi, kita melihat hal yang sama terjadi pada Haiku.
00:07:43Berapa banyak lebih cepat?
00:07:44Sekitar 31% lebih banyak, 31% lebih cepat menggunakan Haiku dengan Ponytail daripada tidak.
00:07:51Dengan Opus, 71% lebih cepat.
00:07:5571% lebih cepat.
00:07:56Dan sekali lagi, apa yang kita lihat pada Haiku?
00:07:58Ada contoh, tepatnya tiga, di mana kinerjanya lebih lambat menggunakan Ponytail.
00:08:03Tahukah kalian, dalam beberapa kasus, 22% lebih lambat dibandingkan setiap tolok ukur secara menyeluruh pada Opus yang mencapai 88%.
00:08:10Dalam beberapa kasus, kinerjanya selalu lebih cepat, bukan?
00:08:13Sekali lagi, kita melihat wizard multi-langkah 78%, pemilih tanggal 88%.
00:08:17Dan dalam skenario terburuk, perbedaannya adalah 27%.
00:08:22Jadi kita melihat angka-angka ini dengan Ponytail dan kita berpikir, ah, jangan ditelan mentah-mentah, meskipun saya bisa melakukan tolok ukurnya, sebenarnya apa arti 20% itu?
00:08:31Dan kemudian kalian berpikir, oh, ini Haiku.
00:08:33Jadi ini semacam omong kosong.
00:08:34Kemudian kami mengujinya pada Opus dan hasilnya sangat berbeda.
00:08:36Jauh lebih efektif.
00:08:37Dan saya pikir pertanyaan yang jelas muncul adalah, bagaimana dengan tolok ukurnya sendiri?
00:08:41Seberapa efektifkah tolok ukur ini?
00:08:42Apakah itu realistis?
00:08:44Pertama-tama, kunjungi repositorinya, uji sendiri atau jalankan tolok ukur kalian sendiri yang menurut kalian sesuai dengan apa yang kalian anggap sah.
00:08:52Bagaimanapun, saya pikir ketika kita membahas, saya rasa dari 19 tolok ukur berbeda yang dijalankan, kita mulai melihat hal yang sama di semua lini.
00:08:59Ketika kita melihat model yang lebih kuat seperti Opus, maksud saya, sejujurnya, saya mengabaikan hal ini untuk Haiku.
00:09:04Saya tidak peduli dengan Haiku.
00:09:06Harganya lebih murah.
00:09:07Lebih cepat.
00:09:08Dan oleh karena itu, lebih efisien.
00:09:11Dan sekali lagi, karena kita membahas apa yang pada dasarnya hanyalah sebuah skill, apa kerugiannya mencoba hal ini?
00:09:16Angka-angka ini terlihat sangat bagus.
00:09:17Saya sangat menyarankan kalian mengunjungi repositori ini, mengunduh dan mulai menggunakannya sendiri.
00:09:21Dalam skenario terburuk, katakanlah untuk proyek khusus kalian, proyeknya sangat rumit sehingga menyuruhnya untuk, kalian tahu, tidak bertele-tele justru menjadi bumerang.
00:09:30Yah, maksud saya, saya pikir ini seperti skenario tanpa risiko, bukan?
00:09:34Jadi itulah skenario terburuknya.
00:09:37Skenario terbaiknya adalah kalian menghemat sekitar 50% penggunaan Opus dan kinerjanya 70% lebih cepat.
00:09:43Jadi ini hal yang sangat menarik.
00:09:45Saya pasti akan menggunakannya dalam keseharian saya.
00:09:47Saya telah menggunakan Caveman selama sekitar satu atau dua bulan sekarang sepanjang waktu, dan langsung dimuat otomatis.
00:09:52Dan saya akan beralih ke Ponytail dan melihat apakah saya menyukainya.
00:09:55Saya pikir semakin banyak hal seperti ini yang dirilis, semakin baik.
00:09:58Yang kalian dengar hari ini adalah biaya token, biaya token, biaya token.
00:10:03Jadi apa pun yang dapat menurunkannya bagi kita pasti akan disambut baik.
00:10:07Jadi di sinilah saya akan mengakhiri video ini.
00:10:08Seperti biasa, pastikan untuk memeriksa ChaseAI Plus jika kalian ingin mendapatkan Cloud Code Masterclass saya.
00:10:13Beri tahu saya pendapat kalian di kolom komentar dan sampai jumpa.