Semuanya Berakhir... Ini Mengakhiri Perdebatan GPT 6 Astra vs Fable 5.1

AAI LABS
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Fable 5.1 dan GPT-6 Astra dirilis hanya berselang beberapa hari dan keduanya sama-sama mendapatkan
00:00:05skor yang sangat tinggi pada tolok ukur. Astra bahkan mencetak hampir 100% pada tes AGI yang belum pernah
00:00:11didekati oleh model apa pun. Jadi, melihat angka-angka tersebut, Anda akan memperkirakan model ini berkinerja sangat baik saat Anda
00:00:16memberinya pekerjaan Anda sendiri. Namun, berkinerja baik pada tes tersebut tidak memberi tahu Anda seberapa baik suatu model akan
00:00:20menangani pekerjaan yang Anda berikan, dan kami ingin melihat apakah kedua model berkinerja sama baiknya pada
00:00:25pekerjaan kami sendiri. Karena kami adalah perusahaan perangkat lunak, kami sudah memiliki proyek untuk mengujinya, jadi kami memberikan pekerjaan
00:00:30dari proyek tersebut kepada kedua model dan memeriksa apa yang berhasil mereka selesaikan. Kami menjalankan setiap model di beberapa
00:00:35proyek dan memberi skor seberapa baik kinerjanya di berbagai bidang. Kami menggunakan GPT-5.6 untuk membantu menilai
00:00:41hasilnya dan memberikan skor. Model penilai ini tidak tahu hasil mana yang berasal dari Fable dan mana yang
00:00:45berasal dari Astra. Satu model mendapat skor keseluruhan 86 dari 100 sementara yang lain mendapat 84. Sekarang hal itu mungkin tampak
00:00:52seperti selisih yang kecil, tetapi model yang unggul secara keseluruhan tidak memenangkan setiap bagian pengujian dan
00:00:57yang lain berkinerja sangat baik di beberapa bidang tersebut. Jadi, kami akan membahas bagaimana masing-masing
00:01:02model berkinerja dalam pengujian kami dan mana yang menang di setiap kategori agar Anda tahu bagaimana perbedaan tersebut
00:01:07memengaruhi pekerjaan yang Anda berikan. Sebelum kita beralih ke bagaimana kinerja masing-masing model, mari kita bahas terlebih dahulu
00:01:12tentang model itu sendiri. Bagian ini khusus bagi mereka yang belum mengetahuinya, jadi jika Anda sudah tahu
00:01:17detailnya, Anda dapat melewati bagian ini dan langsung ke bagian berikutnya. Anthropic merilis
00:01:22Fable 5.1 pada tanggal 1 September dan bahkan sebelum Anthropic dapat sepenuhnya menikmati kehebohan peluncurannya,
00:01:27OpenAI meluncurkan GPT-6 Astra beberapa hari setelah Fable dan orang-orang telah membangun produk yang sangat menarik
00:01:33dengan model-model ini dan mendorong model-model ini ke batas kemampuan mereka serta mendapatkan hasil yang sangat
00:01:37mengejutkan. Mengenai penetapan harga, kedua model sebenarnya memiliki harga yang sama yaitu $10 per
00:01:43juta token masukan dan $50 per juta token keluaran. Namun dengan Fable 5.1 ada satu hal
00:01:49yang berbeda, yaitu Anthropic memotong harga pembacaan tembolok (cached reads) sebesar 75%. Bagi mereka yang tidak tahu
00:01:54tentang pembacaan tembolok, bagian dari percakapan yang telah dibaca oleh model sebenarnya disimpan untuk
00:02:00digunakan kembali. Saat Anda mengirimkan prompt baru, bagian yang disimpan tersebut digunakan kembali alih-alih model membacanya
00:02:05lagi dari awal dan itu disebut pembacaan tembolok. Pembacaan ini sudah membuat penggunaan ulang percakapan menjadi lebih murah,
00:02:10tetapi dengan penurunan harga, harganya menjadi lebih murah lagi. Namun, bukan berarti Fable adalah
00:02:14model yang lebih murah untuk digunakan secara keseluruhan karena total tagihan juga bergantung pada banyak faktor lain yang akan
00:02:19kita bicarakan sebentar lagi. Model Fable sudah ada di Claude Code untuk sementara waktu tetapi Fable 5.1 masih belum
00:02:25termasuk dalam paket Claude Pro, jadi di Pro Anda harus membayarnya secara terpisah melalui kredit penggunaan. Pada
00:02:30paket Max, Fable 5.1 disertakan tetapi model Fable memiliki batas yang lebih rendah daripada model lainnya.
00:02:36Di sisi lain, OpenAI tidak memperlakukan Astra sebagai model terpisah karena Astra adalah bagian dari
00:02:41batas kode normal pada ChatGPT+ dan Pro dan Anda dapat menghabiskan seluruh penggunaannya pada Astra. Sekarang model-model ini
00:02:47benar-benar mampu mengerjakan tugas yang panjang yang berarti Anda dapat meminta mereka untuk membangun fitur besar
00:02:52dan membiarkan mereka bekerja melalui langkah-langkah tersebut sendiri. Tetapi ketika Anda membiarkan model-model ini bekerja
00:02:57pada tugas yang panjang, jumlah konteks yang dapat mereka tampung juga penting. Fable memberi Anda satu juta token di
00:03:02Claude Code sementara jendela konteks bawaan Astra di Codex hanya 272.000 token meskipun Astra memiliki
00:03:09jendela yang jauh lebih besar melalui API-nya yang bahkan lebih tinggi daripada satu juta milik Fable. Tapi Anda tidak akan
00:03:14mendapatkannya di Codex untuk saat ini karena Codex secara default menggunakan jendela konteks 272.000 token bahkan untuk Astra.
00:03:21Sekarang model-model ini telah mencapai tingkat di mana mereka dapat melakukan penelitian tingkat lanjut sehingga OpenAI dan
00:03:26Anthropic sama-sama telah menambahkan pagar pengaman keselamatan yang membatasi beberapa pekerjaan yang diizinkan untuk mereka lakukan.
00:03:31Namun pembatasan tersebut juga memengaruhi pekerjaan Anda dengan cara yang berbeda karena setiap model bereaksi secara berbeda
00:03:36ketika sistem keselamatannya memutuskan permintaan Anda tidak diizinkan. Ketika Astra mencapai bagian tugas yang
00:03:41bertentangan dengan aturannya, ia langsung menolak tugas tersebut dan memberi tahu Anda tentang hal itu. Di sisi lain,
00:03:45Claude Code beralih dari Fable ke model yang lebih lemah ketika sebuah permintaan bertentangan dengan aturannya. Dan banyak
00:03:51orang menemukan bahwa Claude Code telah mengganti model tanpa sepengetahuan mereka. Jadi jika Claude Code terus
00:03:56bekerja setelah peralihan tersebut, hasil yang Anda dapatkan mungkin tidak lagi berasal dari Fable.
00:04:01Sekarang metrik pertama yang kami ukur adalah kualitas yang melihat seberapa bagus pekerjaan model tersebut sebenarnya.
00:04:06Untuk pengujian ini, kami menggunakan beberapa proyek klien sehingga kami tidak dapat mengungkapkan detail proyek tersebut
00:04:11tetapi kami dapat menjelaskan bagaimana kami menilai pekerjaan tersebut dan di mana letak perbedaan antar model. Mengenai seberapa baik kode
00:04:16ditulis dan diatur, Fable mencetak skor 90 dibandingkan dengan Astra yang 78 karena ia menjaga kode untuk bagian-bagian
00:04:22aplikasi yang berbeda terpisah dengan lebih jelas. Hal itu membuatnya lebih mudah bagi model untuk memahami aplikasi ketika
00:04:27melakukan perubahan nanti dan Fable berada di depan Astra dalam hal ini di semua proyek yang kami uji. Dan untuk
00:04:32seberapa banyak pekerjaan yang diminta yang diselesaikan, Fable mencetak skor 91 dibandingkan dengan Astra 84 karena ia juga memperbaiki
00:04:39masalah yang tidak secara khusus kami minta untuk diperbaiki. Namun kami juga memeriksa apakah fitur yang selesai
00:04:44bekerja dengan benar tanpa kami meminta perbaikan dan Astra mencetak skor 87 dibandingkan dengan Fable 85 untuk hal tersebut.
00:04:50Sebagian keunggulan Astra berasal dari pemeriksaan aplikasi yang lebih teliti dan perbaikan lebih banyak masalah yang diketahui.
00:04:55Ketika Fable menguji aplikasinya, ia melewatkan beberapa situasi di mana aplikasi tersebut bisa mengalami kesalahan, sehingga fitur yang selesai
00:05:00masih memiliki beberapa masalah. Ketika menyangkut pengalaman menggunakan aplikasi, Astra mencetak skor 89 dibandingkan Fable 88,
00:05:08karena ia mengatur berbagai bagian halaman di tempat yang membuatnya lebih mudah ditemukan dan digunakan.
00:05:13Jadi berdasarkan semua pengujian yang baru saja kita sebutkan, skor kualitas keseluruhan Fable adalah 88 sementara Astra mencetak 84,
00:05:19karena ia membangun fitur yang lebih lengkap dan pekerjaannya lebih mudah diubah nanti. Jadi dalam hal kualitas,
00:05:25Fable adalah pemenang yang jelas. Tapi sebelum kita beralih ke pengujian berikutnya, mari dengarkan pesan dari sponsor kita,
00:05:30Zapier. Anda membuat aplikasi dengan vibecoding dan itu bekerja dengan baik, tetapi saat Anda ingin aplikasi tersebut benar-benar terhubung ke alat
00:05:35seperti Gmail, Slack, dan Notion, Anda harus merangkai setiap integrasi dan alur OAuth secara manual. Sebelum Anda sadari,
00:05:41Anda terkubur dalam kode otentikasi dan tiba-tiba integrasi tersebut menjadi seluruh proyek itu sendiri. Di situlah
00:05:46SDK Zapier hadir. Ini adalah pustaka kode yang Anda masukkan ke dalam proyek Anda tepat di dalam Claude Code atau Cursor,
00:05:52memberi Anda akses terprogram ke ekosistem lebih dari 9000 aplikasi Zapier. Jadi alih-alih membangun setiap integrasi
00:05:58secara manual, kita cukup memanggil yang kita perlukan dan terus melangkah. Dalam beberapa baris, aplikasi kita mengirimkan email
00:06:04dan membuat halaman Notion tanpa dokumentasi API dan tanpa harus bersusah payah mengurus otorisasi. Dan ketika kita perlu memperbarui
00:06:10properti kustom di Notion yang tidak memiliki tindakan pra-bangun, kita memanggilnya secara langsung melalui
00:06:15SDK. Ini benar-benar menemui Anda di tempat Anda sudah bekerja. Jika Anda lelah merangkai integrasi secara manual,
00:06:20coba SDK Zapier. Tautan ada di deskripsi di bawah. Metrik berikutnya yang kami ukur adalah seberapa baik
00:06:26model menangani tugas jangka panjang, yang berarti seberapa banyak pekerjaan yang mereka selesaikan sendiri dengan sedikit
00:06:31bimbingan dari kami saat mereka bekerja. Kami juga memeriksa seberapa baik mereka menangani masalah yang muncul di tengah jalan.
00:06:36Untuk ini, kami memberi setiap model ide aplikasi untuk dibangun dan merumuskan permintaan sesuai dengan panduan prompt-nya
00:06:42agar ia memiliki peluang terbaik untuk melakukan pekerjaan dengan baik. Kami tidak menyebutkan detail spesifik yang kami inginkan
00:06:47dan kami hanya menjelaskan apa yang harus dilakukan aplikasi tersebut. Astra bekerja selama sekitar 32 menit dan Fable bekerja selama
00:06:53sekitar 44 menit. Astra mengalami kesalahan saat membangun dan memeriksa aplikasinya, tetapi ia mengatasinya
00:06:58dan terus memperbaiki aplikasi tanpa kami harus membimbingnya melalui setiap masalah. Fable juga menyelesaikan
00:07:03aplikasinya tanpa berhenti lebih awal atau menanyakan apa yang harus dilakukan selanjutnya, dan ia menjalankan pemeriksaan pada apa yang telah dibangunnya.
00:07:09Jadi keduanya menyelesaikan pekerjaan tersebut, tetapi kami juga memeriksa aplikasi yang sudah jadi untuk melihat apa yang telah
00:07:13mereka tinggalkan untuk kita. Aplikasi Astra langsung terbuka ke halaman masuk (login) tanpa halaman landas (landing page) yang terpisah. Begitu kami
00:07:18masuk, tata letaknya tersusun dengan baik dan aplikasinya berfungsi, meskipun masih memiliki tata letak familier yang
00:07:24muncul di banyak aplikasi buatan AI. Tetapi kami memiliki masalah dengan panel samping karena tidak dapat digulir
00:07:30cukup jauh untuk memungkinkan kita mencapai tombol keluar (sign out). Kami harus memperkecil tampilan (zoom out) untuk mencapai tombol itu, yang merupakan
00:07:35sesuatu yang belum ditangkap oleh pemeriksaan Astra sendiri. Aplikasi Fable juga terbuka langsung ke halaman masuk, tetapi desainnya
00:07:40terasa jauh lebih generik. Fitur-fiturnya berfungsi, tetapi semuanya dikemas begitu berdekatan sehingga
00:07:45aplikasinya sulit digunakan dan gradien yang berulang menambah tampilan buatan AI yang familier itu. Aplikasi itu memang menyesuaikan dengan
00:07:51layar yang lebih kecil, tetapi tetap tidak memiliki tata letak yang dapat digunakan, meskipun fiturnya mendalam. Kami
00:07:56juga memiliki beberapa aplikasi lain dan fitur besar yang direncanakan dan dibangun dengan cara ini dengan model yang dibiarkan
00:08:01bekerja sendiri. Jadi untuk pekerjaan jangka panjang, Astra mencetak skor 93 dari 100 dibandingkan Fable 90.
00:08:08Fable lebih fokus pada pembuatan fitur agar berfungsi, kecuali jika kami telah menentukan dalam prompt bahwa ia harus
00:08:13berfokus pada visual juga. Astra memperhatikan cara kerja aplikasi maupun tampilannya,
00:08:18sehingga Astra menang pada tugas jangka panjang. Metrik berikutnya yang kami lihat adalah desain dan bagaimana
00:08:23aplikasi mudah digunakan. Kami memang membiarkan model menilai desainnya, tetapi kami tidak ingin mengandalkan
00:08:28selera desainnya saja. Jadi kami membangun penampil untuk hasil Fable dan satu lagi untuk Astra, yang memungkinkan kami meninjau
00:08:33desainnya sendiri dan membandingkan seperti apa rasanya saat digunakan. Kami memberi kedua model tugas desain yang sama,
00:08:38dimulai dengan halaman landas untuk bisnis yang menjual fon. Versi Fable terlihat sangat mirip dengan
00:08:44apa yang cenderung dihasilkan oleh Opus, mulai dari warna dan fon hingga tata letaknya. Bahkan ada garis teks yang bergerak
00:08:50di halaman yang akhir-akhir ini kita lihat dalam desain Opus. Tetapi satu hal yang dilakukan Fable secara berbeda
00:08:55dari Opus adalah menambahkan lebih banyak elemen interaktif di seluruh desain, dan itu membuat aplikasi terasa
00:09:00Versi Astra memiliki tata letak yang lebih luas, dengan perbedaan ukuran teks dan
00:09:05warna yang lebih jelas sehingga teks lebih mudah dibaca. Namun, pergerakannya jauh lebih sedikit, jadi meskipun terasa lebih
00:09:10nyaman dilihat, tampilannya tidak menawarkan pengalaman yang sama seperti desain Fable. Itulah sebabnya Fable
00:09:14meraih skor 94 untuk interaksi, sedangkan Astra memperoleh 85. Berikutnya, kami meminta setiap model merancang halaman landas
00:09:20game horor. Desain Fable menggunakan mercusuar animasi untuk menciptakan suasana. Model tersebut membuat
00:09:25karya seni sebagai SVG, yaitu gambar yang digambar dengan kode, tetapi teksnya kurang begitu menonjol dengan latar belakang gelap
00:09:31karena ukuran dan warna yang dipilih Fable. Dan pada tugas desain yang sama, Astra menggunakan
00:09:36model pembuatan gambar bawaan di Codex untuk menghasilkan gambar alih-alih membuat karya seni dengan kode.
00:09:42Model itu juga membuat cuplikan untuk game tersebut meskipun kami tidak memintanya. Dan keunggulan Astra
00:09:47terletak pada pilihan fon dan warna yang membuat teksnya lebih menonjol di atas latar belakang gelap.
00:09:52Untuk situs festival musik, versi Fable banyak mengulang pilihan desain yang kita lihat dalam desain buatan
00:09:57Opus. Namun, bahkan dengan pilihan yang familier tersebut, Fable terasa lebih berusaha memberikan
00:10:03gaya tersendiri pada situsnya. Astra menggunakan foto konser hasil buatan AI, tetapi desain keseluruhannya terasa lebih
00:10:08generik. Perbandingan terakhir adalah game parkir paralel, yang versi Fable-nya dibuat dengan sangat baik,
00:10:13dan kaca spion belakang membantu kita memperkirakan arah gerak mobil dengan lebih akurat. Game tersebut memiliki dua
00:10:18tampilan kamera, tetapi keduanya bermasalah. Karena yang satu menunjukkan sisi ruang parkir yang salah,
00:10:23sementara yang lain hanya memperlihatkan satu sisi alih-alih memberikan pandangan penuh ke jalan di depan. Hal itu membuat
00:10:27kita lebih sulit melihat arah mobil bergerak, dan jika sudut kamera tersebut benar, game akan
00:10:32terasa lebih realistis. Astra memberikan tiga pandangan tetap dan menambahkan tips mengemudi di panel samping,
00:10:38sehingga gamenya lebih mudah dimainkan. Tampilan kameranya jauh lebih baik daripada Fable. Ini adalah
00:10:42pengujian umum ketika kami memberikan sedikit sekali detail tentang desain yang kami inginkan kepada model, jadi kami melihat
00:10:48selera model itu sendiri di sini. Keduanya mengulang pilihan desain yang terlihat pada karya lainnya, tetapi keduanya memang
00:10:53menghasilkan karya yang bagus. Dan dengan sedikit lebih banyak detail tentang tampilan dan nuansa aplikasi yang diinginkan,
00:10:58kita dapat berharap keduanya mendesain dengan baik. Jadi, dari segi selera saja, Astra unggul dalam visual dan kegunaan, sementara Fable unggul dalam
00:11:04animasi dan interaktivitas. Namun, sebelum kita beralih menguji biaya dan kecepatan, ada baiknya jika Anda
00:11:09berlangganan saluran ini dan menekan tombol suka. Dukungan kecil ini sangat berarti bagi kami.
00:11:15Metrik berikutnya yang kami ukur adalah efisiensi, yang mencakup biaya pengerjaan, durasi waktu,
00:11:20dan seberapa sering model menggunakan alatnya untuk menyelesaikan pekerjaan. Satu hal yang perlu diketahui tentang biaya adalah
00:11:25kami tidak menggunakan API, jadi ini hanyalah perkiraan berapa biaya pekerjaan jika kita menggunakan API
00:11:31berdasarkan token yang digunakan. Kami menjalankan pengujian pada langganan biasa kami. Di semua uji coba, total perkiraan biaya
00:11:37Fable mencapai $49,18, dibandingkan dengan $27,69 untuk Astra, jadi total biaya Astra sekitar 44% lebih rendah.
00:11:47Fable menghasilkan token keluaran hampir 3 kali lipat lebih banyak daripada Astra, sama seperti panduan pembuatan prompt
00:11:52Fable yang menyebutkan bahwa model tersebut cenderung menulis lebih banyak daripada model lainnya. Kedua model memiliki biaya yang sama untuk token
00:11:57tersebut, sehingga menulis lebih banyaklah yang meningkatkan biaya Fable. Penggunaan alat juga menambah jumlah penggunaan token tersebut,
00:12:03karena model menentukan alat yang akan digunakan lalu membaca hasilnya sebelum melanjutkan pekerjaan. Di seluruh
00:12:09enam pengujian, agen utama Fable menggunakan alatnya sebanyak 443 kali, sedangkan Astra sebanyak 287 kali, sehingga hal itu turut menambah
00:12:17biaya. Untuk biaya, Astra meraih skor 80 dari 100, sementara Fable 66. Terkait kecepatan, Astra juga
00:12:23unggul dengan 70 dibandingkan Fable yang mendapat 67. Tugas jangka panjang membutuhkan waktu sekitar 62 menit secara total untuk Astra,
00:12:30dibandingkan 73 menit untuk Fable. Jadi, berdasarkan skor biaya, kecepatan, dan efisiensi alat,
00:12:35Astra unggul dari Fable. Metrik berikutnya yang kami ukur adalah kemampuan mengikuti instruksi,
00:12:40tempat kami memeriksa seberapa baik model mengikuti instruksi yang kami berikan saat membangun,
00:12:44dan apakah mereka terus mengikutinya seiring berjalannya pekerjaan. Saat kami menjalankan Fable pada sebuah proyek,
00:12:49model tersebut awalnya menambahkan pesan penulisan bersama yang menyatakan bahwa Claude membantu menulis kode,
00:12:53meskipun instruksi kami secara tegas melarangnya. Model itu juga mengabaikan aturan tentang cara membuat atau mengubah file.
00:12:58Kami menyuruhnya menggunakan alat pengeditan file milik Claude sendiri, sehingga perubahan tersebut terlacak
00:13:04dan mudah dibatalkan, tetapi Fable justru membuat dua file dengan menjalankan perintah. Untuk kemampuan mengikuti instruksi,
00:13:09Astra meraih skor 96 dari 100, sedangkan Fable 88. Jadi, dalam hal mengikuti instruksi,
00:13:16Astra unggul dalam pengujian ini. Metrik berikutnya yang kami ukur adalah kualitas tinjauan, saat kami memberikan
00:13:21proyek berisi masalah kepada model dan meminta mereka menemukan masalah tersebut. Pertama-tama, kami memberikan kode yang sama
00:13:27untuk ditinjau, dengan empat masalah yang sengaja dimasukkan, sehingga kami tahu apa yang harus mereka temukan. Fable
00:13:33menemukan keempatnya, dan juga menemukan lima masalah tambahan yang tidak kami masukkan, yang kemudian
00:13:37diperiksa dan dikonfirmasi. Astra menemukan dua dari empat masalah yang kami masukkan, tetapi model itu tetap mengatakan bahwa tinjauan
00:13:42sudah selesai. Kami juga menyertakan tiga bagian yang tampak mencurigakan, padahal sebenarnya sudah benar, karena
00:13:47kami ingin melihat apakah model akan melaporkan masalah palsu. Tidak satupun dari mereka menganggapnya sebagai bug, jadi
00:13:52perbedaannya terletak pada seberapa banyak yang ditemukan, dan Fable memberikan tinjauan yang lebih menyeluruh,
00:13:57tetapi ketika diuji pada proyek yang lebih besar dengan sembilan masalah terkonfirmasi, Astra memperbaiki lima, sementara Fable
00:14:03hanya menemukan dan memperbaiki empat. Jadi Astra menyelesaikan perbaikan lebih banyak, meskipun keduanya sama-sama menyisakan beberapa masalah
00:14:08yang belum diperbaiki. Untuk kualitas tinjauan, yang mencakup perbaikan tersebut dan cara model memeriksa pekerjaan lainnya,
00:14:13Fable meraih skor 84 dibandingkan Astra yang 78. Jadi Fable unggul pada skor tinjauan keseluruhan,
00:14:19karena Fable memberikan tinjauan yang secara keseluruhan lebih kuat. Berdasarkan hasil ini, Astra adalah pemenang yang jelas di
00:14:25beberapa kategori yang kami uji, tetapi bukan berarti Fable model yang buruk, karena Fable memang berkinerja baik
00:14:30di berbagai tugas, dan tidak tertinggal jauh di belakang Astra pada beberapa di antaranya. Jadi Anda hanya perlu memilih model
00:14:35berdasarkan tugas yang Anda berikan. Sekarang, untuk mendorong kedua model ini ke kemampuan maksimalnya, ada
00:14:40praktik tertentu yang harus Anda ikuti. Kami menggunakan banyak di antaranya dalam pengujian kami, dan jika Anda ingin mengaksesnya
00:14:45juga, Anda bisa mendapatkannya di AI Labs Pro, yaitu komunitas kami. Jadi, jika Anda merasakan manfaat dari apa yang
00:14:51kami lakukan dan ingin mendukung saluran ini, inilah cara terbaik untuk melakukannya. Tautan ada di deskripsi.
00:14:56Demikian akhir video ini. Jika Anda ingin mendukung saluran ini dan membantu kami terus membuat
00:15:01video seperti ini, Anda dapat melakukannya menggunakan tombol Super Thanks di bawah. Seperti biasa,
00:15:05Terima kasih sudah menonton dan sampai jumpa di video berikutnya.

핵심 요약

Fable 5.1 unggul dalam kualitas kode, interaktivitas, dan tinjauan menyeluruh, sedangkan GPT-6 Astra menang dalam efisiensi biaya, kecepatan, dan kepatuhan terhadap instruksi.

하이라이트

  • Fable 5.1 dan GPT-6 Astra dirilis hanya berselang beberapa hari dengan harga yang sama yaitu $10 per juta token masukan dan $50 per juta token keluaran.

  • Skor kualitas keseluruhan Fable mencapai 88, sedangkan Astra memperoleh 84 karena Astra membangun fitur yang lebih lengkap dan mudah diubah.

  • Astra menyelesaikan tugas jangka panjang lebih efisien dengan total biaya $27,69, sekitar 44% lebih rendah dibandingkan Fable yang menghabiskan $49,18.

  • Fable mencetak skor 94 untuk interaksi pada pengujian desain halaman landas, mengungguli Astra yang meraih skor 85.

  • Astra unggul dalam kemampuan mengikuti instruksi dengan skor 96 dari 100, sementara Fable memperoleh skor 88.

  • Fable menemukan keempat masalah yang sengaja dimasukkan dalam uji kualitas tinjauan kode serta lima masalah tambahan.

타임라인

Perbandingan Model dan Detail Penetapan Harga

  • Fable 5.1 dan GPT-6 Astra dirilis berurutan pada awal September dengan skor tolok ukur yang sangat tinggi.
  • Kedua model dibanderol dengan harga yang sama yaitu $10 per juta token masukan dan $50 per juta token keluaran.
  • Fable memotong harga pembacaan tembolok sebesar 75% untuk mengurangi biaya penggunaan ulang percakapan.
  • Astra terintegrasi langsung dalam batas kode ChatGPT+ dan Pro tanpa batasan model terpisah.

Pengujian dilakukan menggunakan proyek perangkat lunak nyata dengan model penilai GPT-5.6 yang tidak mengetahui asal hasil kode. Fable 5.1 dirilis oleh Anthropic pada 1 September, disusul oleh GPT-6 Astra dari OpenAI beberapa hari kemudian. Fable menawarkan jendela konteks satu juta token di Claude Code, sementara Astra menggunakan jendela konteks 272.000 token secara default di Codex. Perbedaan sistem keamanan membuat Astra langsung menolak tugas yang melanggar aturan, sedangkan Claude Code beralih ke model yang lebih lemah tanpa sepengetahuan pengguna.

Pengujian Kualitas dan Integrasi Ekosistem

  • Fable mencetak skor kualitas keseluruhan 88, mengungguli Astra yang memperoleh 84 dalam pembuatan kode.
  • Fable mencetak skor 90 untuk kerapian struktur kode, sementara Astra memperoleh 78.
  • SDK Zapier memberikan akses terprogram ke lebih dari 9000 aplikasi langsung di dalam lingkungan coding.

Fable memisahkan bagian aplikasi dengan lebih jelas sehingga lebih mudah dipahami saat diubah kembali. Fable juga mencetak skor lebih tinggi dalam jumlah pekerjaan yang diselesaikan karena memperbaiki masalah di luar permintaan awal. Di sisi lain, Astra unggul dalam pemeriksaan aplikasi yang lebih teliti untuk menghindari kesalahan operasional. Integrasi Zapier memungkinkan pembuatan alur otomatis ke Gmail, Notion, dan Slack tanpa harus merangkai kode otentikasi secara manual.

Evaluasi Tugas Jangka Panjang dan Desain

  • Astra menyelesaikan tugas jangka panjang dengan skor 93 dari 100, mengungguli Fable yang memperoleh 90.
  • Fable meraih skor 94 untuk interaksi desain, melampaui Astra yang mendapatkan 85.
  • Astra menggunakan model pembuatan gambar bawaan untuk menghasilkan aset visual dalam pengujian desain.

Astra bekerja selama 32 menit dalam tugas jangka panjang, sedangkan Fable memerlukan waktu 44 menit. Astra memperhatikan aspek fungsional sekaligus visual aplikasi secara bersamaan. Dalam pengujian desain halaman landas untuk bisnis fon, game horor, festival musik, dan game parkir, Fable unggul dalam animasi dan elemen interaktif. Sementara itu, Astra menghadirkan tata letak yang lebih luas dengan hierarki teks yang lebih mudah dibaca.

Efisiensi, Biaya, dan Kualitas Tinjauan Kode

  • Total biaya pengujian Astra mencapai $27,69, lebih rendah 44% dibandingkan Fable yang menghabiskan $49,18.
  • Astra unggul dalam kepatuhan instruksi dengan skor 96, sementara Fable memperoleh 88.
  • Fable menemukan seluruh masalah yang disengaja dalam uji tinjauan kode beserta lima masalah tambahan.

Biaya Fable lebih tinggi karena menghasilkan token keluaran hampir tiga kali lipat lebih banyak dan menggunakan alat sebanyak 443 kali dibandingkan Astra yang menggunakan alat 287 kali. Astra juga unggul dalam kecepatan eksekusi dan konsistensi dalam mengikuti instruksi pembangunan. Dalam pengujian tinjauan kode, Fable memberikan analisis yang jauh lebih menyeluruh dengan mendeteksi bug tersembunyi yang dilewati oleh Astra.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기