스크립트
00:00:00Jadi tepat setelah Anthropic merilis Fable 5.1, OpenAI membalas dan merilis GPT-6 Astra.
00:00:07Sekarang mari kita mulai dengan melihat beberapa tolok ukur untuk GPT-6 Astra. Dan apresiasi kepada
00:00:10OpenAI karena memberi kita lebih banyak tolok ukur untuk dilihat daripada yang ditunjukkan Anthropic dengan Fable
00:00:145.1. Mengenai penggunaan komputer, model ini hampir mendominasi segalanya. Kita bahkan tidak memiliki banyak data
00:00:19di sini dalam hal Fable 5.1. Saat kita melihat tolok ukur profesional, seperti BenchCAD
00:00:24dan browse comp, sekali lagi GPT-6 berkinerja luar biasa. Satu-satunya tempat di mana model ini tidak menang adalah pada
00:00:31indeks kecerdasan artificial analysis, di mana ia mencetak skor 61,2 dibandingkan dengan Fable 5.1 yang meraih 65,7.
00:00:38Berikutnya, kita beralih ke pemrograman. Dan sekali lagi, ceritanya kurang lebih sama. Model ini mengalahkan Fable 5.1 atau
00:00:43bersaing sangat ketat. Jika kita melihat secara khusus pada TerminalBench 4.0, kita melihat lonjakan besar dari GPT 5.6 solo
00:00:49dari 37,3 menjadi 57,7. Dan jika kita melihat DeepSuite, yang mungkin merupakan tolok ukur pemrograman
00:00:55favorit saya, yang benar-benar berfokus pada tugas agen jangka panjang, skornya mencapai 74,1%, yang sekali lagi,
00:01:02lebih baik daripada hal lain di luar sana. GPT-6 juga melibas tolok ukur akademis serta bidang
00:01:08sains dan kesehatan. Dan ketika kita melihat tolok ukur keamanan siber, sekali lagi, saya benar-benar memperhatikan
00:01:13versi 5.6 solo di sini. Lonjakan besar, dari 78,5 menjadi 100%. Dari 55,9 hingga 88,5% pada exploit
00:01:22bench, bahkan naik hingga 39%. Jadi ini adalah perubahan drastis dari model seri lima. Dan dalam hal
00:01:27konteks panjang, GPT-6 juga sangat luar biasa. Skor 100% saat melakukan pengujian delapan jarum dari 256 hingga 512k
00:01:34token. Jadi pada dasarnya seperempat hingga jendela konteks yang sepenuhnya penuh. Dan ketika jendela itu memiliki 512.000
00:01:41hingga satu juta token, skornya tetap mencapai 96,3%. Jadi jika Anda adalah seseorang yang selalu memasukkan banyak
00:01:46konteks ke model AI pilihan Anda, GPT-6 akan bekerja dengan sangat baik dalam skenario tersebut. Namun skor tolok ukur
00:01:51mentah saja tidak cukup. Kita perlu tahu berapa biaya untuk benar-benar mencapai skor ini
00:01:55karena Astra mungkin memiliki skor terbaik di dunia, tetapi jika biayanya 10 kali lipat dari yang lain, apa gunanya?
00:01:59Nah, untungnya bagi model GPT, secara historis, mereka sangat efisien dalam penggunaan token. Jadi ketika kita melihat
00:02:04di sini pada skor terminal bench 4.0, kita melihat hal itu terbukti. Jadi GPT-6 Astra di sini dengan tanda bintang,
00:02:11hal pertama yang ingin saya catat adalah bahwa seperti banyak model ini, kita melihat semacam penurunan efisiensi
00:02:16saat kita bergerak lebih tinggi dalam rantai tingkat upaya. Jadi ketika saya beralih dari rendah ke sedang ke tinggi, saya terus mendapatkan
00:02:23skor yang lebih baik dengan peningkatan biaya yang agak linier. Tetapi saat saya beralih dari tinggi ke ekstra tinggi, lalu maks,
00:02:30pada kenyataannya saya justru mendapatkan skor yang lebih buruk dengan biaya yang lebih tinggi. Jadi pada tingkat tinggi dengan harga $7,21, saya mendapatkan
00:02:39akurasi 57,9%. Ketika saya membandingkan ini dengan Fable 5.1 di sini, dan saya berada di tingkat tinggi, yah, saya mendapatkan akurasi 49,4%
00:02:49dengan harga $10,50. Jadi lebih mahal, dan skornya tidak begitu bagus. Sekarang, Fable memang mencetak skor cukup tinggi
00:02:57ketika saya menempatkannya sepenuhnya ke upaya maksimal di angka 55,8, tetapi biayanya mencapai $19,50. Jadi untuk skor yang sama,
00:03:06sekali lagi, sekitar 55%, biayanya hampir $20 untuk Fable 5. Dan untuk GPT-6 Astra, harganya $7,20. Jadi jauh lebih murah
00:03:16untuk akurasi yang pada dasarnya sama. Dan ketika kita melihat Frontier Code 1.1, kita melihat pola yang serupa,
00:03:22di mana pada tingkat atas, kita mendapatkan skor yang serupa. Ketika kita melihat GPT-6 versus Fable 5.1
00:03:29atau Fable 5. Dalam kasus ini, Fable 5 sebenarnya mencetak skor lebih tinggi di sini. Tetapi biayanya jauh lebih mahal
00:03:34untuk menjalankan model cloud ini karena efisiensi token pada GPT-6 Astra. Sekarang, ada beberapa fungsi
00:03:39di luar tolok ukur yang disorot oleh OpenAI terkait GPT-6. Yang pertama adalah mereka menyebutnya
00:03:43sebagai model penggunaan komputer terbaik di dunia. Sekarang, ada beberapa tolok ukur yang menguji hal semacam ini,
00:03:48seperti ujian akhir agen. Dan seperti yang telah kita lihat pada tolok ukur lain, apa yang ditunjukkan kepada kita?
00:03:52Hal itu menunjukkan Astra mendominasi, baik dalam hal akurasi maupun biaya API, yang tidak pernah bisa
00:03:57diabaikan begitu saja. Namun yang boleh dibilang bahkan lebih penting daripada akurasi adalah kecepatan. Codex sebenarnya memiliki
00:04:01kemampuan penggunaan komputer yang sangat baik, terutama jika Anda menggunakannya bersamaan dengan mode suara. Dan Astra
00:04:06diklaim 1,9 kali lebih cepat daripada GPT-5.6, yang sangat bagus jika Anda adalah seseorang yang sering menggunakannya
00:04:11selama sebulan terakhir ini. Hal lain yang mereka sebutkan adalah kepatuhan terhadap templat. Jadi jika Anda
00:04:15memberikannya semacam templat, katakanlah, dek seluncuran presentasi, seperti yang Anda lihat di sini di sebelah kiri, dan Anda memintanya untuk
00:04:20membuat dek presentasi lain dengan gaya yang sama mengenai topik yang berbeda, nah, Anda akan mendapatkan
00:04:25sesuatu seperti yang kita lihat di sebelah kanan, sesuatu yang sangat, sangat patuh pada gaya tersebut. Jadi jika Anda memiliki
00:04:31semacam templat yang Anda gunakan berulang kali, baik untuk dek presentasi maupun situs web, anggap saja itu sebagai
00:04:35sistem desain untuk benar-benar segala jenis keluaran, GPT-6 sangat bagus untuk hal itu. Anda dapat melihatnya lagi di sini dengan
00:04:41dokumen Excel dan penataan gaya dokumen secara umum. Di sinilah pada dasarnya gambar referensi yang diberikan padanya.
00:04:46Inilah yang biasa kita dapatkan sebelumnya, dan inilah yang kita dapatkan di sebelah kanan setelahnya dengan melihat
00:04:51gambar referensi tersebut. Hal menarik lainnya adalah baris di sini di mana mereka membahas GPT-6 Astra
00:04:55yang menghadirkan penilaian visual yang lebih kuat pada situs web, permainan, aplikasi, dan hasil rendernya, alias mereka
00:05:00mengatakan bahwa GPT-6 memiliki selera yang lebih baik. Dan Anda mungkin telah mendengarnya berulang kali bahwa AI tidak memiliki selera.
00:05:05Nah, mereka mengatakan bahwa GPT-6 memilikinya. Sekarang, jujur saja, akan selalu ada masalah dalam hal
00:05:10AI dan selera, karena jika Anda memberikan prompt yang buruk, model tersebut akan mengalami semacam regresi
00:05:15ke rata-rata, apa pun yang terjadi. Dan apa pun arti rata-rata tersebut, orang-orang akan mengaitkannya dengan sampah AI,
00:05:20tidak peduli seberapa bagus hasilnya sebenarnya. Tetapi mereka menunjukkan beberapa contoh di sini yang pada dasarnya seperti penelusuran
00:05:25Unreal Engine yang mereka lakukan, pemodelan Blender, serta beberapa gambar diam di sini. Sekarang, hal yang sangat keren
00:05:31yang mereka tambahkan dengan Astra adalah perubahan pada cara kerjanya dalam pemadatan otomatis saat jendela konteks penuh. Sekarang,
00:05:37biasanya ketika Anda mengisi jendela konteks Anda, sistem akan melakukan pemadatan otomatis, membuat semacam ringkasan
00:05:41dari semua yang telah Anda bicarakan di sesi terakhir itu, lalu memulai sesi baru.
00:05:46Nah, hal itu menimbulkan masalah, terkadang ada detail yang tertinggal. Tetapi sekarang, Astra menyimpan catatan di seluruh jendela konteks,
00:05:52daripada hanya memiliki satu ringkasan tunggal. Jadi alih-alih satu dokumen, model ini pada dasarnya memiliki banyak
00:05:57catatan tempel berbeda tentang apa yang dianggapnya penting. Dan model itu dapat merujuk catatan tersebut kapan saja
00:06:01dibandingkan hanya berupa hasil sekali jalan seperti, ini ringkasannya, semoga ini mencakup semua yang kita butuhkan.
00:06:06Dan bahkan, jendela konteks sebelumnya tetap dapat dicari. Jadi sekali lagi, tidak seperti ini adalah
00:06:12satu-satunya dokumen yang kita miliki dalam hal ringkasan. Dan jika tidak ada di sini, kita dalam masalah besar. Hal itu tidak lagi berlaku
00:06:16sekarang. Nah, ini adalah fitur eksperimental. Jadi Anda harus mengaktifkannya di konfigurasi codex,
00:06:20tetapi fitur ini akan menjadi bawaan dalam beberapa minggu. Sekarang, dalam hal keamanan siber,
00:06:24Astra memperlakukannya mirip dengan cara Anthropic memperlakukan Fable, di mana mereka menganggap model ini sangat
00:06:28kuat sehingga dapat membuat banyak eksploitasi. Jadi jika model berpikir Anda mencoba membuat semacam
00:06:33eksploitasi, model itu tidak akan mengizinkan Anda melakukannya. Model itu tidak akan patuh, tidak akan menjawab
00:06:37masalah Anda. Satu lagi peningkatan besar pada GPT-6 dibandingkan dengan seri 5 adalah tingkat halusinasi yang lebih rendah
00:06:42GPT-5.6 Sol dan model-model seri 5.6 secara umum sebenarnya cukup sering berhalusinasi jika dibandingkan
00:06:48dengan model perintis lainnya. Namun secara head-to-head, kita melihat tingkat halusinasi telah turun dari sekitar 9,4%
00:06:54menjadi hanya 2%. Sekarang, apakah Astra sudah tersedia? Nah,
00:07:01model ini terbuka untuk sekumpulan organisasi yang terbatas. Dan dalam beberapa hari mendatang, model ini akan dibuka untuk pada dasarnya
00:07:06semua orang. Untuk API, layanan ini tersedia bagi para pengembang. Dan mengenai harga, sekali lagi,
00:07:11sesuai dengan harga Fable. Kita melihat harga $10 per juta token input dan $50 per juta token output.
00:07:17Jadi berdasarkan angka-angkanya, OpenAI memberi kita model yang sangat solid yang dapat bersaing sepenuhnya
00:07:22dengan yang terbaik dari apa yang dimiliki Anthropic. Dan mereka melakukannya dengan harga yang lebih murah. Jadi
00:07:26saya sangat bersemangat untuk mencoba ini. Saya pikir persaingan di antara pemain terbesar di sini
00:07:30pada akhirnya sangat bagus bagi kita, pengguna akhir.