GPT 6 Astra Telah Hadir (Dan Lebih Baik dari Fable 5.1?)

CChase AI
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Jadi tepat setelah Anthropic merilis Fable 5.1, OpenAI membalas dan merilis GPT-6 Astra.
00:00:07Sekarang mari kita mulai dengan melihat beberapa tolok ukur untuk GPT-6 Astra. Dan apresiasi kepada
00:00:10OpenAI karena memberi kita lebih banyak tolok ukur untuk dilihat daripada yang ditunjukkan Anthropic dengan Fable
00:00:145.1. Mengenai penggunaan komputer, model ini hampir mendominasi segalanya. Kita bahkan tidak memiliki banyak data
00:00:19di sini dalam hal Fable 5.1. Saat kita melihat tolok ukur profesional, seperti BenchCAD
00:00:24dan browse comp, sekali lagi GPT-6 berkinerja luar biasa. Satu-satunya tempat di mana model ini tidak menang adalah pada
00:00:31indeks kecerdasan artificial analysis, di mana ia mencetak skor 61,2 dibandingkan dengan Fable 5.1 yang meraih 65,7.
00:00:38Berikutnya, kita beralih ke pemrograman. Dan sekali lagi, ceritanya kurang lebih sama. Model ini mengalahkan Fable 5.1 atau
00:00:43bersaing sangat ketat. Jika kita melihat secara khusus pada TerminalBench 4.0, kita melihat lonjakan besar dari GPT 5.6 solo
00:00:49dari 37,3 menjadi 57,7. Dan jika kita melihat DeepSuite, yang mungkin merupakan tolok ukur pemrograman
00:00:55favorit saya, yang benar-benar berfokus pada tugas agen jangka panjang, skornya mencapai 74,1%, yang sekali lagi,
00:01:02lebih baik daripada hal lain di luar sana. GPT-6 juga melibas tolok ukur akademis serta bidang
00:01:08sains dan kesehatan. Dan ketika kita melihat tolok ukur keamanan siber, sekali lagi, saya benar-benar memperhatikan
00:01:13versi 5.6 solo di sini. Lonjakan besar, dari 78,5 menjadi 100%. Dari 55,9 hingga 88,5% pada exploit
00:01:22bench, bahkan naik hingga 39%. Jadi ini adalah perubahan drastis dari model seri lima. Dan dalam hal
00:01:27konteks panjang, GPT-6 juga sangat luar biasa. Skor 100% saat melakukan pengujian delapan jarum dari 256 hingga 512k
00:01:34token. Jadi pada dasarnya seperempat hingga jendela konteks yang sepenuhnya penuh. Dan ketika jendela itu memiliki 512.000
00:01:41hingga satu juta token, skornya tetap mencapai 96,3%. Jadi jika Anda adalah seseorang yang selalu memasukkan banyak
00:01:46konteks ke model AI pilihan Anda, GPT-6 akan bekerja dengan sangat baik dalam skenario tersebut. Namun skor tolok ukur
00:01:51mentah saja tidak cukup. Kita perlu tahu berapa biaya untuk benar-benar mencapai skor ini
00:01:55karena Astra mungkin memiliki skor terbaik di dunia, tetapi jika biayanya 10 kali lipat dari yang lain, apa gunanya?
00:01:59Nah, untungnya bagi model GPT, secara historis, mereka sangat efisien dalam penggunaan token. Jadi ketika kita melihat
00:02:04di sini pada skor terminal bench 4.0, kita melihat hal itu terbukti. Jadi GPT-6 Astra di sini dengan tanda bintang,
00:02:11hal pertama yang ingin saya catat adalah bahwa seperti banyak model ini, kita melihat semacam penurunan efisiensi
00:02:16saat kita bergerak lebih tinggi dalam rantai tingkat upaya. Jadi ketika saya beralih dari rendah ke sedang ke tinggi, saya terus mendapatkan
00:02:23skor yang lebih baik dengan peningkatan biaya yang agak linier. Tetapi saat saya beralih dari tinggi ke ekstra tinggi, lalu maks,
00:02:30pada kenyataannya saya justru mendapatkan skor yang lebih buruk dengan biaya yang lebih tinggi. Jadi pada tingkat tinggi dengan harga $7,21, saya mendapatkan
00:02:39akurasi 57,9%. Ketika saya membandingkan ini dengan Fable 5.1 di sini, dan saya berada di tingkat tinggi, yah, saya mendapatkan akurasi 49,4%
00:02:49dengan harga $10,50. Jadi lebih mahal, dan skornya tidak begitu bagus. Sekarang, Fable memang mencetak skor cukup tinggi
00:02:57ketika saya menempatkannya sepenuhnya ke upaya maksimal di angka 55,8, tetapi biayanya mencapai $19,50. Jadi untuk skor yang sama,
00:03:06sekali lagi, sekitar 55%, biayanya hampir $20 untuk Fable 5. Dan untuk GPT-6 Astra, harganya $7,20. Jadi jauh lebih murah
00:03:16untuk akurasi yang pada dasarnya sama. Dan ketika kita melihat Frontier Code 1.1, kita melihat pola yang serupa,
00:03:22di mana pada tingkat atas, kita mendapatkan skor yang serupa. Ketika kita melihat GPT-6 versus Fable 5.1
00:03:29atau Fable 5. Dalam kasus ini, Fable 5 sebenarnya mencetak skor lebih tinggi di sini. Tetapi biayanya jauh lebih mahal
00:03:34untuk menjalankan model cloud ini karena efisiensi token pada GPT-6 Astra. Sekarang, ada beberapa fungsi
00:03:39di luar tolok ukur yang disorot oleh OpenAI terkait GPT-6. Yang pertama adalah mereka menyebutnya
00:03:43sebagai model penggunaan komputer terbaik di dunia. Sekarang, ada beberapa tolok ukur yang menguji hal semacam ini,
00:03:48seperti ujian akhir agen. Dan seperti yang telah kita lihat pada tolok ukur lain, apa yang ditunjukkan kepada kita?
00:03:52Hal itu menunjukkan Astra mendominasi, baik dalam hal akurasi maupun biaya API, yang tidak pernah bisa
00:03:57diabaikan begitu saja. Namun yang boleh dibilang bahkan lebih penting daripada akurasi adalah kecepatan. Codex sebenarnya memiliki
00:04:01kemampuan penggunaan komputer yang sangat baik, terutama jika Anda menggunakannya bersamaan dengan mode suara. Dan Astra
00:04:06diklaim 1,9 kali lebih cepat daripada GPT-5.6, yang sangat bagus jika Anda adalah seseorang yang sering menggunakannya
00:04:11selama sebulan terakhir ini. Hal lain yang mereka sebutkan adalah kepatuhan terhadap templat. Jadi jika Anda
00:04:15memberikannya semacam templat, katakanlah, dek seluncuran presentasi, seperti yang Anda lihat di sini di sebelah kiri, dan Anda memintanya untuk
00:04:20membuat dek presentasi lain dengan gaya yang sama mengenai topik yang berbeda, nah, Anda akan mendapatkan
00:04:25sesuatu seperti yang kita lihat di sebelah kanan, sesuatu yang sangat, sangat patuh pada gaya tersebut. Jadi jika Anda memiliki
00:04:31semacam templat yang Anda gunakan berulang kali, baik untuk dek presentasi maupun situs web, anggap saja itu sebagai
00:04:35sistem desain untuk benar-benar segala jenis keluaran, GPT-6 sangat bagus untuk hal itu. Anda dapat melihatnya lagi di sini dengan
00:04:41dokumen Excel dan penataan gaya dokumen secara umum. Di sinilah pada dasarnya gambar referensi yang diberikan padanya.
00:04:46Inilah yang biasa kita dapatkan sebelumnya, dan inilah yang kita dapatkan di sebelah kanan setelahnya dengan melihat
00:04:51gambar referensi tersebut. Hal menarik lainnya adalah baris di sini di mana mereka membahas GPT-6 Astra
00:04:55yang menghadirkan penilaian visual yang lebih kuat pada situs web, permainan, aplikasi, dan hasil rendernya, alias mereka
00:05:00mengatakan bahwa GPT-6 memiliki selera yang lebih baik. Dan Anda mungkin telah mendengarnya berulang kali bahwa AI tidak memiliki selera.
00:05:05Nah, mereka mengatakan bahwa GPT-6 memilikinya. Sekarang, jujur saja, akan selalu ada masalah dalam hal
00:05:10AI dan selera, karena jika Anda memberikan prompt yang buruk, model tersebut akan mengalami semacam regresi
00:05:15ke rata-rata, apa pun yang terjadi. Dan apa pun arti rata-rata tersebut, orang-orang akan mengaitkannya dengan sampah AI,
00:05:20tidak peduli seberapa bagus hasilnya sebenarnya. Tetapi mereka menunjukkan beberapa contoh di sini yang pada dasarnya seperti penelusuran
00:05:25Unreal Engine yang mereka lakukan, pemodelan Blender, serta beberapa gambar diam di sini. Sekarang, hal yang sangat keren
00:05:31yang mereka tambahkan dengan Astra adalah perubahan pada cara kerjanya dalam pemadatan otomatis saat jendela konteks penuh. Sekarang,
00:05:37biasanya ketika Anda mengisi jendela konteks Anda, sistem akan melakukan pemadatan otomatis, membuat semacam ringkasan
00:05:41dari semua yang telah Anda bicarakan di sesi terakhir itu, lalu memulai sesi baru.
00:05:46Nah, hal itu menimbulkan masalah, terkadang ada detail yang tertinggal. Tetapi sekarang, Astra menyimpan catatan di seluruh jendela konteks,
00:05:52daripada hanya memiliki satu ringkasan tunggal. Jadi alih-alih satu dokumen, model ini pada dasarnya memiliki banyak
00:05:57catatan tempel berbeda tentang apa yang dianggapnya penting. Dan model itu dapat merujuk catatan tersebut kapan saja
00:06:01dibandingkan hanya berupa hasil sekali jalan seperti, ini ringkasannya, semoga ini mencakup semua yang kita butuhkan.
00:06:06Dan bahkan, jendela konteks sebelumnya tetap dapat dicari. Jadi sekali lagi, tidak seperti ini adalah
00:06:12satu-satunya dokumen yang kita miliki dalam hal ringkasan. Dan jika tidak ada di sini, kita dalam masalah besar. Hal itu tidak lagi berlaku
00:06:16sekarang. Nah, ini adalah fitur eksperimental. Jadi Anda harus mengaktifkannya di konfigurasi codex,
00:06:20tetapi fitur ini akan menjadi bawaan dalam beberapa minggu. Sekarang, dalam hal keamanan siber,
00:06:24Astra memperlakukannya mirip dengan cara Anthropic memperlakukan Fable, di mana mereka menganggap model ini sangat
00:06:28kuat sehingga dapat membuat banyak eksploitasi. Jadi jika model berpikir Anda mencoba membuat semacam
00:06:33eksploitasi, model itu tidak akan mengizinkan Anda melakukannya. Model itu tidak akan patuh, tidak akan menjawab
00:06:37masalah Anda. Satu lagi peningkatan besar pada GPT-6 dibandingkan dengan seri 5 adalah tingkat halusinasi yang lebih rendah
00:06:42GPT-5.6 Sol dan model-model seri 5.6 secara umum sebenarnya cukup sering berhalusinasi jika dibandingkan
00:06:48dengan model perintis lainnya. Namun secara head-to-head, kita melihat tingkat halusinasi telah turun dari sekitar 9,4%
00:06:54menjadi hanya 2%. Sekarang, apakah Astra sudah tersedia? Nah,
00:07:01model ini terbuka untuk sekumpulan organisasi yang terbatas. Dan dalam beberapa hari mendatang, model ini akan dibuka untuk pada dasarnya
00:07:06semua orang. Untuk API, layanan ini tersedia bagi para pengembang. Dan mengenai harga, sekali lagi,
00:07:11sesuai dengan harga Fable. Kita melihat harga $10 per juta token input dan $50 per juta token output.
00:07:17Jadi berdasarkan angka-angkanya, OpenAI memberi kita model yang sangat solid yang dapat bersaing sepenuhnya
00:07:22dengan yang terbaik dari apa yang dimiliki Anthropic. Dan mereka melakukannya dengan harga yang lebih murah. Jadi
00:07:26saya sangat bersemangat untuk mencoba ini. Saya pikir persaingan di antara pemain terbesar di sini
00:07:30pada akhirnya sangat bagus bagi kita, pengguna akhir.

핵심 요약

GPT-6 Astra mengungguli atau bersaing ketat dengan Fable 5.1 dalam berbagai tolok ukur pemrograman dan penggunaan komputer dengan efisiensi token yang lebih tinggi.

하이라이트

  • GPT-6 Astra mencetak skor 74,1% pada tolok ukur DeepSuite untuk tugas agen jangka panjang.

  • Tingkat halusinasi pada GPT-6 Astra turun menjadi 2% dibandingkan dengan 9,4% pada seri sebelumnya.

  • Kecepatan penggunaan komputer pada GPT-6 Astra meningkat 1,9 kali lipat lebih cepat daripada GPT-5.6.

  • GPT-6 Astra mencetak skor 100% pada pengujian delapan jarum untuk jendela konteks 256k hingga 512k token.

  • Biaya API GPT-6 Astra berada pada kisaran $10 per juta token input dan $50 per juta token output.

타임라인

Tolok Ukur Performa dan Pemrograman

  • GPT-6 mendominasi sebagian besar tolok ukur penggunaan komputer.
  • TerminalBench 4.0 pada GPT-6 melonjak dari 37,3 menjadi 57,7.
  • Skor jendela konteks mencapai 96,3% pada kapasitas 512.000 hingga satu juta token.

OpenAI merilis GPT-6 Astra sebagai respons langsung terhadap Fable 5.1 dari Anthropic. Model ini menunjukkan performa tinggi dalam tolok ukur profesional seperti BenchCAD dan browse comp. Di bidang pemrograman, model ini mencatat skor 74,1% pada DeepSuite. Selain itu, kemampuan konteks panjang mencatat skor 100% pada pengujian delapan jarum hingga 512k token.

Analisis Biaya dan Efisiensi Token

  • Peningkatan tingkat upaya tinggi pada GPT-6 memberikan akurasi 57,9% dengan harga $7,21.
  • Fable 5.1 membutuhkan biaya hingga $19,50 untuk akurasi sekitar 55%.
  • GPT-6 Astra menawarkan efisiensi token yang lebih tinggi daripada model pesaing.

Evaluasi biaya menunjukkan bahwa GPT-6 Astra memberikan hasil yang lebih ekonomis dibandingkan Fable 5.1. Peningkatan tingkat upaya dari rendah ke tinggi memberikan kenaikan skor yang linier, meskipun tingkat maksimal terkadang menurunkan akurasi. Secara keseluruhan, biaya operasional GPT-6 jauh lebih murah untuk tingkat akurasi yang setara.

Fitur Fungsional dan Peningkatan Sistem

  • GPT-6 Astra diklaim 1,9 kali lebih cepat daripada GPT-5.6 dalam penggunaan komputer.
  • Fitur pemadatan otomatis yang baru menyimpan banyak catatan di seluruh jendela konteks.
  • Tingkat halusinasi turun secara signifikan dari 9,4% menjadi 2%.

Model ini memperkenalkan peningkatan dalam kepatuhan templat untuk dokumen dan presentasi. Sistem penyimpanan konteks baru tidak lagi bergantung pada satu ringkasan tunggal, melainkan membuat banyak catatan yang dapat dicari kembali. Selain itu, tingkat halusinasi berhasil ditekan hingga 2%, dan model ini mulai disebar ke pengembang melalui API.

커뮤니티 글

모든 글 보기