스크립트
00:00:00Сразу после выпуска Anthropic модели Fable 5.1 компания OpenAI наносит ответный удар и выпускает GPT-6 Astra.
00:00:07Давайте начнем с рассмотрения некоторых бенчмарков GPT-6 Astra. И выразим благодарность
00:00:10OpenAI за предоставление гораздо большего количества бенчмарков для анализа, чем Anthropic показала с Fable
00:00:145.1. Что касается работы с компьютером, модель практически доминирует. У нас даже нет особо много данных
00:00:19здесь по поводу Fable 5.1. Если посмотреть на профессиональные бенчмарки, такие как BenchCAD
00:00:24и browse comp, GPT-6 снова показывает потрясающие результаты. Единственное место, где она не побеждает, — это
00:00:31индекс интеллекта Artificial Analysis, где она набирает 61.2 по сравнению с 65.7 у Fable 5.1.
00:00:38Далее идут возможности программирования. И здесь картина примерно такая же: модель либо превосходит Fable 5.1, либо идет
00:00:43наравне. Если посмотреть конкретно на TerminalBench 4.0, мы видим огромный скачок от GPT 5.6 solo
00:00:49с 37.3 до 57.7. А если взглянуть на DeepSuite, который является, пожалуй, моим любимым бенчмарком
00:00:55для программирования, ориентированным на долгосрочные агентные задачи, она набирает 74.1%, что опять же
00:01:02лучше всего остального на рынке. GPT-6 также сокрушает академические бенчмарки, а также тесты в области науки и здравоохранения.
00:01:08А когда мы обращаемся к бенчмаркам кибербезопасности, я снова обращаю внимание на 5.6 solo.
00:01:13Огромные скачки: с 78.5 до 100%. С 55.9 аж до 88.5% на exploit bench и вплоть до 39%.
00:01:22Так что это качественный сдвиг по сравнению с моделями 5-й серии. И с точки зрения
00:01:27длинного контекста GPT-6 тоже превосходит всех. 100% результат в тесте с восемью иглами от 256 до 512 тыс.
00:01:34токенов. То есть по сути от четверти до полностью заполненного контекстного окна. И даже когда это окно увеличивается с 512 000
00:01:41токенов до миллиона, она все равно набирает 96.3%. Поэтому, если вы относитесь к тем, кто постоянно загружает кучу
00:01:46контекста в выбранную вами ИИ-модель, GPT-6 проявит себя в таких сценариях превосходно. Но
00:01:51только «сырых» результатов бенчмарков недостаточно. Нам нужно знать, во сколько обходится достижение этих показателей,
00:01:55потому что у Astra может быть лучший результат в мире, но если она стоит в 10 раз дороже остальных, в чем смысл?
00:01:59К счастью для моделей GPT, исторически они отличались высокой эффективностью использования токенов. Поэтому, когда мы смотрим
00:02:04здесь на результаты Terminal Bench 4.0, мы видим, что это подтверждается. У GPT-6 Astra здесь стоят звездочки,
00:02:11и первое, на что я хочу обратить внимание, это то, что, как и у многих подобных моделей, мы наблюдаем падение эффективности
00:02:16по мере продвижения вверх по цепочке уровней усилий. Когда я перехожу от низкого к среднему и высокому, я продолжаю получать
00:02:23лучшие результаты при относительно линейном росте затрат. Но когда я перехожу от высокого к сверхвысокому, а затем к максимальному,
00:02:30на самом деле я получаю худший результат при более высоких затратах. То есть при высоком уровне за $7.21 я получаю
00:02:39точность 57.9%. Когда я сравниваю это с Fable 5.1 прямо здесь на высоком уровне, я получаю точность 49.4%
00:02:49при цене $10.50. То есть дороже, а результат хуже. Конечно, Fable показывает довольно высокий результат,
00:02:57если выставить максимальные усилия — 55.8, но это обходится мне в $19.50. Таким образом, при том же результате
00:03:06около 55%, Fable 5 стоит почти $20, а GPT-6 Astra — $7.20. То есть она бесконечно дешевле
00:03:16при по сути той же точности. А если посмотреть на Frontier Code 1.1, мы увидим похожую тенденцию:
00:03:22на высоких уровнях мы получаем сопоставимые результаты. Если сравнить GPT-6 с Fable 5.1
00:03:29или Fable 5... в данном случае Fable 5 на самом деле набрала больше. Но запускать эти облачные модели
00:03:34гораздо дороже из-за эффективности токенов у GPT-6 Astra. Теперь давайте обсудим несколько функций
00:03:39помимо бенчмарков, которые OpenAI выделяет в GPT-6. Во-первых, они называют её
00:03:43лучшей в мире моделью для работы с компьютером. Существует несколько бенчмарков, проверяющих подобные
00:03:48вещи, например, агентский экзамен. И как мы видели на примере других тестов, что же они показывают?
00:03:52Они показывают, что Astra буквально всех превосходит как по точности, так и по стоимости API,
00:03:57которую нельзя сбрасывать со счетов. Но возможно, даже важнее точности является скорость. Codex на самом деле
00:04:01очень хорош в управлении компьютером, особенно если использовать его вместе с голосовым режимом. А Astra
00:04:06должна быть в 1.9 раза быстрее GPT-5.6, что здорово, если вы активно пользовались ею
00:04:11последний месяц или около того. Другая особенность, которую они отмечают, — это следование шаблонам. Если вы
00:04:15даете ей какой-нибудь шаблон, например, презентации, как вы видите здесь слева, и просите
00:04:20создать еще одну презентацию в том же стиле на другую тему, вы получаете
00:04:25результат, как на экране справа — нечто, что очень и очень точно следует стилю. Так что если у вас есть
00:04:31какие-то повторяющиеся шаблоны для презентаций или веб-сайтов (рассматривайте это как дизайн-систему
00:04:35практически для любого вывода), GPT-6 подходит для этого идеально. Это снова заметно здесь на примере
00:04:41документов Excel и общего оформления документов. Вот исходное изображение, которое ей дали.
00:04:46Вот что получалось раньше, а вот что мы видим справа после того, как она учла это эталонное изображение.
00:04:51Еще один интересный момент — это фраза о том, что GPT-6 Astra
00:04:55привносит более сильное визуальное суждение при создании веб-сайтов, игр и приложений, то есть они
00:05:00утверждают, что у GPT-6 лучший вкус. Вы наверняка не раз слышали, что у ИИ нет вкуса.
00:05:05Так вот, они заявляют, что у GPT-6 он есть. Будем честны, с ИИ всегда будут проблемы
00:05:10во вкусовом плане, потому что при плохом промпте неизбежно произойдет сближение со средним
00:05:15значением. И каким бы ни было это среднее, люди будут ассоциировать его с цифровым мусором от ИИ,
00:05:20насколько бы хорош он ни был на самом деле. Но здесь они показывают несколько примеров: проходку на Unreal
00:05:25Engine, моделирование в Blender, а также несколько статических изображений. Очень крутая вещь,
00:05:31которую они добавляют в Astra — это изменения в автокомпрессии при заполнении контекстного окна.
00:05:37Раньше при заполнении контекстного окна происходила автокомпрессия: создавалось нечто вроде сводки
00:05:41всего, о чем вы говорили в прошлой сессии, после чего запускалась новая сессия.
00:05:46Это порождало проблемы, иногда детали упускались. Но теперь Astra ведет заметки между контекстными
00:05:52окнами, а не просто сохраняет единую сводку. Вместо одного документа у нее по сути есть набор
00:05:57различных стикеров с тем, что она считает важным. И она может ссылаться на них в любой момент,
00:06:01в отличие от подхода «вот краткая выжимка, надеюсь, тут есть все необходимое».
00:06:06Более того, предыдущие контекстные окна остаются доступными для поиска. Опять же, это не единственный
00:06:12документ-сводка, и если чего-то в нем нет, мы пропали. Теперь дела обстоят иначе.
00:06:16Поскольку это экспериментальная функция, её нужно включить в конфигурации codex,
00:06:20но через несколько недель она станет стандартной. В вопросах кибербезопасности
00:06:24Astra придерживается подхода, похожего на подход Anthropic к Fable: модель настолько
00:06:28мощна, что может создавать множество эксплойтов. Поэтому, если она решит, что вы пытаетесь создать
00:06:33какой-то эксплойт, она просто не позволит вам это сделать и не станет отвечать
00:06:37на ваш запрос. Еще одно отличное улучшение в GPT-6 по сравнению с 5-й серией — сниженный уровень
00:06:42галлюцинаций. GPT-5.6 Sol и модели 5.6 в целом галлюцинировали довольно сильно по сравнению
00:06:48с другими передовыми моделями. При прямом же сравнении мы видим снижение уровня галлюцинаций
00:06:54с примерно 9.4% до 2%. Доступна ли Astra? Она
00:07:01открыта для ограниченного числа организаций, а в ближайшие дни станет доступна
00:07:06практически каждому. Что касается API, он доступен разработчикам. И в отношении цен: опять же,
00:07:11они совпадают с ценами Fable. Мы говорим о $10 за миллион входных токенов и $50 за миллион выходных токенов.
00:07:17Судя по цифрам, OpenAI предлагает очень надежную модель, которая может полноценно конкурировать
00:07:22с лучшими разработками Anthropic. И делает это по более низкой цене.
00:07:26Поэтому я очень рад опробовать её в деле. Я считаю, что конкуренция между крупнейшими игроками
00:07:30в конечном счете идет на пользу нам, конечным пользователям.