Всё кончено... Это только что завершило дебаты между GPT 6 Astra и Fable 5.1
AAI LABS
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00Fable 5.1 и GPT-6 Astra были выпущены с разницей всего в несколько дней, и обе модели получают очень
00:00:05высокие баллы в бенчмарках. Astra даже набрала почти 100% в тесте на AGI, к чему ни одна модель
00:00:11даже близко не подбиралась. Так что, глядя на эти цифры, можно ожидать отличных результатов
00:00:16при решении реальных задач. Но высокие результаты в тестах не гарантируют, что модель хорошо
00:00:20справится с вашей работой, и мы хотели проверить, одинаково ли хорошо обе модели показывают себя
00:00:25на наших собственных задачах. Поскольку мы — софтверная компания, у нас уже были проекты для тестирования,
00:00:30поэтому мы дали обеим моделям работу из этих проектов и проверили результаты. Мы запустили каждую модель
00:00:35на нескольких проектах и оценили их производительность в различных областях. Мы использовали GPT-5.6 в качестве
00:00:41судьи для оценки результатов. Эта модель-судья не знала, какие результаты получены от Fable, а какие
00:00:45от Astra. Одна модель получила общую оценку 86 из 100, а другая — 84. И хотя разница может казаться
00:00:52небольшой, модель, занявшая первое место в общем зачете, победила далеко не во всех категориях,
00:00:57а вторая показала на удивление хорошие результаты в некоторых из них. Поэтому мы подробно разберем,
00:01:02как каждая модель проявила себя в тестах и какая из них побеждала в каждой категории, чтобы вы понимали,
00:01:07как эти различия влияют на реальные задачи. Прежде чем перейти к результатам тестирования, давайте сначала
00:01:12кратко рассмотрим сами модели. Этот раздел предназначен только для тех, кто с ними не знаком, поэтому,
00:01:17если вы уже знаете все детали, можете пропустить его и сразу перейти к следующему. Anthropic выпустила
00:01:22Fable 5.1 1 сентября, и еще до того, как Anthropic успела в полной мере насладиться шумихой вокруг релиза,
00:01:27OpenAI выпустила GPT-6 Astra всего через несколько дней после Fable. Люди уже создают очень интересные
00:01:33продукты с помощью этих моделей, доводя их возможности до предела и получая действительно
00:01:37удивительные результаты. Что касается цен, обе модели стоят одинаково: 10 долларов за миллион входных
00:01:43токенов и 50 долларов за миллион выходных токенов. Но у Fable 5.1 есть одно отличие:
00:01:49Anthropic снизила стоимость кэшированного чтения на 75%. Для тех, кто не знает, что такое кэшированное чтение,
00:01:54части диалога, которые модель уже прочитала, сохраняются для повторного использования.
00:02:00Когда вы отправляете новый промпт, эти сохраненные фрагменты используются повторно, вместо того чтобы модель читала их
00:02:05снова с нуля — это и называется кэшированным чтением. Это и так делало повторное использование контекста дешевле,
00:02:10но со снижением цены стало еще выгоднее. Однако это не значит, что Fable в целом дешевле в использовании,
00:02:14поскольку итоговая сумма зависит и от многих других факторов, о которых мы поговорим чуть позже.
00:02:19Модели Fable уже некоторое время доступны в Claude Code, но Fable 5.1 до сих пор не включена в тариф Claude Pro,
00:02:25так что на Pro за нее приходится платить отдельно с помощью кредитов использования. В планах Max
00:02:30Fable 5.1 уже включена, но лимиты для моделей Fable ниже, чем для остальных.
00:02:36С другой стороны, OpenAI не рассматривает Astra как отдельную модель: Astra является частью
00:02:41обычные лимиты кодекса в ChatGPT+ и Pro, и весь объем использования можно потратить на Эстру. Теперь эти
00:02:47Теперь эти модели действительно способны справляться с длинными задачами, а это значит, что вы можете поручить им
00:02:52создание крупного функционала и оставить их самостоятельно проходить все этапы. Но когда вы оставляете
00:02:57модели работать над долгой задачей, размер поддерживаемого контекста тоже имеет значение. Fable предоставляет миллион токенов
00:03:02в Claude Code, в то время как окно контекста Astra по умолчанию в Codex составляет всего 272 000 токенов, хотя
00:03:09у Astra через API доступно гораздо большее окно, которое даже превосходит миллион у Fable.
00:03:14Однако в Codex вы этого пока не получите, так как по умолчанию он ограничивает контекст Astra значением в 272 000 токенов.
00:03:21Теперь эти модели достигли уровня, когда они могут проводить сложные исследования, поэтому OpenAI и
00:03:26Anthropic добавили защитные барьеры безопасности, ограничивающие выполнение некоторых потенциально опасных задач.
00:03:31Но эти ограничения влияют и на вашу работу, поскольку каждая модель реагирует по-своему, когда система безопасности
00:03:36решает, что ваш запрос нарушает правила. Когда Astra доходит до части задачи, противоречащей её правилам,
00:03:41она прямо отказывается выполнять этот запрос и сообщает вам об этом. С другой стороны,
00:03:45Claude Code переключается с Fable на более слабую модель, если запрос нарушает правила. И многие
00:03:51замечали, что Claude Code менял модель без их ведома. Так что, если после такого переключения Claude Code
00:03:56продолжает работу, результат может генерироваться уже вовсе не Fable.
00:04:01Первой метрикой, которую мы измерили, было качество, отражающее то, насколько хороша работа модели на практике.
00:04:06Для этого теста мы использовали реальные клиентские проекты, поэтому не можем раскрывать их детали,
00:04:11но можем объяснить, как мы оценивали работу и в чем модели различались. По качеству написания и организации кода
00:04:16Fable набрала 90 баллов против 78 у Astra, так как она более четко разделяла код для разных
00:04:22частей приложения. Это облегчает модели понимание кодовой базы при внесении изменений в дальнейшем,
00:04:27и Fable опережала Astra по этому показателю во всех протестированных проектах. А по объему
00:04:32выполненной работы Fable набрала 91 балл против 84 у Astra, поскольку она также исправляла проблемы,
00:04:39о которых мы ее специально не просили. Но мы также проверяли, корректно ли работают готовые функции
00:04:44без дополнительных запросов на исправление, и здесь Astra набрала 87 баллов против 85 у Fable.
00:04:50Преимущество Astra частично объясняется тем, что она тщательнее проверяла приложения и устраняла больше известных проблем.
00:04:55Когда Fable тестировала свои приложения, она упускала некоторые сценарии возможных сбоев, поэтому в готовых функциях
00:05:00оставались мелкие недочеты. Что касается удобства использования приложения, Astra получила 89 баллов против 88 у Fable,
00:05:08поскольку она размещала элементы интерфейса на более интуитивных и удобных для поиска местах.
00:05:13Таким образом, основываясь на всех упомянутых тестех, общий балл качества Fable составил 88, а у Astra — 84,
00:05:19поскольку она создавала более завершенный функционал, а ее код было проще модифицировать в дальнейшем. Так что в плане качества
00:05:25Fable одерживает явную победу. Но прежде чем перейти к следующему тесту, послушаем нашего спонсора —
00:05:30компанию Zapier. Вы создаете приложение с помощью ИИ, и оно работает отлично, но как только вам требуется подключить его
00:05:35к таким инструментам, как Gmail, Slack и Notion, приходится вручную настраивать каждую интеграцию и OAuth-авторизацию.
00:05:41Не успеете оглянуться, как увязнете в коде аутентификации, и интеграции неожиданно станут главным проектом. Здесь на помощь
00:05:46и приходят SDK Zapier. Это библиотека кода, которую вы добавляете в свой проект прямо в Claude Code или Cursor,
00:05:52получая программный доступ к экосистеме из более чем 9000 приложений Zapier. Вместо того чтобы собирать каждую интеграцию
00:05:58вручную, мы просто вызывали нужные и продолжали работу. Всего за несколько строк кода наше приложение отправляло письма
00:06:04и создавало страницы в Notion без изучения документации по API и борьбы с авторизацией. А когда нам потребовалось обновить
00:06:10пользовательское свойство в Notion, для которого не было готового действия, мы обратились к нему напрямую через
00:06:15SDK. Это инструмент, который идеально вписывается в ваш привычный рабочий процесс. Если вы устали вручную настраивать интеграции,
00:06:20попробуйте SDK Zapier. Ссылка находится в описании ниже. Следующая метрика, которую мы измерили, касалась того, как
00:06:26хорошо модели справляются с длительными задачами: сколько работы они выполняли самостоятельно при минимальном
00:06:31нашем вмешательстве в процессе работы. Мы также проверяли, как они справляются с возникающими по ходу дела проблемами.
00:06:36Для этого мы дали каждой модели идею приложения для разработки и сформулировали запрос в соответствии с инструкциями по промптингу,
00:06:42чтобы у них были наилучшие шансы выполнить работу качественно. Мы не указывали конкретных деталей реализации,
00:06:47а просто описали, что должно делать приложение. Astra работала около 32 минут, а Fable —
00:06:53около 44 минут. Astra сталкивалась с ошибками во время сборки и проверки приложения, но самостоятельно устраняла их
00:06:58и продолжала дорабатывать приложение без необходимости вести ее за руку через каждую проблему. Fable тоже завершила
00:07:03создание приложения, не прерываясь преждевременно и не спрашивая нас о дальнейших шагах, а также запустила проверки созданного.
00:07:09Таким образом, обе модели довели работу до конца, но мы также изучили готовые приложения, чтобы оценить результат.
00:07:13Приложение от Astra открывалось прямо на странице входа без отдельного лендинга. После входа
00:07:18макет был хорошо организован, и приложение работало, хотя в нем все еще прослеживались привычные шаблоны,
00:07:24характерные для многих сгенерированных ИИ приложений. Однако у нас возникла проблема с боковой панелью, так как она не прокручивалась
00:07:30достаточно далеко, чтобы добраться до кнопки выхода. Пришлось уменьшать масштаб страницы, чего собственные
00:07:35проверки Astra не выявили. Приложение Fable также открывалось сразу со страницы входа, но его дизайн
00:07:40казался гораздо более шаблонным. Функции работали, но все элементы были расположены настолько тесно друг к другу,
00:07:45что приложением было неудобно пользоваться, а повторяющиеся градиенты усиливали привычный «ишный» вид. Интерфейс адаптировался
00:07:51под маленькие экраны, но удобным в использовании так и не стал, несмотря на проработанный функционал.
00:07:56У нас также были запланированы и созданы другие приложения и крупные функции в таком же режиме автономной работы моделей.
00:08:01В итоге для длительных задач Astra набрала 93 балла из 100 против 90 у Fable.
00:08:08Fable больше концентрировалась на работоспособности функций, если только мы специально не указывали в промпте
00:08:13уделить внимание визуалу. Astra же уделяла равное внимание и работе приложений, и их внешнему виду,
00:08:18поэтому в длительных задачах побеждает Astra. Следующей метрикой, которую мы рассмотрели, стал дизайн и
00:08:23удобство интерфейса. Мы разрешили модели оценивать дизайн самостоятельно, но не хотели полагаться исключительно на её
00:08:28вкус. Поэтому мы создали специальный просмотрщик для результатов Fable и отдельный для Astra, что позволило нам самим
00:08:33оценить дизайн и сравнить удобство их использования. Мы дали обеим моделям одинаковые задачи по дизайну,
00:08:38начав с лендинга для компании, продающей шрифты. Вариант от Fable выглядел очень похоже на то,
00:08:44что обычно выдает Opus — от цветов и шрифтов до макета. Там даже присутствовала бегущая строка с текстом
00:08:50по странице, которую мы в последнее время часто видим в дизайнах от Opus. Но что Fable сделала иначе
00:08:55по сравнению с Opus, так это добавила гораздо больше интерактивных элементов по всему макету, благодаря чему приложение
00:09:00Версия Astra имела более просторную компоновку, с более чёткими различиями в размере текста и
00:09:05цветах, благодаря чему текст читался легче. Но движения было гораздо меньше, поэтому, хотя на неё было
00:09:10приятнее смотреть, она не давала тех же ощущений, что дизайн Fable. Вот почему Fable
00:09:14получила 94 балла за интерактивность, а Astra — 85. Затем мы поручили каждой модели разработать
00:09:20целевую страницу для игры в жанре хоррор. В дизайне Fable использовался анимированный маяк для создания
00:09:25атмосферы. Графика была выполнена в формате SVG, то есть в виде рисунков с использованием кода, но текст
00:09:31недостаточно выделялся на темном фоне из-за выбранных Fable размеров и цветов. А для той же дизайнерской
00:09:36задачи Astra использовала встроенную модель генерации изображений в Codex вместо создания графики кодом.
00:09:42Она также создала тизер игры, хотя мы об этом не просили. И в чём Astra вырвалась вперёд,
00:09:47так это в выборе шрифтов и цветов, благодаря чему текст выделялся на темном фоне.
00:09:52Для сайта музыкального фестиваля версия Fable повторяла множество дизайнерских решений, которые мы видим в работах,
00:09:57Opus. Но даже с учетом этих привычных решений казалось, что Fable приложила больше усилий для придания
00:10:03чтобы придать сайту собственный стиль. Astra использовала сгенерированную фотографию с концерта, но в целом дизайн
00:10:08казался более шаблонным. Последним сравнением стала игра в параллельную парковку, где версия Fable была действительно
00:10:13отлично сделана, а зеркало заднего вида помогало нам точнее определять, куда повернуть машину. В игре было два
00:10:18режима камеры, но у обоих были проблемы. Один показывал не ту сторону парковочного места,
00:10:23в то время как другой показывал только одну сторону вместо полноценного обзора дороги впереди. Это затрудняло
00:10:27понимание того, куда мы направляем машину, и если бы эти ракурсы камеры были правильными, игра
00:10:32казалась бы более реалистичной. Astra предоставила три фиксированных вида и добавила советы по вождению на боковой панели,
00:10:38что сделало её игру проще в прохождении. Ракурсы камеры были намного лучше, чем у Fable. Это были
00:10:42общие тесты, в которых мы давали моделям очень мало подробностей о желаемом дизайне, поэтому мы оценивали
00:10:48именно собственный вкус моделей. Обе повторили дизайнерские решения из других своих работ, но обе
00:10:53выдали хорошие результаты. И при наличии небольших уточнений о том, как должны выглядеть и ощущаться приложения,
00:10:58мы ожидали бы хорошего дизайна от обеих. Итак, судя только по вкусу, Astra победили в визуале и удобстве использования, в то время как Fable — в
00:11:04анимации и интерактивности. Но прежде чем мы перейдем к тестированию стоимости и скорости, было бы здорово, если бы вы
00:11:09подписались на канал и нажали кнопку лайка. Этот небольшой жест поддержки очень важен для нас.
00:11:15Следующим измеряемым нами показателем была эффективность, которая охватывала стоимость работы, затраченное время
00:11:20и количество обращений модели к своим инструментам для выполнения задачи. Стоит отметить, что мы не пользовались
00:11:25API, поэтому это лишь оценки того, во сколько обошлась бы работа при использовании API
00:11:31на основе использованных токенов. Мы проводили тесты по нашей обычной подписке. Во всех тестовых запусках общая оценочная стоимость
00:11:37Fable составила 49,18 доллара по сравнению с 27,69 доллара у Astra, то есть общая сумма Astra оказалась примерно на 44% ниже.
00:11:47Fable сгенерировала почти в 3 раза больше выходных токенов, чем Astra, точно так же, как руководство
00:11:52по промптам Fable упоминает, что она склонна писать больше других моделей. Стоимость этих токенов для обеих моделей
00:11:57была одинаковой, поэтому именно больший объем текста увеличил стоимость Fable. Использование инструментов также увеличивает расход токенов,
00:12:03поскольку модель сама решает, какой инструмент использовать, а затем считывает результаты, прежде чем продолжить работу. Во всех
00:12:09шести запусках основной агент Fable использовал свои инструменты 443 раза по сравнению с 287 у Astra, что также увеличило
00:12:17стоимость. По стоимости Astra набрала 80 баллов из 100 против 66 у Fable. Что касается скорости, Astra тоже
00:12:23оказалась впереди с 70 баллами против 67 у Fable. Продолжительные задачи заняли у Astra около 62 минут суммарно
00:12:30по сравнению с 73 минутами у Fable. Таким образом, по баллам за стоимость, скорость и эффективность инструментов
00:12:35Astra опередила Fable. Следующим измеряемым показателем было следование инструкциям,
00:12:40где мы проверяли, насколько хорошо модели следуют данным им инструкциям в процессе разработки,
00:12:44и продолжают ли они следовать им по мере выполнения работы. Когда мы запустили Fable над проектом,
00:12:49она поначалу добавила сообщение об авторстве с указанием, что Claude помог написать код,
00:12:53несмотря на то, что наши инструкции прямо запрещали это. Она также проигнорировала правило о том, как ей разрешено
00:12:58создавать или изменять файлы. Мы велели ей использовать собственные инструменты редактирования файлов Claude, чтобы эти изменения отслеживались
00:13:04и их было легко отменить, но вместо этого она создала два файла с помощью команд. По следованию инструкциям
00:13:09Astra набрала 96 баллов из 100 против 88 у Fable. Так что в вопросе соблюдения инструкций
00:13:16Astra вышла вперед в этих запусках. Следующим измеряемым показателем было качество код-ревью, где мы предоставили моделям
00:13:21проект с проблемами и попросили их найти эти проблемы. Сначала мы дали обеим моделям
00:13:27один и тот же код для проверки, в который намеренно добавили четыре проблемы, чтобы знать наверняка, что им нужно найти. Fable
00:13:33нашла все четыре, а также обнаружила пять дополнительных проблем, которые мы не добавляли и которые затем были
00:13:37проверены и подтверждены. Astra нашла две из четырех добавленных нами проблем, но при этом сообщила нам, что проверка
00:13:42завершена. Мы также включили три фрагмента, которые выглядели подозрительно, но на самом деле были правильными, поскольку
00:13:47мы хотели проверить, станет ли модель сообщать о ложных проблемах. Ни одна из них не посчитала их багами, так что
00:13:52разница заключалась в объеме найденного: Fable провела более тщательный анализ,
00:13:57но когда мы протестировали их на более крупном проекте с девятью подтвержденными проблемами, Astra исправила пять, в то время как Fable
00:14:03нашла и исправила только четыре. Таким образом, Astra выполнила больше исправлений, хотя обе оставили несколько проблем
00:14:08неисправленными. За качество код-ревью, которое включало эти исправления и то, как модели проверяли остальную свою работу,
00:14:13Fable получила 84 балла против 78 у Astra. Так что Fable вырвалась вперед по общей оценке ревью,
00:14:19поскольку в целом выдала более сильный анализ. Исходя из этих результатов, Astra является безусловным победителем в
00:14:25нескольких протестированных категориях, но это не значит, что Fable — плохая модель, ведь она хорошо справилась
00:14:30с задачами и отставала от Astra совсем немного во многих из них. Так что вам просто нужно выбирать модель
00:14:35исходя из тех задач, которые вы перед ними ставите. Теперь, чтобы выжать из этих двух моделей максимум возможностей,
00:14:40необходимо следовать определенным практикам. Мы активно использовали их в нашем тестировании, и если вы хотите получить к ним доступ,
00:14:45вы можете найти их в AI Labs Pro, нашем сообществе. Так что если вам понравилось то, что мы делаем,
00:14:51и вы хотите поддержать канал, это лучший способ сделать это. Ссылка находится в описании.
00:14:56На этом видео подходит к концу. Если вы хотите поддержать канал и помочь нам продолжать создавать
00:15:01подобные ролики, вы можете сделать это с помощью кнопки суперспасибо ниже. Как всегда,
00:15:05спасибо за просмотр, и до встречи в следующем видео.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기