Kimi K3 на уровне Fable... (им стоит начать беспокоиться)
BBetter Stack
Computing/SoftwareSmall Business/StartupsInternet Technology
Transcript
00:00:00Kimi K3 уже здесь, и, честно говоря, это шокирует. Она не просто догнала Opus и
00:00:04GPT 5.5, она догнала Fable и GPT 5.6. Открытые модели отстают не так сильно, как мы сначала
00:00:10полагали. Давайте взглянем. Начнем с анонса. Kimi K3 — это модель с 2,8 триллионами
00:00:19параметров, построенная на базе Kimi Delta Retention and Attention Residuals, с нативной поддержкой зрения
00:00:24и контекстным окном в 1 миллион токенов. Это первая в мире открытая модель класса 3 триллиона параметров,
00:00:29предназначенная для передового интеллекта в задачах долгосрочного кодинга, интеллектуальной работы и рассуждений.
00:00:34Во всех бенчмарках, представленных в этом блоге, Kimi K3 либо немного отстает от Fable
00:00:38и GPT 5.6 Soul, либо даже превосходит их в некоторых других областях. Это настолько безумный скачок,
00:00:43что, думаю, мало кто мог предсказать. Разумеется, это их собственный бенчмарк, так что давайте посмотрим
00:00:47на результаты искусственного интеллекта и сторонние тесты, и я рад сказать, что результаты практически
00:00:52совпадают. На этом графике видно, что около 80% зрителей не подписаны,
00:00:56так что жмите кнопку подписки, если хотите быть в курсе всего, что связано с разработкой ПО
00:01:00и ИИ. Перейдем к реальным бенчмаркам: начав с индекса кодирования, она набирает 76,2 балла,
00:01:06что всего на 0,3 балла меньше, чем у Fable 5, и немного больше, чем у GPT 5.5, Opus 4.8 и
00:01:12больше, чем у GPT 5.6 Luna, и лишь немного уступает GPT 5.6 Soul и Terra. Только посмотрите на этот рывок,
00:01:19который они сделали по сравнению со своей предыдущей моделью. Если мы посмотрим на агентный индекс, то история та же.
00:01:23Она здесь третья, уступая только Fable и Soul, но это все равно серьезное достижение, и вы уже
00:01:29привыкли к этому, но в интеллектуальном индексе ситуация точно такая же. Так что даже сторонние
00:01:32бенчмарки подтверждают, что эта модель потрясающая. К сожалению, у нас еще нет результатов deep SWE на момент
00:01:38записи видео, но если взглянуть на наши собственные тесты, можно увидеть, что она снова заняла третье место.
00:01:42Эта модель кажется слишком хорошей, чтобы быть правдой. Единственные минусы, которые я могу найти,
00:01:46это то, что она немного дороговата. Если у вас дома нет суперкомпьютера, не думаю, что вы
00:01:50будете запускать её локально, так что при использовании через API цена составляет 3 доллара за
00:01:54миллион входящих токенов и 15 долларов за миллион исходящих. Это значительный шаг вперед по сравнению с Kimi K 2.6
00:02:00и стоит примерно столько же, сколько Sonic 5 после окончания действия скидки, но она дешевле Fable 5,
00:02:06Opus и GPT 5.6. Цена API — это не всё, так что если взглянуть на практику с учетом стоимости
00:02:12за задачу, то она сопоставима с GPT 5.6 Soul и в два раза дешевле Opus 4.8 и,
00:02:17конечно, дешевле Fable и Sonic 5. Так что она конкурентоспособна с закрытыми фронтир-моделями, но
00:02:22для тех, кто любит открытые модели за их относительную дешевизну, эта, вероятно,
00:02:26не подойдет. GLM 5.2 — второй лучший вариант, и он в два раза дешевле. Это также не самая
00:02:31быстрая модель, но, на мой взгляд, она вполне конкурентоспособна при таком уровне интеллекта.
00:02:36В целом, сложно сказать что-то негативное об этой модели, так что давайте сразу перейдем
00:02:40к моим локальным тестам. Первый тест, который я провел для этих моделей: создание
00:02:44полноценной гоночной игры Формулы-1 на 3.js, умещающейся в один индексный файл index.html. Это Kimi K3, работающая
00:02:50через Open Router. Я также тестировал её в Kimi Code, через CLI, чтобы проверить, меняет ли что-то среда.
00:02:56Внизу видно, что она думала 14 минут, прежде чем начать, и в целом ей потребовалось
00:03:0035 минут на создание этого 3.js веб-приложения, а стоимость API-токенов составила 1,24 доллара. Полученные результаты
00:03:06довольно впечатляющие. Очевидно, что у неё нет доступа к внешним ассетам, поэтому она делает всё возможное для создания
00:03:11этих моделей. Но трасса работает. У нас есть наши ИИ-гонщики, и они, похоже, способны ездить по
00:03:16трассе. Вы видите, что барьеры действительно работают, я не могу сквозь них пройти. Наша позиция обновляется.
00:03:21Наша карта обновляется. Наше текущее время обновляется, как и количество кругов. Я проехал
00:03:25полный круг и подтверждаю, что всё это работает. Так что это отличный результат, который дала нам Kimi K3.
00:03:30Как я сказал, я также протестировал разные среды. Это Kimi K3, но уже в Kimi Code. И эта версия,
00:03:35я бы сказал, выглядит немного лучше. Она лучше справилась с ассетами, хотя это всего лишь
00:03:39стилевой выбор. Есть небольшая задержка с этими моделями, но управление немного лучше.
00:03:43Управление всё еще инвертировано, и, кстати, это кажется закономерностью во многих из этих 3.js приложений
00:03:48по какой-то причине. Но опять же, всё это управляется очень хорошо, и есть функции, например, выезд
00:03:52с трассы замедляет меня. И да, она тоже проделала довольно впечатляющую работу. А теперь давайте
00:03:57сравним это с фронтир-моделями. У нас есть Fable 5 в Claude Code, настройки были на максимуме, и это заняло
00:04:0144 минуты, чтобы сделать мое 3.js приложение. Также у нас есть GPT 5.6 Sol, тоже на максимуме. И это
00:04:07заняло 18 минут. Вот результат, который дала мне Fable. Так что у нас есть Fable GP. И я бы сказал,
00:04:12что выглядит это немного приятнее, может быть. Но опять же, всё это просто стилистический выбор. И управление
00:04:17здесь на самом деле не инвертировано. Также есть небольшое покачивание камеры, что я считаю неплохим
00:04:22стилем. И опять же, всё в этой версии кажется работающим, как и в остальных. Я пробовал
00:04:26проехать полный круг, насколько это сложно. Здесь также есть столкновения, как вы можете видеть. Но да,
00:04:31всё, кажется, работает, и это вполне сопоставимо с тем, что дала нам Kimi K3. Похожая история
00:04:35с GPT 5.6 Sol. Как видите, у нас есть рабочая игра. Хотя отмечу, что дорога здесь
00:04:40выглядит как трава. Она на самом деле не отрендерила это. И всё, кажется, работает. Управление
00:04:44здесь тоже инвертировано. И еще есть несколько перевернутых ассетов. Не знаю, почему эти модели
00:04:48так любят это делать. Единственная, которая этого не сделала — Fable. И также трасса здесь немного
00:04:53перепутана. Так что на самом деле это единственная модель, которая не создала мне рабочую трассу. Добавлю для
00:04:57окончательного сравнения, я также проверил, что даст мне GLM 5.2, так как это следующая лучшая открытая модель. И эта
00:05:02думала 5 минут и 58 секунд. Хотя она не закончила задачу в одном промпте. На самом деле было
00:05:07несколько багов. Так что мне пришлось вернуться с другим промптом. Даже тогда, когда игра наконец заработала,
00:05:11можно увидеть, что в этой версии много багов. Во-первых, мы стартуем на трассе неправильно.
00:05:15И трассы, по сути, вообще нет. И к тому же она выглядит намного хуже остальных.
00:05:20Так что, переходя к Kimi K3, мы наблюдаем заметный прогресс. Перейдем ко второму тесту. Я попросил создать
00:05:25панель управления личными финансами. Это должно было быть полноценное приложение с интерфейсом
00:05:29и бэкендом. Единственное, что я не хотел — это авторизацию. И я также попросил добавить немного данных.
00:05:33Я снова проделал это в open router с K3. А затем и в Kimi code. Итак, это версия в open
00:05:38router. И видно, что в общей сложности на создание этого приложения ушло 56 минут. И это также стоило
00:05:43мне 1,30 доллара. Вот результат, который они выдали. И, честно говоря, я не могу жаловаться.
00:05:48Это именно то, что я просил. Панель управления личными финансами. Я бы сказал, что выглядит она
00:05:53очень красиво. Есть все функции, включая дополнительные страницы. И я
00:05:57проверил добавление средств и отправку денег. Всё работает. Так что она справилась отлично. Теперь мне также
00:06:01всегда интересно видеть, какие инструменты она использовала для выполнения задачи. Потому что я не давал
00:06:05никаких инструкций по стеку в промпте. Можно увидеть, что для фронтенда здесь выбрали
00:06:09react и react dom. И не использовали никакого роутера или чего-то подобного. На самом деле она построила
00:06:12свою систему отображения. Так что я, вероятно, предпочел бы, чтобы вы использовали что-то вроде react router,
00:06:16tan stack или next.js. А для бэкенда она также создала свой собственный сервер. Полагаю,
00:06:21что используется express.js, как мы видим здесь. Но при этом она создала базу данных просто с использованием
00:06:26JSON-файла. Не использовала SQLite или что-то вроде того, или drizzle, что я бы, вероятно, хотел
00:06:31увидеть, если бы мы масштабировали это приложение в будущем. Но, опять же, я знал, что мог
00:06:35указать это в промпте. Но мне всегда нравится видеть, что они выберут по умолчанию. Это
00:06:38результат, который я получил с помощью K3 через Kimi code. И можно увидеть, что эта версия немного проще.
00:06:43Всего одна страница, без боковой панели. Опять же, все функции работают, и она имеет
00:06:47довольно похожий вид на то, что мы получили от open router. Глядя на код, я
00:06:51на самом деле предпочитаю то, что нам дал Kimi code здесь с K3. Фронтенд довольно похож: просто
00:06:55React и никакой библиотеки роутинга. Но сервер на самом деле использовал базу данных. Можно увидеть,
00:06:59что он построен на express. У нас есть финансовая база данных, и используется node
00:07:04SQLite. А теперь сравним это с фронтир-моделями: это снова Fable 5 в Claude code.
00:07:08Видно, что она работала 56 минут при максимальных усилиях. А еще у меня есть GPT 5.6 soul max,
00:07:13где она думала 31 минуту над созданием приложения. Вот что нам дала Fable 5, и,
00:07:17честно говоря, дизайн довольно похожий. Я имею в виду, не так много чего еще можно сделать
00:07:21с панелью управления личными финансами. И все функции в ней работают. Она выбрала немного
00:07:25другой стиль для шрифтов, что я в последнее время часто замечал у Fable и Opus. Кажется, их
00:07:29переучивают уходить от тех предыдущих “ИИ-видов”, которые у них были, и они создают новый
00:07:34ИИ-облик. И, похоже, это тот самый, который они выбирают. Я бы сказал, что эти графики даже немного
00:07:38бесполезнее, чем то, что мы получили от Kimi K3. Но в целом выглядит довольно похоже и работает
00:07:43практически так же. Даже код довольно похож. Видно, что для фронтенда она выбрала React
00:07:47и не использовала роутер. Написала свой собственный. А также для базы данных она
00:07:51успешно использовала базу данных. Так что здесь мы используем Node SQL. А для
00:07:57самого сервера используется просто Express 2. Перейдем к GPT 5.6 soul. Это немного
00:08:02странная модель. Определенно мой любимый дизайн из всех. И опять же, все функции
00:08:06работают. Дайте знать, согласны ли вы, что это лучший дизайн. Но странная часть кроется в коде.
00:08:11Это определенно самый полный код приложения, который мы видели в этих примерах. Она
00:08:15действительно построила полноценное NextJS приложение и использовала Drizzle, как я и сделал бы. И она использовала NextJS
00:08:20также для фронтенда и для сервера. Но часть, которую я нахожу немного странной, заключается в том, что она
00:08:24выбрала хостинг на Cloudflare, что само по себе не странно, но она также использовала for Next. И не то чтобы
00:08:29я не рекомендовал бы это. Просто думаю, что это немного не проверено. И это довольно
00:08:33новый подход, что показывает, что они действительно подталкивают GPT 5.6 soul к использованию этого. И я могу только строить предположения,
00:08:38почему, но кажется, это может быть потому, что именно так на самом деле работают сайты ChatGPT. Вы можете
00:08:42видеть здесь, что она решила разместить это для меня на той функции сайтов ChatGPT, хотя я не просил
00:08:47её об этом. Лично мне это не очень нравится, когда я пишу приложение. Я не хочу,
00:08:50чтобы она размещала его за меня. Я предпочел бы заняться всем этим самостоятельно. Но я мог бы попросить об этом
00:08:54в промпте. Я бы предпочел, чтобы мне пришлось просить её разместить, а не наоборот.
00:08:58Последний результат у меня здесь — GLM 5.2, и она сделала примерно то же, что и Kimi K3
00:09:04в Kimi Code, где построила эту единственную страницу. Но опять же, все функции работают, и я
00:09:08думаю, что дизайн довольно милый. GLM 5.2 на самом деле потратила 15 минут, и вы можете видеть, что это стоило
00:09:13мне доллар и 11 центов. Что касается реального кода, GLM 5.2 выбрала путь Next.js,
00:09:19что мне на самом деле нравится. Но она создала своё собственное хранилище вместо использования базы данных. Так что всё это
00:09:24просто в памяти JavaScript. Итак, исходя из моих быстрых тестов, я думаю, что Kimi K3 на одном уровне с Fable
00:09:29и GPT 5.6 Sol и оправдывает хайп, который дают ей бенчмарки. И, честно говоря, становится
00:09:33довольно сложно показать вам, насколько мощны эти модели в видеодемонстрации. Обычно приходится
00:09:38использовать их в течение недели в продакшн-коде, чтобы действительно увидеть качество
00:09:42кода. Если у вас есть идеи для тестов, которые я действительно могу показать в видео, чтобы
00:09:46по-настоящему подвергнуть эти модели сложному испытанию, дайте знать в комментариях ниже. Я также хочу
00:09:50показать некоторые примеры, которые у них были в техническом блоге. Вы видите, Kimi
00:09:53K3 построила эту игру, но использовала другой инструмент для генерации этих ассетов, так что ковбой и
00:09:58лошадь не были сгенерированы K3. Они были сделаны где-то еще. Видите, она проделала очень хорошую работу
00:10:03в 3GS. И еще одна безумная вещь — этот дизайн чипа. Вы видите, что в качестве раннего
00:10:08доказательства концепции Kimi K3 разработала чип для обслуживания нано-модели, построенной на её собственной архитектуре. За один
00:10:1348-часовой автономный запуск K3 построила, оптимизировала и верифицировала чип с использованием инструментов с открытым исходным кодом. Так что надеюсь,
00:10:19вы увидели, что эта модель абсолютно потрясающая, и она определенно нанесет удар по
00:10:23этим закрытым фронтир-лабораториям. Или, по крайней мере, нанесет, когда они действительно выпустят веса. Они еще не
00:10:27выпустили их, но планируют это сделать. Так что надеюсь, мы увидим их очень скоро. Что вы думаете
00:10:32об этом? Ожидали ли вы, что китайская лаборатория догонит так быстро? И привлекает ли вас эта модель?
00:10:36Дайте знать в комментариях ниже. Пока вы там, подпишитесь. И как всегда, увидимся в следующем видео.