Как долго ваши навыки актуальны, прежде чем агент забудет сказанное? — Лори Восс, Arize AI

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00-
00:00:12- Всем привет.
00:00:15Спасибо, что пришли на этот донельзя гиковский доклад.
00:00:20У этого доклада очень длинное название,
00:00:22так что позвольте сразу назвать краткую версию.
00:00:23Вы пишете файлы навыков и напихиваете их инструкциями.
00:00:27В какой-то момент модель перестает следить за всеми ними.
00:00:31Вопрос в том, где этот предел?
00:00:33В какой момент вы добавляете слишком много инструкций
00:00:35в свои файлы навыков?
00:00:36И за последний год ответ сильно изменился.
00:00:40Я Лори, руководитель отдела по работе с разработчиками в Arise AI.
00:00:44В прошлом я сооснователь NPM Inc.
00:00:46Так что некоторые из вас могут знать меня по дням JavaScript.
00:00:48В последнее время я много думаю об ИИ
00:00:50и о том, как его тестировать.
00:00:53Пару месяцев назад я была на конференции AI Engineer в Майами,
00:00:55и это была хорошая конференция.
00:00:57И я слушала доклад Декстера Хорти.
00:00:59Это был хороший доклад.
00:01:00Совсем не на эту тему.
00:01:02Но пока он выступал,
00:01:04он между делом упомянул,
00:01:06что агент может следовать примерно 200 инструкциям,
00:01:10прежде чем начнет забывать их.
00:01:13А затем он продолжил свое выступление,
00:01:15и это было сказано вскользь.
00:01:17И он упомянул, что эта цифра из 2025 года,
00:01:20так что сейчас всё может быть лучше.
00:01:22И я на секунду перестала слушать,
00:01:25потому что подумала: 200 инструкций
00:01:27— это ведь совсем немного, правда?
00:01:31Нормальный файл навыков перешагивает отметку в 200 инструкций
00:01:33почти мгновенно.
00:01:35Если пользователь говорит X, делай Y,
00:01:37всегда включай раздел о Z,
00:01:39никогда не используй фразу W,
00:01:40каждая из них — отдельная инструкция.
00:01:42И если модель тихо перестает следить за ними после 200,
00:01:45это очень жесткий потолок
00:01:47для сложности того, что вы можете создать.
00:01:49Поэтому мне сначала захотелось узнать, откуда он взял эту цифру,
00:01:52и правда ли это.
00:01:55Вы ведь знаете это чувство.
00:01:57Вы пишете этот большой прекрасный файл навыков,
00:01:58страницы правил, крайние случаи, тон, форматирование.
00:02:00Вы передаете его агенту.
00:02:01Он выполняет задачу.
00:02:03И вы смотрите на результат и думаете:
00:02:05а он вообще обратил внимание?
00:02:07Действительно ли он следовал всем этим правилам?
00:02:09Или он просто сделал то, что ему показалось нужным,
00:02:11и выдал некое подобие
00:02:14того, чего я ожидала?
00:02:16Трудно сказать, или нет?
00:02:18Подробнее об этом позже.
00:02:20И вот вы живете с этой фоновой тревожностью
00:02:23каждый раз, когда нажимаете «Запуск».
00:02:24И это чувство — то, чему посвящено данное исследование,
00:02:27и мы пытаемся выяснить, можно ли его избежать.
00:02:30Итак, вот мое обещание на следующие 18 минут.
00:02:33Я покажу вам, откуда взялось это число 200,
00:02:36актуально ли оно до сих пор
00:02:37и каково реальное число на сегодня,
00:02:39потому что оно изменилось на порядок.
00:02:41А затем мы поговорим о том, что это значит
00:02:44для вас в качестве выводов.
00:02:46Какой на самом деле может быть длина ваших навыков и промптов
00:02:49и какие изменения в результате вам следует внести
00:02:51в свой рабочий процесс.
00:02:54Так что число 200 — это не фольклор.
00:02:57Оно взято из реального бенчмарка IfScale,
00:02:59из прошлогодней статьи вот этого парня, чью фамилию я исковеркаю,
00:03:03Ярославича и соавторов.
00:03:06И этот тест прекрасен в своей простоте.
00:03:10Вот как устроен IfScale.
00:03:12Вы просите модель написать бизнес-отчет
00:03:14и даете ей список конкретных слов,
00:03:16которые она обязательно должна включить в отчет.
00:03:19Включить точное слово «клиент»,
00:03:20включить точное слово «выручка»
00:03:22и так далее для скольких угодно слов.
00:03:24Каждое из них — это инструкция, которой нужно следовать.
00:03:27А затем вы считаете, сколько именно этих слов появилось в тексте.
00:03:32Так как тест очень простой,
00:03:34вам нужно держать в голове всего два числа.
00:03:36Одно из них — плотность, которую мы называем n.
00:03:38Это то, о скольких правилах идет речь одновременно.
00:03:41А второе — точность,
00:03:42которая представляет собой процент этих правил,
00:03:43которым модель действительно смогла следовать.
00:03:46Теперь вы можете сказать, что включение случайных слов в отчет
00:03:50не то же самое, что выполнение реальных инструкций,
00:03:52и это справедливо, и мы об этом поговорим.
00:03:55Но ключевые слова — это прокси.
00:03:57Задание «включить слово выручка» имеет ту же форму,
00:04:01что и «включить раздел об ценообразовании», верно?
00:04:02Или «никогда не использовать эту фразу».
00:04:04Это дискретное, именованное ограничение,
00:04:06о котором вы сказали агенту, что он должен ему следовать.
00:04:09Если модель не может отследить 200 слов в одном промпте,
00:04:11она определенно будет испытывать трудности
00:04:13с 200 более сложными инструкциями.
00:04:16Так что, если уж на то пошло, ей будет только хуже.
00:04:20Поэтому это число — потолок.
00:04:22Это число — максимум, выше которого не подняться.
00:04:23Если дать модели более сложные инструкции,
00:04:25этот показатель, вероятно, станет еще ниже.
00:04:27И 200 — это действительно низкий потолок.
00:04:30Поэтому, прежде чем гоняться за новыми моделями,
00:04:32нужно заняться качественной наукой,
00:04:33а это значит — воспроизвести старый результат
00:04:36и убедиться, что потолок в 200 действительно существует.
00:04:39И я перезапустила исходный бенчмарк.
00:04:42В оригинальной статье тестировалась целая пачка моделей,
00:04:45а модели появляются и исчезают очень быстро.
00:04:47Так что к тому времени, когда я добралась до этого тестирования,
00:04:50лишь три модели из исходного набора
00:04:52из 10 использованных ими моделей
00:04:54все еще были доступны через какой-либо API.
00:04:57Это были GPT 4.1, Claude Sonnet 4
00:04:59и Gemini 2.5 Pro.
00:05:01Это были модели, которые были доступны 12 месяцев назад
00:05:03и доступны до сих пор.
00:05:05И именно поэтому мы протестировали эти три,
00:05:07потому что они и остались.
00:05:08И с тех пор, как я впервые опубликовала это исследование
00:05:11пару недель назад,
00:05:12одна из этих трех моделей была отправлена в отставку.
00:05:14Так что это был последний момент, когда я могла
00:05:16провести этот тест.
00:05:17Так что из этого состава у нас осталось уже двое.
00:05:20Поэтому не привязывайтесь к своим моделям.
00:05:22А вот результаты, которые мы получили при воспроизведении
00:05:25оригинального открытия IfScale.
00:05:27По вертикальной оси отложена точность.
00:05:29Она начинается со 100% и начинает падать.
00:05:32А количество правил растет вдоль нижней оси
00:05:35в логарифмическом масштабе.
00:05:36То есть каждый раз при преодолении половины пути
00:05:37количество обрабатываемых правил удваивается.
00:05:42Так что к 500 правилам вы теряете 30, 40, 50% из них.
00:05:46Наши кривые совпали с результатами оригинальной статьи
00:05:49в пределах погрешности, так что вывод оказался верным.
00:05:52Год назад, где-то на отметке от 200 до 300 правил,
00:05:55передовые модели начинали сбоить.
00:05:57Это очень низкий потолок.
00:06:00Итак, это наша база, а теперь начинается самое интересное:
00:06:03мы взяли тот же самый тест
00:06:05и применили его к текущему передовому краю,
00:06:07вернее, к тому, каким он был
00:06:09на момент проведения теста.
00:06:10Я протестировал GPT 5.5, Claude Opus 4.7,
00:06:13поскольку версия 4.8 вышла через неделю после моего теста,
00:06:17Gemini 3.1 Pro и Deep Seek V4 Pro.
00:06:20Я дал им тот же промпт, те же слова,
00:06:22всё абсолютно то же самое, и сразу столкнулся с проблемой:
00:06:25они справились блестяще.
00:06:27Все они сразу набрали 100% в этом тесте,
00:06:30абсолютно без ошибок.
00:06:34Мы создали тест для поиска потолка,
00:06:36а модели прошли сквозь этот потолок
00:06:37даже не заметив его.
00:06:40И это стало проблемой, потому что бенчмарк
00:06:42был рассчитан максимум на 500 слов,
00:06:43поэтому мне пришлось изменить его,
00:06:45чтобы найти новый предел.
00:06:47Я сдвинул планку и добавил больше слов для включения.
00:06:50Я удвоил их количество с 500 до 1000,
00:06:52потом снова удвоил с 1000 до 2000,
00:06:55и продолжал делать это, пока не дошел до словарного
00:06:56запаса в 10 000 слов — именно там я начал находить предел
00:07:00возможностей современных моделей.
00:07:03Позвольте показать вам этот главный слайд с результатами.
00:07:06Вот они.
00:07:07Помните, что на оси X здесь используется логарифмическая шкала.
00:07:12То есть значения идут от 500 к 1000, 5000 и 10 000.
00:07:16Поэтому кажется, что график резко обрывается,
00:07:18хотя на самом деле это происходит на промежутке в тысячу чисел.
00:07:20Но посмотрите, как далеко вправо сместились эти новые кривые,
00:07:25прежде чем изогнуться.
00:07:26Год назад они падали уже на 200–300 инструкциях,
00:07:29а теперь, в зависимости от модели, граница ближе к 2000,
00:07:32а у лучших из них доходит до 5000 инструкций,
00:07:36прежде чем они начинают резко падать.
00:07:38Таким образом, примерно за 12 месяцев передовые модели стали примерно в 10 раз
00:07:41лучше справляться с одновременным выполнением инструкций.
00:07:44Это главный вывод, но здесь есть множество нюансов,
00:07:47в которых нужно разобраться.
00:07:49Способность отслеживать 2000 заданных ограничений в одном промпте
00:07:53теперь есть.
00:07:55И это действительно интересно, потому что мне кажется...
00:07:57не знаю, чувствуют ли это остальные,
00:07:59но мне казалось, что переход от, скажем,
00:08:04GPT 5.1 к GPT 5.5 был каким-то эволюционным, верно?
00:08:07Не казалось, что мы стали в 10 раз лучше,
00:08:09но этот тест имеет прямое отношение к очень практической вещи —
00:08:14насколько длинным может быть мой файл навыков?
00:08:17И за год мы стали в 10 раз лучше.
00:08:21Больше всего меня поражает то, что этому бенчмарку
00:08:23едва исполнился год.
00:08:25Год спустя 500 — это погрешность округления,
00:08:27и почва продолжает уходить у меня из-под ног.
00:08:29Я тестировал 4.7, а Opus 4.8 еще лучше.
00:08:35Так что эта диаграмма уже немного устарела,
00:08:36в чем, собственно, и суть.
00:08:37Если вы определили свои инженерные предположения
00:08:39о том, как должны работать файлы навыков,
00:08:41о том, какой длины может быть ваш промпт,
00:08:44и сделали это более полугода назад,
00:08:46сейчас вы неправы,
00:08:48и вам, вероятно, стоит перестроить свой подход к работе.
00:08:52Но в этой истории есть и продолжение,
00:08:54потому что то, как модели давали сбой,
00:08:59драматически изменилось,
00:09:00и характер этих сбоев очень важен.
00:09:02Эта часть стала совершенно неожиданным открытием,
00:09:06когда я только начал эксперимент.
00:09:07Сначала это сильно испортило мне весь тест,
00:09:10потому что старый режим сбоев был скучным.
00:09:13Они просто забывали инструкции,
00:09:14и я мог измерить, сколько именно инструкций
00:09:16они запомнили, а сколько забыли.
00:09:17Но новые модели ломаются по-своему, странно
00:09:20и весьма специфично для каждой.
00:09:22Позвольте рассказать вам, как дают сбой эти четыре модели.
00:09:26Deep Seek 4 — это традиционная модель.
00:09:29Она просто забывает вещи.
00:09:30Без всякой драмы.
00:09:31Она начинает забывать инструкции примерно на 750 правилах,
00:09:35а к 2000 теряет почти половину из них.
00:09:38Так что она просто забывает, что, откровенно говоря, является сбоем,
00:09:41которому я больше всего доверяю, потому что он предсказуем.
00:09:43Его очень легко измерить.
00:09:44Остальные же модели вели себя далеко не так сговорчиво.
00:09:48Opus 4.7 могла снова и снова решать,
00:09:52что этот тест представляет опасность.
00:09:54И тогда она просто отказывалась
00:09:57завершать тест на уровне API.
00:09:59Я и не знал, что от Claude можно получить
00:10:01ответ от API в таком духе:
00:10:03«Нет, я могу это сделать, но не буду».
00:10:06Но это вполне реальный ответ на уровне API,
00:10:09который поддерживает Claude, поскольку
00:10:10они очень заботятся о безопасности, и я стал
00:10:13получать их постоянно.
00:10:15И происходило это потому,
00:10:16что у Claude очень чувствительный классификатор безопасности.
00:10:19Если ввести определенные комбинации слов,
00:10:22скажем, сибирская язва и цианид,
00:10:24он решает, что весь запрос опасен,
00:10:26и прерывает работу.
00:10:27А если помните, что делает мой тест,
00:10:29мой тест добавляет от 5 до 10 тысяч случайных слов
00:10:33в файл с инструкциями.
00:10:35И поэтому среди моих случайно выбранных слов оказалось
00:10:38множество всего, что в комбинации
00:10:39выглядело опасным для фильтра безопасности.
00:10:41Поэтому он постоянно прерывался, заявляя,
00:10:43что я прошу его сделать бомбу или что-то в этом роде.
00:10:47Так что, чтобы заставить Claude сотрудничать, мне пришлось взять все свои слова
00:10:52и прогнать их через фильтр безопасности
00:10:54OpenAI, отсеяв все подозрительные слова,
00:10:56чтобы хоть куда-то продвинуться.
00:10:58После этого Claude справился отлично.
00:10:59Но режим сбоя заключается в том, что Claude гораздо раньше
00:11:03может решить, что то, что вы делаете, опасно
00:11:05— ну, скажем, уже на двух или трехстах инструкциях, —
00:11:08если ваша задача
00:11:11содержит что-то связанное с медицинскими советами,
00:11:13поскольку медицинские темы часто имеют двойное назначение.
00:11:15Они могут быть как опасными, так и безопасными.
00:11:17Третьим режимом сбоя стал Gemini 3.1 Pro.
00:11:20Gemini работает безупречно вплоть до 5000 инструкций.
00:11:24Он справляется чрезвычайно хорошо.
00:11:28Пожалуй, один из лучших в рейтинге.
00:11:30А дальше начинаются странности.
00:11:32Он не забывает инструкции.
00:11:35Он просто оказывается ими перегружен.
00:11:37Он пытается использовать токены рассуждения,
00:11:39чтобы убедиться, что он выполняет
00:11:44все инструкции одновременно.
00:11:45И когда количество инструкций становится очень большим,
00:11:46он тратит на это все свои токены рассуждения.
00:11:48он расходует все токены на размышления.
00:11:50Он тратит весь свой лимит токенов на раздумья,
00:11:53а затем вообще не выдает никакого ответа.
00:11:55То есть, ну, доходит до девяти, знаете,
00:11:57если вы дали ему 10 000 токенов объема,
00:11:59он потратит 9 500 токенов на размышления,
00:12:02а потом выдаст ответ на 500 слов,
00:12:04в котором не будет ни единого нужного токена.
00:12:07То есть он сам себя загоняет в угол
00:12:09и у него не остается места для реального ответа,
00:12:10что очень дорого и совершенно бесполезно,
00:12:13что вполне в его стиле, правда?
00:12:19Хотя, знаете, вслух я бы такое никогда не сказал.
00:12:23И наконец появляется победитель — это GPT 5.5.
00:12:26GPT 5.5 — лучший из всех, точность 99%,
00:12:29вплоть до 5000 правил.
00:12:32Но если надавить на нее сильнее,
00:12:33она оказывается самой странной из всех.
00:12:35Потому что она не отказывается напрямую,
00:12:37она не забывает молча.
00:12:38Вместо этого она начинает возмущаться
00:12:41и заявляет, что этот тест — полная глупость.
00:12:45Она начинает отчет, доходит до пары...
00:12:47в том-то и дело,
00:12:48она не начинает сразу с отказа.
00:12:50Она берется за отчет,
00:12:51начинает писать отчет,
00:12:52и где-то через 500 слов текста
00:12:54выдает: нет, это бред.
00:12:55Я не буду этого делать.
00:12:56И вежливо сообщает вам, что это глупость.
00:12:58Я больше не собираюсь этим заниматься.
00:13:00Такой ответ она мне выдала на самом деле.
00:13:02Но это было примерно после 5000 слов бизнес-отчета,
00:13:05который я приказал ей сгенерировать.
00:13:08И ведь она не права, да?
00:13:10Я просил связный бизнес-отчет
00:13:12на произвольную тему,
00:13:14содержащий 5000 случайных слов.
00:13:17Ты права, GPT.
00:13:19Просить об этом — полная глупость.
00:13:23Это крайне неразумная просьба,
00:13:25и GPT указала мне на это.
00:13:27Но в тесте это все равно считается провалом.
00:13:29Потому что в полуготовом отчете, который она выдает,
00:13:31отсутствует большинство ключевых слов,
00:13:32и это к тому же сложнее всего заметить.
00:13:35Потому что Claude сливается сразу.
00:13:36Claude говорит: нет,
00:13:37я не стану этого делать.
00:13:39Deep Seek старается изо всех сил.
00:13:41Но GPT справляется вроде бы неплохо,
00:13:44пока не дочитаешь до конца отчета,
00:13:46где говорится: нет, вообще-то,
00:13:47я бросаю это дело, потому что это глупость.
00:13:51Так что, если отступить на шаг и посмотреть на все четыре,
00:13:53Deep Seek тихонько все забывает.
00:13:54Claude пугается и отказывается.
00:13:56Gemini заумствованиями доводит себя до молчания.
00:13:58А GPT 5.5 выполняет половину работы
00:14:00и заявляет, что остальное ниже ее достоинства.
00:14:04И дело вовсе не в том, какая из них смешнее.
00:14:07Хотя это и правда забавно.
00:14:09Суть в том, что вопрос «следовал ли он моим инструкциям»
00:14:12больше не сводится к одному типу сбоя.
00:14:14У него есть четыре разных сценария отказа.
00:14:16И этот сбой невозможно распознать, если вы не знаете,
00:14:19с какой именно моделью вы работаете и каков ее паттерн сбоев.
00:14:23Итак, модели стали в 10 раз лучше.
00:14:27Они сбоят забавными способами.
00:14:29Почему вам должно быть до этого дело по возвращении на рабочее место?
00:14:31Потому что в вашем рабочем процессе изменились три вещи.
00:14:34Первая: год назад было разумно делать каждый файл навыков очень-очень коротким.
00:14:39Меньше 200 инструкций, а дальше ссылаться на поднавыки и целые византийские лабиринты дополнительных файлов навыков, подфайлов и прочего в таком духе.
00:14:50Вы сжимали свои инструкции, чтобы поместить их в очень ограниченное доступное пространство, и теперь в этом больше нет необходимости.
00:14:57Ваши файлы навыков могут быть очень длинными.
00:14:59Второе — если для вашего сценария нужно сто или триста конкретных правил, вы можете просто поместить их все в промпт.
00:15:06Вам не нужно лежать без сна и гадать, какие именно из них модель молча проигнорировала.
00:15:12И если вы вспомните собственный опыт использования моделей, то наверняка это замечали.
00:15:21Вы заметили, что стали меньше беспокоиться о длине промпта, потому что модели действительно стали в 10 раз лучше следовать инструкциям.
00:15:322000 поименованных ограничений — это целое руководство по стилю, верно?
00:15:35Это каждое правило бренда, каждый юридический дисклеймер.
00:15:38Год назад вам пришлось бы распределять это по дюжине специализированных агентов и надеяться, что они аккуратно передают задачи друг другу.
00:15:46Но теперь об этом можно забыть.
00:15:48Но третья вещь — самая главная.
00:15:50Раньше вопрос стоял так: способна ли вообще модель на это?
00:15:53И теперь ответ звучит уверенно: да.
00:15:55Ну, относительно уверенно.
00:15:58Новый вопрос: стоит ли это своих денег?
00:16:01Потому что вы можете включить в промпт 10 000 слов — простите, 10 000 разных инструкций, но это будет огромный промпт.
00:16:07Это будет очень дорогой промпт.
00:16:09Это будет очень медленный промпт.
00:16:10Так что то, что раньше было жесткой стеной, превратилось в мягкий компромисс: стоит ли мне добавлять все эти лишние инструкции, если это приведет к росту затрат и задержек?
00:16:19А теперь перейдем к оговоркам, чтобы опередить вопросы.
00:16:25Первое и самое важное: я упоминал об этом ранее, это прокси-задача; включение случайных слов в фальшивый бизнес-отчет является лишь свидетельством того, что длинный файл навыков работает.
00:16:38Это не то же самое, что доказательство работоспособности длинного файла навыков.
00:16:41Кроме того, модели упираются в стену при совершенно разных объемах — от 750 до более чем 9000 токенов, так что модель нужно выбирать очень осторожно.
00:16:49Наш тест не измеряет, насколько четко модель рассуждает при обработке гигантского промпта.
00:16:57Хорошая новость в том, что с тех пор, как я провел свое исследование несколько недель назад, к этому делу подключилась куча людей, и теперь есть качественные исследования.
00:17:05К процессу подключились настоящие ученые — Chroma провела работу по изучению деградации контекста (context rot) на 18 моделях, показав, что точность на длинных входах может падать на 30–50% задолго до достижения лимита контекстного окна.
00:17:21Самым странным в их выводах оказалось то, что когерентный, хорошо структурированный текст с большей вероятностью приводит к такому сбою, чем если просто расположить инструкции в случайном порядке и перемешать их.
00:17:33Я не знаю, почему так происходит, для этого нужно читать их отчет.
00:17:37Итак, модель способна отслеживать 2000, 5000, возможно, 10 000 инструкций, но это не значит, что она будет выстраивать по ним логичные рассуждения.
00:17:46Совсем не обязательно — если эти инструкции противоречат друг другу, если между ними есть напряжение, она не обязательно справится с этим верно.
00:17:53А еще есть второй момент, о котором я вкратце упоминал.
00:17:56Отказы Claude раздражают, но они явные.
00:18:00Вы получаете ошибку и сразу знаете о сбое.
00:18:02Вежливый полуготовый отчет от GPT гораздо опаснее, потому что он выглядит как настоящий ответ.
00:18:07Вам приходится читать его целиком, чтобы заметить, что модель молча сдалась на полпути, а это значит, что доверять такому выводу нельзя.
00:18:13Это значит, что вам придется перечитывать результат каждый божий раз, чтобы убедиться в его работоспособности.
00:18:17Итак, модель примет ваши 2000 правил и выдаст вам нечто, что выглядит уверенным и отполированным — по крайней мере на первый взгляд, но на деле может оборваться на середине.
00:18:30К слову, меня постоянно спрашивают, во сколько мне все это обошлось.
00:18:34Запуск всех этих запросов обошелся мне в 209 долларов.
00:18:372300 вызовов по семи моделям вылились в 209 долларов.
00:18:43Оказывается, оригинальные исследования стоят совсем недорого.
00:18:46И в этой части выступления я говорил о том, что эти вещи необходимо проверять в продакшене, поскольку нельзя быть уверенным, что модель не потерпит молчаливый крах.
00:18:55Конечно, вы знали, что я рано или поздно упомяну эвалы (оценки), ведь я работаю в Arise и именно этим здесь и занимаюсь.
00:19:01Но рекламы Arise и так предостаточно.
00:19:03Поэтому я скажу лишь одну правду: если вы создаете реальное ИИ-приложение и ставите перед ним по-настоящему сложные задачи,
00:19:10вы столкнетесь с одним или несколькими такими типами сбоев передовой модели.
00:19:14И если только это не Claude, посылающий вас подальше на уровне API, единственный способ узнать о сбое — это мониторить свои выходы с помощью другой языковой модели.
00:19:23Это и есть эвал, этим и занимается Arise, на этом я и закончу.
00:19:27Я уже упоминал, что после наших собственных тестов появились новые исследования.
00:19:30Вот еще одно важное.
00:19:31Вышла научная работа, тестирующая 46 моделей, под названием «Пересмотр надежности языковых моделей при следовании инструкциям»,
00:19:37и можете поспорить, после моего собственного исследования мои уши тут же завяли.
00:19:41Исследователи обнаружили неприятную вещь: модель может блестяще справиться с бенчмарком вроде нашего и все равно оставаться крайне ненадежной.
00:19:47Потому что если переформулировать ту же инструкцию чуть иначе, это может кардинально повлиять на то, насколько хорошо модель ей следует.
00:19:56Итак, модель способна выполнять 2000 инструкций, и делает это действительно здорово.
00:20:00Но если расположить те же самые инструкции, те же 2000 инструкций в другом порядке, это может внезапно сильно ухудшить способность модели следовать им.
00:20:08А как именно это делать, каков правильный порядок инструкций для модели, чтобы она следовала им идеально, а не путалась — это исследования, которые все еще проводятся.
00:20:19Так что емкость выросла, но надежность по-прежнему остается проблемой.
00:20:24Ну а это просто небольшое хвастовство, потому что я был рад: я же не ученый, я просто провел кое-какие исследования.
00:20:31А затем целая куча настоящих ученых подключилась и занялась реальной наукой по тому же вопросу.
00:20:36Теперь появилось множество бенчмарков для измерения этого же параметра.
00:20:40Firebench, CCRbench, Guidebench пытаются измерить ровно одно и то же.
00:20:44Насколько хорошо модели справляются с массой реальных, запутанных ограничений одновременно.
00:20:49И теперь вся эта область изучает вопрос, так что если вам нужна наука получше моих, знаете, 10 000 случайных слов, настоящая наука уже существует.
00:20:58Это подводит меня к мысли, с которой я вас оставлю.
00:21:00Год назад самой сложной частью написания навыка было уместить все так, чтобы модель не потеряла нить.
00:21:05Это была проблема сжатия, и проблема сжатия решена.
00:21:08Модель прекрасно удержит ваши 2000 инструкций.
00:21:11Новая сложная задача — понять, сделала ли она то, что вы сказали, а это проблема верификации.
00:21:16Проблема верификации не решается написанием более качественного промпта.
00:21:20Она решается проверкой вывода каждый раз точно так же, как вы тестируете любой другой код — то есть с помощью эвалов.
00:21:26Потолок вырос в 10 раз за один год.
00:21:29Так что вернитесь назад и проверьте допущения, сделанные полгода назад, насчет того, какого размера должны быть промпты и насколько длинными могут быть инструкции, потому что они уже могут быть неверны.
00:21:41На этом доклад окончен.
00:21:42Если вам нужны весь код и все данные, они лежат по этому URL на GitHub.
00:21:48А этот второй QR-код заставил меня вставить маркетинг.
00:21:51Сегодня вечером в 17:00 мы проводим вечеринку по случаю просмотра Чемпионата мира.
00:21:55Вы можете прийти к нам на вечеринку.
00:21:56Эта ссылка ведет на Luma, которая поможет вам попасть на мероприятие.
00:22:01Я надеюсь, что этот доклад дал вам новую информацию или хотя бы пару поводов для смеха, огромное спасибо за ваше время и внимание.
00:22:07Спасибо.
00:22:08Спасибо.

Description

Laurie Voss reran a year old benchmark and the models walked straight through its ceiling without noticing it was there. IFScale asks a model to write a business report containing a list of exact words, then counts how many actually appear. A year ago frontier models started dropping instructions somewhere around 200 to 300, which is a hard limit on how much you can put in a skills file. Voss, head of developer relations at Arize AI and a cofounder of npm, first replicated that result on the three models from the original paper still reachable by API, then pointed the same test at the current frontier. They scored 100 percent immediately. He had to raise the benchmark from 500 words to 10,000 before anything broke at all. The boundary now sits near 2,000 instructions, and for the best model closer to 5,000, roughly a tenfold gain in twelve months. The stranger finding is that the models no longer fail the same way. One simply forgets, shedding nearly half its rules by 2,000. One refuses at the API level, because a pile of random words trips its safety classifier. One spends its whole thinking budget verifying instructions and leaves no room to answer. The last writes five thousand words of the report, decides the request is stupid, says so politely, and stops, which reads like a finished answer unless you get to the end. Voss argues this moves the work: fitting rules into a small budget was a compression problem and it is gone, while knowing whether the model obeyed is a verification problem that only checking outputs solves. The whole study cost 29 dollars. Speaker info: - https://x.com/seldo - https://www.linkedin.com/in/seldo/ - https://seldo.com Timestamps: 0:00 - The 200 instruction ceiling and where it came from 1:49 - Not knowing whether it followed your rules 2:58 - How the IFScale benchmark works 4:19 - Replicating last year's result 6:12 - Pointing the same test at current models 7:07 - The headline, a tenfold jump in a year 9:01 - Four models, four different ways to fail 14:27 - What this changes in your workflow 16:29 - Caveats, and what the test does not prove 19:32 - Capacity went up, reliability did not 21:06 - Compression solved, verification remains

Community Posts

No posts yet. Be the first to write about this video!

Write about this video