Как долго ваши навыки актуальны, прежде чем агент забудет сказанное? — Лори Восс, Arize AI
AAI Engineer
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00-
00:00:12- Всем привет.
00:00:15Спасибо, что пришли на этот донельзя гиковский доклад.
00:00:20У этого доклада очень длинное название,
00:00:22так что позвольте сразу назвать краткую версию.
00:00:23Вы пишете файлы навыков и напихиваете их инструкциями.
00:00:27В какой-то момент модель перестает следить за всеми ними.
00:00:31Вопрос в том, где этот предел?
00:00:33В какой момент вы добавляете слишком много инструкций
00:00:35в свои файлы навыков?
00:00:36И за последний год ответ сильно изменился.
00:00:40Я Лори, руководитель отдела по работе с разработчиками в Arise AI.
00:00:44В прошлом я сооснователь NPM Inc.
00:00:46Так что некоторые из вас могут знать меня по дням JavaScript.
00:00:48В последнее время я много думаю об ИИ
00:00:50и о том, как его тестировать.
00:00:53Пару месяцев назад я была на конференции AI Engineer в Майами,
00:00:55и это была хорошая конференция.
00:00:57И я слушала доклад Декстера Хорти.
00:00:59Это был хороший доклад.
00:01:00Совсем не на эту тему.
00:01:02Но пока он выступал,
00:01:04он между делом упомянул,
00:01:06что агент может следовать примерно 200 инструкциям,
00:01:10прежде чем начнет забывать их.
00:01:13А затем он продолжил свое выступление,
00:01:15и это было сказано вскользь.
00:01:17И он упомянул, что эта цифра из 2025 года,
00:01:20так что сейчас всё может быть лучше.
00:01:22И я на секунду перестала слушать,
00:01:25потому что подумала: 200 инструкций
00:01:27— это ведь совсем немного, правда?
00:01:31Нормальный файл навыков перешагивает отметку в 200 инструкций
00:01:33почти мгновенно.
00:01:35Если пользователь говорит X, делай Y,
00:01:37всегда включай раздел о Z,
00:01:39никогда не используй фразу W,
00:01:40каждая из них — отдельная инструкция.
00:01:42И если модель тихо перестает следить за ними после 200,
00:01:45это очень жесткий потолок
00:01:47для сложности того, что вы можете создать.
00:01:49Поэтому мне сначала захотелось узнать, откуда он взял эту цифру,
00:01:52и правда ли это.
00:01:55Вы ведь знаете это чувство.
00:01:57Вы пишете этот большой прекрасный файл навыков,
00:01:58страницы правил, крайние случаи, тон, форматирование.
00:02:00Вы передаете его агенту.
00:02:01Он выполняет задачу.
00:02:03И вы смотрите на результат и думаете:
00:02:05а он вообще обратил внимание?
00:02:07Действительно ли он следовал всем этим правилам?
00:02:09Или он просто сделал то, что ему показалось нужным,
00:02:11и выдал некое подобие
00:02:14того, чего я ожидала?
00:02:16Трудно сказать, или нет?
00:02:18Подробнее об этом позже.
00:02:20И вот вы живете с этой фоновой тревожностью
00:02:23каждый раз, когда нажимаете «Запуск».
00:02:24И это чувство — то, чему посвящено данное исследование,
00:02:27и мы пытаемся выяснить, можно ли его избежать.
00:02:30Итак, вот мое обещание на следующие 18 минут.
00:02:33Я покажу вам, откуда взялось это число 200,
00:02:36актуально ли оно до сих пор
00:02:37и каково реальное число на сегодня,
00:02:39потому что оно изменилось на порядок.
00:02:41А затем мы поговорим о том, что это значит
00:02:44для вас в качестве выводов.
00:02:46Какой на самом деле может быть длина ваших навыков и промптов
00:02:49и какие изменения в результате вам следует внести
00:02:51в свой рабочий процесс.
00:02:54Так что число 200 — это не фольклор.
00:02:57Оно взято из реального бенчмарка IfScale,
00:02:59из прошлогодней статьи вот этого парня, чью фамилию я исковеркаю,
00:03:03Ярославича и соавторов.
00:03:06И этот тест прекрасен в своей простоте.
00:03:10Вот как устроен IfScale.
00:03:12Вы просите модель написать бизнес-отчет
00:03:14и даете ей список конкретных слов,
00:03:16которые она обязательно должна включить в отчет.
00:03:19Включить точное слово «клиент»,
00:03:20включить точное слово «выручка»
00:03:22и так далее для скольких угодно слов.
00:03:24Каждое из них — это инструкция, которой нужно следовать.
00:03:27А затем вы считаете, сколько именно этих слов появилось в тексте.
00:03:32Так как тест очень простой,
00:03:34вам нужно держать в голове всего два числа.
00:03:36Одно из них — плотность, которую мы называем n.
00:03:38Это то, о скольких правилах идет речь одновременно.
00:03:41А второе — точность,
00:03:42которая представляет собой процент этих правил,
00:03:43которым модель действительно смогла следовать.
00:03:46Теперь вы можете сказать, что включение случайных слов в отчет
00:03:50не то же самое, что выполнение реальных инструкций,
00:03:52и это справедливо, и мы об этом поговорим.
00:03:55Но ключевые слова — это прокси.
00:03:57Задание «включить слово выручка» имеет ту же форму,
00:04:01что и «включить раздел об ценообразовании», верно?
00:04:02Или «никогда не использовать эту фразу».
00:04:04Это дискретное, именованное ограничение,
00:04:06о котором вы сказали агенту, что он должен ему следовать.
00:04:09Если модель не может отследить 200 слов в одном промпте,
00:04:11она определенно будет испытывать трудности
00:04:13с 200 более сложными инструкциями.
00:04:16Так что, если уж на то пошло, ей будет только хуже.
00:04:20Поэтому это число — потолок.
00:04:22Это число — максимум, выше которого не подняться.
00:04:23Если дать модели более сложные инструкции,
00:04:25этот показатель, вероятно, станет еще ниже.
00:04:27И 200 — это действительно низкий потолок.
00:04:30Поэтому, прежде чем гоняться за новыми моделями,
00:04:32нужно заняться качественной наукой,
00:04:33а это значит — воспроизвести старый результат
00:04:36и убедиться, что потолок в 200 действительно существует.
00:04:39И я перезапустила исходный бенчмарк.
00:04:42В оригинальной статье тестировалась целая пачка моделей,
00:04:45а модели появляются и исчезают очень быстро.
00:04:47Так что к тому времени, когда я добралась до этого тестирования,
00:04:50лишь три модели из исходного набора
00:04:52из 10 использованных ими моделей
00:04:54все еще были доступны через какой-либо API.
00:04:57Это были GPT 4.1, Claude Sonnet 4
00:04:59и Gemini 2.5 Pro.
00:05:01Это были модели, которые были доступны 12 месяцев назад
00:05:03и доступны до сих пор.
00:05:05И именно поэтому мы протестировали эти три,
00:05:07потому что они и остались.
00:05:08И с тех пор, как я впервые опубликовала это исследование
00:05:11пару недель назад,
00:05:12одна из этих трех моделей была отправлена в отставку.
00:05:14Так что это был последний момент, когда я могла
00:05:16провести этот тест.
00:05:17Так что из этого состава у нас осталось уже двое.
00:05:20Поэтому не привязывайтесь к своим моделям.
00:05:22А вот результаты, которые мы получили при воспроизведении
00:05:25оригинального открытия IfScale.
00:05:27По вертикальной оси отложена точность.
00:05:29Она начинается со 100% и начинает падать.
00:05:32А количество правил растет вдоль нижней оси
00:05:35в логарифмическом масштабе.
00:05:36То есть каждый раз при преодолении половины пути
00:05:37количество обрабатываемых правил удваивается.
00:05:42Так что к 500 правилам вы теряете 30, 40, 50% из них.
00:05:46Наши кривые совпали с результатами оригинальной статьи
00:05:49в пределах погрешности, так что вывод оказался верным.
00:05:52Год назад, где-то на отметке от 200 до 300 правил,
00:05:55передовые модели начинали сбоить.
00:05:57Это очень низкий потолок.
00:06:00Итак, это наша база, а теперь начинается самое интересное:
00:06:03мы взяли тот же самый тест
00:06:05и применили его к текущему передовому краю,
00:06:07вернее, к тому, каким он был
00:06:09на момент проведения теста.
00:06:10Я протестировал GPT 5.5, Claude Opus 4.7,
00:06:13поскольку версия 4.8 вышла через неделю после моего теста,
00:06:17Gemini 3.1 Pro и Deep Seek V4 Pro.
00:06:20Я дал им тот же промпт, те же слова,
00:06:22всё абсолютно то же самое, и сразу столкнулся с проблемой:
00:06:25они справились блестяще.
00:06:27Все они сразу набрали 100% в этом тесте,
00:06:30абсолютно без ошибок.
00:06:34Мы создали тест для поиска потолка,
00:06:36а модели прошли сквозь этот потолок
00:06:37даже не заметив его.
00:06:40И это стало проблемой, потому что бенчмарк
00:06:42был рассчитан максимум на 500 слов,
00:06:43поэтому мне пришлось изменить его,
00:06:45чтобы найти новый предел.
00:06:47Я сдвинул планку и добавил больше слов для включения.
00:06:50Я удвоил их количество с 500 до 1000,
00:06:52потом снова удвоил с 1000 до 2000,
00:06:55и продолжал делать это, пока не дошел до словарного
00:06:56запаса в 10 000 слов — именно там я начал находить предел
00:07:00возможностей современных моделей.
00:07:03Позвольте показать вам этот главный слайд с результатами.
00:07:06Вот они.
00:07:07Помните, что на оси X здесь используется логарифмическая шкала.
00:07:12То есть значения идут от 500 к 1000, 5000 и 10 000.
00:07:16Поэтому кажется, что график резко обрывается,
00:07:18хотя на самом деле это происходит на промежутке в тысячу чисел.
00:07:20Но посмотрите, как далеко вправо сместились эти новые кривые,
00:07:25прежде чем изогнуться.
00:07:26Год назад они падали уже на 200–300 инструкциях,
00:07:29а теперь, в зависимости от модели, граница ближе к 2000,
00:07:32а у лучших из них доходит до 5000 инструкций,
00:07:36прежде чем они начинают резко падать.
00:07:38Таким образом, примерно за 12 месяцев передовые модели стали примерно в 10 раз
00:07:41лучше справляться с одновременным выполнением инструкций.
00:07:44Это главный вывод, но здесь есть множество нюансов,
00:07:47в которых нужно разобраться.
00:07:49Способность отслеживать 2000 заданных ограничений в одном промпте
00:07:53теперь есть.
00:07:55И это действительно интересно, потому что мне кажется...
00:07:57не знаю, чувствуют ли это остальные,
00:07:59но мне казалось, что переход от, скажем,
00:08:04GPT 5.1 к GPT 5.5 был каким-то эволюционным, верно?
00:08:07Не казалось, что мы стали в 10 раз лучше,
00:08:09но этот тест имеет прямое отношение к очень практической вещи —
00:08:14насколько длинным может быть мой файл навыков?
00:08:17И за год мы стали в 10 раз лучше.
00:08:21Больше всего меня поражает то, что этому бенчмарку
00:08:23едва исполнился год.
00:08:25Год спустя 500 — это погрешность округления,
00:08:27и почва продолжает уходить у меня из-под ног.
00:08:29Я тестировал 4.7, а Opus 4.8 еще лучше.
00:08:35Так что эта диаграмма уже немного устарела,
00:08:36в чем, собственно, и суть.
00:08:37Если вы определили свои инженерные предположения
00:08:39о том, как должны работать файлы навыков,
00:08:41о том, какой длины может быть ваш промпт,
00:08:44и сделали это более полугода назад,
00:08:46сейчас вы неправы,
00:08:48и вам, вероятно, стоит перестроить свой подход к работе.
00:08:52Но в этой истории есть и продолжение,
00:08:54потому что то, как модели давали сбой,
00:08:59драматически изменилось,
00:09:00и характер этих сбоев очень важен.
00:09:02Эта часть стала совершенно неожиданным открытием,
00:09:06когда я только начал эксперимент.
00:09:07Сначала это сильно испортило мне весь тест,
00:09:10потому что старый режим сбоев был скучным.
00:09:13Они просто забывали инструкции,
00:09:14и я мог измерить, сколько именно инструкций
00:09:16они запомнили, а сколько забыли.
00:09:17Но новые модели ломаются по-своему, странно
00:09:20и весьма специфично для каждой.
00:09:22Позвольте рассказать вам, как дают сбой эти четыре модели.
00:09:26Deep Seek 4 — это традиционная модель.
00:09:29Она просто забывает вещи.
00:09:30Без всякой драмы.
00:09:31Она начинает забывать инструкции примерно на 750 правилах,
00:09:35а к 2000 теряет почти половину из них.
00:09:38Так что она просто забывает, что, откровенно говоря, является сбоем,
00:09:41которому я больше всего доверяю, потому что он предсказуем.
00:09:43Его очень легко измерить.
00:09:44Остальные же модели вели себя далеко не так сговорчиво.
00:09:48Opus 4.7 могла снова и снова решать,
00:09:52что этот тест представляет опасность.
00:09:54И тогда она просто отказывалась
00:09:57завершать тест на уровне API.
00:09:59Я и не знал, что от Claude можно получить
00:10:01ответ от API в таком духе:
00:10:03«Нет, я могу это сделать, но не буду».
00:10:06Но это вполне реальный ответ на уровне API,
00:10:09который поддерживает Claude, поскольку
00:10:10они очень заботятся о безопасности, и я стал
00:10:13получать их постоянно.
00:10:15И происходило это потому,
00:10:16что у Claude очень чувствительный классификатор безопасности.
00:10:19Если ввести определенные комбинации слов,
00:10:22скажем, сибирская язва и цианид,
00:10:24он решает, что весь запрос опасен,
00:10:26и прерывает работу.
00:10:27А если помните, что делает мой тест,
00:10:29мой тест добавляет от 5 до 10 тысяч случайных слов
00:10:33в файл с инструкциями.
00:10:35И поэтому среди моих случайно выбранных слов оказалось
00:10:38множество всего, что в комбинации
00:10:39выглядело опасным для фильтра безопасности.
00:10:41Поэтому он постоянно прерывался, заявляя,
00:10:43что я прошу его сделать бомбу или что-то в этом роде.
00:10:47Так что, чтобы заставить Claude сотрудничать, мне пришлось взять все свои слова
00:10:52и прогнать их через фильтр безопасности
00:10:54OpenAI, отсеяв все подозрительные слова,
00:10:56чтобы хоть куда-то продвинуться.
00:10:58После этого Claude справился отлично.
00:10:59Но режим сбоя заключается в том, что Claude гораздо раньше
00:11:03может решить, что то, что вы делаете, опасно
00:11:05— ну, скажем, уже на двух или трехстах инструкциях, —
00:11:08если ваша задача
00:11:11содержит что-то связанное с медицинскими советами,
00:11:13поскольку медицинские темы часто имеют двойное назначение.
00:11:15Они могут быть как опасными, так и безопасными.
00:11:17Третьим режимом сбоя стал Gemini 3.1 Pro.
00:11:20Gemini работает безупречно вплоть до 5000 инструкций.
00:11:24Он справляется чрезвычайно хорошо.
00:11:28Пожалуй, один из лучших в рейтинге.
00:11:30А дальше начинаются странности.
00:11:32Он не забывает инструкции.
00:11:35Он просто оказывается ими перегружен.
00:11:37Он пытается использовать токены рассуждения,
00:11:39чтобы убедиться, что он выполняет
00:11:44все инструкции одновременно.
00:11:45И когда количество инструкций становится очень большим,
00:11:46он тратит на это все свои токены рассуждения.
00:11:48он расходует все токены на размышления.
00:11:50Он тратит весь свой лимит токенов на раздумья,
00:11:53а затем вообще не выдает никакого ответа.
00:11:55То есть, ну, доходит до девяти, знаете,
00:11:57если вы дали ему 10 000 токенов объема,
00:11:59он потратит 9 500 токенов на размышления,
00:12:02а потом выдаст ответ на 500 слов,
00:12:04в котором не будет ни единого нужного токена.
00:12:07То есть он сам себя загоняет в угол
00:12:09и у него не остается места для реального ответа,
00:12:10что очень дорого и совершенно бесполезно,
00:12:13что вполне в его стиле, правда?
00:12:19Хотя, знаете, вслух я бы такое никогда не сказал.
00:12:23И наконец появляется победитель — это GPT 5.5.
00:12:26GPT 5.5 — лучший из всех, точность 99%,
00:12:29вплоть до 5000 правил.
00:12:32Но если надавить на нее сильнее,
00:12:33она оказывается самой странной из всех.
00:12:35Потому что она не отказывается напрямую,
00:12:37она не забывает молча.
00:12:38Вместо этого она начинает возмущаться
00:12:41и заявляет, что этот тест — полная глупость.
00:12:45Она начинает отчет, доходит до пары...
00:12:47в том-то и дело,
00:12:48она не начинает сразу с отказа.
00:12:50Она берется за отчет,
00:12:51начинает писать отчет,
00:12:52и где-то через 500 слов текста
00:12:54выдает: нет, это бред.
00:12:55Я не буду этого делать.
00:12:56И вежливо сообщает вам, что это глупость.
00:12:58Я больше не собираюсь этим заниматься.
00:13:00Такой ответ она мне выдала на самом деле.
00:13:02Но это было примерно после 5000 слов бизнес-отчета,
00:13:05который я приказал ей сгенерировать.
00:13:08И ведь она не права, да?
00:13:10Я просил связный бизнес-отчет
00:13:12на произвольную тему,
00:13:14содержащий 5000 случайных слов.
00:13:17Ты права, GPT.
00:13:19Просить об этом — полная глупость.
00:13:23Это крайне неразумная просьба,
00:13:25и GPT указала мне на это.
00:13:27Но в тесте это все равно считается провалом.
00:13:29Потому что в полуготовом отчете, который она выдает,
00:13:31отсутствует большинство ключевых слов,
00:13:32и это к тому же сложнее всего заметить.
00:13:35Потому что Claude сливается сразу.
00:13:36Claude говорит: нет,
00:13:37я не стану этого делать.
00:13:39Deep Seek старается изо всех сил.
00:13:41Но GPT справляется вроде бы неплохо,
00:13:44пока не дочитаешь до конца отчета,
00:13:46где говорится: нет, вообще-то,
00:13:47я бросаю это дело, потому что это глупость.
00:13:51Так что, если отступить на шаг и посмотреть на все четыре,
00:13:53Deep Seek тихонько все забывает.
00:13:54Claude пугается и отказывается.
00:13:56Gemini заумствованиями доводит себя до молчания.
00:13:58А GPT 5.5 выполняет половину работы
00:14:00и заявляет, что остальное ниже ее достоинства.
00:14:04И дело вовсе не в том, какая из них смешнее.
00:14:07Хотя это и правда забавно.
00:14:09Суть в том, что вопрос «следовал ли он моим инструкциям»
00:14:12больше не сводится к одному типу сбоя.
00:14:14У него есть четыре разных сценария отказа.
00:14:16И этот сбой невозможно распознать, если вы не знаете,
00:14:19с какой именно моделью вы работаете и каков ее паттерн сбоев.
00:14:23Итак, модели стали в 10 раз лучше.
00:14:27Они сбоят забавными способами.
00:14:29Почему вам должно быть до этого дело по возвращении на рабочее место?
00:14:31Потому что в вашем рабочем процессе изменились три вещи.
00:14:34Первая: год назад было разумно делать каждый файл навыков очень-очень коротким.
00:14:39Меньше 200 инструкций, а дальше ссылаться на поднавыки и целые византийские лабиринты дополнительных файлов навыков, подфайлов и прочего в таком духе.
00:14:50Вы сжимали свои инструкции, чтобы поместить их в очень ограниченное доступное пространство, и теперь в этом больше нет необходимости.
00:14:57Ваши файлы навыков могут быть очень длинными.
00:14:59Второе — если для вашего сценария нужно сто или триста конкретных правил, вы можете просто поместить их все в промпт.
00:15:06Вам не нужно лежать без сна и гадать, какие именно из них модель молча проигнорировала.
00:15:12И если вы вспомните собственный опыт использования моделей, то наверняка это замечали.
00:15:21Вы заметили, что стали меньше беспокоиться о длине промпта, потому что модели действительно стали в 10 раз лучше следовать инструкциям.
00:15:322000 поименованных ограничений — это целое руководство по стилю, верно?
00:15:35Это каждое правило бренда, каждый юридический дисклеймер.
00:15:38Год назад вам пришлось бы распределять это по дюжине специализированных агентов и надеяться, что они аккуратно передают задачи друг другу.
00:15:46Но теперь об этом можно забыть.
00:15:48Но третья вещь — самая главная.
00:15:50Раньше вопрос стоял так: способна ли вообще модель на это?
00:15:53И теперь ответ звучит уверенно: да.
00:15:55Ну, относительно уверенно.
00:15:58Новый вопрос: стоит ли это своих денег?
00:16:01Потому что вы можете включить в промпт 10 000 слов — простите, 10 000 разных инструкций, но это будет огромный промпт.
00:16:07Это будет очень дорогой промпт.
00:16:09Это будет очень медленный промпт.
00:16:10Так что то, что раньше было жесткой стеной, превратилось в мягкий компромисс: стоит ли мне добавлять все эти лишние инструкции, если это приведет к росту затрат и задержек?
00:16:19А теперь перейдем к оговоркам, чтобы опередить вопросы.
00:16:25Первое и самое важное: я упоминал об этом ранее, это прокси-задача; включение случайных слов в фальшивый бизнес-отчет является лишь свидетельством того, что длинный файл навыков работает.
00:16:38Это не то же самое, что доказательство работоспособности длинного файла навыков.
00:16:41Кроме того, модели упираются в стену при совершенно разных объемах — от 750 до более чем 9000 токенов, так что модель нужно выбирать очень осторожно.
00:16:49Наш тест не измеряет, насколько четко модель рассуждает при обработке гигантского промпта.
00:16:57Хорошая новость в том, что с тех пор, как я провел свое исследование несколько недель назад, к этому делу подключилась куча людей, и теперь есть качественные исследования.
00:17:05К процессу подключились настоящие ученые — Chroma провела работу по изучению деградации контекста (context rot) на 18 моделях, показав, что точность на длинных входах может падать на 30–50% задолго до достижения лимита контекстного окна.
00:17:21Самым странным в их выводах оказалось то, что когерентный, хорошо структурированный текст с большей вероятностью приводит к такому сбою, чем если просто расположить инструкции в случайном порядке и перемешать их.
00:17:33Я не знаю, почему так происходит, для этого нужно читать их отчет.
00:17:37Итак, модель способна отслеживать 2000, 5000, возможно, 10 000 инструкций, но это не значит, что она будет выстраивать по ним логичные рассуждения.
00:17:46Совсем не обязательно — если эти инструкции противоречат друг другу, если между ними есть напряжение, она не обязательно справится с этим верно.
00:17:53А еще есть второй момент, о котором я вкратце упоминал.
00:17:56Отказы Claude раздражают, но они явные.
00:18:00Вы получаете ошибку и сразу знаете о сбое.
00:18:02Вежливый полуготовый отчет от GPT гораздо опаснее, потому что он выглядит как настоящий ответ.
00:18:07Вам приходится читать его целиком, чтобы заметить, что модель молча сдалась на полпути, а это значит, что доверять такому выводу нельзя.
00:18:13Это значит, что вам придется перечитывать результат каждый божий раз, чтобы убедиться в его работоспособности.
00:18:17Итак, модель примет ваши 2000 правил и выдаст вам нечто, что выглядит уверенным и отполированным — по крайней мере на первый взгляд, но на деле может оборваться на середине.
00:18:30К слову, меня постоянно спрашивают, во сколько мне все это обошлось.
00:18:34Запуск всех этих запросов обошелся мне в 209 долларов.
00:18:372300 вызовов по семи моделям вылились в 209 долларов.
00:18:43Оказывается, оригинальные исследования стоят совсем недорого.
00:18:46И в этой части выступления я говорил о том, что эти вещи необходимо проверять в продакшене, поскольку нельзя быть уверенным, что модель не потерпит молчаливый крах.
00:18:55Конечно, вы знали, что я рано или поздно упомяну эвалы (оценки), ведь я работаю в Arise и именно этим здесь и занимаюсь.
00:19:01Но рекламы Arise и так предостаточно.
00:19:03Поэтому я скажу лишь одну правду: если вы создаете реальное ИИ-приложение и ставите перед ним по-настоящему сложные задачи,
00:19:10вы столкнетесь с одним или несколькими такими типами сбоев передовой модели.
00:19:14И если только это не Claude, посылающий вас подальше на уровне API, единственный способ узнать о сбое — это мониторить свои выходы с помощью другой языковой модели.
00:19:23Это и есть эвал, этим и занимается Arise, на этом я и закончу.
00:19:27Я уже упоминал, что после наших собственных тестов появились новые исследования.
00:19:30Вот еще одно важное.
00:19:31Вышла научная работа, тестирующая 46 моделей, под названием «Пересмотр надежности языковых моделей при следовании инструкциям»,
00:19:37и можете поспорить, после моего собственного исследования мои уши тут же завяли.
00:19:41Исследователи обнаружили неприятную вещь: модель может блестяще справиться с бенчмарком вроде нашего и все равно оставаться крайне ненадежной.
00:19:47Потому что если переформулировать ту же инструкцию чуть иначе, это может кардинально повлиять на то, насколько хорошо модель ей следует.
00:19:56Итак, модель способна выполнять 2000 инструкций, и делает это действительно здорово.
00:20:00Но если расположить те же самые инструкции, те же 2000 инструкций в другом порядке, это может внезапно сильно ухудшить способность модели следовать им.
00:20:08А как именно это делать, каков правильный порядок инструкций для модели, чтобы она следовала им идеально, а не путалась — это исследования, которые все еще проводятся.
00:20:19Так что емкость выросла, но надежность по-прежнему остается проблемой.
00:20:24Ну а это просто небольшое хвастовство, потому что я был рад: я же не ученый, я просто провел кое-какие исследования.
00:20:31А затем целая куча настоящих ученых подключилась и занялась реальной наукой по тому же вопросу.
00:20:36Теперь появилось множество бенчмарков для измерения этого же параметра.
00:20:40Firebench, CCRbench, Guidebench пытаются измерить ровно одно и то же.
00:20:44Насколько хорошо модели справляются с массой реальных, запутанных ограничений одновременно.
00:20:49И теперь вся эта область изучает вопрос, так что если вам нужна наука получше моих, знаете, 10 000 случайных слов, настоящая наука уже существует.
00:20:58Это подводит меня к мысли, с которой я вас оставлю.
00:21:00Год назад самой сложной частью написания навыка было уместить все так, чтобы модель не потеряла нить.
00:21:05Это была проблема сжатия, и проблема сжатия решена.
00:21:08Модель прекрасно удержит ваши 2000 инструкций.
00:21:11Новая сложная задача — понять, сделала ли она то, что вы сказали, а это проблема верификации.
00:21:16Проблема верификации не решается написанием более качественного промпта.
00:21:20Она решается проверкой вывода каждый раз точно так же, как вы тестируете любой другой код — то есть с помощью эвалов.
00:21:26Потолок вырос в 10 раз за один год.
00:21:29Так что вернитесь назад и проверьте допущения, сделанные полгода назад, насчет того, какого размера должны быть промпты и насколько длинными могут быть инструкции, потому что они уже могут быть неверны.
00:21:41На этом доклад окончен.
00:21:42Если вам нужны весь код и все данные, они лежат по этому URL на GitHub.
00:21:48А этот второй QR-код заставил меня вставить маркетинг.
00:21:51Сегодня вечером в 17:00 мы проводим вечеринку по случаю просмотра Чемпионата мира.
00:21:55Вы можете прийти к нам на вечеринку.
00:21:56Эта ссылка ведет на Luma, которая поможет вам попасть на мероприятие.
00:22:01Я надеюсь, что этот доклад дал вам новую информацию или хотя бы пару поводов для смеха, огромное спасибо за ваше время и внимание.
00:22:07Спасибо.
00:22:08Спасибо.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기