Создание контекстного слоя документов для ИИ-агентов — Джерри Лю, LlamaIndex
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00знаете, постоянно обновляются у вас в SharePoint, просто для поиска по базе знаний RAG.
00:00:04Понятно, что в таких случаях хочется избежать совсем уж грубых ошибок,
00:00:08но даже если что-то немного исказится, ничего страшного, ведь в конечном счете,
00:00:12при наличии достаточно хорошего агента, он всегда может изучить документ глубже и извлечь
00:00:16нужную информацию с точными цитатами и обоснованием. Поэтому для таких задач возможность
00:00:20создать масштабируемый оффлайн-конвейер индексации с оптимальными затратами —
00:00:25это наилучшее решение. Однако у подходов на базе VLM есть одна особенность:
00:00:31как правило, они работают не очень быстро. И часто, когда у вас есть загрузка файлов в реальном времени —
00:00:36скажем, вы используете Cloud Cowork, загружаете 1000 документов, и вам нужно
00:00:41обработать их за минуту, — обработка такого объема кучей VLM становится сложнейшей задачей
00:00:47практически для любого сервиса OCR, и, честно говоря, для нашего в том числе. Я считаю,
00:00:52что в целом существует потребность в решении с крайне низкой задержкой,
00:00:57чтобы обрабатывать данные в реальном времени, даже если для более детального визуального анализа
00:01:03используются механизмы VLM. Именно это я и называю нахождением «в цикле агента».
00:01:08Помимо LlamaParse, нашего коммерческого сервиса для обработки
00:01:12и извлечения данных из документов, мы также создали инструмент под названием LightParse.
00:01:17И он работает удивительно хорошо. Не знаю, следили ли вы за тредами в Twitter,
00:01:21но он написан на Rust. Это самый быстрый парсер с открытым исходным кодом. Он абсолютно
00:01:27бесплатен и не содержит никаких скрытых условий — лицензия MIT или Apache.
00:01:33По сути, это самый точный парсер Markdown из тех, что не используют VLM
00:01:37или другие подобные сложные модели. И это очень удобно, так как его можно использовать
00:01:43по умолчанию в цикле вспомогательного агента. Допустим, вы загружаете пакет документов
00:01:48в Cloud Code, Cloud Codework или Codex и хотите невероятно быстро разобрать,
00:01:53скажем, тысячу PDF-файлов. Вы легко можете это сделать, а затем подключить VLM-парсер,
00:01:59например LlamaParse или другие передовые модели, как отдельный инструмент. В итоге агенты сначала
00:02:04быстро пробегутся по всем документам — предельно эффективно
00:02:09просканируют весь контекст. А затем, если потребуется детально изучить страницу с таблицами
00:02:13или графиками для глубокого понимания значений, агент задействует VLM-инструмент,
00:02:19пусть и с более медленной обработкой, чтобы корректно считать данные. Инструмент доступен
00:02:22как навык с установкой в один клик. Он отлично дополняет любой другой продвинутый OCR-инструмент
00:02:27на базе VLM. Мы постарались сделать его максимально быстрым и удобным
00:02:32для интеграции с вашим любимым ИИ-агентом.
00:02:35Я довольно бегло пробежался по этой теме, но, по сути, мы уделили немало времени
00:02:42уровню парсинга. Есть и другие компоненты, связанные с семантикой и хранением,
00:02:47касающиеся извлечения данных, поиска и, конечно же, документооборота.
00:02:51Из-за нехватки времени я, пожалуй, пропущу неисследованные темы,
00:02:57такие как нативные форматы документов для агентов, Hill-Climbing как сервис и прочее, но
00:03:01выложу полную презентацию в сеть. Что касается уровня семантики и хранения,
00:03:06помимо парсинга, во многих сценариях требуется получать структурированную информацию
00:03:12из документов в больших объемах. Обрабатываете ли вы миллион счетов,
00:03:16авансовых отчетов, чеков или заявлений, вам необходимо быть уверенными,
00:03:21что вы получаете структурированные данные для загрузки в баз данных или внешнюю систему.
00:03:26И большинство таких задач сводится к вопросу автоматизации процессов,
00:03:31которые обычно выполняют люди при сканировании бумаг и ручном вводе данных.
00:03:36Будь то счета, заявления, договоры, чеки или что-то еще. Мы добавили
00:03:41эти возможности и в LlamaParse. Многие функции оптимизированы для обеспечения
00:03:47низкой стоимости при высочайшей точности. Вы получаете детализированные ссылки
00:03:52на исходный документ для каждого извлеченного фрагмента. И, разумеется, вы можете запустить это
00:03:56в конвейере в больших масштабах с оценкой достоверности. Вы также сможете маркировать,
00:04:02уверена ли система в конкретном значении, перед его внесением
00:04:06в ПО. Также есть поиск по документам — расширенный набор инструментов,
00:04:12включающий поиск, BM25, grep, векторный поиск, чтение и скроллинг. Все эти функции
00:04:19доступны как на наших коммерческих платформах, так и в решениях с открытым кодом. Но мне также хотелось
00:04:23дать общее представление о современных концепциях. Раздел о планах на будущее я пропущу и перейду сразу к концу. Понимаю, что немного выбился из регламента, так что спасибо вам за внимание. И дайте мне
00:04:36буквально секунду быстренько дойти до этой части. Ах да, это я тоже пропущу и выложу в сеть. Наш стенд — LG 47, если хотите зайти. И сегодня мы устраиваем большой турнир по пиклболу. Спасибо за ваше время.
00:05:06Спасибо.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video