TuBrief
Subscribed Channels
Videos
Community

Создание «чистой комнаты» ИИ-пайплайна исключительно на литературе до 1931 года

TuBrief Editorial
May 8, 2026
0
Computing/Software

Written with AI assistance from the source video. The video is the authority.

Русский한국어EspañolEnglish中文العربيةहिन्दीDeutschFrançaisPortuguêsBahasa Indonesia日本語

Related Video

Этот ИИ застрял в 1930 году (И это завораживает)6:55

Этот ИИ застрял в 1930 году (И это завораживает)

Better Stack

More from the community

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

September 13, 2026

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

September 13, 2026

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

September 13, 2026

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

September 13, 2026

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

September 12, 2026

Apple Won the AI Race

September 12, 2026

Comments (0)

Log in to leave a comment

No posts yet

© 2026 . All rights reserved.

TuBrief
Subscribed Channels
Videos
Community
Log in

Создание «чистой комнаты» ИИ-пайплайна исключительно на литературе до 1931 года

Современные LLM уже начинают «пожирать собственный хвост». Ответы моделей, поглотивших огромные массивы оценочных данных из интернета, скорее являются продуктом памяти, а не интеллекта. Чтобы увидеть истинную способность к рассуждению, необходимо использовать данные из времен, когда современных знаний еще не существовало. Ниже описан конкретный процесс создания среды обучения без загрязнений с использованием данных общественного достояния до 1931 года.

Получение доступа к хранилищам исторических текстов без авторских отчислений

Прежде чем тратить бюджет на сбор данных, стоит опустошить репозитории с истекшим сроком авторских прав. «Проект Гутенберг» содержит более 75 000 документов, а коллекция Sonny Bono Memorial в Internet Archive предоставляет бесплатный доступ к научным данным периода с 1923 по 1941 год.

  • Фильтрация по дате публикации: При вызове API gutendex на Python следует ориентироваться не на поле Issued в метаданных, а на год смерти автора и дату первого издания, оставляя только материалы до 1931 года.
  • Проверка целостности: Сверка ID Гутенберга с номером управления Библиотеки Конгресса США (LCCN) поможет предотвратить ошибки, связанные с перемешиванием годов издания.
  • Приоритет логики: Анализируя поле LCC в метаданных, в первую очередь скачивайте тексты по философии (B), математике (QA) и классической логике.

Гибридное восстановление для повышения точности OCR

Бумага столетней давности обветшала, а макеты газет сложны. Обычное OCR выдает массу опечаток. Необходим процесс, который сначала разбирает макет, а не просто копирует текст.

  • Анализ макета: Используйте фреймворк LayoutParser для разделения заголовков и табличных областей в документе. Для многоколоночных газетных статей следует использовать модель Newspaper Navigator для исправления порядка чтения.
  • Структурное извлечение: С помощью LayoutLM определите визуальные координаты и логическую последовательность текстовых блоков, после чего запускайте OCR по зонам.
  • Пост-коррекция на базе LLM: Используйте фреймворк REVISE. Назначьте LLM роль эксперта-корректора исторических документов, чтобы она исправляла ошибки распознавания, сохраняя орфографию эпохи. Этот процесс поднимает точность с 30% до уровня, пригодного для обучения, сокращая время очистки вдвое.

Фильтр из 5 000 стоп-слов для предотвращения утечки современных знаний

Необходимо помешать модели притворяться умной за счет использования современных знаний. Создайте систему мониторинга обучающего набора данных на основе списка терминов, появившихся после 1931 года.

  • N-gram сканирование: На основе данных о первых цитатах в Оксфордском словаре английского языка (OED) установите 5 000 современных понятий (например, «компьютер», «ДНК», «интернет») в качестве стоп-слов и сканируйте весь текст обучения по униграммам.
  • Удаление на уровне документа: Если обнаружено хотя бы одно стоп-слово, удаляйте не просто предложение, а весь документ. Это искореняет риск попадания современных комментариев или подделок.
  • Проверка на анахронизмы: Используйте модели вроде Claude Sonnet в качестве цензоров для оцифровки того, насколько часто в ответах модели встречаются концепции, не соответствующие эпохе.

Измерение реальных способностей через бенчмарк SAT 1926 года

Устаревшие данные не означают устаревший интеллект. Напротив, такие труды, как Principia Mathematica (1910) Бертрана Рассела, являются лучшим учебным пособием для развития дедуктивного мышления, чем современные веб-данные.

Для оценки используйте экзаменационные листы прошлого, ответы на которые не растиражированы в современном интернете. Используйте вопросы по искусственным языкам и логическому мышлению из первого теста SAT 1926 года. Измерение способностей к zero-shot рассуждению с помощью вопросов теста интеллекта Стэнфорд-Бине в редакции 1916 года четко покажет: заучила ли модель ответ или она мгновенно понимает и применяет данные правила. Модель, способная правильно ответить на вопросы вековой давности, — это и есть настоящий интеллект, свободный от подозрений в загрязнении данных.