TuBrief
Subscribed Channels
Videos
Community

بناء خط أنابيب الغرفة النظيفة للذكاء الاصطناعي باستخدام أدبيات ما قبل عام 1931 فقط

TuBrief Editorial
May 8, 2026
0
Computing/Software

Written with AI assistance from the source video. The video is the authority.

العربية한국어EspañolEnglish中文हिन्दीDeutschFrançaisPortuguêsРусскийBahasa Indonesia日本語

Related Video

ذكاء اصطناعي عالق في عام 1930 (والنتائج مذهلة)6:55

ذكاء اصطناعي عالق في عام 1930 (والنتائج مذهلة)

Better Stack

More from the community

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

September 13, 2026

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

September 13, 2026

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

September 13, 2026

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

September 13, 2026

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

September 12, 2026

Apple Won the AI Race

September 12, 2026

Comments (0)

Log in to leave a comment

No posts yet

© 2026 . All rights reserved.

TuBrief
Subscribed Channels
Videos
Community
Log in

بناء خط أنابيب الغرفة النظيفة للذكاء الاصطناعي باستخدام أدبيات ما قبل عام 1931 فقط

لقد بدأت نماذج اللغات الكبيرة (LLMs) الحديثة بالفعل في التهام ذيولها. فمن المرجح أن تكون الإجابات التي تقدمها النماذج التي ابتلعت بيانات التقييم المنتشرة عبر الإنترنت بالكامل هي نتاج قوة الحفظ وليست نتاج الذكاء. إذا كنت ترغب في رؤية قدرات الاستدلال الحقيقية، فيجب عليك جلب بيانات من عصر لم تكن فيه المعرفة الحديثة موجودة أصلاً. لقد قمنا بتلخيص العمليات المحددة لإنشاء بيئة تعلم خالية من التلوث باستخدام بيانات الملكية العامة التي تعود إلى ما قبل عام 1931.

تأمين مستودعات النصوص التاريخية الخالية من حقوق الملكية

قبل إنفاق الميزانية على جمع البيانات، يجب عليك أولاً استغلال المستودعات التي انتهت صلاحية حقوق الطبع والنشر الخاصة بها. يضم مشروع غوتنبرغ (Project Gutenberg) أكثر من 75,000 وثيقة، كما توفر مجموعة "Sonny Bono Memorial Collection" في أرشيف الإنترنت بيانات أكاديمية من الفترة ما بين 1923 و1941 مجانًا.

  • التصفية بناءً على تاريخ النشر: عند استدعاء واجهة برمجة تطبيقات gutendex الخاصة بـ Python، لا تعتمد على حقل Issued في البيانات الوصفية، بل اترك فقط المواد التي تسبق عام 1931 بناءً على سنة وفاة المؤلف وتاريخ الطبعة الأولى.
  • التحقق من السلامة: يمكن أن يؤدي التحقق المتبادل من معرف غوتنبرغ (Gutenberg ID) مع رقم التحكم في مكتبة الكونجرس (LCCN) إلى منع وقوع حوادث اختلاط سنوات النشر.
  • استخراج الأولوية للمنطق: قم بتحليل حقل LCC في البيانات الوصفية لتنزيل النصوص المتعلقة بالفلسفة (B)، والرياضيات (QA)، والمنطق الكلاسيكي كأولوية قصوى.

الترميم الهجين لزيادة معدلات التعرف الضوئي على الحروف (OCR)

الورق الذي يعود تاريخه إلى 100 عام قديم، وتخطيطات الصحف معقدة. إذا قمت بتشغيل OCR عادي، فستظهر الكثير من الأخطاء المطبعية. نحن بحاجة إلى عملية تفكك التخطيط أولاً بدلاً من مجرد كشط النصوص.

  • تحليل التخطيط: قم بتشغيل إطار عمل LayoutParser للتمييز بين العناوين ومناطق الجداول داخل المستند. وبشكل خاص، يجب استخدام نموذج Newspaper Navigator لتصحيح ترتيب القراءة في أعمدة الصحف المتعددة.
  • الاستخراج الهيكلي: استخدم LayoutLM لتحديد معلومات الإحداثيات المرئية وتحديد الترتيب المنطقي لكتل النص، ثم قم بتشغيل OCR لكل منطقة.
  • التصحيح اللاحق القائم على LLM: استخدم إطار عمل REVISE. امنح النموذج دور مصحح وثائق تاريخية متخصص واجعله يصحح الكلمات التي تم التعرف عليها بشكل خاطئ مع الحفاظ على قواعد الإملاء في تلك الحقبة. ومن خلال هذه العملية، سيرتفع معدل التعرف من مستويات 30% إلى مستوى قابل للتعلم، وسيتم تقليل وقت التنقية إلى النصف.

منع تسرب المعرفة الحديثة بفلتر يضم 5,000 كلمة محظورة

يجب منع النموذج من التظاهر بالذكاء عبر سرقة المعرفة الحديثة. نقوم بإنشاء نظام يراقب مجموعات بيانات التدريب من خلال إنشاء قائمة بالمصطلحات التي ظهرت بعد عام 1931.

  • مسح N-gram: استنادًا إلى بيانات سنة أول اقتباس في قاموس أكسفورد الإنجليزي (OED)، قم بتعيين 5,000 مفهوم حديث مثل الكمبيوتر، والحمض النووي (DNA)، والإنترنت ككلمات محظورة، وامسح نص التدريب بالكامل بوحدات unigram.
  • التخلص من المستندات بالكامل: إذا تم العثور على كلمة محظورة واحدة، فلا تحذف تلك الجملة فحسب، بل احذف المستند بأكمله. هذا لاقتلاع احتمال وجود تعليقات حديثة أو تزوير من جذوره.
  • التحقق من الأخطاء الزمنية: استخدم نماذج مثل Claude Sonnet كمتحقق لقياس ما إذا كانت هناك مفاهيم لا تتناسب مع العصر مختلطة في الإجابات التي يولدها النموذج.

قياس المهارات الحقيقية عبر اختبار SAT لعام 1926

كون البيانات قديمة لا يعني أن الذكاء قديم. بل على العكس، فإن مؤلفات مثل Principia Mathematica (1910) لبرتراند راسل تعد مواد تعليمية أفضل من بيانات الويب الحديثة لتعليم التفكير الاستنتاجي.

للتقييم، استخدم أوراق الامتحانات القديمة التي لم يتم ملء إجاباتها في الإنترنت الحديث. استخدم أسئلة اللغة الاصطناعية والاستدلال المنطقي من أول اختبار SAT أُجري في عام 1926 كبيانات تقييم. إن قياس قدرة الاستدلال بنظام (zero-shot) باستخدام أسئلة اختبار ستانفورد بينيه للذكاء المنقح عام 1916 سيكشف بوضوح ما إذا كان النموذج قد حفظ الإجابات، أم أنه يفهم القواعد المعطاة ويطبقها على الفور. إن النموذج الذي يجيب بشكل صحيح على أسئلة من قبل 100 عام هو الذكاء الحقيقي الخالي من تهمة تلوث البيانات.