بناء طبقة سياق المستندات لوكلاء الذكاء الاصطناعي — جيري ليو، LlamaIndex

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00تُحَدَّث باستمرار داخل SharePoint لديك، لمجرد، مثلاً، البحث في قاعدة المعرفة بتقنية RAG.
00:00:04تعلمون، في هذه الحالات، تريد بالتأكيد ألا تكون غير دقيقة بشكل كبير،
00:00:08ولكن حتى لو كانت غير مرتبة قليلاً، فلا بأس بذلك أيضاً، لأنه في النهاية، إذا كان لديك
00:00:12وكيل ذكي جيد بدرجة كافية، فيمكنه دائماً التعمق أكثر في المستند وإظهار
00:00:16المعلومات الصحيحة مع الاقتباسات والإسناد المناسب. لذا، بالنسبة لهذه الحالات،
00:00:20فإن القدرة على إنشاء مسار فهرسة غير متصل بالإنترنت وقابل للتوسع ويتمتع بأفضل قيود التكلفة
00:00:25هو أمر مثالي. ولكن هناك أمر واحد يتعلق بالأساليب القائمة على VLMs، وهو أنها،
00:00:31كما تعلمون، ليست سريعة جداً عادةً، وأعتقد أنه في كثير من الأحيان، إذا كان لديك رفع ملفات
00:00:36في الوقت الفعلي، لنفترض أنك تستخدم Cloud Cowork، وقمت برفع 1000 مستند، وتحتاج إلى
00:00:41معالجتها في غضون دقيقة، فإن الاستعانة بمجموعة من نماذج VLM لمعالجة ذلك على نطاق واسع أمر صعبة حقاً
00:00:47على جميع خدمات OCR المتاحة تقريباً، ولنكون منصفين، يشمل ذلك خدمتنا أيضاً.
00:00:52أعتقد، بشكل عام، أن هناك حاجة أيضاً إلى حل ذي زمن انتقال منخفض للغاية
00:00:57حتى تتمكن بالفعل من معالجة البيانات في الوقت الفعلي، حتى لو كان لديك معالجة أعمق مدعومة بـ VLM
00:01:03من أجل نوع من الفحص والتحليل البصري الأعمق. وهذا ما أسميه
00:01:08التواجد ضمن حلقة الوكيل الذكي. فإلى جانب LlamaParse، وهو خدمتنا التجارية
00:01:12المخصصة لمعالجة المستندات واستخراجها، أنشأنا أيضاً هذه الأداة المسمى LightParse.
00:01:17إنها ممتازة حقاً بشكل مدهش. لا أعرف ما إذا كنتم قد تابعتم بعض منشورات Twitter،
00:01:21ولكنها قائمة على لغة Rust. وهي أسرع أداة تحليل مفتوحة المصدر متاحة. وهي مجانية
00:01:27تماماً، وبدون أي شروط مخفية تقريباً. أعتقد أنها بترخيص MIT أو Apache. وهي
00:01:33بالأساس الأكثر دقة بين أدوات تحليل markdown المتاحة التي لا تستخدم VLM أو
00:01:37أي نوع من النماذج الأكثر عمقاً. وهذا أمر رائع لأن بإمكانك استخدامها
00:01:43كخيار افتراضي في حلقة الوكيل المساعد. لنفترض أنك تقوم برفع مجموعة من المستندات
00:01:48إلى Cloud Code، Cloud Codework، أو Codex. وتريد منها معالجة ألف ملف PDF بسرعة
00:01:53فائقة. يمكنك دائماً فعل ذلك. ثم، كما تعلمون، تزويد المحلل القائم على VLM، مثل LlamaParse
00:01:59أو نماذج رائدة أخرى، كأداة. لذا، ما ستفعله هذه الوكلاء هو إجراء فحص سريع
00:02:04سريع لجميع المستندات أولاً. نوع من المسح السريع لجميع السياقات بكفاءة
00:02:09عالية للغاية. ثم إذا احتاجت بالفعل إلى التعمق في صفحة تحتوي على جداول أو
00:02:13مخططات بيانية وتحتاج إلى فهم القيم بشكل أعمق، فستستخدم أداة قائمة على VLM، بمعالجة
00:02:19أبطأ، للتأكد من قراءة المعلومات بشكل صحيح. هذا متاح
00:02:22كمهارة يمكن تثبيتها بنقرة واحدة. وهي تكمل أي أداة OCR أعمق قائمة على VLM
00:02:27تريد استخدامها. وقد صممناها لتكون بأسرع ما يمكن وسهلة
00:02:32التوصيل بوكيل الذكاء الاصطناعي المفضل لديك.
00:02:35لقد استعرضت الكثير من هذه الأمور بسرعة، ولكن بالأساس، قضينا
00:02:42وقتاً طويلاً على طبقة التحليل. هناك أيضاً مكونات عامة أخرى تتعلق بطبقة
00:02:47الدلالات والتخزين من حيث استخراج المستندات والبحث، وبالطبع، تدفقات
00:02:51عمل المستندات. أعتقد أنه بسب الوقت، سأتجاوز بعض المجالات غير المستكشفة،
00:02:57مثل صيغ المستندات المخصصة للوكلاء، والتحسين المتدرج كخدمة، وغيرها. لكني سأشارك
00:03:01مجموعة العروض التقديمية الكاملة عبر الإنترنت. بالنسبة لطبقة الدلالات والتخزين، إلى جانب
00:03:06تحليل المستندات، تتطلب العديد من حالات الاستخدام أيضاً استعادة معلومات منظمة
00:03:12على نطاق واسع من المستندات. سواء كنت تعالج ملايين الفواتير أو تقارير النفقات
00:03:16أو الإيصالات أو المطالبات، يجب عليك التأكد من أنك تريد بالفعل الحصول على
00:03:21مخرجات منظمة يمكنك إدخالها في قاعدة بيانات أو نظام لاحق. والعديد من حالات الاستخدام هذه
00:03:26تدور بالأساس حول كيفية أتمتة الكثير من أعباء العمل
00:03:31التي يقوم بها البشر عادةً في مسح الأوراق وإدخال البيانات.
00:03:36سواء كانت فواتير، أو مطالبات، أو عقود، أو إيصالات، أو غيرها. لقد أنشأنا هذه
00:03:41الإمكانيات داخل LlamaParse أيضاً. العديد من إمكانياتنا ضبطت بالفعل نحو
00:03:47التكلفة المنخفضة مع دقة عالية للغاية. وتحصل على اقتباسات تفصيلية ترجع
00:03:52مباشرة إلى المستند المصدر لكل مخرج تم استخراجه. وبالطبع، يمكنك تشغيل هذا في
00:03:56مسار العمل على نطاق واسع مع درجات الثقة. وأيضاً، القدرة على تحديد
00:04:02ما إذا كنا متأكدين من قيمة معينة أم لا قبل اتخاذ القرار بإدخالها في نوع ما
00:04:06من أنظمة البرمجيات. هناك أيضاً البحث في المستندات، وهو مجموعة أدوات موسعة كما ذكرت،
00:04:12حول الاسترجاع، وBM25، وgrep، والبحث الموجه، والقراءة، والتمرير. وكل هذه الإمكانيات
00:04:19متاحة ضمن بعض منصاتنا التجارية وكذلك العروض مفتوحة المصدر. لكني أردت فقط
00:04:23رسم صورة عن المفاهيم العامة المتاحة اليوم. لذا سأتجاوز هذا القسم حول الخطوات القادمة ثم أتنقل مباشرة إلى النهاية. أعلم أنني تجاوزت الوقت المخصص قليلاً، لذا أقدر لكم حقاً قضاء هذا الوقت اليوم. والآن دعوني فقط
00:04:36كيف أصل إلى هذا الجزء بسرعة. حسناً، سأتجاوز هذا الجزء وسأنشره عبر الإنترنت. جناحنا موجود في LG 47 إذا كنتم مهتمين بالمرور علينا. ونحن نستضيف بطولة بيكلبول ضخمة اليوم. شكر لكم على وقتكم.
00:05:06شكراً لكم.

설명

A PDF is designed for printing, so its text is glyphs with coordinates and its tables are line segments with characters at cell positions. Reading order for a multicolumn page is not stored anywhere. That, Jerry Liu argues, is why an agent handed a raw file cannot make sense of it, and why document OCR is still unsolved after twenty years. His larger frame is that RAG in 2026 decomposes into an agent harness plus a context layer. Retrieval complexity has moved into the agent, which now reasons about the right search term instead of hacking around top k retrieval; context has moved up the stack toward MCP servers and skills; and programs are increasingly written in English. For LlamaIndex, what remains is the ten trillion plus pages locked in PDFs, PowerPoints, Word documents, and spreadsheets. The platform he describes has three layers: parsing into token efficient markdown and metadata, semantic storage as document management for humans and agents, and repeatable workflows for invoices, KYC, and claims. On parsing he contrasts heuristic pipelines with one shot VLM reads that hallucinate on text pages and cost a lot, and pitches a hybrid routing between cheap specialized models and frontier ones. ParseBench, his public benchmark of two thousand human verified pages, scores around fifty models on tables, charts, and faithfulness, and shows how much is left. Three regimes follow: high accuracy for regulated finance, low cost for indexing a million documents a day, and low latency for a thousand uploads in a minute, which is where LightParse comes in: a free Rust parser he calls the fastest open source option, the first pass before a VLM tool dives into a page. Speaker info: - https://x.com/jerryjliu0 - https://www.linkedin.com/in/jerry-liu-64390071/ Timestamps: 0:00 - RAG in 2026: an agent harness plus a context layer 1:33 - From naive top k retrieval to agents that reason about search 3:11 - Context moves up the stack, programs move toward English 5:15 - Context is everything: ten trillion pages in document containers 6:52 - Three layers: parsing, semantic storage, document workflows 8:27 - Why document OCR is hard: PDFs are drawn, not written 10:46 - Pipelines, one shot VLMs, and the hybrid in between 13:29 - ParseBench: 2,000 human verified pages, fifty models 15:08 - High accuracy, low cost, and low latency regimes 16:45 - LightParse in the agent loop 18:46 - Extraction with citations, document search, and what's next

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기