Membangun Document Context Layer untuk Agen AI — Jerry Liu, LlamaIndex

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00terus diperbarui di SharePoint Anda, hanya untuk pencarian
00:00:04berbasis pengetahuan RAG. Dalam kasus ini, Anda tentu ingin hasilnya tidak terlalu tidak akurat,
00:00:08tetapi kalaupun ada sedikit kekacauan, itu tidak masalah, karena pada akhirnya jika Anda memiliki
00:00:12agen yang cukup bagus, ia selalu bisa menggali lebih dalam ke dokumen dan menampilkan
00:00:16informasi yang tepat dengan kutipan dan acuan yang benar. Jadi untuk ini, kemampuan
00:00:20membuat alur pengindeksan luring yang dapat diskalakan dengan batasan biaya terbaik
00:00:25adalah hal yang optimal. Namun satu hal tentang pendekatan berbasis VLM adalah,
00:00:31biasanya tidak terlalu cepat, dan sering kali jika Anda memiliki pengunggahan berkas
00:00:36secara real-time, katakanlah Anda menggunakan Cloud Cowork, Anda mengunggah 1.000 dokumen, dan Anda perlu
00:00:41memprosesnya dalam semenit, memprosesnya dengan banyak VLM dalam skala besar sangatlah sulit
00:00:47bagi hampir semua layanan OCR di luar sana, dan sejujurnya, itu juga termasuk layanan kami. Saya
00:00:52pikir secara umum, ada juga semacam kebutuhan akan solusi berlatensi sangat rendah
00:00:57sehingga Anda benar-benar dapat memproses data secara real-time, bahkan jika Anda memiliki pemrosesan
00:01:03berbasis VLM yang lebih mendalam untuk semacam inspeksi dan analisis visual mendalam. Dan itulah yang saya sebut
00:01:08berada di dalam loop agen. Jadi, selain LlamaParse, yang merupakan layanan komersial kami
00:01:12seputar pemrosesan dan ekstraksi dokumen, kami juga membuat alat bernama LightParse ini.
00:01:17Ini mengejutkan sangat, sangat bagus. Saya tidak tahu apakah Anda mengikuti beberapa utas Twitter,
00:01:21tetapi ini berbasis Rust. Ini adalah parser sumber terbuka tercepat yang ada. Ini sepenuhnya
00:01:27gratis, dan pada dasarnya tanpa syarat. Lisensinya kalau tidak salah MIT atau Apache. Dan
00:01:33pada dasarnya ini adalah parser markdown paling akurat di luar sana yang tidak menggunakan VLM atau
00:01:37model yang lebih mendalam semacam itu. Dan ini bagus karena Anda bisa
00:01:43menggunakannya sebagai bawaan dalam loop agen pembantu. Katakanlah Anda mengunggah sekelompok dokumen
00:01:48ke Cloud Code, Cloud Codework, Codex. Dan Anda ingin memproses seribu PDF dengan sangat
00:01:53cepat. Anda selalu bisa melakukannya. Dan kemudian melengkapi parser berbasis VLM, seperti LlamaParse
00:01:59atau model mutakhir lainnya, sebagai alat. Jadi, agen-agen ini akan melakukan pemindaian cepat
00:02:04cepat awal pada semua dokumen terlebih dahulu. Seperti sekadar memindai semua konteks secara sangat
00:02:09efisien. Kemudian, jika memang perlu menggali ke halaman dengan tabel, dengan
00:02:13bagan, dan perlu memahami nilainya secara lebih mendalam, ia akan menggunakan alat berbasis VLM, pemrosesan yang lebih lambat,
00:02:19untuk memastikan bahwa ia membaca informasinya dengan benar. Ini tersedia
00:02:22sebagai skill yang dapat diinstal dengan satu klik. Melengkapi alat OCR berbasis VLM mendalam lainnya
00:02:27yang ingin Anda gunakan. Dan kami merancangnya agar secepat mungkin dan juga mudah untuk
00:02:32dihubungkan ke agen AI favorit Anda.
00:02:35Jadi, saya sudah menyampaikan banyak hal ini dengan cepat, namun pada dasarnya, kami menghabiskan
00:02:42banyak waktu pada lapisan parsing. Ada juga komponen umum lain di sekitar lapisan semantik
00:02:47dan penyimpanan dalam hal ekstraksi dan pencarian dokumen, dan tentu saja, seperti
00:02:51alur kerja dokumen. Karena keterbatasan waktu, saya mungkin akan melewatinya
00:02:57area yang belum terjelajahi, seperti format dokumen asli agen, hill-climbing sebagai layanan, dan lainnya. Tapi saya akan membagikan
00:03:01seluruh salindia secara daring. Dari segi lapisan semantik dan penyimpanan, selain
00:03:06parsing dokumen, banyak studi kasus yang juga memerlukan pengembalian informasi terstruktur
00:03:12dalam skala besar dari dokumen. Baik saat Anda memproses sejuta faktur atau laporan pengeluaran
00:03:16atau resi atau klaim, Anda perlu memastikan bahwa Anda sebenarnya ingin mendapatkan kembali
00:03:21luaran terstruktur yang dapat Anda masukkan ke dalam basis data atau sistem hilir. Jadi, banyak dari kasus penggunaan ini
00:03:26pada dasarnya berkisar pada bentuk, bagaimanakah cara mengotomatiskan banyak beban kerja
00:03:31yang biasanya dilakukan manusia dalam memindai banyak berkas dan melakukan entri data. Baik
00:03:36itu, sekali lagi, faktur, klaim, kontrak, resi, atau lainnya. Kami juga telah membuat
00:03:41kemampuan ini di dalam LlamaParse. Banyak kemampuan kami yang sebenarnya disesuaikan untuk
00:03:47biaya murah namun dengan akurasi sangat tinggi. Dan Anda mendapatkan kembali kutipan terperinci sampai
00:03:52ke dokumen sumber untuk setiap luaran yang diekstraksi. Dan tentu saja, Anda dapat menjalankannya dalam
00:03:56alur kerja berskala besar dengan skor keyakinan. Dan juga, kemampuan untuk benar-benar menandai
00:04:02apakah kita yakin tentang nilai tertentu atau tidak sebelum memutuskan untuk memasukkannya ke dalam semacam
00:04:06sistem perangkat lunak. Ada juga pencarian dokumen, yang pada dasarnya merupakan kumpulan alat yang diperluas, seperti yang saya sebutkan,
00:04:12seputar temu balik, BM25, grep, pencarian vektor, membaca, dan menggulir. Dan semua kemampuan ini
00:04:19tersedia dalam beberapa platform komersial kami serta penawaran sumber terbuka. Namun saya juga hanya ingin
00:04:23memberikan gambaran tentang konsep umum yang ada saat ini. Jadi saya akan melewati bagian tentang apa langkah selanjutnya dan mungkin langsung saja ke bagian akhir. Saya tahu waktu saya agak berlebih, jadi terima kasih banyak atas waktu Anda hari ini. Lalu izinkan saya
00:04:36melihat, bagaimana saya bisa ke bagian ini dengan cepat. Oh ya. Saya akan melewati bagian ini. Saya akan mengunggahnya secara daring. Stan kami ada di LG 47, jika Anda berminat untuk mampir. Dan kami mengadakan turnamen pickleball besar hari ini. Terima kasih atas waktu Anda.
00:05:06Terima kasih.

Key Takeaway

Efisiensi arsitektur agen AI dicapai dengan menggabungkan pemrosesan konteks cepat berlatensi rendah melalui LightParse dan pemrosesan VLM mendalam melalui LlamaParse untuk ekstraksi data terstruktur.

Highlights

  • LightParse adalah parser markdown berbasis Rust sumber terbuka tanpa VLM yang berlisensi MIT atau Apache.

  • Pemrosesan dokumen dengan banyak Vision Language Model (VLM) secara langsung pada skala besar memicu kendala latensi pada hampir semua layanan OCR.

  • Strategi pemindaian dua tahap menggunakan parser cepat untuk pemindaian awal dan alat berbasis VLM untuk pemrosesan tabel atau bagan yang lebih mendalam.

  • LlamaParse menyediakan fitur ekstraksi data terstruktur dengan kutipan hingga ke dokumen sumber serta skor keyakinan untuk verifikasi sebelum masuk ke sistem basis data.

Timeline

Tantangan Skalabilitas dan Latensi Pemrosesan Dokumen Berbasis VLM

  • Pengunggahan dokumen secara real-time seperti 1.000 berkas sekaligus sulit diproses cepat oleh layanan OCR berbasis VLM.
  • Sistem pencarian berbasis pengetahuan RAG membutuhkan keseimbangan antara batasan biaya dan kecepatan pengindeksan.
  • Solusi pemrosesan dokumen berlatensi sangat rendah diperlukan agar pemrosesan data real-time dapat berjalan efisien.

Pengindeksan luring yang dapat diskalakan menjadi pilihan optimal untuk menjaga efisiensi biaya. Namun, ketika pengguna mengunggah ribuan dokumen PDF sekaligus dalam alur kerja real-time, keterbatasan kecepatan VLM menjadi hambatan utama. Agen AI memerlukan mekanisme parsing berkecepatan tinggi agar tetap dapat bekerja di dalam loop tanpa hambatan latensi.

Optimasi Pemrosesan Dokumen Menggunakan LightParse dan LlamaParse

  • LightParse adalah parser markdown tercepat berbasis Rust yang dapat diinstal sebagai skill satu klik.
  • Alur kerja dua tahap mengombinasikan pemindaian cepat LightParse dengan analisis mendalam VLM untuk tabel dan bagan.
  • Pendekatan hibrida ini memangkas waktu pemrosesan dokumen dalam skala besar tanpa mengorbankan akurasi.

LightParse hadir sebagai parser sumber terbuka gratis berbasis Rust yang dirancang untuk kecepatan tinggi tanpa bergantung pada model visual yang berat. Agen AI memanfaatkannya untuk melakukan pemindaian cepat awal pada seluruh teks. Jika agen menemukan halaman yang berisi visual kompleks seperti tabel atau grafik, agen akan memanggil alat berbasis VLM seperti LlamaParse untuk melakukan ekstraksi tingkat lanjut.

Ekstraksi Data Terstruktur dan Pencarian Dokumen untuk Agen AI

  • Ekstraksi data terstruktur otomatis menggantikan entri data manual pada faktur, resi, klaim, dan kontrak.
  • LlamaParse menyertakan kutipan dokumen sumber dan skor keyakinan untuk setiap data yang diekstraksi.
  • Pencarian dokumen menggabungkan metode BM25, grep, dan pencarian vektor untuk penemuan informasi yang presisi.

Otomatisasi entri data dalam jumlah besar, seperti jutaan laporan pengeluaran, memerlukan keluaran terstruktur yang dapat langsung dimasukkan ke basis data. LlamaParse menyediakan penandaan skor keyakinan untuk memastikan keandalan data sebelum diintegrasikan ke sistem perangkat lunak hilir. Ekosistem ini dilengkapi pencarian dokumen yang memadukan berbagai teknik pencarian teks dan vektor.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video