Dari Ingesti hingga Agen: Cara Tim AI Membangun di Atas Intelijen Dokumen — Adit Abraham, Reducto

Transcript

00:00:00Halo, apakah suara saya terdengar jelas? Bagus. Kita punya waktu singkat, 20 menit di sini, jadi saya ingin langsung
00:00:20memulainya. Nama saya Deet, salah satu pendiri dan CEO Reducto, dan hari ini kami ingin berbicara
00:00:25tentang salah satu bagian yang menurut saya sangat praktis, namun mungkin kurang keren dalam membangun agen yang benar-benar bekerja di dunia nyata, yaitu data. Saya yakin Anda sudah melihat banyak presentasi tentang data hari ini. Fokus utama kami adalah membangun infrastruktur bagi siapa saja yang bekerja dengan beberapa sumber data tersulit, yaitu gambar tak terstruktur, PDF, lembar kerja, dan semua yang biasa digunakan manusia sehari-hari. Ada yang sudah menggunakan Reducto atau mencobanya? Keren.
00:00:55Sebagai konteks yang berguna untuk memulai, kami adalah platform pemrosesan dokumen berbasis agen. Kami membantu banyak tim AI terkemuka dunia membangun aplikasi AI maupun alur kerja, tergantung pada apa yang ingin mereka capai.
00:01:08Itu mencakup banyak perusahaan native AI yang mungkin pernah Anda lihat saat ini. Termasuk perusahaan seperti Harvey, Ligor, Rogo, serta beberapa perusahaan terbesar di dunia. Menurut saya, itu konteks penting untuk apa yang akan kita bahas.
00:01:19Kami bekerja sama dengan perusahaan teknologi terbesar, institusi keuangan global, organisasi asuransi, pihak-pihak yang memiliki data historis berdekade-dekade yang secara historis sangat sulit digunakan di luar konteks demo.
00:01:34Di seluruh perusahaan ini, sejauh ini kami telah memproses berpuluh-puluh miliar dokumen untuk pelanggan kami. Saya agak malas memperbarui simbol plus di akhirnya, tetapi jumlahnya terus bertambah, jadi biarkan saja begitu.
00:01:46Namun hal utama yang kami pelajari dari semua itu, dan yang ingin saya fokuskan hari ini, sebenarnya bukanlah produk Reducto itu sendiri.
00:01:51Melainkan seluk-beluk dari apa yang telah kami pelajari, yang semoga dapat Anda bawa pulang dan terapkan dalam pekerjaan Anda juga.
00:01:58Dan saya pikir banyak dari pekerjaan yang kami lakukan serta pembelajaran yang kami dapatkan berada dalam konteks tematik yang lebih luas ini, di mana cakupan aplikasi AI telah banyak berubah belakangan ini.
00:02:07Dari yang tadinya sekadar produk sintesis informasi menjadi agen nyata yang benar-benar bekerja.
00:02:13Dan seiring hal itu, kami menemukan beberapa hal yang patut untuk dibahas.
00:02:16Pertama adalah merumuskan masalah itu sendiri, kendala yang dihadapi orang-orang, mengapa PDF secara khusus sangat sulit, meskipun Anda mungkin pernah melihat belasan peluncuran pemrosesan PDF yang berbeda di Twitter.
00:02:26Di mana kami menemukan kelebihan dan kekurangan dari berbagai alat.
00:02:31Kami pikir ada waktu dan tempat yang tepat untuk CV tradisional versus BLM.
00:02:35Dan yang lebih menarik, saya rasa paruh kedua presentasi ini akan difokuskan pada babak baru berikutnya.
00:02:40Apa yang kami lihat menjadi mungkin sebagai hasil dari penggunaan agen dalam alur kerja.
00:02:43Hal-hal yang kami temukan dari kemampuan memanfaatkan kerangka kerja untuk berbagai jenis tugas.
00:02:47Serta pembelajaran kami seputar evaluasi saat Anda beralih dari RAG ke pembuat produk agen.
00:02:53Namun saya akan mulai dengan hal pertama, yaitu sesuatu yang saya rasa sudah sering kali dibahas.
00:02:58Jika Anda datang ke acara AI Engineer beberapa tahun lalu, kata yang akan Anda dengar di setiap presentasi adalah RAG.
00:03:04Dan semua orang sedang membangun semacam aplikasi RAG.
00:03:07Untuk sementara waktu, semua aplikasi sebenarnya berupa semacam sintesis informasi, bukan?
00:03:12Anda akan mengambil informasi dari suatu konteks, entah itu prompt yang sempurna atau berkas yang diunggah pengguna.
00:03:19Dan Anda akan memiliki sesuatu seperti produk pencarian.
00:03:22Anda memiliki pencarian enterprise.
00:03:23Anda memiliki chatbot yang melakukan tanya jawab sederhana berdasarkan konten tersebut.
00:03:27Dan hanya sebatas itu.
00:03:28Namun saat ini, kata populer yang mungkin sudah sejuta kali Anda dengar adalah agen.
00:03:34Bagi Anda yang merupakan insinyur, Anda mungkin sudah menggunakan Claude Code atau alat serupa untuk menyelesaikan banyak pekerjaan secara menyeluruh.
00:03:41Dan pergeseran semacam itu mulai terjadi pada berbagai jenis pekerjaan perkantoran.
00:03:46Baik Anda di bidang keuangan, asuransi, maupun layanan kesehatan, orang-orang mulai membuat keputusan mandiri.
00:03:51Mereka mencoba menciptakan hasil kerja yang utuh, tidak hanya menjawab pertanyaan dari PDF, tetapi juga membuat dan memodifikasi PDF.
00:03:58Dan itu adalah sudut pandang yang sangat berbeda.
00:04:00Alat yang Anda butuhkan dan masalah yang Anda hadapi sangat berubah dibandingkan sekadar mencoba membangun platform pencarian informasi.
00:04:06Inti permasalahan dari semua ini adalah, hal ini menjadi masalah yang lebih penting lagi untuk diselesaikan saat Anda mulai memiliki alur kerja bertahap seperti ini.
00:04:18Jika Anda hanya melakukan tanya jawab, tentu ada risiko yang muncul dari sekadar menjawab pertanyaan tersebut.
00:04:24Namun ketika agen membuat beberapa keputusan yang dampaknya menumpuk di sepanjang pemrosesan berkas, dan saat mereka mengambil berbagai sumber data, risiko input yang buruk menjadi sangat berbahaya dalam alur kerja Anda.
00:04:36Dan itulah yang menjadi fokus kami.
00:04:38Karena pada akhirnya, sebagian besar nilai dari alat model bahasa di dunia nyata hanya berguna sesuai dengan konteks tempat Anda menerapkan kecerdasan tersebut.
00:04:48Jadi bagi banyak perusahaan, data itu tidak terstruktur, tersebar, dan bersifat multimodal.
00:04:53Data tersebut bukanlah repositori yang tersusun rapi.
00:04:56Anda memiliki berbagai tim dan organisasi yang menyimpan file di Google Drive, Box, atau tempat lainnya.
00:05:04Anda akan mendapati format data yang pada dasarnya tidak terstruktur.
00:05:07Anda belum tentu tahu apa yang ada di dalam kumpulan informasi Anda.
00:05:11Dan Anda akan menghadapi segala macam masalah turunan dari hal tersebut.
00:05:14Beberapa masalahnya berkaitan dengan akurasi pemindaian dan ekstraksi, dan itu memang sangat penting.
00:05:18Tetapi ini juga mengenai masalah seperti apakah Anda mengambil konteks yang tepat.
00:05:22Ini juga tentang bagaimana Anda benar-benar berinteraksi dengan konteks tersebut dan menerapkan modifikasi padanya.
00:05:27Dan hal yang mungkin sering Anda dengar digaungkan oleh Reducto dan lainnya di bidang ini adalah bahwa PDF secara mengejutkan masih merupakan masalah yang sangat sulit.
00:05:36Saya tidak tahu apakah ada dari Anda yang mengikuti Surge, yaitu lab data yang bekerja sama dengan banyak perusahaan model dasar.
00:05:42Merek memiliki tolak ukur luar biasa bernama GDP PDF, di mana bahkan Fable, kecerdasan model terdepan saat ini, hanya mencapai tingkat akurasi sekitar 30%.
00:05:52Dan itu sepenuhnya didasarkan pada gagasan: bisakah kita meminta model memeriksa dan benar-benar membuat keputusan berdasarkan konten dalam dokumen seperti PDF.
00:06:01Alasan mengapa hal itu sulit—saya akan kembali ke tolak ukur itu sebentar lagi—adalah karena pada dasarnya PDF sebagai format berkas sudah sangat tua dan dirancang dalam konteks yang jauh berbeda.
00:06:11Saya benar-benar pernah bertemu dengan orang-orang yang telah menggarap pemrosesan PDF lebih lama dari usia hidup saya.
00:06:16Saya pernah bertemu orang-orang yang mengerjakan driver pencetak untuk mencetak PDF pada awal tahun 1990-an.
00:06:21Dan memang seperti itulah tujuannya.
00:06:22Dahulu Anda ingin menampilkan persis apa yang ada pada dokumen saat pertama kali dibuat dan dapat dicetak pada akhirnya.
00:06:30Banyak pertimbangan saat ini tidak lagi berkutat di sekitar hal itu.
00:06:33Pada akhirnya, yang kita inginkan adalah sesuatu seperti representasi markdown, sesuatu yang dapat dipahami secara efektif oleh agen.
00:06:39Dan di dunia nyata, manusia menyajikan begitu banyak konteks secara visual.
00:06:44Seperti analis keuangan lulusan baru di peran perbankan investasi, mereka tidak berpikir apakah AI agen akan memahami presentasi ini.
00:06:54Merek membuat salimbaran slide yang sangat kreatif.
00:06:57Saya yakin Anda pernah melihat slide SoftBank tentang angsa bertelur emas.
00:07:01Detail seperti itu sangat penting.
00:07:02Benar, kan?
00:07:03Banyak data yang harus Anda analisis berupa struktur tabel tanpa garis kisi yang jelas dan sel yang digabung.
00:07:10Akan ada elemen seperti grafik garis dan diagram.
00:07:12Akan ada tulisan tangan berantakan yang bahkan bagi saya sebagai manusia pun sulit dibaca.
00:07:17Dan itulah jenis masalah yang harus diselesaikan jika Anda menangani kasus-kasus spesifik tersebut.
00:07:22Kami mendirikan perusahaan ini pada tahun 2023 karena merasa ada lompatan besar dalam hal apa yang bisa dicapai di sini.
00:07:29Selama ini, saat orang memikirkan pemrosesan PDF, mereka biasanya menggunakan alur kerja NLP yang dimodifikasi.
00:07:37Langkah pertama melakukan OCR sederhana, lalu mencoba memproses teks hasilnya.
00:07:41Cara itu berhasil jika tata letak dokumennya sangat konsisten.
00:07:44Kan?
00:07:45Jika Anda tahu formulir pajak selalu terlihat sama, itu masalah terbatas yang bisa diselesaikan dengan templat.
00:07:51Namun VLM menarik karena sifat dasarnya yang sangat fleksibel dan serbaguna.
00:07:56Untuk pertama kalinya, Anda memiliki premis membaca dokumen seperti halnya manusia.
00:08:01Anda memiliki konsep untuk menangani berbagai variasi kasus yang rumit.
00:08:04Jadi kami menemukan VLM sangat luar biasa untuk teks tulisan tangan, jauh melampaui kemampuan OCR tradisional.
00:08:12Namun di sisi lain, kami tidak menganggap VLM sebagai solusi tunggal untuk segalanya.
00:08:16Jika Anda menyelesaikan masalah ini dalam skala besar, seperti perusahaan yang menangani ratusan juta dokumen,
00:08:21ada berbagai pertimbangan sekunder seperti determinisme.
00:08:25Anda sangat peduli pada efisiensi pemrosesan Anda.
00:08:27Oleh karena itu, kami menemukan Computer Vision tradisional masih sangat kuat untuk beberapa hal.
00:08:33Hal ini sering terabaikan seiring makin majunya riset kendaraan otonom.
00:08:37Teknik seperti deteksi objek kini jauh lebih canggih daripada satu dekade lalu.
00:08:42Sehingga model di bawah 100 juta parameter sangat efektif untuk mendeteksi tata letak dokumen.
00:08:48Anda bisa melangkah sangat jauh tanpa perlu model fondasi yang besar.
00:08:52Model-model ini bahkan bisa dijalankan di CPU biasa.
00:08:54Anda bisa menjalankannya dalam skala besar.
00:08:55Anda bisa memastikan pemahaman di tingkat wilayah mengenai bagian mana yang sulit diproses.
00:09:00Lalu VLM memperkenalkan konsep semantik ini.
00:09:03Anda bisa memeriksa dan langsung mengenali serta mengoreksi jenis kesalahan yang mungkin terjadi di alur kerja Anda.
00:09:09Berdasarkan ide semantik tersebut, saat menguraikan masalah ini dan memahami letak bagian yang rumit,
00:09:18jika Anda telah membagi teks pada halaman dan tahu posisi tulisan tangannya,
00:09:21Anda bisa menerapkan konsep agen dalam sistem alur kerja ini.
00:09:25Jika dulunya Anda membutuhkan tim peninjau manusia untuk memeriksa dan mengoreksi kesalahan,
00:09:29kini VLM dapat menghadirkan gagasan yang kami sebut sebagai OCR berbasis agen.
00:09:33Penerapannya seperti saat Anda menggunakan alat seperti Cursor yang menerapkan pengeditan cepat di IDE Anda,
00:09:41ada konsep dekoding spekulatif di mana Anda menerapkan pengeditan tingkat token pada hasil keluaran.
00:09:45Anda bisa menerapkan prinsip serupa di sini, tidak sekadar mengirim hasil OCR ke Gemini,
00:09:51menulis perintah instruksi yang rapi, dan memintanya agar tidak menyimpang terlalu jauh dari aslinya.
00:09:56Karena kami menemukan saat melakukan prediksi token berikutnya seperti itu,
00:09:58Anda memicu potensi kesalahan baru di mana model yang sangat cerdas
00:10:02mulai mengoreksi hal-hal yang tidak sesuai lagi dengan isi dokumen aslinya.
00:10:05Model akan melihat kata "total", dan jika ada kesalahan manusia di tabel itu,
00:10:08kadang model justru menghitung dan menjumlahkan sendiri nilai-nilai dalam tabel tersebut.
00:10:13Yang Anda inginkan adalah mengoreksi suntingan pada tingkat token sesuai kebutuhan.
00:10:16Mungkin ada kekeliruan titik dengan koma, atau angka nol dengan huruf O,
00:10:19detail-detail seperti itu sangatlah penting.
00:10:21Dan ini masalah bagaimana kita menyajikan apa yang sebenarnya dilihat oleh manusia
00:10:25saat mereka membaca dokumen tersebut.
00:10:27Jadi pandangan kami, OCR berbasis agen ini hampir mirip analogi manusia dalam alur kerja,
00:10:34di mana masukan awal diproses melalui kombinasi Computer Vision dan VLM,
00:10:39lalu ada lapisan verifikasi dan koreksi yang menghasilkan keluaran berakurasi tinggi.
00:10:44Namun seperti yang saya sebutkan tadi, kami tidak melihat cakupan masalah ini sekadar ekstraksi dan penguraian data.
00:10:50Sebagian besar bentuknya adalah pentingnya memikirkan detail alur kerja pemrosesan Anda,
00:10:56meskipun Anda memiliki alur konversi dokumen ke markdown yang luar biasa.
00:10:59Contoh bagusnya adalah jika Anda pernah membangun platform RAG jenis apa pun,
00:11:04Anda mungkin pernah memikirkan pertimbangan terkait hal-hal seperti tabel.
00:11:07Ada banyak hal yang bisa disajikan dengan baik dalam format seperti markdown.
00:11:13Namun untuk hal seperti tabel ini, di mana sel tergabung menyimpan banyak makna,
00:11:18sangat penting untuk mempertahankan struktur tersebut.
00:11:20Dan ini bukanlah keterbatasan model.
00:11:22LLM sangat luar biasa dalam menganalisis struktur HTML dari tabel yang sama,
00:11:26tetapi Anda juga membuang banyak token, dan biayanya dengan cepat membengkak.
00:11:29Dan tentunya di sisi lain,
00:11:31Anda mungkin tidak ingin mengodekan tabel sederhana ke dalam HTML,
00:11:35karena itu akan menghasilkan banyak tag HTML yang tidak perlu.
00:11:38Jadi yang akhirnya kami lakukan adalah melihat ini sebagai masalah dinamis
00:11:42di mana jika tabelnya sederhana, bagus, kita bisa mengaproksimasi data itu dalam markdown.
00:11:47Ketika Anda memiliki tabel yang lebih kompleks, Anda mungkin ingin menggunakan HTML,
00:11:50tetapi model bahasa bukanlah satu-satunya hal yang harus dipertimbangkan dalam alur kerja Anda.
00:11:55Jika Anda melakukan sesuatu yang terkait dengan embedding,
00:11:57Anda juga akan menghadapi masalah sekunder berupa pemanggilan ulang (retrieval) konteks tersebut.
00:12:01Tabel yang sama yang saya tunjukkan tadi,
00:12:03jika Anda melihat representasi HTML-nya, terlihat sangat berantakan.
00:12:08Sebagian besar cuplikan itu hanyalah tag HTML.
00:12:11Itu hanya mengklasifikasikan struktur dokumen.
00:12:14Dan sayangnya, meskipun dalam beberapa evaluasi menyeluruh,
00:12:17Anda mungkin memiliki konten yang sangat berusaha mempermudah kerja model
00:12:22dan menyebutkan secara persis apa yang Anda cari.
00:12:24Di dunia nyata, orang tidak akan merinci nilai-nilai di dalam tabel.
00:12:28Merekah hanya bertanya, bagaimana perubahan pendapatan dari waktu ke waktu?
00:12:30Dan mereka menganggap Anda akan mengambil tabel yang tepat saat relevan.
00:12:34Meskipun model bahasa dapat memahami teks tersebut secara efektif,
00:12:37jika Anda mengambil data dari kumpulan dokumen yang besar,
00:12:39kami menemukan bahwa model embedding sangat kesulitan mengorelasikan perintah manusia berformat bahasa alami
00:12:44dengan kumpulan tag HTML dan angka yang berantakan ini.
00:12:47Oleh karena itu, hal besar yang bisa Anda lakukan dan sebenarnya membutuhkan sedikit usaha
00:12:51adalah membuat representasi yang lebih dirancang untuk model embedding itu sendiri.
00:12:55Mengambil tabel yang sama,
00:12:56Anda membuat representasi bahasa alami dari tabel tersebut,
00:12:58sehingga Anda mendapatkan yang terbaik dari kedua pendekatan.
00:13:00Saat Anda memasukkan ini ke dalam model untuk penalaran,
00:13:02Anda menggunakan representasi tabel HTML,
00:13:04dan ketika Anda mencoba memastikan bahwa Anda mengambil cuplikan yang tepat,
00:13:07Anda menggunakan blok bahasa alami tersebut.
00:13:12Selain itu, ada juga gagasan bahwa banyak hal yang harus dilakukan selain sekadar pemindaian dan ekstraksi.
00:13:18Dan saya pikir sebagian besar fokus industri secara historis tertuju pada pemindaian dan ekstraksi
00:13:22karena kami yakin ada peningkatan besar di sana.
00:13:25Dan tadi saya telah berbicara tentang tolak ukur GDP PDF,
00:13:30yang menurut saya merupakan contoh ilustratif yang bagus tentang apa yang bisa Anda lihat
00:13:34sebagai hasil dari peningkatan alur kerja data Anda.
00:13:37Jadi, apa yang kami temukan adalah jika Anda mengambil tolak ukur yang sama persis
00:13:40yang saya sebutkan tadi, sayangnya kami tidak dapat mengujinya pada Fable
00:13:43karena akses kami telah diputus.
00:13:46Tetapi jika Anda mengujinya pada model lain dan memberinya PDF asli
00:13:50sekaligus representasi terstruktur dari PDF tersebut,
00:13:52seperti hasil pemindaian di sini, di berbagai model,
00:13:55baik itu Gemini, Anthropic, maupun OpenAI,
00:13:58Anda akan menemukan bahwa Anda benar-benar meningkatkan performa akhir LLM hanya dari input yang lebih baik.
00:14:04Bahkan hingga titik ekstrem di mana model seperti GPT 5.5 dan Opus
00:14:09sebenarnya mengungguli sesuatu seperti Fable secara langsung,
00:14:12tidak hanya pada basis akurasi, tetapi sebagai hasil dari pemberian input yang lebih baik,
00:14:17model-model tersebut akhirnya juga menggunakan lebih sedikit token penalaran.
00:14:20Mereka kurang berfokus pada merepresentasikan data dan lebih pada hasil yang sebenarnya.
00:14:24Dan alhasil, mereka berhasil menurunkan latensi
00:14:27sekaligus mencapai jawaban yang benar secara lebih cepat.
00:14:30Namun bahkan setelah Anda memiliki alur kerja seperti itu
00:14:33dan Anda telah selesai memeriksa semuanya secara mendalam
00:14:37di lapisan pemindaian Anda, banyak pekerjaan manusia yang masih membutuhkan
00:14:41pemahaman sebenarnya tentang cakupan isi dari kumpulan dokumen Anda,
00:14:44mengarahkannya ke alur kerja yang tepat dan semacam menguraikan masalah itu,
00:14:48atau bahkan pada akhirnya menyunting dan mengubah dokumen Anda.
00:14:51Jadi apa yang kami coba lakukan adalah melihat ini sebagai sebuah masalah
00:14:54tentang bagaimana memastikan setiap interaksi yang dilakukan model bahasa
00:14:57dengan dokumen menjadi seefektif seandainya manusia yang melakukannya.
00:15:00Jika Anda mengisi formulir, bagaimana Anda memastikan tingkat presisi
00:15:03dalam bagian-bagian yang Anda isi?
00:15:05Dan contoh yang sangat bagus untuk hal ini di sisi orkestrasi
00:15:08adalah pembagian klasifikasi yang menurut saya cara yang sangat kurang diapresiasi
00:15:12untuk membuat LLM bekerja dengan maksimal.
00:15:14Tentu saja, Anda bisa saja langsung memasukkan konteks sebanyak yang Anda mau.
00:15:17Dan jika Anda melakukan pengujian jenis jarum dalam tumpukan jerami,
00:15:19hal itu mungkin tidak masalah.
00:15:20Namun dalam praktiknya, ada penurunan kualitas yang akan Anda temukan
00:15:24di luar sekadar ekonomika token akibat memasukkan terlalu banyak data.
00:15:28Sebaliknya, apa yang kami temukan adalah Anda bisa mendapatkan ruang peningkatan yang luas dengan memikirkan
00:15:33hal-hal seperti bagaimana Anda mengklasifikasikan dokumen yang tepat
00:15:36ke jenis alur kerja yang tepat?
00:15:38Bahkan untuk dokumen besar, bagaimana Anda memastikan bahwa Anda memasukkan
00:15:41cuplikan-cuplikan yang benar-benar relevan?
00:15:43Kami melihat contoh penggunaan di mana orang-orang memiliki hal-hal seperti surat fisik,
00:15:47dan berkas surat fisik ini bisa mencapai ratusan halaman.
00:15:50Anda tidak selalu tahu apa yang terkandung di dalamnya.
00:15:53Anda mungkin menghadapi masalah seperti seseorang menyelipkan konten,
00:15:57dan menyuruh model melakukan pekerjaan semacam itu hampir seperti pengalihan perhatian
00:16:01dari pekerjaan yang sebenarnya ingin Anda capai,
00:16:03yang mungkin berupa mengekstrak data dari surat fisik tersebut,
00:16:05menganalisisnya, atau membuat keputusan.
00:16:10Sekali lagi, tadi saya telah menyebutkan bahwa bagian kedua, menurut saya,
00:16:13merupakan bagian yang lebih menarik, yaitu begitu Anda memiliki jenis
00:16:16lapisan klasifikasi dan pemisahan awal,
00:16:20dan Anda telah memahami proses pengurutannya.
00:16:22Saya pikir hal yang sangat kami salutkan sebagai sebuah tim
00:16:26adalah bahwa pemicu agen (agent harnesses) telah menjadi garis depan yang sangat menarik
00:16:29untuk menembus apa yang secara kanonis dulu merupakan masalah rumit yang tak terpecahkan.
00:16:34Salah satu contoh bagus tentang ini yang akan saya bahas sebentar lagi
00:16:37adalah hal-hal seperti grafik garis.
00:16:39Kami bekerja dengan banyak dana lindung nilai (hedge fund) terbesar di dunia,
00:16:41dan hal-hal seperti grafik garis secara historis sangat,
00:16:43sangat sulit karena pertama, bentuknya adalah format gambar.
00:16:46Namun kedua, ada banyak detail tingkat piksel yang jika Anda
00:16:49melakukan sesuatu dengan pengode penglihatan (vision encoder) tradisional,
00:16:52Anda kemungkinan besar akan kehilangan detail tersebut.
00:16:53Anda akan mendapatkan plot kasar tentang bagaimana tren pendapatan,
00:16:55tetapi Anda tidak akan mendapatkan titik-titik data individunya.
00:16:57Oleh karena itu kami telah memikirkan bagaimana cara memberikan agen kemampuan
00:17:00untuk memiliki alat yang tepat dalam menyelesaikan jenis masalah spesifik
00:17:04yang sedang Anda amati.
00:17:05Dalam kasus ekstraksi grafik, grafik di sebelah kiri menyandikan
00:17:09tabel data yang sangat besar.
00:17:11Jika Anda benar-benar mencoba memetakan setiap piksel,
00:17:14itu akan sangat, sangat sulit.
00:17:16Tetapi juga akan sulit bagi model untuk sekadar mengira-ngira
00:17:19kerumitan garis-garis di antaranya.
00:17:22Dan tidak ada model yang secara bawaan bisa melakukan ini
00:17:24sebagai masalah sekali jalan (single-shot).
00:17:25Apa yang Anda lihat di sebelah kanan adalah rekonstruksi
00:17:28tabel markdown yang berhasil kami hasilkan
00:17:30dari grafik garis awal tersebut.
00:17:32Dan satu-satunya cara kami bisa mencapainya
00:17:34adalah dengan memiliki agen yang dilengkapi berbagai alat.
00:17:36Agen ini memiliki penerjemah kodenya sendiri.
00:17:37Ia dapat memvisualisasikan grafik yang dihasilkannya.
00:17:40Dan prosesnya dilakukan secara berulang.
00:17:41Ia menemukan kesalahan pada grafik garis terus-menerus
00:17:45hingga berhasil mencapai hasil akhir.
00:17:47Hal ini juga berlaku untuk masalah seperti ekstraksi terstruktur,
00:17:51di mana selama ini kita memiliki fitur
00:17:53dokumen ke output terstruktur.
00:17:55Namun Anda bisa melangkah lebih jauh
00:17:57dengan memanfaatkan kerangka agen untuk tugas sejenis.
00:18:00Anda bisa meminta agen utama menetapkan kriteria validasi
00:18:03untuk diikuti oleh sub-agen.
00:18:05Artinya, jika Anda memiliki formulir seperti formulir CBP
00:18:09dengan puluhan ribu kolom,
00:18:11dalam jenis masalah itulah Anda sering menemukan
00:18:13banyak masalah yang sifatnya tidak terdeteksi.
00:18:15Seperti adanya konten atau baris yang terlewat.
00:18:17MicroOne sebenarnya baru saja merilis tolok ukur yang sangat bagus
00:18:20di bidang ini pagi tadi, di mana terjadi percabangan
00:18:23di dalam pasar.
00:18:24Model terdepan dengan penalaran maksimal sangatlah presisi.
00:18:28Selama model tersebut berhasil mengekstrak suatu baris,
00:18:30kemungkinan besar baris itu bukan sekadar halusinasi.
00:18:31Hasilnya memang benar-benar akurat.
00:18:33Namun model ini sering kali melewatkan banyak konten di seluruh tolok ukur.
00:18:37Tingkat recall-nya sangat rendah.
00:18:39Di sisi lain, banyak layanan pemrosesan dokumen khusus
00:18:42yang justru tertinggal dari model terdepan dalam hal presisi,
00:18:46tetapi mampu mengejar ketertinggalan dari segi recall.
00:18:48Oleh karena itu, selalu ada kompromi semacam ini.
00:18:51Hanya dengan kerangka agen kami bisa menemukan
00:18:54titik maksimal lokal untuk presisi sekaligus recall
00:18:57dalam jenis tugas ini.
00:19:00Hal terakhir, dan mungkin yang terpenting dari presentasi ini,
00:19:04adalah pada akhirnya evaluasi harus menjadi dasar
00:19:09bagi seluruh keputusan Anda.
00:19:10Ini menjadi bagian penting dari cara kami merancang produk.
00:19:12Hal ini berlaku untuk dataset standar yang Anda gunakan untuk evaluasi,
00:19:16maupun untuk hal-hal seperti pemantauan produksi secara real-time.
00:19:19Sebab data produksi Anda akan berbeda
00:19:21dari data apa pun yang ada pada dataset buatan Anda.
00:19:25Saya rasa sangat penting untuk memandang evaluasi
00:19:28bukan sekadar sudut pandang tingkat makro,
00:19:30tetapi tim-tim terbaik yang bekerja sama dengan kami
00:19:33melihat evaluasi secara mendalam pada setiap tahap alur kerja mereka.
00:19:36Langkah pertama mungkin memastikan
00:19:38bahwa input ke alur kerja Anda sudah sangat baik.
00:19:40Tentu saja Anda harus mengevaluasi hal-hal seperti alur pemrosesan teks.
00:19:43Namun pemrosesan teks sempurna sekalipun dengan alur pencarian informasi yang buruk
00:19:47tidak akan membantu jika Anda tidak memasukkan konteks yang tepat.
00:19:50Oleh karena itu, penting bagi Anda untuk memikirkan detailnya
00:19:52seperti alur pencarian informasi Anda,
00:19:54format di akhir alur kerja,
00:19:56dan pada akhirnya hal yang paling penting
00:19:58adalah apakah Anda mampu meningkatkan kinerja akhir dari agen.
00:20:03Saya akan menutupnya dengan gambaran ke mana arah tujuan kami
00:20:06dan ke mana kami melihat arah perkembangan industri ini.
00:20:08Hal terpenting menurut saya adalah seiring agen berkembang semakin baik,
00:20:12Anda dapat beralih dari jenis alur kerja deterministik
00:20:15yang mungkin Anda gunakan beberapa tahun lalu.
00:20:17Banyak pelanggan kami yang pada dasarnya membuat sistem berkas
00:20:20untuk ditelusuri dan dinavigasi oleh agen mereka,
00:20:22serta membiarkan agen memutuskan alat mana yang ingin digunakan.
00:20:25Jadi kami membuat CLI di mana daripada membuat alur kerja dari ujung ke ujung
00:20:28yang dokumennya selalu mengikuti satu alur khusus yang sama,
00:20:32agen akan menentukan sendiri apakah perlu membaca jenis dokumen tertentu,
00:20:35lalu membaginya menjadi dua kelompok.
00:20:38Pertama adalah kolom konten yang bisa dibaca agen sesuai kebutuhan,
00:20:41dan yang lainnya adalah semua metadata yang Anda perlukan.
00:20:44Jika Anda membuat kutipan, Anda mungkin memerlukan kotak batas,
00:20:47dan seterusnya.
00:20:50Saya akan melompati bagian penyuntingan ini.
00:20:52Saya rasa ada banyak inovasi menarik yang sedang dikerjakan di sini.
00:20:54Kami sudah merilis sebagian, tetapi dalam beberapa bulan ke depan,
00:20:57Anda akan melihat kami semakin fokus pada hal-hal seperti pembuatan dokumen.
00:21:01Namun ringkasan untuk hari ini, dan saya sangat menghargai waktu Anda,
00:21:04adalah pertama, saya sangat menyarankan Anda membagi masalah ekstraksi teks.
00:21:08Sebisa mungkin, anggaplah ini sebagai pemilihan alat yang tepat untuk tugas yang tepat
00:21:11sehingga Anda bisa mencapai batas optimal antara akurasi, biaya, dan latensi.
00:21:16Kedua, verifikasi berbasis agen adalah perubahan terbesarnya industri ini setelah sekian lama,
00:21:21dan ini kesempatan bagus bagi Anda untuk memastikan bahwa alur kerja yang dibangun berfungsi di lingkungan produksi.
00:21:26Ketiga, ini membutuhkan usaha yang sangat minim, tetapi memberi ruang peningkatan besar dari hal-hal detail,
00:21:31seperti memformat data sesuai dengan kebutuhan penggunanya.
00:21:34Senada dengan itu, saya rasa sangat penting untuk memikirkan bukan hanya pemrosesan data,
00:21:39tetapi juga orkestrasi data.
00:21:41Jadi Anda harus selalu mempertimbangkan alat seperti klasifikasi dan pemisah
00:21:44sebagai cara untuk meningkatkan alur kerja Anda.
00:21:46Kelima, pastikan Anda melakukan evaluasi di setiap tahapan.
00:21:49Dan keenam, pikirkan seperti apa garis depan berikutnya bagi Anda,
00:21:52karena saya rasa sebagian besar perusahaan sukses di era sekarang telah banyak berubah
00:21:56dari apa yang biasa kita lakukan dua atau tiga tahun lalu.
00:21:59Namun jika Anda memiliki pertanyaan, jangan ragu untuk menghubungi kapan saja.
00:22:03Email saya adalah namadepan@reducto.ai.
00:22:06Anda juga dapat menghubungi melalui situs web kami jika kami bisa membantu kebutuhan penggunaan Anda.
00:22:10Terima kasih.

Description

The newest frontier model scores about thirty percent on a data lab's benchmark of decisions from PDFs, and Adit Abraham has met people who worked on PDF processing before he was born. The format was built to print, not to be reasoned over, and humans encode meaning visually: merged cells, line charts, unreadable handwriting. Reducto has processed billions of them, and the talk is the lessons, not the product. RAG meant a bad parse cost one answer; with agents, bad inputs compound across every step. VLMs finally read the long tail like a human, but they are not one size fits all: small detectors still find layout on a CPU at scale, and a VLM asked to rewrite OCR will helpfully recompute a total the human got wrong. His agentic OCR applies token level corrections, a zero for an O, instead of regenerating the page. Simple tables go to markdown and complex ones to HTML, but embedding models cannot match how did revenue change to a blob of tags, so a natural language rendering serves retrieval. Parsed structure rather than raw PDFs lifted other frontier models past the newest one on that benchmark and cut reasoning tokens. Classification and splitting keep a hundred page mail packet from distracting it. Agent harnesses crack problems no model solves in one shot, turning a line chart into a data table with a code interpreter and repeated self checks, and they beat a trade off a new benchmark exposed, where frontier models are precise but silently drop rows and document services do the reverse. He closes on evals at every stage and customers who give agents a file system, not a fixed pipeline. Speaker info: - https://reducto.ai Timestamps: 0:00 - Reducto, and the less sexy part of agents that work: data 2:04 - From RAG to agents: bad inputs compound across steps 5:28 - Why PDFs are still hard, and a benchmark frontier models fail 7:19 - Traditional CV versus VLMs: the right place for each 9:07 - Agentic OCR: token level correction, not rewrites 10:42 - Tables: markdown versus HTML, and a form for the embedding model 13:15 - Better inputs lift frontier models and cut reasoning tokens 14:41 - Classification and splitting as orchestration 16:17 - Agent harnesses: line charts to tables, precision and recall together 18:57 - Evals at every stage 20:06 - Where this heads: a file system and CLI for agents 21:00 - Six takeaways

Community Posts

No posts yet. Be the first to write about this video!

Write about this video