TuBrief
구독 채널
비디오
커뮤니티

Modernisasi Pipeline Pemrosesan Dokumen Warisan dan Penghematan Biaya

TuBrief 편집팀
2026년 4월 22일
0
Computing/Software

원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.

Bahasa Indonesia한국어EspañolEnglish中文हिन्दीالعربيةDeutschFrançaisPortuguêsРусский日本語

관련 영상

Berhenti Membangun Pipeline RAG Seperti Ini... Gunakan MarkItDown6:17

Berhenti Membangun Pipeline RAG Seperti Ini... Gunakan MarkItDown

Better Stack

커뮤니티의 다른 글

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

2026년 9월 13일

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

2026년 9월 13일

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

2026년 9월 13일

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

2026년 9월 13일

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

2026년 9월 12일

Apple Won the AI Race

2026년 9월 12일

댓글 (0)

Log in to leave a comment

아직 작성된 글이 없습니다

© 2026 . All rights reserved.

TuBrief
구독 채널
비디오
커뮤니티
로그인

Modernisasi Pipeline Pemrosesan Dokumen Warisan dan Penghematan Biaya

Mengurangi Pemeliharaan dengan Integrasi Logika Konversi Markdown

Jika Anda menghabiskan 5 jam lembur setiap minggu untuk memasukkan ratusan file PDF, PPT, dan Excel ke dalam sistem RAG, penyebab masalahnya adalah pustaka penguraian (parsing) yang terfragmentasi. Struktur lama yang mencampur PyPDF2 atau openpyxl hanya meningkatkan kompleksitas kode. Dengan mengadopsi MarkItDown dari Microsoft, Anda dapat menghapus logika percabangan yang rumit.

Saat melakukan refaktorisasi pipeline, gunakan processor factory pattern.

  1. Singkirkan pustaka yang tersebar di setiap format dan unifikasi antarmuka pemanggilan dengan fungsi convert() dari MarkItDown.
  2. Lakukan percabangan metode pemrosesan berdasarkan kompleksitas dokumen. Gunakan parser ringan untuk teks sederhana, dan pilih MarkItDown untuk dokumen kompleks dengan banyak tabel.
  3. Isolasi semua dependensi dalam kontainer Docker (Python 3.11 atau lebih tinggi) dan distribusikan dengan FastAPI.

Struktur ini membuat parsing engine dapat diskalakan secara independen. Jika struktur tabel tetap utuh, kesalahan preservasi tabel saat LLM membaca dokumen berkurang sebesar 34% (berdasarkan pengumuman Microsoft 2024).

Menghemat 30% Biaya API dengan Pra-pemrosesan Markdown

Biaya token embedding berbanding lurus dengan panjang file Markdown. Hasil keluaran MarkItDown sering kali bercampur dengan metadata atau noise yang tidak perlu dikirim ke LLM. Hanya dengan memfilter hal ini, Anda dapat mengurangi biaya API sebesar 30%.

Bangun logika penyaringan yang efisien.

  1. Gunakan modul re di Python untuk mengurangi baris baru yang berurutan (\n{3,}) menjadi dua, dan hapus teks hak cipta di bagian bawah atau tag HTML yang berulang dengan regular expression.
  2. Gunakan MarkdownHeaderTextSplitter untuk melakukan chunking berdasarkan header. Mengelola child chunk untuk pencarian dan parent chunk untuk konteks akan meningkatkan akurasi pencarian.
  3. Gunakan hash MD5 untuk mencegah embedding duplikat dari laporan yang sama sejak awal.

Dengan memperhatikan efisiensi token, Anda dapat menurunkan biaya API perusahaan secara signifikan setiap bulannya.

Mengelola Kualitas Data dengan Snapshot Testing

Saat versi pustaka berubah, hasil penguraian bisa sedikit bergeser. Berhentilah melakukan verifikasi manual di mana insinyur harus membuka file satu per satu. Dengan memperkenalkan snapshot testing, Anda dapat mendeteksi penurunan kualitas secara instan.

Buat lingkungan pengujian unit untuk mencegah regresi.

  1. Instal plugin pytest-regressions dan simpan Markdown yang telah dikonversi dengan baik sebagai golden master file.
  2. Pastikan skrip pengujian membandingkan hasil konversi dengan golden master setiap saat. Jika terjadi perbedaan (diff), kirim pemberitahuan segera.
  3. Gunakan model sentence transformer untuk mengukur kemiripan kosinus antara versi asli dan versi yang dikonversi. Anda hanya perlu mengatur agar log dicatat jika tingkat preservasi format di bawah 0,9.

Sistem otomatisasi ini akan menghilangkan tugas perbandingan manual yang memakan waktu 5 jam setiap minggu.

Meningkatkan Kecepatan Batch Job dengan Pemrosesan Paralel

Memproses ribuan dokumen secara sekuensial adalah pemborosan sistem. Dengan menggunakan concurrent.futures.ProcessPoolExecutor untuk memparalelkan pemrosesan batch, pekerjaan yang biasanya memakan waktu berhari-hari dapat diselesaikan dalam hitungan jam.

Implementasikan arsitektur paralel dengan cara berikut:

  1. Jika memori server adalah 16GB, batasi jumlah worker hingga 20-25. Jika dipaksakan lebih, hanya akan menyebabkan error memori.
  2. Bagi file ke dalam batch berukuran 50-100, dan panggil garbage collection secara paksa di setiap akhir batch untuk menangani kebocoran memori.
  3. Pisahkan PDF berukuran besar di atas 10MB ke dalam antrean khusus agar ditangani oleh worker berkinerja tinggi.

Metode ini membantu menjaga kekinian data sekaligus memanfaatkan sumber daya sistem secara efisien.