Jika Analisis Data Terhenti karena Kekurangan Memori Pandas
TuBrief 편집팀
2026년 7월 13일
0
Computing/Software원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
커뮤니티의 다른 글
댓글 (0)
Log in to leave a comment
아직 작성된 글이 없습니다
원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
Log in to leave a comment
아직 작성된 글이 없습니다
Pandas memuat data ke dalam RAM secara sekaligus. Inilah alasan mengapa Python mengalami crash saat Anda mencoba membuka file CSV berukuran 20GB di laptop dengan RAM 16GB. Begitu data sedikit membesar, laptop akan membeku dan kernel Jupyter Notebook akan mati. Anda tidak bisa terus-menerus melakukan sampling data atau mengupgrade komputer.
Sebagai gantinya, gunakan DuckDB. Alat ini hanya mengambil data yang diperlukan sedikit demi sedikit. Tanpa memuat seluruh data ke RAM, ia menelusuri bagian yang diperlukan menggunakan sintaks SQL. Ada alasan mengapa alat ini menjadi sorotan di kalangan data engineer sebagai alternatif untuk Pandas.
Mengubah lingkungan analisis data ternyata lebih sederhana dari yang dibayangkan. Tetap gunakan dataframe Pandas yang biasa Anda gunakan dan cukup ganti mesinnya saja.
duckdb.sql(). Perhitungan sebenarnya belum terjadi pada tahap ini..df() di bagian akhir.Cara ini memberikan efisiensi yang lebih dari sekadar mengubah kode. Pekerjaan yang biasanya menyebabkan RAM penuh saat melakukan groupby di Pandas, dapat berjalan dengan stabil di DuckDB dengan memanfaatkan disk.
Saat menangani data berukuran besar, sering terjadi situasi di mana RAM habis dan program mati. Untuk mencegahnya, Anda harus memasang "pagar pembatas" (guardrail) pada lingkungan kerja Anda.
Masukkan kode berikut di bagian atas skrip Anda:
`python
import duckdb
con = duckdb.connect()
con.execute("SET memory_limit = '4GB'")
con.execute("SET temp_directory = './tmp'")
`
memory_limit adalah batas yang menentukan berapa banyak RAM yang boleh digunakan oleh DuckDB. Jika disetel ke 4GB, sistem secara keseluruhan tidak akan membeku bahkan di laptop saya yang memiliki RAM 16GB. Jika RAM tidak mencukupi, DuckDB akan secara otomatis menulis data ke file sementara di disk. Berdasarkan benchmark tahun 2023, DuckDB berhasil menyelesaikan pemrosesan file Parquet berukuran 140GB hanya dengan RAM 1,3GB. Jika menggunakan Pandas, pekerjaan tersebut akan menghabiskan puluhan gigabyte RAM dan akhirnya berakhir dengan crash.
Saat melakukan analisis data, momen yang paling menjengkelkan adalah ketika proses parsing terhenti karena format yang salah. Jika tipe data tidak sesuai saat memuat file CSV, analisis bahkan tidak bisa dimulai.
Aktifkan opsi berikut saat menggunakan fungsi read_csv:
`python
con.execute("""
SELECT * FROM read_csv('data.csv',
columns={'id': 'INTEGER', 'value': 'DOUBLE'},
store_rejects=true,
strict_mode=false)
""")
`
Dengan cara ini, seluruh proses tidak akan mati hanya karena ada data yang tidak sesuai format. Baris yang salah akan diisolasi ke dalam tabel terpisah. Nantinya, Anda cukup memeriksa tabel reject_errors secara terpisah untuk mengetahui mengapa data tersebut rusak.
Analisis bukan tentang memperbaiki alat, melainkan tentang mengekstraksi insight dari data. Berhentilah menjalankan ulang kode berkali-kali karena masalah RAM, dan mulailah mengamankan efisiensi pemrosesan dengan mengganti mesin Anda.