Cara Uber Menghemat Biaya Multi-Agen dan Mencegah Halusinasi Melalui Sistem uReview
TuBrief 편집팀
2026년 9월 8일
0
Computing/Software원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
커뮤니티의 다른 글
댓글 (0)
Log in to leave a comment
아직 작성된 글이 없습니다
원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
Log in to leave a comment
아직 작성된 글이 없습니다
Memasukkan raw git diff dan keseluruhan kode sumber ke dalam legacy monolith secara langsung akan menyebabkan "lonjakan biaya". Platform uReview yang dirilis oleh Uber pada tahun 2025 secara otomatis menganalisis 90 persen dari 65.000 perubahan yang berasal dari 6 monorepo setiap minggunya. Namun, jika Anda memberikan model pada basis kode yang batas modulnya tidak jelas tanpa pembersihan terlebih dahulu, biaya token akan melonjak hingga 6 kali lipat. Model yang tidak memahami global factory class akan meminta validasi null pointer yang tidak masuk akal dan memicu halusinasi. Begitu komentar yang tidak berguna menumpuk, para pengembang langsung mematikan notifikasi dan mengalami kebal terhadap peringatan (warning fatigue).
Anda perlu menulis mesin pra-pemrosesan yang menggunakan modul ast standar Python untuk hanya mengekstrak signature fungsi yang diubah dan variabel lokal yang terpengaruh. Setelah menyaring metadata statis, singkirkan modifikasi non-fungsional yang tidak relevan dengan perubahan menggunakan perbandingan hash. Selanjutnya, lakukan reverse parsing hanya pada signature dari lowest-level function node yang berisi baris perubahan dan sintaksis modifikasi aktual untuk membuat payload JSON yang ringan.
Jika Anda menjalankan benchmark dengan 100 modul legacy, perbedaannya akan terlihat jelas. Injeksi raw file menghabiskan 42.000 token dan $0.273 per PR. Sebaliknya, penggunaan kompresi JSON pra-pemrosesan AST menurunkannya menjadi 6.100 token dan $0.068 per PR. Biaya API berkurang sebesar 47,3 persen dan rasio false positive akibat halusinasi juga turun menjadi 9,4 persen.
Jika Anda menggabungkan agen keamanan dan agen logika bisnis dalam group chat interaktif, mereka akan saling membalas output dan terjebak dalam infinite ping-pong loop. Analisis satu PR membutuhkan waktu puluhan menit dan biaya API melambon tinggi. Anda tidak boleh membiarkan para agen berkomunikasi secara langsung. Anda harus membangun kerangka kerja finite state machine dengan memanfaatkan skema Pydantic dan LangGraph.
Setiap agen spesialis hanya menerima status central pipeline yang diteruskan, dan mengembalikan hasil penilaian sesuai aturan domain mereka hanya dalam bentuk model yang telah ditentukan. Gunakan Pydantic untuk menentukan data class yang memaksa pengidentifikasi, jalur file, tingkat keparahan, dan skor kepercayaan diri dari output agen. Atur conditional edge untuk menghentikan state machine secara paksa ketika jumlah iterasi mencapai 2 kali atau ketika tingkat kepercayaan diri dari semua komentar menyatu di atas 0,85.
Berdasarkan standar konvensi semantik OpenTelemetry GenAI, Anda harus membungkus eksekusi setiap agen dalam span unik dan meninggalkan penggunaan token di distributed tracing backend. Jika Anda menerapkan struktur ini, waktu debugging tech lead yang biasanya terbuang untuk menangani malfungsi agen akan berkurang lebih dari 6 jam per minggu.
Menurut data operasional Tricorder (alat analisis statis internal Google), seberapa pun akuratnya poin yang ditunjukkan oleh alat tersebut, jika pengembang merasa hal itu tidak layak untuk diperbaiki, rasa permusuhan justru akan meningkat. Pemeriksa dengan tingkat false positive yang valid melebihi 5 persen akan langsung disingkirkan. Agar lebih dari 67 persen komentar automated review dapat diterima, Anda harus melakukan gradual rollout yang dimulai secara bertahap dari modul dengan risiko rendah.
Jalankan shadow mode selama 3 minggu untuk menyembunyikan komentar dengan memilih lapisan seperti lapisan validasi DTO dan fungsi murni (pure function) yang tidak memiliki efek samping (side effect). Setelah mengonfirmasi tingkat akurasi sebesar 85 persen, lepaskan komentar inline pada kode backend dari 3 domain squad dan lacak tingkat adopsinya. Kumpulkan log umpan balik secara mingguan, jalankan skrip feedback loop yang secara otomatis mengeluarkan aturan high false positive yang berada di bawah tingkat adopsi 67 persen dari whitelist dan membuangnya ke daftar isolasi. Jika Anda menanamkan skrip validasi whitelist ini ke dalam pipeline, aturan tidak berguna yang membuat pengembang kesal akan dengan cepat disaring, sehingga Anda dapat mencapai tingkat adopsi sistem review dalam tim sebesar 70 persen.