TuBrief
Subscribed Channels
Videos
Community

우버의 uReview 시스템에서 배운 멀티 에이전트 비용 절감과 환각 차단법

TuBrief Editorial
September 8, 2026
0
컴퓨터/소프트웨어

Written with AI assistance from the source video. The video is the authority.

한국어EnglishEspañol中文العربيةहिन्दीDeutschFrançaisPortuguêsРусскийBahasa Indonesia日本語

Related Video

Uber의 멀티 에이전트 코드 리뷰 엔진, uReview 개발기 — 윌 본드(Will Bond), 아메야 케트카르(Ameya Ketkar), Uber15:07

Uber의 멀티 에이전트 코드 리뷰 엔진, uReview 개발기 — 윌 본드(Will Bond), 아메야 케트카르(Ameya Ketkar), Uber

AI Engineer

More from the community

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

September 13, 2026

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

September 13, 2026

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

September 13, 2026

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

September 13, 2026

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

September 12, 2026

Apple Won the AI Race

September 12, 2026

Comments (0)

Log in to leave a comment

No posts yet

© 2026 . All rights reserved.

TuBrief
Subscribed Channels
Videos
Community
Log in

우버의 uReview 시스템에서 배운 멀티 에이전트 비용 절감과 환각 차단법

AST 파싱으로 LLM 호출 전 불필요한 코드 조각을 걸러내는 법

레거시 모놀리스에 원시 깃 디프와 전체 소스코드를 그대로 넣으면 비용 폭탄이 터진다. 2025년에 우버가 공개한 uReview 플랫폼은 매주 6개 모노레포에서 나오는 65,000건의 변경 사항 중 90퍼센트를 자동 분석했다. 하지만 모듈 경계가 불분명한 코드베이스에 정제 없이 모델을 물리면 토큰 비용이 6배로 뛴다. 전역 팩토리 클래스를 이해하지 못한 모델은 엉뚱한 널 포인터 검증을 요구하며 환각을 일으킨다. 개발자들은 유용하지 않은 코멘트가 쌓이는 순간 알림을 끄고 경고 불감증에 빠진다.

파이썬 표준 ast 모듈을 써서 변경된 함수 시그니처와 영향받는 로컬 변수만 추려내는 전처리 엔진을 짜야 한다. 정적 메타데이터를 정제한 뒤, 변경과 상관없는 비기능적 수정을 해시 비교로 날려버린다. 그리고 변경 라인이 포함된 최하위 함수 노드의 시그니처와 실제 수정 구문만 역파싱해 경량 JSON 페이로드를 만든다.

레거시 모듈 100건으로 벤치마크를 돌려보면 차이가 확연하다. 원시 파일 주입은 PR당 42,000 토큰과 0.273달러가 깨진다. 반면에 AST 전처리 JSON 압축을 쓰면 PR당 6,100 토큰과 0.068달러로 떨어진다. API 비용이 47.3퍼센트 줄어들고 환각성 오탐 비율도 9.4퍼센트로 내려간다.

상태 머신 스키마로 에이전트 간 무한 루프를 끊어내는 법

보안 에이전트와 비즈니스 로직 에이전트를 대화형 그룹챗으로 묶으면 서로 출력을 받아치며 무한 핑퐁 루프에 빠진다. 단일 PR 분석에 수십 분이 걸리고 API 비용이 치솟는다. 에이전트끼리 직접 통신하게 두면 안 된다. Pydantic 스키마와 LangGraph를 활용해 유한 상태 머신 프레임워크를 구축해야 한다.

각 전문 에이전트는 중앙 파이프라인 상태만 전달받고, 자기 도메인 규칙에 따라 판정한 결과를 정해진 모델 형태로만 반환한다. Pydantic으로 에이전트 출력의 식별자, 파일 경로, 심각도, 신뢰도 점수를 강제하는 데이터 클래스를 정의한다. 반복 횟수가 2번에 도달하거나 모든 코멘트의 신뢰도가 0.85 이상으로 수렴하면 상태 머신을 강제로 끊는 조건부 에지를 건다.

OpenTelemetry GenAI 시맨틱 컨벤션 표준에 따라 각 에이전트의 실행을 고유한 스팬으로 감싸고 토큰 사용량을 분산 트레이싱 백엔드에 남겨야 한다. 이 구조를 적용하면 에이전트 오작동을 잡느라 날리던 테크 리드의 디버깅 시간이 주당 6시간 이상 줄어든다.

화이트리스트 검증 스크립트로 개발자 수용률 70퍼센트를 달성하는 법

구글의 사내 정적 분석 도구 트리코더 운영 데이터에 따르면, 도구가 아무리 정확한 지적을 해도 개발자가 고칠 가치가 없다고 느끼면 적대감만 커진다. 유효 오탐율이 5퍼센트를 넘는 검사기는 그 즉시 퇴출당한다. 자동 리뷰 코멘트의 67퍼센트 이상이 수용되게 만들려면 위험도가 낮은 모듈부터 단계적으로 넓혀가는 점진적 롤아웃을 해야 한다.

DTO 검증 레이어와 순수 함수처럼 부수 효과가 없는 계층을 골라 코멘트를 숨기는 섀도우 모드를 3주간 돌린다. 정밀도 85퍼센트를 확인한 뒤에 3개 도메인 스쿼드의 백엔드 코드에 인라인 코멘트를 풀고 수용률을 추적한다. 주간 단위로 피드백 로그를 모아서 수용률 67퍼센트를 밑도는 고오탐 룰을 자동으로 화이트리스트에서 빼고 격리 목록으로 던지는 피드백 루프 스크립트를 돌린다. 이 화이트리스트 검증 스크립트를 파이프라인에 박아두면 개발자가 짜증 내는 무쓸모 규칙들이 빠르게 걸러지면서 팀 내 리뷰 시스템 수용률 70퍼센트를 찍을 수 있다.