링크드인, 다중 AI 에이전트로 코드 리뷰 자체 구축
최근 30일 조회수 — 좋아요 —핵심 요약
링크드인이 단일 AI 리뷰어의 한계를 극복하고자 여러 에이전트가 교차검증하는 코드 리뷰 플랫폼을 만들어 63.9% 수락률을 기록했다.
링크드인이 자사 규모의 코드 리뷰 문제를 사람 검토자나 기성 AI 리뷰어 하나로는 감당할 수 없다고 판단하고, 여러 AI 에이전트가 독립적으로 코드를 검토하는 다중 에이전트 플랫폼을 자체 구축했다. InfoQ에 따르면 이 플랫폼의 목표는 단순히 리뷰 코멘트를 많이 생성하는 것이 아니라, 개발자가 실제로 반영할 만한 신호 대비 잡음 비율 높은 코멘트를 만들고, 조직의 코딩 표준·저장소별 관례·암묵적 지식까지 반영하는 데 있다.1
링크드인은 기성 AI 리뷰어를 그대로 쓸 때 드러나는 세 가지 구조적 한계를 지적한다. 첫째, 단일 모델에 의존하면 특정 유형의 버그를 계속 놓치고 같은 저신호 이슈만 반복해서 지적하는 사각지대가 생긴다. 둘째, 조직 전체 정책과 저장소별 관례, 고위험 시나리오에 특화된 지침을 동시에 인코딩하기 어려운 커스터마이징 부족 문제가 있다. 셋째, 리뷰어를 엔지니어링 인프라의 일부로 통제·평가·모니터링할 운영 통제력이 없다는 점이다.
이를 해결하기 위해 링크드인은 서로 다른 모델과 추론 방식을 쓰는 여러 개의 독립적인 AI 리뷰어를 두고, 조직 정책부터 저장소 관례, 상황별 규칙까지 층층이 조합 가능한 커스터마이징 체계를 만들었다. 인프라는 쿠버네티스 기반 이벤트 주도 파이프라인으로, 내구성 있는 큐와 수평 확장 가능한 워커를 통해 지연 시간, 수락률, 완료율, 프로바이더 장애까지 모니터링한다. 여러 리뷰어가 같은 이슈를 독립적으로 지적하면 그 일치를 강한 증거로 간주해 신뢰도를 높이고, 한 리뷰어만 찾아낸 이슈는 자동으로 버리지 않고 별도로 검증한다. 사소하거나 이미 고쳐졌거나 관련 없거나 해당 저장소 관례와 맞지 않는 제안은 게시 전에 걸러낸다.
실제 효과를 확인하기 위해 링크드인은 AI 제안이 병합된 코드에 반영됐는지 자동으로 비교하는 수락률 평가 파이프라인을 만들었다. 1,727건의 PR에서 표본으로 뽑은 5,230건의 리뷰 코멘트 중 90.1%를 병합된 코드 기준으로 높은 신뢰도로 평가할 수 있었고, 전체 수락률은 63.9%로 나타났다. 카테고리별 편차는 컸다.
| 카테고리 | 수락률 |
|---|---|
| 동시성 버그 | 100% |
| 로직 오류 | 80% |
| 버그 수정 | 58.1% |
| 리팩터링 | 43.5% |
| 보안 관련 수정 | 40.6% |
대규모 코드 리뷰 문제에 접근하는 방식은 회사마다 다르다. 클라우드플레어는 오픈소스 코딩 에이전트 OpenCode를 중심으로 오케스트레이션 시스템을 구축했고, 데이터브릭스는 AI 코딩 비용의 급증에 대응해 중앙집중식 AI 관리를 위한 Unity AI Gateway와 개발자 도구인 Omnigent를 내놓았다. 링크드인의 접근은 단일 모델 대신 다중 에이전트 간 교차검증에, 나머지 두 회사는 오케스트레이션과 비용 관리에 각각 무게를 두고 있다.
Footnotes
-
InfoQ, “AI Code Review at Scale: LinkedIn’s Multi-Agent Approach” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요.