인간 중심에서 에이전틱 코드 리뷰로 - 더 빠른 결정이 더 나은 리뷰를 뜻하지는 않는다

1 hour ago 1

207개 GitHub 프로젝트의 102만 개 PR을 분석해, 코드 리뷰가 인간 중심/LLM 보조/AI 에이전트 참여 단계로 바뀌는 과정에서 리뷰 속도와 품질이 어떻게 달라졌는지 조사함 AI 리뷰어를 점진적으로 도입하거나 에이전트 단계에서 빠르게 도입한 프로젝트는 리뷰 결정이 빨라졌지만, 초기 LLM 리뷰어에 크게 의존한 프로젝트에서는 별다른 속도 향상이 없었음 에이전트가 먼저 리뷰하거나 여러 에이전트가 참여하면 일부 프로젝트에서 사람만 리뷰할 때보다 빠르게 결론에 도달했지만, 리뷰 품질 지표가 함께 좋아지지는 않았음 AI가 참여한 리뷰는 같은 리뷰어를 반복해서 배정하거나 큰 변경을 한꺼번에 다루는 패턴이 더 자주 나타났으며, 사람만 참여한 리뷰보다 리뷰 안티패턴 비율이 대체로 높았음 AI 리뷰어를 모든 PR에 동일하게 붙이기보다 변경 종류/크기/작성자 경험/기존 논의와 위험도에 따라 선택적으로 배치하고, 기존 인간 리뷰 관행과 결합해야 한다는 결론 102만 개 PR에서 세 번의 리뷰 시대를 추적 2022년 5월부터 2026년 2월까지 207개 오픈소스 GitHub 프로젝트의 리뷰 완료 PR을 분석함 각 프로젝트의 리뷰 역사를 세 시기로 구분함 인간 중심 리뷰: 생성형 AI 리뷰어가 참여하기 전 LLM 보조 리뷰: 초기 LLM 기반 리뷰어가 참여한 시기 에이전틱 리뷰: 저장소 탐색과 도구 실행이 가능한 AI 에이전트가 참여한 시기 리뷰 시간뿐 아니라 세 가지 코드 리뷰 안티패턴을 품질 대리 지표로 사용함 같은 리뷰어 조합에 반복적으로 의존하는 Review Buddies 리뷰가 장시간 멈춰 있는 Sleeping Review 지나치게 큰 변경을 한 번에 검토하는 Large Changeset AI 도입과 리뷰 결과 사이의 통계적 연관성을 분석한 연구이며, AI 도입이 결과를 직접 유발했다는 인과관계를 입증한 것은 아님 AI 리뷰어를 도입하는 방식도 서로 달랐음 프로젝트의 AI 리뷰어 참여 추이에 따라 세 가지 도입 방식이 나타남 점진적 도입 46%: 초기 LLM 리뷰는 제한적으로 사용하고 이후 에이전트 참여를 점차 확대 초기 LLM 집중 도입 22%: LLM 리뷰 단계부터 대부분의 PR에 AI 리뷰어를 사용 에이전트 집중 도입 32%: 초기 LLM 사용은 적었지만 에이전트 등장 이후 빠르게 확대 점진적 도입 프로젝트에서는 AI 리뷰 대상이 유지보수와 버그 수정에서 기능 개발과 리팩터링까지 넓어짐 단순 코멘트를 생성하는...

Read Entire Article