에이전틱 코드 리뷰에서 인간-AI 시너지 : 인간과 AI는 다르게 리뷰한다

1 hour ago 1

300개 GitHub 프로젝트의 27만여 개 인라인 코드 리뷰 대화를 분석해, 인간과 AI의 피드백이 실제 수정과 후속 대화로 어떻게 이어지는지 비교함 AI는 코드에서 문제를 찾아 바로 수정안을 제시하는 데 집중한 반면, 인간은 왜 이렇게 구현했는지 묻고 테스트/프로젝트 관례/기존 결정을 함께 살펴봄 AI는 인간보다 길고 많은 수정안을 제시했지만 실제 채택률은 낮았으며, 잘못된 제안이나 문제는 맞아도 프로젝트에 맞지 않는 해결책이 적지 않았음 인간의 리뷰는 작성자와 여러 차례 의견을 주고받는 과정으로 이어졌지만, AI가 시작한 리뷰는 첫 코멘트만 남기고 대화 없이 끝나는 경우가 대부분이었음 AI는 대량의 변경에서 결함 후보를 빠르게 선별하는 역할, 인간은 맥락과 의도를 확인하고 수정 방향과 최종 판단을 조율하는 역할에 더 가까웠음 300개 프로젝트의 실제 리뷰 대화 분석 2022년부터 2025년 11월까지 300개 성숙한 오픈소스 프로젝트의 54,330개 PR과 278,790개 인라인 리뷰 대화를 분석함 PR 전체 코멘트가 아니라 특정 코드 변경에 연결된 대화만 수집해, 피드백과 후속 논의 및 실제 코드 반영 여부를 추적함 공식적으로 확인된 16개 AI 코드 리뷰 봇을 식별하고, PR 작성자와 첫 리뷰어가 인간인지 에이전트인지에 따라 대화를 분류함 AI 에이전트가 시작한 리뷰는 전체의 55.7%였지만, AI 에이전트 계정이 직접 작성한 PR은 2.6%로 아직 적었음 AI는 결함을 지적하고, 인간은 의도를 물음 AI 리뷰 코멘트의 95% 이상이 코드 개선과 결함 탐지에 집중함 인간도 코드 개선 피드백이 가장 많았지만 다음과 같은 역할을 추가로 수행함 구현 의도와 설계 이유 질문 테스트 방식 확인 기존 코드와 저장소 관례 안내 여러 차례의 대화를 통한 수정 방향 조율 인간 리뷰의 Knowledge Transfer 피드백은 최근 변경된 클래스명이나 저장소 내부 관례처럼 프로젝트 고유 지식을 전달하는 역할을 함 AI는 의도가 불분명한 경우 질문하기보다 바로 수정안을 제시하는 경향을 보임 AI 리뷰는 길지만 대화로 이어지는 경우가 적음 인간 리뷰 코멘트는 코드 한 줄당 평균 4.1토큰, AI 리뷰는 29.6토큰이었음 AI 코멘트에는 심각도/요약 제목/도구 출력/관련 파일 목록 등이 함께 들어가 사람이 읽어야 할 정보량이 증가함 AI가 시작한 리뷰의 85.2~86.7%는 첫 코멘트 이후 추가 응답 없이 종료됨 반면 인간이...

Read Entire Article