코딩 에이전트는 왜 이렇게 멍청할까?

1 day ago 3

AI 지원 개발은 발전했지만, 모델을 코드베이스와 시스템에 연결하는 에이전트는 작업 관리, 위임, 소통에서 여전히 병목으로 남아 있음 작업을 하위 과제로 나눠도 병렬 실행과 모델별 위임이 미흡해, 간단한 작업까지 느리고 비싼 모델에 맡기거나 사람이 직접 모델을 바꿔야 함 읽기 어려운 계획, 자기 기능에 대한 무지, 사소한 질문 때문에 멈추는 실행 흐름이 개발자의 시간과 주의력을 계속 요구함 접근하지 말라는 프롬프트나 반복적인 승인 대신, 파일시스템과 네트워크의 접근 경계를 강제하는 OS 수준 샌드박스가 기본으로 필요함 이상적인 에이전트는 비용, 속도, 정확성을 조율하면서 사람이 이해할 계획과 자율 실행을 제공해야 함. 현재의 부족함을 대리인 문제로 보는 가설은 있지만, 충분한 답은 아직 없음 모델의 발전과 에이전트의 정체 2025년 2월 처음 코딩 에이전트를 사용했을 때는 IDE와 AI 채팅 사이에서 복사해 옮기던 작업을 대신해, 파일을 직접 수정하고 오류를 실시간으로 고치는 모습이 인상적이었음 며칠 뒤부터 응답 중단, 원시적인 개발 흐름, 성급한 완료 선언이 반복됐으며, 6개월이면 기반 LLM만큼 인상적인 도구가 될 것이라는 기대와 달리 문제가 이어짐 모델과 에이전트는 다름 GPT Astra, Claude Sonnet, GLM-5.3 같은 모델은 텍스트, 이미지, 코드를 생성함 Anthropic의 Claude Code, OpenAI의 Codex 같은 에이전트는 모델을 코드베이스와 컴퓨터 시스템에 연결함 모델이 두뇌라면 에이전트는 몸이며, 모델의 텍스트 출력을 실제 명령과 파일 작업으로 이어 줌 작업을 나누지만 제대로 병렬화하거나 위임하지 못함 OpenCode는 파일 업로드용 공유 링크를 만드는 PicoShare에 암호 문구로 링크를 보호하는 기능을 추가하면서 약 1,500줄의 새 코드를 작성하는 작업을 10개 하위 작업으로 나눴지만, 모두 순차 실행함 서로 독립적이어서 쉽게 병렬화할 수 있는 작업까지 하나씩 처리함 Claude Code도 하위 에이전트 한두 개를 실행하지만, 이들이 모두 끝날 때까지 기다리는 경우가 있음 종단 간 테스트를 몇 분씩 기다린 뒤에야 Git 이력을 살펴보고 커밋 메시지 규칙을 파악해 메시지를 작성하기 시작하는 일이 하루에도 여러 번 발생함 작업 난도에 맞춘 모델 전환도 부족함 5만 줄의 코드에서 특정 패턴을 찾는 작업에도 느리고 비싼 최첨단 모델을 계속 쓰며, 반대로 더 똑똑한 모델...

Read Entire Article