HANDBOOK.md는 20~124쪽의 업무 절차가 장시간·다중 도구 작업에서도 에이전트 행동을 제약하는지 측정하는 65개 과제 벤치마크임 금융·의료 청구·보험·물류·인사 환경에서 과제마다 권한자·임계값·절차를 바꿔, 익숙한 규칙을 재사용하지 않고 해당 문서를 직접 읽도록 설계함 11개 제공자의 30개 모델 구성을 평가한 결과, 모든 기준을 충족해야 통과하는 엄격 채점에서 최고 구성도 36.2%에 그쳤으며 대부분의 프런티어 구성은 25% 미만이었음 에이전트는 환경 내 요청을 상위 정책보다 우선하거나 필수 검사 결과를 무시하고, 장시간 작업 중 규칙을 잃거나 달성하지 못한 준수를 완료했다고 보고하는 패턴을 반복함 단 하나의 기준 위반을 허용하면 선두 모델의 점수가 약 두 배로 높아져, 업무 대부분을 완료하더라도 실제 환경에서 결정적인 한 가지 요구사항을 놓칠 수 있음 기업 업무를 재현한 벤치마크 HANDBOOK.md는 장기 정책 문서가 에이전트의 후속 행동을 끝까지 통제하는지 직접 평가함 기존 벤치마크는 주로 이슈 해결, 사이트 탐색, 워크플로 완료 같은 목표 달성 여부를 측정함 장문의 구속력 있는 문서가 즉각적인 요청과 충돌할 때도 행동을 제약하는지는 충분히 평가되지 않았음 기존 정책 준수 평가는 짧고 반복되는 정책을 사용해, 모델이 현재 문서를 읽지 않고 반복 노출로 규칙을 습득할 가능성이 있었음 65개 과제는 금융, 의료 청구, 보험, 물류, 인사의 5개 분야와 10개 가상 회사를 다룸 각 환경에는 스프레드시트, PDF, Office 문서가 있는 작업 공간과 모의 이메일, Slack, 캘린더, Jira, Shopify 서비스가 포함됨 외부 서비스는 Model Context Protocol(MCP) 도구로 제공됨 프롬프트는 “SOP에 따라 오늘의 읽지 않은 이메일을 처리하라”처럼 일상적이며, 난도는 요청보다 이를 통제하는 문서에서 발생함 표준 운영 절차는 분야 전문가가 작성한 20~124쪽 분량이며 PDF, Word, HTML 형식으로 제공됨 에이전트는 적용 조항을 찾고 평균 약 17개 추론 단계와 30회 도구 호출 동안 기억해야 함 필요한 행동뿐 아니라 정책이 중단을 요구하는 조건도 정확히 적용해야 함 분야별 2개씩 총 10개의 기본 핸드북을 만들고, 모든 과제에서 권한자 이름과 임계값, 절차 세부 사항을 변경함 과제마다 정책이 달라 익숙한 규칙과의 패턴 매칭만으로 해결할 수 없음 824개의 프로그램 기준이...
HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음
1 week ago
17
Related
한 연구자가 noreply.net을 샀더니 기업 기밀이 쏟아짐
13 minutes ago
0
프랑스, 사전 동의 없는 텔레마케팅 전화 금지
42 minutes ago
0
GitHub Actions에 OIDC audience 제약이 필요한 이유
2 hours ago
0
H3-metal - Apple Silicon용 네이티브 MiniMax-H3 추론
2 hours ago
1
AI가 웹을 잠식하면서 인터넷의 집단 기억이 사라지고 있음
3 hours ago
1
Rails는 DHH 없이도 Rails일 수 있을까
5 hours ago
1
LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다
5 hours ago
1
Hanami - Rails를 대체하는 Ruby 프레임워크
6 hours ago
2
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
3 weeks ago
209
Codex 사용량 한도 리셋 추적
3 weeks ago
88
NVIDIA·CoreWeave·Nebius가 만든 GPU 붐의 순환 금융 구조
4 weeks ago
62
'킬러들의 쇼핑몰2' 감독 "시즌3 고민 중"⋯이동욱 "시키면 ...
3 weeks ago
57
© Clint IT 2026. All rights are reserved









English (US) ·