Qwen3.8 Max, Agentic Index 종합 1위

4 days ago 10

Qwen3.8 Max가 도구 사용·계획·자율성·복합 문제 해결을 측정하는 Artificial Analysis Agentic Index에서 종합 최고 모델로 평가됨 Agentic Index는 특정 역량과 산업별 성능을 측정하는 Capability Indices 중 하나로, 총 24개 모델을 비교함 별도 지표인 Intelligence Index v4.1.1은 GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1 등 9개 평가를 결합하며 비용·소요 시간·출력 토큰도 함께 비교함 모델 외에도 코딩 에이전트, 이미지·영상·음성, 개방성, API 속도·지연 시간과 제공자별 엔드포인트 정확도를 독립적으로 평가함 모델을 선택할 때는 지능 점수뿐 아니라 작업당 비용, 실행 시간, 출력 속도, 가중치 공개 여부와 실제 엔드포인트의 정확도 보존 수준까지 함께 확인할 수 있음 Qwen3.8 Max와 Agentic Index Qwen3.8 Max는 8월 5일 새 언어 모델 평가 대상으로 추가됐으며, Hacker News 제목 기준 Agentic Index 종합 1위에 오름 Artificial Analysis Agentic Index는 에이전트 워크플로에서 나타나는 도구 사용, 계획, 자율성, 복합 문제 해결 성능을 측정함 총 24개 모델이 포함되며, 추론 모델은 전구 아이콘으로 구분됨 금융·회계, 전략·운영, 법률, 의료, 엔지니어링, 경제학과 함께 특정 역량과 산업을 평가하는 Capability Indices에 속함 Intelligence Index v4.1.1 Artificial Analysis Intelligence Index v4.1.1은 독립적으로 실행한 9개 평가를 결합함 GDPval-AA v2: 현실에서 경제적 가치가 있는 직무 과제 𝜏³-Banking: 에이전트형 도구 사용 Terminal-Bench v2.1: 에이전트형 코딩과 터미널 사용 SciCode: 코딩 Humanity's Last Exam: 추론과 지식 GPQA Diamond: 과학적 추론 CritPt: 물리학 추론 AA-Omniscience: 지식과 환각 AA-LCR: 긴 문맥 추론 대시보드는 전체 595개 모델 가운데 선택된 26개 모델을 지능, 비용, 시간, 출력 토큰 기준으로 비교함 모델은 공개 가중치, 상업적 사용이 제한된 공개 가중치, 독점 모델로 구분되며 입력 유형과 국가별 필터도 제공함 가중치가 공개됐더라도 상업적 이...

Read Entire Article