Qwen3.8 Max가 도구 사용·계획·자율성·복합 문제 해결을 측정하는 Artificial Analysis Agentic Index에서 종합 최고 모델로 평가됨 Agentic Index는 특정 역량과 산업별 성능을 측정하는 Capability Indices 중 하나로, 총 24개 모델을 비교함 별도 지표인 Intelligence Index v4.1.1은 GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1 등 9개 평가를 결합하며 비용·소요 시간·출력 토큰도 함께 비교함 모델 외에도 코딩 에이전트, 이미지·영상·음성, 개방성, API 속도·지연 시간과 제공자별 엔드포인트 정확도를 독립적으로 평가함 모델을 선택할 때는 지능 점수뿐 아니라 작업당 비용, 실행 시간, 출력 속도, 가중치 공개 여부와 실제 엔드포인트의 정확도 보존 수준까지 함께 확인할 수 있음 Qwen3.8 Max와 Agentic Index Qwen3.8 Max는 8월 5일 새 언어 모델 평가 대상으로 추가됐으며, Hacker News 제목 기준 Agentic Index 종합 1위에 오름 Artificial Analysis Agentic Index는 에이전트 워크플로에서 나타나는 도구 사용, 계획, 자율성, 복합 문제 해결 성능을 측정함 총 24개 모델이 포함되며, 추론 모델은 전구 아이콘으로 구분됨 금융·회계, 전략·운영, 법률, 의료, 엔지니어링, 경제학과 함께 특정 역량과 산업을 평가하는 Capability Indices에 속함 Intelligence Index v4.1.1 Artificial Analysis Intelligence Index v4.1.1은 독립적으로 실행한 9개 평가를 결합함 GDPval-AA v2: 현실에서 경제적 가치가 있는 직무 과제 𝜏³-Banking: 에이전트형 도구 사용 Terminal-Bench v2.1: 에이전트형 코딩과 터미널 사용 SciCode: 코딩 Humanity's Last Exam: 추론과 지식 GPQA Diamond: 과학적 추론 CritPt: 물리학 추론 AA-Omniscience: 지식과 환각 AA-LCR: 긴 문맥 추론 대시보드는 전체 595개 모델 가운데 선택된 26개 모델을 지능, 비용, 시간, 출력 토큰 기준으로 비교함 모델은 공개 가중치, 상업적 사용이 제한된 공개 가중치, 독점 모델로 구분되며 입력 유형과 국가별 필터도 제공함 가중치가 공개됐더라도 상업적 이...
Qwen3.8 Max, Agentic Index 종합 1위
4 days ago
10
Related
Hanami - Rails를 대체하는 Ruby 프레임워크
1 hour ago
1
Show GN: 프리터뷰 - 가입 없이 포트폴리오부터 채점해보는 AI 모의면접
1 hour ago
1
Show GN: 공공데이터 통합검색 x AI
2 hours ago
1
Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전트 LLM
3 hours ago
2
Show GN: TLcube — 세 면의 휘도 순서에 데이터를 싣는 2.5D 바코드
3 hours ago
1
Show GN: 알뜰계산기를 소개합니다
4 hours ago
2
영국의 익명성 전쟁, 미국에 상륙
5 hours ago
4
Postgres 내부로 CDC를 밀어 넣은 방법
5 hours ago
3
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
3 weeks ago
209
Codex 사용량 한도 리셋 추적
3 weeks ago
88
NVIDIA·CoreWeave·Nebius가 만든 GPU 붐의 순환 금융 구조
4 weeks ago
62
'킬러들의 쇼핑몰2' 감독 "시즌3 고민 중"⋯이동욱 "시키면 ...
3 weeks ago
56
© Clint IT 2026. All rights are reserved









English (US) ·