Qwen3.8-2.4T

3 hours ago 3

Qwen 오픈 모델 계열 최초의 Qwen-Max급 모델로, 코딩·전문 업무·연구·장기 에이전트 작업과 복잡한 다단계 작업의 완수 능력을 강화함 MoE 구조를 적용해 전체 2.4T 파라미터 중 95B를 활성화하며, 기본 262,144토큰 컨텍스트를 최대 1,010,000토큰까지 확장할 수 있음 Qwen3.8-Max는 PaperBench 93.0, IFBench 82.8, WideSearch 81.9를 기록했지만, 여러 평가에서는 Fable 5나 GPT 5.6 Sol보다 낮아 벤치마크별 결과가 엇갈림 공개된 Qwen3.8-2.4T-A95B는 텍스트 전용·상시 사고 모드 모델이며, reasoning_effort로 추론 깊이를 조절하고 preserve_thinking으로 이전 메시지의 추론 맥락을 유지함 Transformers에서 직접 불러오거나 SGLang·vLLM·TokenSpeed로 배포할 수 있으며, 관리형 Qwen3.8-Max는 비전 입력, 비사고 모드, 기본 1M 컨텍스트와 내장 도구를 추가로 제공함 Qwen-Max급 공개 모델 Qwen3.8-2.4T-A95B는 사후 학습된 모델의 가중치와 설정 파일을 Hugging Face Transformers 형식으로 제공함 Qwen3.5 아키텍처를 기반으로 코딩, 전문 업무, 연구, 장기 에이전트 작업 전반을 개선했으며, Qwen 오픈 모델 계열에서 처음으로 Qwen-Max급 모델을 공개함 어려운 질문에 답하는 능력뿐 아니라 복잡한 다단계 작업을 끝까지 더 안정적으로 수행하도록 설계됨 개선 영역은 다음과 같음 핵심 역량: 코딩·전문 업무·연구·장기 에이전트 작업을 포괄적으로 개선함 에이전트 실행: 자율 계획과 환경 피드백 처리를 강화해 종단 간 작업 완수의 신뢰성을 높임 하위 호환성: 널리 쓰이는 에이전트 하네스와 개발 도구를 폭넓게 지원함 사고 제어: reasoning_effort로 추론 깊이를 조절하고 preserve_thinking으로 이전 메시지의 추론 맥락을 유지함 관리형 확장 추론은 Qwen Cloud에서 제공함 Qwen3.8-Max는 Qwen3.8-2.4T-A95B 기반 공식 버전으로, 비전 입력, 비사고 모드, 기본 1M 컨텍스트, 공식 내장 도구 등을 추가함 자세한 정보는 Qwen3.8-Max 소개에서 확인할 수 있음 모델 구조와 규모 인과 언어 모델로 사전 학습과 사후 학습을 거침 전체 파라미터는 2.4T이며, 토큰당 95B 파라미터가 활성화됨 주요...

Read Entire Article