Meta Muse Glimmer - 기기에서 실행하는 오픈 웨이트 30B 코딩 모델

16 hours ago 3

Meta가 30B 파라미터 로컬 에이전트 모델 Muse Glimmer를 Apache 2.0 라이선스로 공개했으며, 단일 소비자용 GPU를 장착한 Mac이나 PC에서 실행하도록 최적화함 대형 교사 모델의 에이전트 추론을 전이하는 로짓 증류와 장문맥 중간 학습, 지도 미세조정·온정책 증류·강화학습을 조합해 제한된 메모리·연산 성능에 대응함 함수 호출과 장기 다단계 추론, 도구 오류 복구, 코드 작성·디버깅, 텍스트·이미지 처리를 지원하며 100개가 넘는 언어의 데이터로 학습함 완전 정밀도에서 55GB 이상 필요한 모델을 약 4비트·20GB 미만으로 양자화하고, DFlash 기반 추측 디코딩으로 출력 품질을 유지하면서 생성 속도를 높임 가중치는 Hugging Face에서 받을 수 있으며, llama.cpp·MLX·ExecuTorch와 Ollama·LM Studio·Unsloth 등 로컬 실행 생태계의 지원도 순차적으로 추가될 예정임 소비자용 하드웨어를 겨냥한 로컬 에이전트 Muse Glimmer는 Meta Superintelligence Labs가 공개한 30B 파라미터 모델로, 상시 실행되는 로컬 에이전트 워크플로에 최적화됨 단일 소비자용 GPU를 탑재한 Mac이나 PC에서 실행할 수 있음 로컬 에이전트, 함수 호출, 코딩, LLM 심사자 평가에 활용 가능함 Apache 2.0 라이선스로 오픈 웨이트를 제공함 클라우드와 네트워크에 의존하지 않고 어디서나 AI를 사용할 수 있도록 설계했으며, 표적 작업에서 소형 모델의 성능을 높이는 학습 방식을 적용함 모델 가중치와 개발자 문서를 함께 공개함 llama.cpp, MLX, ExecuTorch용 최적화 통합은 공개 후 며칠 내 제공될 예정임 에이전트 성능을 만드는 학습 과정 개인 일정·메시지·파일을 다루는 에이전트에는 장기 실행과 정확한 도구 호출, 멀티모달 이해, 장문맥 기억, 지시 준수가 함께 필요함 로컬 하드웨어의 메모리·연산 제약에 맞추기 위해 소형 아키텍처, 대형 교사 모델의 에이전트 추론을 전달하는 증류 방식, 양자화를 포함한 추론 최적화를 사용함 학습은 세 단계로 진행됨 사전 학습: 교사 모델과 유사한 데이터 구성을 사용하고 Muse Spark 출력에 로짓 증류를 수행함 중간 학습: 자연 발생 데이터와 함께 더 긴 문맥, 에이전트 중심 데이터, 풍부한 추론 실행 추적을 학습함 후속 학습: 일반·추론·코딩·에이전트 영역에서 지도 미세조정, 온정책 증류, 강화학...

Read Entire Article