Moonshot AI의 Kimi K3는 전체 2.8T·활성 104B 매개변수와 네이티브 비전, 100만 토큰 문맥을 갖춘 오픈 웨이트 모델이며, Unsloth가 로컬 실행용 GGUF 양자화를 제공함 전체 정밀도 추론에는 1.56TB가 필요하지만, Dynamic 1-bit UD-IQ1_S는 594GB에서 약 78.9% Top-1 정확도를, 861.3GB의 2-bit UD-Q2_K_XL은 약 90%를 기록함 Kimi K3는 사고 흔적을 유지하는 thinking-only 모델로 Instant 모드를 지원하지 않으며, reasoning_effort로 "low", "high"", "max"를 선택하고 최대 1,048,576토큰을 처리함 Unsloth Studio는 RAM 오프로딩과 다중 GPU 감지를 자동화하며, 비전 기능을 사용하는 llama.cpp 실행에는 Kimi K3용 Unsloth 포크가 필요함 권장 UD-IQ1_S 실행에는 최소 610GB RAM이 필요하고, 대체로 RAM+VRAM을 양자화 파일 크기만큼 확보해야 하며 부족하면 디스크 오프로딩으로 크게 느려짐 모델 특성과 로컬 실행 요구사항 Moonshot AI의 Kimi K3는 코딩, 에이전트, 장문 문맥, 채팅을 겨냥한 2.8T 매개변수 오픈 웨이트 모델이며 추론 시 104B 매개변수를 활성화함 네이티브 비전과 100만 토큰 문맥 창을 지원하고 MoE 가중치에 MXFP4를 사용함 전체 정밀도 추론에는 1.56TB의 저장 공간이 필요함 Kimi-K3-GGUF는 Unsloth Studio 또는 llama.cpp에서 실행할 수 있음 NVIDIA DGX Station이나 128GB RAM 장치에 연결된 Mac Studio에서도 실행 가능함 하드웨어 요구량은 RAM과 VRAM 또는 통합 메모리의 합으로 계산하며, 구성 범위는 610GB~1.6TB임 GGUF 구현 방식 llama.cpp PR을 기반으로 구현했으며, Unsloth 포크가 비전 지원과 버그 수정을 추가함 비전 타워는 Kimi K2.5와 유사하지만 다음 차이가 있음 RMSNorm을 사용하고 bias가 없음 융합 QKV가 비정방형이며 qkv width != n_embd임 projector 뒤에 정규화를 적용함 큰 배치에서 n_tokens * 40 예산이 실패해 n_tokens * 160 으로 늘림 Kimi 채팅 템플릿을 Jinja 형식으로 변환함 기본 학습 설정이 preserved thinking을 활성화하...
Related
한 연구자가 noreply.net을 샀더니 기업 기밀이 쏟아짐
10 minutes ago
0
프랑스, 사전 동의 없는 텔레마케팅 전화 금지
40 minutes ago
0
GitHub Actions에 OIDC audience 제약이 필요한 이유
2 hours ago
0
H3-metal - Apple Silicon용 네이티브 MiniMax-H3 추론
2 hours ago
1
AI가 웹을 잠식하면서 인터넷의 집단 기억이 사라지고 있음
3 hours ago
1
Rails는 DHH 없이도 Rails일 수 있을까
5 hours ago
1
LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다
5 hours ago
1
Hanami - Rails를 대체하는 Ruby 프레임워크
6 hours ago
2
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
3 weeks ago
209
Codex 사용량 한도 리셋 추적
3 weeks ago
88
NVIDIA·CoreWeave·Nebius가 만든 GPU 붐의 순환 금융 구조
4 weeks ago
62
'킬러들의 쇼핑몰2' 감독 "시즌3 고민 중"⋯이동욱 "시키면 ...
3 weeks ago
57
© Clint IT 2026. All rights are reserved

1 week ago
18








English (US) ·