지난해 공개된 Kimi Linear를 48B에서 2.8T로 확장한 프로덕션 모델로, 현재 공개 가중치 모델 가운데 규모가 가장 큼 새로 도입한 LatentMoE는 대형 선형 계층을 다운 프로젝션해 압축하고, 전체 구조는 일반 MoE와 어텐션을 추론 효율 중심 구성요소로 대체함 어텐션 잔차(attention residuals) 는 계층 간 잔차를 어텐션 점수 기반 가중치로 연결해 검증 손실과 다운스트림 성능을 일관되게 소폭 개선함 어텐션 잔차로 훈련 비용은 약 4%, 추론 비용은 약 2% 늘어나며, 모든 RoPE 계층을 제거하고 전체에 NoPE를 적용함 네이티브 멀티모달 지원까지 추가해, Kimi Linear의 대규모 확장과 추론 효율·잔차 경로 개선을 함께 추구함 Kimi Linear에서 2.8T로 확장 Kimi K3는 Kimi Linear를 48B에서 2.8T로 확장한 프로덕션 버전이며, 현재 공개 가중치 모델 중 가장 큰 규모임 Kimi Linear 대비 새로 추가된 LatentMoE는 Nemotron 3 Ultra의 방식과 본질적으로 같음 다중 헤드 잠재 어텐션과 마찬가지로 대형 선형 계층을 다운 프로젝션해 압축함 Nemotron 3와 DeepSeek V4 등에서 나타난 흐름처럼 추론 효율 개선에 초점을 맞춤 일반 MoE를 LatentMoE로 대체함 일반 어텐션 대신 다중 헤드 잠재 어텐션과 Kimi Delta Attention을 사용함 잔차 경로와 위치 정보 어텐션 잔차는 효율 최적화가 아닌 잔차 경로 개선을 위한 구성요소로, Kimi Linear에도 이미 적용됐음 DeepSeek V4의 mHC(manifold-constrained Hyper-Connections)가 잔차 경로를 넓히는 것과 달리, 어텐션 잔차는 계층 사이의 잔차를 연결함 각 잔차의 중요도나 기여도를 나타내는 어텐션 점수를 연결 가중치로 사용함 기술 보고서 기준으로 검증 손실과 다운스트림 성능이 일관되게 소폭 개선되지만, 훈련 비용은 약 4%, 추론 비용은 약 2% 증가함 모든 RoPE 계층을 제거하고 NoPE, 즉 위치 임베딩 없음을 전체 계층에 적용함 최근 다른 아키텍처는 슬라이딩 윈도 어텐션 같은 로컬 어텐션에 RoPE를, 전역 계층에 NoPE를 사용하는 경향이 있었음 NoPE만 사용한 기존 아키텍처도 있지만, Kimi K3는 확인된 범위에서 이를 전면 적용한 최초의 프런티어급 모델임 네이티브 멀티모달 지원 Kimi K3에는 네이티...
Related
한 연구자가 noreply.net을 샀더니 기업 기밀이 쏟아짐
1 hour ago
1
프랑스, 사전 동의 없는 텔레마케팅 전화 금지
1 hour ago
0
GitHub Actions에 OIDC audience 제약이 필요한 이유
3 hours ago
0
H3-metal - Apple Silicon용 네이티브 MiniMax-H3 추론
3 hours ago
1
AI가 웹을 잠식하면서 인터넷의 집단 기억이 사라지고 있음
4 hours ago
1
Rails는 DHH 없이도 Rails일 수 있을까
6 hours ago
1
LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다
6 hours ago
1
Hanami - Rails를 대체하는 Ruby 프레임워크
7 hours ago
2
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
3 weeks ago
209
Codex 사용량 한도 리셋 추적
3 weeks ago
88
NVIDIA·CoreWeave·Nebius가 만든 GPU 붐의 순환 금융 구조
4 weeks ago
62
'킬러들의 쇼핑몰2' 감독 "시즌3 고민 중"⋯이동욱 "시키면 ...
3 weeks ago
57
© Clint IT 2026. All rights are reserved

1 week ago
19








English (US) ·