WASTE는 2.78조 파라미터의 완전한 Kimi K3 오픈 가중치 모델을 축소 없이 982GiB 컨테이너로 변환해 소비자용 노트북에서 실행하는 C 기반 추론 엔진임 모델의 상주 트렁크만 메모리에 두고 토큰마다 활성화되는 약 4%의 전문가 가중치를 NVMe에서 읽으며, 남은 RAM은 크기가 제한된 전문가 캐시로 사용함 Kimi K3는 4K 컨텍스트에서 최소 29.05GB RAM으로 열리지만 실용적인 구성은 64GB MacBook Pro의 46GB 예산이며, 여기서 0.45~0.62 tok/s를 기록함 전문가 읽기와 연산을 겹쳐 약 1.6배 개선하고 다음 계층 라우터를 한 residual 앞서 실행해 캐시 적중률을 14%에서 38% 로 높이면서도 총 읽기량과 로짓은 바꾸지 않음 인터넷 연결·토큰별 비용·외부 데이터 전송 없이 초대형 모델을 로컬에서 실행할 수 있지만, 내부 NVMe와 약 1TB 저장공간이 필요하고 RAM 예산이 52GB 이상이면 운영체제 페이징으로 오히려 급격히 느려질 수 있음 WASTE의 목표와 구현 형태 WASTE(Weight-Aware Streaming Tensor Engine) 는 런타임 외부 의존성이 없는 임베드 가능한 C 추론 엔진임 libwaste.a와 waste 실행 파일만 사용하며 libc와 pthreads 외에 BLAS, CUDA, ONNX, Python이 필요하지 않음 Python은 모델 변환과 PyTorch 기준 검증에만 사용되고 추론 경로에는 들어가지 않음 공개 API는 26개 함수로 구성되며 모델 열기, RAM 상한 설정, 생성, 세션 저장, 종료를 지원함 현재 검증 대상은 Kimi K3 2.78T 전체 모델임 공개 원본은 1.42TB이며 변환 후 컨테이너는 982GiB임 증류·가지치기·축소 버전이 아님 Kimi-Linear 48B도 같은 엔진과 포맷으로 19GiB 컨테이너, 최소 1.87GB RAM, 10.7 tok/s를 기록함 프로젝트 이름은 데스크 위 하드웨어에서 실행할 수 있는 모델을 클라우드 데이터센터에서 돌리며 토큰 비용과 전력을 함께 소비하는 상황을 줄이려는 목표에서 나옴 디스크 스트리밍 구조 Mixture of Experts 구조인 K3는 토큰당 모델의 약 4%만 활성화하므로, 비활성 가중치를 RAM에 상주시킬 필요 없이 필요한 시간에 접근 가능하게 배치함 .waste 컨테이너는 JSON 매니페스트, 상주 트렁크, 계층별 전문가 뱅크로 구성됨 각 전문가 레코...
29GB RAM에서 Kimi K3를 0.50 tok/s로 실행하기
1 week ago
18
Related
한 연구자가 noreply.net을 샀더니 기업 기밀이 쏟아짐
12 minutes ago
0
프랑스, 사전 동의 없는 텔레마케팅 전화 금지
42 minutes ago
0
GitHub Actions에 OIDC audience 제약이 필요한 이유
2 hours ago
0
H3-metal - Apple Silicon용 네이티브 MiniMax-H3 추론
2 hours ago
1
AI가 웹을 잠식하면서 인터넷의 집단 기억이 사라지고 있음
3 hours ago
1
Rails는 DHH 없이도 Rails일 수 있을까
5 hours ago
1
LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다
5 hours ago
1
Hanami - Rails를 대체하는 Ruby 프레임워크
6 hours ago
2
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
3 weeks ago
209
Codex 사용량 한도 리셋 추적
3 weeks ago
88
NVIDIA·CoreWeave·Nebius가 만든 GPU 붐의 순환 금융 구조
4 weeks ago
62
'킬러들의 쇼핑몰2' 감독 "시즌3 고민 중"⋯이동욱 "시키면 ...
3 weeks ago
57
© Clint IT 2026. All rights are reserved









English (US) ·