TurboFieldfare는 전체 14.3GB 모델을 메모리에 올리지 않고 Gemma 4 26B-A4B를 약 2GB의 메모리로 실행해, 8GB Apple Silicon Mac에서도 로컬 추론이 가능함 1.35GB 공유 코어와 FP16 KV 캐시만 상주시킨 뒤 토큰마다 필요한 MoE 전문가 가중치를 SSD에서 스트리밍하며, 16슬롯 LFU 캐시와 병렬 pread로 입출력을 제한함 Gemma 4 26B-A4B는 토큰당 약 3.88B 파라미터를 활성화하며, 측정된 디코딩 속도는 8GB M2 MacBook Air에서 5.1~6.3 tok/s, 24GB M5 Pro에서 31~35 tok/s임 Swift 6.2와 Metal 4로 구현된 전용 런타임이며, 네이티브 Mac 앱·CLI·설치 도구·실험적 OpenAI 호환 서버를 동일한 .gturbo 모델 디렉터리 위에서 제공함 현재 범위는 macOS 26 이상과 최소 8GB RAM을 갖춘 Apple Silicon Mac의 텍스트 전용 추론으로 한정되며, 이미지·음성·영상과 원격 서버 인증·TLS는 지원하지 않음 메모리를 줄이는 실행 구조 TurboFieldfare는 instruction-tuned Gemma 4 26B-A4B를 전체 메모리에 적재하지 않음 1.35GB 공유 코어와 FP16 KV 캐시는 메모리에 유지함 각 토큰에 필요한 routed expert만 SSD에서 Metal이 볼 수 있는 버퍼로 읽음 설치된 텍스트 전용 모델은 약 14.3GB지만, 가중치와 4K KV 캐시가 사용하는 메모리는 약 2GB임 모델은 총 26B 파라미터 가운데 토큰당 약 3.88B 파라미터를 활성화함 가중치는 group 64 기반 MLX affine 4비트를 사용하며, router는 8비트, 공유 및 routed expert는 4비트임 MLX나 llama.cpp를 감싼 구성이 아니라 Gemma 4 26B-A4B에 맞춰 만든 Swift·Metal 전용 런타임임 토큰 생성 과정 각 Transformer 레이어에서 Metal이 상주 가중치로 attention과 router를 계산함 CPU는 router가 선택한 상위 8개 expert ID를 레이어별 16슬롯 LFU 캐시와 대조함 캐시 미스는 제한된 수의 병렬 pread 호출로 채움 SSD 읽기가 진행되는 동안 Metal은 상주하는 shared-expert 분기를 계산함 읽기가 끝나면 shared output과 routed output을 결합함 프롬...
TurboFieldfare - 모든 M 시리즈 Mac에서 Gemma 4 26B를 2GB RAM으로 실행하는 오픈소스 엔진
1 week ago
20
Related
한 연구자가 noreply.net을 샀더니 기업 기밀이 쏟아짐
1 hour ago
1
프랑스, 사전 동의 없는 텔레마케팅 전화 금지
1 hour ago
0
GitHub Actions에 OIDC audience 제약이 필요한 이유
3 hours ago
0
H3-metal - Apple Silicon용 네이티브 MiniMax-H3 추론
3 hours ago
1
AI가 웹을 잠식하면서 인터넷의 집단 기억이 사라지고 있음
4 hours ago
1
Rails는 DHH 없이도 Rails일 수 있을까
6 hours ago
1
LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다
6 hours ago
1
Hanami - Rails를 대체하는 Ruby 프레임워크
7 hours ago
2
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
3 weeks ago
209
Codex 사용량 한도 리셋 추적
3 weeks ago
88
NVIDIA·CoreWeave·Nebius가 만든 GPU 붐의 순환 금융 구조
4 weeks ago
62
'킬러들의 쇼핑몰2' 감독 "시즌3 고민 중"⋯이동욱 "시키면 ...
3 weeks ago
57
© Clint IT 2026. All rights are reserved









English (US) ·