304B 매개변수의 DeepSeek-V4-Flash-0731을 추가 가중치 양자화나 오프로딩 없이 단일 AMD MI300X에서 프로덕션 운영하기 위한 구성과 패치를 제공함 MI300X의 192GB HBM3에 156.67GiB 가중치와 20GB GPU KV 캐시를 배치하고, 퇴거된 프리픽스 캐시는 96GiB CPU 계층에 저장함 고정된 vLLM ROCm·AITER 스택에서 단일 스트림 디코드 중앙값 168.6 tok/s, 8개 스트림 합계 542 tok/s, 64개 버스트 합계 830 tok/s를 기록했으며 256K 컨텍스트를 검증함 MI300X의 FNUZ FP8 형식, 고동시성 MoE 라우팅, 인과적 추측 검증, CPU-KV 동기화, 누락된 gfx942 커널 튜닝을 읽기 전용 오버레이와 AITER 튜닝 테이블로 보완함 성능 수치는 고정된 이미지와 프롬프트에 대한 검증 기준이며, HBM 사용량이 205.8GB 중 약 204.5GB에 달하므로 KV 풀 확대보다 메모리 여유·콜드 및 캐시 경로의 정확성 검증이 중요함 단일 MI300X 배포 구성 DeepSeek-V4-Flash-0731을 AMD MI300X 한 장에서 실행하는 Docker Compose 스택, SHA-256 고정 오버레이, 업스트림 대비 diff, 커널 튜닝 테이블을 제공함 체크포인트는 배포된 그대로 실행하며 추가 가중치 양자화나 오프로딩을 사용하지 않음 고정된 런타임은 vLLM ROCm nightly 0.26.1rc1.dev229+g124154a88.rocm723과 AITER 0.1.19임 공식 vLLM 레시피는 NVIDIA와 MI325X·MI355X를 다루지만, 이 구성은 0731 체크포인트를 단일 MI300X에서 프로덕션 운영하는 데 필요한 수정 사항을 묶음 MI300X를 선택한 이유 AMD Instinct MI300X는 192GB HBM3와 5.3TB/s 메모리 대역폭을 제공하며, H100 SXM5보다 HBM 용량이 2.4배 큼 304B 매개변수 체크포인트 전체가 HBM에 들어가므로 PCIe 가중치 스트리밍이나 계층 오프로딩이 필요 없음 남은 공간에는 20GB GPU KV 풀을 두며, 퇴거된 프리픽스 캐시 항목은 96GiB CPU 계층에 저장함 한 장의 카드로 일반적인 동시 스트림 2~8개와 최대 64개 스트림의 버스트를 처리함 MI300X의 CDNA3는 AMD/Graphcore의 E4M3 FNUZ 변형을 사용하지만 MI325X 이후 제품은 O...
단일 AMD MI300X에서 DeepSeek V4 Flash 실행하기
6 days ago
14
Related
Rails는 DHH 없이도 Rails일 수 있을까
1 hour ago
1
LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다
1 hour ago
1
Hanami - Rails를 대체하는 Ruby 프레임워크
3 hours ago
2
Show GN: 프리터뷰 - 가입 없이 포트폴리오부터 채점해보는 AI 모의면접
3 hours ago
2
Show GN: 공공데이터 통합검색 x AI
3 hours ago
2
Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전트 LLM
4 hours ago
2
Show GN: TLcube — 세 면의 휘도 순서에 데이터를 싣는 2.5D 바코드
4 hours ago
1
Show GN: 알뜰계산기를 소개합니다
5 hours ago
2
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
3 weeks ago
209
Codex 사용량 한도 리셋 추적
3 weeks ago
88
NVIDIA·CoreWeave·Nebius가 만든 GPU 붐의 순환 금융 구조
4 weeks ago
62
'킬러들의 쇼핑몰2' 감독 "시즌3 고민 중"⋯이동욱 "시키면 ...
3 weeks ago
57
© Clint IT 2026. All rights are reserved









English (US) ·