Assembly Hall of Shame은 명령어를 빠르게 최적화하는 대신, 단일 명령어가 얼마나 느려질 수 있는지 실험해 성능의 절대 하한을 찾는 프로젝트임 현재 x86 1위는 AMD Ryzen 7 5800H에서 실행한 fxrstor64로, PCIe 경합을 일으켜 198,002,498,236사이클과 62초를 기록함 핵심 기법은 고지연 MMIO 영역에서 512바이트 FPU/MMX/XMM 상태를 읽는 동안 다른 코어들이 PCIe 루트 복합체와 엔드포인트를 포화시켜 요청을 대기시키는 것임 순위에는 1사이클의 nop부터 마이크로코드 보조, 캐시·TLB·엔트로피 고갈, I/O 포트, PCIe MMIO를 활용한 수십 초짜리 명령어까지 포함됨 측정 대상은 인터럽트할 수 없는 단일 명령어여야 하며, 기본 클록으로 시간을 정규화하고 하드웨어를 개조하지 않은 출고 상태 플랫폼만 허용함 프로젝트의 목표와 측정 규칙 일반적인 명령어 지연시간 분석과 반대로, 단일 명령어 성능의 절대 하한을 탐색함 준비 과정에는 제한이 없지만 점수에는 명령어 하나만 포함됨 트랩·에뮬레이션·가상화되는 명령어는 핸들러가 아니라 트랩 자체의 시간만 측정할 수 있음 rep movs, pause처럼 인터럽트할 수 있는 명령어는 제외함 결과는 CPU 기본 클록 주파수를 기준으로 정규화함 모든 플랫폼은 하드웨어 개조가 없는 출고 상태여야 함 현재 x86 우승 기록 AMD Ryzen 7 5800H에서 fxrstor64가 198,002,498,236사이클, 62초를 기록함 CPU 0은 고지연 PCIe MMIO 영역에서 512바이트 FPU/MMX/XMM 상태를 읽음 나머지 코어들은 별도의 고지연 MMIO 레지스터를 4바이트 단위로 반복해서 읽음 비게시(non-posted) 트랜잭션이 PCIe 루트 복합체와 엔드포인트를 포화시켜 CPU 0의 요청이 경합 트래픽 뒤에서 대기함 경합 없는 fxrstor64 기준 기록도 74,584,168,512사이클, 23.354502677초에 달함 mmiotic으로 PCIe 패브릭의 고지연 영역을 찾아 512바이트 상태를 느린 메모리 애퍼처에서 불러옴 MXCSR 손상을 피하도록 상태 위치와 오프셋을 조정함 짧은 지연시간 구간 nop: 아무 작업도 하지 않으며 1사이클, 0나노초를 기록함 nop16: 긴 NOP 인코딩으로 아무 작업도 하지 않는 시간을 20사이클, 7나노초까지 늘림 rdtsc: 기준점 역할을 하며 49사이클, 18나노초임 ...
Related
Hanami - Rails를 대체하는 Ruby 프레임워크
1 hour ago
1
Show GN: 프리터뷰 - 가입 없이 포트폴리오부터 채점해보는 AI 모의면접
1 hour ago
1
Show GN: 공공데이터 통합검색 x AI
2 hours ago
1
Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전트 LLM
3 hours ago
2
Show GN: TLcube — 세 면의 휘도 순서에 데이터를 싣는 2.5D 바코드
3 hours ago
1
Show GN: 알뜰계산기를 소개합니다
4 hours ago
2
영국의 익명성 전쟁, 미국에 상륙
5 hours ago
4
Postgres 내부로 CDC를 밀어 넣은 방법
5 hours ago
3
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
3 weeks ago
209
Codex 사용량 한도 리셋 추적
3 weeks ago
88
NVIDIA·CoreWeave·Nebius가 만든 GPU 붐의 순환 금융 구조
4 weeks ago
62
'킬러들의 쇼핑몰2' 감독 "시즌3 고민 중"⋯이동욱 "시키면 ...
3 weeks ago
56
© Clint IT 2026. All rights are reserved

3 days ago
10








English (US) ·