압축기와 LLM은 문맥을 바탕으로 다음 기호의 확률을 예측하며, 실제 기호에 높은 확률을 부여할수록 더 적은 비트로 표현할 수 있음 현대 압축기는 대체로 변환·확률 모델·엔트로피 부호화기로 구성되며, 산술 부호화나 Huffman 부호화가 모델의 확률 분포를 최종 비트스트림으로 바꿈 정보량은 -log₂(P)로 계산되고 그 평균인 Shannon 엔트로피가 무손실 압축의 이론적 최저 비트 수를 결정하므로, 확률이 편향되고 문맥에 잘 맞을수록 압축률이 높아짐 TO BE OR NOT TO BE 예제에서 문맥 없는 모델은 약 47비트였지만 order-1 모델은 약 21비트였고, Dickens 문장에서는 GPT-2가 원본의 10%인 176비트로 order-1 모델의 434비트보다 작았음 LLM은 뛰어난 압축 모델이지만 양쪽에 수 GB 규모의 모델이 필요하고 연산량과 지연도 커서 HTTP 응답 압축에는 비현실적이며, 실용 압축은 압축률·속도·메모리를 함께 고려해야 함 중복성을 이용하는 압축 축소(minification)는 변수명을 한 글자로 줄이고 주석·공백·불필요한 구문을 제거하지만, 일반적인 데이터 압축은 데이터의 중복성을 찾아 더 짧게 표현함 JavaScript 예제는 156자에서 62자로 줄어 60% 작아짐 실행 길이 부호화(run-length encoding)는 연속해서 반복되는 기호를 기호와 반복 횟수로 바꾸는 변환임 28자 문자열을 A9B4C2D1A3D9로 표현하면 224비트에서 96비트로 줄어 57% 작아짐 gzip과 Brotli 같은 실제 압축기는 여러 기법을 조합해 데이터를 줄임 현대 압축기의 세 구성 요소 변환(transform) 은 압축하기 쉬운 형태로 데이터를 전처리함 실행 길이 부호화도 변환의 한 종류임 변환 자체가 항상 데이터를 줄이는 것은 아니며, 이후 단계가 활용할 중복성을 더 만들기도 함 확률 모델(model) 은 문자·숫자·토큰·이진 코드 같은 기호의 빈도를 바탕으로 데이터의 형태를 확률로 나타냄 28자 예제의 확률은 A 0.429, D 0.357, B 0.143, C 0.071임 단순 확률표부터 문맥을 사용하는 정교한 모델까지 활용할 수 있음 엔트로피 부호화기(entropy coder) 는 모델의 확률을 받아 파일 형식의 구조가 없는 원시 비트스트림을 생성하는 마지막 단계임 세 요소의 경계가 항상 명확한 것은 아니며, 각각이 단독으로 사용되는 경우도 드묾 산술 부호화의 동작 산술 부호화(a...
Related
Go가 AI 지원 소프트웨어 엔지니어링에 이상적인 이유
1 hour ago
1
OpenAI 윤리 책임자, 합류 1년도 안 돼 퇴사
2 hours ago
2
Mojo 1.0 정식 출시
2 hours ago
2
코드가 아니라 아이디어를 통제하라
3 hours ago
2
LLM Evals에 대해 알아야 할 모든 것
4 hours ago
2
Xirp - Spotify가 만든 조직 컨텍스트 기반 AI 코딩 환경
4 hours ago
2
코드 리뷰도 배워야 하는 기술이다
4 hours ago
2
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
3 weeks ago
210
Codex 사용량 한도 리셋 추적
3 weeks ago
88
NVIDIA·CoreWeave·Nebius가 만든 GPU 붐의 순환 금융 구조
1 month ago
64
'킬러들의 쇼핑몰2' 감독 "시즌3 고민 중"⋯이동욱 "시키면 ...
3 weeks ago
59
© Clint IT 2026. All rights are reserved

1 hour ago
2





![[테크 차이나] DeepSeek V4 Flash 1위… 중국 모델 강세 지속(OpenRouter 주간 AI 모델 사용량 순위)](https://img.etnews.com/news/article/2026/08/06/news-p.v1.20260806.379c2eee15bb4be5b29d934a203a6106_Z1.jpg)


English (US) ·