압축은 예측이다

1 hour ago 2

압축기와 LLM은 문맥을 바탕으로 다음 기호의 확률을 예측하며, 실제 기호에 높은 확률을 부여할수록 더 적은 비트로 표현할 수 있음 현대 압축기는 대체로 변환·확률 모델·엔트로피 부호화기로 구성되며, 산술 부호화나 Huffman 부호화가 모델의 확률 분포를 최종 비트스트림으로 바꿈 정보량은 -log₂(P)로 계산되고 그 평균인 Shannon 엔트로피가 무손실 압축의 이론적 최저 비트 수를 결정하므로, 확률이 편향되고 문맥에 잘 맞을수록 압축률이 높아짐 TO BE OR NOT TO BE 예제에서 문맥 없는 모델은 약 47비트였지만 order-1 모델은 약 21비트였고, Dickens 문장에서는 GPT-2가 원본의 10%인 176비트로 order-1 모델의 434비트보다 작았음 LLM은 뛰어난 압축 모델이지만 양쪽에 수 GB 규모의 모델이 필요하고 연산량과 지연도 커서 HTTP 응답 압축에는 비현실적이며, 실용 압축은 압축률·속도·메모리를 함께 고려해야 함 중복성을 이용하는 압축 축소(minification)는 변수명을 한 글자로 줄이고 주석·공백·불필요한 구문을 제거하지만, 일반적인 데이터 압축은 데이터의 중복성을 찾아 더 짧게 표현함 JavaScript 예제는 156자에서 62자로 줄어 60% 작아짐 실행 길이 부호화(run-length encoding)는 연속해서 반복되는 기호를 기호와 반복 횟수로 바꾸는 변환임 28자 문자열을 A9B4C2D1A3D9로 표현하면 224비트에서 96비트로 줄어 57% 작아짐 gzip과 Brotli 같은 실제 압축기는 여러 기법을 조합해 데이터를 줄임 현대 압축기의 세 구성 요소 변환(transform) 은 압축하기 쉬운 형태로 데이터를 전처리함 실행 길이 부호화도 변환의 한 종류임 변환 자체가 항상 데이터를 줄이는 것은 아니며, 이후 단계가 활용할 중복성을 더 만들기도 함 확률 모델(model) 은 문자·숫자·토큰·이진 코드 같은 기호의 빈도를 바탕으로 데이터의 형태를 확률로 나타냄 28자 예제의 확률은 A 0.429, D 0.357, B 0.143, C 0.071임 단순 확률표부터 문맥을 사용하는 정교한 모델까지 활용할 수 있음 엔트로피 부호화기(entropy coder) 는 모델의 확률을 받아 파일 형식의 구조가 없는 원시 비트스트림을 생성하는 마지막 단계임 세 요소의 경계가 항상 명확한 것은 아니며, 각각이 단독으로 사용되는 경우도 드묾 산술 부호화의 동작 산술 부호화(a...

Read Entire Article