- 30papers.com은 Ilya Sutskever가 John Carmack에게 줬다고 전해진 목록을 바탕으로, 머신러닝 핵심 논문을 초보자가 따라가기 쉽게 모은 사이트임
- 이름은 30편을 암시하지만 현재 공개된 항목은 27편이며, 완전한 공식 목록을 아는 사람에게 연락을 요청하고 있음
- 목록은 CNN, RNN/LSTM, ResNet, 어텐션, Transformer, Neural Turing Machines, 그래프 신경망, 스케일링 법칙, 파이프라인 병렬화까지 딥러닝의 주요 흐름을 따라감
- 논문만 나열하지 않고 강의 노트와 해설 글, 코드 기반 설명도 함께 묶어 원 논문 진입 장벽을 낮춤
- 현대 대규모 언어 모델과 딥러닝 시스템을 이해하려는 독자는 아키텍처·학습 기법·복잡도 이론의 출발점을 한곳에서 훑어볼 수 있음
소문으로 전해진 목록과 현재 범위
- 이 웹사이트는 Ilya Sutskever가 John Carmack에게 줬다고 전해진 논문 목록을 기반으로 함
- 현재 확보된 목록은 27편이며, 완전하고 공식적인 목록을 아는 사람에게 연락해 달라고 요청함
- 각 항목은 개별 페이지로 연결되며, 제목과 짧은 설명, 주요 저자 정보를 함께 담고 있음
비전과 합성곱 신경망 계열
- CS231n: Convolutional Neural Networks for Visual Recognition
- 선형 분류기부터 이미지용 심층 아키텍처까지 합성곱 신경망을 처음부터 다루는 강의 노트
- Andrej Karpathy, Fei-Fei Li 등이 포함됨
- ImageNet Classification with Deep Convolutional Neural Networks
- AlexNet 논문으로, ImageNet에서 큰 차이로 우승하며 현대 딥러닝 시대를 촉발한 합성곱 네트워크
- Alex Krizhevsky, Ilya Sutskever가 저자로 포함됨
- Deep Residual Learning for Image Recognition
- ResNet 논문으로, 전체 변환 대신 입력에 대한 변화를 학습하는 residual connection을 도입해 수백 층 네트워크를 가능하게 함
- Multi-Scale Context Aggregation by Dilated Convolutions
- 해상도를 잃지 않고 수용 영역을 넓히는 dilated convolution을 보여주며, segmentation 같은 dense prediction 작업을 개선함
- Identity Mappings in Deep Residual Networks
- ResNet 후속 연구로, identity shortcut이 잘 작동하는 이유를 분석하고 더 깔끔한 pre-activation residual block을 제안함
순환 신경망, 시퀀스 모델, 어텐션
- The Unreasonable Effectiveness of Recurrent Neural Networks
- 문자 단위 RNN을 훈련해 텍스트를 생성하고, RNN이 구조를 얼마나 포착할 수 있는지 예시로 보여주는 실습형 블로그 글
- Understanding LSTM Networks
- LSTM gate가 긴 시퀀스에서 정보를 전달하는 방식을 설명하는 시각적 입문 자료
- Recurrent Neural Network Regularization
- LSTM에 dropout을 올바르게 적용하는 방법을 다루며, recurrent connection이 아닌 non-recurrent connection에 적용해 대형 recurrent model의 과적합을 줄임
- Deep Speech 2: End-to-End Speech Recognition in English and Mandarin
- connectionist temporal classification으로 훈련한 end-to-end 음성 인식 시스템이며, 영어와 중국어라는 서로 다른 두 언어에서 작동함
- Order Matters: Sequence to Sequence for Sets
- 입력과 출력의 순서가 sequence-to-sequence 모델에 미치는 영향을 검토하고, 실제로는 집합인 데이터를 다루는 방법을 다룸
- Neural Machine Translation by Jointly Learning to Align and Translate
- 번역 모델이 하나의 고정 요약에만 의존하지 않고 관련 원문 단어를 다시 볼 수 있게 하는 attention mechanism을 도입함
- Pointer Networks
- 출력이 입력 위치를 가리키는 시퀀스 모델로, 답이 입력의 선택이나 순서화인 문제에 적합함
Transformer, 메모리, 관계 추론
- Attention Is All You Need
- Transformer 논문으로, recurrence를 self-attention으로 완전히 대체했으며 거의 모든 현대 대규모 언어 모델의 기반 아키텍처임
- The Annotated Transformer
- Transformer 원 논문을 줄 단위로 실행 가능한 재구현 코드로 바꾼 자료로, 읽을 수 있는 동작 코드 형태를 제공함
- Neural Turing Machines
- 신경망을 읽고 쓸 수 있는 외부 메모리와 미분 가능한 어텐션으로 결합해, 예시로부터 단순 알고리듬을 학습함
- A Simple Neural Network Module for Relational Reasoning
- 객체 쌍의 관계를 추론할 수 있게 하는 작은 플러그인 모듈인 relation network를 도입함
- Relational Recurrent Neural Networks
- recurrent network에 self-attention 기반 메모리를 추가해 저장된 기억들이 상호작용하도록 하고, 시간에 따른 관계 추론이 필요한 작업을 개선함
- Neural Message Passing for Quantum Chemistry
- 여러 graph neural network를 message passing framework로 통합하고, 분자 속성 예측에 적용함
스케일링, 대형 모델 학습, 압축
- Scaling Laws for Neural Language Models
- 언어 모델의 loss가 모델 크기, 데이터, compute에 대해 부드러운 power law로 감소함을 측정했으며, 더 큰 모델을 만드는 경험적 근거가 됨
- GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism
- 거대 모델을 여러 장치에 나누고 장치가 계속 동작하게 하는 pipeline parallelism 라이브러리로, 매우 큰 네트워크 학습을 실용적으로 만듦
- Keeping Neural Networks Simple by Minimizing the Description Length of the Weights
- 좋은 네트워크는 가중치를 적은 비트로 설명할 수 있는 네트워크라는 초기 정보이론적 논의를 통해, 일반화를 압축과 연결함
- A Tutorial Introduction to the Minimum Description Length Principle
- 데이터를 얼마나 잘 압축하는지로 모델을 선택하는 Minimum Description Length 원리를 읽기 쉽게 소개함
복잡도, 오토인코더, 기계 지능
- The First Law of Complexodynamics
- 닫힌계의 복잡도가 단순히 엔트로피를 따라가는 것이 아니라 상승하고 정점에 도달한 뒤 하락하는 이유를 설명할 형식적 법칙을 요구하는 블로그 에세이
- Quantifying the Rise and Fall of Complexity in Closed Systems: The Coffee Automaton
- 커피와 크림이 섞이는 과정을 단순한 cellular automaton으로 모델링해, 계가 평형으로 이동할 때 복잡도가 상승했다가 하락하는 이유를 묻는 연구
- Kolmogorov Complexity
- 문자열을 생성하는 가장 짧은 프로그램을 다루는 교과서적 설명으로, description length와 알고리듬적 무작위성의 형식적 기반
- Variational Lossy Autoencoder
- variational autoencoder와 autoregressive decoder를 결합하고, latent code가 어떤 정보를 유지하도록 강제할지 제어하는 방법을 보여줌
- Machine Super Intelligence
- 기계 지능에 대한 형식적이고 보편적인 척도를 제안하고, 매우 유능한 agent에 대한 함의를 탐구하는 박사 학위 논문

1 month ago
26







![[테크 차이나] DeepSeek V4 Flash 1위… 중국 모델 강세 지속(OpenRouter 주간 AI 모델 사용량 순위)](https://img.etnews.com/news/article/2026/08/06/news-p.v1.20260806.379c2eee15bb4be5b29d934a203a6106_Z1.jpg)
English (US) ·