Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift¶
Authors: Sergey Ioffe, Christian Szegedy Year: 2015 Venue: ICML 2015 Citations: 40,000+
Link¶
Summary¶
Introduces Batch Normalization (BN), normalizing layer inputs during training to reduce internal covariate shift. Enables training with higher learning rates, acts as regularizer, improves generalization. Critical component of modern deep networks.
Key Concepts¶
- Internal Covariate Shift: Distribution change of layer inputs during training
- Normalization: Standardize mean and variance of layer inputs
- Learnable Parameters: Trainable scale and shift parameters
- Mini-Batch Statistics: Uses batch statistics during training
- Regularization Effect: Acts as implicit regularizer
- Inference Mode: Uses population statistics accumulated during training
Impact¶
- 40,000+ citations
- Essential component of modern deep networks
- Enabled training much deeper networks
- Inspired Layer Norm, Instance Norm, Group Norm variants
- Critical for training stability and speed
- Nearly universal in modern architectures
- Fundamental technique in deep learning
Key Results¶
- Faster training with higher learning rates
- Better generalization and reduced overfitting
- Enabled training of very deep networks
- Smoother loss landscape
- Reduced need for dropout
Related Papers¶
- Layer Normalization (Ba et al., 2016)
- Group Normalization (Yuxin Wu et al., 2018)
- Weight Normalization (Salimans & Kingma, 2016)
- ResNet: Deep Residual Learning (He et al., 2015)