You are reading immutable version 1. The current guide may be newer.

Study the paper

Scaling Laws for Neural Language Models

Lessons, visuals, quizzes, flashcards, and resources—organized in teaching order.

All activities

The Infinite Data Limit and Overfitting

Optimal compute allocation scaling

Optimal compute allocation scaling

Source equation

NCαCmin/αN,BCαCmin/αB,SCαCmin/αS,D=BSN\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad

This equation describes the optimal scaling of model parameters NN, batch size BB, and training steps SS as power-law functions of the total compute budget CC. It also defines the total dataset size DD in tokens as the product of batch size and training steps.

Sources

S1.E7

N∝CαCmin/αN,B∝CαCmin/αB,S∝CαCmin/αS,D=B⋅Sformulae-sequenceproportional-to𝑁superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑁formulae-sequenceproportional-to𝐵superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝐵formulae-sequenceproportional-to𝑆superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑆𝐷⋅𝐵𝑆N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad (1.7)
N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad

NCαCmin/αN,BCαCmin/αB,SCαCmin/αS,D=BSN\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad

Sources

S1.E7

N∝CαCmin/αN,B∝CαCmin/αB,S∝CαCmin/αS,D=B⋅Sformulae-sequenceproportional-to𝑁superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑁formulae-sequenceproportional-to𝐵superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝐵formulae-sequenceproportional-to𝑆superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑆𝐷⋅𝐵𝑆N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad (1.7)
N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad
Implementation detail

Illustrative Calculation

Let us calculate the scaling exponents given the following empirical values:

  • αN=0.076\alpha_N = 0.076
  • αB=0.21\alpha_B = 0.21
  • αS=0.17\alpha_S = 0.17

First, we compute the minimum compute scaling exponent αCmin\alpha_C^{\rm min} using the relation: 1αCmin=1αN+1αB+1αS\frac{1}{\alpha_C^{\rm min}} = \frac{1}{\alpha_N} + \frac{1}{\alpha_B} + \frac{1}{\alpha_S}

1αCmin=10.076+10.21+10.1713.158+4.762+5.882=23.802\frac{1}{\alpha_C^{\rm min}} = \frac{1}{0.076} + \frac{1}{0.21} + \frac{1}{0.17} \approx 13.158 + 4.762 + 5.882 = 23.802

αCmin123.8020.0420\alpha_C^{\rm min} \approx \frac{1}{23.802} \approx 0.0420

Now, we compute the power-law exponents for NN, BB, and SS:

  • Exponent for NN: aN=αCminαN0.04200.0760.55a_N = \frac{\alpha_C^{\rm min}}{\alpha_N} \approx \frac{0.0420}{0.076} \approx 0.55
  • Exponent for BB: aB=αCminαB0.04200.210.20a_B = \frac{\alpha_C^{\rm min}}{\alpha_B} \approx \frac{0.0420}{0.21} \approx 0.20
  • Exponent for SS: aS=αCminαS0.04200.170.25a_S = \frac{\alpha_C^{\rm min}}{\alpha_S} \approx \frac{0.0420}{0.17} \approx 0.25

Thus, as compute CC increases, the optimal parameters scale as NC0.55N \propto C^{0.55}, batch size as BC0.20B \propto C^{0.20}, and steps as SC0.25S \propto C^{0.25}. The total dataset size D=BSD = B \cdot S scales as DC0.20+0.25=C0.45D \propto C^{0.20 + 0.25} = C^{0.45}.

Sources

S1.E7

N∝CαCmin/αN,B∝CαCmin/αB,S∝CαCmin/αS,D=B⋅Sformulae-sequenceproportional-to𝑁superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑁formulae-sequenceproportional-to𝐵superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝐵formulae-sequenceproportional-to𝑆superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑆𝐷⋅𝐵𝑆N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad (1.7)
N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad
CC
Total compute budget · scalar
NN
Number of model parameters (excluding embeddings) · scalar
BB
Critical batch size · scalar
SS
Number of training steps · scalar
DD
Total dataset size in tokens · scalar
αCmin\alpha_{C}^{\rm min}
Minimum compute scaling exponent · scalar
αN\alpha_{N}
Power-law scaling exponent for model parameters · scalar
αB\alpha_{B}
Power-law scaling exponent for batch size · scalar
αS\alpha_{S}
Power-law scaling exponent for training steps · scalar