You are reading immutable version 3. The current guide may be newer.

Study the paper

Scaling Laws for Neural Language Models

Lessons, visuals, quizzes, flashcards, and resources—organized in teaching order.

All activities

Transformer Parameter and Compute Scaling

Optimal Compute Allocation Scaling Relations

Optimal Compute Allocation Scaling Relations

Source equation

NCαCmin/αN,BCαCmin/αB,SCαCmin/αS,D=BSN\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad

This set of scaling relations determines how to optimally allocate an increased compute budget CC among the model size (number of non-embedding parameters NN), the batch size BB, and the number of training steps SS. The total number of tokens processed during training is given by D=BSD = B \cdot S.

Sources

S1.E7

N∝CαCmin/αN,B∝CαCmin/αB,S∝CαCmin/αS,D=B⋅Sformulae-sequenceproportional-to𝑁superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑁formulae-sequenceproportional-to𝐵superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝐵formulae-sequenceproportional-to𝑆superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑆𝐷⋅𝐵𝑆N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad (1.7)
N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad

NCαCmin/αN,BCαCmin/αB,SCαCmin/αS,D=BSN\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad

Sources

S1.E7

N∝CαCmin/αN,B∝CαCmin/αB,S∝CαCmin/αS,D=B⋅Sformulae-sequenceproportional-to𝑁superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑁formulae-sequenceproportional-to𝐵superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝐵formulae-sequenceproportional-to𝑆superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑆𝐷⋅𝐵𝑆N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad (1.7)
N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad
Deep dive

Illustrative Calculation

Let us compute the scaling exponents given the empirical values from the paper:

  • αN=0.076\alpha_N = 0.076
  • αB=0.21\alpha_B = 0.21
  • αS=0.17\alpha_S = 0.17

First, we find the minimum scaling exponent αCmin\alpha_C^{\rm min} using the relation: αCmin=(1αN+1αB+1αS)1\alpha_C^{\rm min} = \left( \frac{1}{\alpha_N} + \frac{1}{\alpha_B} + \frac{1}{\alpha_S} \right)^{-1}

Let's calculate the terms:

  • 1/αN=1/0.07613.1581/\alpha_N = 1 / 0.076 \approx 13.158
  • 1/αB=1/0.214.7621/\alpha_B = 1 / 0.21 \approx 4.762
  • 1/αS=1/0.175.8821/\alpha_S = 1 / 0.17 \approx 5.882

Summing these values: 13.158+4.762+5.882=23.802\sum \approx 13.158 + 4.762 + 5.882 = 23.802

Thus, the minimum exponent is: αCmin=1/23.8020.0420\alpha_C^{\rm min} = 1 / 23.802 \approx 0.0420

Now, we compute the scaling exponents for each resource allocation:

  • For model size NN: αCmin/αN0.0420/0.0760.55\alpha_C^{\rm min} / \alpha_N \approx 0.0420 / 0.076 \approx 0.55
  • For batch size BB: αCmin/αB0.0420/0.210.20\alpha_C^{\rm min} / \alpha_B \approx 0.0420 / 0.21 \approx 0.20
  • For steps SS: αCmin/αS0.0420/0.170.25\alpha_C^{\rm min} / \alpha_S \approx 0.0420 / 0.17 \approx 0.25

This shows that as the compute budget CC increases, the optimal allocation scales the model size NN fastest (NC0.55N \propto C^{0.55}), followed by training steps (SC0.25S \propto C^{0.25}) and batch size (BC0.20B \propto C^{0.20}).

Sources

S1.E7

N∝CαCmin/αN,B∝CαCmin/αB,S∝CαCmin/αS,D=B⋅Sformulae-sequenceproportional-to𝑁superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑁formulae-sequenceproportional-to𝐵superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝐵formulae-sequenceproportional-to𝑆superscript𝐶superscriptsubscript𝛼𝐶minsubscript𝛼𝑆𝐷⋅𝐵𝑆N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad (1.7)
N\propto C^{\alpha_{C}^{\rm min}/\alpha_{N}},\quad B\propto C^{\alpha_{C}^{\rm min}/\alpha_{B}},\quad S\propto C^{\alpha_{C}^{\rm min}/\alpha_{S}},\quad D=B\cdot S\quad
CC
Total compute budget · scalar
NN
Optimal model size (number of non-embedding parameters) · scalar
BB
Optimal batch size · scalar
SS
Optimal number of training steps · scalar
DD
Total dataset size in tokens · scalar
alpha_C_min
Minimum scaling exponent for compute · scalar
alphaNalpha_N
Power-law scaling exponent for model size · scalar
alphaBalpha_B
Power-law scaling exponent for batch size · scalar
alphaSalpha_S
Power-law scaling exponent for training steps · scalar