You are reading immutable version 1. The current guide may be newer.

Study the paper

Scaling Laws for Neural Language Models

Lessons, visuals, quizzes, flashcards, and resources—organized in teaching order.

All activities

The Infinite Data Limit and Overfitting

Power-law scaling with non-embedding parameters

Power-law scaling with non-embedding parameters

Source equation

L(N)=(Nc/N)αN;  αN0.076,Nc8.8×1013 (non-embedding parameters)L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\nobreak\ \nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\nobreak\ \text{(non-embedding parameters)}

This equation models the empirical power-law scaling of the cross-entropy loss L(N)L(N) of a language model as a function of its number of non-embedding parameters NN. By excluding embedding parameters, the scaling law exhibits a cleaner power-law behavior over several orders of magnitude.

Sources

S1.E1

L​(N)=(Nc/N)αN;αN∼0.076,Nc∼8.8×1013​(non-embedding parameters)formulae-sequence𝐿𝑁superscriptsubscript𝑁c𝑁subscript𝛼𝑁formulae-sequencesimilar-tosubscript𝛼𝑁0.076similar-tosubscript𝑁c8.8superscript1013(non-embedding parameters)L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)} (1.1)
L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)}

L(N)=(Nc/N)αN;  αN0.076,Nc8.8×1013 (non-embedding parameters)L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\nobreak\ \nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\nobreak\ \text{(non-embedding parameters)}

Sources

S1.E1

L​(N)=(Nc/N)αN;αN∼0.076,Nc∼8.8×1013​(non-embedding parameters)formulae-sequence𝐿𝑁superscriptsubscript𝑁c𝑁subscript𝛼𝑁formulae-sequencesimilar-tosubscript𝛼𝑁0.076similar-tosubscript𝑁c8.8superscript1013(non-embedding parameters)L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)} (1.1)
L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)}

Illustrative Calculation

Let us calculate the predicted loss L(N)L(N) for a model with N=109N = 10^9 non-embedding parameters (a 1-billion parameter model):

  1. Inputs:

    • N=109N = 10^9
    • Nc=8.8×1013N_{\mathrm{c}} = 8.8 \times 10^{13}
    • αN=0.076\alpha_N = 0.076
  2. Ratio Calculation: NcN=8.8×1013109=8.8×104=88000\frac{N_{\mathrm{c}}}{N} = \frac{8.8 \times 10^{13}}{10^9} = 8.8 \times 10^4 = 88000

  3. Power-law Exponentiation: L(N)=(88000)0.0762.373L(N) = (88000)^{0.076} \approx 2.373

Sources

S1.E1

L​(N)=(Nc/N)αN;αN∼0.076,Nc∼8.8×1013​(non-embedding parameters)formulae-sequence𝐿𝑁superscriptsubscript𝑁c𝑁subscript𝛼𝑁formulae-sequencesimilar-tosubscript𝛼𝑁0.076similar-tosubscript𝑁c8.8superscript1013(non-embedding parameters)L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)} (1.1)
L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)}
L(N)L(N)
Cross-entropy loss · scalar
NN
Number of non-embedding parameters · scalar
NcN_{\mathrm{c}}
Scale parameter constant · scalar
αN\alpha_{N}
Power-law scaling exponent · scalar