Study the paper
Scaling Laws for Neural Language Models
Lessons, visuals, quizzes, flashcards, and resources—organized in teaching order.
The Infinite Data Limit and Overfitting
Power-law scaling with non-embedding parameters
Power-law scaling with non-embedding parameters
Source equation
This equation models the empirical power-law scaling of the cross-entropy loss of a language model as a function of its number of non-embedding parameters . By excluding embedding parameters, the scaling law exhibits a cleaner power-law behavior over several orders of magnitude.
Sources
S1.E1
L(N)=(Nc/N)αN;αN∼0.076,Nc∼8.8×1013(non-embedding parameters)formulae-sequence𝐿𝑁superscriptsubscript𝑁c𝑁subscript𝛼𝑁formulae-sequencesimilar-tosubscript𝛼𝑁0.076similar-tosubscript𝑁c8.8superscript1013(non-embedding parameters)L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)} (1.1)
L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)}Sources
S1.E1
L(N)=(Nc/N)αN;αN∼0.076,Nc∼8.8×1013(non-embedding parameters)formulae-sequence𝐿𝑁superscriptsubscript𝑁c𝑁subscript𝛼𝑁formulae-sequencesimilar-tosubscript𝛼𝑁0.076similar-tosubscript𝑁c8.8superscript1013(non-embedding parameters)L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)} (1.1)
L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)}Illustrative Calculation
Let us calculate the predicted loss for a model with non-embedding parameters (a 1-billion parameter model):
-
Inputs:
-
Ratio Calculation:
-
Power-law Exponentiation:
Sources
S1.E1
L(N)=(Nc/N)αN;αN∼0.076,Nc∼8.8×1013(non-embedding parameters)formulae-sequence𝐿𝑁superscriptsubscript𝑁c𝑁subscript𝛼𝑁formulae-sequencesimilar-tosubscript𝛼𝑁0.076similar-tosubscript𝑁c8.8superscript1013(non-embedding parameters)L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)} (1.1)
L(N)=\left(N_{\mathrm{c}}/N\right)^{\alpha_{N}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{N}\sim 0.076,\quad N_{\mathrm{c}}\sim 8.8\times 10^{13}\leavevmode\nobreak\ \text{(non-embedding parameters)}- Cross-entropy loss · scalar
- Number of non-embedding parameters · scalar
- Scale parameter constant · scalar
- Power-law scaling exponent · scalar