You are reading immutable version 1. The current guide may be newer.

Study the paper

Scaling Laws for Neural Language Models

Lessons, visuals, quizzes, flashcards, and resources—organized in teaching order.

All activities

The Infinite Data Limit and Overfitting

Power-law scaling with minimum compute

Power-law scaling with minimum compute

Source equation

L(Cmin)=(Ccmin/Cmin)αCmin;  αCmin0.050,Ccmin3.1×108 (PF-days)L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\nobreak\ \nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\nobreak\ \text{(PF-days)}

This equation describes the power-law scaling of the cross-entropy loss LL as a function of the minimum training compute CminC_{\rm min} (measured in PF-days) required to reach a given performance level.

Sources

S1.E3

L​(Cmin)=(Ccmin/Cmin)αCmin;αCmin∼0.050,Ccmin∼3.1×108​(PF-days)formulae-sequence𝐿subscript𝐶minsuperscriptsuperscriptsubscript𝐶cminsubscript𝐶minsuperscriptsubscript𝛼𝐶minformulae-sequencesimilar-tosuperscriptsubscript𝛼𝐶min0.050similar-tosuperscriptsubscript𝐶cmin3.1superscript108(PF-days)L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)} (1.3)
L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)}

L(Cmin)=(Ccmin/Cmin)αCmin;  αCmin0.050,Ccmin3.1×108 (PF-days)L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\nobreak\ \nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\nobreak\ \text{(PF-days)}

Sources

S1.E3

L​(Cmin)=(Ccmin/Cmin)αCmin;αCmin∼0.050,Ccmin∼3.1×108​(PF-days)formulae-sequence𝐿subscript𝐶minsuperscriptsuperscriptsubscript𝐶cminsubscript𝐶minsuperscriptsubscript𝛼𝐶minformulae-sequencesimilar-tosuperscriptsubscript𝛼𝐶min0.050similar-tosuperscriptsubscript𝐶cmin3.1superscript108(PF-days)L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)} (1.3)
L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)}

Illustrative Calculation

Let us compute the loss L(Cmin)L(C_{\rm min}) for a given minimum compute budget of Cmin=104C_{\rm min} = 10^4 PF-days.

Using the empirical parameters:

  • Ccmin=3.1×108C_{\mathrm{c}}^{\rm min} = 3.1 \times 10^8 PF-days
  • αCmin=0.050\alpha_{C}^{\rm min} = 0.050

We calculate:

  1. The ratio: CcminCmin=3.1×108104=3.1×104=31000\frac{C_{\mathrm{c}}^{\rm min}}{C_{\rm min}} = \frac{3.1 \times 10^8}{10^4} = 3.1 \times 10^4 = 31000
  2. The power-law exponentiation: 310000.0501.67531000^{0.050} \approx 1.675

Thus, the predicted loss L(104)L(10^4) is approximately 1.6751.675 nats.

Sources

S1.E3

L​(Cmin)=(Ccmin/Cmin)αCmin;αCmin∼0.050,Ccmin∼3.1×108​(PF-days)formulae-sequence𝐿subscript𝐶minsuperscriptsuperscriptsubscript𝐶cminsubscript𝐶minsuperscriptsubscript𝛼𝐶minformulae-sequencesimilar-tosuperscriptsubscript𝛼𝐶min0.050similar-tosuperscriptsubscript𝐶cmin3.1superscript108(PF-days)L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)} (1.3)
L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)}
L(Cmin)L(C_{\rm min})
Cross-entropy loss as a function of minimum compute · scalar
CminC_{\rm min}
Minimum compute budget used for training · scalar
CcminC_{\mathrm{c}}^{\rm min}
Scale parameter for the minimum compute · scalar
αCmin\alpha_{C}^{\rm min}
Power-law scaling exponent for the minimum compute · scalar