Study the paper
Scaling Laws for Neural Language Models
Lessons, visuals, quizzes, flashcards, and resources—organized in teaching order.
The Infinite Data Limit and Overfitting
Power-law scaling with minimum compute
Power-law scaling with minimum compute
Source equation
This equation describes the power-law scaling of the cross-entropy loss as a function of the minimum training compute (measured in PF-days) required to reach a given performance level.
Sources
S1.E3
L(Cmin)=(Ccmin/Cmin)αCmin;αCmin∼0.050,Ccmin∼3.1×108(PF-days)formulae-sequence𝐿subscript𝐶minsuperscriptsuperscriptsubscript𝐶cminsubscript𝐶minsuperscriptsubscript𝛼𝐶minformulae-sequencesimilar-tosuperscriptsubscript𝛼𝐶min0.050similar-tosuperscriptsubscript𝐶cmin3.1superscript108(PF-days)L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)} (1.3)
L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)}Sources
S1.E3
L(Cmin)=(Ccmin/Cmin)αCmin;αCmin∼0.050,Ccmin∼3.1×108(PF-days)formulae-sequence𝐿subscript𝐶minsuperscriptsuperscriptsubscript𝐶cminsubscript𝐶minsuperscriptsubscript𝛼𝐶minformulae-sequencesimilar-tosuperscriptsubscript𝛼𝐶min0.050similar-tosuperscriptsubscript𝐶cmin3.1superscript108(PF-days)L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)} (1.3)
L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)}Illustrative Calculation
Let us compute the loss for a given minimum compute budget of PF-days.
Using the empirical parameters:
- PF-days
We calculate:
- The ratio:
- The power-law exponentiation:
Thus, the predicted loss is approximately nats.
Sources
S1.E3
L(Cmin)=(Ccmin/Cmin)αCmin;αCmin∼0.050,Ccmin∼3.1×108(PF-days)formulae-sequence𝐿subscript𝐶minsuperscriptsuperscriptsubscript𝐶cminsubscript𝐶minsuperscriptsubscript𝛼𝐶minformulae-sequencesimilar-tosuperscriptsubscript𝛼𝐶min0.050similar-tosuperscriptsubscript𝐶cmin3.1superscript108(PF-days)L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)} (1.3)
L(C_{\rm min})=\left(C_{\mathrm{c}}^{\rm min}/C_{\rm min}\right)^{\alpha_{C}^{\rm min}};\leavevmode\nobreak\ \leavevmode\nobreak\ \alpha_{C}^{\rm min}\sim 0.050,\quad C_{\mathrm{c}}^{\rm min}\sim 3.1\times 10^{8}\leavevmode\nobreak\ \text{(PF-days)}- Cross-entropy loss as a function of minimum compute · scalar
- Minimum compute budget used for training · scalar
- Scale parameter for the minimum compute · scalar
- Power-law scaling exponent for the minimum compute · scalar