Study the paper
Scaling Laws for Neural Language Models
Lessons, visuals, quizzes, flashcards, and resources—organized in teaching order.
Critical Batch Size and Training Dynamics
Critical Batch Size and Training Dynamics
Critical Batch Size and Training Dynamics
Critical Batch Size Scaling
Sources
section
5.1 Adjustment for Training at Bcrit(L)subscript𝐵crit𝐿B_{\rm crit}(L)
The critical batch size determines the boundary between data-parallel efficiency and diminishing returns. It scales as a power-law of the cross-entropy loss :
Sources
S1.E4
Bcrit(L)=B∗L1/αB,B∗∼2⋅108 tokens,αB∼0.21formulae-sequencesubscript𝐵crit𝐿subscript𝐵∗superscript𝐿1subscript𝛼𝐵formulae-sequencesimilar-tosubscript𝐵∗⋅2superscript108 tokenssimilar-tosubscript𝛼𝐵0.21B_{\rm crit}\left(L\right)=\frac{B_{\ast}}{L^{1/\alpha_{B}}},\qquad B_{\ast}\sim 2\cdot 10^{8}\text{ tokens},\ \ \alpha_{B}\sim 0.21 (1.4)
B_{\rm crit}\left(L\right)=\frac{B_{\ast}}{L^{1/\alpha_{B}}},\qquad B_{\ast}\sim 2\cdot 10^{8}\text{ tokens},\ \ \alpha_{B}\sim 0.21Sources
S1.E4
Bcrit(L)=B∗L1/αB,B∗∼2⋅108 tokens,αB∼0.21formulae-sequencesubscript𝐵crit𝐿subscript𝐵∗superscript𝐿1subscript𝛼𝐵formulae-sequencesimilar-tosubscript𝐵∗⋅2superscript108 tokenssimilar-tosubscript𝛼𝐵0.21B_{\rm crit}\left(L\right)=\frac{B_{\ast}}{L^{1/\alpha_{B}}},\qquad B_{\ast}\sim 2\cdot 10^{8}\text{ tokens},\ \ \alpha_{B}\sim 0.21 (1.4)
B_{\rm crit}\left(L\right)=\frac{B_{\ast}}{L^{1/\alpha_{B}}},\qquad B_{\ast}\sim 2\cdot 10^{8}\text{ tokens},\ \ \alpha_{B}\sim 0.21When training with a batch size , we can define the minimum number of steps and minimum compute required to reach a given loss level. These quantities represent the idealized limits when operating far from the bottlenecks:
Sources
S5.E4
Smin(S)≡S1+Bcrit(L)/B(minimum steps, at B≫Bcrit)subscript𝑆min𝑆𝑆1subscript𝐵crit𝐿𝐵much-greater-thanminimum steps, at 𝐵subscript𝐵critS_{\rm min}(S)\equiv\frac{S}{1+B_{\rm crit}(L)/B}\qquad(\text{minimum steps, at }B\gg B_{\rm crit}) (5.4)
S_{\rm min}(S)\equiv\frac{S}{1+B_{\rm crit}(L)/B}\qquad(\text{minimum steps, at }B\gg B_{\rm crit})S5.E5
Cmin(C)≡C1+B/Bcrit(L)(minimum compute, at B≪Bcrit)subscript𝐶min𝐶𝐶1𝐵subscript𝐵crit𝐿much-less-thanminimum compute, at 𝐵subscript𝐵critC_{\rm min}(C)\equiv\frac{C}{1+B/B_{\rm crit}(L)}\qquad(\text{minimum compute, at }B\ll B_{\rm crit}) (5.5)
C_{\rm min}(C)\equiv\frac{C}{1+B/B_{\rm crit}(L)}\qquad(\text{minimum compute, at }B\ll B_{\rm crit})Sources
S5.E4
Smin(S)≡S1+Bcrit(L)/B(minimum steps, at B≫Bcrit)subscript𝑆min𝑆𝑆1subscript𝐵crit𝐿𝐵much-greater-thanminimum steps, at 𝐵subscript𝐵critS_{\rm min}(S)\equiv\frac{S}{1+B_{\rm crit}(L)/B}\qquad(\text{minimum steps, at }B\gg B_{\rm crit}) (5.4)
S_{\rm min}(S)\equiv\frac{S}{1+B_{\rm crit}(L)/B}\qquad(\text{minimum steps, at }B\gg B_{\rm crit})Sources
S5.E5
Cmin(C)≡C1+B/Bcrit(L)(minimum compute, at B≪Bcrit)subscript𝐶min𝐶𝐶1𝐵subscript𝐵crit𝐿much-less-thanminimum compute, at 𝐵subscript𝐵critC_{\rm min}(C)\equiv\frac{C}{1+B/B_{\rm crit}(L)}\qquad(\text{minimum compute, at }B\ll B_{\rm crit}) (5.5)
C_{\rm min}(C)\equiv\frac{C}{1+B/B_{\rm crit}(L)}\qquad(\text{minimum compute, at }B\ll B_{\rm crit})