Smooth Scaling Laws Hide Stepwise Token Learning
DGX agentarXiv:2606.29858v1 Announce Type: new Abstract: Language model loss follows remarkably regular scaling laws over model and data size, yet it remains unclear why the aggregate loss should exhibit a pow