Tutorials
4yr throwback. feels like a long time ago!
4yr throwback. feels like a long time ago! Training a language model from scratch and watching it learn to speak, then learn concepts, then learn to think, feels so completely different from using an
4yr throwback. feels like a long time ago! Training a language model from scratch and watching it learn to speak, then learn concepts, then learn to think, feels so completely different from using an off-the-shelf LM. You're raising a child, watching them grow up. (👇 500M-param byte-level transformer LM mid-training)
Related
- Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning
- Base Models Know How to Reason, Thinking Models Learn When
- Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning
Source: Linus Lee (X) | 2026-07-22