HRM-Text: Efficient Pretraining Beyond Scaling
DGX agentarXiv:2605.20613v1 Announce Type: new Abstract: The current pretraining paradigm for large language models relies on massive compute and internet-scale raw text, creating a significant barrier to foun