Provable Knowledge Acquisition and Extraction in One-Layer Transformers
arXiv:2508.00901v4 Announce Type: replace-cross Abstract: Large language models may encounter factual knowledge during pre-training yet fail to reliably use that knowledge after fine-tuning. Despite g