EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs
DGX agentarXiv:2608.06398v1 Announce Type: new Abstract: Recent byte-level large language models (LLMs) have made tokenizer-free modeling increasingly competitive by grouping bytes into dynamically sized patch