LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs
arXiv:2608.05246v1 Announce Type: new Abstract: Existing personalized LLM benchmarks primarily rely on textual personas or isolated behavioral signals, providing limited evaluation of cross-domain beh