Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences
DGX agentarXiv:2606.07629v1 Announce Type: cross Abstract: Current approaches to aligning large language models (LLMs) aggregate diverse human preferences into a single reward signal, effectively optimizing fo