Sycophancy as a Multilingual Alignment Failure: How Safety Degrades Across Languages, Topics, and Models
DGX agentarXiv:2606.08451v1 Announce Type: cross Abstract: Safety-aligned large language models often exhibit sycophancy, which is the tendency to affirm users' opinions regardless of factual accuracy. Althoug