Variance-aware Reward Modeling with Anchor Guidance
DGX agentarXiv:2605.11865v1 Announce Type: cross Abstract: Standard Bradley--Terry (BT) reward models are limited when human preferences are pluralistic. Although soft preference labels preserve disagreement i