Factored Causal Representation Learning for Robust Reward Modeling in RLHF
DGX agentarXiv:2601.21350v2 Announce Type: replace Abstract: A reliable reward model is essential for aligning large language models with human preferences through reinforcement learning from human feedback. H