Pessimistic Risk-Aware Policy Learning in Contextual Bandits
DGX agentarXiv:2605.15620v1 Announce Type: cross Abstract: We study risk-aware offline policy learning, aiming to learn a decision rule from logged data that is optimal under general risk criteria. This proble