DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment
DGX agentarXiv:2606.07678v1 Announce Type: cross Abstract: Safety alignment for large language models relies on preference data, but current pipelines often train on large, redundant datasets. Existing data se