Measuring Safety Alignment Effects in Autonomous Security Agents
DGX agentarXiv:2605.19722v1 Announce Type: cross Abstract: Do stock safety-aligned language models and their uncensored or abliterated derivatives behave differently when run as autonomous security agents? Sin