Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training
arXiv:2605.28467v1 Announce Type: new Abstract: As LLMs gain stronger reasoning capabilities, their extended chain-of-thought introduces new degrees of complexity for defending against adversarial jai