Closing the Activation-Cone Blind Spot: Response-Time Probing and Unified Defense
DGX agentarXiv:2606.29441v1 Announce Type: cross Abstract: Inference-time safety methods for large language models have proliferated, yet no systematic comparison exists. We evaluate five defense paradigms (no