Furina: Fragmented Uncertainty-Driven Refusal Instability Attack
DGX agentarXiv:2605.26158v1 Announce Type: cross Abstract: Safety alignment in large language models (LLMs) and multimodal large language models (MLLMs) is commonly assumed to operate as a near-binary threshol