Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy
DGX agentarXiv:2606.07929v1 Announce Type: new Abstract: Large language models (LLMs) are entering clinical practice based on benchmark accuracy that may fail to detect safety-relevant failure modes. Here we p