MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection
DGX agentarXiv:2607.15166v2 Announce Type: replace Abstract: Most medical AI benchmarks measure whether a model knows the correct answer. MedFailBench asks a different question: which safety boundary failed? W