When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations
arXiv:2606.07237v1 Announce Type: cross Abstract: Large Language Models (LLMs) are increasingly used in healthcare for tasks such as clinical question answering, diagnosis support, and report summariz