Prompt engineering does not universally improve Large Language Model performance across clinical decision-making tasks
DGX agentarXiv:2512.22966v2 Announce Type: replace Abstract: Large Language Models (LLMs) have demonstrated promise in medical knowledge assessments, yet their practical utility in real-world clinical decision