MiraMind: Benchmarking Reliable Mental Health Reasoning beyond Answer Accuracy
DGX agentarXiv:2512.09636v3 Announce Type: replace Abstract: Mental-health reasoning with large language models (LLMs) is an evidence-constrained judgment problem: models must transform limited, subjective, an