TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
arXiv:2509.25143v2 Announce Type: replace-cross Abstract: Existing medical reasoning benchmarks for vision-language models primarily focus on analyzing a patient's condition based on an image from a s