VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch
DGX agentarXiv:2606.03273v1 Announce Type: cross Abstract: Visual DeepSearch requires multimodal large reasoning model (MLRM) agents to answer complex visual queries by repeatedly inspecting image regions, gro