VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
DGX agentarXiv:2506.02387v3 Announce Type: replace Abstract: Recent advancements in Vision Language Models (VLMs) have expanded their capabilities to interactive agent tasks, yet existing benchmarks remain lim