vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models
DGX agentarXiv:2603.13966v2 Announce Type: replace Abstract: Vision-Language-Action (VLA) models are increasingly evaluated across multiple simulation benchmarks, yet adding each benchmark to an evaluation pip