K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos
DGX agentarXiv:2607.02680v1 Announce Type: cross Abstract: MLLMs have shown strong zero-shot capabilities across diverse inputs such as across images, video, audio, and text. A crucial, yet underexplored, appl