EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data
DGX agentarXiv:2605.19130v1 Announce Type: cross Abstract: Children acquire language grounding with remarkable robustness from limited visuo-linguistic input in ways that surpass today's best large multimodal