CrochetBench: Can Vision-Language Models Move from Describing to Doing in Crochet Domain?
arXiv:2511.09483v3 Announce Type: replace Abstract: While multimodal large language models can describe visual content, their ability to generate executable procedures remains underexplored. CrochetBe