Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing
arXiv:2607.23368v1 Announce Type: cross Abstract: Vision-Language Models (VLMs) are demonstrating significant capabilities in medical tasks like radiology analysis, yet providing faithful and interpre