Code-Guided Reasoning for Small Language Models: Evaluating Executable MCQA Scaffolds
arXiv:2605.18827v1 Announce Type: cross Abstract: Multiple-choice QA benchmarks usually evaluate small language models (SLMs) as direct answerers, but deployed language-model systems increasingly rely