METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
DGX agentarXiv:2604.11502v1 Announce Type: cross Abstract: Contextual causal reasoning is a critical yet challenging capability for Large Language Models (LLMs). Existing benchmarks, however, often evaluate th