Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment
arXiv:2607.20476v1 Announce Type: new Abstract: We present an empirical benchmark evaluating how five large language models assess multisensor physical hazard data. Testing 60 scenarios across three c