BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation
DGX agentarXiv:2606.30850v1 Announce Type: new Abstract: Large language models (LLMs) are typically deployed in multi-turn conversations, where each turn provides new evidence that should reduce epistemic unce