Training-free Truthfulness Detection via Sparse MLP Value Vectors
DGX agentarXiv:2509.17932v2 Announce Type: replace Abstract: Large language models (LLMs) are prone to generating factually incorrect content, motivating methods for assessing truthfulness from internal model