CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation
DGX agentarXiv:2607.29252v1 Announce Type: cross Abstract: Reliable evaluation of open-ended LLM outputs requires fine-grained rubrics, yet expert curation is costly and difficult to scale. Existing automated