arXiv AI

Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration

arXiv:2605. 27752v2 Announce Type: replace Abstract: LLM confidence calibration is often evaluated by comparing two signals: token-probability scores and verbalized confidence.