arXiv AI

Same Answer, Different Confidence: Protocol Sensitivity in LLM Confidence Calibration

arXiv:2605. 27752v3 Announce Type: replace Abstract: Is verbalized confidence better calibrated than token likelihood?