benchmarksfactneutralFinal success accuracy alone is insufficient for evaluating conversational LLM clarification behavior, as models with similar accuracy can differ substantially in efficiency and robustnessComputation and Language28 Jul 2026http://arxiv.org/abs/2607.21143v1