safetyopinionneutralSafe completion should be evaluated as intent-calibrated behavior over controlled task variants, not as aggregate prompt-safety scoresComputation and Language27 Jul 2026http://arxiv.org/abs/2607.02047v1