benchmarksopinionneutralA single scalar success rate cannot adequately explain computer-use agent performanceArtificial Intelligence02 Aug 2026http://arxiv.org/abs/2607.28367v1