benchmarkscritiquebearishLarge language models now score near ceiling on general benchmarks, but aggregate measures reveal little about disciplinary behaviorComputation and Language27 Jul 2026http://arxiv.org/abs/2607.02007v1