benchmarkscritiquebearishExisting instruction-following benchmarks cannot properly evaluate hierarchical constraints because they treat constraint sets as flat lists applied uniformly to responsesComputation and Language01 Aug 2026http://arxiv.org/abs/2607.27912v1