benchmarksfactneutralEvaluating large generative models across benchmarks is time-consuming and computationally expensive, driving the need for coreset-based evaluation methodsMachine Learning (Statistics)01 Aug 2026http://arxiv.org/abs/2607.26887v1