benchmarksfactbearishHealthBench 'Hard' subset top score remains at only 32%, indicating significant gaps in medical AI capabilityMachine Learning27 Jul 2026http://arxiv.org/abs/2607.02175v1