benchmarksfactbearish52% of critical medical criteria were satisfied by no model, revealing fundamental gaps in clinical reasoningMachine Learning27 Jul 2026http://arxiv.org/abs/2607.02175v1