benchmarksfactbearishFrontier medical AI models exhibit an inversion of clinical priority, passing critical weight-5 criteria at only 32.4-41.7% while passing low-stakes weight-1 criteria at 80-90%Machine Learning27 Jul 2026http://arxiv.org/abs/2607.02175v1