benchmarkscritiquebearishGeneral purpose benchmarks do not adequately measure whether LLMs reason safely and correctly about aviation-specific operational knowledgeComputation and Language27 Jul 2026http://arxiv.org/abs/2607.01829v1