agents
fact
bearish
LLMs' performance in code review varies substantially across different defect types and severity levels, with semantically complex or low-salience defects being significantly more likely to be missed
LLMs' performance varies substantially across different defect types and severity levels, with semantically complex or low-salience defects being significantly more likely to be missed
Computation and Language30 Aug 2026