文章反驳了“只要审查 AI 生成的代码就没问题”这一常见辩护。作者指出,LLM 编程助手经常出错,而人类代码审查存在明确的认知上限:有效审查每次不宜超过 1 小时,且代码量不应超过约 400 行。若要求开发者全面审查 AI 生成的每一行代码,不仅会严重限制产出,还可能因审查疲劳而降低质量。更令人担忧的是,现有初步证据显示,人类在审查 LLM 生成的代码时往往更自信,却发现更少的缺陷。文章呼吁 AI 工具的支持者用实证研究回应这些质疑,而不是依赖轶事或回避问题。
🔑 核心要点
LLM 编程助手容易出错,被许多人比作“实习生”,因此有人主张像审查实习生代码一样审查所有 AI 输出。
实证研究表明,有效的人工代码审查每次应控制在 1 小时以内,且代码量不宜超过约 400 行。
如果开发者必须逐行审查 AI 生成的代码,生产力收益将被审查成本抵消,实际日产量可能不到 1000 行。