AI 软件开发——数据怎么说?对 LLM 编程的一轮证据盘点
来源:codemanship.wordpress.com — 2026-08-12
📋 概述
作者 Jason Gorman 汇总了近年关于 LLM 用于软件开发的同行评审与行业研究,结论相当冷静:真正自主、可靠、长程的 agentic 开发在 LLM 下几乎不可能是科幻;有效上下文上限远小于厂商宣称值;LLM 分不清新旧信息,训练出的「主导先验」常压过输入;行业研究显示输出量上升但结果并未改善,团队反而更慢地交付更差的软件。他强调 AI 编码是「放大器」而非「修复剂」,并且提高可靠性所需的算力量级是天文数字。
🔑 核心要点
- 有效上下文远小于宣称上限,「压缩」机制本身有损,导致输出在长上下文下不可用。
- 行业大样本研究一致显示:输出↑ 但结果未改善,平均团队更慢交付更差软件。
- AI 编码是放大器而非修复剂,会放大团队既有优势与短板。
- LLM 不懂否定、偏爱范例胜过描述、难以学习长程依赖——「只见迷雾不见全局」。
- 让可靠性提升一个数量级所需算力约 10^20 倍,近期别指望显著更可靠的模型。
- 提升可靠性的现实路径是上下文工程与更有效的质量闸门。
💡 金句
想知道一门技术的极限?去问物理学家——对 LLM 的统计物理研究早就给了答案。
👍 0
👎 0
← 返回 Lobsters 首页