任何与计算机编程有过哪怕是间接接触的人都知道,现代AI编程助手和智能体能够极其高效地生成大量可运行代码。但使用这些工具的程序员也清楚,不能轻易信任这些代码的准确性,这意味着必须投入大量精力去审查AI生成的输出结果。
一项针对数百家企业实际编程实践的最新研究发现,人工代码审查已成为制约AI编程工具整体效率的一个重要"瓶颈",几乎没有证据表明企业通过使用这些工具提升了软件产出或减少了用人需求。研究作者指出,编码阶段本身获得的任何效率提升,都"被生产流程中的下游限制所吸收";随着"代码审查流程的时长显著增加,拉取请求更有可能需要修改,审查者也会留下更多评论"。
三思而后行
为了得出这些结论,哈佛大学研究员菲奥娜·陈(Fiona Chen)和詹姆斯·斯特拉顿(James Stratton)使用了Jellyfish提供的汇总分析数据,该工具用于衡量工程团队的细颗粒度产出情况。这些数据涵盖了3亿个独立的"工作事件"(例如提交和拉取请求),以及2021年至2026年3月期间,700多家相关软件开发企业、超过70万名员工的问题管理软件数据。
为评估AI工具对这些企业的影响,研究人员综合使用了直接测得的AI使用情况,以及对GitHub活动的分析,以确定每家公司何时开始将AI编程助手(主要辅助人类自动完成代码)和/或AI编程智能体(主要根据提示自主编写并提交代码)引入其工作流程。随后,研究人员通过较为复杂的计算方法,对不同组织在不同时间点引入这些工具前后的关键变量进行了"双重差分"回归分析。
就原始代码产出而言,研究结果清晰而鲜明。研究人员写道,企业引入AI编程智能体后,生成代码总行数平均增加30%,提交总数增加20%,拉取请求平均增加23%。但所有这些额外的代码并没有直接转化为企业层面软件产出的提升。相反,Jira等工具跟踪的"问题"和"史诗"(即整体软件功能)的解决率,在引入AI工具后并未出现统计学意义上的显著变化(研究人员还发现,在引入AI前后,Jira跟踪的这些问题在规模或复杂度上也没有出现"构成性转变")。
这种差异的原因可以直接从代码审查流程中找到答案,该流程在引入AI编程智能体后明显耗时更长。总体来看,从拉取请求提交到最终合并进代码库之间的平均"审查流程"时间,在引入AI智能体后平均膨胀了49%。这一影响在更细颗粒度的数据中也可见一斑:研究人员写道,在AI智能体引入之后,"被要求修改的拉取请求占比几乎翻倍,每个拉取请求的评论数量增加了35%"。
针对这一变化,研究人员发现,AI智能体引入后,从事代码审查工作的员工比例增加了14%。他们还写道,在查看Jellyfish上的活跃员工总数并与这些企业的领英(LinkedIn)数据进行交叉比对后,"无法将显著的用人变化归因于AI"。
尽管理论上AI也可以帮助处理审查流程,但研究人员发现,到目前为止,这种影响仍然微乎其微。尽管到2026年3月,被调查企业中有80%使用了某种形式的AI代码审查,但AI智能体仅贡献了全部审查评论的23.3%和全部拉取请求的10.8%,这表明绝大部分此类工作仍由人类承担。
当然,AI智能体在编程领域仍是相对新生的事物,即便是自本次研究2026年3月的数据截止日期以来,其产出也经历了显著的更新和升级。虽然截至目前,研究所涉企业中已有95%引入了AI编程智能体,但许多企业无疑仍在摸索在何时、如何最佳地部署这些工具。随着软件工程团队在权衡AI智能体处理特定编程问题的优劣方面积累更多经验,"编码时间与审查时间"之间的这种权衡关系或许会有所改善。
但就目前而言,让AI编写代码看起来像是一把双刃剑:编码速度的提升被人工代码审查时间和精力的相应增加所抵消。这样的结果不禁让人怀疑,对大多数公司而言,投入大量时间和成本去让AI编程智能体运转起来,究竟是否真的值得。
Q&A
Q1:AI编程智能体真的能提高软件开发效率吗?
A:研究发现,虽然AI编程智能体能让代码生成量大幅增加(代码行数增加30%,提交数增加20%,拉取请求增加23%),但企业层面的软件问题解决率并未出现统计学意义上的显著提升,整体效率提升有限。
Q2:为什么AI生成的代码越多,软件产出却没有相应增加?
A:主要原因在于代码审查环节成为瓶颈。引入AI编程智能体后,代码审查流程时间平均增加49%,需要修改的拉取请求占比几乎翻倍,每个拉取请求的评论数量增加35%,这些下游限制抵消了编码阶段的效率提升。
Q3:使用AI编程智能体会减少程序员的工作岗位吗?
A:研究没有发现显著的用人变化可归因于AI。相反,由于审查工作量增加,从事代码审查工作的员工比例还增加了14%,说明目前AI智能体更多是改变了工作内容分布,而非直接替代人力。
