Today for AI

Google Research · 2026/10/7 20:19:57

AI 介入职场学习的双刃剑:赋能初级员工独立表现 vs 阻碍资深判断力养成

原标题:Does better work always mean better workers?
68AI 研判分
核心综述

文章综合多项实证研究指出,AI 工具在嵌入培训流程时能显著提升初级员工的独立工作能力,但在软件工程、咨询等领域却可能削弱其通过重复性任务积累“判断力”的机会。核心矛盾在于 AI 加速了技能获取,却可能阻断从新手到专家所需的数千小时刻意练习路径。

报道全文原始报道全文

本文目录4 个章节

判断力是区分资深专业人士与初级从业者的关键。培养判断力需要数千小时的在岗学习,通常通过枯燥但具有塑造性的常规工作实践来实现,并往往在经验丰富者的指导下进行。然而,AI 已经在改变在岗学习的方式。一方面,在放射学、商业问题解决、求职者写作和法律教育等领域的实证研究表明,当 AI 工具被审慎地嵌入培训流程时,经验较少的工作人员能够提升其独立表现。

另一方面,近期针对软件工程师、管理顾问、高中生和临床医生的实验表明,虽然 AI 可以作为一种临时外骨骼来提升即时产出,但一旦移除该工具,这些收益往往难以持续。要理解 AI 如何削弱或增强专业能力,需要具备三个很少同时具备的要素:(1) 在数月而非数小时的普通专业工作中持续使用 AI;(2) 在无法使用 AI 时,对无辅助判断力进行可信评估;以及 (3) 由领域专家进行的盲评打分。

在由美国国家经济研究局发布的论文《AI 辅助是增强还是侵蚀专业能力?来自专利撰写领域为期三个月实地实验的证据》中,我们描述了一项实地实验,旨在捕捉在高度依赖专业知识的知识产权法律行业中,使用 AI 所导致的短期生产力变化及长期技能构建情况。在我们的实验中,我们将一款当时尚未发布的 Google Labs AI 专利写作助手工具(现已整合入 Gemini Notebook)的访问权限,随机分配给十一家与 Google 保持常规非独家业务关系的知识产权律师事务所中的 133 名律师。每家律所三分之二的律师被分入“处理组”,获得了该工具的早期访问权限;其余律师则被分入“对照组”,虽然接受了关于如何使用 AI 的一些培训,但在为期三个月的研究期间内未被允许使用该工具。

借助 AI 提升工作质量

在获得 AI 辅助 10 天后,我们向所有参与实验的律师发送了一份关于假设发明的发明人材料包,并要求他们起草一份专利。90 天后,我们使用了另一套模拟的发明人材料进行了同样的测试。我们在两个时间点都观察到了预期的、由 AI 带来的起草任务绩效提升。在第 10 天,拥有 AI 工具访问权限使起草得分提高了 0.34 个标准差(得分由独立法律专家根据涵盖五个不同质量维度的 Likert 量表评分细则进行评定),相当于在对照组得分分布中百分位排名提升了 10 个百分点;到第 90 天,这一改进扩大至 0.38 个标准差,意味着百分位排名提升了 11 个百分点。这些改进在所有质量维度上都表现出显著的一致性。值得注意的是,绩效的提升主要源于低分频率的降低和高分频率的增加,而满分或极优分的频率并未发生变化。从统计上看,被分配了 AI 访问权限的律师其得分从最低五分位数区间移动到了中下和中位区间,但卓越得分的数量没有明显变化。这种模式在初级律师身上尤为清晰,他们的质量提升同时也伴随着显著的时间节省(例如,在第 10 天的任务中,他们比对照组平均耗时 124 分钟快了 18 分钟)。

但专利律师的工作不仅仅是起草专利,他们还会相互审查彼此的工作成果,以发现可能导致专利在法庭上无法执行的关键错误(有时被称为“专利亵渎”)——例如,过度主张发明的新颖性或保护范围。因此,我们在第 90 天增加了另一项任务,要求受试者对一份包含大量实质性及风格性错误的假设性现有专利进行红线修订(即手动标记并修正)。这项测试任务反映了资深律师日常运用且往往无法依赖 AI 辅助的那种专业判断力。关键在于,虽然鼓励实验组律师在起草任务中使用未发布的 AI 工具或其他任何 AI 工具,但在红线修订任务中禁止任何人使用 AI,这使得他们在该任务上的得分成为衡量其技能发展水平的指标。对于所有任务(包括起草和红线修订),我们与第三方专利专业人士合作,从五个质量维度对提交作品进行评分:(1) 可执行性,(2) 准确性,(3) 策略性模糊(权利要求的战术性界定),(4) 完整性,以及 (5) 清晰度。

当移除 AI 时

当在第 90 天的红线修订任务中移除 AI 助手后,那种拉平差距的效果消失了。获得 AI 工具访问权限的律师在这项无辅助任务上比对照组高出 0.32 个标准差(相当于百分位排名提升 9 个百分点),但这种效应完全由资深律师驱动,他们比对照受试者高出 0.45 个标准差(提升 13 个百分点),而初级律师则没有表现出明显的进步。相反,初级律师的分数出现了两极分化:极低分增多,中等分数减少,高分增多,但顶尖分数并未增加。

这些结果对学习意味着什么?显然,那些此前获得 AI 工具访问权限的资深律师,在过去三个月使用该工具的过程中,从他们的专业判断力中获取了显著价值。但初级律师的情况更为复杂微妙。部分分数的提高暗示了 AI 具有跨越学习阶段的能力;而其他分数向分布的低端扩散,表明在某些场景下,AI 可以帮助初级律师交付合格的工作成果,但他们借助机器实现的高绩效表现,并不能转化为更快掌握使资深专业人士具备独特价值的专业知识。

考察定性编辑模式有助于了解不同经验水平的专业人士如何使用生成式 AI 工具。在实验组和对照组中,初级律师的提交均表现出僵化的形式主义:他们按顺序从上到下工作,经常在低风险的引言部分进行文字校对上耗尽时间,而未能触及核心的专利权利要求。初级律师还侧重于表面层面的同义词替换,而非改进商业保护范围。即使发现了严重缺陷,他们也往往只是留下诊断性评论,指出问题所在,而不是执行修订(redline)来实际修复它。由于这种“只诊断不执行”的姿态在未使用 AI 辅助的对照组初级律师中也同样普遍,这表明它是初级律师的一种基线能力短板,而依赖 AI 执行重写三个月并未弥补这一短板。

相比之下,资深律师持续受益于 AI 的使用。接受过 AI 培训的资深律师花在修订上的时间比初级律师更长,他们跳过低风险的文字润色,从头重建权利要求,剔除可能无意中缩小法律权利或限制保护范围的措辞,并将许多修改与明确的法律原则相结合。在后续访谈中,资深律师表示,他们将 AI 输出视为一种“逻辑审计员”,而非最终成品。这削弱了他们对现有文本的执念,迫使他们阐明结构性修改的理由和方法,从而激活并磨砺了他们的基础专业知识。

进一步的方向

提升绩效和培养持久的专业判断力是不同的目标。对于初级专业人士而言,这两者之间可能存在张力。基础专业知识可能是缺失的一环,它使得借助 AI 进行的重复性工作能够在整个职业生涯中转化为老练的专业判断力。即使模型能力不断进步,这种判断力很可能仍将至关重要:律师在与法官、客户和同事互动时,将继续运用他们的判断力。他们无法在所有场景中都依赖 AI 工具提供协助。当前 AI 时代的一个关键挑战在于,确保那些旨在今天产出更好工作的工具,不会阻碍初级专业人士成长为明天我们所需要的专家。

在专业人员的实际工作环境中开展研究对研究者而言是一项挑战。我们的实验仅包含一个有限的专利律师样本,这反映了该领域顶尖专业人士高昂的按小时计费费率。我们仅对他们进行了为期三个月的观察,相较于他们形成持久专业能力所需的数年时光,这一时间窗口显得十分短暂。此外,过去一年中模型能力的快速提升、用户对 AI 基础认知的普及(以及 AI 赋能产品在法律领域的渗透),若我们现在重新运行试验,可能会影响结果。这些局限性为后续研究带来了机遇,其中一些方向我们希望在未来几个月内继续探索。尽管如此,我们的工作得出了一个明确的结论:要理解 AI 辅助对专业技能的影响,必须通过测试将“使用工具的效果”与“无辅助下的用户表现效果”区分开来。

致谢

衷心感谢共同作者 Josh Martin、Zanna Iscenko、Scott Strand、David Pearl 和 Melissa Ferere;感谢 James Manyika、Ruth Porat、Kent Walker、Josh Woodward、Anu Madgavkar、Daniel Rock 和 Fabien Curto Millet 提供的指导与支持;感谢 Google Labs 的 Tom Shane、Mauricio Carneiro、Johnny Jacobs、Victor Lavrenko、Yinghao Sun、Samuel Yang、Daniel Nishi、Eric Wang、Kevin Li、Hao Zheng 和 Franz Och 与我们合作开展实验;感谢 Kiera Russell 在产品访问权限和可信测试员支持方面的协助;感谢 Steve Gong 和 Taylor Montgomery 在法律指导和招募支持方面的帮助;并感谢我们的传播、市场和研究博客合作伙伴,包括 Kerry McHugh、Zoe Ortiz、Emily Short、Joseph Mack、Esmeralda Cardenas 和 Leanne Trujillo,他们推动了项目的发布。