personal_asset
2026-09-12 每周好文:AI 帮你做得更好,不等于学会
专利律师随机试验发现,AI 能立刻提高产出,但能否沉淀为脱离工具后的判断力,取决于已有经验与使用方式。
为什么选它
最近一周的微信转发反复讨论普通人怎样给自己谋前途:学英语还有没有用,销售高手究竟在做什么,教育和个人努力能不能改变处境。它们背后其实有一个共同问题:完成一件事,和获得以后独立完成这件事的能力,是不是同一回事。
David Autor、Tanya Rodchenko 等人的新论文《Does AI Assistance Enhance or Erode Expertise?》把这个问题搬进了真实职场。研究团队与美国 11 家知识产权律所合作,让 133 名执业专利律师参加为期三个月的随机试验。一组获得定制 AI 写作助手,另一组保持原有工具;研究既测他们使用 AI 时交付得怎么样,也测三个月后不准使用 AI 时还能不能做出专业判断。
这篇论文值得读,因为它同时戳破了两种过于轻松的判断。第一种是“AI 让新人迅速达到专家水平,所以经验已经不重要”;第二种是“用了 AI 就会退化,所以最好少用”。结果更麻烦,也更接近现实:初级律师在 AI 辅助任务中提升最大、节省时间最多,但脱离 AI 后没有平均进步;高级律师即时增益较小,脱离 AI 后反而保留了明显的判断力提升。
原文核心论证
研究招募了 156 名律师,其中 133 人完成入组并被随机分配。随机化在每家律所内部进行,并按经验分层;90 人获得 Google Labs 尚未公开发布的 InFlow 写作助手,43 人进入对照组。论文把七年以上法律经验定义为高级律师,少于七年定义为初级律师,同时用三年至九年的不同阈值做了稳健性检验。
InFlow 并不是一个只会续写的聊天框。它可以在选中文本中修改或插入内容,按上下文生成文字,从编辑者、专家或受众角度反馈,还能按规则检查语义不一致。实验组另有一套针对专利写作的培训,包含工具设置、提示词库、常见错误与缓解办法;对照组只接受通用 AI 基础培训,不能使用生成式写作工具。
实验设置了三次关键评估。获得工具约十天后,参与者根据一项发明的主权利要求、图示和客户笔记撰写从属权利要求及详细说明;约九十天后再做一次更难的专利撰写。最后所有人都要在不使用 AI 的条件下修改一份有缺陷的专利申请,也就是 redlining。前两项测“带着工具能做多好”,最后一项测“工具不在场时,专业判断有没有留下”。
所有作品由独立知识产权律所的专利律师盲评。每份作品由两名评审打分,标准包括可执行性、准确性、歧义、完整性和清晰度。十天任务有 105 人完成,九十天撰写有 98 人完成,最终无 AI 修改任务有 91 人完成;从最初随机入组到最后一项任务的累计流失为 32%,但研究没有发现实验组和对照组之间存在显著的差异流失。
先看即时产出。使用 AI 的律师在十天撰写任务中平均高出对照组 0.34 个标准差,九十天时高出 0.38 个标准差,两个结果都达到统计显著。五个质量维度的方向也一致,说明提升并非只来自文字更流畅。
初级律师获得的即时帮助更大。十天和九十天时,他们的估计增益分别为 0.58 和 0.60 个标准差;高级律师分别为 0.22 和 0.30 个标准差,其中前者不显著,后者只在 10% 水平显著。十天任务里,实验组初级律师还比对照组初级律师快约 18 分钟;高级律师只有约 5 分钟的差异,无法与零区分。AI 确实把新人的当期表现向上托,并让他们更快交付。
再看脱离 AI 后的判断。三个月后,实验组在无 AI 修改任务中整体高出对照组 0.32 个标准差。可是一拆经验层级,这个平均结果完全由高级律师贡献:高级律师提高 0.45 个标准差,初级律师的估计值为负 0.03,几乎就是零。换句话说,最能借 AI 提高当前产出的人,并不是最能把使用过程转化为独立能力的人。
初级律师的平均值还遮住了分化。实验组初级律师的无 AI 得分更分散:中下水平的作品变少,但差作品和较好作品都变多。论文没有把它证明为“AI 让一部分人进步、让另一部分人退步”的确定机制,只说这个分布与那种解释一致。高级律师的分布则更明确地向好作品移动,差和一般作品减少。
作者用文本分析探索原因,但没有把它当作预注册的因果检验。使用 AI 三个月后的高级律师,更常重构整段专利文本,处理影响商业范围的宏观法律问题,并为修改写出法律理由。初级律师更多按顺序做格式和局部修改,能指出高层问题,却常常没有真正完成修复。作者提出两种可能:AI 生成底稿让专家把注意力转向战略判断;对新人而言,同样的代劳也可能挤掉形成战略能力所需的费力练习。
值得质疑之处
第一,样本很小,而且并不代表所有知识工作者。最终无 AI 任务只有 91 人,来自 11 家为高要求客户提供专利服务的美国律所。专利写作高度专业、保密要求高、工具使用受控制,结果不能直接推广到程序员、销售、学生或普通办公室工作。
第二,研究没有做入组前的无 AI 能力测试。合作律所不接受这项设计,所以作者只能依赖随机分组后的基线平衡,把期末差异解释为实验影响。随机化是有力依据,但直接比较每个人前后能力,本来会更清楚。
第三,累计流失达到 32%。论文的统计检验没有发现实验组与对照组差异流失,主要结果也做了稳健性分析,但小样本中“不显著”不等于绝对没有选择性退出。高级与初级子组的估计尤其需要保留不确定性。
第四,所谓“无 AI”主要依赖明确指令,研究团队无法完整监控参与者是否在任务外使用其他工具。作者检查了 InFlow 日志、提交特征并做排除分析,没有发现足以推翻结果的证据;但它仍不是一个物理隔离的闭卷考试。
第五,实验只持续三个月,而专业能力通常需要多年形成。初级律师的分化以后可能收敛,也可能扩大;高级律师的提升能否长期保留,也没有答案。论文测到的是一个重要的中期信号,不是职业生涯结论。
第六,工具在试验期间经历了功能变化,而且直接成本由 Google 资助,多位作者是 Google 员工或承包商并披露了利益关系。作品由外部专利律师盲评、研究预先注册,这些安排降低了偏差风险,但读者仍应把资助和产品背景纳入判断。
第七,作者提出的学习机制仍是解释,不是被随机操纵的变量。高级律师没有明显省时却积累了更多独立判断,初级律师省时更多却没有平均积累,这与“是否继续投入认知努力”有关;但实验没有随机规定思考时长,也没有直接测量每个人把省下来的时间用到了哪里。
结合近期关注的启发
这篇论文给“学一项技能是否还有用”加了一条很重要的检查:不要只看使用工具时能交付什么,还要看工具拿走后你能判断什么。产出提升当然有价值,但它不能自动证明能力增长。
对正在入门的人,最危险的不是使用 AI,而是把最需要形成判断的环节一起外包。可以让 AI 给出底稿、解释和反馈,但至少保留三件事自己做:先独立判断问题在哪里,再决定采用哪条建议,最后在不看答案的情况下重做一次。若每次只是接受一份看起来专业的结果,熟练的可能是调用流程,不是底层能力。
对已经有经验的人,AI 更像注意力放大器。已有的领域模型能帮助你识别哪些生成内容只是表面流畅,哪些地方触及真正风险;工具替你生成基础文字后,注意力可以转到结构、边界和取舍。这里的“经验”不是工龄本身,而是能解释为什么改、改了会影响什么、什么不能交给模型判断。
这也提醒我们重新看待销售高手和英语学习。背下一段话、完成一次对话,与能独立识别对方真实顾虑或选择合适表达,不是同一层能力。AI 可以陪练、润色和模拟客户,但应该定期加入无辅助测试:不用提示能否抓住问题,不看翻译能否组织观点,没有脚本能否处理意外追问。
对管理者,不能只用“当期产出提高多少”评价 AI 培训。至少要分成两块:工具在场时的质量和时间,以及工具不在场时的判断、纠错与迁移。新人如果只承担被 AI 简化后的任务,短期数据可能很好看,传统学徒制里那些费力但能长本事的环节却会消失。
更现实的做法不是禁用 AI,而是重新设计工作:让 AI 负责可检查的底稿,让新人必须解释关键取舍并完成独立复盘;让高级人员把审阅中的判断过程显性化,而不只是给出最终修改。工具能提高交付速度,组织仍要为能力积累保留摩擦。
适合怎么读
先读摘要和图 1,分别记下三组结果:十天 AI 辅助撰写、九十天 AI 辅助撰写、九十天无 AI 修改。不要把前两组的产出提升直接称为学习。
再读第 3 节实验设计,核对 133 人如何分组、三项任务分别测什么、完成样本怎样从 105 人降到 91 人。接着读表 3、表 4 和表 6,重点比较初级与高级律师的点估计、显著性和置信区间,而不是只记住“AI 有效”。
最后读讨论部分的限制:没有基线能力测试、样本小而特殊、三个月观察期、无法完全监控无 AI 任务。读完后拿自己的一个 AI 工作流做双重验收:工具在场时是否更快更好,以及一周后不看原答案能否独立发现同类问题。两项都提高,才更接近“能力增长”。
NBER 研究页: Autor 等:Does AI Assistance Enhance or Erode Expertise?