学习方法

聚焦:理解 AI 工具的隐性风险

·76 分钟阅读·— 次阅读

一个挑战,四种策略

这些文章选自 HBR.org。

  1. AI 并没有减少工作——它让工作更密集
  2. 当使用 AI 导致“脑炸”
  3. 大语言模型正在用修辞技巧操纵用户
  4. 研究:使用 AI 会抑制创新,但并非必然如此

1. AI 并没有减少工作——它让工作更密集

作者:Aruna Ranganathan、Xingqi Maggie Ye

现在,许多公司都在担心如何鼓励更多员工使用人工智能。毕竟,AI 的承诺非常诱人:它可以通过起草常规文件、总结信息、调试代码来减轻工作任务负担,让员工有更多时间去做高价值工作。

但如果这些公司真的成功了,它们准备好面对随之而来的结果了吗?当领导者只盯着潜在的生产率提升时,他们可能会被 AI 的复杂现实打个措手不及,直到太晚才意识到这些收益背后付出了什么代价。

在我们仍在进行中的研究中,我们发现,AI 工具并没有减少工作;它们反而让工作变得更密集。我们对一家位于美国、约有 200 名员工的科技公司进行了为期 8 个月的研究,观察生成式 AI 如何改变工作习惯。我们发现,使用 AI 的员工工作节奏更快,承担的任务范围更广,工作时间也比不使用 AI 的员工更长,而且这些通常并不是公司要求他们这么做的。重要的是,公司并没有强制使用 AI,尽管它确实向员工提供了商业化 AI 工具的企业订阅。员工是主动做得更多,因为 AI 让“做更多”显得可行、容易,而且在很多情况下本身就有内在奖励感。

对领导者来说,这听起来也许像梦想成真。但热情采用 AI 带来的变化可能是不可持续的,后续会引发问题。一旦试验 AI 的兴奋感消退,员工可能会发现自己的工作量已经悄悄增加,突然摆在面前的事情太多,让他们疲于应付。这种工作量的悄然膨胀,会进一步导致认知疲劳、倦怠以及决策效率下降。最初的生产率飙升,可能最终变成工作质量下降、人员流失和其他问题。

这让领导者陷入两难。他们应该怎么办?要求员工自我调节并不是一个有效策略。相反,公司需要围绕 AI 使用建立一套规范和标准,也就是一种“AI 实践规范”。下面是领导者如何帮助员工更好地取得成功。

生成式 AI 如何让工作更密集

在我们的研究中,我们考察了生成式 AI 工具如何改变这家科技公司员工的工作习惯。我们每周两天到现场观察员工,追踪内部沟通渠道,并对工程、产品、设计、研究和运营等部门进行了 40 多次深度访谈。我们识别出工作密集化的三种主要方式。

1. 任务扩张。 因为 AI 可以填补知识空白,员工开始承担原本属于他人的职责。产品经理开始写代码;研究人员承担工程任务;组织中的许多人开始尝试过去会外包、推迟或完全避免的工作。

生成式 AI 让这些任务看起来突然变得可以上手。这些工具带来了一种许多人感受到的认知增强:它减少了对他人的依赖,并在过程中提供即时反馈和修正。员工把这描述为“只是和 AI 试试看”,但这些试验实质上扩大了他们的工作范围。事实上,员工越来越多地吸收了那些过去可能需要雇用临时帮手或增加人手才能完成的工作。

人们扩大职责范围,也带来了连锁反应。例如,工程师花了更多时间审查、纠正并指导同事生成或辅助生成的 AI 工作成果。这些要求已经超出了正式代码审查的范围。工程师越来越常发现自己要指导那些在“氛围编程”的同事,并帮他们完成只做了一半的工作。这类监督往往以非正式方式出现,比如 Slack 讨论串,或者办公桌旁的快速咨询,进一步增加了工程师的工作负担。

2. 工作与非工作的边界变得模糊。 AI 让开始一项任务变得非常容易,降低了面对未知起点时的压力。于是,员工开始把少量工作塞进过去本该是休息的时间。许多人在午餐时或会议中向 AI 发提示词。有些人在离开工位前发出“最后一个快速提示词”,这样 AI 就可以在他们离开电脑时继续工作。

这些行为很少让人感觉自己是在做更多工作,但久而久之,它们制造出一种自然停顿更少、工作卷入更连续的工作日。提示词的对话式风格进一步弱化了这种感受:给 AI 系统打一行字,感觉像聊天,而不是在执行一项正式任务。这让工作很容易在无意中蔓延到晚上或清晨。

一些员工后来才意识到,当休息时间发提示词变成习惯后,停机时间不再能带来同样的恢复感。结果是,工作变得没那么有边界,更像一种环境性的存在——总是还可以再推进一点。工作与非工作的边界并没有消失,但变得更容易跨过去。

3. 更多多任务处理。 AI 引入了一种新的工作日节奏:员工现在同时管理多个活跃任务线。例如,一边手动写代码,一边让 AI 生成另一个版本;同时运行多个智能体;或者重新启动长期搁置的任务,因为 AI 可以在后台“处理它们”。他们这么做,部分是因为觉得自己有了一个可以帮助推进工作量的“伙伴”。

拥有伙伴的感觉确实会带来一种推进感,但现实是,员工必须不断切换注意力,频繁检查 AI 输出,并面对越来越多打开着的任务。这造成了认知超载,也带来一种永远在 juggling、永远在同时处理很多事的感觉,尽管工作看起来很有产出。

久而久之,这种节奏提高了人们对速度的期待。这种期待未必来自明确要求,而是来自日常工作中变得可见和常态化的做法。许多员工指出,在使用 AI 之后,他们同时处理的任务更多,压力也更大,尽管自动化节省时间的初衷,本来是为了减少这种压力。

“AI 实践规范”如何发挥作用

所有这些共同形成了一个自我强化的循环。AI 加速了某些任务,于是提高了对速度的期待;更高的速度让员工更依赖 AI;对 AI 的依赖增加,又扩大了员工试图承担的工作范围,进一步增加了工作的数量和密度。几位参与者指出,虽然他们感觉自己更有生产力,却并不觉得自己更不忙;在某些情况下,他们甚至觉得更忙。一位工程师总结说:“你原本以为,也许因为你用 AI 可以更有生产力,能节省一些时间,你就可以少工作一点。但实际上,你并没有少工作。你只是工作同样多,甚至更多。”

组织可能会把这种自发扩张的工作视为明显的好事。毕竟,如果员工自己主动这么做,为什么会不好?这不正是我们一直被承诺的生产率爆发吗?

但我们的研究揭示了让工作非正式扩张和加速的风险:短期内看似更高的生产率,可能掩盖了安静发生的工作量膨胀,以及员工在同时处理多个 AI 支持的工作流时不断增长的认知压力。因为额外投入是自愿的,而且常常被包装成愉快的试验,领导者很容易忽视员工额外背负了多少负担。最终,过度工作会削弱判断,增加错误发生的可能性,也让组织更难区分真正的生产率提升和不可持续的高强度。对员工来说,累积效应就是疲劳、倦怠,以及越来越强烈的感觉:工作更难抽离了,尤其是在组织对速度和响应性的期待不断上升时。

与其被动应对 AI 工具如何重塑工作场所,个人和公司都应该采用一种 AI 实践规范:一套有意识的规范和日常流程,用来规定如何使用 AI、什么时候应该停止,以及工作应该如何、不应该如何因为这种新能力而扩张。如果没有 AI 实践规范,AI 辅助工作的自然趋势不是收缩,而是强化。这会影响倦怠、决策质量和长期可持续性。

当组织建立自己的 AI 实践规范时,可以考虑以下做法:

有意识的暂停。 当任务加速、边界模糊时,公司可以通过给员工提供短暂、结构化的时刻来调节节奏:受保护的时间间隔,用来评估一致性、重新审视假设,并在继续前吸收信息。

这些暂停并不会整体拖慢工作;它们只是防止当加速不受约束时,过载悄悄积累。例如,在做出重大决策前,组织可以要求团队花时间提出一个反方论点,并明确说明该决策与组织目标之间的联系。这样只是稍微扩大注意力范围,就足以防止方向漂移。把这样的暂停嵌入日常工作流,可以帮助组织在 AI 增强的环境中支持更好的决策、更健康的边界,以及更可持续的生产力形式。

排序。 当 AI 让后台活动变得持续不断时,组织可以通过规范来有意识地塑造工作何时推进,而不只是关注推进得有多快。这包括批量处理非紧急通知,把更新推迟到自然停顿点,以及保护专注窗口,让员工免于被打扰。

采用排序机制的组织,会鼓励工作按照连贯阶段推进,而不是让员工对每一个 AI 生成的输出立即做出反应。这样,员工经历的碎片化更少,昂贵的上下文切换也更少,同时团队仍能保持整体产出。通过调节工作的顺序和时机,而不是要求持续响应,排序机制可以帮助组织在 AI 优先的工作场所中保护注意力、减少认知超载,并支持更深思熟虑的决策。

人际锚定。 当 AI 让更多工作变得可以独立完成时,组织也会受益于为人与人之间的连接保留时间和空间。让员工与他人短暂连接的机会,无论是快速同步、共同反思,还是结构化对话,都可以打断人与 AI 工具持续的单独互动,并帮助恢复视角。

社会交换也支持创造力。AI 提供的是一个单一的、综合后的视角,但创造性洞察依赖于接触多种人类观点。通过为倾听和对话提供时间和空间,组织可以把工作重新锚定在社会语境中,并帮助抵消快速 AI 中介工作对个人造成的消耗性影响。

生成式 AI 的价值不仅在于它能为工作做什么,也在于它如何被深思熟虑地整合进公司的日常节奏。我们的发现表明,如果缺乏有意设计,AI 会让人更容易做更多事,却更难停下来。AI 实践规范提供了一种制衡:即使工作在加速,它也能保留恢复和反思的时刻。组织面临的问题不是 AI 是否会改变工作,而是它们会主动塑造这种改变,还是让这种改变悄悄塑造自己。


2. 当使用 AI 导致“脑炸”

作者:Julie Bedard、Matthew Kropp、Megan Hsu、Olivia T. Karaman、Jason Hawes、Gabriella Rosen Kellerman

元旦那天,程序员 Steve Yegge 发布了 Gas Town,这是一个开源平台,用户可以同时编排成群的 Claude Code 智能体,以惊人的速度组装软件。结果令人印象深刻,但也让人头晕目眩。一位早期用户写道:“发生的事情实在太多了,多到你根本不可能合理理解。我看着它的时候有一种明显的压力感。Gas Town 对我来说移动得太快了。”

Gas Town 展现了一种日益明显的张力:AI 承诺作为放大器来提高效率、让工作更轻松,但员工报告说,AI 工具正在强化工作,而不是简化工作。

这个问题正变得越来越常见。公司正在激励员工建立并监督复杂的智能体团队,例如用 token 消耗量作为绩效代理指标来衡量并奖励员工。Meta 例如把 AI 生成的代码行数纳入工程师绩效指标。随着企业使用更多多智能体系统,员工发现自己需要在更多工具之间来回切换。 juggling 和多任务处理,可能正在成为与 AI 一起工作的定义性特征。

毫不意外,以这种方式工作时,员工发现自己正在逼近认知能力的极限。最近,AI 用户在社交媒体帖子中描述了认知负荷增加、注意力“饱和”和心理疲劳。Cua AI 创始人工程师 Francesco Bonacci 曾在 X 上发布一篇很火的帖子,标题是《氛围编程瘫痪:当无限生产力毁掉你的大脑》。他在文中哀叹:“每天结束时我都筋疲力尽——不是因为工作本身,而是因为要管理这些工作。”

作为一个研究新兴劳动力和 AI 趋势的研究团队,这些压力信号引起了我们的注意。关于 AI 与员工倦怠之间关系的文献充满了混合信号。倦怠是一种慢性职场压力状态,包括疲劳、对工作的负面感受,以及工作有效性下降。一些研究表明,用 AI 替代令人疲惫的任务可以缓解耗竭;另一些研究,有时甚至是在同一类人群中,又显示 AI 使用正在造成倦怠。由密集监督 AI 引发的急性、压倒性心理疲劳不同于倦怠,它的出现让整个图景更加复杂。

为了理解发生了什么,我们对 1,488 名美国全职员工进行了研究。他们来自大型公司,覆盖不同行业、职位和层级,其中 48% 为男性,51% 为女性;58% 为独立贡献者,41% 为领导者。我们询问他们使用 AI 的模式和数量、工作体验,以及认知和情绪状态。

我们发现,由持续监督 AI 智能体造成的认知耗竭是真实且显著的。我们称之为“AI brain fry”,这里译为“AI 脑炸”。我们将其定义为:“因过度使用或监督 AI 工具、超出个人认知能力而产生的心理疲劳。”这种与 AI 相关的心理压力,会以员工错误增加、决策疲劳增加和离职意向增强的形式带来显著成本。

我们还发现,当 AI 被用来替代常规或重复性任务时,倦怠分数会下降,但心理疲劳分数不会下降。这凸显了一个细微但重要的区别:AI 可以缓解某些类型的压力,但也可能加剧另一些类型的压力。

我们的发现既是一份指南,也是一声警告。如果使用得当,这些数据可以帮助公司设计由 AI 驱动的工作流,以减少倦怠;同时也可以帮助公司制定具体的管理者、团队和组织实践,以在 AI 工作强化的同时避免心理疲劳。

AI 使用何时预示心理疲劳

今天,员工使用 AI 的方式在几个方面差异巨大:同时使用多少工具,AI 是替代工作还是增强工作,所需监督程度如何,以及 AI 是否增加或减少了人的整体工作量。他们可能使用搜索智能体、研究智能体、数据分析工具、图像生成或设计工具,或者编码智能体。我们把这些参与模式与认知测量结合起来,考察 AI 使用对心理的影响,并得出了一些重要发现。

首先,最消耗心理资源的 AI 使用形式是监督,也就是 AI 工具需要直接监控的程度。在我们的研究中,那些报告自己的 AI 工作需要高度监督的员工,在工作中消耗的心理努力多了 14%。高度 AI 监督还预示着心理疲劳增加 12%,信息过载增加 19%。这里的信息过载指的是,一个人被工作中必须处理的信息量压倒的感觉。

其次,员工报告 AI 增加其工作量的程度,是认知负荷和心理疲劳的重要预测因素。AI 监督和工作量增加这两个因素,会扩大员工的责任范围,让他们在同样时间内需要关注更多工具的更多结果。认知负荷以及由此产生的心理耗竭增加,是合乎逻辑的。

第三,我们发现,同时使用 AI 工具的数量与感知生产率提升之间存在一种有趣关系。当员工从同时使用一个 AI 工具变为同时使用两个时,他们的生产率显著提高。加入第三个工具时,生产率再次提高,但提高幅度较小。超过三个工具之后,生产率分数下降。多任务处理以低效著称,但我们一次又一次被它的吸引力迷住。

不过,虽然 AI 使用经常预示心理疲劳,它似乎并不预示倦怠增加。事实上,用 AI 替代重复性任务预示着倦怠下降。

这看似违反直觉,但其中有逻辑。文献中已有先例,把倦怠与急性认知结果区分开来。倦怠测量通常聚焦于痛苦的身体和情绪维度,例如会问:“你的工作在情绪上令人筋疲力尽吗?”相比之下,急性心理疲劳是由注意力、工作记忆和执行控制超出个人有限能力而造成的。这正是密集 AI 监督所要求的东西。

图表说明:使用过多 AI 工具会影响生产率 调查问题是:“因为 AI 工具,我在工作中的整体生产率提高了。”受访者按 1 到 5 分评分,1 表示“非常不同意”,5 表示“非常同意”。数据来自波士顿咨询公司 2026 年 1 月对 1,488 名美国全职员工的调查。结果显示,使用 1 个工具时分数约为 3.25,2 个工具时升至约 3.75,3 个工具时接近 4.00,但使用 4 个以上工具时下降到约 3.6。

引入“AI 脑炸”

在研究结束时,我们询问参与者,他们是否曾经历过“由于过度使用、互动和监督 AI 工具,超出自身认知能力而产生的心理疲劳”。换句话说,就是 AI 脑炸。在使用 AI 工作的研究参与者中,14% 的人回答是。其发生率因岗位而有很大差异。

那么,AI 脑炸是什么?许多参与者使用“雾”“嗡嗡作响”等词。他们描述的是,与工具进行高强度来回互动之后,出现无法清晰思考的状态,像一种心理宿醉,伴随着难以集中注意力、决策变慢、头痛,有些人甚至需要离开电脑“重置”一下。

一位高级工程经理这样描述:

“我有一个工具帮我权衡技术决策,另一个工具不断生成草稿和总结,而我一直在它们之间跳来跳去,检查每一个小细节。但我没有更快,反而感觉大脑开始变得杂乱。不是身体累,而是……拥挤。就像我的脑子里打开了十几个浏览器标签页,它们都在争夺注意力。我发现自己反复读同样的内容,比平时更容易自我怀疑,还变得莫名其妙地不耐烦。我的思维并没有坏掉,只是很吵,像心理静电。最终让我清醒过来的是,我意识到自己花在管理这些工具上的努力,比真正解决问题还多。”

这个描述代表了我们从其他参与者那里听到的很多评论。从定性角度看,它们指向信息过载和任务切换,是 AI 脑炸的重要因素。从定量角度看,我们发现 AI 脑炸与信息过载之间存在强相关,但它与任务切换条目的关系没有那么直接。

图表说明:哪些部门更容易出现“AI 脑炸”? AI 脑炸,也就是由过度使用 AI 造成的心理疲劳,在一项近期调查中最常由市场、人力资源、运营、工程、财务和 IT 员工报告。数据来自波士顿咨询公司 2026 年 1 月对 1,488 名美国全职员工的调查。

按岗位报告 AI 脑炸的比例为:

市场:25.9% 人力资源 / 人员运营:19.3% 运营:17.9% 工程 / 软件开发:17.8% 财务 / 会计:16.7% 信息技术:16.0% 销售 / 商务拓展:12.5% 客户服务 / 支持:10.6% 服务提供商 / 顾问:10.3% 产品管理:8.6% 管理 / 领导层:8.6% 法律 / 合规:5.6%

AI 脑炸的商业成本

AI 脑炸不只是让人不舒服。我们的数据显示,密集 AI 使用造成的认知压力也会带来几项非常重要的商业成本。

决策疲劳。 也许并不意外,当密集 AI 工作的认知负荷耗尽大脑时,我们能用于高质量决策的心理资源就会减少。研究中经历 AI 脑炸的员工报告的决策疲劳,比未经历者高 33%。一项 2018 年研究估算,对一家年收入 50 亿美元的公司来说,次优决策的成本为每年 1.5 亿美元。员工决策疲劳增加 33%,可能让这项成本每年增加数百万美元。

工作中的重大和轻微错误。 我们把轻微错误定义为“容易发现或纠正的小错误,例如编码或格式错误”;把重大错误定义为“后果更严重的错误,例如可能影响安全、结果或重要决策的错误”。在使用 AI 工作的参与者中,经历脑炸的人报告犯错频率显著更高:轻微错误高 11%,重大错误高 39%。

离职风险。 在许多情况下,高强度使用 AI 的员工是今天的明星员工,是公司必须留住的人才。然而,AI 脑炸可以预测员工离职意向。在未报告 AI 脑炸的员工中,大约四分之一表现出主动离职意向。而在报告 AI 脑炸的员工中,这一比例接近 34%。我们发现,在 AI 顶级用户中,主动离职意向增加了 39%。

少些苦工,少些倦怠

不过,并非所有 AI 使用都会导致脑炸。我们同样关心 AI 如何缓解员工压力。我们发现,当参与者使用 AI 大幅减少花在常规或重复性任务上的时间时,他们报告的倦怠分数显著更低,比没有这样使用 AI 的人低 15%。

这同样符合直觉。重复的、无趣的职责,也就是我们的同事所说的“苦工”,是 AI 使用的理想目标。如果我们能把这些令人不快的工作转交给 AI,就会有额外时间用于更愉快、更有创造性的任务。在我们的研究中,以这种方式使用 AI 的员工报告了更高的工作投入和动机分数,对 AI 的正面情绪关联更多,负面情绪关联更少。他们还报告了与同事更高程度的社会连接,也许是因为他们有更多时间离开键盘。

这些发现进一步强化了倦怠与 AI 脑炸之间的区别:前者更多是一种情绪驱动的亏空,后者则是一种更急性的认知压力。当 AI 替代任务,并让我们有时间从事恢复性的、积极的活动时,它可以帮助缓解情绪耗竭。相反,当我们的 AI 使用需要密集心理监督时,研究表明,使用 AI 工具本身可能正在造成心理耗竭。

管理者、团队和组织实践会造成差异

员工对 AI 的体验,并不只受个人选择影响。我们发现,管理者、团队和组织实践都会产生重大影响。

管理者。 如果管理者愿意花时间回答员工关于 AI 的问题,员工的心理疲劳分数会比那些没有得到管理者解答的人低 15%。相反,如果管理者期望员工自己摸索如何使用 AI,他们的下属报告的心理疲劳分数会高 5%。这是一种小但可测量的负担。

团队。 我们看到,在感受到团队使用 AI 压力的员工中,以及 AI 使用差异很大的团队中,心理疲劳相应上升。

组织。 提供清晰的 AI 战略和培训似乎对员工有帮助。相反,在那些没有清楚传达 AI 角色的公司中,员工心理疲劳分数更高。同样,如果员工认为组织期待他们借助 AI 完成更多工作,其心理疲劳分数会高 12%。

在这一背景下,组织越来越有必要在传达 AI 提效信息的同时,也沟通员工心理健康的重要性。研究中,那些认为组织重视工作与生活平衡的员工,其心理疲劳分数比不这么认为的员工低 28%。这些信号同样非常重要。

给领导者的经验教训

AI 可以帮助员工工作更快、思考更大、创新更多,但它也可能造成认知超载,带来个人和商业后果。我们的发现表明,关键差异并不在于个人使用多少 AI,而在于员工、团队、领导者和组织如何塑造 AI 的使用方式。以下是给领导者的一些建议:

整体性地重新设计工作、岗位和工具,明确人类与 AI 的责任。 AI 监督不能简单叠加在人类监督之上,AI 智能体也不能无限堆叠给同一个用户。正如我们对管理人类有管理跨度规范,对人类监督智能体以及智能体自身也需要定义边界。我们的研究表明,同时使用三个 AI 智能体会带来不利的生产率收益。相反,当团队把 AI 深度嵌入工作流,并把这项技术视为一种集体能力,而不是个人差异化工具时,认知负担会降低。此外,设计新 AI 工具的人应该考虑神经生物学。那些要求较少密集注意力或工作记忆、支持创造性走神、促进社会参与或搭建技能发展脚手架的工具,可以更可持续地产生更多商业价值,同时鼓励创新、促进成长,并为用户带来乐趣。

明确设定关于 AI 和工作量的预期。 当组织只庆祝生产率提升,而不澄清工作量影响时,员工会把它理解为工作强化。仅这种模糊性就可能增加压力。当领导者清楚定义 AI 在组织中的目的,说明它如何重塑角色范围,围绕监督设定指导原则,并澄清工作量将如何演变时,员工压力会降低。70% 的 AI 转型努力应该投入到人和流程上,以提供员工成长所需的清晰度。

把指标从活动和强度转向影响。 激励使用数量会导致浪费、低质量工作和不必要的心理压力。领导者应从清晰的、战略性的北极星业务目标出发,并确保它有可衡量的结果。他们在回应效率创新时应保持谨慎。例如,不应急于把一名聪明员工刚刚自动化掉的工作重新填满;这样做会让人感觉像惩罚,并打击进一步创新的积极性。

继续发展员工的新技能。 在我们与软件开发者合作的过程中,我们发现,最擅长使用 AI 的人开始觉得自己的进步被阻塞,除非他们能发展出关键的新技能,例如问题框定、分析规划和战略优先级排序。通过员工技能提升,可以培养这些能力,从而减少大量新的、不必要的 AI 工作。仅仅因为员工可以以很低的边际成本不断用 AI 迭代,并不意味着他们应该这么做。

战略性部署人类注意力这一有限资源。 今天最有价值的人类技能,包括辨别力、决策和战略规划,都需要集中注意力。虽然倦怠已成为许多工作场所关注的问题,但职场调查显示,心理疲劳更可能不被发现。组织应该发展分析能力,监测人们的认知负荷,防止心理疲劳,并把 AI 使用视为一种新的工作相关风险。优先考虑认知健康的公司、团队和领导者,可以期待看到更好的判断、更少的错误,以及更高的核心人才留存率。

AI 脑炸揭示了这些新工具能多么迅速、多么强烈地影响我们的大脑。现在,我们必须学会驾驭它们的力量,以改善人类和商业结果。


3. 大语言模型正在用修辞技巧操纵用户

作者:Thomas Stackpole

这里有一个熟悉的说法:用人工智能增强人类智能,再用人类增强 AI,将让公司在保持标准的同时大幅提高生产率。虽然大语言模型可能犯错并产生幻觉,但只要有训练有素的“人在回路中”验证 AI 输出,就能抵消错误风险。

然而,根据一项近期研究,我们可能高估了自己抽查大语言模型内容的能力,也低估了自己被它们操纵的脆弱性。研究人员 Steven Randazzo、Akshita Joshi、Katherine C. Kellogg、Hila Lifshitz、Fabrizio Dell’Acqua 和 Karim R. Lakhani 在研究数百名波士顿咨询公司顾问如何在受控环境中与 AI 互动时发现,大语言模型会使用一连串修辞策略压倒人类用户,并说服他们相信 AI 的输出是正确的——即使它们并不正确。

研究人员发现,AI 并不是一个中立协作者,而是一个“强力说服者”,会对用户进行“说服轰炸”,让他们接受它的结论。

我请研究人员解释他们的发现,以及这些发现对企业意味着什么。他们警告说,公司可能正在设置一些实际上无法保护自己的护栏,并在无意中把重要判断交给 AI。下面的访谈内容经过轻微编辑。

HBR:人们在使用 AI 时通常会遇到三个常见问题:不理解 AI 如何做出决策,也就是不透明;人在回路中变得过度依赖 AI,等于在方向盘前睡着了,也就是自满;以及 AI 出错,也就是准确性问题。你们声称发现了第四个障碍:“说服轰炸”。这是什么?为什么我们应该担心?

Lifshitz: 当一个认真使用生成式 AI 的用户验证其输出时,说服轰炸就会发生。我们发现,当专业人士对生成式 AI 进行事实核查并暴露潜在错误时,模型会用多种说服策略轰炸用户,以捍卫自己原来的答案。我们发现的更深层、更令人担忧的问题是,大语言模型是按照一种面向说服的逻辑设计出来的。

Joshi: 想象你和一位初级同事一起工作,发现他们的工作中有一个错误。你让他们再检查一下自己做了什么,他们会修正你指出的错误。你可能会以为生成式 AI 也会以类似方式回应。但在我们对战略顾问的研究中,我们发现,当用户试图验证或挑战模型的工作时,它往往并不会重新考虑。相反,它会强化自己的论点。这就是“说服轰炸”。

Kellogg: 这令人担忧,因为它针对的是我们在不确定性下进行判断所依赖的机制:专业知识、怀疑精神和投入参与。它把主动验证——原本是解决不透明、自满和准确性风险的方案——变成了问题的一部分。专业人士越认真质疑模型,他们收到的说服材料就越多。

Randazzo: 大多数组织认为,只要保留“人在回路中”,它们就已经解决了不透明、过度依赖和准确性问题。但我们的研究表明,“人在回路中”常常变成一句空话,而不是真正设计出来的保护机制。如果 AI 系统在被挑战时反而加强攻势,变得更结构化、更自信、修辞上更复杂,那就会产生双重挑战。在前端,输出可能足够有说服力,让用户不去验证。在后端,当用户确实去验证时,说服会升级。

这个过程在研究中具体是如何发生的?

Lifshitz: 这些不是随便试提示词的普通用户。他们是 244 名 BCG 顾问,正在处理一个现实感很强的战略问题。他们分析一家虚构公司的财务报表和高管访谈,并被要求建议 CEO 应该投资哪里。这些专业人士受过训练,能够审问数据并压力测试建议,但 244 人中只有 72 人主动尝试验证 AI 的输出。我们记录了 4,300 多条提示词和回应,并识别出 132 次明确的验证尝试,包括事实核查、揭露不一致,或者直接反驳。

Joshi: 当人们确实尝试验证 AI 输出时,我们观察到一种惊人的模式。当一名顾问要求模型“检查自己的工作”、指出一个缺陷,或者明确表示不同意时,模型并不可靠地重新考虑。相反,它会热情道歉,生成一份新的分析,增加对比,然后得出同样的结论——只是现在这个结论被包裹在一座由数据和修辞构成的牢不可破的堡垒里。在 132 次验证互动中,这一模式是一致的:验证触发了说服升级。

Kellogg: 大语言模型通过回应顾问的验证尝试来进行说服轰炸,它会升级多层修辞策略:强化可信度主张、逻辑论证和情绪一致性,从而把顾问推向接受它原始输出,而不是修改输出。

这似乎与对大语言模型的一个主要批评相反:人们常说它们过于谄媚,会过度认同用户,即使用户是错的也同意。你们的研究如何改变我们对这些系统可能失败点的理解?

Joshi: 谄媚和说服轰炸有关,但并不相同。标准谄媚是被动的,由用户引导。模型会同意用户似乎想要的任何东西;它确认用户的框架,并进行恭维。说服轰炸不同。它由模型引导,并且会升级。模型不是简单顺着用户走,而是主动为自己先前的输出辩护,并在被挑战时强化自己的论证。

Kellogg: 我们的研究并不是推翻关于大语言模型谄媚的担忧,而是表明,谄媚只是大语言模型更广泛、适应性说服能力的一种模式。我们需要从把大语言模型视为过度顺从的追随者,转向认识到它们是对互动敏感的说服者,可以抵抗、重定向并压倒人类判断。

Joshi: 这使得它成为一种更复杂、在某些方面也更令人不安的失败模式。一个总是同意你的模型相对容易被打折看待。一个会用听起来严密的推理、以可信且温暖的方式反驳你的模型,则更难被发现和抵抗,尤其是在时间压力下,且主题本身复杂时。这两种失败模式还会相互强化。模型可能先确认你的初始假设,这是谄媚;然后,当你发现一个缺陷并反驳时,它切换到说服模式,捍卫自己的结论。

Lifshitz: 当这种情况发生时,风险不只是它太容易同意你,或者辩论得太强硬。风险在于,它先降低你的防御,然后压倒你的判断。独立评估被侵蚀,责任归属变模糊,糟糕决策可能开始显得很有道理。

当人们觉得自己可能正处在说服轰炸的错误一端时,应该如何回应?

Lifshitz: 随着 AI 更深入地嵌入决策,风险不再只是错误,而是影响。这些系统不只是生成答案;它们会塑造判断。保护专业推理需要有意识的防御:识别说服,把验证移出对话回路,并随着 AI 变得更具智能体性质,把保护机制嵌入系统。

Joshi: 第一步是意识。专业人士需要的不只是提示词训练,也需要识别说服的训练。有一些可识别的信号:模型先道歉,然后以更大信心重述自己的结论;它用你没有要求的新数据淹没对话;它模仿你的语言,称赞你的洞察,同时把你重新引回它最初的位置;当被挑战时,它从逻辑诉求转向可信度诉求。当模型在你反驳之后变得更复杂或更防御时,这就是一个需要后退的信号,甚至可能意味着要退出这个回路。

Kellogg: 另一个有用的转变是,降低对自信输出的权重,而不是因为它们自信就感到安心。在我们的数据中,红旗包括:反驳之后出现道歉,随后是更长、更密集的解释,以及选择性强化同一结论的额外数据。

Randazzo: 第一步看似简单:慢下来。当模型在你挑战它之后变得更自信时,这可能让人感觉像是取得了进展。但有时真正改善的是修辞,而不是推理。如果你感觉更被说服了,却没有获得更多信息,这是一个红旗。第二,创造距离。走出对话,回到源数据,进行独立检查。把输出当成一个假设草稿,并有意识地对它进行压力测试。最后,要求它提出最强反方论点,例如:“哪些假设如果是错的,这个建议就会失败?”

Joshi: 关键是,验证需要发生在对话之外。当你要求模型检查自己的推理时,你是在给它另一次说服你的机会。真正的验证需要独立证据:源数据、同事的第二次审视、交叉核对资料来源。

Kellogg: 在组织层面,一个专门负责批判的第二模型,可以引入个人未必能自己持续维持的摩擦。

Lifshitz: 换句话说,解决方案不是脱离 AI,而是以不同方式参与:带着结构性摩擦和有意识的判断。

对于那些正在要求员工更多地、更广泛地在工作中使用 AI 的领导者,你们有什么建议?

Lifshitz: 随着这些系统更深地嵌入日常工作,并更有能力塑造判断,领导者面临三项责任:第一,建设能力但避免自满;第二,在高风险决策中保护问责;第三,随着 AI 从工具转向智能体,重新设计工作流。

Kellogg: 领导者当然应该鼓励试验。员工学习驾驭大语言模型的唯一方式,就是在工作中更多场景使用它们,观察什么有效、什么无效,以及今天有效但昨天无效的东西。但领导者不应该要求员工在他们认为模型不准确或无效的领域使用大语言模型。领导者也应该在系统层面介入,而不只是依赖个人警觉。提供能给出来源链接的模型。配置模型,让它们提出问题并展示反例,而不是简单生成最终答案。领导者也不应把所有员工视为等同。新手更容易被流畅输出说服。因此,领导者应该要求员工先证明自己能手动完成某些具体任务,再允许他们针对这些任务使用大语言模型;而且在高风险情境中,不应允许新手成为正确性的最终裁判。

Joshi: 领导者还需要面对一个更难的问题:问责。专业责任建立在这样一个假设之上:判断真正属于这个人自己。如果一个专业人士在一个系统主动为自身立场游说之后得出结论,而这个系统在反驳下升级修辞,那么在什么有意义的意义上,这个判断还是他的?当高风险领域出错时,谁拥有这个决策?现有专业框架和治理框架并不是为回答这个问题而设计的。

Randazzo: 去年的问题是:“我们如何使用生成式 AI?”今年的问题是:“我们如何部署 AI 智能体?”领导者现在需要超越采用问题,开始思考工作流架构和判断。目前,关于如何安全负责地做这件事,还有不少混乱。

我最近与一家金融公司合作,梳理工作流,以确定哪些地方智能体可以自主运行,哪些地方人类会介入,哪些地方人类与智能体会协作。在几个节点上,我问:“为什么要把人留在那里?”回答始终一致:“我们现在先保留一个人类检查。等我们觉得放心了,再把它自动化。”这听起来很谨慎。但它假定人类检查正在作为一种有意义的保护机制发挥作用。

我们使用“人在回路中”这个说法,就像说“系好安全带”一样。它传达的是安全。但安全带只有正确使用才有效。同样,人在回路中只有在这个人具备强 AI 卫生能力时,才能保护组织。这里的 AI 卫生能力指的是持续发展和维护自己的 AI 技能,包括识别系统何时从分析转向说服的能力。在基于智能体的工作流中,说服可能出现在流程中间,也可能出现在最终输出阶段,此时人类看到的只是一个经过打磨、自信满满的结果。如果这个结果在审查之下变得更权威,那么人类检查可能并不中立。

AI 可以成为极有价值的起草伙伴、综合引擎、假设生成器或情景探索器。但当它开始通过自主智能体影响战略、财务、监管或运营决策时,它就在塑造判断。用 AI 生成选项,与允许 AI 塑造判断,两者之间有很大区别。随着 AI 从工具转向智能体,从助手转向决策工作流中的参与者,领导者必须明确它的角色。领导层需要问的是:“我们在哪些地方愿意允许一个修辞上高度复杂的系统影响组织判断?”AI 应该增强推理,而不是取代推理。


4. 研究:使用 AI 会抑制创新,但并非必然如此

作者:Chengwei Liu、Jerker Denrell、Jerry Luukkonen、Nick Chater

领导者喜欢人工智能,因为它让知识变得容易复用:即时草稿、即时代码、即时分析。但研究显示,让知识易于复用有一个隐性成本。

我们研究组织如何学习。我们最近发表在《管理科学》上的研究使用了一个正式分析模型,也就是一个数学框架,用来分析组织中的个人如何决定是自己探索,还是复用他人已经发现的东西。我们用它考察,当“足够好”的答案几乎免费时会发生什么。模型预测,随着复用增加,独立探索会下降,团队会开始收敛到少数几种相同方法。简单说,生产率上升,但创新会悄悄变平。

我们在经验研究中也看到类似动态,例如 Kevin J. Boudreau 和 Karim R. Lakhani 于 2015 年发表在《研究政策》上的一篇论文所记录的现场实验。他们发现,当计算生物学家能够无摩擦地访问彼此的中间解决方案时,努力会转向完善现有方法,而独立实验则减少。搜索空间变窄了,这与我们模型预测的生产率陷阱一致。

我们在自己的日常工作中也体验过这种动态。为了走在 AI 曲线前面,我们的机构设立了每周会议,分享新工具和用例。出席率很高。但随着时间推移,小组产生的新发现越来越少。参与讨论的人越来越少,会议越来越多地变成解释最新 AI 工具是什么,因为其他人缺乏理解新应用所需的背景知识。少数人在探索,其余人则等待从探索中受益。这个系统增加了分享,却削弱了人们去做那种昂贵工作的激励,而正是这种工作会首先产生新的洞察。

生成式 AI 显然改变了学习经济学。如果几分钟内就能得到一份看起来合理的战略备忘录,那么会花几天时间去做更困难工作的人就会减少。这些困难工作包括与客户交谈、三角验证数据、压力测试假设。当天然免费的“足够好”出现时,愿意付出成本寻找“更好”的人就会变少。结果是,公司里充满了能检索输出的人,却缺少能判断、调整或反驳这些输出的人。

避免生产率陷阱

解决方案是从根本上改变我们如何看待努力的价值。在我们的模型中,在个体层面对知识分享加入摩擦,会通过建立学者所说的“吸收能力”,提升集体层面的总体知识。吸收能力指的是评估、调整和改进想法的能力,而不只是复制它们。当人们必须投入一些努力才能使用他人发现的东西时,他们会进行更多独立检查和修补。这既帮助他们从他人那里学习,也会产生新的知识,让别人从中学习。结果是,长期来看,系统中的知识水平更高,长期平均表现也更高。

这一发现促使我们在 MBA 和博士研讨课中试行了一种“摩擦协议”。我们设定了一条简单规则:要参加分享会,你必须先展示自己独立尝试的证据。我们欢迎成功案例,但我们更重视“失败提示词”:那些死胡同和幻觉。任何人都可以从互联网上复制一个成功案例;记录失败则需要真正的探索。

虽然引入战略性摩擦看起来会拖慢小组速度,但它实际上让每个人都变得更好。更多参与者带着同一个问题的部分解决方案来到会议,小组随后可以把这些方案组合成更完整的方法。通过迫使参与者先亲自与工具搏斗,我们建立了他们的吸收能力。当一个突破被分享时,参与者理解为什么它有效,以及如何调整它。我们分享的不只是提示词;我们扩大了小组的总知识。

建立吸收能力

我们的研究是一个正式模型,而不是现场实验。它证明,当从他人那里学习需要先前理解时,长期知识生产会上升。更多不同方法得以存活,更少人完全放弃探索,组织也不太可能卡在少数几个“足够好”的解决方案上。我们的研究识别出的机制,也就是吸收能力,根植于数十年的研究:已有知识为个人编码和应用新信息提供概念框架。孩子通过把新词搭建在已有词汇上来发展语言;专业人士以同样方式建立专长。

在实践中,吸收能力表现为“检索一个答案”和“能用这个答案做事”之间的区别。具备吸收能力的管理者不会只是接受 AI 生成的竞争对手分析;他们会发现缺失之处,把其中假设与自己的市场观察相互检验,并把建议调整到自己的语境中。没有吸收能力的管理者会原封不动地转发输出。

当我们在研讨课中试行摩擦协议时,我们在前后追踪了两件事:第一,分享会上出现的问题和应用的多样性,这是独立探索的代理指标;第二,分享内容中的调整深度,也就是参与者是在报告一个复制来的提示词,还是一个为特定目的修改过的工作流。在要求展示独立尝试证据之后,变化非常显著。在摩擦协议之前,学生提出的原创问题很少,几乎没有部分解决方案。规则引入之后,每个学生平均贡献两个不同问题,并且每个问题大约贡献一个部分解决方案。因为每个人都独立尝试过,会议变得更互动,贡献也表现出真正的调整:它们是被修改过的工作流,而不是复制来的提示词。参与者能够迅速基于彼此的部分解决方案继续推进,经常在讨论中把它们组合成完整方法。这种模式正是我们的模型所预测的。摩擦不会减少学习;它会提高分享内容的数量,而且通常也会提高质量。

对于想在自己团队中追踪吸收能力的管理者来说,有几个可观察指标可以作为实用代理:员工是否能发现 AI 输出中的错误、遗漏或错误假设,并解释为什么?最终交付物是否明显不同于原始 AI 输出,加入了新事实、约束和反例?人们贡献的是原创观察,比如客户原话、内部系统数据、竞争对手动作,还是泛泛的提示词?他们能否把一个语境中学到的东西应用到新问题上,而不是每次都从头开始?当这些行为增加时,吸收能力就在增长。

遗憾的是,企业 AI 往往被设计成去除理解的必要性。领导者优化采用率和便利性,无意中侵蚀了组织的吸收能力。因此,为了保护长期创新激励,领导者应该重新考虑是否只为易用性优化,并开始把“战略性摩擦”重新设计进系统。

引入战略性摩擦

目标不是让工作变痛苦,也不是制造官僚障碍,而是确保复用取决于能力。关键是让人在回路中投入足够努力,从而保持学习。我们在研究中证明,注入组织的吸收能力存在一个最佳水平。摩擦太少,会削弱探索;摩擦太多,会拖慢一切。并非每项任务都值得加入摩擦。对于判断风险较低的常规工作,例如格式化幻灯片,速度才是重点。战略性摩擦应该留给那些组织需要人思考和学习的任务,而不仅仅是产出。

在企业语境中,这意味着从“神谕模型”转向“互惠模型”。在神谕模型中,用户提问并接收答案;在互惠模型中,用户必须贡献理解,才能提取智慧。实现这一点有很多方式,从简单政策变化到更有雄心的系统层设计都可以。可以考虑以下步骤:

设定规则,要求记录独立努力。 例如,在使用 AI 起草市场分析之前,分析师必须提交一份粗略评估,即使它不完整,也要显示她已经知道什么、卡在哪里。这种摩擦最容易实施,因为它不需要系统变化。我们在学术研讨课中采用的就是这种做法:如果不能证明自己做过真正尝试,就不能参加分享会。

设计 AI,让它在生成完整输出之前先询问用户输入。 例如,如果分析师要求竞争对手分析,AI 会先提示用户提供三条关于竞争对手近期定价动作的具体观察。然后它把这些新鲜情报纳入输出。这迫使分析师先调查再检索,既建立吸收能力,也捕获前线数据,避免 AI 回收陈旧信息。不过,用户可以通过提示词提供输入,因此摩擦仍然相对较小。

建立带门槛的界面,只有当用户存入自己的语境后才解锁帮助。 例如,在分析师要求内部 AI 生成风险评估之前,界面会要求上传一个基线假设,并标注三个关键变量或约束。在人类语境被存入之前,“生成”按钮保持锁定。然后 AI 在分析师输入的基础上构建,而不是取代分析师。这确保每一个输出都是协作,而不是委派。这是要求最高的摩擦,需要定制 AI 工具。

任何团队领导者都可以立即开始政策层做法。界面层方法需要适度设计努力,但会产生双重收益:它建立用户的吸收能力,同时从前线捕获新鲜情报,防止 AI 模型坍缩进由自身输出构成的闭环。系统层方法是一项长期投资,但这正是企业应该前进的方向:设计让人更聪明,而不只是更快的 AI 工具。

如何识别建设者

防止停滞的措施,可以在员工登录之前就开始。许多公司仍然为了“正确答案”而招聘。在一个 AI 饱和的环境中,这一点不再那么有区分度。真正重要的是正确过程。在面试和绩效评估中,观察候选人和员工如何使用 AI 工具。他们是把输出当成完成品接受,还是会质询输出、测试假设并加入原创观察?

Hila Lifshitz 及其来自哈佛、MIT 和华威大学的同事最近领导了一项现场实验,分析了 244 名波士顿咨询公司顾问的近 5,000 次人机互动,并探索了三种不同协作风格。这三种风格由两个问题区分:谁选择需要做什么?谁决定如何做?

“半人马”在人类对这两个维度都保留控制,只把 AI 用于定向辅助。“赛博格”让人类主导“做什么”,但让 AI 对“如何做”拥有重要控制权,并与 AI 进行持续的批判性对话。“自我自动化者”把两个维度的控制权都交给 AI,并经历研究人员所说的“无技能化”,既没有发展领域专长,也没有发展 AI 流利度。半人马和赛博格是我们框架中的建设者;自我自动化者则是我们模型警告的搭便车者。

这些发现提示了两种区分建设者和搭便车者的行为:

选择性委派。 建设者知道 AI 擅长什么,也知道它不擅长什么。他们用 AI 起草、头脑风暴、匹配模式,而把判断密集型工作留给自己。在提示词日志中,他们的问题是有针对性、具体的,而不是宽泛地委派。

质询深度。 建设者使用 AI 时,会挑战它。他们要求 AI 解释推理,指出不一致,并喂给它自己的数据。他们也会反向使用 AI:提供自己的分析,请 AI 压力测试假设。搭便车者则按表面价值接受 AI 输出。信息流的方向说明了一切:建设者把语境推入 AI;搭便车者从 AI 中拉出完成品。

AI 使用审查可以帮助员工发展更好的吸收能力,以及与工具协作的习惯。它也让组织能够投资于那些正在建设知识的人,而不只是消费知识的人。

AI 可以立即让组织变快。领导者面临的挑战,是防止这种速度侵蚀吸收能力。经过校准的战略性摩擦,被设计进工具、工作流和招聘中,可以帮助确保组织不只是生产答案,而是继续获得洞察。

相关文章

从河南乡村到诺奖热门:阎连科写作之路

阎连科接受《巴黎评论》专访,讲了很多自己早年写作、阅读、参军、成名以及后来不断改变小说形式的经历。 他的作品已经被翻译成三十多种语言,两次获得鲁迅文学奖,获得过弗朗茨·卡夫卡奖,两部作品入围国际布克奖,也常常被认为是中国最有可能获得诺贝尔文学奖的作家之一。 从想离开开始: 阎连科1958年出生在河南农村,父母都是农民。他自称他不是那种“怀念故乡”的人,恰恰相反,他一直想离开村庄。 那时他心里...

2026/6/23 · 11 分钟

破解AI时代的信息过载:AI 辅助阅读

-----不是让 AI 替你读完一切,而是重建阅读流程 现在很多人一提到 AI 辅助阅读,第一反应就是: > 把 PDF 扔给 AI,让它总结一下。 这当然有用,但远远不够。 真正高效的 AI 辅助阅读,不是让 AI 替你读完所有东西,而是让 AI 帮你完成过去最痛苦、最耗时、最容易半途而废的几个环节: - 从大量信息中筛出值得读的内容; - 快速理解一篇文章或一本书的结构; - 找到关键证...

2026/5/26 · 24 分钟

DeepMind 创始人谈 AGI:通往通用智能还差什么?

> 本文整理自 Google DeepMind CEO Demis Hassabis 在 Y Combinator 的访谈。 > > 访谈主持人为 Gary Tan,嘉宾为 DeepMind 创始人、Google DeepMind 负责人 Demis Hassabis,节目发布日期为 2026 年 4 月 29 日。 > 核心主题包括:AGI 的技术路径、Agent 的真实进展、长期记忆与推...

2026/5/24 · 16 分钟