Skip to content

A

深入浅出聊 AI:与智能体协作

深入浅出聊 AI

#技术#智能体#判断力

内容概要

智能体考验的不是你的提问能力,是你的管理能力——你的杠杆点从「怎么问」搬到了任务开始前的设计和结束后的验收。5E 框架(委托、装备、护航、验收、沉淀)把带人的动作装进人机协作;而「人在环里」正在因为审批疲劳、信息缺失和自动化偏见悄悄失效,需要被重新设计。

先说一个你这周大概率经历过的三秒钟。

屏幕上弹出一个框:「智能体请求执行以下操作:修改 12 个文件。允许 / 拒绝」。你扫了一眼,手已经点在「允许」上了。不是因为你判断过这 12 个文件该不该改——而是因为这是今天第 27 个弹窗,前 26 个都没出事,而且那行字里根本没告诉你它要改成什么样。

这三秒钟,大概是眼下最常见的人机协作现场之一。我们花了两年时间学会怎么跟 AI 说话,现在真正的问题变成了:怎么跟一个能替你动手的东西共事

上一篇我们拆开了智能体的骨架——它是一颗只会预测下一段文字的「脑子」,外面套了一整套让它能看、能动、能记事、能被核实的系统(行业里叫 harness,可以理解成给模型装的操作系统),也讲了怎么挑一款适合自己的。那篇讲的是它是怎么造出来的、该选哪一个。这一篇讲另一半,也是真正属于你的那一半:它到手了,你怎么用它干活,而不被它坑。

好消息是:你不需要从零学起。 如果你带过人、交办过工作、验收过下属的活儿,你已经掌握了这套技能的八成——只是节奏被压缩了一百倍,而且这个「下属」的能力形状和人类很不一样。

这篇讲四件事:你的角色变了什么它的能力边界在哪一套可以照着做的协作动作(5E),以及那个很多人天天在犯、却很少被拿出来讨论的问题——为什么你的「确认」正在失效

一、角色变了:你从提问者变成了委托人

对话式 AI 考验的是你的提问能力:你说一句,它答一句,每一轮你都在场,说错了大不了重问。

智能体考验的是你的管理能力:你交代一句,它自己跑几十轮「想一步—做一步—看结果」的循环,调工具、读写文件、花钱花时间——而你不在中间那几十轮里。

这个变化带来三个后果,值得一条条说清楚。

第一,你的杠杆点移动了。 对话时代杠杆在「怎么问」;智能体时代杠杆在任务开始前的设计结束后的验收——过程中你反而插不上多少手。很多人第一次用智能体,本能地想在过程中多盯着,盯又盯不明白,最后要么全程焦虑,要么干脆撒手不管。两个都是错的位置。

第二,风险结构变了。 对话说错了,损失是一句话;智能体做错了,损失是一个真实动作——文件被改了、邮件发出去了、数据被删了。更麻烦的是错误会累积:一个十步的任务,即使每步成功率高达 99%,连乘下来整体也只剩约 90%。步数越多,衰减越狠。

第三,最容易被忽略:你的责任没有跟着任务一起交出去。 署你名字发出去的东西,出了事是你的事。

理解这三条之后,有一个图景能把整件事统起来,我称之为双循环

  • 内环,是它的。 想 → 做 → 看 → 再想,直到任务完成。这是工程师造好的机器,你不需要碰,也碰不到。
  • 外环,是你的。 委托 → 装备 → 护航 → 验收 → 沉淀 → 下一次更好的委托。这是任何工程师都替代不了的部分——因为只有你知道「什么叫做好了」。

关键的一句话是:内环转得越自主,外环就越重要。 智能体的自主性不是免除你的责任,而是把你的责任从「每一步」搬到了「首尾两端」。

The Double Loop

(这是我的判断,不是行业定论。但下面每一个具体动作,我都会尽量挂上一条可查的出处。)

二、先看清它的能力边界

在讲怎么用之前,必须先讲它做不到什么。而且不是列清单,是推导——因为只有理解了「为什么必然如此」,你才知道换个模型、换个产品,这条边界会不会消失。

边界一:能力在快速上涨,但涨的是「时长」,不是「确定性」

有一个机构叫 METR,专门研究一件事:AI 能独立完成多长的任务? 它的衡量方式很聪明——不问「难不难」,而问「一个人类专家做完这件事要多久」。

结论是:这个「时间跨度」大约每 7 个月翻一倍,近两年还在加速;到 2026 年,前沿模型在它的评测里已经能应付人类专家要花十几个小时的任务。(METR, Time Horizon 系列)

听起来很吓人。但这句话带着三个定语,被大多数转述顺手省掉了:

第一,是按 50% 成功率算的。 「能做十几个小时的任务」的准确含义是——这类任务它大概有一半概率能做成。 一半。

第二,测的是「难度」,不是「续航」。 它衡量的是「一个人类专家做这件事要多久」,用来标定任务的难度量级,不等于这个 AI 真能自己连续干十几个小时不出事。

第三,测的主要是编程、机器学习、网络安全这类任务——目标明确、能自动打分、材料自带。你手上那些「跟三个部门对齐一下口径」的活儿,不在这条曲线上。METR 自己也提醒,时长越长的那几档,测量本身就越不稳。

这不是吹毛求疵,这是这条边界的全部要害:能力的增长曲线,和可靠性的增长曲线,不是同一条线。

边界二:「它会做」不等于「它每次都做对」

有一个专门测这件事的基准叫 τ-bench(Sierra Research 团队,2024),它模拟真实的零售和航空客服场景:有数据库、有业务政策文档、有会追问的用户。它引入了一个我认为每个职场人都该知道的指标——pass^k(读作 pass-hat-k)。

它测的不是「试 k 次至少蒙对一次」,而是反过来:同一件事,换 k 种问法(意思一样、话不一样),它是不是次次都做对。 这更像现实——同一个诉求,不同的客户会用不同的说法提出来。

结果很扎眼:在零售场景里,某个当时的前沿模型问一次的成功率约六成,但八次全对的比例只剩两成半左右。

翻译成人话:你昨天验收通过的那个任务,不代表你今天换个说法交代一遍,它还会做对。

这条边界的根源在上一篇讲过——模型是概率性的,不是确定性的。同一个问题问两次,答案可能不同。这不是 bug,这是它的工作方式。所以「我上次试过没问题」不构成免检理由,独立验证不是一次性动作,是每次都要做的动作。

边界三:它不知道自己不知道

模型的本职工作是「生成看起来最像样的下一段话」,不是「核实真假」。所以它出错时的语气,和它正确时一模一样自信。装上 harness 之后这一点有所缓解(它会去查、会被验证层核实),但没有消失——只是从「编造一个事实」变成了「误判一个进度」:它可能真心以为自己做完了。

企业层面的数据侧面印证了代价。Gartner 在 2025 年预测,超过 40% 的 agentic AI 项目会在 2027 年底前被取消,主因是成本失控、价值不清和风险控制不足。这是一家机构的预测,不是已经发生的统计;但它和多家 2026 年调研指向的同一个短板对得上——能把智能体管起来的组织,还是少数。

这三条边界推出的结论只有一句:把什么交出去,取决于两个变量——这件事做错了能不能撤销,以及你说不说得清什么叫做好了。

把它画成一个四象限,你手上的活儿立刻能分类:

What to Hand Off

右下角那一格是所有翻车案例的老家。说不出「什么叫做好了」的任务,交给智能体只会放大这份模糊——而且这次模糊会自己跑五十步。

三、5E:把带人的动作装进协作流程

我们系列第二篇讲过 Anthropic 的 4D 对话框架——委派、描述、辨别、尽责。它针对的是回合制对话,前提是你每一轮都在场。智能体打破了这个前提,于是需要一套外环的动作。我在培训里用的是 5E——委托(Entrust)、装备(Equip)、护航(Escort)、验收(Evaluate)、沉淀(Evolve)

先说清来历,免得听起来像凭空发明,也免得你误会它有官方背书:5E 是我自己从带团队的经验和 harness 工程里反推出来的框架,不是 Anthropic 的官方升级版。 有意思的是,Anthropic 后来基于近万段真实对话做的使用研究里,被反复点名的那些高质量行为——先把目标说清楚、先定义什么算做好了、主动补上缺失的背景、对关键事实做核实——和 5E 的几个环节是撞上的。不是谁抄谁,是同一个行业转折逼出了同一套动作。

一句话总括:4D 教你和 AI 好好说话,5E 教你和 AI 好好共事。

E1 · 委托 —— 决定交什么、给多大自主权

核心问题:这件事该不该交?交到什么颗粒度?给多长的缰绳?

对话时代你只需要决定「问不问」;智能体时代你要决定自主权的档位。管理学里的情境领导直接能用:

  • 指令档:一步一确认。用于高风险操作、第一次合作的任务类型。
  • 辅导档:先出计划给你审,批准后执行。这是复杂任务的默认档位,也是性价比最高的一档。
  • 授权档:直接干完交结果。用于低风险、可逆、你有把握验收的任务。

心法

  • 可逆的放手,不可逆的握紧。 判断标准不是任务难度,是「做错了能不能撤销」。
  • 验收标准想不清楚的任务,不要委托。(见上一节右下角那一格)
  • 先榨干单个智能体,再考虑多个。 「多派几个是不是更厉害」是个大问题,下一篇专门讲。

常见误区:把智能体当搜索引擎用(大材小用);或者把「我自己也说不清要什么」的任务丢给它(垃圾进、垃圾出,只是这次垃圾会自己跑五十步)。

E2 · 装备 —— 给上下文、工具和权限,环境即能力

核心问题:它看得见什么?摸得着什么?被允许做什么?

这是智能体时代全新的维度,4D 里没有对应物。对话时代 AI 只有你打的那些字;智能体有文件、工具、记忆、权限——它的能力上限,很大程度上是你搭的环境决定的。

三条反直觉的经验:

  • 上下文不是越多越好。 塞得越满,关键那句话越容易被埋在中段(研究里管这叫「迷失在中间」)。给智能体材料要像给高管做简报:少而准,重点放开头和结尾。
  • 工具不是越多越好。 就像给新人一把有四十个键的遥控器,他大概率按错。把工具砍到只剩这件事真正用得上的那几个,出错率明显下降——这是工程实践里的普遍经验,不是有定论的对照实验。
  • 权限先于能力。 OWASP 在 2026 年发布的智能体安全风险清单(Top 10 for Agentic Applications)指向一个很实在的判断:安全控制得落在身份、权限和工具执行这几层,光在系统提示里写一句「不许删文件」是不算数的。 那是一句好言相劝,不是一把锁。

心法:写任务简报,不是写提示词。 一份合格的委托书只有四行:

目标:要什么(可验收的那种说法)
边界:绝对不许碰什么
材料:给它看哪些东西
验收:怎么算完成

四行,通常两分钟能写完,但它决定了后面两小时的走向。

常见误区:一次性挂载所有文件夹、开放所有工具,然后抱怨它「抓不住重点」——重点是被你自己淹没的。

E3 · 护航 —— 在过程中设卡点,可看见、可叫停

核心问题:它跑起来之后,我在哪些节点看一眼?出事了我能不能拉手刹?

因为错误会复利,护航的本质是在错误累积成灾之前截断它

心法

  • 检查点设在不可逆操作之前,不是均匀撒在全程。
  • 长任务分段签收。 与其委托一个两小时的大任务,不如拆成四个三十分钟的段落,每段验收一次。这既符合它的上下文规律,也符合你自己的注意力规律。
  • 观察轨迹,不只看结果。 它的工具调用记录就是它的工作日志。抽查两眼「它为了得出这个结论都干了什么」,很多问题在过程里一目了然。
  • 随时可中断是底线。 用任何智能体产品之前先搞清三件事:怎么停?停了状态还在不在?能不能回退?

常见误区:两个极端——全程盯着每一步(那不如自己干),或者按下开始就去睡觉(醒来发现它顺着错误的第 3 步推了 47 步)。

E4 · 验收 —— 独立验证,不让干活的人给自己打分

核心问题:我怎么知道它做对了?不是「它说做完了」,是「我验证过了」。

对话的输出你读一遍就能辨真伪;智能体的输出是改过的文件、跑过的流程、发出去的内容——你没看见过程,就更不能免检结果。

心法

  • 验收标准在委托时就定好(呼应 E1)。事后临时想的标准,既不公平也不可靠。
  • 能用规则验的用规则,不能的用抽查。 数字对不对、链接通不通、格式合不合规——让它自己跑检查;判断、口吻、事实性——你抽查关键样本。
  • 要求它自证。 「把你依据的原文和数据来源列出来」是成本最低的验证手段,捏造的引用在这一步大概率现形。
  • 把产出当高质量草稿,不当成品。 尤其是要署你名字的东西。

常见误区:被流畅度骗过。智能体的产出永远「看起来很完整」,而完整感不等于正确性——这两件事在它身上是被无意焊在一起、其实毫不相关的。

E5 · 沉淀 —— 让下一次委托更聪明

核心问题:这次的经验,怎么变成下一次的起点?

这是 5E 相对 4D 的第二个全新维度。对话是没有积累的,每次从零开始;而智能体有记忆机制(各类产品里的项目说明、偏好文件、长期记忆)——你和它的协作关系是可以复利的。

心法

  • 纠正一次,沉淀一条。 每次你纠正它,问一句:这条该不该进它的长期记忆?「我们的报告永远先结论后论据」写进去一次,以后每次都省一遍。
  • 记忆是索引,不是日记本。 沉淀原则和给上下文一样:少而准。塞满琐碎记忆的智能体,和塞满上下文的模型一样会变笨。
  • 定期做减法。 过时的偏好、已经改变的项目状态,留着就是负资产。
  • 复盘你自己的外环。 大多数「智能体不行」的案例,回头看是 E1 委托了不该委托的,或者 E2 没给够材料。先查外环,再怪模型。

一页记忆卡:委托看可逆,装备要精简,护航设卡点,验收不免检,沉淀能复利。

5E: Working With an Agent

四、为什么你的「确认」正在失效

这一节比前面都重要——现在回到开头那三秒钟。

行业里有个词叫 human-in-the-loop(人在环里),翻译过来是「关键决策必须由人确认」。这句话你在 AI 产品的宣传页和企业的治理文档里都见得到。而它在很多地方正在悄悄失效。

这不是道德问题,是设计问题。失效有三条独立的成因,叠在一起就成了必然。

成因一:数量。审批疲劳(approval fatigue)

一个人被要求批准的事情太多、太频繁时,他会停止逐个评估。批准变成反射动作——点、点、点。这个现象在安全领域早有名字,叫告警疲劳:机房里的警报器要是一天响两百次,第两百零一次真着火了也没人抬头。搬到智能体这儿,可以叫它审批疲劳——当每个动作都要确认时,确认这件事本身就没有信息量了。 如果你一天点 50 次「允许」,其中 49 次无害,那么第 50 次你也会点——因为你的大脑已经从 「这次该不该」 切换成了 「这类一般都行」

成因二:信息。你被要求判断的事,没给你判断所需的材料

「智能体请求修改 12 个文件,允许/拒绝」——这个弹窗里没有任何能支持判断的东西。 你不知道改成什么样、为什么要改、拒绝了会怎样。

这种情况下点「允许」,不是你不负责任,是这个界面在结构上就没打算让你负责任:它想要的是一个签名,不是一个判断。这类设计我自己给它起了个不太客气的名字——合规性剧场:戏是演给流程看的,不是演给风险看的。

成因三:心理。自动化偏见(automation bias)

这是最隐蔽的一条。人类天然倾向于过度信任「看起来很确定」的机器输出。 美国国家标准与技术研究院(NIST)在其生成式 AI 风险管理框架中,把自动化偏见、过度依赖和拟人化列为专门的风险类别——它不是个人素质问题,是人类认知的默认设置。

微软与卡内基梅隆大学 2025 年的一项研究给了这条一个特别刺眼的注脚:他们调查了 319 名知识工作者、收集了 936 个真实的 AI 使用实例,发现一个人对 AI 的信心越高,投入的批判性思考越少;而对自己判断的信心越高,批判性思考越多。同一项研究还观察到工作方式的三个位移——从收集信息变成验证 AI 的信息,从解决问题变成整合 AI 的答案,从执行任务变成监督 AI 执行

(一句必要的提醒:这是自述式调查,工作者自己报告的感受,不是「AI 导致思考下降」的因果实验。但那个方向,恐怕很多人自己心里有数。)

研究者引用了一个来自航空业的老概念,1983 年就有人提出来了,叫「自动化的讽刺」:自动系统把日常操作全接管了,于是人只在系统失灵时才被叫上场——而那恰恰是最需要熟练判断、你却因为长期不练而最生疏的时刻。 就像一个开了十年自动驾驶的司机,突然被要求在暴雨天接手方向盘。

把三条叠起来,结论就出来了:「人在环里」不等于安全。如果人看不懂、没时间细看、或者只扫一眼就点通过,那个确认只是一枚橡皮图章。

那怎么办?四条可以今天就改的做法

第一,把「人在环里」改成「人在关键处」。 行业里现在会区分两种姿势:human-in-the-loop(人在环内,智能体停下来等你批)human-on-the-loop(人在环上,智能体自己跑,你在旁边看着、随时能叫停)。前者像手把手教新人写每一封邮件,后者像你让他先发着、但重要客户的必须先给你看。

要求每个动作都批准,等于取消了自动化本身的意义,最后多半退化成橡皮图章。

正确的做法不是加更多闸门,而是让闸门更少、更重。 具体怎么分?回到 E1 那个四象限:不可逆的动作进闸门,可逆的动作放行。 发送、发布、付款、删除、对外沟通——这几类进闸门;改草稿、整理、分析、生成候选方案——这几类放行。

第二,把判断前置成策略,而不是逐次决定。 与其在每个弹窗前重新想一遍,不如提前写一张清单:「这几类事必须问我,其余你自己定。」 这张清单承载了你的判断,而且是可复用的——它让你的判断力在规模上生效,而不是在疲劳中损耗。

第三,要求界面给你判断所需的东西。 一个合格的确认请求应该包含三样:它打算做什么(计划)、会造成什么改变(差异对比)、依据是什么(证据)。选择智能体产品时,这是我认为比「用了什么模型」更值得看的一条:它是让你看着确认,还是让你盲着确认? 如果只能盲着确认,这个产品的「人在环里」是装饰品。

第四,给自己设一道减速带。 针对不可逆的动作,养成一个动作习惯:点确认之前,先用一句话说出「如果这一步错了,会怎样」。 说不出来,就说明你没在判断——那就别点。这句话大概花你五秒钟,但它做的事很关键:把一个无意识的反射,重新变回一个有意识的判断。

一个必须说的补充:为什么这道防线撤不掉

有人会问:技术进步不能解决这个问题吗?

短期内不能,原因是结构性的。提示注入(prompt injection)——把伪装成指令的文字藏在网页、邮件、文档里,骗智能体做它不该做的事——至今没有根治方案。打个比方:这就像有人在你交给助理的一沓资料里,夹了一张假的便签条,上面写着「顺便把这份名单发到这个邮箱」。助理照做了,因为他分不清哪张纸是你写的、哪张纸是别人塞的。

2025 年 6 月披露的 EchoLeak(漏洞编号 CVE-2025-32711)是个标志性案例:它被安全研究者视为零点击提示注入在生产级 AI 产品中的首例——用户什么都不用点,助手在例行帮你总结邮件的过程中,就可能把公司内部文件传给外人。(微软自己把它评为最高危一档;不同漏洞库给的分数不完全一样,但性质没有争议。)

前沿厂商在这件事上是坦诚的。OpenAI 在 2026 年 2 月给 ChatGPT 推出「锁定模式」时明说:联网场景下的这类风险,行业现有的缓解手段还没能完全解决,所以干脆用限制外部连接的办法来降低外泄。Anthropic 公开的测试数据也说明了攻防量级——他们的浏览器智能体在防护介入前,被这类攻击得手的比例接近三成;加了针对性训练和拦截之后压到了半个百分点左右。这是了不起的工程成果;但半个百分点不是零,而且这是他们自己的测试环境,不等于你日常上网的概率。

所以那道人类的防线撤不掉。它只能被重新设计成一道人真的看得懂、也真的会看的防线。

五、人和智能体:不是取代,也不是工具

最后聊一件更长期、也更个人的事。

前面提到微软和 CMU 那项研究里的三个位移——从收集信息到验证信息、从解决问题到整合答案、从执行任务到监督执行。这三句话精确地描述了我自己这一年工作方式的变化。

位移本身是中性的:你的价值从「做」转移到了「判断做得对不对」。 从职业角度看这甚至是升级——判断力的市场价格一向高于执行力。

但它有个前提,而这个前提正在被悄悄侵蚀:判断力是练出来的,而练它的方式恰恰是自己动手做。 你不再写第一稿,几年后你还认得出好的第一稿吗?这就是「自动化的讽刺」在个人层面的版本。

我没有标准答案,但有三个自己在守的习惯:

一,接到任务先自己想三十秒再问它。 不为效率,为的是在被它的答案锚定之前先有一个属于自己的判断——哪怕很粗糙。有了自己的版本,你才是在比较;没有,你就只是在接受

二,定期挑一件事完全不用它做。 一个月一次就够。这不是复古情怀,是校准:你需要知道自己现在的水平,而不是你和它加起来的水平。

三,永远保留说「不」的余地。 它给的方案听起来都很有道理——流畅是它的强项。但**「有道理」和「适合这件事」是两回事**,后者需要一些它不掌握的信息:你的处境、你的关系、你真正在意什么。

关于关系,我最后的判断是这样的:它不是同事,因为它不承担后果;也不是工具,因为工具不会自己走五十步。 它更像一个能力极强、执行飞快、但没有常识包袱、不会主动喊停、也不会「感觉不对劲」的新同事——而在这段关系里,「感觉不对劲」这件事,只能由你来做。

六、回到那三秒钟

开头那个弹窗,现在我们可以重新看一遍了。

它之所以让你为难,不是因为你不够认真,而是因为它把一个本该在别处解决的问题,塞进了三秒钟里——该在委托时想清楚的边界(E1)、该在装备时限死的权限(E2)、该在护航时设好的卡点(E3),全都没做,最后一股脑压在了那个「允许 / 拒绝」上。

协作的质量,不取决于你在弹窗前多犹豫,取决于你在弹窗出现之前做了多少事。

三条带走的结论:

  1. 你的位置在首尾,不在中间。 任务开始前把目标、边界、材料、验收写清楚(四行就够);任务结束后独立验证。中间那几十轮,你既插不上手,也不必焦虑。
  2. 闸门要少而重。 不可逆的动作进闸门,可逆的动作放行;点确认之前用一句话说出「错了会怎样」——说不出来就别点。
  3. 责任不会跟着任务一起交出去。 它不承担后果,你承担。所以「感觉不对劲」这件事,只能由你来做。

一页记忆卡再放一次:委托看可逆,装备要精简,护航设卡点,验收不免检,沉淀能复利。

模型会一代代变强,这一点不用你操心。但怎么把活儿委托清楚、怎么在它能干的同时守住自己的判断——这是它替不了你的部分,也是这个时代真正稀缺的能力。

本文引用的主要来源

  • METR,Measuring AI Ability to Complete Long Tasks / Time Horizons 系列(metr.org)——时间跨度按 50% 成功率计,任务以软件、机器学习、网络安全类为主
  • Sierra Research,τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains(arXiv:2406.12045)——pass^k 指标与一致性数据
  • OWASP,Top 10 for Agentic Applications 2026(genai.owasp.org)——智能体的工具滥用、提示注入、权限与身份类风险
  • NIST,AI 600-1 生成式 AI 风险管理框架——自动化偏见、过度依赖与拟人化
  • Microsoft Research & Carnegie Mellon University,The Impact of Generative AI on Critical Thinking(CHI 2025,319 名知识工作者 / 936 个使用实例,自述式调查)
  • Lisanne Bainbridge,Ironies of Automation(1983)——「自动化的讽刺」
  • Gartner,2025 年 6 月关于 agentic AI 项目取消率的预测(预测,非已发生的统计)
  • CVE-2025-32711(EchoLeak)公开披露;OpenAI 2026 年 2 月 Lockdown Mode 说明;Anthropic 浏览器智能体安全测试公开数据

说明:本文中标注为「我的判断」「我认为」「我的总结」的部分是观点,其余为可追溯的公开信息。所有数字都带着它自己的适用范围,本文尽量在正文里写明了;研究结论随时间更新,引用时请回到原始来源核对最新版本。

下一篇预告《一个人,怎么带一支智能体团队》——子智能体、多智能体、任务编排、Grok Bot 这类「常驻 AI 同事」到底怎么回事,什么时候该上、什么时候纯属给自己找麻烦。