Skip to content

A

深入浅出聊 AI:能干活的助理

深入浅出聊 AI

#技术#智能体#AI 安全

内容概要

模型是一颗只会运算的 CPU,不是会思考的大脑。智能体的诞生,是行业照着裸机的四处缺口——没有存储、不知道外面、输出没校验、没有外设——一个部件一个部件装出一套操作系统(harness):工具、记忆、检索、验证、调度、规划、权限。少了哪一块,任务就一定会在某个环节翻车,这是结构问题,不是运气问题。

你交代一句话:「调研三个竞品,写一份对比摘要,存到项目文件夹里。」然后你去开会。四十分钟后回来,文件已经在那儿了——它自己上网查了、自己读了,中间发现有份材料的数据没标来源,还单独补查了一轮,最后连文件命名都按你平时的习惯来。

两年前这是不可想象的。那时候的 AI 能把摘要写得很漂亮,但「查」「存」「放进哪个文件夹」这些活儿,一件都干不了。而到了 2026 年,这类能替你动手的产品已经遍地开花:有开源的,有大厂做的,有装在你自己电脑上的,也有常驻在云端、你合上笔记本它还在干的。行业管这类东西叫智能体(Agent)

上一篇我们讲过对话类产品身上打的六块补丁——先查再说、让它记住你、多想一会儿、自我检查、门卫、按题分派——也讲到这些补丁的尽头正是智能体。这一篇就接着往下讲:同样叫 AI,为什么去年那个只能陪你聊,今年这个敢接下整件事?多数人的第一反应是「模型更聪明了呗」——这个直觉很自然,但会把你带偏。这篇文章想说清楚一件反直觉的事:

决定一个 AI 能不能干活的,往往不是那颗芯片本身,而是芯片外面那套操作系统。

这句话不是修辞。下面我会用一整篇的篇幅,把这个类比拆开讲清楚——为什么把大语言模型理解成一颗 CPU 比理解成一个「大脑」更准确,一台只有 CPU 的裸机缺什么,以及行业是怎么照着这些缺口,一个部件一个部件给它装出一套操作系统的。这套系统在行业里有个名字,叫 harness(挽具),你不需要记住这个英文词,但值得花十分钟跟我把它拆一遍。

拆完你会拿到两样东西。一个是很干净的答案:从「会说」到「能做」,中间隔的不是智力,是两样具体的部件——手,和心跳;另一个是一把尺子,用来量市面上那些都自称「智能体」的产品,到底哪个真能替你办事。

一、模型是一颗 CPU,不是一个大脑

先纠正一个很流行、但会误导人的说法:把大语言模型比作「大脑」。

这个比方之所以危险,是因为「大脑」这个词自带一堆你不该给它的属性——会思考、会记事、有意图、能主动。可这些它一样都没有。更贴切的比方是:模型是一颗 CPU。

一颗 CPU 的本事非常明确,就是运算:给它一段输入,它按照内部的规则算出输出,速度极快,能力极强。但也仅此而已——它不记事,不知道外面的世界发生了什么,不会主动做任何事,更碰不到任何东西。你把一颗顶级 CPU 单独摆在桌上通上电,它什么也干不了。

模型的处境几乎一模一样。它接收一段文字,算出下一段最可能是什么,然后接下去。这项能力强得惊人,但它同样带着四处「裸机」式的不足——注意,这不是哪一款模型的毛病,而是「只有运算单元」这件事本身的必然结果。

第一,它没有存储,算完就忘。 你告诉它你叫什么,它回答了,这句话在下一轮就不存在了。你之所以觉得聊天是连贯的,是因为有什么东西在每一轮悄悄把之前说过的话原样端回去给它重看了一遍。行业里管这个特性叫无状态(stateless)——就像一台没有硬盘的机器,每次开机都是一张白纸。

第二,它不知道外面的世界。 训练在某个时间点截止,之后发生的事对它是一片空白:今天的会议、这周的汇率、昨晚的邮件,它统统不知道。你的姓名、公司、上周交代过的偏好,它也没见过。这就像一台没接网线、没插 U 盘的机器,只能用出厂时装进去的那些东西。

第三,它的输出没有校验。 它的本职是算出「接下来最像样的一段话」,而不是核实这段话是不是真的。所以它可能给你一个格式完美、听起来无懈可击、但根本不存在的数据,而且语气和答对的时候一模一样。自信和正确,在它身上是两件被无意焊在一起、其实毫不相关的事。

第四,它没有外设。 它能写出一封漂亮的邮件却发不出去,能算出一个数字却改不了你的表格,能列出该做的三件事却一件都做不了。它的全部产出,只有文字。

把这四条并起来看,结论就很清楚了:模型强的是算力,缺的是把算力变成生产力的那一整套周边。 而这套周边有个我们都很熟悉的名字——操作系统。

二、装操作系统:照着缺口一个个补

一台裸机要变成能用的电脑,靠的从来不是换一颗更强的 CPU,而是装上一套操作系统,再接上内存、硬盘和外设。智能体的诞生过程,几乎是同一件事的重演:照着上面那四处缺口,一个部件一个部件往上补。

补「没有存储」,装上内存和硬盘。 既然模型每轮都是失忆重启,就得有人负责在每一轮开始前,把它这次需要知道的东西重新摆到它面前。这件事分两层:这一次任务里发生的事叫短期记忆,相当于内存,用完就清空;跨越很多次任务都要记住的东西——你的偏好、项目背景、你纠正过它的地方——叫长期记忆,相当于硬盘,存在别处,用到的时候才被读进来。你觉得「它越来越懂我了」,其实不是它变懂了,是有人替它建了个档案柜。

补「不知道外面」,接上网线。 模型自己不知道的事,与其让它凭语感编一个,不如让它先去查,再基于查到的东西回答。这就是为什么一个设计良好的智能体遇到不确定的事,第一反应是「去看一眼」而不是「凭印象说」。

补「没有外设」,装上驱动和接口。 系统把「搜索」「读文件」「发邮件」「跑代码」「改表格」这些真实动作,包装成模型能调用的接口。模型自己动不了手,但它可以在文字里写一张申请单——「我要用搜索工具,关键词是……」——由外面的系统真的去执行,再把结果喂回来。这是模型第一次真正触碰到现实世界,也是「手」的由来。

补「输出没有校验」,加一道质检。 既然自信和正确没有必然关系,就不能让它嘴上说一句「完成了」就算数。得有另一层机制去核对:文件是不是真的生成了、数据是不是真的改了、结果跟材料对不对得上。这一层的关键在于它不受模型自我感觉的影响——就像内存校验位不会因为 CPU 觉得自己算对了就放行。

补到这里,这台机器已经能记事、能上网、能动手、能被核实了。但它还差最关键的一个部件——调度器

现实任务很少一步到位。你让它「调研三个竞品」,它得先搜索、再阅读、再判断信息够不够、不够再搜一次、够了才动笔。这需要一个不停转的循环:想一步、做一步、看结果、再想下一步,直到任务完成或者卡住需要人来拍板。这个循环就是整套系统的心跳,也是操作系统里调度器所干的事——决定这一刻该执行哪个动作,执行完了再看情况安排下一个。心跳值得单独讲,第四节会慢放一遍。

心跳转起来之后,还有两个部件是「锦上添花但绝不能少」的。一个是任务管理:得有人说清楚什么时候算完,否则循环会一直转下去——「调研一下」这种话本身没有终点,只有「找出三个竞品、各列三条优势和价格、写成一页摘要」这种话才有。另一个是规划:步骤明确的活儿(把 50 份合同的甲方和金额填进表格)可以走一条固定流程,稳当高效;步骤说不准的活儿(「查一下这个月销量为什么掉了」)则需要它边查边决定下一步,路径是在干的过程中长出来的,不是提前写死的。

最后一个部件最容易被忽略,却决定生死:权限系统。一旦模型真的有了手、能改现实了,出错的代价就从「说错一句话」变成了「真的做错一件事」。所以系统里必须有一层单独的规矩——什么能碰、什么必须经人批准、有没有留痕、能不能叫停、能不能撤销。这一层绝不能指望模型自己「有分寸」,因为它没有分寸,它只是在概率地算下一个词;真正的约束必须写在模型碰不到的地方,也就是权限和工具那一层。

把这些部件摞起来——工具(外设)· 上下文与记忆(内存与硬盘)· 检索查证(网线)· 验证(质检)· 循环(调度器)· 目标与规划(任务管理)· 权限与护栏(权限系统)——就是 harness 的全部家当。它们不是随手列的清单,而是照着那四处缺口的形状反推出来的必需品:少了哪一块,某类任务就一定会在某个环节翻车,这不是运气问题,是结构问题。

Seven Parts of a Harness

这个类比还戳破了一件常被营销话术模糊掉的事:harness 不是一个「更懂事的伙伴」,它是基础设施。 操作系统不会让电脑更聪明,它只是让 CPU 的算力变得可用、可控、可协调;同理,harness 也不会让模型更会推理,它只是让模型的推理能力变得能被安全、持续地用起来。一台顶级 CPU 装了一套稀烂的操作系统照样卡顿死机;一个顶尖模型配了一套粗糙的 harness,照样在第五步就翻车。

From Bare CPU to Agent

三、这个类比在哪儿会失真

任何类比都有失真的地方,这个类比也有三处需要你留个心眼。

第一,调度的复杂度不一样。 真实的操作系统通常要同时伺候好几个并发程序,而一个智能体的 harness 大多数时候只服务当前这一件事,调度问题没那么复杂。

第二,操作系统不管对错,harness 得管。 真实操作系统不太关心「这个程序算出来的结果对不对」,它只负责让程序跑起来;但 harness 里专门有一层验证机制去核实结果是否属实——这更像是在操作系统之上又叠了一个质检部门,现实电脑里没有精确对应的部件。

第三,也是最根本的一点:CPU 是确定性的,模型是概率性的。 同样的输入,CPU 永远算出同样的输出;而同一个问题问模型两次,答案可能不一样。这正是 harness 要花大力气做错误处理和证据核验的原因——面对一颗规规矩矩的 CPU,真实操作系统根本不用操心这些。

记住这三点边界,这个类比就不会被神化,同时它依然是眼下帮你建立直觉最好用的一张图。

四、心跳怎么跳:调度器转一圈是什么样

循环值得单独慢放一遍,因为它是「聊天」和「干活」之间最硬的那条分界线。

行话叫「想 — 做 — 看」(业内也称 ReAct,推理—行动—观察),说白了就是三件事不停轮转:想一下该干什么,真的去做一步,看看做完之后现实变成什么样了,再基于新看到的情况想下一步。如此往复,直到任务完成或者需要人来拍板。

还是拿「帮我调研三个竞品,写一份摘要」走一遍。系统先把任务、能用的工具、已有的背景信息打包交给模型;模型想「我得先搜这三家的资料」,于是申请调用搜索工具,系统真的去联网查,把结果原样喂回来;模型读完三篇报道,发现其中一篇提到的关键数据没有来源,于是又想「这条我得单独核实」,再搜一次。这样反复几轮,直到它判断资料够了,动笔生成摘要、存好文件——目标达成,循环停下。

这里有个特别容易被忽略、却决定成败的细节:第二步到第三步之间的那两个动作,是聊天机器人根本没有的。 聊天机器人只做「想」和「说」;智能体多出来的「做」和「看」,才是它区别于聊天的地方——它不是在猜下一句该说什么好听的话,而是真的执行了一个动作,再把这个动作在现实里造成的结果重新纳入自己的判断。

也正因为多了「看」这一步,循环成了最容易出岔子的地方。假如某一轮系统没有真的把结果看清楚——比如工具返回了一整个网页,模型图省事只扫了标题就以为读完了,然后顺着标题里的错误信息继续往下走——这就是「没真看却以为看过了」,而它自己完全不知道,会带着错误的判断一路走下去。 这也是为什么后面要专门讲「别只信它说完成了,要它拿证据」:循环这一环,从设计上就容不得「自我报告」当真相。

记住这个循环。前面讲的每一个部件,都是围着让这颗心跳跳得准、跳得稳而存在的:工具让「做」有内容可做,记忆和上下文让「想」有材料可想,验证让「看」看得清楚,权限保证心跳失控时能被叫停。

The Heartbeat Loop

五、那它到底革命在哪

机制讲完了,我想再花一节讲一个更大的问题,因为它决定了你该用多认真的态度对待这件事:这轮智能体热潮,到底是又一次工具升级,还是真的有什么根本不同?

我的判断是有三件事被永久改变了。而且要特别注意:革命性不在「它变聪明了」这一层,恰恰相反,它在「接口」这一层。

第一件,能力的边界从「生成文字」跳到了「改变世界的状态」。 聊天机器人的产出永远停在一段文字上,中间那段把文字变成结果的活儿还是你干的——复制、粘贴、微调、发出去。智能体跨过了这条线,它的产出不再是文字,而是外部世界某个状态的改变:文件真的生成了、邮件真的发出去了、表格真的被改了。这一步跨过去,性质就变了——「AI 有用」这件事第一次可以被直接衡量,不是「它写得像不像样」,而是「这件事办没办成」。

第二件,软件第一次开始适应人,而不是人适应软件。 这一条我认为最被低估。过去三十年,我们用软件的方式没变过:软件定好一套操作方式,你去学它——学 Excel 的函数、学 CRM 的字段、学审批系统的按钮在哪,每一个软件都要你交一笔学费,而且这笔学费不能跨软件复用,你会用这家的报销系统,换一家还得重学。智能体反过来了:你说「把这个月的发票整理成报销单」,它去学那个系统怎么用,中间那层「人类学习软件」的成本第一次有了被压缩的可能。

这也解释了一个看着不起眼、实际很关键的现象——这两年真正引爆的智能体产品,往往不是能力最强的那个,而是把门槛降到最低的那个:把它从黑乎乎的命令行搬进一个窗口,或者做成装上就能用的样子。因为它们减掉的正是那笔学费,让一个不写代码的人,第一次拥有了一个真的会替他动手的东西。软件正在从「一套你要学会的操作」变成「一个你可以交代的对象」,这是交互范式的变化,而交互范式的变化,历史上每一次都比功能变化影响更深远。

第三件,协作关系第一次可以「复利」。 传统软件的价值曲线是平的,你今天用 Excel 和三年后用 Excel,它对你的了解都是零。智能体有记忆,你纠正它一次「我们的报告永远先结论后论据」,写进长期记忆,以后每次都省一遍——用得越久,它越贴合你,这是一条向上的曲线。由此还能推出一个很实际的判断:评估一个智能体不能只看第一天好不好用,要看第三十天,一个第一天惊艳、但什么都记不住的产品,长期价值可能不如一个第一天平庸、但会积累的。

说完这三条,必须泼一点冷水,因为热潮里最贵的错误,是把革命放错了层。革命发生在接口层,不在智能层:那颗 CPU 还是那颗 CPU,它还是不知道外面、还是会自信地说错、还是概率性的,变革的只是它周围那套让它能动手的系统。

这意味着两件事。一是模型的老毛病一个都没消失,只是换了个出现的位置——以前它编造一个数据,你一眼能看出来;现在它可能误判一个进度,真心以为自己做完了,而你没看见过程。二是能力越强,越需要有人看证据、设边界、保留叫停和撤销的能力:把活儿交给它,不代表把判断和最终的责任也一起交了出去,署你名字发出去的东西,出了事还是你的事。

这不是给热潮泼冷水,恰恰相反——看清楚革命发生在哪一层,你才知道自己该在哪一层用功。

六、为什么同一个模型,两个产品天差地别

有了前面这把尺子,一个常见困惑就能解释了。

我们习惯用「用了什么模型」来评判一款 AI 产品,但在智能体这件事上,这个直觉尤其不可靠——因为骨架之间的差距,比模型之间的差距大得多。

放回操作系统那个类比就很好理解:决定一台电脑好不好用的,从来不只是 CPU 主频,很大程度上是操作系统。同一颗芯片,装一个臃肿卡顿的系统和装一个精简流畅的系统,体验可以天差地别。模型也一样——同一颗 CPU,配一套编排混乱、验证形同虚设的骨架,和配一套心跳规律、质检到位的骨架,交付结果可能一个能用、一个不能用。工程界也反复观察到这一点:不换模型、只重做外面那套系统,同一个智能体在评测上的名次就能前进一大截。

这就是为什么市面上「套个对话框就敢自称智能体」的产品那么多,真正能稳定干活的却没几个:差的往往不是那颗 CPU,是 CPU 外面那套操作系统。 那怎么分辨?下一节就讲这个。

七、怎么选一款适合自己的智能体

这一节是我认为本文最实用的部分。市面上的产品每周都在变,所以我不给推荐清单——给你判据,判据的保质期比产品长得多。

第一步,先问自己三个问题,而不是先看产品。

我想让它动哪些东西? 只读资料、整理信息、写草稿,还是要它真的改文件、发消息、操作系统?这一条决定了你需要的操作系统有多厚,也决定了后面所有的取舍。很多人的真实需求其实停在第一类,却按第二类去挑产品,结果买了一堆用不上的风险。

这些动作错了,能不能撤销? 改草稿可逆,发邮件不可逆。不可逆的动作有多少,决定了你对权限那一层的要求有多高。

我愿意让它看见多少? 这是最容易被跳过、却最该先想的一条。智能体的能力上限,取决于你让它看见和摸到什么;但你让它看见的每一样东西,也同时进了它的活动范围——合同、客户名单、财务数据、你的邮箱。你愿意开到哪一层,直接决定了你该选哪一类形态。

第二步,认清四类形态,各有各的代价。 它们没有优劣,只有取舍:

形态 代表 优势 代价
对话产品加了工具 主流 AI 助手的联网、读文件功能 零门槛,随手可用 严格说还不算智能体——没有连续的心跳,干不了长活儿
本地自建 开源的自建智能体 数据在自己机器上,可改可控,按用量付费 要折腾,出了问题自己修
桌面应用 装在电脑上的智能体客户端 不用敲命令,装上就用 能力受产品设计限制
云端常驻 住在云端、能自动开工的那一类 最省心,关了电脑还在干 数据和登录态在别人的机器上,订阅成本高

这张表最关键的一列是「代价」。我的建议是沿着「你愿意让它看见多少」这条线来选,而不是沿着「谁的功能多」那条线。一个具体的判断:如果你处理的是客户资料、合同、未公开的财务数据,那么「数据在哪台机器上」这个问题,优先级高于任何功能对比。

第三步,用七个问题量它的骨架。 这七个问题不需要你懂技术,但足以把「真智能体」和「高级聊天框」分开,问销售或者自己试十分钟就行:

  1. 它有没有心跳? 能不能自己连续做多步——查完一步、看到结果、再决定下一步,还是问一句答一句?
  2. 它能不能叫停? 跑到一半我按停止,它真的停吗?停了之后干到哪一步还在不在?
  3. 它能不能回退? 它改错了东西,有没有办法撤回到之前的状态?
  4. 我能不能看见它干了什么? 有没有一份可查的动作记录——用了什么工具、查了什么、改了什么。这是最能区分产品扎实程度的一条。
  5. 权限分不分级? 是所有动作一视同仁,还是「发送、付款、删除」这类会单独拦一道?
  6. 它给我的确认框,有没有给我判断所需的信息? 是「是否允许?」,还是「我打算这样改,这是改动前后的对比」?只让你盲着点同意的产品,它的安全机制是装饰品。
  7. 它记不记得住? 我教过它的规矩,下周还算不算数?记忆能不能看、能不能改、能不能删?

七个问题里,如果第 1、2、4 有任何一个答不上来,那大概率不是智能体,是个套了工具的聊天框。

如果只能记一句,记这句:先看它敢不敢让你看见,再看它肯不肯让你叫停,最后才看它能干多少活。 理由很简单——能干多少活是产品迭代最快的一项,几个月就变;而「可观察、可叫停」是设计哲学,一开始没有,后面很难补上。

最后提一句成本。智能体按「干了多少活」计费,而不是按「你用不用」,这意味着一个反直觉的现象:用得越顺手,账单涨得越快。 而且很多浪费是隐性的——一个没说清楚目标的任务,它可能自己跑五十步;一个塞满了无关材料的上下文,每一轮都在为你不需要的东西付钱。所以选型时多问一句:它有没有让我看见「这次花了多少」?一个连账都不给你看的产品,你没法管理它的成本。

八、回到「上手」这两个字

开头我们问:为什么一个 AI 只能陪你聊,另一个却能替你跑腿?

现在答案清楚了。区别不在于哪颗芯片更聪明,而在于芯片外面有没有、以及装了多完整的一套操作系统——那套帮它补上「没有存储、不知道外面、输出没校验、没有外设」这四处缺口的系统,让它能记事、能上网、能动手、能被核实,出事还能被叫停。所以下次再有人跟你吹「我们用了最强的大模型」,你可以多问一句:那它外面那套系统,是怎么调度、怎么管权限、怎么核实结果的?

三条带走的结论:

  1. 别只问「用了什么模型」,要问「外面那套操作系统怎么搭的」。 一个用普通模型但骨架扎实的产品,完全可能比一个堆了最强模型、连权限都管不利索的产品更让你放心。
  2. 选型先看可观察、可叫停,再看能干多少活。 前者是设计哲学,后者是迭代速度——后者会追上来,前者不会。
  3. 革命发生在接口层,不在智能层。 CPU 的老毛病一个都没消失,只是换了个出现的位置;能力越强,越需要有人看证据、设边界。

CPU 会一代代变强,这一点不用你操心。但怎么给它配一套对的操作系统、怎么把活儿委托得清楚、怎么在它能干的同时守住自己的边界——这才是真正属于你的能力。

下一篇我们就聊这件事:一套叫 5E 的方法,讲清楚活儿该怎么交出去、过程中在哪里看一眼、结果怎么验收——以及那个几乎所有人都在犯的错:为什么你点的那些「允许」,正在悄悄失效。

本文引用的主要来源

-「模型是 CPU,harness 是操作系统」类比及 harness 组件拆解:整理自 2026 年多篇 agent harness 工程分析,各家拆法略有出入

  • 想 — 做 — 看循环(ReAct,推理—行动—观察):该范式的公开研究与工程实践
  • 四类智能体形态(对话产品加工具 / 本地自建 / 桌面应用 / 云端常驻):2026 年公开产品信息归纳 -「只改骨架不改模型即大幅提升排名」的工程案例:公开报道,具体榜单与名次以原文为准

说明:本文中标注为「我的判断」「我认为」的部分是观点,其余为可追溯的公开信息。文中涉及的产品均只作为形态举例,不构成推荐;这一领域变动很快,请以你使用时的官方信息为准。