Skip to content

A

深入浅出聊 AI:模型之外

深入浅出聊 AI

#技术#AI 素养#大语言模型

内容概要

模型是发动机,产品是整车。ChatGPT 之后四年,行业照着模型的四处天生不足——不认识你、没有记性、自信地说错、没有手——一层层往外搭脚手架:先查再说、让它记住你、让它多想一会儿、自我检查、加道门卫、按题分派。这六块补丁的尽头就是智能体,也是下一篇要讲的东西。

关于 AI,你大概同时听过两套完全相反的说法。一套说它靠不住,会一本正经地编,会把不存在的数据说得有鼻子有眼;另一套是你自己的体感——昨天你让它查一个行业数据,它给了三个带链接的来源,前天你问了件它不清楚的事,它老实说「我不太确定,你再核实一下」。

这两套说法都是对的,而它们之间的落差里藏着一件很关键的事:你每天打交道的,不是模型,是产品。

这篇文章就想把「模型之外」的那一层讲透,读完你手上会多一把尺子:面对满屏的 AI 产品,知道怎么判断哪一款适合你。先说清楚边界——这一篇讲的是对话类产品,从 2022 年底的 ChatGPT 到今天你手机里那些能聊、能查、能写的 App;那些能自己动手办事的「智能体」,是下一篇的主角,而这条线为什么划在这儿,第四节会说明白。

一、发动机和整车

先把两个东西分开,后面所有事情才说得清。

模型是那台发动机。ChatGPT、Claude、Gemini、豆包、千问、DeepSeek 背后的那个东西,本质上是一个文字预测引擎:根据前面的文字,算出下一小段最可能是什么,然后接下去。而产品是整车——你打开的那个 App,是模型加上外面一整套东西:系统指令、检索工具、记忆、安全策略、界面,还有一堆你看不见的判断逻辑。

发动机决定动力上限,但一辆车好不好开——安不安静、刹不刹得住、下雨天会不会打滑——大部分由发动机之外的部分决定。而模型这台发动机,有四处天生的不足;这不是哪一款模型的毛病,是「文字预测引擎」这个东西本来的样子。

第一,它不认识你,也不知道「现在」。 你的姓名、公司、上周交代过的偏好它没见过;训练在某个时间点截止,之后的事对它是一片空白,这个时间点叫知识截止日(knowledge cutoff)

第二,它没有记性。 你告诉它你叫什么,它答应了,这句话在它「脑子」里下一刻就不存在了;你之所以觉得聊天连贯,是因为有什么东西在每一轮悄悄把之前说过的话原样端回去给它看一遍。这个特性叫无状态(stateless)——你以为的「对话」,在它那里其实是一次次独立的、全新的阅读理解题。而它每轮能同时看见的文字总量有上限,这个上限叫上下文窗口(context window),可以想成一张有限大的写字台。

第三,它说错的时候,和说对的时候一样自信。 它的本职是接一段像样的话,不是核实真假,所以可能编出一个格式完美、听起来无懈可击、但根本不存在的数据。这通常叫幻觉(hallucination),不过我更喜欢美国国家标准与技术研究院用的那个词——confabulation,虚构:它不是偶发故障,是在不知道的时候把空白补成了一个听起来合理的故事,是这套机制的必然产物。

第四,它没有手。 它能写出一封漂亮的邮件但发不出去,能算出一个数字但改不了你的表格。它的全部产出,只有文字。

从 ChatGPT 上线那天起,整个行业做的事,就是照着这四处不足往上补。

Engine vs. Product

二、从 ChatGPT 到现在的进化史

这段历史值得完整看一遍,因为它不是一串产品发布会,而是一条很清晰的逻辑线:每一步补的都是上面那四处不足,只是补的位置越来越靠外。

2022 年底到 2023 年,补的是「不知道现在」。 ChatGPT 在 2022 年 11 月上线,两个月用户破亿。它引爆的原因其实不是模型新——底子早就有了——而是产品层做对了一件很小的事:把它做成一个聊天框。在那之前,同样的能力藏在开发者接口后面,普通人碰不到;产品形态决定了一项技术能不能被用起来,这件事本身就是本文的主题。但那时候的它博学却活在过去,你问它今天的汇率,要么说不知道,要么编一个。于是 2023 年 2 月起联网搜索进入产品,3 月 ChatGPT 上线插件(后来被淘汰,但方向留下来了),同月 GPT-4 发布,能看图,推理也明显变强。关键词是「接上外面的世界」——AI 从背书的学生变成了能查资料的学生。

2023 年底到 2024 年,补的是「看不多、记不住」。 短板暴露得很快:上下文窗口太小,一份三十页的合同它读不完。于是 2023 年 11 月上下文窗口涨到十几万词元,2024 年 2 月 Gemini 推到百万量级,一次能读完一整本书;中国这边 Kimi 靠超长文本打开局面。同期 GPT-4o 让实时语音和图像成为日常功能,记忆功能开始普及,回答也开始带引用链接——最后这一步看着不起眼,其实是可信度的分水岭。关键词是「上下文变大,而且开始记事」。

2024 年底到 2025 年,补的是「想得太浅」。 它答得太快,一口气往下接话,遇到需要多步推演的问题就容易接歪,像一个人不打草稿直接写答案。转折点是推理模型:2024 年 9 月 o1 系列第一次把「回答前先在心里演算一遍」做成产品能力;2025 年 1 月 DeepSeek 发布 R1 并把权重开源,证明了这种「会思考」的能力不是只有极少数公司烧得起钱才做得出来,从那之后前沿能力的可得性完全变了。同年「深度研究」类功能出现,给它一个题目,它自己查几十个网页交一份带出处的报告。关键词是「慢下来,多想一步」——行业的进步重心也从「把模型造得更大」转向了「让模型在答题时多花点算力」。

2025 年底到 2026 年,补的是「没有手」。 AI 开始能看着屏幕点按钮、填表格;一个叫 MCP 的接口标准被广泛采纳并交给中立基金会托管,相当于给 AI 定了一个「USB 口」;到 2026 年智能体全面爆发,从开源项目引发的装机热,到大厂的桌面办公智能体,再到常驻云端、你合上电脑它还在干活的产品。关键词是「从说到做」。

四年下来是一条很干净的线:产品层做的从来不是让模型变聪明,而是照着它的短板一样一样往外搭脚手架。 而这篇要讲的对话类产品,就停在第三阶段的末尾。

三、今天的对话产品,身上装了哪六块补丁

把这段历史落到今天,主流对话产品身上大致有六块补丁。先说一句:没有一块补丁是免费的,所以下面每一块都连着它的代价一起讲。

先查再说。 系统先去搜索、去翻你上传的文件,把材料塞给模型,让它基于材料回答并标出处。行业里管这套叫检索增强(RAG),说白了就是把闭卷考试改成开卷考试——不让它凭记忆答,让它先翻书,还得告诉你翻的是哪一页。这是最有效的一块,讲究的做法还会加一道:没有材料支持的句子宁可不说。代价是慢和贵,更麻烦的是检索错了,答案会错得更理直气壮——因为它现在有「出处」了。

让它记住你。 产品把你的偏好、项目背景、纠正过的东西存在别处,用时取出来放进对话,所以你觉得「它越来越懂我了」。其实它没变懂,是有人替它做了笔记。代价是记忆会过期也会记错,而一条错误的长期记忆会在你毫无察觉的情况下污染后面每一次对话,比幻觉更难发现——因为它很稳定。

让它多想一会儿。 打开「深度思考」之后它会慢很多,因为它在回答前先把问题拆一遍、试几条路。代价是慢和贵,而且对不需要动脑的问题反而更差——想太久,简单问题也能被想复杂。

让它自己先检查一遍。 做法是生成多个候选挑最靠谱的,或者逐句比对材料把没依据的标出来。代价是成本翻倍,而且同一个模型倾向于认可自己的答案——就像自己校对自己写的稿子,错别字看十遍也看不见。

给它装个门卫。 产品在模型前后各放一道检查,看输入有没有攻击、输出有没有不该出的内容。这一层通常是独立的小模型或规则,不依赖大模型自己「有良心」——它没有良心,只是在算下一个词。代价是会误伤:你正当的问题被拒答,多半撞上了这一层。

按题分派。 产品内部通常不止一个模型,简单问题给便宜快的,复杂问题给贵的慢的——你在同一个对话框里问两句话,背后可能不是同一个模型。代价是分派会出错:一个看起来简单、实际很难的问题被分给了便宜模型,你就会遇到「它今天怎么变笨了」——它不是变笨了,是你换了个答题的人,而界面不会告诉你。

Six Patches on Every Chat Product

四、这些补丁的尽头,就是智能体

如果你了解过「智能体」(Agent),读到这里可能已经觉得眼熟:上面这六块补丁,和智能体骨架里的组件几乎是同一批东西——这不是巧合,它们本来就在同一条线上。行业里管智能体外面那套系统叫 harness(挽具),大致有七件家当:

骨架的七件家当 对话产品有吗
上下文与记忆
检索与查证
验证
护栏与权限 ✅ 弱版:只管它说什么,不管它做什么
目标与规划 🟡 半个:单轮之内会拆解,但没有跨轮的计划
工具与行动(手)
想 — 做 — 看的循环(心跳)

也就是说,对话产品有其中四件半,缺的正好是两件:手,和心跳——而这两件才是真正的分界线。

「手」意味着输出的性质变了。 对话产品的产出仍然是一段文字,写得再好也要你去复制、粘贴、发送;有了手之后,产出变成了外部世界某个状态的改变——文件真的生成了,邮件真的发出去了。「心跳」则意味着你可以不在场了。 对话是回合制的,每一轮你都在;而循环是它自己转的,想一步、做一步、看结果、再想下一步,反复几十轮,你不在中间那几十轮里。两件加起来,性质就完全变了:说错一句话和做错一件事,代价不在一个量级上。

所以本文的边界就划在这儿——你手机里绝大多数 AI App 都属于「补了大半套家当、但还没长出手和心跳」的那一档,它们再好用,本质上仍是一个会查资料、有记性、说话前会想一想的对话对象。这里有个让人安心的推论:这一类产品的错误代价基本停留在屏幕上,所以它正是学习 AI 最好的练手场——等你在这一层把判断建立起来,再去碰会动手的那一类,才不至于翻车。

五、走一遍:一个问题在产品里经过的六步

补丁分开看有点抽象,我们拿一个真实的问题走一遍。你打字:「我们这个行业去年的市场规模大概是多少?」按下回车之后,在你看到第一个字之前,大致发生了这些事:

第一步是分派。 系统判断这是个什么题,「要查最新数据」,那就得走检索,可能还要调用更强的模型。

第二步是组装桌面。 系统把这些东西摆到模型面前:你这句话、这轮对话的前文、它记着的关于你的背景(比如你提过你在新能源行业),还有一段你看不见的系统指令,比如「回答要给出处」,「不确定要说明」。注意这一步——你只打了十几个字,但模型看到的是一大堆东西。

第三步是去查。 模型不直接回答,先申请调用搜索工具,系统真的去联网,把找到的材料原样喂回来。

第四步是作答并带上出处,材料里没提到的部分,理想情况下它会说「这一点我没找到可靠来源」。第五步是过门卫,输出在给你之前还要过一道安全检查。讲究的产品还有第六步:把生成的每句话拿回去和材料比对,没依据的标出来或者删掉。

六步走完,你看到的只是最后那一屏字。这里有两件事值得注意。一是你能控制的比你以为的多——第二步里模型看到的东西有一部分来自你,同样这个问题,你说清楚「我指的是中国大陆市场、按出货量算、2025 自然年」,跟只说「我们这个行业」,得到的东西完全不是一个水平。很多人抱怨「AI 答得不准」,问题其实出在第二步。 二是出错可能在任何一步:分派把你分给了便宜模型、记忆里有条过期信息、搜到了一篇错文章、转述材料时走了样,而界面上什么都不会告诉你。

Six Steps Behind One Answer

六、补丁补不上的四个洞

讲完能补的,必须讲不能补的——否则这篇就变成了「放心用吧」,那是不负责任的。

检索解决「有没有依据」,不解决「依据对不对」。 它搜到的可能是一篇错误的报道、一份过期的数据,甚至另一个 AI 生成的内容,然后原样端给你,还配上引用格式——看起来比自己编的可信一百倍。

引用可以是真链接、假摘要。 链接是真的,网页确实存在,但模型对它的转述有偏差,甚至说了原文没有的话——你看到链接就放心了,而那正是最该点开的时候。我的做法很简单:关键数字和关键论断,链接必点,三十秒的事,挡掉绝大部分事故。

补丁越多,出问题时越难查——上一节那六步,你不知道是哪一步出的岔子。

最后一个洞原理上补不了:你自己验不动的事。 产品可以把证据摆到你面前,但没法替你判断这份证据对不对。所以有个很实用的分类:

这类活儿 补得怎么样 你该怎么用
有公开来源、你查得动 补得很好 放心用,链接要点开
有标准答案、能自动验(算数、代码、格式) 补得很好 放心用,让它自证
你手上有材料、它需要读 补得不错 放心用,材料别塞太满
对未来的判断、对你公司内部情况的推测 基本没补 当成观点,不是结论
冷门数据、非公开信息 查得到,但你验不动 ⚠️ 最危险的一档
需要你个人价值判断的事 不该补,也补不了 别问它该怎么选

倒数第二行风险最高:它给了你一个数字、给了一个出处,看起来完整可信,但那个出处你没有能力去核。「看起来可信」和「实际可信」之间,隔着的正好是你验不动的那一段。

七、五种活法:产品哲学的分野

那六块补丁是所有产品都在做的共同动作。但你一定感觉到了,同样打了这六块补丁,不同产品用起来差别还是很大——差别不在补得多少,而在于面对同一批取舍,各家站的位置不同。

我扫了一圈这几年真正跑出来的对话类产品,把它们归成五种活法,每一种都从四个角度看:它想成为什么(定位)、遇到取舍站哪边(设计哲学)、它看得见和碰得着什么(能力来源)、实际用起来强在哪弱在哪(表现)。

通用型,代表是 ChatGPT,中国这边是豆包。 它们不为特定场景设计,而为所有人的所有问题设计,遇到「要不要为专业场景牺牲通用性」的取舍时一律选通用;豆包更极致,把门槛降到几乎为零,很多人的第一次 AI 体验就是从这儿开始的。它是万金油,而万金油的价值恰恰在于你不用挑。

克制型,代表是 Claude。 这是我认为性格最鲜明的一家:在「有用」和「诚实」之间它明显偏诚实,不确定就说不确定,你的前提有问题它会直接指出来,而不是顺着你往下写——它的训练本身就围绕一套明确写下来的行为准则。它还开创了一个被低估的形态:把对话的产出变成一份可以直接编辑、直接拿走的东西,而不是让你从聊天记录里往外抠。代价是它拒绝得比别家多,有时一个正当的问题也要绕两句,这不是 bug,是它站位的代价。你要一个会说「这里不对」的合作者,还是一个什么都说「好的」的助手?这决定了你适不适合它。

溯源型,哲学是同一句「没有出处的话不说」,方向却相反,正好构成一对。 向外的是 Perplexity,它不做聊天机器人,做答案引擎,把搜索重做一遍:每一句结论都挂着出处,不追求跟你聊得开心,追求让你能顺着链接查下去;它的天花板是网上有什么,网上错的它也照样端过来。向内的是 NotebookLM,一个只读你交给它那几份材料的研究助理——大多数 AI 的默认动作是去整个互联网找答案,它反过来,材料里没有就说没有,而且每句话挂一个小标签,点一下跳回原文那一段。它还有个很妙的设计:能把一堆材料变成一段两个人对谈的音频,让你走路时把资料「听」完,解决的是「大部分人不是不想读,是没时间坐下来读」这个真实痛点。

打个比方,大多数 AI 像一个见多识广的朋友,你问什么他都能聊两句,但你不知道他哪句是真读过、哪句是听说的;NotebookLM 像一个只读了你那几本书的助理,他知道的少得多,但你问「这句在哪一页」,他翻得出来。当你要为自己写的每个字负责的时候,能溯源比知道得多重要一百倍。

生态型,代表是 Gemini、微软 Copilot,中国这边是千问。 它们不做新 App,而是长在你已经在用的东西里——搜索框、文档、邮箱、地图。哲学是分发即优势:赌的不是「我最聪明」,而是「你反正每天都要打开这个」。

它们真正的护城河在能力来源,分两层。看得见那一层:Gemini 能查航班、比价格、看酒店,因为它接的是自家的地图、航班、酒店数据。碰得着那一层:千问在 2026 年初打通了阿里的旅行和电商体系,能直接帮你订票下单。这一步的难点根本不在模型——一个 AI 要帮你订机票,得同时有三样东西:看得到实时库存和价格、有你的账号和身份、能完成支付,而这三样任何一个纯粹的聊天产品都拿不到,不是做不到,是够不着。就像请朋友帮你订票,他聪不聪明是次要的,关键是他手里有没有你的个人信息。

这一类里还有个特殊例子是 Grok,它的优势不来自生态,而来自它站的地方——长在 X 上,能直接看到实时的公开讨论流和社区批注,所以判断一条正在传播的消息真假时有先天优势:最有用的信号往往不是权威媒体的报道(那要等几个小时),而是此刻有多少人在质疑、有没有人贴出原始素材。这就像判断一家餐厅排不排队,你可以查点评,也可以直接站在门口看一眼——站门口那个人不需要更聪明。 生态型的共同代价是:一旦它能替你花钱,风险性质就变了,所以这类功能通常会设一道人工确认——那道确认不是麻烦,是你唯一的刹车。

开放型,代表是 DeepSeek 以及一批开源权重的模型。 它们不靠 App 赚钱,而是把模型本身放出来,谁都能下载、能改、能跑在自己机器上。2025 年初 DeepSeek 把一个对标当时最强推理模型的东西直接开源,意义不在于「谁更强」,而在于它改变了可得性。它最大的能力是「你可以把它搬回家」——这对普通用户看着抽象,但对处理客户资料、合同、未公开财务数据的人极其重要:本地跑的不出你的机器,调接口的要传出去,而这个差别的优先级高于任何功能对比。它卖的不是最好用的产品,是最低的门槛。

把五种活法并排放,就是下面这张表,四个维度和上面完全一致:

活法 定位 设计哲学 能力来源 表现(强 / 弱)
通用型 所有人的所有问题 先做大,再做精 覆盖最广、生态最厚 八成日常够用 / 没一项极致
克制型 较真的写作与思考伙伴 有用与诚实之间偏诚实 长文本与写作;产出可直接编辑 长文与推演手感最好 / 拒绝得多
溯源型 答案引擎 / 研究助理 没有出处的话不说 向外=全网检索;向内=只用你的材料 可溯源 / 向外受限于网上有什么,向内出了材料就不知道
生态型 长在你已有的工具里 分发即优势 看得见自家数据 + 碰得着账号与支付 能真办成事 / 出了生态只能建议
开放型 把前沿能力变成公共品 开放与成本优先 可本地部署,数据不出机器 性价比最高 / 产品打磨最弱

这张表里有两栏最容易被误读。「能力来源」说的不是品牌定位,而是两件很具体的事:它能看见什么数据,以及它能碰到什么系统——都不是聪明程度,而是位置带来的结构性差异。「设计哲学」则是「性格」的来源:有用、无害、诚实这三件事会互相打架,越追求无害越容易谨慎爱拒绝,越追求有用越容易顺着你说,越追求诚实越容易说不知道、而用户体感上觉得它「不行」。每家在这个三角里的位置不同,就是你感觉到的性格差异——这不是能力差异,是价值取舍。所以选产品的方式该变:不是找最好的那个,是找取舍最适合你这件事的那个。

八、怎么选,以及回到「模型之外」

不给推荐清单——产品每个月都在变,判据却能用三年。三步就够。

第一步,先说清你要它干哪一类活儿。 大部分选错都错在这一步没想。方法很简单:先问这件事的难点在哪,再问谁的结构刚好解决它。

你要干的 难点在哪 该看哪一类
日常起草、改写、想点子 没有难点,要顺手和覆盖广 通用型
写要为每个字负责的东西 说得对,还要说得出为什么 克制型 + 溯源型
啃材料、做研究 能不能一键跳回原文 溯源型(向内)
摸清一个陌生话题 出处能不能顺藤摸瓜 溯源型(向外)
不只要建议,要真办成 生态、账号、支付 生态型
处理敏感数据 数据去了哪里 开放型(可本地部署)

第二步,用四个问题量它的骨架。 不需要懂技术,自己试十分钟就行:它会不会先查再答并给出处?记忆能不能看、能不能改、能不能删?不确定的时候会不会说不确定?要动真格的时候会不会先问我?

第三步,问那个决定「能不能用」的问题:我的数据去了哪里。 前面两步决定它好不好用,这一步决定它能不能用——顺序别搞反,很多人挑了半天功能,最后发现这条不过关,全白挑。

最后提一句成本。AI 按「干了多少活」计费,不是按「你用不用」,这意味着一个反直觉的现象:用得越顺手,账单涨得越快,而且很多浪费是隐性的——一个塞满无关材料的对话,每一轮都在为你不需要的东西付钱。所以不妨多问一句:它有没有让我看见「这次花了多少」?

说回开头那个矛盾。「AI 会一本正经地胡说八道」说的是模型,它至今成立,只是被遮住了;「我用着挺好啊」说的是产品,它也成立,因为你享受到的是这几年一层层搭上去的脚手架。理解这道落差的价值在于:你知道自己站在多厚的补丁上,也就知道补丁薄的地方在哪。

三条带走的结论:

  1. 你用的是产品,不是模型。 好体感来自那六块补丁,不是模型变老实了。
  2. 产品之间的差别,来自定位、设计哲学、能力来源这三样,都不是聪明程度。 NotebookLM 不是更笨才只用你的材料,Grok 不是更聪明才看得见实时流,Gemini 和千问能订票也不是因为模型更强。
  3. 选产品先说清你要干哪一类活儿,再看谁的结构刚好解决那个难点,最后问数据去了哪里。 别从功能表开始挑。

一页记忆卡:模型是发动机,产品是整车 · 先查再说是最强的一招 · 引用要点开 · 差别在定位、哲学和能力来源 · 先问它看得见吗,再问它聪明吗。

下一篇我们要跨过那条分界线,聊聊那些能自己动手办事的智能体——为什么同样是 AI,一个只能陪你聊,另一个敢接下整件事。

本文引用的主要来源

  • 时间线(ChatGPT 上线与两个月破亿、插件与联网、上下文窗口跃迁、多模态、推理模型、深度研究、操作电脑、工具接口标准、智能体爆发):各厂商公开发布信息与 2022–2026 年公开报道
  • DeepSeek R1 于 2025 年 1 月开源发布并对标当时最强推理模型:公开发布与广泛报道
  • 检索接地与引用约束对降低编造率的效果:2025–2026 年多篇工程实践与评测综述(降幅各家口径差异大,本文只取方向)
  • 各产品的设计与能力(NotebookLM 源锚定与音频概览、Grok 与 X 实时流及社区批注、Gemini 接自家地图航班酒店数据、千问打通阿里旅行与电商体系):各自官方说明与 2026 年报道
  • harness 的组件划分:整理自 2026 年多篇 agent 工程分析,各家拆法略有出入
  • confabulation 一词:美国国家标准与技术研究院(NIST)生成式 AI 风险管理框架

说明:本文标注为「我认为」「我的做法」的部分是观点,其余为可追溯的公开信息。文中所有产品仅作形态举例,不构成推荐、不涉及优劣排名;这一领域变化很快,功能与边界请以你使用时的官方信息为准。