做产品 PMaker
空格的键盘
我们默认「难的做得到,简单的当然也做得到」—— 对模型不成立 人:平滑下降 模型:锯齿状 强 弱 解竞赛数学题 写一个完整模块 数清表格有几行 看清截图里的小字 所以「它连这个都会,那个肯定没问题」是本章最贵的一句错话。每一格都得单独验。

同一个模型能解奥数题,也会数错表格行数。能力不是一条平滑上升的线,是一排高低不齐的齿。

AI 目前到了哪一步

今天的模型在语言、代码、图像和一部分工具操作上,已经能干完不少真活。但它的能力分布是坑坑洼洼的——这才是做产品时最该先知道的一件事。

你会遇到的现象
  • 演示里它能自动做完整个任务,换成你们的真实数据就频频卡住
  • 同一个模型能写出复杂代码,却数错表格里有几条记录
  • 团队在争「AI 能不能替代某个岗位」,但没人定义过任务、质量线和出错代价

锯齿状的能力

我们判断一个人的能力,靠的是一条平滑的线:他能解奥数题,那算个百分比肯定没问题。这个推断对人成立,是因为人的能力是层层垒起来的。

对模型不成立。它的能力来自训练语料里的统计分布,哪一块语料多、反馈密,哪一块就强。这跟人类眼里的「难易」几乎没关系。于是就出现了那张图里的锯齿:竞赛数学题做得漂亮,数表格行数却会错;能写完整模块,看不清截图里的小字。业内把这个叫锯齿状智能。

这不矛盾,也不是模型「不认真」。它只说明一件事:每一格能力都得单独验证,不能从旁边那一格推过来。

还有第二层落差同样重要:能做出一次和能稳定做一万次是两回事。演示只需要跑通一条成功路径,产品要面对全部失败路径。中间隔着任务拆分、评估、权限、回退和人工复核——这一整段工作,才是把模型变成产品的真正内容。

三档成熟度

与其问「AI 行不行」,不如把你要做的事放进这张表里对号入座。

成熟度典型任务该怎么用
已经好用 改写、摘要、翻译、分类、信息抽取、代码补全、内容草稿 当副驾驶用。输出能被快速检查,错了重试的成本也低。
有条件可用 企业知识问答、文档分析、多模态识别、受控的工具调用、短流程 Agent 给权威资料、明确工具、固定步骤,配上自动评估和人工兜底。
仍需谨慎 长时间无人值守、高风险审批、医疗法律结论、开放网页操作、通用机器人 严格限制权限和作用范围。关键动作必须人工确认,别把输出当事实。
资料基准:2026 年 8 月。分档依据不是技术名称,而是三件事的组合:失败概率、失败后果、验证成本。同一个技术用在不同场景,档位可以完全不同。

注意最后那句。「用大模型做客服」这句话本身没有档位——回答产品咨询是第一档,自动给客户退款是第三档。决定档位的是后果,不是技术。

最容易误判的一档

Agent 是这三档里最容易被高估的。

它并不是模型突然有了「主观能动性」。它是模型在一个循环里反复做同一件事:选一个工具、读取结果、决定下一步。所以它的成功率是连乘的——单步九成的准确率,跑十步就只剩三成半。

这就是为什么 Agent 的演示和落地之间落差最大。演示展示的是一次成功路径;你的产品要面对的是每一步都可能出错、而且错误会往后累积的现实。链条越长,这个差距越大。

可行的做法不是等模型变强,是把链条截短:把长任务拆成几段,每段结束有一个能自动验证的检查点,过不了就停下来找人。

Agent 的成功率是连乘的,不是平均的 100% 50% 0% 10 步后只剩 35% 单步 95% 的话,还有 60% 1 步 5 步 10 步 15 步 单步 90% 所以可行的做法不是等模型变强,是把链条截短 把长任务拆成几段,每段结束设一个能自动验证的检查点,过不了就停下来找人。
这条曲线解释了为什么 Agent 的演示和落地之间落差最大:演示只需要跑通一条成功路径,产品要面对每一步都可能出错、而且错误会往后累积的现实。

四个判断问题

拿不准某个功能该不该做、该做到哪一档时,问这四个。

一、答案能不能被验证?有数据库、有规则、或者有人能核对,才适合自动化。无法验证又后果严重的结论,不该直接交付给用户。

二、失败是不是可逆?生成一版草稿写砸了可以重来;自动付款、删数据、对外发布则必须设闸。可逆的地方可以放手,不可逆的地方必须卡人工。

三、任务边界清不清楚?输入格式、可用工具、什么算完成——越明确,成功率越高。「帮我经营公司」不是一个可执行任务,「把这批工单按这五类打标」才是。

四、经济账算不算得过来?把模型费用、延迟、人工复核时间、以及失败损失一起算。技术上能做,不代表比现在的流程更划算——这条被跳过的次数最多。

最稳的起点,是同时满足高频、耗时、可验证、可逆的任务。然后按这个顺序放权:先让它提建议,再让它填草稿,最后才开放执行。自治不是一个开关,是一段一段交出去的。

资料来源

资料基准:2026 年 8 月。「锯齿状智能」是业内对这一现象的通行说法,非某一家的专有术语;三档成熟度的划分是本文的归纳,不是任何报告的原文结论。模型能力与价格变动很快,做决策前请以厂商当前的官方文档为准。