AI 名词地图
名词多,不是因为这件事复杂,是因为它们分别长在一次调用的不同段落上。把这四段走一遍,绝大多数词自己就落位了。
- 一篇 AI 报道里四个词不认识,读完不确定它到底说了什么
- 会上有人说「这个上 RAG 就行了」,你不知道该追问什么才不露怯
- Token、Agent、微调你都能单独解释,但说不出它们之间是什么关系
一次调用发生了什么
你的产品每问模型一次,都要走完四段。这四段就是上面那张图。
第一段,把东西装进去。模型不会自己去找资料,所有它该知道的,都得由你的代码在这一次请求里一起发过去:产品的设定与规则(系统提示)、之前聊过的内容(历史对话)、从你的文档库里捞出来的相关片段(检索,也就是 RAG)、以及用户刚说的这句话。这四样打包在一起,装在一个有上限的盒子里,这个盒子叫上下文窗口,容量按 Token 算。
第二段,模型开始算。它做的事只有一件:算下一个词最可能是什么,抽一个接上去,再把接好的整段从头算一遍。重复几百次,一段回答就写完了。这一段里你能调的只有温度之类的旋钮;参数量、能力上限、知道多少东西,在训练的时候就定死了。
第三段,它把字吐出来。注意这是现场生成的,不是从某个库里查出来的——这是它和搜索引擎最根本的区别。生成机制决定了它遇到不知道的地方会用「最像的内容」补上,语气和真话完全一样,这就是幻觉;也决定了它不知道训练之后发生的事。
第四段,它想动手。光会说话不够。你把一组工具的说明书写进第一段,它就能输出「我要调这个工具、参数是这些」,然后由你的代码去执行,再把执行结果塞回第一段,让它接着算。这一来一回反复几十轮,就是 Agent 循环。
关键在最后这个回流箭头:每转一圈,前三段全部重算一遍。上下文越滚越长,每一轮都要把之前所有内容重新发一次、重新计一次费。Agent 为什么又慢又贵,答案就在这条线上。它也解释了为什么省钱的功夫全在控制上下文长度,而不在挑一个便宜模型。
最容易混淆的六组
记住定义没什么用。真正会让你在会上判断失误的,是下面这六组——它们听起来像同一件事,实际上差得很远。
一、Token 不是字。它是模型自己统计出来的一套切法,一个常见英文单词可能占 1 个,一个生僻汉字可能占 3 个。计费、上下文长度、限流全按 Token 算。所以「这份文档两万字,应该不贵」这句话是估不准的,得实际切一遍。
二、参数量不是上下文长度。一个是模型有多大(写成 7B、70B),一个是它一次能读多少(写成 128K、1M)。两个数字毫无关系,可以一大一小任意组合。选型时最常被混着说。
三、微调不是喂资料。微调改的是模型「怎么说话」的倾向,要花钱训练、要准备成千上万条样本,而且教不会它新知识。你要让它知道公司的规章制度,正确答案几乎总是 RAG——把文档检索出来放进第一段,而不是去微调。这一条误判的代价最贵,很多团队花几个月微调,最后发现做个检索就解决了。
四、Agent 不是更聪明的模型。Agent 是模型外面那一层:循环、工具、权限、终止条件。同一个模型,套上好的循环就能干活,套上坏的循环就会绕圈子。所以「它老是漏步骤」多半不是模型笨,是你的流程没定义清楚,或者没给它一个能验证结果的工具。
五、Skill 不是 MCP。Skill 是一包写好的知识和流程,用到的时候才加载进上下文,解决的是「每次都要重新交代一遍」;MCP 是一套让 Agent 连外部系统的接口协议,解决的是「怎么接上你的数据库和第三方服务」。一个装知识,一个装接口,不能互相替代。
六、开源不等于免费。「开源模型」通常只公开权重,训练数据和训练代码一般不给。你可以下载下来自己跑,但要自备显卡、自己运维、自己扛并发。算总账,中小规模下自部署往往比直接调 API 更贵。开源真正买到的是可控——数据不出门、模型不会某天被下线或涨价。
名词对照表
按上面四段的顺序排。每个词一句话说清是什么,再一句话说清跟你有什么关系。已经写成文章的带链接。
| 名词 | 一句话是什么 | 为什么你要关心 |
|---|---|---|
| ① 装进去 —— 上下文这一侧 | ||
| 提示词 Prompt | 你这一次发过去的全部文字。 | 它不是咒语,是需求文档。你没写清的地方,它一定会自己补一个。 |
| 系统提示 | 放在最前面、每轮都带上的设定与规则。 | 产品的性格、边界、禁区都写在这。它也是最该做缓存的一段。 |
| 上下文窗口 | 一次请求能装下的内容上限,按 Token 算。 | 超了就得截断或压缩。被截掉的部分它真的看不见,而且不会告诉你。 |
| Token | 模型眼里的最小单位,既不是字也不是词。 | 计费、上下文长度、限流全按它算。估成本必须先换算。 |
| 中段丢失 | 上下文太长时,开头结尾记得清楚,中间容易被忽略。 | 关键指令放最前或最后,别埋在一堆资料中间。 |
| 向量 Embedding | 把文字变成一串坐标,意思相近的靠得近。 | 整套语义检索建在它上面。它算的是「像不像」,不是「对不对」。 |
| RAG / 知识库 | 先从你的资料里检索相关片段,再连问题一起交给模型。 | 治幻觉最有效的一招,也是绝大多数「企业知识库」的真身。 |
| 上下文压缩 | 对话太长时把前文摘要成一小段,替换原文。 | 省了钱也丢了细节,丢的常常正是早期定下的约束。 |
| 长期记忆 | 把该记的事存在外部,下次对话再注入。 | 模型本身没有记忆,所谓记忆都是你的系统在替它存取。 |
| ② 模型算 —— 模型本身 | ||
| 下一个词预测 | 每一步只算下一个 token 最可能是什么,抽一个接上,再重复。 | 这是唯一的机制。它所有的能与不能都要回到这句话解释。 |
| 训练 / 推理 | 训练是一次性喂出来,推理是每次调用时用起来。 | 你的账单全在推理侧,能力边界在训练侧就定死了。 |
| 训练数据 | 训练时喂进去的全部文本、图片与代码。 | 语料里没有的,它只能靠猜。你们的内部概念就属于这一类。 |
| 参数量 | 模型内部权重的数量,写成 7B、70B。 | 跟聪明程度不是一回事,跟上下文长度更是毫无关系。 |
| 温度 | 控制抽样随机性的旋钮:低就稳,高就野。 | 要稳定输出就调低。默认值往往不是你要的那档。 |
| 推理模型 | 回答前先生成一大段思考过程,再给结论。 | 难题上更准,但那段思考也要按输出价计费。简单任务上纯属浪费。 |
| 开源模型 | 权重公开、可以自己部署的模型。 | 买到的是可控,不是便宜。中小规模自部署往往更贵。 |
| ③ 吐出来 —— 输出与它的边界 | ||
| 幻觉 | 把不知道的部分用最像的内容补上,语气和真话一样。 | 机制的必然产物,不是 bug。只能防,不能等它被修好。 |
| 知识截止 | 训练语料的最后时间点,之后的事一概不知。 | 凡是涉及「最新」的功能,都得由你把最新信息喂进去。 |
| 多模态 | 能读图、音频、视频的模型,这些能力多半是后来加装的。 | 小字、表格线、精确坐标是高发失败区。 |
| ④ 动手 —— Agent 这一侧 | ||
| Agent | 能自己决定下一步、并调工具去做的一套程序。 | 它不是更聪明的模型,是模型外面那层循环和权限。 |
| 工具调用 | 你给它工具说明书,它输出调哪个、参数是什么,由你的代码执行。 | 工具给到哪,它的能力边界就到哪。 |
| Agent 循环 | 想一步、做一步、看结果、再想,反复到收敛。 | 成本和延迟按轮数翻倍。不收敛的循环是最贵的故障。 |
| Skill | 一包写好的知识和流程,用到时才加载。 | 把「每次都要交代一遍」的经验固化下来,平时还不占窗口。 |
| MCP | 让 Agent 接外部系统的标准接口协议。 | 接一次多处可用。选第三方 MCP 要当成开权限来审。 |
| 多 Agent | 把任务拆给几个各管一摊的 Agent,再合并结果。 | 确实更稳,但上下文要复制好几份,成本涨得很快。 |
| 提示注入 | 它读到的资料里藏了一句指令,它照做了。 | 模型分不清指令和数据。原理层面的漏洞,靠提示词补不上。 |
| API / 网页版 | 一个给程序调用,一个给人使用。 | 数据留存策略、可控参数、计费方式都不同。谈合规先分清这两个。 |
听不懂时问哪一句
还有一件事得说明白:这些词的边界在业内本来就不统一。同一个「Agent」,供应商说的、工程师说的、你在报道里读到的,经常不是一回事。有人管一个带工具的对话框叫 Agent,也有人非要能跑几十轮才算。
所以真正管用的不是背定义,是在会上追问一句:「你说的这个,具体是指哪一步?」让对方把它落到上面那四段里的某一段上。大部分误会在这一句里就解掉了。
如果你只带走一句话,带走这个:模型只会预测下一个词,其余所有名词,都是人们为了绕开这个限制而发明出来的东西。知道每个词在绕哪一个限制,你就不需要记它的定义了。
