大模型与搜索引擎的区别
搜索引擎替你找到东西放在哪一页,模型直接从记忆里说出它认为的答案。同一个问题,两种交付物。
你会遇到的现象
- 它给了一个看起来很权威的数字,但你搜遍全网找不到出处
- 它把两个相似产品的功能说混了,两边的描述都对,就是配错了对象
- 你让它「给个链接」,它给了一个格式完美但打不开的网址
差别在哪一步
搜索引擎干活时,原文一直在。它做的是建索引、匹配、排序,最后把「这段话在哪个文档的哪个位置」还给你。你点开就能看到原句,作者是谁、什么时候写的,一目了然。
模型不是这样。训练结束之后,语料就被扔掉了,留下的只有一堆权重。这堆权重记住的不是「哪句话出现在哪」,而是「什么样的内容后面通常跟什么样的内容」。它是把语料的统计规律压缩进了参数,不是把语料存进了硬盘。
所以「它记得那篇论文」这句话本身就不准确。它记得的是那类论文里常出现的说法、结构和术语搭配。回答的时候,它是把这些东西重新组装出来的,不是调出来的。
| 搜索引擎 | 模型 | |
|---|---|---|
| 交付物 | 一串位置 | 一段内容 |
| 原文在不在 | 在 | 不在 |
| 能不能核 | 点开就能核 | 只能你另外去查 |
| 新内容 | 抓到就有 | 训练之后的一概不知 |
| 擅长的问题 | 「这个东西在哪」 | 「帮我把这堆东西变成那样」 |
凭记忆的三个后果
- 会记串。权重里没有「这条信息属于哪一篇」这种标记,相似的内容会互相污染。两个同类产品的定价、两个同名 API 的参数、两个相邻年份的数据,最容易被串到一起。而且串了之后,它照样答得很顺。
- 有知识截止日。权重固定在训练结束那一刻。之后发布的版本、改过的接口、换过的政策,它一概不知,但它会用截止日之前的模式往下推,推出一个听起来很合理的错答案。
- 没有出处。这一条最要命:它给不出出处,但能编出出处。链接的格式、论文的作者和年份、条款的编号,这些都是有强统计规律的东西,编起来毫无难度。凡是它主动给的引用,默认都要当成待核实。
联网之后呢
现在很多产品会先搜再答。这确实解决了一部分问题,但要清楚它解决的是哪一部分。
联网检索做的是:把几段真实原文塞进这一次的输入里,让模型基于这几段来写。好处是有了出处,坏处是它仍然是在生成。检索到的几段原文如果不全,它照样会用记忆去补;如果检索到的内容互相矛盾,它会挑一个顺的说法圆过去。
所以看到带引用的回答,仍然要做两件事:一是点开链接确认这个链接是真的,二是确认引用的那句话真的在那个页面里。第二条比第一条更常出问题——链接是真的,但那句话是它自己加工过的。
还有一个产品上的判断:需要出处的场景,检索这一层要你自己控。不要把「去哪儿找资料」也交给模型自由发挥,而是明确限定它能用哪些库、哪些文档、哪个时间范围。范围一收窄,答案的可核实性会立刻上一个台阶。
