做产品 PMaker
空格的键盘
三个经常被混为一谈的数字,其实互不相干 参数量 7B · 70B · 多数已不公布 决定能力的天花板 不决定这次答得好不好 同尺寸的两家能差很远 上下文长度 8K · 200K · 1M token 决定一次能塞多少 不决定它真的用得上 塞满之后中段照样丢 跑分 各种榜单上的那个数 决定它考试考得好 不决定你的场景过不过 题目可能已进了训练集 真正该看的第四个数字:拿你自己的 20 条真实用例,让候选模型各跑一遍 这 20 条排出来的顺序,和任何一张榜单都不会一致 —— 以你这一张为准

这三个数字回答的是三个不同的问题。混着看,就会买到一个榜单很好看、在你场景里很难用的模型。

参数量与跑分怎么看

参数量、上下文长度、跑分,是三件不相干的事。三个都高的模型未必适合你,三个都不出众的模型可能刚好够用。

你会遇到的现象
  • 换了一个榜单排名更高的模型,你们的场景反而变差了
  • 技术同学说这个模型「更大」,你不知道大在哪、意味着什么
  • 给了 100 万上下文,你把整个知识库塞进去,答案却更含糊了

三个不同的数字

参数量是模型里权重的个数,7B 就是 70 亿个。它决定的是这个模型能装下多少统计规律,也就是能力的上限。但上限不等于表现:同样是 70B,训练数据的质量、后训练的手法不同,出来的东西能差出一大截。而且现在主流模型基本都不公布参数量了,你能拿到的通常只有一个档位名。

上下文长度是一次请求能装多少 token。它跟聪明程度没关系,只跟「能不能一次读完」有关。而且能装进去不代表能用好——长上下文里,中间那一段被忽略的概率会明显上升。这一条对做 AI 产品的人非常现实:窗口大是给了你余量,不是给了你随便塞的许可。

跑分是它在若干标准题库上的正确率。它回答的问题是「这个模型在这些题上考得怎么样」,仅此而已。

数字回答的问题不回答的问题
参数量能力上限有多高这次任务做得好不好
上下文长度一次能读多少读进去的能不能被用上
跑分标准题上考得好不好你的题上考得好不好
价格贵不贵值不值
延迟快不快用户能不能忍
右边那一列才是你真正关心的问题,而左边任何一个数字都答不了。这就是为什么必须自己测。

跑分为什么会骗人

该怎么选

把选型变成一件可执行的事,就四步。

一、先攒一份你自己的题。从真实场景里挑 20 到 50 条,覆盖典型情况、边界情况和你们最怕出错的情况。每条要写清楚什么算合格。这份题库是你选型的唯一依据,也是以后每次换模型的回归测试。

二、先测能不能过,再测哪个更好。很多任务其实有一条明确的及格线。先用便宜的档位跑一遍,如果已经过线,更强的模型只是在浪费钱。能用小的就别用大的,这条在成本上的杠杆比任何提示词优化都大。

三、把不同任务分开选。一个产品里通常有好几类调用:分类、抽取、改写、复杂推理。前三类用便宜快的档位,最后一类才上贵的。分流做好,账单能砍掉大半。

四、把可替换性设计进去。模型半年就换一代,把调用封在一层里,换模型时只改一个地方。选型不是一锤子买卖,是一件每隔几个月要重做一次的事。

一个产品里通常有好几类调用,它们不该共用一个档位 全都走最强档 分类 抽取 改写 复杂推理 账单 = 四份贵的 按任务分流 分类 抽取 改写 复杂推理 账单能砍掉大半 绿色 = 便宜快的档位  红色 = 贵档 选型四步 ① 先攒一份你自己的题(20–50 条,写清什么算合格)——它是唯一依据,也是以后的回归测试 ② 先测能不能过线,再测哪个更好——已经过线的话,更强的模型只是在浪费钱 ③ 把不同任务分开选,就是上面那张分流图 ④ 把调用封在一层里——模型半年换一代,选型不是一锤子买卖
能用小的就别用大的,这条在成本上的杠杆比任何提示词优化都大。而做到它的前提只有一个:你得有一份自己的题,能判断便宜那档到底过没过线。

接着看