做产品 PMaker
空格的键盘
榜单三个月就翻一遍,这六条不会 会过期 谁家跑分第一 谁家最便宜 上个月的评测榜 「XX 全面超越 YY」 记住了也没用, 下季度还得重查一遍 不会过期:拿这六条去量 ① 你那类任务上的实测表现 ② 上下文长度够不够装你的资料 ③ 单次调用的真实成本 ④ 稳定性:限流、超时、SLA ⑤ 合规:数据出境、留存、审计 ⑥ 迁移成本:换掉它要改多少 前两条决定能不能用,中间两条决定用得起用不起,后两条决定敢不敢用

别背厂商排名。把候选放进同一张表,用你自己的任务去量——这份表下个季度还能接着用。

主流模型厂商的差异

这一节不会给你一份「厂商排行榜」。榜单三个月就翻一遍,背下来没有意义。真正能重复使用的,是一套量的方法。

你会遇到的现象
  • 看了一堆评测,还是不知道自己该用哪个
  • 按跑分选了最强的,实际用起来还不如便宜那个稳
  • 接完一家才发现数据合规过不了,得从头再来

为什么不给排名

三个原因。

一、榜单和你的任务不是一回事。公开评测测的是竞赛题、通用问答这些标准化任务,而你要它干的是「把这类工单按我们内部的五个类别打标」。跑分高不代表你的场景好用——这两件事经常反着来。

二、差距在收窄,而且变动很快。头部模型之间的公开基准差距一直在缩小,同时每隔几个月就有新版本、新定价。任何写死的排名,写下来的那天就开始过期。

三、选型从来不只是选能力。价格、稳定性、合规、迁移成本,任何一条不过关都能一票否决——哪怕它能力最强。

六个选型维度

把候选模型放进这张表,一个个打分。这份表下个季度还能接着用。

维度具体量什么怎么量
① 任务表现在你那类任务上的准确率与稳定性。准 20–50 条真实样例,各模型跑同一套,人工判对错。
② 上下文长度够不够装下你要塞的资料。拿最长的那份真实输入去试,别信标称值。
③ 真实成本一次完整调用的钱,不是每百万 token 的单价。用真实请求量一遍 Token,算上输入、输出和多轮重发。
④ 稳定性限流额度、超时率、故障时的表现、有没有 SLA。压一段时间,看 P95 延迟和错误率,别只看平均值。
⑤ 合规数据是否出境、留存多久、是否用于训练、能否签协议。让法务看厂商的数据处理条款,别看营销页。
⑥ 迁移成本换掉它要改多少东西。看是否兼容通用接口格式,提示词要重调多少。
资料基准:2026 年 8 月。前两条决定「能不能用」,中间两条决定「用不用得起」,后两条决定「敢不敢用」。任何一条不过关都是一票否决。

第 ① 条最花时间,也最值。准备一组真实样例、跑一遍、人工判对错——这件事做过一次,后面每次换模型都能复用,是整个选型里回报最高的投入。

几个阵营的性格

虽然不给排名,但阵营之间确实有稳定的性格差异,这些短期内不会变。

海外头部闭源厂商(OpenAI、Anthropic、Google 这一类):能力上限通常最高,工具调用和长任务的工程成熟度好,文档与生态完整。代价是价格偏高,且国内使用涉及网络与合规问题。

国内大厂平台(阿里、字节、腾讯、百度这一类):优势在中文场景、合规资质、企业合同与发票,以及和自家云的整合。它们通常既提供自研模型,也在平台上托管第三方模型。

国产高性价比阵营(DeepSeek、月之暗面、智谱、MiniMax 这一类):定价激进,部分开放权重,性价比是主要卖点。近年国产模型的价格底线一直被这一阵营拉低。

开放权重模型:可以自己部署,数据不出门、不怕下线涨价。代价是显卡、运维和并发都得自己扛——中小规模下通常比直接调 API 更贵,买到的是可控而不是便宜。

一个参考量级:2026 年 8 月,海外旗舰模型的输入价大致在每百万 token 几美元的水平,国产主力模型则在几元人民币甚至更低,头部产品还常配免费额度。但这些数字变动极快,务必以厂商当期报价页为准。

怎么做一次选型

四步,一两天能走完。

第一步,先划掉不合规的。把数据出境、留存策略、能不能签协议这几条摆出来,过不了的直接出局。这一步放最前面,能省掉后面全部白工。

第二步,准备一组真实样例。20 到 50 条,覆盖常见情况和几个刁钻的边界情况。这组样例是你之后所有决策的尺子。

第三步,同一套样例跑所有候选。同样的提示词、同样的参数,人工判对错。注意一个坑:不同厂商对同一段提示词的反应差别很大,所以一轮结果不理想时,先给它一次针对性调整提示词的机会,再下结论。

第四步,选两个,不是一个。一个主力,一个备用,而且备用的接入要真的跑通过。模型限流、故障、下线都是常态,不能把产品可用性押在单一供应商身上。

四步,一两天能走完。顺序很重要 第一步 先划掉不合规的 数据出境、留存策略、能不能签协议——过不了的直接出局 放最前面,能省掉后面全部白工 第二步 准备一组真实样例 20 到 50 条,覆盖常见情况和几个刁钻的边界情况 整个选型里回报最高的投入 第三步 同一套样例跑所有候选 同样的提示词、同样的参数,人工判对错 结果差时先给它一次调提示词的机会 第四步 选两个,不是一个 一个主力,一个备用,而且备用的接入要真的跑通过 限流、故障、下线都是常态
第一步之所以排在最前面,是因为它是一票否决:能力再强,合规过不了就是零。而第二步那组样例做过一次,后面每次换模型、换渠道都能复用。

资料来源

资料基准:2026 年 8 月。本文刻意不写具体排名与单价明细,因为这两项过期最快;文中提到的阵营性格是结构性归纳。任何采购决策前,请以厂商官方文档与当期报价页为准。