做产品 PMaker
空格的键盘
「开源模型」这四个字,开的是中间那一块 一个模型由三部分构成 训练数据 几乎从不公开 权重 这一块公开 = 「开源」 训练代码与配方 多数不公开 所以你拿到权重之后 拿到了 数据不出门 不怕涨价下线 可以自己微调 没拿到 显卡 运维 并发能力 持续更新 开源买到的是「可控」,不是「便宜」—— 中小规模自部署,总账常常高于直接调 API

开源模型公开的通常只有权重这一块。训练数据和配方一般不给,所以你复现不出它,只能用它。

开源与闭源

「开源模型」这个说法借用了软件行业的词,但含义差得很远。软件开源你能看到全部源代码;模型开源,你通常只拿到权重——一堆训练好的数字。

你会遇到的现象
  • 以为「开源」等于免费,算完自部署的账才发现比调 API 贵
  • 下载了权重,却发现许可证不允许你这种商用方式
  • 老板说「用开源的,数据安全」,但没人算过要买几张卡

开的到底是什么

一个模型由三部分构成:训练数据、权重、训练代码与配方。

所谓「开源模型」,绝大多数情况下只公开了中间那一块——权重。训练数据几乎从不公开(涉及版权和商业机密),完整的训练配方多数也不给。

这意味着:你能用它,但复现不出它,也搞不清它到底学过什么。所以业内更准确的叫法是「开放权重」(open-weight),而不是开源。你在训练数据那一节看到的那些偏向和缺口,在开放权重模型上同样存在,而且更难查证。

相对地,闭源模型连权重都不给,你只能通过 API 调用。你不知道它具体是什么结构、多大参数,厂商换了模型你也未必察觉得到。

许可证要看什么

「公开」不等于「随便用」。下载之前,让法务或者你自己确认三件事。

一、能不能商用。有些许可证只允许研究用途,商用要单独授权。

二、有没有规模限制。有的许可证写了用户量或收入的门槛,超过就要另外谈授权——这条最容易被忽略,等产品做大了才发现,那时候换模型的成本已经很高了。

三、产出物和衍生模型归谁。你用它微调出来的模型能不能自己发布、能不能闭源,不同许可证规定不一样。

许可证种类很多,宽松的接近标准开源协议,严格的更像「有条件的免费使用授权」。别看厂商宣传页上那句「完全开源」,去读许可证原文。

自部署的真实账

这是最容易算错的地方。很多人把「不用付 API 费」直接等同于「免费」。

实际要付的是这些:显卡(买或租,大模型往往需要多张高端卡)、电力与机房、运维人力(部署、监控、故障恢复、版本升级)、并发能力(要支撑多少人同时用,就要备多少冗余)。

关键在于,这些成本大部分是固定的,跟你用不用无关。API 是用多少付多少,半夜没人用就不花钱;自部署的卡在那放着,闲着也在烧钱。

所以结论几乎总是:调用量低的时候,自部署单位成本高得离谱;只有量大到能把固定成本摊薄,才可能划算。而「量大」的门槛,通常比团队预估的高不少。

另外还有一笔隐性账:能力差距。开放权重模型和头部闭源模型之间通常仍有差距,而且你要自己承担跟进新版本的工作——闭源 API 是厂商升级了你自动受益。

把「开源 = 省钱」这个等号去掉,再看这张图 总成本 调用量 → 回本点 调 API:用多少付多少 自部署:固定成本,闲着也在烧钱 这一整段里,自部署的 单位成本高得离谱 「量大」的门槛通常比团队预估的高不少。先用 API 跑一段时间,拿真实用量算一遍多久回本——算不明白就说明还不到时候。
显卡、电力机房、运维人力、并发冗余,这些成本大部分是固定的,跟你用不用无关。开源真正卖给你的是控制权:数据不出门、模型不会消失、版本你自己定——不是便宜。

什么时候才该自部署

符合下面任意一条,自部署才真正成立。

一、数据绝对不能出门。医疗、金融、政务、军工这类场景,合规要求压过一切成本考虑。这是自部署最正当、也最常见的理由。

二、调用量大到能摊薄固定成本。先用 API 跑一段时间,拿真实用量算一遍:按现在的量,自部署多久能回本?算不明白就说明还不到时候。

三、需要深度定制。要做大规模微调、改模型结构、或者部署到没有网络的环境,这些闭源 API 做不到。

四、必须消除供应商风险。不接受模型某天被下线、涨价或限流。这条对长周期的 B 端合同尤其重要。

如果一条都不占,那就用 API。把「开源=省钱」这个等号去掉,你会做出更清醒的决定。开源真正卖给你的是控制权:数据不出门、模型不会消失、版本你自己定——这在选择接入渠道时也是同一套逻辑。

还有个折中方案值得知道:用云厂商托管的开放权重模型。模型是开放权重的,但由云平台负责部署运维,你按调用量付费。拿到了模型选择的自由,又不用自己扛运维——对多数团队来说,这是比自建机房更现实的一条路。