开源与闭源
「开源模型」这个说法借用了软件行业的词,但含义差得很远。软件开源你能看到全部源代码;模型开源,你通常只拿到权重——一堆训练好的数字。
- 以为「开源」等于免费,算完自部署的账才发现比调 API 贵
- 下载了权重,却发现许可证不允许你这种商用方式
- 老板说「用开源的,数据安全」,但没人算过要买几张卡
开的到底是什么
一个模型由三部分构成:训练数据、权重、训练代码与配方。
所谓「开源模型」,绝大多数情况下只公开了中间那一块——权重。训练数据几乎从不公开(涉及版权和商业机密),完整的训练配方多数也不给。
这意味着:你能用它,但复现不出它,也搞不清它到底学过什么。所以业内更准确的叫法是「开放权重」(open-weight),而不是开源。你在训练数据那一节看到的那些偏向和缺口,在开放权重模型上同样存在,而且更难查证。
相对地,闭源模型连权重都不给,你只能通过 API 调用。你不知道它具体是什么结构、多大参数,厂商换了模型你也未必察觉得到。
许可证要看什么
「公开」不等于「随便用」。下载之前,让法务或者你自己确认三件事。
一、能不能商用。有些许可证只允许研究用途,商用要单独授权。
二、有没有规模限制。有的许可证写了用户量或收入的门槛,超过就要另外谈授权——这条最容易被忽略,等产品做大了才发现,那时候换模型的成本已经很高了。
三、产出物和衍生模型归谁。你用它微调出来的模型能不能自己发布、能不能闭源,不同许可证规定不一样。
许可证种类很多,宽松的接近标准开源协议,严格的更像「有条件的免费使用授权」。别看厂商宣传页上那句「完全开源」,去读许可证原文。
自部署的真实账
这是最容易算错的地方。很多人把「不用付 API 费」直接等同于「免费」。
实际要付的是这些:显卡(买或租,大模型往往需要多张高端卡)、电力与机房、运维人力(部署、监控、故障恢复、版本升级)、并发能力(要支撑多少人同时用,就要备多少冗余)。
关键在于,这些成本大部分是固定的,跟你用不用无关。API 是用多少付多少,半夜没人用就不花钱;自部署的卡在那放着,闲着也在烧钱。
所以结论几乎总是:调用量低的时候,自部署单位成本高得离谱;只有量大到能把固定成本摊薄,才可能划算。而「量大」的门槛,通常比团队预估的高不少。
另外还有一笔隐性账:能力差距。开放权重模型和头部闭源模型之间通常仍有差距,而且你要自己承担跟进新版本的工作——闭源 API 是厂商升级了你自动受益。
什么时候才该自部署
符合下面任意一条,自部署才真正成立。
一、数据绝对不能出门。医疗、金融、政务、军工这类场景,合规要求压过一切成本考虑。这是自部署最正当、也最常见的理由。
二、调用量大到能摊薄固定成本。先用 API 跑一段时间,拿真实用量算一遍:按现在的量,自部署多久能回本?算不明白就说明还不到时候。
三、需要深度定制。要做大规模微调、改模型结构、或者部署到没有网络的环境,这些闭源 API 做不到。
四、必须消除供应商风险。不接受模型某天被下线、涨价或限流。这条对长周期的 B 端合同尤其重要。
如果一条都不占,那就用 API。把「开源=省钱」这个等号去掉,你会做出更清醒的决定。开源真正卖给你的是控制权:数据不出门、模型不会消失、版本你自己定——这在选择接入渠道时也是同一套逻辑。
还有个折中方案值得知道:用云厂商托管的开放权重模型。模型是开放权重的,但由云平台负责部署运维,你按调用量付费。拿到了模型选择的自由,又不用自己扛运维——对多数团队来说,这是比自建机房更现实的一条路。
