做产品 PMaker
空格的键盘
六种模型,六个不同的计费单位 —— 拿文本那套去估视频,能差出两个数量级 类型 输入 输出 计费按 文本 文字 文字 Token 图片 文字 / 图 图 张 × 分辨率 视频 文字 / 图 视频 秒 语音合成 TTS 文字 音频 字符 语音识别 ASR 音频 文字 音频时长 向量 Embedding 文字 一串数字 Token 相对单价量级 最便宜 最贵 条形只表示数量级关系,不是精确比例。做预算前必须按各自的单位实测。

「模型」不是一种东西。六类各有各的输入输出,更要紧的是——各有各的计费单位。

模型的六种类型

日常说的「大模型」通常只指文本模型。但你要做的产品,很可能同时用到好几类。它们的能力边界不同,计费单位更是完全不同——这一点比能力差异更容易让你在预算上翻车。

你会遇到的现象
  • 按文本模型的经验估了个成本,做语音功能时账单差了十几倍
  • 想做「上传视频自动剪辑」,不知道该找哪种模型
  • 听说「向量」很贵,其实它是这六类里最便宜的

六种分别是什么

文本模型。文字进、文字出,就是你最熟的那种。按 Token 计费,输入一个价、输出一个价,输出通常贵几倍。绝大多数 AI 功能的主力。

图片模型。给一段描述(也可以再给一张参考图),生成一张图。按张计费,分辨率越高越贵,而且是跳档式的——分辨率调一档,单价可能翻好几倍。

视频模型。给文字或图,生成一段视频。按秒计费,这是它和其他所有类型最不一样的地方。一段十几秒的视频,成本可能顶得上几百次文本调用。做预算时务必单独算这一项。

语音合成(TTS)。文字进、音频出。按字符数计费,不是按 Token。所以文本模型那套换算在这里不适用。音色克隆、情感控制通常另外收费。

语音识别(ASR)。音频进、文字出。按音频时长计费,跟说了多少字无关——一段沉默的录音和一段密集对话,只要时长一样,价钱就一样。

向量模型(Embedding)。文字进,出来一串数字坐标。它不生成任何内容,只负责把「意思」变成可以计算距离的坐标。这是整套语义检索和知识库的地基,而且是六类里最便宜的,通常比文本模型便宜一两个数量级。名词地图里也提到过它。

计费单位才是重点

能力差异你大概能猜到,计费单位的差异才是真正会伤到你的地方。

看那张图右边的条形:同样是「调用一次模型」,成本能差出两个数量级。向量最便宜,视频最贵,中间隔着好几档。

这带来一条很实际的纪律:估成本时,六类必须分开算,不能用同一套心算。做一个「上传录音 → 转文字 → 摘要 → 生成配图」的功能,你要同时算 ASR 的时长费、文本模型的 Token 费、图片模型的张数费。任何一项用错单位,整个预算就废了。

还有一个常被忽略的点:非文本模型往往还有并发和时长的硬限制。视频生成一次可能要等几十秒到几分钟,这不只是成本问题,更是产品设计问题——你得设计一个像样的等待体验,而不是让用户对着转圈干等。

真实产品是拼出来的

实际产品很少只用一类模型。举个具体的:一个「会议纪要」功能,链路通常是这样——

录音先交给 ASR 转成文字(按时长计费);文字交给文本模型做摘要和待办提取(按 Token);如果要做语义搜索,还要把纪要切段后过一遍向量模型存进库里(按 Token,但很便宜);要是产品还想生成一张分享卡片,再叫一次图片模型(按张)。

四类模型,四种计费单位,四条独立的失败路径。拆开看,每一段的成本和风险才算得清楚。

选型时也一样:这四段可以来自不同厂商,没必要绑在一家。ASR 挑准确率和中文表现好的,文本模型挑你那类任务上实测好的,向量模型挑便宜稳定的就行。怎么把它们统一接进来是另一个话题。

「会议纪要」这一个功能,就用掉了四类模型 录音 ASR 转文字 文本模型 摘要与待办 向量模型 切段入库 图片模型 分享卡片 按音频时长 按 Token 按 Token(极便宜) 按张 四类模型,四种计费单位,四条独立的失败路径 同样是「调用一次模型」,成本能差出两个数量级 向量 文本 语音 图片 视频 便宜 非文本模型还有并发和时长的硬限制:视频生成一次要等几十秒到几分钟——这是产品设计问题,不只是成本问题。
估成本时六类必须分开算,任何一项用错单位,整个预算就废了。这四段也不必绑在一家厂商:ASR 挑中文表现好的,文本模型挑你那类任务实测好的,向量模型挑便宜稳定的就行。