生图为什么贵几十倍
第一次往多模态模型里传图片的人,都会被账单吓到——一张图的价格能顶几千字。原因很简单:图片不是按「一张」计费,是按分辨率换算成等效 Token。
- 传一张截图给模型,费用比平时高出一个数量级
- 同一张图,改了下分辨率,价格翻了几倍
- 预算表里「图片调用」一项,怎么估都不准
图片怎么计费
模型处理图片时,会把图片按比例切成若干小块,每块单独理解再拼起来。小块的数目基本由分辨率决定,所以计费天然跟着分辨率走。
各家算法略有不同,但共同点是:按长边分档。低分辨率一档,中分辨率一档,高分辨率一档,跨过阈值价格跳档。同一张图,从长边 1024 提到 2048,等效 Token 可能翻好几倍;提到 4096,再翻好几倍。
这意味着一条很容易踩的坑:你拿原始高清图去问模型,模型也看不出比低清图多多少信息,但你的账单按高清算了。
为什么贵
贵在理解工作量。模型要看懂一张图,需要的计算量远大于读一段相同字节数的文字。像素的信息密度低但计算密度高——这就是「几十倍」的来源。
而且多模态场景往往是「多图 + 文本」一起进:好几张截图 + 一个问题,总费用会明显超过纯文本对话。输入 Token 一多,成本立刻上去。
理解了这个机制,就知道省钱的方向不是「少用图片」,而是让每张图花在刀刃上。
省钱的几招
一、按需降分辨率。这是最大的一招。识别图片里的文字、小字 → 用高清。识别整体构图、风格、有没有人 → 用低清就够了。先问「模型真的需要看清那么细吗」。把长边压到刚好够用的档位,费用可能省一个数量级。
二、只发相关的部分。一页 PDF 截成一张大图 vs 裁出出问题的区域——后者便宜得多,识别率还可能更高(不相关的部分会干扰判断)。这和文字检索里切分的道理一样:喂进去的内容越聚焦,效果越好、成本越低。
三、裁剪掉无关区域。截图里的边框、菜单、空白,裁掉再发。既省 Token 又减少干扰。
四、批量、离线任务走低价通道。很多厂商对不需要实时返回的离线图片任务给折扣价。
五、分清「看懂图」和「生成图」是两种计费。本文讲的是「让模型看懂图片」的费用(视觉理解)。生成图片是另一套计费,通常按张数、按分辨率、按生成步数算,两者别混在一起估预算。
最后一条:把「图片调用」单独记日志、单独看成本。它量少价高,最容易偷偷吃掉预算。单独统计之后,你才能知道哪类功能在烧钱。
