做产品 PMaker
空格的键盘
图片不按「一张」计费 —— 按分辨率换算成等效 Token 一张图的费用 ≈ 多少个等效 Token × 单价 低分辨率(长边 1024) 几百 Token 级 · 便宜 中分辨率(长边 2048) 上千 Token 级 · 贵好几倍 高分辨率(长边 4096) 上万 Token 级 · 跳档暴涨 为什么按分辨率算 模型处理图片时要把像素切成小块分别理解 —— 像素越多,工作量越大,账单越厚 很多厂商是「长边按档位」计费:跨过一个阈值,价格跳一档 提醒:识别小字要高清,识别构图风格用低清 —— 先想清楚「真的需要那么清楚吗」

图片进模型不是「一张一块钱」,是按分辨率算的等效 Token。分辨率一提,费用按档位跳。

生图为什么贵几十倍

第一次往多模态模型里传图片的人,都会被账单吓到——一张图的价格能顶几千字。原因很简单:图片不是按「一张」计费,是按分辨率换算成等效 Token。

你会遇到的现象
  • 传一张截图给模型,费用比平时高出一个数量级
  • 同一张图,改了下分辨率,价格翻了几倍
  • 预算表里「图片调用」一项,怎么估都不准

图片怎么计费

模型处理图片时,会把图片按比例切成若干小块,每块单独理解再拼起来。小块的数目基本由分辨率决定,所以计费天然跟着分辨率走。

各家算法略有不同,但共同点是:按长边分档。低分辨率一档,中分辨率一档,高分辨率一档,跨过阈值价格跳档。同一张图,从长边 1024 提到 2048,等效 Token 可能翻好几倍;提到 4096,再翻好几倍。

这意味着一条很容易踩的坑:你拿原始高清图去问模型,模型也看不出比低清图多多少信息,但你的账单按高清算了。

为什么贵

贵在理解工作量。模型要看懂一张图,需要的计算量远大于读一段相同字节数的文字。像素的信息密度低但计算密度高——这就是「几十倍」的来源。

而且多模态场景往往是「多图 + 文本」一起进:好几张截图 + 一个问题,总费用会明显超过纯文本对话。输入 Token 一多,成本立刻上去。

理解了这个机制,就知道省钱的方向不是「少用图片」,而是让每张图花在刀刃上。

省钱的几招

一、按需降分辨率。这是最大的一招。识别图片里的文字、小字 → 用高清。识别整体构图、风格、有没有人 → 用低清就够了。先问「模型真的需要看清那么细吗」。把长边压到刚好够用的档位,费用可能省一个数量级。

二、只发相关的部分。一页 PDF 截成一张大图 vs 裁出出问题的区域——后者便宜得多,识别率还可能更高(不相关的部分会干扰判断)。这和文字检索里切分的道理一样:喂进去的内容越聚焦,效果越好、成本越低。

三、裁剪掉无关区域。截图里的边框、菜单、空白,裁掉再发。既省 Token 又减少干扰。

四、批量、离线任务走低价通道。很多厂商对不需要实时返回的离线图片任务给折扣价。

五、分清「看懂图」和「生成图」是两种计费。本文讲的是「让模型看懂图片」的费用(视觉理解)。生成图片是另一套计费,通常按张数、按分辨率、按生成步数算,两者别混在一起估预算。

最后一条:把「图片调用」单独记日志、单独看成本。它量少价高,最容易偷偷吃掉预算。单独统计之后,你才能知道哪类功能在烧钱。

先问一句:模型真的需要看清那么细吗? 需要 → 用高分辨率 图里的文字、小字、表格线、编号 跨过阈值价格跳档,但这时候值 长边 1024 → 2048,等效 Token 可能翻好几倍 不需要 → 压到刚够用 整体构图、风格、有没有人、布局 费用可能直接省一个数量级 这是所有省钱手段里最大的一招 · 裁掉边框、菜单、空白再发——既省 Token,又减少干扰,识别率还可能更高 · 「让模型看懂图」和「让模型生成图」是两套完全不同的计费,别混在一起估预算 · 把图片调用单独记日志、单独看成本:它量少价高,最容易偷偷吃掉预算
最容易踩的坑是拿原始高清图直接问:模型未必比看低清图多读出什么,你的账单却按高清算了。图片贵在理解的计算量——像素信息密度低但计算密度高,这就是「几十倍」的来源。