DeepSeek 睁眼了:视觉模型上线,实测把报错截图变成解决方案

DeepSeek 一直有个尴尬:推理强到能写论文,但"看不见"。别的模型早就看图说话了,它家 API 里只有纯文本模型——你截个报错图发给它,它只能干瞪眼。

这个短板,本周补上了。

一个 384 token 封顶的视觉模型

DeepSeek 官方 API 悄然上线了一个实验性模型:deepseek-v4-flash-vision-exp。名字很直白——在 v4-flash 基础上加了视觉能力,实验版。

几个关键参数,全是官方文档里的硬数字:

  • 支持格式:JPEG、PNG、GIF、WebP(按文件真实内容识别,不看你文件名)
  • 单请求最多 600 张图,单图最大 32MiB(base64/URL 方式)或 64MiB(Files API 方式)
  • 每张图最多 384 tokens,超了自动缩放——2000×2000 和 5000×5000 的图,花一样的钱
  • 请求体上限 48MiB,图片边长最大 8192px(15 张以上时降到 4096px)

最狠的是那个 384 token 封顶。用过 GPT-4o 的人都知道,OpenAI 的图片 token 按 tile 算,一张高清截图轻松吃掉上千 token。DeepSeek 直接一刀切:任何图,最多 384 tokens,大图小图一个价。做批量 OCR、截图分析这种场景,成本是可预测的——不用再担心用户上传一张 4K 截图就把预算打穿。

实测:报错截图 → 解决方案

光看文档不过瘾,我直接调 API 试了两次。

第一次,把一张软件界面截图丢给它:

输入:这张图片里有什么?用中文回答,50字以内。 输出:这是一张名为"Cumora"的AI团队协作平台界面截图。左侧显示对话列表,右侧是"Everyone"群聊,用户正在讨论AI智能体的"触发层"、可控性与可追溯性等产品设计问题。

界面布局、产品名、连对话里讨论的技术名词都读出来了。这水平不是"认出有文字",是真的读懂了界面。

第二次更有意思——我画了一张终端报错截图(Python 的 TimeoutError),让它提取报错并给方案:

输出:程序运行 app.py 时调用 api.py 的 query 函数,API 请求在 30 秒内没收到响应,抛出了 TimeoutError。常见诱因:网络问题、目标服务缓慢、请求参数错误、代理未正确配置。解决方法:调整超时设置……

报错提取一字不差,原因分析条理清楚,连"代理/VPN 问题"这种环境相关的原因都列出来了。对开发者来说,这个场景就是日常:报错截图扔进去,出来的是解决方案,不用再手动抄报错去搜。

三种传图方式,兼容三种 API

接入方式很"DeepSeek"——全面兼容现成生态,不逼你学新东西:

方式一:base64 内联(本地文件最简单)

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
import base64
from openai import OpenAI

client = OpenAI(api_key="<key>", base_url="https://api.deepseek.com")
b64 = base64.b64encode(open("image.jpg", "rb").read()).decode()

resp = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "这张图里有什么?"},
            {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}},
        ],
    }],
)
print(resp.choices[0].message.content)

方式二:外链 URL——传个公网图片地址就行,模型自己下载,单图限 32MiB、URL 限 8192 字符。

方式三:Files API——先传文件拿 file_id,再在请求里引用。图片复用多次、或者文件超过 32MiB 时用它,单图可到 64MiB。

三种方式都同时支持 OpenAI 兼容接口、Anthropic 兼容接口(/anthropic 端点)和 Responses API。也就是说,你现有的 OpenAI SDK 代码,改个模型名和 base_url 就能用

还有个细节:detail 参数可以控制处理精度——low 会把图缩到 512×512 再推理,更快更省;auto 目前等价于 original 原图。

和主流视觉模型比,性价比如何

维度 DeepSeek v4-flash-vision-exp GPT-4o mini (vision) Gemini Flash
图片计费 每张图 ≤384 tokens 封顶 按 tile 计费(大图贵) 按图片计费
单请求图片数 最多 600 张 通常个位数 通常个位数
输入价格/1M 约 $0.22(off-peak $0.11) $0.15 约 $0.075
输出价格/1M 约 $0.66(off-peak $0.33) $0.60 约 $0.30
API 兼容 OpenAI + Anthropic + Responses OpenAI Google 系

注:GPT-4o mini 与 Gemini 价格为其官方公开定价,DeepSeek 为 v4-flash 档位定价(视觉模型未单列,按 flash 计价)。

DeepSeek 这张牌打得很聪明:不跟 GPT-4o、Gemini 拼"谁看得更清楚"的天花板,而是用 384 token 封顶 + 600 张图批量 + 白菜价 切"开发者批量处理图片"这个场景。天花板可能不是最高,但地板价是真低。

丑话说前头

  • 这是 experimental 版,官方明说"实验性",生产环境用之前先压测
  • system 和 assistant 消息里不能放图,只有 user 消息能带图,传错返回 400——做 Agent 的人要注意,别把图塞进 system prompt
  • 没有单列的 benchmark 分数,视觉能力上限未知,复杂图表、细密文字的场景建议先自测
  • 图片 token 计算器在官方 token 页面,接入前建议算一下成本

一句话总结

DeepSeek 终于睁眼了。它没去追"最强视觉",而是用成本可预测切入——384 token 封顶、600 张批量、三套 API 兼容。对做截图分析、文档 OCR、UI 测试自动化的开发者,这个模型值得今晚就试一把。

代码 10 行就能跑通,成本可能比你想象的便宜。


搬砖程序员带你飞,专注 Golang / AI / 后端。每天一篇,讲清楚一个技术真相。

0%