DeepSeek 睁眼了:视觉模型上线,实测把报错截图变成解决方案

DeepSeek 一直有个尴尬:推理强到能写论文,但"看不见"。别的模型早就看图说话了,它家 API 里只有纯文本模型——你截个报错图发给它,它只能干瞪眼。
这个短板,本周补上了。
一个 384 token 封顶的视觉模型
DeepSeek 官方 API 悄然上线了一个实验性模型:deepseek-v4-flash-vision-exp。名字很直白——在 v4-flash 基础上加了视觉能力,实验版。
几个关键参数,全是官方文档里的硬数字:
- 支持格式:JPEG、PNG、GIF、WebP(按文件真实内容识别,不看你文件名)
- 单请求最多 600 张图,单图最大 32MiB(base64/URL 方式)或 64MiB(Files API 方式)
- 每张图最多 384 tokens,超了自动缩放——2000×2000 和 5000×5000 的图,花一样的钱
- 请求体上限 48MiB,图片边长最大 8192px(15 张以上时降到 4096px)
最狠的是那个 384 token 封顶。用过 GPT-4o 的人都知道,OpenAI 的图片 token 按 tile 算,一张高清截图轻松吃掉上千 token。DeepSeek 直接一刀切:任何图,最多 384 tokens,大图小图一个价。做批量 OCR、截图分析这种场景,成本是可预测的——不用再担心用户上传一张 4K 截图就把预算打穿。
实测:报错截图 → 解决方案
光看文档不过瘾,我直接调 API 试了两次。
第一次,把一张软件界面截图丢给它:
输入:这张图片里有什么?用中文回答,50字以内。 输出:这是一张名为"Cumora"的AI团队协作平台界面截图。左侧显示对话列表,右侧是"Everyone"群聊,用户正在讨论AI智能体的"触发层"、可控性与可追溯性等产品设计问题。
界面布局、产品名、连对话里讨论的技术名词都读出来了。这水平不是"认出有文字",是真的读懂了界面。
第二次更有意思——我画了一张终端报错截图(Python 的 TimeoutError),让它提取报错并给方案:

输出:程序运行 app.py 时调用 api.py 的 query 函数,API 请求在 30 秒内没收到响应,抛出了 TimeoutError。常见诱因:网络问题、目标服务缓慢、请求参数错误、代理未正确配置。解决方法:调整超时设置……
报错提取一字不差,原因分析条理清楚,连"代理/VPN 问题"这种环境相关的原因都列出来了。对开发者来说,这个场景就是日常:报错截图扔进去,出来的是解决方案,不用再手动抄报错去搜。
三种传图方式,兼容三种 API
接入方式很"DeepSeek"——全面兼容现成生态,不逼你学新东西:
方式一:base64 内联(本地文件最简单)
|
|
方式二:外链 URL——传个公网图片地址就行,模型自己下载,单图限 32MiB、URL 限 8192 字符。
方式三:Files API——先传文件拿 file_id,再在请求里引用。图片复用多次、或者文件超过 32MiB 时用它,单图可到 64MiB。
三种方式都同时支持 OpenAI 兼容接口、Anthropic 兼容接口(/anthropic 端点)和 Responses API。也就是说,你现有的 OpenAI SDK 代码,改个模型名和 base_url 就能用。
还有个细节:detail 参数可以控制处理精度——low 会把图缩到 512×512 再推理,更快更省;auto 目前等价于 original 原图。
和主流视觉模型比,性价比如何
| 维度 | DeepSeek v4-flash-vision-exp | GPT-4o mini (vision) | Gemini Flash |
|---|---|---|---|
| 图片计费 | 每张图 ≤384 tokens 封顶 | 按 tile 计费(大图贵) | 按图片计费 |
| 单请求图片数 | 最多 600 张 | 通常个位数 | 通常个位数 |
| 输入价格/1M | 约 $0.22(off-peak $0.11) | $0.15 | 约 $0.075 |
| 输出价格/1M | 约 $0.66(off-peak $0.33) | $0.60 | 约 $0.30 |
| API 兼容 | OpenAI + Anthropic + Responses | OpenAI | Google 系 |
注:GPT-4o mini 与 Gemini 价格为其官方公开定价,DeepSeek 为 v4-flash 档位定价(视觉模型未单列,按 flash 计价)。
DeepSeek 这张牌打得很聪明:不跟 GPT-4o、Gemini 拼"谁看得更清楚"的天花板,而是用 384 token 封顶 + 600 张图批量 + 白菜价 切"开发者批量处理图片"这个场景。天花板可能不是最高,但地板价是真低。
丑话说前头
- 这是 experimental 版,官方明说"实验性",生产环境用之前先压测
- system 和 assistant 消息里不能放图,只有 user 消息能带图,传错返回 400——做 Agent 的人要注意,别把图塞进 system prompt
- 没有单列的 benchmark 分数,视觉能力上限未知,复杂图表、细密文字的场景建议先自测
- 图片 token 计算器在官方 token 页面,接入前建议算一下成本
一句话总结
DeepSeek 终于睁眼了。它没去追"最强视觉",而是用成本可预测切入——384 token 封顶、600 张批量、三套 API 兼容。对做截图分析、文档 OCR、UI 测试自动化的开发者,这个模型值得今晚就试一把。
代码 10 行就能跑通,成本可能比你想象的便宜。
搬砖程序员带你飞,专注 Golang / AI / 后端。每天一篇,讲清楚一个技术真相。
