DeepSeek-V4-Flash 看不了图片?用 pi-image-bridge 给它装一双眼睛
TL;DR: DeepSeek-V4-Flash-0731 任务通过率高、价格便宜,被大量用户设为主模型,但模型本身没有视觉能力。装一个 pi(AI 编程终端)扩展 pi-image-bridge,配置一个支持视觉的模型当副驾:主模型遇到图片,自动交给视觉模型分析成文字描述,再注入上下文。截图报错、设计稿、表格、无头浏览器截图都能看懂。安装一条命令,配置两个字段,默认关闭、按需开启。
我把一张报错截图丢给 DeepSeek-V4-Flash,它回:抱歉,我无法查看图片。
我盯着这行字看了三秒。这个干活又快又便宜的家伙,是个瞎子。
为什么 DeepSeek-V4-Flash 被这么多人设成主模型?
DeepSeek-V4-Flash-0731 出来后,身边朋友一个接一个把它设成主模型。任务通过率高,缓存命中率还高,以至于整体价格便宜到能当默认模型挂着。写代码、写文档、查资料,跟贵价模型没差。
就是看不见图。
模型没有视觉能力,哪些场景最受影响?
主模型不认图片,所有依赖”看图”的活儿都得人肉转述:
- 截图报错:报错信息在截图里,只能手动敲给模型
- UI 设计稿:改样式要看设计稿,调布局要对着效果图,视觉回归靠截图对比——图是前端开发的工作语言,主模型看不见,等于少半边手
- 图表表格:数据在图片里,模型只能靠描述猜
- 无头浏览器自动化:headless(无头)服务器没有屏幕,截图是唯一能看到页面状态的手段;脚本截了图,模型看不懂,断言和调试全靠猜
一次两次忍了,多了真的烦。为看张图换掉又便宜又顺手的模型?不值。
给它配个眼睛,才是正解。
怎么给 DeepSeek-V4-Flash 补上视觉能力?
思路一句话:找个支持视觉的模型当副驾。主模型遇到图片,自动把图发给视觉模型;视觉模型看完,用文字把画面描述出来;主模型接着干活。
图片进不来,文字进得来。
pi-image-bridge 就是干这个的,项目地址->moewah/pi-image-bridge,它是基于 pi(AI 编程终端)的扩展,装上后两条路径自动接管:
- 拖图进对话,自动分析、注入描述
- 工具读到图(read 读截图、抓网页的图),同样自动处理
主模型”看”到的是一段准确描述。报错、布局、数字,一样不落。

pi-image-bridge 怎么安装?
pi install npm:@moewah-dev/pi-image-bridge装完重启 pi(或 /reload 重载一次),扩展加载时自动生成配置文件 ~/.pi/agent/pi-image-bridge.json,默认关闭状态,需要修改配置文件。
pi-image-bridge 怎么配置?
一般只需要确认两个字段:enabled 设为 true,vision.model 填一个支持视觉的模型,其余保持默认。不放心的话fallbackModels 再填一个备用模型。
配置文件 pi-image-bridge.json 修改示例,如下
{ "vision": { "enabled": true, "model": "opencode-go/gpt-5.6-luna", "fallbackModels": [ "opencode-go/qwen3.7-plus" ], "timeoutMs": 30000, "maxImages": 4, "force": false, "cache": true }}如果你订阅 OpenCode Go 其实有蛮多支持视觉的模型的,作为视觉模型便宜、好用是最主要的,例如在 OpenCode Go 套餐下的 opencode-go/gpt-5.6-luna、opencode-go/qwen3.7-plus 等都比较推荐使用。
各字段的用途:
| 字段 | 作用 |
|---|---|
enabled | 总开关,true 启用 |
model | 主视觉模型,负责看懂图片 |
fallbackModels | 备用链,主模型限流或认证失败时自动顶上 |
timeoutMs | 单次视觉调用超时(毫秒),超时整批停止,不烧预算 |
maxImages | 一次最多分析的图片数,默认 4,防打爆上下文 |
force | 主模型本身支持图片时,是否强制走视觉辅助 |
cache | 会话内缓存,同图同要求只分析一次,省钱 |
几个值得知道的行为细节:
- 模型失败自动切换:主视觉模型挂了,自动试备用链,不会因为一次限流就罢工
- 会话内缓存:同图同要求只调一次,重复图直接命中,
/image-bridge stats能看实际花了多少 - 图片数量上限:一次拖 10 张不会打爆上下文,默认最多分析 4 张,超出会提示
- 全程可取消:按 Esc,正在跑的视觉调用立刻中止,不浪费额度
pi-image-bridge 支持哪些图片格式?
PNG、JPEG、GIF、WebP 直接支持,BMP 也能读(自动转成 PNG 处理)。图片链路跟着 pi 主程序走,扩展能处理的格式和 pi 一致。
AVIF 暂时不支持。pi 的图片管线只认上述几种格式,其他格式一律尝试转成 PNG——AVIF 恰好卡在这一步:pi 内置的转换库解不了 AVIF,图片在到达扩展之前就被丢弃。这是 pi 主程序的限制,等 pi 官方支持 AVIF 解码,这边自然就通了。
DeepSeek-V4-Flash 用经济性把模型能力平民化了,pi-image-bridge 补的是它最后一块短板。主模型负责聪明,视觉模型负责看。各司其职,性价比最高的组合。
支持与分享
如果这篇文章对你有帮助,欢迎分享给更多人或赞助支持!