DeepSeek-V4-Flash 看不了图片?用 pi-image-bridge 给它装一双眼睛

1286 字
6 分钟
DeepSeek-V4-Flash 看不了图片?用 pi-image-bridge 给它装一双眼睛

TL;DR: DeepSeek-V4-Flash-0731 任务通过率高、价格便宜,被大量用户设为主模型,但模型本身没有视觉能力。装一个 pi(AI 编程终端)扩展 pi-image-bridge,配置一个支持视觉的模型当副驾:主模型遇到图片,自动交给视觉模型分析成文字描述,再注入上下文。截图报错、设计稿、表格、无头浏览器截图都能看懂。安装一条命令,配置两个字段,默认关闭、按需开启。

我把一张报错截图丢给 DeepSeek-V4-Flash,它回:抱歉,我无法查看图片。

我盯着这行字看了三秒。这个干活又快又便宜的家伙,是个瞎子。

为什么 DeepSeek-V4-Flash 被这么多人设成主模型?#

DeepSeek-V4-Flash-0731 出来后,身边朋友一个接一个把它设成主模型。任务通过率高,缓存命中率还高,以至于整体价格便宜到能当默认模型挂着。写代码、写文档、查资料,跟贵价模型没差。

就是看不见图。

模型没有视觉能力,哪些场景最受影响?#

主模型不认图片,所有依赖”看图”的活儿都得人肉转述:

  • 截图报错:报错信息在截图里,只能手动敲给模型
  • UI 设计稿:改样式要看设计稿,调布局要对着效果图,视觉回归靠截图对比——图是前端开发的工作语言,主模型看不见,等于少半边手
  • 图表表格:数据在图片里,模型只能靠描述猜
  • 无头浏览器自动化:headless(无头)服务器没有屏幕,截图是唯一能看到页面状态的手段;脚本截了图,模型看不懂,断言和调试全靠猜

一次两次忍了,多了真的烦。为看张图换掉又便宜又顺手的模型?不值。

给它配个眼睛,才是正解。

怎么给 DeepSeek-V4-Flash 补上视觉能力?#

思路一句话:找个支持视觉的模型当副驾。主模型遇到图片,自动把图发给视觉模型;视觉模型看完,用文字把画面描述出来;主模型接着干活。

图片进不来,文字进得来。

pi-image-bridge 就是干这个的,项目地址->moewah/pi-image-bridge,它是基于 pi(AI 编程终端)的扩展,装上后两条路径自动接管:

  • 拖图进对话,自动分析、注入描述
  • 工具读到图(read 读截图、抓网页的图),同样自动处理

主模型”看”到的是一段准确描述。报错、布局、数字,一样不落。

deepseek-v4-flash+gpt-5.6-luna图片内容识别(测试截图)
deepseek-v4-flash+gpt-5.6-luna图片内容识别(测试截图)

pi-image-bridge 怎么安装?#

Terminal window
pi install npm:@moewah-dev/pi-image-bridge

装完重启 pi(或 /reload 重载一次),扩展加载时自动生成配置文件 ~/.pi/agent/pi-image-bridge.json,默认关闭状态,需要修改配置文件。

pi-image-bridge 怎么配置?#

一般只需要确认两个字段:enabled 设为 truevision.model 填一个支持视觉的模型,其余保持默认。不放心的话fallbackModels 再填一个备用模型。

配置文件 pi-image-bridge.json 修改示例,如下

{
"vision": {
"enabled": true,
"model": "opencode-go/gpt-5.6-luna",
"fallbackModels": [
"opencode-go/qwen3.7-plus"
],
"timeoutMs": 30000,
"maxImages": 4,
"force": false,
"cache": true
}
}

如果你订阅 OpenCode Go 其实有蛮多支持视觉的模型的,作为视觉模型便宜、好用是最主要的,例如在 OpenCode Go 套餐下的 opencode-go/gpt-5.6-luna、opencode-go/qwen3.7-plus 等都比较推荐使用。

各字段的用途:

字段作用
enabled总开关,true 启用
model主视觉模型,负责看懂图片
fallbackModels备用链,主模型限流或认证失败时自动顶上
timeoutMs单次视觉调用超时(毫秒),超时整批停止,不烧预算
maxImages一次最多分析的图片数,默认 4,防打爆上下文
force主模型本身支持图片时,是否强制走视觉辅助
cache会话内缓存,同图同要求只分析一次,省钱

几个值得知道的行为细节:

  • 模型失败自动切换:主视觉模型挂了,自动试备用链,不会因为一次限流就罢工
  • 会话内缓存:同图同要求只调一次,重复图直接命中,/image-bridge stats 能看实际花了多少
  • 图片数量上限:一次拖 10 张不会打爆上下文,默认最多分析 4 张,超出会提示
  • 全程可取消:按 Esc,正在跑的视觉调用立刻中止,不浪费额度

pi-image-bridge 支持哪些图片格式?#

PNG、JPEG、GIF、WebP 直接支持,BMP 也能读(自动转成 PNG 处理)。图片链路跟着 pi 主程序走,扩展能处理的格式和 pi 一致。

AVIF 暂时不支持。pi 的图片管线只认上述几种格式,其他格式一律尝试转成 PNG——AVIF 恰好卡在这一步:pi 内置的转换库解不了 AVIF,图片在到达扩展之前就被丢弃。这是 pi 主程序的限制,等 pi 官方支持 AVIF 解码,这边自然就通了。

DeepSeek-V4-Flash 用经济性把模型能力平民化了,pi-image-bridge 补的是它最后一块短板。主模型负责聪明,视觉模型负责看。各司其职,性价比最高的组合。

支持与分享

如果这篇文章对你有帮助,欢迎分享给更多人或赞助支持!

赞助
DeepSeek-V4-Flash 看不了图片?用 pi-image-bridge 给它装一双眼睛
https://blog.moewah.com/posts/deepseek-v4-vision-pi-image-bridge/
作者
MoeWah
发布于
2026-08-12
许可协议
CC BY-NC-SA 4.0
相关文章 智能推荐
1
有了 tmux 还需要 herdr 吗?一个给 AI Agent 用的「终端管家」
AI实验室 herdr 是一个终端原生的 Agent 多路复用器,专为同时运行多个 AI Agent 的开发者设计。它解决了 Agent 管理混乱、会话丢失、远程协作等痛点,不替换终端、不依赖 Electron。本文从实际使用体验出发,带你了解它的核心功能和上手方法。
2
Claude 深度研究指南:斯坦福验证的多视角提问法(附 4 个提示词)
AI实验室 斯坦福 STORM 方法实操版——用多视角提问让 Claude 做出博士级研究。5 种专家视角、矛盾地图、综合简报、同行评审,4 个可复制提示词。
3
Claude Code 的 CLAUDE.md 怎么写?这 12 条规则,管住 AI Agent 的静默失败
AI实验室 12 条 CLAUDE.md 规则完整指南,涵盖代码生成和 Agent 模式两个阶段。每条规则附带英文原文、中文解释和真实翻车场景。文末提供完整模板可直接复制。
4
你的 AI Agent 在替云厂商打工?73% 的 Token 消耗其实与你无关
AI实验室 Hermes Agent 社区因 Token 消耗过高爆发争议,73% 的 API 调用开销来自工具定义和系统提示。本文拆解 Token 税的构成与两派立场分歧,揭示 Coding Plan 退场后行业从补贴红利到精细化运营的转折。
5
告别国内 AI 订阅生态:OpenCode Go 接入 Claude Code 部署全流程
AI实验室 受不了国内 AI 订阅服务的封号和收割?用 OpenCode Go 每月 10 刀平替,通过 routatic-proxy(原项目oc-to-cc改名) 代理接入 Claude Code 的完整部署教程,附带多 Agent 省 token 方案。
随机文章 随机推荐

评论区

Profile Image of the Author

关于作者

MoeWah

我是 MoeWah,喵斯基部落的作者。一个折腾自托管、群晖 NAS、虚拟化运维与 SEO/GEO 实践的独立博主,10 年以上的企业站运维与SEO优化经验,文章来自真实部署与踩坑记录。为自己记录,为同路人分享。
专题
分类
站点统计
文章
205
分类
9
标签
449
总字数
413,413
运行时长
0
最后活动
0 天前

目录