personal_asset

多模态模型再强,也救不回被删掉的图

给自建知识库接上视觉大模型后,配图检索测出来是 0 张——问题不在模型强弱,是网页转正文那道「抓干净」的工序早把图片剔掉了。AI 工具的能力上限,常卡在它看不到的上游数据管道。

多模态模型再强,也救不回被删掉的图

我自己攒了个知识库,平时读到的文章、收藏的链接,都往里导,方便以后搜。前段时间给它接了个能「看图」的模型——Qwen3-VL-32B-Instruct,Qwen 团队 2025 年 10 月刚放出来的一款多模态模型,官方说它能做文档、图表、截图这类内容的深度视觉理解。

我盘算的是:库里不少文章的干货其实在配图里,一张对比表、一张流程图、一张报错截图,光搜文字搜不到这些内容。接上视觉模型之后,搜「某某流程图」应该能把对应文章直接翻出来。

那天晚上开着后台日志,把一篇带图的文章重新丢进去解析,等结果出来,图片数量那一栏写着:0。不是识别错了,是这篇文章从头到尾都没有一张图进过模型的眼睛。

我第一反应是模型没配对,翻了半天参数没问题,回头去查中间那一步——网页转成正文的那道工序。

网页转正文做的事情是「抓干净」:把广告、导航、侧边栏这些用不上的东西剔掉,只留下能读的那部分文字。这道工序干得很漂亮,副作用是它顺手把图片链接也当成了非文字的东西扔在外面。等这段干净的文字流到视觉模型面前,图片早就不在这段文字里了。模型再会看图,喂给它的输入里压根没有图,它能看的,从来只是别人递到它手上的那一份。

我为这层视觉能力多付了一笔按 token 计费的账单,换回来的是一个从没机会派上用场的功能。它对我直接上传的 PDF、截图、聊天里贴的图是真的管用——那些走的是另一条路径,图片原样跟着内容一起进去,没经过前面那道抓干净的工序。差的不是模型,差的是这张图有没有活着走到它面前。

这件事让我把自己另外几处接了 AI 的地方翻出来重新看了一遍:是不是也有类似情况——模型很新、参数很大,喂给它的东西却在它看到之前,已经被前面某道工序动过手。

大概率不止这一次犯这个毛病,只是这次刚好被「0」这个数字撞破了。以后接一个新的模型能力,我打算第一件事不是测模型强不强,是先把喂给它的那份输入原样打出来看一眼,到底还剩下什么。模型的天花板,常常不在模型这一层。

来源