让手机「看懂」照片需要几步?
阅读时间约 10 分钟视觉语言模型(VLM, Vision-Language Model)是一类能同时处理图像和文字的 AI 模型。它不仅能"读"文字,还能"看"图片——然后用自然语言来描述、分析和回答关于图像的问题。
VLM 的核心架构由三个部分组成:视觉编码器(Vision Encoder)负责"看"图片,语言模型(LLM)负责"说"文字,而连接器(Connector / Projector)则是它们之间的"翻译桥梁"——将视觉信号转换为语言模型能理解的表示。
一张照片从输入到文字输出,经历了以下步骤:
点击任意步骤查看说明
VLM 就像一个既会看照片又会写作的助手——先用眼睛(Vision Encoder)看图,再用大脑(LLM)组织语言来描述它。
纯文字的 LLM 已经很大了,而 VLM 还要额外加上一个视觉编码器——这意味着更多的参数和计算量。但真正让 VLM 变得"沉重"的,是图像的 Token 数量。
语言模型处理图像的方式,是将图片切分成许多小块(Patch),每个 Patch 变成一个 Token。分辨率越高,Token 数量呈平方级增长:
224 x 224 → ~196 tokens
336 x 336 → ~441 tokens
768 x 768 → ~2304 tokens
一张普通照片产生的 Token 数量,相当于一篇长文章的全部 Token。这就是为什么 VLM 需要大量内存和计算资源。
拖动滑块调整图像分辨率,观察 Token 数量的变化:
想象你用马赛克拼一幅画——像素越多,需要的马赛克方块就越多。高分辨率图片对 VLM 来说,就像阅读一本厚书。
AtomGradient 的 Gemma-Prune 研究提出了一种多阶段压缩流水线,专门针对 Gemma 3 4B VLM 进行优化。通过三个阶段的逐步压缩,将模型从 2.8 GB 缩小到 2.1 GB——体积减少 25%,同时保持出色的性能。
点击每个阶段查看详细说明,观察模型体积的变化:
多阶段压缩就像整理行李箱——先丢掉不需要的东西(剪枝),再把衣服卷起来节省空间(量化),最后所有东西都能装进更小的箱子。
当 VLM 足够小、足够快,能够直接在手机或平板上运行时,它就开启了一系列完全离线的视觉理解能力。最关键的是——你的照片永远不会离开你的设备。
拍一张照片,AI 自动识别内容、生成描述。"这是一只橘猫躺在蓝色沙发上。"
对着文件拍照,直接提取文字并理解内容。支持手写体、表格和多语言文档。
"这道菜大概多少卡路里?""这个零件是什么型号?"对着图片提问,获得即时回答。
为视障用户描述周围环境、读取路标、识别商品信息。AI 成为随身的"眼睛"。
端侧 VLM 就像给你的手机装上了一双"AI 眼睛"——它能看懂你拍的一切,而且完全在你的设备上运行,不需要联网,不会泄露隐私。
视觉编码器看图、语言模型说话、连接器做翻译,三者协同让 AI 既能看又能说。
一张图片产生 256-2304 个 Token,分辨率翻倍则 Token 数翻四倍,这是 VLM 体积大的关键原因。
通过视觉编码器优化、结构化剪枝和量化,Gemma-Prune 实现 25% 压缩和 3.4x 加速。
照片不离开设备,所有视觉理解在本地完成。AI 的能力与隐私保护不再矛盾。
当视觉模型小到能装进口袋,AI 就真正拥有了一双看见世界的眼睛。