header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

苹果开源LensVLM-9B:100页文档先压成图,KV缓存省84%

动察 Beating AI 快讯,苹果开源了专门处理长文档的视觉语言模型 LensVLM-9B,模型基于 Qwen3.5-9B-Base 训练。处理长文档时,它会先把整份文档压成低清页面快速扫一遍,定位到相关页面后,再读取其中的原始文字或高清图片。


这样就不用把全文都塞进模型上下文。论文测试一份 100 页文档时,直接读取全文需要 51,273 个 tokens,LensVLM 只用了 8,090 个。对应的 KV 缓存从约 1.6GB 降到 253MB,减少 84.2%。


压缩后准确率也没有明显下降。7 项文档问答测试中,直接读取全文的平均准确率为 72.4%,LensVLM 在约 4.3 倍压缩下仍有 68.9%。相比直接把文字缩成图片让模型识别,同样约 5 倍压缩时,准确率从 31.3% 提高到 68.9%。


不过,它目前会更慢。LensVLM 找到相关页面后,还要再调用一次工具读取原文,因此需要连续跑两轮推理。论文测试中,一次回答约需 17 秒;如果不用这套压缩方案,直接把整份文档作为文本输入 Qwen3.5-9B,一次生成答案约需 8 秒。

AI 解读
苹果开源LensVLM-9B,底座为Qwen3.5-9B-Base,把长文档拆成“低清页扫读—定位—回读原文”。此前PrismML把Qwen3.6-27B压进iPhone,苹果已接触;KV压缩正成端侧主线。

关键在延迟:100页全文输入51,273 tokens,LensVLM仅8,090,KV缓存从约1.6GB降至253MB,省84.2%;但两轮推理一次约17秒,直接文本输入Qwen3.5-9B仅约8秒。它以时间换内存,回读原文后约4.3倍压缩准确率仍68.9%,远高于文字转图压缩的31.3%。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成