
【免费下载链接】LensVLM-9B项目地址https://ai.gitcode.com/hf_mirrors/apple/LensVLM-9B点击查看免费下载LensVLM-9B 是 Apple 发布的一款 9B 参数规模的视觉语言模型VLM其核心思路是先浏览文本的压缩页图像再借助习得的工具learned tools只把与问题相关的页面选择性扩展回未压缩形式从而在极低视觉 token 开销下完成长文档问答。本篇指南以本仓库HuggingFace 模型镜像中的 README.md 为骨架结合 config.json、processor_config.json、chat_template.jinja 等模型配置文件带你完整理解其架构设计与压缩-扩展推理范式并给出可复现的安装、推理命令与压缩比参数说明。读完本文你将掌握 LensVLM-9B 的模型结构、预处理管线、对话模板机制以及如何对其输入自定义文档并调节5x / 10x / 15x压缩比完成长文本视觉问答。一、模型概述从压缩浏览到选择性扩展LensVLM is a 9B Vision Language Model (VLM) that scans compressed images of text, then selectively expands only the relevant pages to their uncompressed form via learned tools.这是 README.md 对 LensVLM 的一句话定义也是理解整个模型的钥匙压缩浏览Compressed Scan输入不是整篇长文而是把文本渲染、压缩成页面图像page images模型以图像方式扫一遍全文视觉 token 开销被大幅压低选择性扩展Selective Expansion模型在浏览过程中通过习得的工具调用判断哪些页面与当前问题相关仅将这些页面解压回未压缩文本并纳入上下文按需扩容Context Expansion最终送入解码器的上下文是由压缩全景 少量被选中的全文页组成兼顾信息完整性与上下文长度控制。该模型配套论文为LensVLM: Selective Context Expansion for Compressed Visual Representation of TextarXiv:2605.07019配套推理代码单独发布在官方 ml-lensvlm 仓库链接见 README 的 Code 一节。本仓库是模型权重卡仓库即模型权重的托管镜像包含 README.md、config.json、generation_config.json、processor_config.json、tokenizer.json、tokenizer_config.json、chat_template.jinja、model.safetensors 以及 LICENSE、NOTICE、ACKNOWLEDGEMENTS 等法律与致谢文件。注意推理脚本并不在本仓库内而是位于官方 ml-lensvlm 代码仓库使用时需按下文安装与推理一节操作。二、仓库文件速览与定位文件作用README.md模型卡核心思想、许可证、Usage 命令、引用信息config.json模型架构与训练/推理设置Qwen3.5 衍生架构 Apple 调优参数generation_config.json解码阶段默认参数eos/pad token、use_cacheprocessor_config.json图像/视频预处理默认值面向压缩页渲染tokenizer.json / tokenizer_config.json分词器与特殊 token 定义chat_template.jinja对话模板多模态占位符、思考模式、工具调用格式model.safetensors模型权重本镜像中为 136 字节的 git-lfs 指针占位文件LICENSE / NOTICE / ACKNOWLEDGEMENTSApple 模型许可、修改声明、上游致谢从文件大小可以推断本镜像中的model.safetensors136 字节与tokenizer.json133 字节均为 git-lfs 指针占位文件实际权重与词表由 Transformers 在加载模型时按需从托管仓库下载因此推理环境需要具备网络访问能力。三、模型架构与关键配置解析config.jsonconfig.json 声明了model_type: qwen3_5、架构类Qwen3_5ForConditionalGeneration权重精度bfloat16由 Transformers 5.2.0 序列化。根据 NOTICE 的声明模型架构、hidden size、层数、层类型与词表大小均与上游 Qwen3.5-9B 保持一致Apple 的修改集中在权重微调与推理相关配置上。3.1 文本端text_config32 层混合注意力文本端关键参数如下参数值说明hidden_size4096隐层维度num_hidden_layers32总层数intermediate_size12288FFN 中间维度hidden_act 为 silunum_attention_heads16注意力头数head_dim 256num_key_value_heads4KV 头数GQAfull_attention_interval4每隔 4 层放置一个全注意力层max_position_embeddings262144最大序列长度256Kvocab_size248320词表大小use_cachefalse训练配置中关闭 KV cachelayer_types数组给出了 32 层的具体排布共24 个linear_attention层 8 个full_attention层全注意力层位于第 4、8、12、16、20、24、28、32 层即每隔 4 层一个索引从 3 开始。这种线性注意力为主、稀疏全注意力兜底的混合结构正是 Qwen3.5 系列面向超长上下文的设计线性注意力层具备linear_conv_kernel_dim: 4、linear_num_key_heads: 16、linear_num_value_heads: 32、linear_key_head_dim: 128、linear_value_head_dim: 128等参数并以mamba_ssm_dtype: float32计算 SSM 部分。位置编码方面rope_parameters采用mRoPE多模态旋转位置编码mrope_interleaved: true、mrope_section: [11, 11, 10]文本/图像高度/图像宽度三段各 11/11/10 维、rope_theta: 10000000、partial_rotary_factor: 0.25。这与视觉输入的空间坐标编码直接相关——图像 token 拥有独立的行、列位置分量使模型能感知页面上文字的空间布局这正是扫描压缩页图像的底层基础。3.2 视觉端vision_config27 层视觉编码器视觉端model_type: qwen3_5关键参数参数值说明depth27视觉 Transformer 层数hidden_size1152视觉隐层维度intermediate_size4304视觉 FFN 维度gelu_pytorch_tanhnum_heads16视觉注意力头数patch_size16patch 尺寸 16×16spatial_merge_size2空间合并因子2×2 合并为一个视觉 tokentemporal_patch_size2时间维 patch支持视频out_hidden_size4096输出投影维度与文本 hidden_size 对齐num_position_embeddings2304视觉位置嵌入数量也就是说16×16 patch 切分 → 2×2 空间合并 → 经 27 层编码器 → 投影到 4096 维与文本隐层对齐。这套视觉子网与 Qwen2.5-VL/Qwen3 系列同源保证了处理超高分辨率页面图像时的效率结合 processor 的max_pixels限制见下文。3.3 多模态特殊 tokenconfig.json与 tokenizer_config.json 共同定义了以下多模态标记token id 见 configTokenid用途|vision_start|248053视觉内容起始|vision_end|248054视觉内容结束|image_pad|248056图像占位|video_pad|248057视频占位|im_end|248046对话结束符eos|endoftext|248044填充符pad对话中图像被渲染为|vision_start||image_pad||vision_end|的 token 序列由 chat 模板自动插入见第六节。四、长上下文设计与压缩页渲染LensVLM-9B 的文本端max_position_embeddings为262144256Ktokenstokenizer_config.json 中的model_max_length同样为 262144这说明模型原生支持超长输入。但能支持长上下文不等于每个 token 都值得付账——这正是 LensVLM 压缩浏览范式的动机不把整篇文档的全文逐字送入而是先把文档按页渲染为图像并压缩让模型以极少的视觉 token 获得全文版面级概览解码过程中模型通过工具调用挑选与问题相关的页面将选中的页面扩展为未压缩文本进入上下文于是长文档问答的 token 成本 ≈ 压缩页图像 token 少数相关页的全文 token远低于全量长上下文。NOTICE 明确写道model.safetensors是 Apple 为压缩页面图像上的选择性上下文扩展selective context expansion over compressed page images而微调的权重而 processor_config.json 则是 为压缩页渲染compressed-page rendering设定的图像/视频预处理默认值——配置文件与模型卡互为印证。五、安装与推理从默认 Demo 到自定义文档以下命令全部继承自 README.md 的 Usage 一节可直接复现。5.1 环境准备LensVLM 的推理代码不在本权重仓库内需先获取官方 ml-lensvlm 代码仓库README 的 Code 一节给出了仓库地址git clone https://github.com/apple-aiml-research/ml-lensvlm cd ml-lensvlm pip install -r requirements.txt随后通过 Transformers 从模型仓库加载apple/LensVLM-9B权重首次运行会自动下载权重与词表请确保网络可用。注意模型权重受 LICENSE 约束仅限非商业研究用途使用前请阅读许可条款见第八节。5.2 运行默认 Demopython scripts/run_demo.py --model apple/LensVLM-9B该命令会加载模型并运行内置演示用于快速验证环境与推理链路是否打通。5.3 对自定义文档提问python demo.py \ --model apple/LensVLM-9B \ --text_file document.txt \ --question What is the main finding? \ --compression 10x各参数含义参数说明--model模型标识填apple/LensVLM-9B--text_file待分析的本地文本文档路径如document.txt会被按页渲染并压缩为页面图像--question用户问题模型据此决定要扩展哪些页面如What is the main finding?--compression页面图像压缩比可选5x、10x、15x5.4 压缩比选项5x / 10x / 15xREADME 明确给出三档压缩选项5x、10x、15x。可以推断压缩比越高如 15x单页图像占用的视觉 token 越少浏览全文的 token 成本越低但页面细节损失越大对压缩图像中可读信息的依赖越强压缩比越低如 5x页面细节保留更完整视觉 token 开销相应上升实际使用时建议针对文档类型与问题粒度做小规模对比实验版面复杂、数字密集的文档可先用低压缩比纯文本长文可尝试高压缩比。数据准备与评测的详细流程包括页面渲染脚本、评测集组织方式等在官方 ml-lensvlm 仓库 README 中有完整说明可结合使用。六、图像与视频预处理配置processor_config.jsonprocessor_config.json 定义了输入侧预处理processor_class为Qwen3VLProcessor图像处理器为Qwen2VLImageProcessorFast。关键图像参数参数值说明do_convert_rgb / do_rescale / do_normalize / do_resizetrue标准管线转 RGB → 缩放 → 归一化 → 重采样image_mean / image_std0.5 / 0.5三通道归一化均值与标准差rescale_factor0.00392156862745098即 1/255像素值缩放patch_size16与 vision_config 对齐merge_size2空间合并 2×2temporal_patch_size2时间维 patchmin_pixels / max_pixels1 / 1572864单张图像像素数下限/上限上限约 1.57M即约 1024×1536 量级size.longest_edge / shortest_edge16777216 / 65536重采样边界约束这些默认值直接服务于压缩页渲染max_pixels限制单页图像规模保证超高分辨率页面被缩放到模型可接受的范围patch_size与merge_size则决定了每页图像最终产生的视觉 token 数量。视频处理器Qwen3VLVideoProcessor还提供fps: 2、max_frames: 768、min_frames: 4等帧采样默认值。七、生成配置与解码默认值generation_config.jsongeneration_config.json 由 Apple 设定作为解码默认值eos_token_id: [248046, 248044]|im_end|与|endoftext|均作为结束符pad_token_id: 248044use_cache: true推理时启用 KV cache与 config.json 中训练用的use_cache: false形成对比同一模型在训练与推理阶段采用不同 cache 策略。八、对话模板与提示格式chat_template.jinjachat_template.jinja 与上游 Qwen3.5 逐字节一致NOTICE 声明其未修改承担多模态消息的组装工作值得关注的行为包括图像/视频占位消息中的图像被渲染为|vision_start||image_pad||vision_end|当开启add_vision_id时会自动追加Picture N:前缀用于编号定位系统消息约束系统消息中不允许包含图像或视频会直接抛异常且必须位于消息序列开头思考模式thinkingadd_generation_prompt开启后模板会以|im_start|assistant\nthink\n结尾引导模型先推理enable_thinkingfalse时则输出空的think\n\n/think块实现关闭思考工具调用格式若消息携带tools模板会注入# Tools系统指令并规定tool_callfunction....../function/tool_call的 XML 调用格式。这一机制与 LensVLM选择性扩展页面的习得工具直接相关——模型正是通过工具调用请求解压相关页面。九、许可、致谢与合规要点LensVLM-9B 的许可结构分为两层详见 LICENSE 与 NOTICE模型权重受Apple Machine Learning Research Model License约束。该许可授予个人、非独占、不可转让、可撤销的非商业研究用途许可Research Purposes 指以推进科学知识为目的的实验、分析、测试明确排除商业产品开发与商业服务再分发时须附带协议副本并保留归属声明。源代码官方 ml-lensvlm 推理代码另行发布遵循Apple Sample Code License。同时NOTICE 与 ACKNOWLEDGEMENTS 声明LensVLM-9B 权重是Qwen3.5-9BApache License 2.0Copyright 2026 Alibaba Cloud的衍生作品Apple 的修改被明确标记为 NOT A CONTRIBUTION修改涉及model.safetensors为压缩页选择性扩展微调、config.json以新版 Transformers 重序列化并更新训练/推理设置但架构、hidden size、层数、层类型、词表大小不变、tokenizer.json/tokenizer_config.json重序列化词表逐字节一致、generation_config.json/processor_config.jsonApple 设定的解码与预处理默认值chat_template.jinja未修改页面渲染使用的 DejaVu 字体等第三方材料在 ACKNOWLEDGEMENTS 中致谢。因此在研究引用与合规使用前请完整阅读上述三个文件确认你的使用场景符合 Apple 研究许可的限制。十、引用与延伸阅读若在你的研究或论文中使用了 LensVLM-9B请按 README.md 提供的方式引用article{xie2026lensvlm, title{LensVLM: Selective Context Expansion for Compressed Visual Representation of Text}, author{Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal{arXiv preprint arXiv:2605.07019}, year{2026} }进一步深入可依次阅读本仓库中的 config.json架构细节、processor_config.json压缩页预处理、chat_template.jinja工具调用与思考格式以及 NOTICE修改声明再结合官方 ml-lensvlm 代码仓库的demo.py、scripts/run_demo.py与requirements.txt复现完整推理流程。赞分享【免费下载链接】LensVLM-9B项目地址https://ai.gitcode.com/hf_mirrors/apple/LensVLM-9B点击查看免费下载相关推荐【性能超越Llama3】GLM-4-9B-Chat模型家族全解析从9B到1M上下文的选型指南【性能超越Llama3】GLM 4 9B Chat模型家族全解析从9B到1M上下文的选型指南 你还在为模型选型头疼读完这篇让你秒变GLM专家 在大语言模型GHelper华硕笔记本控制工具替代 Armoury Crate 的完整指南GHelper华硕笔记本控制工具替代 Armoury Crate 的完整指南 GHelper 是一款开源的华硕笔记本控制工具用来替代官方 Armoury桌面应用系统编程animatescroll.js vs 原生scroll为什么选择这款jQuery滚动插件animatescroll.js vs 原生scroll为什么选择这款jQuery滚动插件 在网页开发中滚动交互是提升用户体验的关键元素。原生JavaScUI库/组件前端创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考