Vision Token Pruning
概念词视觉令牌剪枝(MLLM 效率优化)
🧠 Vision Token Pruning 是什么
Vision token pruning(视觉令牌剪枝)指多模态大语言模型(MLLM/LVLM)在处理图像输入时,减少进入长上下文注意力计算的视觉 token(visual token)数量的技术。MLLM 视觉编码器会把一张图切成几十到几百个 patch,每个 patch 变成一个 token,导致视觉 token 占比远超文本、计算与显存开销巨大;视觉令牌剪枝则按\"哪些视觉 token 重要\"对它们做裁剪、压缩或采样,保留关键信息而丢弃冗余,从而显著提升推理效率。\n\n2026-09 批次的一批新论文正集中深化这一方向:\"Beyond One-Size-Fits-All: Sample-Adaptive Strategy Routing for Vision Token Pruning in MLLMs\"提出按样本自适应的策略路由去剪视觉 token;PLPHP("Per-Layer Per-Head Vision Token Pruning for Efficient Large-Vision-Language Models",arxiv 2609.10346)提出逐层逐头的视觉令牌剪枝;更早的 QAPruner(2502.14504)则把量化和剪枝结合。arxiv 全库关于\"vision token pruning\"的精确命中约 21 篇,最早出现在 2025 年,属正在快速上升的细分方向。
🔥 为什么现在火
MLLM 普及后\"图像 token 吃掉绝大多数算力\"成为部署硬瓶颈:一张图顶几百个 token,长上下文、实时对话、端侧部署都受拖累;2025-2026 年涌现大量把 token 剪枝/压缩用到视觉方向的论文(样本自适应路由、逐层逐头剪枝等),是\"高质量、低算力多模态\"浪潮的技术抓手。
📄 证据链(交叉验证)
- ▸arxiv《PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large-Vision-Language Models》(2026-09)
- ▸arxiv《QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models》(2025-02)
🔍 搜索形态
Vision Token Pruning 视觉令牌剪枝 MLLM token 剪枝 视觉 token 压缩
Vision Token Pruning 常见问题 FAQ
vision token pruning 是什么意思?+
多模态大模型里减少参与注意力计算的视觉 token 数量的技术,只保留关键视觉信息,从而降低计算量、显存与推理延迟。
它和文本 token 剪枝、量化有什么不同?+
它针对的是视觉 patch 转成的 token,按图像内容重要性裁剪;量化压缩的是权重精度,两者目标不同但常被结合使用(如 QAPruner)。
vision token pruning 有什么用?+
让 MLLM 在图像输入下更快更省:降低延迟与显存,支持更长上下文、实时对话和端侧部署,是 2025 年后\"多模态提效\"的关键研究方向。
与 Vision Token Pruning 相关的搜索
人们搜索 Vision Token Pruning 时,还会关心这些问题:
- vision token pruning 是什么
- 什么是 vision token pruning
- vision token pruning 是什么意思
- vision token pruning 原理
- vision token pruning 有什么用
- vision token pruning 应用场景
- vision token pruning 为什么火
- vision token pruning 2026