subquadratic attention
概念词亚二次注意力
🧠 subquadratic attention 是什么
subquadratic attention(亚二次注意力)指注意力机制的计算/内存复杂度低于 O(n²) 的模型设计总称,包括线性注意力、稀疏注意力、SSA(SubQuadratic Sparse Attention)、选择性注意力等具体形态。传统 softmax 注意力随序列长度二次增长,长上下文推理时成为主要瓶颈;亚二次注意力通过近似、稀疏化或结构化分解,让模型在更长序列上保持可负担的推理成本。
2026 年系统研究《Rethinking Heterogeneous System Disaggregation for Subquadratic Attention》指出,前沿语言模型正越来越激进地采用亚二次注意力来降低推理内存占用与算力,同时保持前沿精度;论文提出 SQD(SubQuadratic Disaggregation)方案,针对亚二次注意力模型独特的算术强度与内存足迹,在 DRAM 与 SRAM 异构系统上做细粒度拆分,获得显著的吞吐与能效提升。该论文 2026-09-11 提交,arxiv 精确短语命中 6 篇(最早 2025-05)。
🔥 为什么现在火
2026 年长上下文与推理成本是 LLM 主线话题:模型序列越做越长,平方级注意力在推理侧的成本暴露越明显,亚二次注意力成为架构与系统两侧的共同解法;本批 arxiv 论文(SQD)把系统层面的注意力拆分优化单独拎出来研究,说明它已经从论文概念变成了工程落地的现实问题。
📄 证据链(交叉验证)
- ▸arxiv《Rethinking Heterogeneous System Disaggregation for Subquadratic Attention》(2026-09-11)
- ▸arxiv 搜索 all:"subquadratic attention"(6 篇)
🔍 搜索形态
subquadratic attention subquadratic attention paper subquadratic sparse attention 亚二次注意力
subquadratic attention 常见问题 FAQ
subquadratic attention 是什么?+
注意力计算与内存复杂度低于 O(n²) 的模型设计总称,包括线性注意力、稀疏注意力等形态,目标是让长序列推理成本可负担。
它和标准 attention 有什么区别?+
标准 softmax 注意力对每个 token 都要和全部历史 token 计算权重,O(n²) 开销随序列长度爆炸;亚二次注意力通过稀疏化、近似或结构化分解换成线性或近线性复杂度。
哪些模型用亚二次注意力?+
论文称前沿语言模型正更激进地采用亚二次注意力,包括各类线性注意力与稀疏注意力(SSA 等)变体,主要用于降低推理时的内存与算力需求。
与 subquadratic attention 相关的搜索
人们搜索 subquadratic attention 时,还会关心这些问题:
- subquadratic attention 是什么
- 什么是 subquadratic attention
- subquadratic attention 是什么意思
- subquadratic attention 原理
- subquadratic attention 有什么用
- subquadratic attention 应用场景
- 亚二次注意力 模型
- subquadratic attention 2026