AI 新词情报站 — 追踪 AI 领域新概念与新工具,每个词条都有论文、代码、社区讨论构成的交叉验证证据链

colibri

新工具

colibri(纯 C 本地 MoE 推理引擎)

🔍 Google 联想 8 📅 首次出现 2026-09-14

🧠 colibri 是什么

colibri 是 2026 年 7 月开源的 MoE 推理引擎,纯 C 实现、零依赖、Apache 2.0 许可,口号是"run models bigger than your machine"(跑比你机器更大的模型)。核心思路:MoE 权重不是要持有的状态,而是可按需分期的数据——以 GLM-5.2 为例,单个 token 只激活约 400 亿参数,其中约 11GB 是随 token 变化的 routed experts。colibri 把稠密权重常驻内存,把 19,456 个专家组织成存储层级:按实测路由热度决定哪些专家住 VRAM、哪些住固定 RAM、哪些从 NVMe 流式加载,路由器提前一层运行用预取隐藏延迟。\n\n工程上它声称 token-exact(与参考 transformers 实现逐 token 一致)、支持 CPU 或 GPU、6 个后端 4 个平台,当前版本 v1.11.0;已支持 GLM-5.2/5.3、GLM-5.3-Flash、Qwen3.8-Flash-Next 等多个模型家族。项目 2026-07-01 创建,2026-09-13 单日冲上 GitHub Trending 第一(29,700+ stars、100+ 贡献者),开源社区的"本地跑千亿参数"运动代表项目。

🔥 为什么现在火

开源社区对"本地跑前沿模型"的需求在 2026 年爆发:大厂模型越做越大(万亿参数 MoE),个人硬件够不着;colibri 证明了磁盘流式专家 + 分级缓存能让 32GB 家用机跑 2.8T 参数模型,9 月 13 日登 GitHub Trending 榜首直接反映热度。

📄 证据链(交叉验证)

🔍 搜索形态

colibri AI colibri MoE colibri 推理引擎 colibri github

colibri 常见问题 FAQ

colibri 是什么?+

纯 C、零依赖、Apache 2.0 的开源 MoE 推理引擎,通过磁盘流式加载专家权重和分级缓存,让 2.8 万亿参数模型能在 32GB 内存的机器上运行。

colibri 和 llama.cpp 有什么区别?+

llama.cpp 是通用本地推理引擎(主要针对单机内存范围内的模型);colibri 专攻超大规模 MoE,把 1 万+ 专家按热度分到 VRAM/内存/NVMe 三级存储,目标是跑"比你机器更大的模型"。

colibri 怎么做到 32GB 跑 2.8T 模型?+

MoE 每 token 只激活一小部分专家(如 GLM-5.2 约 400 亿参数),colibri 把不活跃专家存磁盘、按路由热度提前预取,所以内存占用取决于活跃专家而非模型总大小。

与 colibri 相关的搜索

人们搜索 colibri 时,还会关心这些问题:

  • colibri 是什么
  • 什么是 colibri
  • colibri ai 是什么意思
  • colibri 原理
  • colibri 有什么用
  • colibri MoE 引擎
  • colibri 本地大模型
  • colibri 2026

相关词条

更多新工具:同类新词