colibri
新工具colibri(纯 C 本地 MoE 推理引擎)
🧠 colibri 是什么
colibri 是 2026 年 7 月开源的 MoE 推理引擎,纯 C 实现、零依赖、Apache 2.0 许可,口号是"run models bigger than your machine"(跑比你机器更大的模型)。核心思路:MoE 权重不是要持有的状态,而是可按需分期的数据——以 GLM-5.2 为例,单个 token 只激活约 400 亿参数,其中约 11GB 是随 token 变化的 routed experts。colibri 把稠密权重常驻内存,把 19,456 个专家组织成存储层级:按实测路由热度决定哪些专家住 VRAM、哪些住固定 RAM、哪些从 NVMe 流式加载,路由器提前一层运行用预取隐藏延迟。\n\n工程上它声称 token-exact(与参考 transformers 实现逐 token 一致)、支持 CPU 或 GPU、6 个后端 4 个平台,当前版本 v1.11.0;已支持 GLM-5.2/5.3、GLM-5.3-Flash、Qwen3.8-Flash-Next 等多个模型家族。项目 2026-07-01 创建,2026-09-13 单日冲上 GitHub Trending 第一(29,700+ stars、100+ 贡献者),开源社区的"本地跑千亿参数"运动代表项目。
🔥 为什么现在火
开源社区对"本地跑前沿模型"的需求在 2026 年爆发:大厂模型越做越大(万亿参数 MoE),个人硬件够不着;colibri 证明了磁盘流式专家 + 分级缓存能让 32GB 家用机跑 2.8T 参数模型,9 月 13 日登 GitHub Trending 榜首直接反映热度。
📄 证据链(交叉验证)
- ▸colibri 官网(引擎原理/模型家族/基准)
- ▸GitHub: JustVugg/colibri(29.7k stars, Apache-2.0)
- ▸GitHub Trending 2026-09-13 榜首
🔍 搜索形态
colibri AI colibri MoE colibri 推理引擎 colibri github
colibri 常见问题 FAQ
colibri 是什么?+
纯 C、零依赖、Apache 2.0 的开源 MoE 推理引擎,通过磁盘流式加载专家权重和分级缓存,让 2.8 万亿参数模型能在 32GB 内存的机器上运行。
colibri 和 llama.cpp 有什么区别?+
llama.cpp 是通用本地推理引擎(主要针对单机内存范围内的模型);colibri 专攻超大规模 MoE,把 1 万+ 专家按热度分到 VRAM/内存/NVMe 三级存储,目标是跑"比你机器更大的模型"。
colibri 怎么做到 32GB 跑 2.8T 模型?+
MoE 每 token 只激活一小部分专家(如 GLM-5.2 约 400 亿参数),colibri 把不活跃专家存磁盘、按路由热度提前预取,所以内存占用取决于活跃专家而非模型总大小。
与 colibri 相关的搜索
人们搜索 colibri 时,还会关心这些问题:
- colibri 是什么
- 什么是 colibri
- colibri ai 是什么意思
- colibri 原理
- colibri 有什么用
- colibri MoE 引擎
- colibri 本地大模型
- colibri 2026