想本地跑大模型,硬件配置往往跟着模型规模一起攀升。至于千亿参数级别的旗舰模型,在家用电脑上跑,那更是想都不敢想今天介绍的开源项目:Colibri 则提出了不一样的思路。Colibri 是一个用纯 C 写的专跑 MoE 大模型推理引擎。744B 参数的模型,每生成一个 token,真正激活的参数只有约 400 亿。而激活这一部分,相邻的两个 token 之间被换掉的大约只有 11 GB。Colibri 把显存、内存和硬盘看成同一层存储。模型权重以 int4 格式躺在 NVMe 上,需要哪层专家就按路由热度流式读上来。它还会把我们常用的专家记一个学习缓存,每次对话更新,并把最热门的专家记在内存里。每个 token 为 576 个 浮点数,而非原本的 32768 个。GLM-5.2 原生 MTP head 会起草 token,再由主模型一次前向验证 2.2 到 2.8 个 token。PS:MTP head 必须是 int8,选错就不会有作用。上述命令可以起一个 OpenAI 兼容的 API。任何支持自定义 OpenAI 端点的客户端都能接入。1.前置:程序(几百 KB)和模型(372 GB)。从 Releases 下载对应平台的预编译包,Linux、macOS、Windows 都有:mkdir colibri && tar xzf colibri-v1.8.0-linux-x86_64.tar.gz -C colibri && cd colibripython3 coli info
解压即用,只需装好 Python 3 就行(Python 只负责启动器和 API 网关)。至于模型,在 Hugging Face 上有转好的 int4 版本,约 372GB:https://huggingface.co/mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp
也支持自己从 FP8 源转换,无需一次性腾出 756GB:./coli convert --model /nvme/glm52_i4
COLI_MODEL=/nvme/glm52_i4 ./coli chat COLI_MODEL=/nvme/glm52_i4 ./coli plan COLI_MODEL=/nvme/glm52_i4 ./coli doctor ./coli web --model /nvme/glm52_i4 ./coli serve --model /nvme/glm52_i4
Colibri 价值在于:25 GB 内存也可以跑千亿参数大模型。如果你也硬件有限,但又想持有而非租用智能,不妨试试。https://github.com/JustVugg/colibri