文章总结: 开源项目kimi-k3-in-c展示了在仅8GB内存和CPU环境下运行2.78万亿参数KimiK3大模型的可行性。该引擎基于纯C99编写,体积仅176KB,通过四重压缩技术(半字节权重、稀疏专家唤醒、自动缓存等)实现675倍压缩,将运行内存从5.56TB降至8.24GB。其核心突破在于将模型留存在磁盘而非内存中,通过Linuxcgroup验证了不同内存阶梯下输出结果的一致性。用户可在Linuxx86-64设备上通过简单命令编译并使用laptop预设运行,但需准备1.7TB存储空间且仅支持基座模型续写,目前缺乏对话模板与API接口,主要价值在于验证了极端资源受限下的推理思路。 综合评分: 82 文章分类: AI安全,其他
终于能在 8G 笔记本上跑 Kimi K3 了 。
原创
开源日记 开源日记
开源日记
2026年8月9日 15:18 湖北
在小说阅读器读本章
去阅读
上个月Kimi K3刚刚发布的时候,圈子里都在讨论一件事。
2.78 万亿参数,全球第一个开源的三万亿级模型。
马斯克在X上点了个赞,有人把这样的行为称为“Sputnik时刻”。
但是很热闹,跑起来要几十个H100。普通人别说跑起来了,就连下载1.56TB的权重文件都很难。
最近在 GitHub 上刷到一个项目,把运行它的门槛直接拉到了地面。
它的名字叫 kimi-k3-in-c,GitHub 上已经获得了 3800 多个 Star。
它是用纯C99写的Kimi K3推理引擎,2.78万亿参数的模型。它甚至不用显卡,普通电脑只靠 CPU 和 8GB 内存就能跑起来。
零框架、零GPU、零依赖。整个引擎大小为 176KB。
而且跑出来的结果和 PyTorch 官方实现逐字节完全一样。
来看看实际跑起来是啥样
只需要一台装有Linux操作系统的台式电脑和一块NVMe固态硬盘。
装上 GCC 编译器,克隆仓库,make 一下,一分钟编译完。
然后下载模型权重。
1.56TB,大概几小时。
下载之后会自动进行验证。
出错会自己报出来,不会让你用不完整的权重得到错误的结果。
运行检测脚本k3-doctor.sh,它会自动检测你的磁盘带宽和内存大小,并给出一个推荐值。
选择laptop预设,8G 的内存就可以运行。输入“法国的首都是”,等待半分钟之后,它输出 Paris。
同样的提示词,你换成 128 GB 内存的 server 预设,5.6 秒就出结果。
Reddit 上有老哥说,这个项目问的问题跟别人不一样。
别人的想法是把模型放到内存中去,而它的想法是——模型真的要一直留在内存里吗?
问题一问对,答案就不一样了。
有人好好奇了,它是怎么做到的
01 四重压缩,675 倍压缩。
模型原始大小为 5.56TB,最终运行时只需要 8.24GB 内存,大小缩小了 675 倍。
第一,权重出厂的时候就是半字节格式,1.56TB直接存到硬盘上,不需要解压。
第二步,每个模型层有 896 个专家,每次推理只唤醒 16 个,其余 1.45TB 的权重从不进入内存。
第三步是用专家权重自动缓存,重复使用的时候直接拿,不从硬盘上读。
02 无依赖,只用到C99标准库。
整个推理引擎只用了 7 个 C 源文件,编译后得到一个 176KB 的静态二进制文件。
不需要用到PyTorch、CUDA等任何GPU框架,也不需要使用到ONNX这样的中间层。只用到了基本的数学库。
注意力机制、矩阵乘法、激活函数等所有的数学运算都是自己写的,并没有使用任何现成的库。
基础运算和 CPU 向量加速走两条不同路径,靠固定累加顺序保证结果逐位一致。
这就意味着用两台不同的机器来运行同一个提示词,并不是差不多的结果,而是完全一样的结果。
03 确定性验证,三道关卡全过。
不需要下载模型就可以进行全部的测试。第一道门禁,逐token与官方输出比较,32个位置都一致。
用两种不同的生成方式分别运行 20 个 token,带缓存的情况下都正确,93 层逐层和 PyTorch 参考值对比无差异。
04 内存阶梯,8 GB 到 224 GB 结果完全相同。
使用Linux cgroup来限制内存,并且测试了12个预算等级。各个等级的输出结果都是一样的。
内存是速度旋钮,并不是正确性开关。
从笔记本上的8GB(26.5秒/Token)到服务器上的128GB以上(5.6秒/Token),只是速度不同。
这里有一个反常识的地方:内存并不是越大越快。
当插入了四条大容量内存之后,为了保证稳定性,主板会自动降低频率,结果导致带宽变小。
说白了,瓶颈是会转移的——模型小的时候卡在频率,模型大的时候卡在容量。
kimi-k3-in-c 的 8G 能跑下来,不是靠堆硬件,而是把模型放在哪里、什么时候放的账算清楚了。
这么厉害,估计大家已经迫不及待想试试了
首先克隆仓库,然后进行编译和验证。
git clone https://github.com/FareedKhan-dev/kimi-k3-in-c.git
cd kimi-k3-in-c
make -j
make test
测试套件不需要模型权重,一分钟跑完。通过了就说明引擎本身没问题。
然后下载模型,并使用自带的脚本来运行。
export HF_TOKEN=hf_your_token_here
./scripts/download-model.sh ~/k3model
下载完打包主干,选一个预设就能跑了。
python3 tools/pack_trunk.py ~/k3model ~/k3trunk
./bin/k3 ~/k3model --trunk ~/k3trunk --preset laptop \
--tok ~/k3model --prompt "法国的首都是" --gen 8 --incremental
到这里边界也给大家提提
它只可以在Linux x86-64上运行,并且需要O_DIRECT和posix_memalign。
并且要 1.7TB 的存储空间,其中 1.56TB 是检查点,另外 109GB 是打包主干。
没有聊天模板,没有 temperature 采样,没有 HTTP API,就是一个基座模型直接续写。
写在最后
这个项目也引发了一些争议。
有人认为它是技术奇迹,176KB 的二进制可以运行 2.78 万亿参数的模型。
也有人认为它的“8GB 实测”并不是在真实的 8GB 物理机上进行的,而是在 228GB 的服务器上使用了 cgroup 限制。
两种说法都对。但是我认为重点不在这上面,在于它证明了一个思路是可行的。
kimi-k3-in-c 的贡献不是让你现在就可以使用它,而是让你知道这件事是能够实现的。
有兴趣的朋友可以去试一试。
项目基于 MIT 协议开放,感兴趣的同学可以去 GitHub 仓库看看源码和文档。
开源地址:https://github.com/FareedKhan-dev/kimi-k3-in-c
我这个公众号之前发过很多有意思的开源项目,可以关注一下。
在后台回复关键词通过 AI 来找你想要的项目。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:开源日记 开源日记 开源日记《终于能在 8G 笔记本上跑 Kimi K3 了 。》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。








评论