用 29GB 内存以 0.50 tok/s 运行 Kimi K3
来源:github.com — 排名 #7 · 128 分 · 作者 marcobambini
📋 概述
一个名为 waste 的开源项目展示了如何在仅 29GB 内存的条件下本地运行 Kimi K3 模型,虽然生成速度只有约每秒 0.5 个 token,却证明了大型语言模型在消费级硬件上被'挤'出来的可能性。
🔑 核心要点
- 内存极限压榨:通过量化与内存复用技巧,把大模型装进小内存
- 极慢但可行:0.50 tok/s 的速度提醒我们工程权衡的现实
- 开源方案:项目公开了完整的运行配置与优化思路
- 边缘部署启示:为离线与隐私敏感场景提供了低门槛落地方案
💡 金句
把模型塞进 29GB 内存,本身就是对'需要多强硬件'这一假设的挑战。
👍 0
👎 0
← 返回 Hacker News 首页