用 29GB 内存、0.50 tok/s 跑起 Kimi K3
来源:github.com — 排名 #27 · 299 分 · 作者 marcobambini
📋 概述
一个开源项目展示了如何在极其有限的内存(约 29GB)下运行 Kimi K3 大模型,尽管推理速度低至约 0.50 token/秒。项目聚焦于内存优化与量化技巧,体现了在消费级硬件上运行大型模型的极限探索。
🔑 核心要点
- 内存极限:在约 29GB 内存下加载大模型
- 量化与优化:通过多种技巧压缩模型占用
- 极慢推理:约 0.50 token/s 的代价换取本地可用性
- 探索价值:展示消费级硬件的可行边界
💡 金句
每慢吞吞吐出一个 token,都是在跟硬件极限讨价还价。
👍 0
👎 0
← 返回 Hacker News 首页