4 GB 笔记本 GPU 对 6 核 CPU 跑 Gemma 4,按 ABBA 顺序重测:4.1 倍
来源:dev.to — 2026-09-23
📋 概述
这是上一次对比的重测版。同一台笔记本、同一份 3.35 GB 的量化感知 GGUF(google/gemma-4-E2B-it-qat-q4_0-gguf),由 llama-server 分别跑在 CPU 和 GPU 上,两次构建来自同一个 llama.cpp 提交,命令行只差一个 flag。GTX 1650 Ti 的解码速度是共享同一机身的 i7-10750H 的 4.14 倍,预填充快 3.42 倍,端到端完成请求快 3.62 倍。由于 CPU 与 Max-Q 显卡共用一套散热,作者这次用 ABBA 顺序(CPU、GPU、GPU、CPU)来抵消热漂移。
🔑 核心要点
- 测量方法很干净:同一台笔记本上的同一个模型、同一个提交的两次构建,命令行只差一个 flag。
- 结果:解码快 4.14 倍、预填充快 3.42 倍、端到端完成请求快 3.62 倍。
- 因为 CPU 和 Max-Q 显卡共用一套散热,必须用 ABBA 顺序(CPU、GPU、GPU、CPU)跑,才能不让热量决定胜负。
- 顺序确实影响结论:解码比从 4.09 倍变成 4.17 倍,单顺序测量大约偏离 2%。
- 环境变化包括升级到 Debian sid、gcc 16.2 与 CUDA 13.4;compute 7.5 已是当前工具链仍支持的最老架构,再升级可能就编不出来了。
💡 金句
这台笔记本上,只跑一种顺序的基准测试,结果大约会偏离 2%。
👍 0
👎 0
← 返回 dev.to 首页