在浏览器里试七个微型语言模型 — Hacker News 中文摘要
来源:stateofutopia.com — 271 分 · by logicallee
📋 概述
MicroLLM Lab 用 WebGPU 把 Q4 量化的小语言模型直接跑在浏览器里,模型缓存在 IndexedDB,可以一次加载多个,聊天、跑基准、互相比较。它的定位很明确:测的是速度(峰值与持续解码的 token/s)与客观正确率(靠正则或精确 token 判定),而不是写作质量。作者甚至写明了态度——一个 135M 的模型本来就有权失败,那正是测量结果本身。跑完还能生成一张带硬件信息的基准证书。
🔑 核心要点
- 用 WebGPU 在浏览器本地跑 Q4 量化的小模型,模型缓存在 IndexedDB。
- 可一次加载多个模型,跑同一套基准并互相对比。
- 指标是峰值速度、持续解码速度与总耗时。
- 测的是客观正确率(正则或精确 token 判定),不是写作质量。
- 作者的态度是:135M 模型失败了也没关系,那正是测量的意义。
- 跑完可生成一张带设备硬件信息的基准证书并分享。
💡 金句
A 135M model is allowed to fail — that is the measurement.
👍 0
👎 0
← 返回 Hacker News 首页