token 便宜到不必计量:推理成本仍在每年掉几个数量级
来源:jyn.dev — 312 分 · by teoruiz
📋 概述
jyn.dev 收集了大量证据来支持一个判断:使用机器学习智能的价格正以每年几个数量级的速度下降,且没有放缓迹象。硬件的能效大约每两年翻一番,幅度堪比 1960 年代的摩尔定律;前沿模型的每 token 价格未必下降,但完成同一任务的"每任务成本"在明显下降。软件侧同样激进:MoE 让模型在同等基准下小七倍(60 亿参数降到 8 亿),Mamba 一类结构把本地推理所需内存降五倍以上,vLLM 十五个月里能效提升约 40%,英伟达在 MLPerf 2.0 到 2.1 上最多提升 50%,英特尔仅靠软件优化就让吞吐翻了 2.4 倍。推论是:token 会便宜到比工具调用还便宜,限制因素将从 token 数量转为质量与可及性。
🔑 核心要点
- 硬件基线:GPU 能效约每两年翻一番,是 1960 年代以来罕见的幅度。
- 关键区分:每 token 价格不一定降,但每任务成本在明显下降。
- 架构红利:MoE 让模型在同等基准下小七倍(60 亿 → 8 亿参数),且更省内存。
- 本地推理的瓶颈被改写:Mamba 一类结构把内存需求降五倍以上。
- 软件侧的增速是量化的:vLLM 15 个月能效 +40%、英伟达 MLPerf 最多 +50%、英特尔吞吐 2.4 倍。
- 结论涉及商业逻辑:token 会比工具调用更便宜,供需两侧的杰文斯悖论都会出现。
💡 金句
很快我们就会看到,限制 AI 使用的因素变成质量与可及性,而不是 token 的绝对数量。
👍 0
👎 0
← 返回 Hacker News 首页