Hacker News | 📄 原文链接 | 2026-09-24 收录

token 便宜到不必计量:推理成本仍在每年掉几个数量级

来源:jyn.dev — 312 分 · by teoruiz

📋 概述

jyn.dev 收集了大量证据来支持一个判断:使用机器学习智能的价格正以每年几个数量级的速度下降,且没有放缓迹象。硬件的能效大约每两年翻一番,幅度堪比 1960 年代的摩尔定律;前沿模型的每 token 价格未必下降,但完成同一任务的"每任务成本"在明显下降。软件侧同样激进:MoE 让模型在同等基准下小七倍(60 亿参数降到 8 亿),Mamba 一类结构把本地推理所需内存降五倍以上,vLLM 十五个月里能效提升约 40%,英伟达在 MLPerf 2.0 到 2.1 上最多提升 50%,英特尔仅靠软件优化就让吞吐翻了 2.4 倍。推论是:token 会便宜到比工具调用还便宜,限制因素将从 token 数量转为质量与可及性。

🔑 核心要点

💡 金句

很快我们就会看到,限制 AI 使用的因素变成质量与可及性,而不是 token 的绝对数量。
← 返回 Hacker News 首页