永不调用 LLM 的记忆层:它换来什么,又付出什么代价
来源:dev.to — 2026-07-30
📋 概述
作者对比了自己的 RE-call 与 Mem0 两种 AI 记忆方案,用 BEAM 1M-token 基准衡量“可答性问题”。核心决策点只有一句话:Mem0 写入记忆时调用 LLM 蒸馏,RE-call 从不调用模型、只存原始对话轮次。前者在某些类别(如时间推理)更准,但为此付出每写一条记忆都调用模型的成本(单次基准 7.29 美元、慢 4.3 倍、数据发给外部 LLM 提供商);后者边际成本永远为零、可离线运行、数据不出基础设施。作者把这份权衡账单完整摊开,让读者自己选边。
🔑 核心要点
- 架构一句话:Mem0 写入时用 LLM 蒸馏存储,RE-call 零模型调用、存原始轮次
- 准确率代价:时间推理类 RE-call 得 0.408 vs Mem0 0.567,因 Mem0 存储的是蒸馏后的一行状态
- 成本差距:同一基准 RE-call 建记忆 0 美元、67 秒,Mem0 则 2.6M token、7.29 美元、288 秒(慢 4.3 倍)
- 数据主权:RE-call 用本地嵌入与自建 Postgres,可离线、可跑在气隙环境,数据永不外流
- 诚实取舍:作者承认 Mem0 在蒸馏类别上更优且不好修,并主动更正了发表后读者指出的过度断言
💡 金句
A memory layer that calls an LLM per write cannot offer that, structurally.
👍 0
👎 0
← 返回 Dev.to 首页