量化交易:先调试回测,再升级模型
来源:dev.to — 2026-09-17
📋 概述
文章从一个经典错误切入:某公司下午 4 点 05 分发布财报,而回测在 4 点整就基于这份财报做了买入决策。测试全绿、曲线漂亮,模型看起来能预测未来——问题只出在有人按日期列把两份数据集连了起来。作者认为量化交易的工程本质是:在信任模型之前,先调查让结果成立的那套系统。文章用 Python 标准库与合成数据演示三个问题:模型是否拿到了当时不可得的信息、复杂模型在公平评估下是否真的更好、以及这些交易在假设成本下是否真能成交。
🔑 核心要点
- 看前偏差(look-ahead bias)往往不来自缺时间戳,而来自把「发布时间」当成「可得时间」。
- 每行都要区分 published_at、received_at、processed_at 三个含义不同的时间戳。
- 版本同样要处理:公司后来修正的数据,不能悄悄替换掉当年决策时能看到的那个值,查询必须以决策时点为界。
- 语言模型自带另一条泄漏路径:训练数据里可能已经包含了 2022 年发生的事,过滤检索文档无法移除已编码进模型的信息。
- 更严格的验证方式是冻结模型版本、提示词、检索策略与决策规则,在看到结果之前先记录预测。
- 复杂度必须自己赚来位置:只有能表达简单模型表达不了的关系时才值得用。
💡 金句
那份按日期连接的数据集是合法的 Python,但它是对「策略当时知道什么」的错误表示。
👍 0
👎 0
← 返回 dev.to 首页