阅读约 9 分钟· 发布于 July 19, 2026

让 AI 智能体做模拟交易:先验证,再信任

回测验证的是你的策略,AI 模拟交易验证的则是智能体本身:触发条件、仓位、边界情况。本文讲清该盯住什么、该跑多久,以及何时可以切换到实盘。

作者 Florent Poux
审校 Benjamin Sultan
风洞里被仪器夹具固定住的纸滑翔机,一次在真实条件下进行的演练飞行

你的智能体回测跑得漂亮极了。夏普比率超过 1.5,回撤在你能承受的范围内,权益曲线也很干净。但这一切都无法告诉你:你真正搭出来的那套自动化,是否和你脑子里那套策略一致。AI 模拟交易补上的正是这道缺口——智能体对着实时行情运行,做出它用真金白银时会做的每一个决策,却不下任何单。本文讲清一次模拟运行到底测的是什么、运行期间该盯住什么、跑多久才算够,以及区分“可以上实盘了”和“得推倒重来”的那条界线。

为什么 AI 模拟交易是一种不同的测试

对手动交易者来说,模拟交易主要考验的是策略本身和交易者的心态。模拟交易那些经典的坑(把假钱当儿戏、不知不觉就破了自己的规矩),我们在如何做模拟交易而不自欺欺人这篇指南里讲过了。而本文要谈的,是更细、也更新的一件事。

当一个 AI 智能体替你交易时,受审的对象多了第三样:翻译。你用大白话描述了策略,或者用一条条规则把它拼了出来,然后某个系统把这段描述变成了受监控的条件和下单逻辑。回测验证的是被编码后的策略;模拟交易验证的则是编码本身,而且用的是谁都没见过的新数据。

具体是什么样子呢?你说的是“逢 ETH 回调就买入”。你心里想的是:日线收盘价比 20 日高点至少低 8%。可智能体实现成了:盘中只要跌 8% 就买。这两种读法都能跑出一份看似合理的回测。然后来了一周剧烈波动,模拟日志里出现了三笔你手动绝不会做的进场。这不是策略出了问题,而是翻译出了问题——而实时数据的演练,是唯一能在它亏钱之前把它暴露出来的地方。

还有数据本身。给 AI 交易智能体做回测回放的是整整齐齐的历史 K 线。而一次模拟运行吃的是实时行情:其中有延迟、有周末稀薄的挂单簿、有交易所抽风、有 K 线未收盘时的噪声。不少智能体换了这第二种“食谱”后,表现就变了个样。

智能体运行期间该盯住什么

把模拟期当成一场审计,而不是候车室。记一份简短的日志,检查五件事。

触发的保真度。 对每一个触发的信号,核实那一刻条件是否真的满足了。对每一个没动静的日子,问一句:它本该触发吗?漏触发和误触发一样致命;它们通常意味着条件被编码到了错误的周期上,或者用错了价格类型(最新成交价 vs. 标记价,收盘价 vs. 影线)。

仓位。 检查每一笔模拟订单是否符合你的仓位规则,无论那是固定金额、承担 0.5%–1% 权益的风险,还是基于 ATR 的仓位。留意那些边界:最小下单量、手数取整、以及当周内权益发生变化时会怎样。

边界情况。 回测抹平掉的那些事件,恰恰是最伤人的。隔夜跳空把一只股票直接冲穿了你的止损位;交易暂停;某个周日凌晨 3 点的加密货币急拉。如果你的模拟窗口里一个都没碰上,那就把它延长到至少碰上一次为止。

成本的真实性。 把模拟器假设的成交价,与你屏幕上看得见的实时价差比一比。如果你策略每笔的优势是 0.4%,而真实价差加手续费是 0.3%,那你就学到了一件绿色权益曲线掩盖掉的东西。

频率。 数一数每周的交易笔数,跟回测的预期对一对。一个交易频率是回测两倍的智能体,是在告诉你:实盘里的那个条件比历史里的更松。

风洞里被仪器夹具固定住的纸滑翔机,一次在真实条件下进行的演练飞行

在 Obside 上,模拟模式用完全相同的智能体定义、跑在相同的实时数据上、套用相同的风控;唯一的区别是订单会停在模拟的边界上。比如你输入:“当 4 小时 RSI(14) 跌破 30 时买入价值 150 美元的 ETH,每周最多买两次,涨到 +12% 时卖出一半。”副驾把这些条件复述一遍,你确认后,智能体先以模拟智能体的身份运行。一周后,日志显示了三次 RSI 触发、两次成交,第三次则被“每周最多买两次”这条规则跳过了。那笔被跳过的交易,是整份日志里最有价值的一行:你设的约束在实战中扛住了。

该跑多久:两到四周,或者 20 个信号

老实说,答案取决于你策略的节奏,因为一次模拟运行身兼两职,而这两件事完工的速度不一样。触发、仓位、路由这类机制,几个事件之内就能验证完;而对表现的判断需要样本量,信号数少于大约 20 个,基本上等于什么都没告诉你。

策略节奏 最短模拟运行 你真正在测的东西
每天多个信号 2 周 机制,外加真实频率下的成本拖累
每周几个信号 4 周或 20+ 个信号,取更晚者 各种条件下触发的保真度
每周或每月(DCA、再平衡) 3–4 次计划内执行 仅验证计划、仓位和跳过规则

对于慢节奏策略,别为了凑够 20 个事件而傻等一年。用三四次执行把机制验证清楚,把表现的裁决交给回测。对于快节奏策略,你可能三天就攒够 20 个信号;但还是把整整两周跑完,好让智能体穿越不同的市况。无论节奏快慢,在你宣布演练完成之前,尽量让它涵盖一个有预定波动的日子——一次 CPI 数据发布或一个 FOMC 下午,加密货币的话则是一个周末盘。

有一条规则凌驾于日历之上:如果你在运行途中改了智能体的规则,计时就得从头开始。一次模拟运行只为跑完它的那个版本背书。

毕业标准:何时可以扳动开关

只有当以下每一条都成立时才上实盘,而不是大部分成立就行。

  1. 零笔无法解释的交易。 日志里的每一次进场和出场,都能对应到一条你凭记忆就能说出名字的规则。
  2. 零次无法解释的沉默。 任何一次漏触发都有据可查的原因,比如交易所宕机,而不是一句“不知道”。
  3. 每一笔成交的仓位都正确,包括最小的那笔和最大的那笔。
  4. 至少扛过一个压力窗口——一个事件日、一次跳空,或一段周末行情——而且它的行为你认可。
  5. 结果落在回测的预期区间内。 注意它没说的是:“盈利”。一个均值回归智能体在四周单边趋势里可能会亏钱,却依然完全健康。你要核对的是它与回测结果分布的一致性,而不是这四周盈亏的正负号。
  6. 你不再想插手了。 如果你对一半的信号都做了干预或质疑,那不管数字多好看,这套策略都还不完整。

然后,上实盘要刻意从小做起:头两到四周的实盘,只用你预期配置额的 10%–25%,每笔交易承担 0.5%–1% 的权益风险。毕业只是自主性阶梯上的一级台阶,不是一步登顶。在 Obside 上,这级台阶就是字面意义上的一个开关:同一个智能体从模拟切换到实盘路由,风控原封不动地带过去,而且从第一天起你就能给它能动用的配置额设上限。

风洞里被仪器夹具固定住的纸滑翔机,一次在真实条件下进行的演练飞行

什么情况下该推倒重来

一次失败的模拟运行,正说明这套体系在起作用。每一种失败模式都有它对应的补救办法,而其中没有一种是“照样上实盘,然后盯紧点”。

智能体做了你本不会做的交易。 翻译鸿沟。重新措辞策略,重新确认复述后的条件,重启模拟计时。这个修复属于智能体创建流程,而不属于日常盯盘。

你总是想否决那些有效的信号。 你的直觉在跑一道你的规则里没有的过滤器。把它提炼出来。“市场刚跳空下跌 3% 时我不做多”是一条可以编码的条件;而一个没写下来的本能,就是未来某个凌晨两点的人工干预。

成本吃掉了优势。 如果在观测到的价差下,模拟利润缩水到几乎为零,那就降低交易频率,或者把这个想法退役。上了实盘只会更糟。

你没法从日志里解释某个决策。 永远不要为你无法复原的行为投入真金白银。要么是日志记录不到位,这是平台的问题;要么是逻辑对你而言不透明,这是你自己的问题。两者都足以让它出局。

推倒重来的代价是几周时间。同一堂课的实盘版,代价则是几周时间外加一段回撤。

从这里往后

给 AI 智能体做模拟交易,不是回测和上线之间的一道走过场;它是唯一一场检验你手里真正拥有的那个智能体(而非你自以为写出来的那套策略)的测试。让它跑在实时数据上,像对手一样审计它,守住毕业那条线,就算干干净净地通过了也要从小做起。如果你想把整条路径放在一处走通——用大白话描述一套策略,回测它,在模拟模式里演练它,然后扳动一个开关、带着完好的风控上限切到实盘——Obside 正是围绕这套工作流打造的。

仅供教育参考,不构成投资建议。交易存在风险,可能导致本金损失。

FAQ

两到四周,或 20+ 个信号,取更晚者,并按节奏调整。快节奏的日内智能体即便早早攒够 20 个信号,也应至少跑满两周;而像每周 DCA 这样的慢节奏策略,用三四次执行就能验证机制,表现的裁决则交给回测。任何时候改了规则,计时都要重启,并尽量涵盖至少一个高波动交易时段。

相关文章

在你的投资组合上试用 Obside

连接你的券商,一句话构建你的投资组合。

开始