阅读约 9 分钟· 发布于 July 19, 2026

LLM 在交易中:它们能做什么、不能做什么

大语言模型在哪里真正帮到交易者,在哪里会满怀自信地出错,以及为什么研究说 LLM 的回测在自我美化。一份技术上诚实的指南。

作者 Florent Poux
审校 Benjamin Sultan
一个一分为二的机构:一侧是一本翻开的书流出流动的字迹,另一侧是精密的钟表齿轮

每隔几周就有一篇论文或一款产品声称某个大语言模型跑赢了市场。这些声称值得比通常得到的更严格的审视,因为 LLM 交易处在一个尴尬的交叉口:语言模型在某些与交易相邻的工作上是真的出色,在另一些部分上又是真的糟糕,而营销很少告诉你哪块是哪块。这篇文章把界线画精确。LLM 擅长什么、在哪里失败、为什么它们的回测在自我美化,以及那种能拿到好处、又不把你的账户押在一个文本预测器上的架构。

LLM 是什么,以及为什么这在订单簿前很要紧

LLM 是一个下一个词元的预测器:给定文本,它产出统计上很可能跟在后面的文本,并被训练塑造得乐于助人。这一个事实,就解释了它在交易中的长处和它的失效模式。

对语言的预测,让 LLM 在语言任务上极为出色:摘要、在不同措辞之间翻译、从散文里抽取结构、模仿其训练数据中出现的推理套路。金融正淹没在恰恰是这一类的材料里。申报文件、电话会议记录、央行声明、新闻电讯:这些非结构化文本,过去需要人类花上数小时才能消化。

但下一个词元的预测里面没有一本账本。这个模型不会像计算器那样去计算 $41,000 的 2.7%;它产出的是在上下文里看起来合理的数字。它没有经过校准的概率感、没有实时市场数据源(除非外接一个),也没有“错了”这个概念,只有“不太可能”。当输出是一份摘要时,这些都无所谓。当输出是一笔订单时,这些全都要紧。

LLM 交易工具在哪里真正帮到忙

有四项工作格外突出,它们有一个共同的性质:LLM 处理语言,而由别的东西来处理后果。

以机器速度解析新闻和申报文件。 一个 LLM 能在 FOMC 声明发布后几秒钟内读完它,并把它对照上一份来打标签:哪些句子变了、关于通胀的措辞是变强硬了还是变缓和了。它能把一份 200 页的年报变成“下调了指引,把利润率压力归于投入成本,暂停了回购”。人类做这个做得好;LLM 则能在几秒内跨几百份文档做完。

把意图转译成规则。 “我想在上升趋势里买入弱势”是不可执行的。一个 LLM 擅长提出这样的转译:价格在 200 日移动平均线之上、RSI(14) 低于 35、仓位规模固定、出场明确。人类判断这个转译是否匹配意图;机器负责起草。

解释头寸和行情。 被问到某个投资组合本周为什么亏了 4% 时,一个能访问实际持仓数据和价格历史的 LLM,能产出一份可读的归因:哪些持仓在推动它、什么在相关联、什么新闻正好赶上。这是戴着金融帽子的摘要,稳稳落在模型的能力范围之内。

审阅策略逻辑。 把你的系统描述给一个 LLM,问它什么会把它弄垮,你往往会得到一份有用的清单:没有失效规则、没有费用假设、一个很少触发的入场条件。一个通用聊天机器人就能做到这么多,这正是为什么我们把 ChatGPT 当成一个有用的助手、一个糟糕的交易员,而这个区分也延续到专门打造的系统上。

一个一分为二的机构:一侧是一本翻开的书流出流动的字迹,另一侧是精密的钟表齿轮

LLM 在哪里失败,并且满怀自信地失败

算术。 让一个模型为一个 $27,400 的账户、入场价 $43,150、止损 $41,900、每笔冒 1% 风险来定仓位,你可能会得到正确的答案:$274 的风险对上每单位 $1,250,所以大约 0.22 个单位。你也可能得到一段流畅的、包含一个错误数字的文字,而没有任何信号来区分这两种情况。计算器的错误罕见而响亮;LLM 的错误偶发而无声。无声的错误,正是交易里代价高昂的那一种。

校准。 交易是概率性的决策,而 LLM 不产出经过校准的概率。一个说“这次突破有 70% 的概率延续”的模型,是在生成一个合理的句子,不是在测量一个频率。依据一个编造出来的置信度行动,比依据没有置信度行动更糟,因为它感觉像信息。

价格预测。 下一个词元的训练里,没有任何东西赋予它预测收益的优势。一份对 77 项 LLM 交易研究的审阅(arXiv:2605.19337, 2026)断定,支持持久 alpha 的证据依然稀薄,而这些系统的实用价值在于有纪律的执行、监控和研究辅助,而不是选股。这个发现和机制吻合:模型识别的是文本中的模式,而价格不是文本。

捏造事实。 LLM 会产生幻觉,而金融会诱发它:密集的数字、相似的实体名称、对日期敏感的声称。2024 到 2025 年的基准测试测得,在没有防护措施的情况下被问及的金融问题中,有相当一部分出现了幻觉。这种失效模式及其架构层面的修复,值得单独讲,它们在交易中的 AI 幻觉里得到了讲述。

回测的海市蜃楼:为什么 LLM 的结果在自我美化

在你信任任何 LLM 策略的过往战绩之前,研究文献里有一个值得理解的可复现性问题。

2024 年一份关于 LLM 交易智能体的综述(arXiv:2408.06361)指出,大多数已发表的系统都报告了优越的回测表现,然后点出了这个模式背后的模式:短测试窗口、小股票池,以及贯穿这个领域大部分的前视风险。数字很亮眼,实验设计很孱弱。

接着来了更锋利的诊断。《Can LLM-based Financial Investing Strategies Outperform the Market?》(arXiv:2505.07078, 2025)表明,LLM 回测被记忆所膨胀:一个训练数据覆盖了回测期的模型,实际上能记住代码、日期和价格波动。它不是在预测 2021 年;它是在回忆 2021 年。一旦策略在样本外、越过模型的知识截止日期被评估,表现往往就退化了。

2026 年一个受控记忆的基准(arXiv:2605.28359)证实了这一点:当评估被设计成让被记住的市场历史无法泄露进预测里时,表面上的技能就急剧下降。

实用的检验很简单。任何在模型受训过的一段时期上回测的 LLM 策略,默认就是可疑的。要求提供训练截止日之后的结果,或者一次受控记忆的评估。这是一个经典量化原罪在智能体时代的表亲,而经典的防御依然适用;我们在回测过拟合里讲了它们。

一个一分为二的机构:一侧是一本翻开的书流出流动的字迹,另一侧是精密的钟表齿轮

那种管用的架构:语言在上,确定性在下

从以上所有内容得出的诚实结论,不是“避开 LLM”。而是一种分工。让语言模型去做语言。让确定性引擎去做一切有后果的事。

在一个构建良好的系统里,LLM 解读你的指令、起草规则、解释结果、摘要新闻。规则本身,一旦被批准,就作为朴素的确定性逻辑运行:从市场数据算出的指标数值、被精确比较的阈值、由不会即兴发挥的算术定出的订单规模。LLM 提议;引擎处置。如果模型在解读时产生了幻觉,你会在批准这一步抓住它,因为系统在任何东西运行之前,会把它理解到的东西展示给你看。一个错误的句子被纠正;它永远不会变成一笔错误的订单。

这就是 Obside 划界线的方式。副驾是一个 LLM,而它的工作止于语言:你输入“当 SOL 日线的 RSI(14) 收盘跌破 30 时买入,当它重新上穿 55 时卖出,每笔冒 1% 风险”,副驾就把它复述为被监控的条件和一条定仓规则,供你批准。从那里开始,确定性引擎接手:回测用精确的指标数学回放历史 K 线,模拟交易在实时数据上运行同样的逻辑,实盘执行用数值方式计算每一笔订单的规模、并在执行时核对你的风险限制。LLM 从不做算术,也从不碰一笔订单。

那次分工也改变了回测的含义。因为被测试的对象是确定性规则,而不是模型逐日的判断,所以没有被记住的历史可以泄露进来:无论测试窗口落在任何训练语料的里面还是外面,规则的表现都一模一样。你验证的是逻辑,不是回忆。这些部件如何组合成一个完整的“感知—推理—行动”系统,是它自己的话题,讲在图解 AI 交易智能体里。

下一步该做什么

把 LLM 当成一个才华横溢、但没有触碰资金牌照的分析师。用它来读得更快、把意图转译成精确的规则、并盘问你自己的逻辑。拒绝把三样工作交给它:计算数字、估计概率、预测价格。而对任何来自模型可能记住过的回测的表现声称,都要打个折扣;研究在这一点上毫不含糊。

如果你想要一个已经把这种分工建好的东西,Obside 默认就应用它:语言由副驾处理,数学和执行由确定性引擎处理,而在你批准了被复述的规则、并在模拟盘里看着它运作之前,什么都不会上实盘。

仅供教育参考,不构成投资建议。交易存在风险,可能导致本金损失。

FAQ

没有可信的证据支持它。2026 年一份对 77 项 LLM 交易研究的审阅(arXiv:2605.19337)发现,支持持久 alpha 的证据依然稀薄,而那些控制了记忆的研究显示,表面上的预测技能急剧下降。LLM 识别的是文本中的模式;而价格不是文本。它们在交易中已被证明的价值,是有纪律的执行支持、研究辅助,以及把意图转译成规则,而不是预测收益。

相关文章

在你的投资组合上试用 Obside

连接你的券商,一句话构建你的投资组合。

开始