閱讀約 9 分鐘· 發布於 July 19, 2026

LLM 在交易中:它做得到與做不到什麼

大型語言模型真正能幫上交易者的地方、它自信地出錯的地方,以及為什麼研究說 LLM 的回測會自我美化。一份技術上誠實的指南。

作者 Florent Poux
審稿 Benjamin Sultan
一具一分為二的機械:一側是一本攤開的書、匯入流動的手寫字,另一側是精密的鐘錶齒輪

每隔幾週,就有一篇論文或一項產品宣稱某個大型語言模型打敗了市場。這些宣稱值得一個比通常更嚴格的檢視,因為 LLM 交易坐落在一個尷尬的交叉口:語言模型在某些與交易相鄰的工作上真的極為出色,在另一些部分上又真的糟糕透頂,而行銷很少告訴你哪個是哪個。這篇文章會把這條線精確地畫出來。LLM 做得好什麼、它在哪裡失手、為什麼它的回測會自我美化,以及那種「能拿到好處、卻不必把你的帳戶押在一個文字預測器上」的架構。

LLM 是什麼,以及這件事為什麼在委託簿前很重要

LLM 是一個「下一個 token 的預測器」:給它文字,它就產出統計上最可能接在後面的文字,並由訓練塑造成樂於助人的樣子。光這一個事實,就同時解釋了它在交易中的長處與失效模式。

對語言做預測,讓 LLM 在語言任務上極為出色:摘要、在不同措辭之間翻譯、從散文中抽取結構、模仿訓練資料裡出現過的推理模式。金融正淹沒在正是這一類的材料裡。申報文件、法說會逐字稿、央行聲明、新聞快訊:都是過去需要人類花上數小時才能消化的非結構化文字。

但「下一個 token 的預測」裡面沒有一本帳。這個模型並不像計算機那樣去計算 $41,000 的 2.7%;它產出的是在上下文裡看起來合理的數字。它沒有經過校準的機率感、沒有即時的市場資料源(除非另外接上一個),也沒有「我錯了」這個概念,只有「這不太可能」。當輸出是一段摘要時,這些都不重要。當輸出是一筆委託時,這些全都重要。

LLM 交易工具真正幫得上忙的地方

有四項工作特別突出,而它們共享一個特性:LLM 處理語言,而由別的東西來處理後果。

**以機器速度解析新聞與申報文件。**一個 LLM 能在 FOMC 聲明發布後幾秒內讀完它,並拿它去對照前一份:哪些句子變了、關於通膨的措辭是變硬還是變軟。它能把一份 200 頁的年報變成「下修財測、把利潤率壓力歸因於投入成本、暫停庫藏股回購」。人類做這個做得好;LLM 則在幾秒內跨數百份文件做完。

把意圖轉譯成規則。「我想在上升趨勢中買進弱勢」是無法執行的。LLM 很擅長提出這份轉譯:價格在 200 日移動平均線之上、RSI(14) 在 35 以下、部位大小固定、出場明確。由人類來判斷這份轉譯是否符合意圖;機器則負責起草。

**解釋部位與行情狀態。**當被問到某個投資組合這週為什麼虧了 4%,一個能存取實際部位資料與價格歷史的 LLM,能產出一份好讀的歸因:哪些持股主導了它、什麼互相關聯、有什麼新聞剛好同時發生。這是戴著金融帽子的摘要,正好落在這個模型的能力範圍之內。

**批判策略邏輯。**把你的系統描述給一個 LLM 聽、問它什麼會拆掉它,你常常會得到一份有用的清單:沒有失效規則、沒有費用假設、一個很少擊發的進場條件。一個通用聊天機器人就能做到這麼多,這正是為什麼我們把 ChatGPT 當成一個有用的助理、卻是個糟糕的交易者,而這個區分也延續到了專門打造的系統上。

一具一分為二的機械:一側是一本攤開的書、匯入流動的手寫字,另一側是精密的鐘錶齒輪

LLM 在哪裡失手,而且自信地失手

**算術。**要一個模型替一個 $27,400 的帳戶、以 $43,150 進場、$41,900 停損、承擔 1% 風險的部位算大小,你可能會拿到正確答案:$274 的風險對上每單位 $1,250,所以大約 0.22 單位。你也可能拿到一段流暢的、包含一個錯誤數字的段落,而且沒有任何訊號能區分這兩種情況。計算機的錯誤既罕見又大聲;LLM 的錯誤則是偶爾而無聲。在交易裡,無聲的錯誤才是昂貴的那一種。

**校準。**交易是機率性的決策,而 LLM 並不產出經過校準的機率。一個說「這次突破有 70% 的機率會延續」的模型,是在生成一個看起來合理的句子,而不是在量測一個頻率。依據一個被憑空編出來的信心去行動,比依據沒有信心去行動更糟,因為它感覺起來像是資訊。

價格預測。「下一個 token 的訓練」裡沒有任何東西,能在預測報酬上賦予優勢。一份對 77 篇 LLM 交易研究的審視(arXiv:2605.19337, 2026)結論是,持久性 alpha 的證據仍然稀薄,而這些系統實務上的價值,坐落在有紀律的執行、監控與研究輔助上,而不是選股。這個發現與其機制相符:模型辨認的是文字裡的模式,而價格不是文字。

**捏造事實。**LLM 會產生幻覺,而金融特別容易誘發它:密集的數字、相似的實體名稱、對日期敏感的宣稱。2024 到 2025 年的基準測試量到,在缺乏防護措施下被問到的金融問題裡,有相當比例會出現幻覺。這個失效模式與它在架構層級的修法值得專門處理,而它們在交易中的 AI 幻覺裡得到了處理。

回測的海市蜃樓:為什麼 LLM 的結果會自我美化

研究文獻裡有一個「可重現性」的問題,值得你在信任任何 LLM 策略的實績之前先弄懂。

2024 年一份對 LLM 交易智能體的綜述(arXiv:2408.06361)指出,大多數已發表的系統都回報了優異的回測績效,接著點出了那個藏在模式背後的模式:整個領域大量存在著過短的測試區間、過小的股票宇宙,以及前視風險。亮眼的數字,虛弱的實驗設計。

接著來了更銳利的診斷。〈Can LLM-based Financial Investing Strategies Outperform the Market?〉(arXiv:2505.07078, 2025)顯示,LLM 的回測是被「記憶」灌水了:一個訓練資料涵蓋了回測期間的模型,能有效地記得那些代碼、日期與價格走勢。它不是在預測 2021 年;它是在回憶 2021 年。一旦策略被拿到樣本外、超過模型知識截止日之後去評估,績效往往就退化了。

2026 年一份控制記憶的基準測試(arXiv:2605.28359)證實了這一點:當評估被設計成「被記住的市場歷史無法洩漏進預測」時,看似的技巧就急遽下滑。

實務上的測試很簡單。任何在「模型曾被訓練過的期間」上回測的 LLM 策略,預設就是可疑的。要求看訓練截止日之後的結果,或是一個控制了記憶的評估。這是那個經典量化原罪在智能體時代的表親,而經典的防禦手段依然適用;我們在回測過度擬合裡談了它們。

一具一分為二的機械:一側是一本攤開的書、匯入流動的手寫字,另一側是精密的鐘錶齒輪

行得通的架構:語言在上,決定論在下

從以上這一切導出的誠實結論,不是「避開 LLM」。而是一種分工。讓語言模型去做語言。讓決定論式的引擎去做每一件有後果的事。

在一套打造得好的系統裡,LLM 詮釋你的指令、起草規則、解釋結果、摘要新聞。而規則本身一旦被核准,就作為單純的決定論式邏輯來運行:從市場資料算出的指標數值、被精確比較的門檻,以及由「無法即興發揮」的算術所設定的委託大小。LLM 提議;引擎處置。如果模型在詮釋時產生了幻覺,你會在核准那一步抓到它,因為在任何東西開跑之前,系統會先讓你看到它理解成了什麼。一個錯誤的句子會被更正;它永遠不會變成一筆錯誤的委託。

這就是 Obside 畫這條線的方式。副駕是一個 LLM,而它的工作止於語言:你輸入「當 SOL 的日線 RSI(14) 收在 30 以下時買進、當它反向穿回 55 以上時賣出、每筆交易承擔 1% 風險」,副駕就把它複述成受監控的條件與一條大小規則,交給你核准。從那裡開始,決定論式的引擎接手:回測用精確的指標數學重播歷史 K 棒、模擬盤在即時資料上運行同一套邏輯,而實盤執行則以數字方式計算每一筆委託大小,並在執行當下檢查你的風險上限。LLM 從不做算術,也從不碰一筆委託。

那道切分也改變了「回測」的意義。因為被測試的對象是那條決定論式的規則、而不是模型逐日的判斷,所以沒有任何被記住的歷史能洩漏進去:不論測試區間落在任何訓練語料的內側或外側,那條規則的表現都一模一樣。你驗證的是邏輯,不是回憶。這些零件如何組合成一套完整的「感知—推理—行動」系統,是它自己的一個主題,涵蓋在AI 交易智能體詳解裡。

接下來該往哪走

把 LLM 當成一位才華洋溢、卻沒有執照去碰錢的分析師。用它來讀得更快、把意圖轉譯成精確的規則,以及拷問你自己的邏輯。拒絕給它三份工作:計算數字、估計機率、預測價格。而且對任何來自「模型可能背得下來的回測」的績效宣稱都打折扣;研究在這一點上毫不含糊。

如果你想要這種分工已經打造好的樣子,Obside 預設就套用它:語言由副駕處理、數學與執行由決定論式引擎處理,而且在你核准那條被複述的規則、並看著它在模擬盤上運作之前,沒有任何東西會上線。

僅供教育參考,不構成投資建議。交易存在風險,可能導致本金損失。

FAQ

沒有可信的證據支持這件事。2026 年一份對 77 篇 LLM 交易研究的審視(arXiv:2605.19337)發現,持久性 alpha 的證據仍然稀薄,而那些控制了記憶的研究顯示,看似的預測技巧急遽下滑。LLM 辨認的是文字裡的模式;價格不是文字。它們在交易中已被證明的價值,是有紀律的執行支援、研究輔助,以及把意圖轉譯成規則,而不是預測報酬。

相關文章

用 Obside 試試你的投資組合

連接你的券商,用一句話打造你的投資組合。

立即開始