トレーディングにおけるLLM:できること、できないこと
大規模言語モデルがトレーダーを本当に助ける場面、自信たっぷりに失敗する場面、そしてなぜ研究がLLMのバックテストは自らを良く見せると言うのか。技術的に正直なガイド。

数週間ごとに、ある論文や製品が、大規模言語モデルが市場に勝ったと主張します。その主張は、通常受けているよりも厳しい目に値します。LLMトレーディングは、気まずい交差点に位置しているからです。言語モデルは、トレーディングに隣接する一部の作業には本当に優れており、ほかの部分では本当にひどく、そしてマーケティングは、どちらがどちらかをめったに教えてくれません。本記事はその線を正確に引きます。LLMが得意とすること、失敗する場面、なぜそのバックテストが自らを良く見せるのか、そしてテキスト予測器にあなたの口座を賭けずに恩恵を得るアーキテクチャです。
LLMとは何か、そしてそれが板の前でなぜ重要なのか
LLMは次トークン予測器です。テキストを与えられると、それに続く統計的に見込みの高いテキストを、役に立つように訓練された形で生成します。このたった1つの事実が、トレーディングにおけるその強みと失敗モードの両方を説明します。
言語に対する予測は、LLMを言語作業に非常に長けたものにします。要約、言い回しの間の翻訳、散文からの構造の抽出、訓練データに現れる推論パターンの模倣。金融は、まさにこの種の素材で溢れかえっています。開示書類、決算説明会の書き起こし、中央銀行の声明、ニュース配信。以前は人間の何時間もを要して咀嚼していた非構造化テキストです。
しかし次トークン予測の内側に、帳簿はありません。モデルは、電卓のように$41,000の2.7%を計算するのではなく、文脈上もっともらしく見える数字を生成します。較正された確率の感覚はなく、後付けしない限りライブの市場フィードもなく、間違っているという概念もなく、あるのは「見込みが低い」という概念だけです。出力が要約なら、そのどれも問題になりません。出力が注文なら、そのすべてが問題になります。
LLMトレーディング・ツールが本当に役立つ場面
4つの仕事が際立っており、共通の性質を持ちます。LLMが言語を扱い、別の何かが結果を扱う、という点です。
**ニュースと開示書類を機械の速度で解析する。**LLMはFOMC声明を発表の数秒後に読み、前回のものと照合できます。どの文が変わったか、インフレに関する言葉が硬化したか軟化したか。200ページの年次報告書を「ガイダンス引き下げ、投入コストに起因するマージン圧迫、自社株買い停止」に変えられます。人間もこれは得意ですが、LLMは数百の文書にわたり数秒でやります。
意図をルールに翻訳する。「上昇トレンドの中の弱さを買いたい」は実行可能ではありません。LLMは翻訳の提案が得意です。価格が200日移動平均線の上、RSI(14)が35未満、ポジションサイズは固定、エグジットは定義済み。翻訳が意図に合っているかを人間が判断し、下書きは機械が扱います。
**ポジションと局面を説明する。**ポートフォリオが今週なぜ4%下げたのかを問われれば、実際のポジションデータと価格履歴にアクセスできるLLMは、読みやすい要因分解を作れます。どの保有が牽引したか、何が相関したか、どんなニュースが重なったか。これは金融の帽子をかぶった要約であり、まさにモデルの得意領域の内側です。
**戦略ロジックを批評する。**自分のシステムをLLMに説明し、何がそれを壊すかを尋ねると、しばしば有用なリストが返ってきます。無効化ルールがない、手数料の前提がない、めったに発火しないエントリー条件。汎用のチャットボットでもこの程度はできます。だから私たちはChatGPTを有用な助手であり、ひどいトレーダーとして扱うのであり、その区別は専用に作られたシステムにも引き継がれます。
LLMが失敗する場面、しかも自信たっぷりに失敗する場面
算術。$27,400の口座の1%をリスクにさらし、エントリーが$43,150、ストップが$41,900のポジションサイズをモデルに尋ねると、正しい答えが返ってくるかもしれません。リスクは$274、1単位あたり$1,250なので、およそ0.22単位。しかし、間違った数字を含む流暢な段落が返ってくることもあり、その2つのケースを区別する合図はありません。電卓の誤りはまれで大きな声を上げますが、LLMの誤りはときどきで、静かです。静かな誤りこそ、トレーディングでは高くつく種類のものです。
**較正。**トレーディングは確率的な意思決定であり、LLMは較正された確率を生み出しません。「このブレイクアウトが継続する確率は70%です」と言うモデルは、頻度を測っているのではなく、もっともらしい文を生成しています。でっち上げられた自信に基づいて行動するのは、自信なしで行動するより悪い。情報のように感じられるからです。
**価格予測。**次トークンの訓練の中に、リターン予測での優位性を授けるものは何もありません。LLMトレーディングに関する77本の研究を扱ったレビュー(arXiv:2605.19337, 2026)は、持続的なアルファの証拠は依然として薄く、これらのシステムの実用的な価値は銘柄選択ではなく規律ある執行、監視、リサーチ支援にあると結論づけました。その発見は仕組みと一致します。モデルはテキストの中のパターンを認識し、価格はテキストではないからです。
**捏造された事実。**LLMは幻覚(ハルシネーション)を起こし、金融はそれを誘発します。密な数字、似た固有名、日付に敏感な主張。2024年から2025年のベンチマークは、安全策なしで尋ねた金融の質問のかなりの割合で幻覚を測定しました。この失敗モードとそのアーキテクチャレベルの対策は、それ自体の扱いに値し、トレーディングにおけるAIの幻覚で扱っています。
バックテストの蜃気楼:なぜLLMの成績は自らを良く見せるのか
研究文献には、どんなLLM戦略の実績を信じる前にも理解しておく価値のある、再現性の問題があります。
LLMトレーディング・エージェントに関する2024年のサーベイ(arXiv:2408.06361)は、公表されたシステムの大半が優れたバックテスト成績を報告していると指摘し、そのうえでパターンの背後にあるパターンを警告しました。この分野の多くにわたる、短いテスト期間、小さな銘柄ユニバース、そして先読みのリスク。印象的な数字と、弱い実験設計です。
それからより鋭い診断が来ました。「Can LLM-based Financial Investing Strategies Outperform the Market?」(arXiv:2505.07078, 2025)は、LLMのバックテストが記憶によって水増しされていることを示しました。訓練データがバックテスト期間をカバーするモデルは、ティッカー、日付、価格の動きを実質的に覚えていられます。それは2021年を予測しているのではなく、2021年を思い出しているのです。戦略がアウトオブサンプルで、モデルの知識のカットオフより後で評価されると、成績はしばしば劣化します。
2026年の記憶を統制したベンチマーク(arXiv:2605.28359)がそれを裏づけました。記憶された市場の履歴が予測に漏れ込めないように評価が設計されると、見かけの技量は急落します。
実践的なテストは単純です。モデルが訓練された期間にわたってバックテストされたLLM戦略は、既定で疑わしい。訓練カットオフ後の結果、または記憶を統制した評価を求めてください。これは古典的なクオンツの罪の、エージェント時代のいとこであり、古典的な防御が今も通用します。それらはバックテストの過剰最適化で扱っています。
機能するアーキテクチャ:言語を上に、決定論を下に
以上のすべてからの正直な結論は「LLMを避けよ」ではありません。分業です。言語モデルには言語をやらせる。決定論的なエンジンには、結果を伴うすべてをやらせる。
よく作られたシステムでは、LLMはあなたの指示を解釈し、ルールを下書きし、結果を説明し、ニュースを要約します。ルールそのものは、いったん承認されれば、素朴な決定論的ロジックとして走ります。市場データから計算された指標の値、正確に比較される閾値、即興のできない算術でサイズを決められる注文。LLMが提案し、エンジンが処理します。もしモデルが解釈中に幻覚を起こしても、承認のステップでそれを捕まえられます。システムが、何かが走る前に、理解した内容をあなたに示すからです。間違った文は訂正されます。それが間違った注文になることは決してありません。
これがObsideの引く線です。コパイロットはLLMであり、その仕事は言語で終わります。あなたが「日足のRSI(14)が30を割って引けたらSOLを買い、55を上抜けたら売る、取引ごとに1%リスク」と入力すると、コパイロットはそれを監視条件とサイズ決定のルールとして言い直し、あなたの承認を待ちます。そこから先は決定論的なエンジンが引き継ぎます。バックテストは正確な指標計算で過去のローソク足を再生し、ペーパートレードは同じロジックをライブデータ上で走らせ、ライブ執行はすべての注文サイズを数値的に計算し、あなたのリスク制限を執行時点でチェックします。LLMは算術を決して行わず、注文に決して触れません。
その分割は、バックテストの意味も変えます。テストされる対象がモデルの日々の判断ではなく決定論的なルールであるため、漏れ込む記憶された履歴がありません。ルールは、テスト期間がどの訓練コーパスの内側に落ちようと外側に落ちようと、同一に機能します。あなたは想起ではなくロジックを検証しているのです。これらの部品がどう組み合わさって完全な知覚・推論・行動のシステムになるかは、それ自体のテーマであり、AIトレーディング・エージェントを解説で扱っています。
ここからどこへ
LLMを、お金に触れる免許を持たない優秀なアナリストとして扱ってください。速く読むため、意図を正確なルールに翻訳するため、そして自分自身のロジックを問いただすために使いましょう。3つの仕事は拒否してください。数字を計算すること、確率を見積もること、価格を予測すること。そして、モデルが記憶しえたバックテストからのどんな成績の主張も割り引いてください。研究はその点について明白です。
この分業がすでに作り込まれたものが欲しければ、Obsideはそれを既定で適用します。言語はコパイロットが扱い、計算と執行は決定論的なエンジンが扱い、言い直されたルールをあなたが承認し、それがペーパーで動くのを見届けるまで、何もライブにはなりません。
本記事は教育目的のみです。投資助言ではありません。取引には元本を失う可能性を含むリスクがあります。
FAQ
それを支持する信頼できる証拠はありません。LLMトレーディングに関する77本の研究を扱った2026年のレビュー(arXiv:2605.19337)は、持続的なアルファの証拠は依然として薄いと結論づけ、記憶を統制した研究は、見かけの予測技量が急落することを示しています。LLMはテキストの中のパターンを認識しますが、価格はテキストではありません。トレーディングで実証されているその価値は、規律ある執行支援、リサーチ支援、意図のルールへの翻訳であって、リターンの予測ではありません。