LLMs im Trading: Was sie können und was nicht
Wo große Sprachmodelle Tradern wirklich helfen, wo sie selbstsicher versagen und warum die Forschung sagt, dass LLM-Backtests sich selbst schmeicheln. Ein technisch ehrlicher Leitfaden.

Alle paar Wochen behauptet ein Paper oder ein Produkt, ein großes Sprachmodell habe den Markt geschlagen. Die Behauptungen verdienen einen härteren Blick, als sie meist bekommen, denn LLM-Trading sitzt an einer unbequemen Kreuzung: Sprachmodelle sind bei manchen trading-nahen Aufgaben wirklich hervorragend und bei anderen Teilen wirklich furchtbar, und das Marketing sagt Ihnen selten, was was ist. Dieser Artikel zieht die Linie präzise. Was LLMs gut können, wo sie versagen, warum ihre Backtests sich selbst schmeicheln und die Architektur, die die Vorteile bekommt, ohne Ihr Konto auf einen Textvorhersager zu setzen.
Was ein LLM ist und warum das am Orderbuch zählt
Ein LLM ist ein Next-Token-Vorhersager: Bei gegebenem Text produziert es den Text, der statistisch am wahrscheinlichsten folgt, geformt durch Training, hilfreich zu sein. Diese eine Tatsache erklärt sowohl seine Stärken als auch seine Fehlermodi im Trading.
Vorhersage über Sprache macht LLMs großartig bei Sprachaufgaben: Zusammenfassen, Übersetzen zwischen Formulierungen, Struktur aus Prosa extrahieren, Argumentationsmuster imitieren, die in ihren Trainingsdaten auftauchen. Finanzen ertrinken in genau dieser Art von Material. Berichte, Transkripte, Notenbank-Statements, Nachrichtenticker: unstrukturierter Text, der zuvor menschliche Stunden zum Verdauen brauchte.
Aber die Next-Token-Vorhersage hat kein Rechenbuch in sich. Das Modell berechnet 2,7 % von 41.000 $ nicht so, wie ein Taschenrechner es tut; es produziert Ziffern, die im Kontext plausibel aussehen. Es hat kein kalibriertes Wahrscheinlichkeitsgefühl, keinen Live-Marktfeed, sofern keiner angeschraubt ist, und kein Konzept davon, falsch zu liegen, nur davon, unwahrscheinlich zu sein. Nichts davon zählt, wenn die Ausgabe eine Zusammenfassung ist. Alles davon zählt, wenn die Ausgabe eine Order ist.
Wo LLM-Trading-Tools wirklich helfen
Vier Aufgaben stechen heraus, und sie teilen eine Eigenschaft: Das LLM erledigt die Sprache, während etwas anderes die Konsequenzen erledigt.
Nachrichten und Berichte in Maschinengeschwindigkeit parsen. Ein LLM kann ein FOMC-Statement Sekunden nach der Veröffentlichung lesen und es gegen das vorherige markieren: welche Sätze sich änderten, ob die Sprache zur Inflation härter oder weicher wurde. Es kann einen 200-seitigen Jahresbericht in „Guidance gesenkt, Margendruck auf Inputkosten zurückgeführt, Rückkauf pausiert“ verwandeln. Menschen tun das gut; LLMs tun es in Sekunden über hunderte Dokumente hinweg.
Absicht in Regeln übersetzen. „Ich will Schwäche in einem Aufwärtstrend kaufen“ ist nicht ausführbar. Ein LLM ist gut darin, die Übersetzung vorzuschlagen: Preis über dem gleitenden 200-Tage-Durchschnitt, RSI(14) unter 35, feste Positionsgröße, definierter Ausstieg. Der Mensch beurteilt, ob die Übersetzung zur Absicht passt; die Maschine erledigt den Entwurf.
Positionen und Marktphasen erklären. Gefragt, warum ein Portfolio diese Woche 4 % verloren hat, kann ein LLM mit Zugriff auf die tatsächlichen Positionsdaten und die Kurshistorie eine lesbare Zuordnung produzieren: welche Bestände es trieben, was korrelierte, welche Nachrichten zusammenfielen. Das ist Zusammenfassung mit Finanz-Hut, mitten in der Kompetenz des Modells.
Strategielogik kritisieren. Beschreiben Sie Ihr System einem LLM und fragen Sie, was es bricht, und Sie bekommen oft eine nützliche Liste: keine Invalidierungsregel, keine Gebührenannahme, eine Einstiegsbedingung, die selten feuert. Ein allgemeiner Chatbot kann so viel, weshalb wir ChatGPT als nützlichen Assistenten und furchtbaren Trader behandeln, und die Unterscheidung überträgt sich auf zweckgebaute Systeme.
Wo LLMs versagen, und zwar selbstsicher
Arithmetik. Bitten Sie ein Modell, eine Position zu dimensionieren, die 1 % eines 27.400-$-Kontos riskiert, mit Einstieg bei 43.150 $ und Stop bei 41.900 $, und Sie bekommen vielleicht die richtige Antwort: 274 $ Risiko gegen 1.250 $ pro Einheit, also rund 0,22 Einheiten. Sie bekommen vielleicht auch einen flüssigen Absatz mit einer falschen Zahl, ohne ein Signal, das die beiden Fälle unterscheidet. Die Fehler eines Taschenrechners sind selten und laut; die eines LLM sind gelegentlich und still. Stille Fehler sind die teure Sorte im Trading.
Kalibrierung. Trading ist probabilistische Entscheidungsfindung, und LLMs produzieren keine kalibrierten Wahrscheinlichkeiten. Ein Modell, das sagt „dieser Ausbruch hat eine 70-%-Chance fortzusetzen“, generiert einen plausiblen Satz, misst keine Häufigkeit. Auf erfundene Zuversicht zu handeln ist schlimmer, als auf keine Zuversicht zu handeln, weil es sich wie Information anfühlt.
Kursprognose. Nichts im Next-Token-Training verleiht einen Vorteil beim Prognostizieren von Renditen. Ein Audit von 77 LLM-Trading-Studien (arXiv:2605.19337, 2026) kam zu dem Schluss, dass die Belege für dauerhaftes Alpha dünn bleiben und dass der praktische Wert dieser Systeme in disziplinierter Ausführung, Überwachung und Recherche-Unterstützung liegt statt in der Aktienauswahl. Dieser Befund passt zum Mechanismus: Das Modell erkennt Muster in Text, und Preise sind kein Text.
Erfundene Fakten. LLMs halluzinieren, und Finanzen provozieren es: dichte Zahlen, ähnliche Entitätsnamen, datumssensible Behauptungen. Benchmarks von 2024 bis 2025 maßen Halluzination bei einem erheblichen Anteil von Finanzfragen, die ohne Schutzmechanismen gestellt wurden. Der Fehlermodus und seine Behebungen auf Architektur-Ebene verdienen eine eigene Behandlung, die sie in KI-Halluzinationen im Trading bekommen.
Die Backtest-Fata-Morgana: warum LLM-Ergebnisse sich selbst schmeicheln
Die Forschungsliteratur hat ein Reproduktionsproblem, das man verstehen sollte, bevor man dem Track Record irgendeiner LLM-Strategie vertraut.
Ein Survey von LLM-Trading-Agenten aus 2024 (arXiv:2408.06361) merkte an, dass die meisten veröffentlichten Systeme überlegene Backtest-Performance berichten, und markierte dann das Muster hinter dem Muster: kurze Testfenster, kleine Aktien-Universen und Lookahead-Risiko über weite Teile des Feldes. Beeindruckende Zahlen, schwaches experimentelles Design.
Dann kam die schärfere Diagnose. „Can LLM-based Financial Investing Strategies Outperform the Market?“ (arXiv:2505.07078, 2025) zeigte, dass LLM-Backtests durch Auswendiglernen aufgebläht werden: Ein Modell, dessen Trainingsdaten den Backtest-Zeitraum abdecken, kann Ticker, Daten und Kursbewegungen faktisch erinnern. Es prognostiziert nicht 2021; es ruft 2021 ab. Die Performance verschlechtert sich oft, sobald die Strategie außerhalb der Stichprobe bewertet wird, jenseits des Wissens-Cutoffs des Modells.
Ein speicherkontrollierter Benchmark aus 2026 (arXiv:2605.28359) bestätigte es: Wenn die Bewertung so gestaltet ist, dass auswendig gelernte Markthistorie nicht in die Vorhersagen einsickern kann, fällt die scheinbare Fähigkeit stark ab.
Der praktische Test ist einfach. Jede LLM-Strategie, die über einen Zeitraum backgetestet wurde, auf dem das Modell trainiert wurde, ist standardmäßig verdächtig. Fragen Sie nach Ergebnissen nach dem Trainings-Cutoff oder nach einer speicherkontrollierten Bewertung. Das ist der Vetter aus der Agenten-Ära einer klassischen Quant-Sünde, und die klassischen Abwehrmaßnahmen gelten weiter; wir behandeln sie in Backtest-Overfitting.
Die Architektur, die funktioniert: Sprache obendrauf, Determinismus darunter
Der ehrliche Schluss aus alldem lautet nicht „LLMs meiden“. Es ist eine Arbeitsteilung. Lassen Sie das Sprachmodell Sprache machen. Lassen Sie deterministische Engines alles mit Konsequenzen machen.
In einem gut gebauten System interpretiert das LLM Ihre Anweisung, entwirft die Regel, erklärt die Ergebnisse und fasst die Nachrichten zusammen. Die Regel selbst läuft, einmal genehmigt, als schlichte deterministische Logik: Indikatorwerte aus Marktdaten berechnet, Schwellen exakt verglichen, Orders per Arithmetik dimensioniert, die nicht improvisieren kann. Das LLM schlägt vor; die Engine verfügt. Wenn das Modell während der Interpretation halluziniert, fangen Sie es am Freigabeschritt ab, weil das System Ihnen zeigt, was es verstanden hat, bevor irgendetwas läuft. Ein falscher Satz wird korrigiert; er wird nie zu einer falschen Order.
So zieht Obside die Linie. Der Copilot ist ein LLM, und seine Aufgabe endet bei der Sprache: Sie tippen „kaufe SOL, wenn RSI(14) im Tageschart unter 30 schließt, verkaufe, wenn er wieder über 55 kreuzt, riskiere 1 % pro Trade“, und der Copilot formuliert das als überwachte Bedingungen und eine Dimensionierungsregel zu Ihrer Freigabe neu. Von da an übernehmen deterministische Engines: Der Backtest spielt historische Kerzen mit exakter Indikator-Mathematik ab, Paper-Trading lässt dieselbe Logik auf Live-Daten laufen, und die Live-Ausführung berechnet jede Ordergröße numerisch mit Ihren Risikolimits, die zur Ausführungszeit geprüft werden. Das LLM macht nie die Arithmetik und berührt nie eine Order.
Diese Teilung ändert auch, was ein Backtest bedeutet. Weil das getestete Objekt die deterministische Regel ist und nicht das tägliche Urteil des Modells, gibt es keine auswendig gelernte Historie, die einsickern könnte: Die Regel performt identisch, ob das Testfenster innerhalb oder außerhalb irgendeines Trainingskorpus fällt. Sie validieren Logik, nicht Erinnerung. Wie sich diese Teile zu einem vollständigen Wahrnehmen-Schlussfolgern-Handeln-System fügen, ist ein eigenes Thema, behandelt in KI-Trading-Agenten erklärt.
Wie es von hier aus weitergeht
Behandeln Sie das LLM als brillanten Analysten ohne Lizenz, Geld anzufassen. Nutzen Sie es, um schneller zu lesen, Absicht in präzise Regeln zu übersetzen und Ihre eigene Logik zu hinterfragen. Verweigern Sie ihm drei Aufgaben: Zahlen berechnen, Wahrscheinlichkeiten schätzen und Kurse vorhersagen. Und rabattieren Sie jede Performance-Behauptung aus einem Backtest, den das Modell hätte auswendig lernen können; die Forschung ist da unmissverständlich.
Wenn Sie diese Arbeitsteilung bereits gebaut haben wollen: Obside wendet sie standardmäßig an: Sprache vom Copilot erledigt, Mathematik und Ausführung von deterministischen Engines erledigt, und nichts geht live, bevor Sie die neu formulierte Regel genehmigt und im Paper-Modus arbeiten gesehen haben.
Nur zu Bildungszwecken. Dies ist keine Anlageberatung. Trading ist mit Risiken verbunden, einschließlich des möglichen Kapitalverlusts.
FAQ
Keine glaubwürdigen Belege stützen das. Ein Audit von 77 LLM-Trading-Studien aus 2026 (arXiv:2605.19337) fand, dass Belege für dauerhaftes Alpha dünn bleiben, und Studien, die für Auswendiglernen kontrollieren, zeigen, dass scheinbare Vorhersagefähigkeit stark abfällt. LLMs erkennen Muster in Text; Preise sind kein Text. Ihr nachgewiesener Wert im Trading ist disziplinierte Ausführungsunterstützung, Recherche-Hilfe und das Übersetzen von Absicht in Regeln, nicht das Prognostizieren von Renditen.
Verwandte Artikel
- Was ist Agentic Trading? Der komplette Leitfaden
- KI-Trading-Agenten erklärt: Wie sie wirklich funktionieren
- KI-Halluzinationen im Trading: Leitplanken schlagen blindes Vertrauen
- Backtest-Overfitting: Wenn großartige Ergebnisse eine Falle sind
- ChatGPT fürs Trading: nützlicher Assistent, miserabler Trader
Teste Obside mit deinem Portfolio
Verbinde deinen Broker und bau dein Portfolio mit einem einzigen Prompt.
Loslegen