So backtesten Sie einen KI-Trading-Agenten, bevor er live geht
Eine Methode Regime für Regime zum Backtesten agentenbasierter Strategien, die Report-Zahlen, die wirklich zählen, und warum sich LLM-gesteuerte Backtests selbst schmeicheln.

Ein Agent, den Sie aus einem Prompt in Alltagssprache gebaut haben, fühlt sich in dem Moment getestet an, in dem er Ihre Strategie korrekt zurückformuliert. Das ist er nicht. Zurückformulieren ist Verständnis; Backtesten ist Beweis. Bevor ein Agent echtes Kapital anfasst, wollen Sie wissen, wie sich seine exakten Regeln über Jahre echter Markthistorie verhalten hätten. Und um einen KI-Trading-Agenten gut zu backtesten, brauchen Sie drei Dinge: Regeln, die eng genug festgezurrt sind, um sie wiederzugeben, Testzeiträume, die feindlich genug sind, um zu zählen, und die Disziplin, den Report als Kritiker statt als Fan zu lesen. Dieser Leitfaden behandelt alle drei – plus eine Fehlerart, die nur LLM-gesteuerte Strategien betrifft.
Zurren Sie die Regeln fest, bis eine Maschine sie wiedergeben könnte
Ein Backtest spielt Ihre Logik gegen historische Daten ab, Kerze für Kerze. Das funktioniert nur, wenn jede Entscheidung Ihres Agenten aus Daten berechenbar ist, die in jenem Moment existierten. „Kaufen, wenn der tägliche RSI(14) unter 30 schließt und der Kurs über dem 200-Tage-Durchschnitt liegt" lässt sich perfekt wiedergeben. „Kaufen, wenn die Nachrichten übertrieben wirken" nicht, denn „wirken" steht in keiner Kerze.
Die erste Aufgabe ist also, die zurückformulierten Bedingungen Ihres Agenten in eine vollständige Spezifikation zu überführen. Ein nützlicher Test: Könnte eine Tabellenkalkulation mit historischen Kursen und Ihren Regeln jeden Einstieg, jeden Ausstieg und jede Positionsgröße bestimmen, ganz ohne Ermessensentscheidungen? Wenn eine Regel Interpretation braucht, wird die Backtest-Engine sie irgendwie interpretieren, und ihre Interpretation wird ohne Ihre Zustimmung zu Ihrer Strategie.
Achten Sie auch auf die leisen Parameter. Annahmen zu Slippage und Gebühren, Ordertyp (eine Market-Order wird ausgeführt; eine Limit-Order manchmal nicht) und was mit Signalen außerhalb der Handelszeiten bei Aktien geschieht. Wenn Ihnen die generelle Funktionsweise dieser Engines neu ist, deckt unser Leitfaden zu Backtesting-Software die Grundlagen ab; dieser Artikel bleibt auf das fokussiert, was bei Agenten anders ist. Und wenn Sie Einstieg, Ausstieg, Größe und Invalidierung Ihrer Strategie noch nicht definiert haben, tun Sie das zuerst; es ist Schritt zwei beim Erstellen eines KI-Trading-Agenten.
So backtesten Sie einen KI-Trading-Agenten über verschiedene Marktregime
Eine Strategie, die nur an der jüngsten Vergangenheit getestet wurde, ist eine Wette darauf, dass die jüngste Vergangenheit sich fortsetzt. Die Lösung ist gezielt: Wählen Sie Testfenster, die verschiedene Fehlerarten belasten, und verlangen Sie vom Agenten, die meisten davon zu überstehen. Vier Regime aus dem letzten Jahrzehnt decken viel Terrain ab:
| Zeitraum | Was es war | Was es belastet |
|---|---|---|
| 2018 | Zermürbender Bärenmarkt (Krypto ~80 % runter, scharfer Q4-Rutsch bei Aktien) | Ausstiegsdisziplin, DCA-Schmerztoleranz, Tod durch tausend Schnitte |
| Feb–März 2020 | Senkrechter Crash, dann V-förmige Erholung | Stopps bei Gap-Bewegungen und Slippage, ob Sie wieder einsteigen oder ängstlich bleiben |
| 2021 | Anhaltender Melt-up | Ob Shorts und Mean-Reversion-Regeln gegen den Trend kämpfen, vorzeitige Gewinnmitnahmen |
| 2022 | Drawdown bei steigenden Zinsen, Aktien und Krypto fallen gemeinsam | Korrelationsannahmen, Trendfilter, Drawdown-Obergrenzen |
Lassen Sie die Regeln des Agenten durch jedes Fenster einzeln laufen, nicht nur durch einen langen Durchschnitt. Eine Dip-Buying-Regel kann 2020 und 2021 glänzen und dann 2022 alles zurückgeben; eine einzige Aggregatzahl verbirgt diese Geschichte. Sie verlangen keinen Gewinn in allen vier Regimen. Sie verlangen zu wissen, im Voraus, welches Regime Ihrem Agenten wehtut und ob seine Invalidierungsregel auslöst, bevor sich der Schaden aufsummiert.
Hier zählt das Werkzeug ganz praktisch: Bei Obside spielt die Backtesting-Engine Jahre historischer Daten in Minuten ab, mit eingebauten Slippage-Annahmen, sodass vier Fenster zu testen vier Läufe vor dem Mittagessen sind statt ein Wochenendprojekt. Welche Engine Sie auch nutzen, das Prinzip bleibt: Regime, keine Durchschnitte.
Lesen Sie den Report wie ein Gegner
Ein Backtest-Report ist ein Verkaufsargument, geschrieben von Ihren eigenen Hoffnungen. Lesen Sie jede Zahl daraufhin, was sie sagen kann und was nicht.
Die Sharpe-Ratio misst die Rendite pro Einheit Volatilität. Ungefähr zwischen 0,5 und 1,5 liegt die ehrliche Zone für die meisten Privatanleger-Strategien; eine Sharpe über 3 in einem Backtest ist häufiger ein Bug, ein Bias oder ein Overfit als eine Entdeckung.
Der maximale Drawdown ist der tiefste Verlust vom Hoch zum Tief. Vergleichen Sie ihn mit dem, was Sie wirklich aushalten können, und nehmen Sie dann an, dass es live schlimmer wird, denn der historische Worst Case ist ein Boden, keine Decke.
Die Trefferquote bedeutet allein nichts. Eine 90-%-Trefferquote mit kleinen Gewinnen und seltenen katastrophalen Verlusten beschreibt eine Strategie, die Münzen vor einer Dampfwalze aufsammelt; koppeln Sie sie mit dem durchschnittlichen Gewinn-Verlust-Verhältnis, bevor Sie sie bewundern.
Die Trade-Anzahl ist Ihre Stichprobengröße. Unter etwa 30 Trades haben Sie eine Anekdote. Unter 10 haben Sie eine Geschichte.
Die Exposure sagt Ihnen, wie lange Kapital im Markt saß, um die Rendite zu verdienen – das Risiko, das die Equity-Kurve nicht zeigt.
Führen Sie dann eine Stressvariation aus: Verdoppeln Sie die Annahmen zu Slippage und Gebühren und lassen Sie erneut laufen. Strategien, die oft handeln oder dünne Werte handeln, können in diesem einzigen Test zusehen, wie ihr Vorsprung verdampft. Wenn kleine Parameteränderungen (RSI 30 gegen 32, Stopp bei 4 % gegen 5 %) die Ergebnisse zusammenbrechen lassen, starren Sie wahrscheinlich auf Curve-Fitting; diese ganze Fehlerfamilie wird in unserem Leitfaden zu Backtest-Overfitting seziert.
Der LLM-Vorbehalt: wenn das Modell das Ende schon kennt
Agentenbasierte Strategien führen eine Fehlerart ein, die klassische Bots nie hatten. Wenn ein großes Sprachmodell innerhalb der Backtest-Schleife Entscheidungen trifft (Werte auswählen, Einstiege timen, Nachrichten gewichten), kann seine Trainingsdatenbasis genau die Historie enthalten, an der Sie testen. Das Modell prognostiziert nicht 2021; es erinnert sich an 2021.
Das ist nicht hypothetisch. Forschung zu LLM-basierten Anlagestrategien fand Backtests, die durch Memorierung und Lookahead aufgebläht waren: Modelle, deren Trainingsdaten das Testfenster überlappen, können Ticker, Daten und Kursbewegungen abrufen, und die Performance verschlechtert sich oft außerhalb der Stichprobe („Can LLM-based Financial Investing Strategies Outperform the Market?", arXiv:2505.07078, 2025). Ein nachfolgender speicherkontrollierter Benchmark zeigte, dass die scheinbare Fähigkeit von LLM-Trading-Agenten deutlich fällt, wenn memorierte Markthistorie sauber ausgeschlossen wird (arXiv:2605.28359, 2026). Ein Überblick über das Feld markiert dasselbe Muster in mehreren Studien: kurze Testfenster, kleine Universen und Lookahead-Risiko (arXiv:2408.06361, 2024).
Zwei praktische Verteidigungen. Erstens: Wenn ein LLM Trades entscheidet, vertrauen Sie nur Testfenstern nach seinem Trainings-Cutoff, was Ihnen meist Monate an Daten lässt, nicht Jahre. Zweitens, und für die meisten Privatanwendungen besser: Halten Sie das LLM ganz aus der Replay-Schleife heraus. Lassen Sie es Ihre Strategie einmal in deterministische Regeln übersetzen und backtesten Sie diese Regeln dann auf klassische Weise. So ist Obside gebaut: Der Copilot interpretiert Ihre Sprache, aber der Backtest spielt feste Bedingungen gegen historische Kerzen ab, sodass kein Modell in der Schleife steckt, das sich an die Antworten erinnern könnte.
Abschlusskriterien: wie ein bestandener Backtest aussieht
Bevor Sie weitergehen, schreiben Sie auf, was „bestanden" bedeutet, und prüfen Sie den Report dann kühl dagegen. Eine vernünftige Latte:
- Übersteht mindestens drei der vier Regime, das heißt, die Verluste blieben innerhalb der Invalidierungsregel, auch dort, wo es nicht profitabel war.
- Maximaler Drawdown an oder unter der Zahl, die Sie vor dem Test für tolerierbar erklärt haben.
- Mindestens 30 Trades über den gesamten Test, genug, um etwas zu bedeuten.
- Immer noch positiv, nachdem die Kostenannahmen verdoppelt wurden.
- Benachbarte Parameterwerte geben ähnliche Ergebnisse – ein Plateau statt eines einzelnen magischen Gipfels.
- Sie können die schlimmste Verlustserie in klaren Worten erklären: welche Marktbedingung sie verursacht hat und warum die Strategie trotzdem solide ist.
Verfehlen Sie ein Kriterium, haben Sie ein Redesign-Ziel. Verfehlen Sie drei, haben Sie eine andere Strategie zu finden. Und ein voller Erfolg ist immer noch keine Freigabe zum Live-Gang: Ein Backtest kann die Übersetzung Ihrer Absicht auf Echtzeitdaten, das Ausführungs-Timing oder Ihr eigenes Verhalten beim Beobachten echter Drawdowns nicht testen. Dafür ist die nächste Stufe da, und dieselbe Agentendefinition sollte unverändert dorthin wandern; die Begründung und die Checkliste stehen in unserem Leitfaden zum Papertrading eines KI-Agenten.
Wie es weitergeht
Beim Backtesten eines Agenten geht es weniger darum, großartige Zahlen zu finden, als darum, Informationen billig zu kaufen: welches Regime Ihre Regeln bricht, wie Ihr schlimmster Monat aussieht, ob Kosten den Vorsprung auffressen. Jede dieser Erkenntnisse kostet im Backtest nichts und live echtes Geld. Zurren Sie die Regeln fest, lassen Sie die vier Regime laufen, lesen Sie den Report wie ein Gegner und halten Sie jedes LLM von der Replay-Schleife fern. Wenn Sie eine Engine wollen, die Jahre in Minuten abspielt, Slippage einbezieht und genau denselben Agenten in einem Schritt zum Papertrading befördert, starten Sie Ihren nächsten Backtest auf Obside.
Nur zu Bildungszwecken. Dies ist keine Anlageberatung. Trading ist mit Risiken verbunden, einschließlich des möglichen Kapitalverlusts.
FAQ
Weit genug, um mindestens einen Bärenmarkt, einen Crash und eine kräftige Rally einzuschließen; für die meisten Strategien bedeutet das fünf Jahre oder mehr. Die Länge zählt weniger als die Vielfalt: Drei Jahre von 2020 bis 2022 lehren mehr als acht Jahre stetiger Bullenmarkt. Bei schnelleren Strategien bestätigen Sie zusätzlich die Stichprobengröße, denn über 30 Trades sind eine vernünftige Untergrenze, bevor die Statistik viel bedeutet.
Verwandte Artikel
Teste Obside mit deinem Portfolio
Verbinde deinen Broker und bau dein Portfolio mit einem einzigen Prompt.
Loslegen