Backtest-Overfitting: Wenn großartige Ergebnisse eine Falle sind
Curve-Fitting, Survivorship, Lookahead und das Neue: LLMs, die den Testzeitraum memoriert haben. Wie Sie aufgeblähte Ergebnisse erkennen und Strategien validieren, die Echtmärkte überstehen.

Das Gefährlichste, was ein Backtest tun kann, ist zu gelingen. Backtest-Overfitting ist das, was geschieht, wenn eine Strategie das Rauschen einer bestimmten Scheibe der Historie lernt statt irgendetwas Echtes über Märkte – und dabei eine wunderschöne Equity-Kurve produziert, die exakt nichts vorhersagt. Die Quant-Welt kämpft seit Jahrzehnten damit. Die Agenten-Ära fügt eine neue Wendung hinzu: Sprachmodelle, die die Historie, an der Sie sie testen, vielleicht schon gelesen haben. Dieser Artikel behandelt die klassische Mechanik, die alten Verzerrungen, die Menschen immer noch erwischen, die neue LLM-Memorierungsfehlerart und die Verteidigungen, die vertrauenswürdige von schmeichelhaften Ergebnissen trennen.
Warum Backtest-Overfitting entsteht: Freiheitsgrade
Jede einstellbare Wahl in einer Strategie ist ein Freiheitsgrad, und über Freiheitsgrade wird Rauschen angepasst. Beobachten Sie, wie es sich potenziert. Ein Moving-Average-Crossover beginnt mit zwei Parametern: der schnellen und der langsamen Länge. Fügen Sie einen RSI-Filter hinzu, und Sie haben vier: Periode plus Schwelle. Fügen Sie ein Tageszeitfenster, eine Stopp-Distanz und ein Gewinnziel hinzu, und Sie sind bei sieben oder acht. Testen Sie zehn plausible Werte je Parameter, und der Raum fasst Zehnermillionen Kombinationen. Irgendwo dort passt eine Konfiguration rein zufällig wunderbar auf Ihren Testzeitraum. Ein Optimierer findet sie für Sie.
Die Intuition ist der Münzwurf-Wettbewerb. Stellen Sie zehntausend Menschen in einen Raum, die Münzen werfen, und nach zehn Runden haben ungefähr zehn von ihnen jedes Mal Kopf geworfen. Sie sehen aus wie Genies. Sie sind Lottogewinner. Parametersuchen führen denselben Wettbewerb mit Strategievarianten als Teilnehmern, und der Sieger einer hinreichend großen Suche ist beinahe garantiert ein Zufallstreffer. Daraus folgt die unbequeme Regel: Je mehr Konfigurationen Sie ausprobiert haben, desto weniger bedeutet die Performance der besten. Eine Sharpe-Ratio von 2,0 aus dem Test von drei Ideen ist interessant. Dieselbe Zahl aus einem Sweep von fünfzigtausend ist meist nur eine Messung dafür, wie groß der Sweep war.
Die klassischen Verzerrungen: Survivorship und Lookahead
Zwei ältere Sünden blähen Backtests auf, ganz ohne Optimierer.
Survivorship-Bias bedeutet, an den heutigen Gewinnern zu testen. Lassen Sie eine Strategie über die aktuellen Bestandteile eines Aktienindex laufen, und Sie haben still jedes Unternehmen ausgeschlossen, das unterwegs delistet, mit Abschlag übernommen wurde oder pleiteging; die Verlierer, die Ihre Strategie gehalten hätte, fehlen in den Daten. Bei Krypto ist es schlimmer: Tausende toter Token verschwinden einfach aus den meisten Datensätzen, sodass ein „kaufe die Top 50 nach Marktkapitalisierung"-Backtest, gebaut auf überlebenden Coins, ein Portfolio testet, das niemand zu halten hätte wissen können. Die Lösung sind Point-in-Time-Daten, die widerspiegeln, was an jedem Datum tatsächlich handelbar war, und Skepsis, sobald solche Daten nicht verfügbar sind.
Lookahead-Bias bedeutet, auf Informationen zu handeln, bevor es sie gab. Die plumpe Version: eine Kerze mit dem Schlusskurs eben dieser Kerze zu handeln. Subtilere Versionen schleichen sich überall ein: Wirtschaftsdaten in der später revidierten statt der erstveröffentlichten Fassung, über ein Vollstichprobenfenster berechnete Indikatoren oder Fundamentaldaten, gestempelt mit dem Datum des Geschäftszeitraums statt dem späteren Datum ihrer Veröffentlichung. Jedes dieser Lecks lässt die Zeitung von morgen in die Entscheidung von heute sickern, und der Backtest belohnt das Leck.
Die neue Fehlerart: Ihr LLM hat die Antworten schon gelesen
Agentenbasierte Strategien führen eine Version von Lookahead ein, die keine Datenhygiene-Checkliste erwischt, weil das Leck im Modell steckt. Ein großes Sprachmodell, das auf Daten etwa bis 2024 trainiert wurde, hat Finanznachrichten, Kurskommentare und Nachbetrachtungen zu jeder dramatischen Marktbewegung vor seinem Cutoff aufgenommen. Bitten Sie es zu „entscheiden", was im März 2020 zu handeln ist, prognostiziert es nicht. Es erinnert sich.
Die Forschung dazu ist unverblümt. „Can LLM-based Financial Investing Strategies Outperform the Market?" (arXiv:2505.07078, 2025) zeigte, dass LLM-Strategie-Backtests durch Memorierung und Lookahead aufgebläht werden: Modelle, deren Trainingsdaten das Testfenster überlappen, können Ticker, Daten und Kursbewegungen abrufen, und die Performance verschlechtert sich oft, sobald die Auswertung außerhalb der Stichprobe erfolgt. Ein nachfolgender speicherkontrollierter Benchmark (arXiv:2605.28359, 2026) kam von der anderen Seite zum selben Urteil und fand, dass lange Backtests, die den Wissens-Cutoff eines Modells überlappen, memorierte Markthistorie in seine „Prognosen" sickern lassen, und dass die Kontrolle für Speicher die scheinbare Fähigkeit stark reduziert. Ein Agent, der auf 2020–2023 brillant aussieht, ist womöglich nur ein sehr teurer Index dessen, was 2020–2023 geschah.
Die praktischen Konsequenzen sind leicht formuliert. Wenn ein LLM irgendwo in Ihrer Schleife Entscheidungen trifft, behandeln Sie jedes Backtest-Fenster vor dem Trainings-Cutoff dieses Modells als kontaminiert und gewichten Sie Belege von nach dem Cutoff. Besser: Halten Sie das LLM ganz aus dem Prognosepfad heraus, nutzen Sie es, um Ihre Absicht in ausdrückliche Regeln zu übersetzen, und spielen Sie diese deterministischen Regeln dann gegen die Historie ab, wo Memorierung nichts hat, woran sie sich klammern kann. Die breitere Arbeitsteilung zwischen Sprachmodellen und deterministischen Engines behandelt LLMs im Trading.
Verteidigungen, die wirklich funktionieren
Keine der Verteidigungen ist exotisch. Ihre Kraft liegt darin, angewandt zu werden, bevor Sie sich in ein Ergebnis verlieben.
Halten Sie Daten zurück und respektieren Sie den Holdout. Teilen Sie die Historie und optimieren Sie nur am früheren Teil, während Sie das jüngere Segment unangetastet lassen, bis das Design eingefroren ist. Ein Blick auf den Holdout je Strategie. Spähen Sie wiederholt hinein und passen jedes Mal an, ist der Holdout still zu Trainingsdaten geworden.
Walk-Forward-Testing. Statt einer statischen Teilung optimieren Sie an einem Fenster, testen an der nächsten Scheibe, rollen vorwärts und wiederholen. Die zusammengesetzten Out-of-Sample-Segmente zeigen, wie sich die Strategie verhält, wenn sie auf Daten weiterarbeiten muss, die sie nie gesehen hat – die tatsächliche Stellenbeschreibung.
Regime-Abdeckung. Ein Testfenster ist ein Argument, und ein enges ist schwach. Spannen Sie den Krypto-Bärenmarkt 2018, den Crash im März 2020, den Melt-up 2021 und die Zermürbung 2022, und Sie erfahren, ob der Vorsprung eine Markteigenschaft ist oder ein Regime-Kostüm. Ein Überblick über LLM-Trading-Agenten (arXiv:2408.06361, 2024) markierte kurze Testfenster und kleine Universen als endemische Schwächen im Feld, und Privatanleger-Backtests sind selten besser.
Parameter-Plateaus statt Gipfel. Variieren Sie jeden Parameter um seinen gewählten Wert und beobachten Sie, was passiert. Angenommen, eine RSI-Einstiegsschwelle von 30 backtestet mit einer Sharpe von 1,4, aber 25 ergibt 0,3 und 35 ergibt 0,4: Dieser nadeldünne Zacken ist die Signatur angepassten Rauschens, denn echte Markteffekte sind nicht so präzise. Wenn alles von 25 bis 40 zwischen 0,9 und 1,2 landet, stehen Sie auf einem Plateau, und Plateaus reisen weit häufiger ins Live-Trading als Gipfel. Wählen Sie die Mitte eines breiten Plateaus über die Spitze eines scharfen Zackens, selbst wenn die Zahl des Zackens hübscher ist.
Auch hier hilft das Werkzeug entweder oder schadet still, also wählen Sie Backtesting-Software, die Ehrlichkeit bequem macht. Bei Obside spielt ein Backtest Jahre an Historie in Minuten ab, mit eingebauten Slippage-Annahmen, was den billigen, disziplinierten Zug – über Regime hinweg mit realistischen Kosten zu testen, bevor man irgendetwas vertraut – zum Weg des geringsten Widerstands macht statt zur lästigen Pflicht. Der agentenspezifische Ablauf wird in So backtesten Sie einen KI-Trading-Agenten durchgegangen.
Einfachheit als Grundhaltung und Papertrading als Abschlussprüfung
Wenn zwei Strategien ähnlich backtesten, bevorzugen Sie die mit weniger beweglichen Teilen – und halten Sie diese Präferenz, bevor Sie irgendwelche Ergebnisse sehen. Jede zusätzliche Regel oder jeder Parameter muss Miete zahlen, indem er außerhalb der Stichprobe überlebt, nicht bloß indem er die In-Sample-Kurve verbessert, was zusätzliche Komplexität fast immer gratis tut. Eine Zwei-Regel-Strategie mit einer Sharpe von 0,9 über vier Regime verdient mehr Vertrauen als eine Neun-Parameter-Konstruktion, die 1,8 auf einer einzelnen Bullenphase zeigt. Komplexität ist keine Raffinesse. Beim Backtesten ist sie meist nur Angriffsfläche, an der sich Rauschen festhält.
Dann kommt der eine Test, den nichts kontaminieren kann: die Zukunft. Papertrading lässt Ihren exakten Agenten gegen Echtmärkte laufen, ohne Kapital im Risiko, auf Daten, die es nicht gab, als Sie die Strategie entwarfen. Kein Optimierer hat sie gesehen, und kein Sprachmodell hat sie memoriert. Eines zählt bei diesem Abschluss am meisten: Am Agenten ändert sich auf dem Weg nichts. Bei Obside wandert dieselbe Agentendefinition, die gebacktestet wurde, unverändert in den Paper-Modus, mit identischen Bedingungen und Risikokontrollen, sodass der Paper-Lauf die Strategie testet, die Sie validiert haben, statt eine handkopierte Näherung davon. Drei oder vier Wochen Paper-Ergebnisse, die sich mit dem Backtest reimen, sind der stärkste Beleg, den eine Privatanleger-Validierung liefern kann.
Wie es weitergeht
Behandeln Sie jeden schönen Backtest als Behauptung, die eine feindselige Prüfung erfordert, und auditieren Sie in dieser Reihenfolge: Wie viele Konfigurationen wurden durchsucht, ob die Daten survivorship-frei und Point-in-Time sind, ob ein LLM in der Schleife das Fenster memoriert haben könnte, ob das Ergebnis auf einem Plateau oder einem Zacken ruht und ob es Daten überstand, die Sie zurückgehalten haben. Lassen Sie dann das Papertrading das Urteil liefern. Wenn Sie diese Disziplin in den Ablauf eingebaut statt angeschraubt wollen: Obside fährt die ganze Leiter – regimeübergreifende Backtests mit eingebackener Slippage, dann Paper, dann live, auf einer unveränderten Agentendefinition.
Nur zu Bildungszwecken. Dies ist keine Anlageberatung. Trading ist mit Risiken verbunden, einschließlich des möglichen Kapitalverlusts.
FAQ
Es ist, wenn eine Strategie – absichtlich oder zufällig – so lange abgestimmt wird, bis sie das zufällige Rauschen eines historischen Zeitraums anpasst statt eines wiederholbaren Marktverhaltens. Der Backtest sieht ausgezeichnet aus, weil die Strategie diese Scheibe der Historie faktisch auswendig gelernt hat. Echtmärkte erzeugen neues Rauschen, die memorierten Muster wiederholen sich nicht, und die Performance bricht zusammen. Das verräterische Symptom ist eine Strategie, die im Test weit besser aussieht, als jede schlichte ökonomische Logik rechtfertigen würde.
Verwandte Artikel
Teste Obside mit deinem Portfolio
Verbinde deinen Broker und bau dein Portfolio mit einem einzigen Prompt.
Loslegen