Jeden Tag zeigt dir jemand eine Zahl. „77 % Win-Rate." „Schlägt den Markt seit drei Jahren." „Dieses Setup hat die letzten zwei Rallys erwischt." Ob du kaufst, hängt oft nur daran, ob du dieser einen Zahl glaubst.
Am 2. September hat die Arena Backtest Nummer 100.000 geschrieben — systematisch, über Hunderte Coins, alle Zeitebenen, nach Kosten. Ein Datensatz dieser Größe kann zwei Dinge, die eine einzelne Zahl nie kann: Er zeigt, welche Regeln in Krypto wiederholt funktioniert haben. Und er zeigt, mit welchen Tricks eine Performance-Zahl dich täuscht — weil bei 100.000 Läufen jeder dieser Tricks irgendwo von selbst passiert und man ihn dann in Ruhe sezieren kann.
Beides bekommst du hier. Erst das, was du benutzen kannst. Dann das, was dich schützt.
Vier Befunde, mit denen du arbeiten kannst
1. Du musst nicht „meistens richtig" liegen — hör auf, danach zu suchen. 73,8 % aller vergleichbaren Backtests (mindestens 5 Trades, n = 71.129) haben eine Win-Rate unter 50 % — und darunter sind fast alle profitablen Systeme. Über 70 % Win-Rate erreichen nur 6,9 % der Läufe, meist mit einer Handvoll Trades. Diese Verteilung stand bei jedem unserer Meilensteine, über wechselnde Märkte und Populationen. Profitabel heißt in echten Daten: seltener gewinnen, dafür größer. Für dich heißt das zweierlei: Eine Strategie mit 40 % Trefferquote ist kein Defekt — und wer dir 77 % Win-Rate verkauft, verkauft dir fast sicher eine der vier Täuschungen aus dem zweiten Teil.
2. Die Tages-Kerze ist die Whipsaw-Falle — die mittleren Zeitebenen sind der Sweet Spot. Auf Tages-Kerzen zerhacken Fehlsignale die Klassiker: RSI/SMA hat auf 1d einen Median-CAGR von −2,9 %, auf 3-Tages-Kerzen +9,4 %; RSI Overbought/Oversold: 1d −8,9 %, 3d +5,5 %. Das Muster „weg vom Daily" hält seit unserem ersten Meilenstein. Neu und genauso wichtig: Der Monats-Chart ist kein sicherer Hafen — 1M ist über alle Strategien das schwächste Intervall (49,6 % schlagen Buy & Hold, Median −3,6 %). Für dich heißt das: 2-Tages- und 3-Tages-Kerzen zuerst testen. Wer dieselbe Strategie auf Mehrtages-Kerzen fährt, sollte übrigens wissen, an welchem Tag sein Raster beginnt — das allein verschiebt Ergebnisse messbar; dazu bald ein eigenes Stück.
3. Markt-Regime schlägt Volatilität — und jeder Filter hat einen Job. Von den Pro-Filtern schlagen die Regime-Filter Buy & Hold am häufigsten: Bullmarket-Stage 71,6 % (n = 17.721), Altcoin-Season 62,9 %, ATR-Volatilitätsfilter 61,5 %. Die Rangfolge „Regime vor Volatilität" reproduziert sich seit 40k. Aber miss jeden Filter an seinem Job: ATR ist ein Drawdown-Werkzeug — er soll Abstürze dämpfen, nicht die Trefferquote heben. Wer ihn an der Rendite misst, misst das Falsche.
4. Umschlag frisst Rendite — im Schnitt unsichtbar, im Einzelfall tödlich. Nach Kosten kippen nur 1,5 % aller Brutto-Sieger — klingt harmlos. Aber diese 1,5 % konzentrieren sich fast vollständig in Hochfrequenz-Strategien. Unsere einst zweitbeliebteste Strategie (Stochastik-RSI, im Schnitt 558 Trades pro Lauf) steht nach Kosten bei 0 von 28 Markt-Zellen über Buy & Hold. Wir haben sie abgeschaltet. Für dich heißt das: Rechne jede Strategie netto, und sei bei allem misstrauisch, was Hunderte Trades braucht — der Durchschnitt tut nicht weh, dich als Einzelnen trifft es ganz.
Vier Fragen, die jede fremde Zahl entlarven
Die stärkste Eigenschaft von 100.000 Läufen: Jeder Zahlen-Trick, mit dem draußen Performance verkauft wird, passiert hier irgendwo von selbst — und lässt sich dann mit Beleg vorführen.
Frage 1: „Woraus besteht der Nenner — und hat er sich geändert?" Unsere eigene Schlagzeilen-Quote „X % schlagen Buy & Hold" lief über die Meilensteine 64 % → 52 % → 67 % — ohne dass eine einzige Strategie besser oder schlechter wurde. Bewegt hat sich der Asset-Mix: Auf Krypto schlagen ~65 % der Läufe Buy & Hold, auf Aktien im Dauer-Bullenmarkt ~16 %; als die Plattform crypto-only wurde, sprang die Quote. Eine Quote ist eine Eigenschaft der Stichprobe, nicht der Strategie. Wir zeigen die wandernde Zahl trotzdem — mit genau dieser Erklärung —, weil wir sie an uns selbst gemessen haben und du die Frage danach an jede fremde Quote stellen sollst: Welche Assets? Welcher Zeitraum? Und was hat sich geändert, als sich die Zahl änderte?
Frage 2: „Quote oder Größe?" Der bösartigste Fall im Datensatz: Auf A2ZUSDC schlagen alle drei vergleichbaren Läufe Buy & Hold. Ihre Ergebnisse: −93,7 bis −99,1 % CAGR. Buy & Hold: −99,7 %. Die Benchmark schlagen und fast alles verlieren — gleichzeitig. Es geht auch andersherum: Auf SAHARAFDUSD machte RSI/SMA aus −35 % Buy & Hold ein −99,3-%-Ergebnis. „Schlägt den Markt" zählt Siege, nicht Beträge. Frag immer nach beidem.
Frage 3: „Stehen auf beiden Seiten dieselben Assets?" Vergleiche ungefilterte gegen gefilterte Läufe über den ganzen Bestand, und die Ungefilterten „gewinnen" 79,9 % zu 65,5 %. Sind Filter nutzlos? Die Auflösung steht in der Spalte, die solche Vergleiche weglassen: Das durchschnittliche Buy & Hold der einen Gruppe liegt bei −31,5 %, das der anderen bei −6,6 % — 25 Prozentpunkte Unterschied in der Grundmenge. Wo die Benchmark am Boden liegt, ist „schlagen" gratis. Gemessen wurde die Zusammensetzung, nicht der Filter. Unsere Software verweigert solche Quer-Populations-Vergleiche inzwischen komplett; belastbare Filter-Effekte rechnet die Edge Library je Markt×Strategie — gleiche Population auf beiden Seiten, mit Bootstrap-Intervallen.
Frage 4: „Wie viele unabhängige Fälle?" Der Sommer-Neuzugang in unserer Kuriositäten-Liste heißt tatsächlich USELESSUSDT: +1.826 % CAGR — aus 6 Trades. Und der amtierende CAGR-Rekord der Plattform (197.923,7 %, gegen 2.238,98 % Buy & Hold) steht auf 10 Trades auf einem Memecoin, der nur deshalb in den Daten ist, weil er gepumpt hat. Beides ist wertlos, und beides sieht spektakulär aus. Unter 30 Trades ist es eine Anekdote — je schöner die Zahl, desto wichtiger die Regel. Frag auch: Wie viele Setups wurden probiert, bis dieses eine übrig blieb? Drei bestätigende Läufe fühlen sich nach Signal an; als wir einen solchen „Mehrfach-bestätigten" Kandidaten später systematisch mit 847 Läufen abdeckten, schlugen noch 21 % die Benchmark. Auswaschung ist der Normalfall.
Was das im Produkt bedeutet
Verdikte fallen bei uns nie am Gesamt-Aggregat, sondern je Zelle: Mindest-Stichprobe, nach Kosten, mit Mehrfachtest-Korrektur. Und sie haben Konsequenzen — seit dem letzten Meilenstein sind vier eigene Strategien abgeschaltet (die schwächste der Plattform, ein Schein-Edge aus toten Altcoins, eine ersetzte v1, die Hochfrequenz-Strategie von oben). Alle bleiben mit Zahlen und Verdikt in der Library sichtbar. Für dich heißt Kuration: Du testest nicht an Material, von dem wir schon wissen, dass es dich täuscht.
Der Geduldsrekord der Plattform gehört übrigens jetzt BTCUSDT mit Keltner Breakout auf Tages-Kerzen: 9,0 Jahre, 36,6 % CAGR — mit 30+ Trades und ohne Sternchen. So sieht eine Zahl aus, die die vier Fragen übersteht.
Sieh dir die aktuelle Strategie×Zeitebenen-Matrix selbst an →
FAQ
Sind die 100.000 echte User-Backtests? Nein: 97,6 % sind systematische Coverage-Läufe unserer Pipeline (Hunderte Coins × Strategien × Zeitebenen, täglich), 2.780 stammen von Nutzern. Für die Aussagekraft ist das ein Vorteil — systematische Abdeckung hat keinen Auswahl-Bias durch das, was Nutzer gerade spannend finden. Gelabelt wird es trotzdem, denn ohne Etikett liest man Verteilungen falsch.
Heißt „schlägt Buy & Hold", dass die Strategie profitabel war? Nein. Auf Coins mit −99 % Buy & Hold schlägt fast alles die Benchmark und verliert trotzdem fast alles (Frage 2). Quote und Größe sind zwei Achsen — und nach Kosten kippt ein Teil der Sieger zusätzlich.
Welche Zeitebene soll ich zuerst testen? 2-Tages- und 3-Tages-Kerzen. „Weg vom Daily" hält für die Klassiker (RSI/SMA-Median: 1d −2,9 % vs. 3d +9,4 %), und der Monats-Chart ist entgegen der Intuition das schwächste Intervall im Bestand.
Warum ist eure „Schlägt B&H"-Quote über die Zeit gewandert? Asset-Mix, nicht Leistung (Frage 1): crypto-only statt gemischter Bestand. Die Quote je Teilmenge war ziemlich stabil — bewegt hat sich die Mischung. Genau deshalb steht sie hier als Lehrstück, nicht als Erfolgsmeldung.
Wo finde ich belastbare Aussagen statt Aggregat-Quoten? In den Zellen-Auswertungen: Strategy Insights (je Strategie×Zeitebene gegen Avg B&H) und Edge Library (Filter-Effekte mit Bootstrap-Intervallen, gleiche Population auf beiden Seiten).
Keine Anlageberatung, keine Empfehlung, keine Prognose — historische Muster sind keine Zusage.
Study the Past — Improve your Future 🥋