SF2 Load-Forecasting Leaderboard

DE-Day-Ahead-Lastprognose im Wettbewerb: bewertet über die mittlere MAE aller bewerteten Tage (aufsteigend). Tage ohne eigene Einreichung eines Teams zählen als NA und gehen nicht in die Wertung ein — kein LOCF (Last Observation Carried Forward).

📌 Live-Wettbewerb: das Leaderboard wird nach jedem Tageslauf (lokaler sf2-challenge daily-Lauf) neu berechnet und veröffentlicht.

14Teams
23Bewertete Tage
1121Beste Ø MAE [MW]

Stand: 2026-08-13T08:20:13+00:00 UTC.

Leaderboard

Live-Wertung des Wettbewerbs ab Zieltag 21.07.2026 (UTC, „clean restart"): alle Mittelwerte starten bei null und zählen ausschließlich Tage ab diesem Zieltag, an denen ein Team selbst eine Prognose eingereicht hat. Fehlende Einreichungen zählen als NA und werden aus allen Metriken ausgeschlossen (kein LOCF); „Bewertete Tage" zeigt die Zahl der tatsächlich eingereichten Tage. Die Auswertung eines Zieltags erscheint am Folgetag, sobald die ENTSO-E-Ist-Werte veröffentlicht sind.

#TrendEinreichung Mean MAE [MW] Mean RMSE [MW] Mean MAPE [%] Mean MASE Mean Bias [MW] UPR [%] Bewertete Tage
1 optuna_lgbm 1121.00 1342.38 2.27 0.289 211.70 42.4 23
2 spotoptim_lgbm 1173.17 1399.71 2.39 0.302 210.46 47.1 23
3 spotoptim_causal 1186.68 1427.93 2.39 0.305 280.23 42.8 23
4 spotoptim_xgb 1246.64 1488.28 2.50 0.321 211.04 46.2 23
5 spotoptim_catboost 1256.18 1498.14 2.56 0.323 257.10 47.1 23
6 macl2l_wx 1263.74 1488.65 2.69 0.326 -141.08 58.3 6
7 chronos 1278.05 1535.16 2.59 0.329 275.25 40.9 23
8 macl2l_entsoe 1310.88 1578.76 2.63 0.337 -234.66 53.8 23
9 macl2l_dev 1325.38 1600.24 2.67 0.341 -45.13 48.9 23
10 macl2l 1327.19 1605.90 2.66 0.342 14.61 48.7 23
11 team_weather_report 1441.37 1704.29 2.77 0.372 528.08 35.8 5
12 ENTSO-E 1739.93 2059.96 3.55 0.448 354.06 41.5 23
13 Seasonal naive (168 h) 2188.52 2539.34 4.44 0.563 1178.21 32.4 23
14 Seasonal naive (24 h) 3584.88 4104.40 7.35 0.922 76.04 43.7 23

Ranking nach Mean MAE (Tie-Break: bewertete Tage). Fett markiert den besten Wert jeder Spalte: Minimum bei MAE/RMSE/MAPE/MASE, am nächsten an 0 beim Bias, am nächsten an 50 % bei der UPR, Maximum bei den bewerteten Tagen. MASE (Mean Absolute Scaled Error, Hyndman & Koehler 2006) skaliert die MAE am In-Sample-MAE der saisonal-naiven Prognose ŷt = yt−24 h (Vortag, gleiche Stunde), berechnet über ein gleitendes 28-Tage-Fenster der Ist-Last bis zum Vortag des Zieltags; MASE < 1 bedeutet besser als die 24-Stunden-Persistenz, der Nenner ist pro Zieltag für alle Teams identisch (vgl. Hyndman & Koehler (2006), „Another look at measures of forecast accuracy", Int. J. Forecasting 22(4):679–688). Bias = Ø(Prognose − Ist), negativ = systematische Unterprognose; UPR = Anteil der Stunden mit Prognose < Ist. Beides macht die im Netzbetrieb teurere Unterprognose-Richtung sichtbar, die vorzeichenblinde Metriken (MAE/RMSE/MAPE) verbergen — die offiziellen ENTSO-E-Day-ahead-Lastprognosen sind nachweislich systematisch verzerrt, vgl. Möbius et al. (2023), „Enhancing Energy System Models Using Better Load Forecasts", arXiv:2302.11017.

Wegen Inaktivität ausgeblendet (keine Einreichung seit mindestens 7 bewerteten Zieltagen): ddkast (zuletzt 22.07.2026), hot_rod (zuletzt 22.07.2026). Die Historie bleibt erhalten — mit der nächsten Einreichung kehrt ein Team automatisch auf das Leaderboard zurück.

Prognose vs. Ist-Last

Stündliche 24-h-Prognose jedes Teams gegen die tatsächlich gemessene Netzlast (ENTSO-E Actual Total Load, DE). Die gestrichelte Linie ist die ENTSO-E-Day-ahead-Prognose als Referenz-Baseline. Zieltag über den Kalender wählbar.

Mittlere MAE je Team

Mittlerer absoluter Fehler [MW] über alle bewerteten Tage — die Ranking-Metrik des Leaderboards. Jede Stunde zählt gleich; kleiner = besser.

Mittlerer RMSE je Team

Wurzel des mittleren quadratischen Fehlers [MW]. Quadrieren gewichtet große Einzelfehler überproportional — wer Lastspitzen verpasst, fällt hier stärker ab als bei der MAE; kleiner = besser.

Mittlere MAPE je Team

Mittlerer absoluter Fehler relativ zur Ist-Last [%] — die klassische Referenzmetrik der Lastprognose-Praxis, vergleichbar über Tage mit unterschiedlichem Lastniveau; kleiner = besser.

Mittlere MASE je Team

MAE skaliert am saisonal-naiven In-Sample-MAE (m = 24 h, gleitendes 28-Tage-Fenster; Hyndman & Koehler 2006). Dimensionslos und über Tage mit unterschiedlichem Lastniveau vergleichbar; MASE < 1 = besser als die 24-h-Persistenz, kleiner = besser.

Mittlerer Bias je Team

Ø(Prognose − Ist) [MW], signiert: negativ = systematische Unterprognose (im Netzbetrieb die teurere Richtung), positiv = Überprognose. Bester Wert = am nächsten an der 0-Linie (gepunktet) — ein kleiner Bias bei großer MAE bedeutet: die Fehler heben sich auf, sind aber stündlich trotzdem groß.

Mittlere UPR je Team

Under-Prediction Rate [%]: Anteil der Stunden, in denen die Prognose unter der Ist-Last lag. 50 % (gepunktete Linie) ≈ ausgewogen; Werte nahe 100 % bzw. 0 % zeigen systematisch einseitige Prognosen. Bester Wert = am nächsten an 50 %.

MAE-Verlauf

Tages-MAE je Team innerhalb einer Kalenderwoche. Woche über den Kalender wählbar (KW-Zahl oder Tag anklicken).