SF2 Load-Forecasting Leaderboard
DE-Day-Ahead-Lastprognose im Wettbewerb: bewertet über die mittlere
MAE aller bewerteten Tage (aufsteigend). Tage ohne eigene Einreichung
eines Teams zählen als NA und gehen nicht in die Wertung ein — kein
LOCF (Last Observation Carried Forward).
📌 Live-Wettbewerb: das Leaderboard wird nach jedem Tageslauf
(lokaler sf2-challenge daily-Lauf) neu berechnet und
veröffentlicht.
14Teams
23Bewertete Tage
1121Beste Ø MAE [MW]
Stand: 2026-08-13T08:20:13+00:00 UTC.
Leaderboard
Live-Wertung des Wettbewerbs ab Zieltag 21.07.2026 (UTC, „clean
restart"): alle Mittelwerte starten bei null und zählen ausschließlich
Tage ab diesem Zieltag, an denen ein Team selbst eine Prognose
eingereicht hat. Fehlende Einreichungen zählen als NA und werden aus
allen Metriken ausgeschlossen (kein LOCF); „Bewertete Tage" zeigt die
Zahl der tatsächlich eingereichten Tage. Die Auswertung eines Zieltags
erscheint am Folgetag, sobald die ENTSO-E-Ist-Werte veröffentlicht sind.
| # | Trend | Einreichung |
Mean MAE [MW] |
Mean RMSE [MW] |
Mean MAPE [%] |
Mean MASE |
Mean Bias [MW] |
UPR [%] |
Bewertete Tage |
| 1 |
● |
optuna_lgbm |
1121.00 |
1342.38 |
2.27 |
0.289 |
211.70 |
42.4 |
23 |
| 2 |
● |
spotoptim_lgbm |
1173.17 |
1399.71 |
2.39 |
0.302 |
210.46 |
47.1 |
23 |
| 3 |
● |
spotoptim_causal |
1186.68 |
1427.93 |
2.39 |
0.305 |
280.23 |
42.8 |
23 |
| 4 |
▲ |
spotoptim_xgb |
1246.64 |
1488.28 |
2.50 |
0.321 |
211.04 |
46.2 |
23 |
| 5 |
▼ |
spotoptim_catboost |
1256.18 |
1498.14 |
2.56 |
0.323 |
257.10 |
47.1 |
23 |
| 6 |
▲ |
macl2l_wx |
1263.74 |
1488.65 |
2.69 |
0.326 |
-141.08 |
58.3 |
6 |
| 7 |
▼ |
chronos |
1278.05 |
1535.16 |
2.59 |
0.329 |
275.25 |
40.9 |
23 |
| 8 |
▼ |
macl2l_entsoe |
1310.88 |
1578.76 |
2.63 |
0.337 |
-234.66 |
53.8 |
23 |
| 9 |
● |
macl2l_dev |
1325.38 |
1600.24 |
2.67 |
0.341 |
-45.13 |
48.9 |
23 |
| 10 |
● |
macl2l |
1327.19 |
1605.90 |
2.66 |
0.342 |
14.61 |
48.7 |
23 |
| 11 |
● |
team_weather_report |
1441.37 |
1704.29 |
2.77 |
0.372 |
528.08 |
35.8 |
5 |
| 12 |
● |
ENTSO-E |
1739.93 |
2059.96 |
3.55 |
0.448 |
354.06 |
41.5 |
23 |
| 13 |
● |
Seasonal naive (168 h) |
2188.52 |
2539.34 |
4.44 |
0.563 |
1178.21 |
32.4 |
23 |
| 14 |
● |
Seasonal naive (24 h) |
3584.88 |
4104.40 |
7.35 |
0.922 |
76.04 |
43.7 |
23 |
Ranking nach Mean MAE (Tie-Break: bewertete Tage). Fett markiert
den besten Wert jeder Spalte: Minimum bei MAE/RMSE/MAPE/MASE, am nächsten
an 0 beim Bias, am nächsten an 50 % bei der UPR, Maximum bei den
bewerteten Tagen. MASE (Mean Absolute Scaled Error, Hyndman
& Koehler 2006) skaliert die MAE am In-Sample-MAE der
saisonal-naiven Prognose ŷt = yt−24 h
(Vortag, gleiche Stunde), berechnet über ein gleitendes 28-Tage-Fenster
der Ist-Last bis zum Vortag des Zieltags; MASE < 1
bedeutet besser als die 24-Stunden-Persistenz, der Nenner ist pro Zieltag
für alle Teams identisch (vgl. Hyndman
& Koehler (2006), „Another look at measures of forecast accuracy",
Int. J. Forecasting 22(4):679–688). Bias =
Ø(Prognose − Ist), negativ = systematische Unterprognose; UPR =
Anteil der Stunden mit Prognose < Ist. Beides macht die im
Netzbetrieb teurere Unterprognose-Richtung sichtbar, die
vorzeichenblinde Metriken (MAE/RMSE/MAPE) verbergen — die offiziellen
ENTSO-E-Day-ahead-Lastprognosen sind nachweislich systematisch
verzerrt, vgl. Möbius
et al. (2023), „Enhancing Energy System Models Using Better Load
Forecasts", arXiv:2302.11017.
Wegen Inaktivität ausgeblendet (keine Einreichung seit
mindestens 7 bewerteten Zieltagen):
ddkast (zuletzt
22.07.2026), hot_rod (zuletzt
22.07.2026).
Die Historie bleibt erhalten — mit der nächsten Einreichung kehrt ein
Team automatisch auf das Leaderboard zurück.
Prognose vs. Ist-Last
Stündliche 24-h-Prognose jedes Teams gegen die tatsächlich gemessene
Netzlast (ENTSO-E Actual Total Load, DE). Die gestrichelte Linie ist die
ENTSO-E-Day-ahead-Prognose als Referenz-Baseline. Zieltag über den
Kalender wählbar.
Mittlere MAE je Team
Mittlerer absoluter Fehler [MW] über alle bewerteten Tage —
die Ranking-Metrik des Leaderboards. Jede Stunde zählt gleich;
kleiner = besser.
Mittlerer RMSE je Team
Wurzel des mittleren quadratischen Fehlers [MW]. Quadrieren gewichtet
große Einzelfehler überproportional — wer Lastspitzen verpasst, fällt
hier stärker ab als bei der MAE; kleiner = besser.
Mittlere MAPE je Team
Mittlerer absoluter Fehler relativ zur Ist-Last [%] — die klassische
Referenzmetrik der Lastprognose-Praxis, vergleichbar über Tage mit
unterschiedlichem Lastniveau; kleiner = besser.
Mittlere MASE je Team
MAE skaliert am saisonal-naiven In-Sample-MAE (m = 24 h, gleitendes
28-Tage-Fenster; Hyndman & Koehler 2006). Dimensionslos und über
Tage mit unterschiedlichem Lastniveau vergleichbar; MASE < 1 =
besser als die 24-h-Persistenz, kleiner = besser.
Mittlerer Bias je Team
Ø(Prognose − Ist) [MW], signiert: negativ = systematische
Unterprognose (im Netzbetrieb die teurere Richtung), positiv =
Überprognose. Bester Wert = am nächsten an der 0-Linie (gepunktet) —
ein kleiner Bias bei großer MAE bedeutet: die Fehler heben sich auf,
sind aber stündlich trotzdem groß.
Mittlere UPR je Team
Under-Prediction Rate [%]: Anteil der Stunden, in denen die Prognose
unter der Ist-Last lag. 50 % (gepunktete Linie) ≈
ausgewogen; Werte nahe 100 % bzw. 0 % zeigen systematisch
einseitige Prognosen. Bester Wert = am nächsten an 50 %.
MAE-Verlauf
Tages-MAE je Team innerhalb einer Kalenderwoche. Woche über den
Kalender wählbar (KW-Zahl oder Tag anklicken).