Genauigkeit
Die echte, aktuelle Bewertung des Open-Lifts-Modells für die Anzahl offener Lifte — jede Aufteilung, die Basislinie, an der es gemessen wird, und genau wie viele Belege ihr zugrunde liegen. Diese Seite wird direkt aus denselben Bewertungsartefakten erzeugt, mit denen das Modell selbst registriert wurde — nichts hier ist von Hand geschrieben.
Modell reconstruction-hgb-v1-20260918 ist derzeit als EXPERIMENTAL gekennzeichnet. Die PRD verlangt eine Trefferquote von ≥75.0% bei gleichzeitigem Schlagen einer einfachen Basislinie auf jeder unten aufgeführten zurückgehaltenen Aufteilung, bevor ein Modell als validiert gelten darf. Dieses hat diese Schwelle noch nicht erreicht — jede damit erzeugte Vorhersage auf dieser Seite ist als experimentell gekennzeichnet, nicht als buchungsreifes Versprechen.
model held-out-date coverage 0.743 does not beat the resort-historical-mean baseline's 0.788 — PRD §2.9.1 requires both; held-out-date coverage 0.7428571428571429 < 0.75; held-out-resort evidence insufficient: only 3 eligible resorts (need >=10 per Phase 3E Sec 14's own criterion for a trustworthy estimate); held-out-season evidence insufficient: only 79 training rows (Phase 3E Sec 14 flags 300+ as the scale needed to trust this split); held-out-season coverage 0.5263157894736842 < 0.75
Die drei erforderlichen Aufteilungen
Ein „Treffer“ des Bereichs bedeutet, dass die tatsächlich beobachtete Anzahl offener Lifte innerhalb des vorhergesagten Bereichs lag. Jede Aufteilung beantwortet eine andere Frage dazu, ob das Modell tatsächlich verallgemeinert, statt nur zu Daten zu passen, die es bereits gesehen hat.
Ein Datum, mit dem das Modell nie trainiert wurde, dieselben Skigebiete.
n = 35 n
Ein Skigebiet, mit dem das Modell überhaupt nie trainiert wurde.
n = 3 bewertete Skigebiete
Eine Saison, mit der das Modell überhaupt nie trainiert wurde.
n = 38 n
Der Basislinienvergleich
Eine Basislinie ist die einfachste vernünftige Schätzung ganz ohne Modell — hier der eigene historische Durchschnitt eines Skigebiets für diese Jahreszeit. Ein echtes Modell muss sie schlagen, nicht nur 75% erreichen, sonst bringt es keinen Mehrwert.
Dieses Modell schlägt die Basislinie bei dieser Aufteilung derzeit nicht — ehrlich gesagt ist ein einfacher historischer Durchschnitt derzeit mindestens genauso gut eine Schätzung.
Basislinie bewertet an 33 von 35 zurückgehaltenen Testtagen (für die übrigen lagen keine historischen Daten für dieses Skigebiet vor, aus denen gemittelt werden konnte).
Warum die Schwelle nicht nur ein Prozentsatz ist
Eine Trefferquote auf zu wenig Beleggrundlage ist für sich genommen nicht vertrauenswürdig. Hier ist genau, wie viele echte Belege dieser Bewertung zugrunde liegen:
Für die Bewertung zurückgehaltener Skigebiete verwendet: cauterets, galibier-thabor, valloire.
Live-Prognoseüberprüfung
Unabhängig vom obigen Backtest zur Trainingszeit wird jede echte Prognose dieses Modells nach Eintritt des Datums mit dem tatsächlichen Ergebnis abgeglichen — der laufende, echte Genauigkeitsnachweis.
Modell reconstruction-hgb-v1-20260918, trainiert mit Daten bis 16 June 2026, registriert am 18 September 2026. Siehe So funktioniert es für die Bedeutung von beobachtet/rekonstruiert/prognostiziert, oder /data für Quellenangaben.