Ogni numero di questa pagina viene da una verifica automatica contro
osservazioni reali. Nessuno è scritto a mano, e nessuno viene tolto
quando non ci fa bella figura.
Errore a 6 ore di distanza
1.1°C
contro 1.29°C
della media grezza dei modelli
Miglioramento misurato: 14.7%
1.014 verifiche · ultimi 31 giorni · aggiornata 0.2 giorni fa
Confronto testa-a-testa accuratezza meteo
MAE temperatura (C) vs METAR osservato — piu' basso e' meglio. Previsioni archiviate prima dell'evento, stessi comuni e orizzonti, verità = stessa osservazione METAR. Campione 29598 confronti su 14 località, +1h/+3h/+6h. Ultima verifica 2026-09-08.
Motore
MAE temp (°C) ↓
n
Com'è oggi ⭐
1.146
12606
MET Norway
1.236
12687
Tomorrow.io
1.369
4305
Variabile: temperatura (l'unica con verità puntuale affidabile al METAR); non è un confronto su pioggia/temporali. 3Bmeteo NON è incluso: non abbiamo un accesso consentito ai loro dati archiviati → nessun confronto con loro finché non esiste.
Confronto appaiato stessi casi, stessa incertezza
Temperatura (°C), MAE. Per ogni coppia usiamo gli stessi identici casi e le stesse osservazioni, e riportiamo la differenza con intervallo di confidenza al 95% calcolato tenendo conto della dipendenza fra previsioni dello stesso giorno.
Coppia
MAE noi
MAE altro
Δ (95%)
n
Com'è oggi vs MET Norway
1.135
1.240
-0.105 [-0.17,-0.05]
12507
Com'è oggi vs Tomorrow.io
1.078
1.414
-0.335 [-0.42,-0.25]
4129
Δ negativo = noi meglio; se l'intervallo non tocca lo zero, il vantaggio è statisticamente solido. Escluso: nessun accesso consentito ai loro archivi pre-evento → non misurabile, nessuna dichiarazione.
Correzione distribuita Debias diurno della temperatura
Errore corretto: Bias caldo sistematico a mezzogiorno/pomeriggio (+0.4/+0.9°C) e cold-miss serale nei giorni caldi (fino a -1.1°C); la media globale era ~0 perché si annullano.
Quanto migliora (Out-of-time (fit luglio → test agosto, dist METAR ≤15km)): MAE 1.320 → 1.263 (-4.3%), scarto medio +0.36 → -0.03, errori grossi (≥5°C) 418 → 181 (-57%).
Dove migliora: Ore diurne e serate calde; riduce del 57% gli errori ≥5°C (tipo i picchi di Bergamo). Dove resta incerto: Comuni lontani da ogni stazione (non-ancorati) a brevissimo termine: effetto piccolo o nullo. Il breve termine ancorato a osservazione reale non è toccato.
Onestà: Correzione ML del vento (LOS +4.1% vs stazioni riparate) NON distribuita: peggiorava vs METAR aeroportuali (sottostima già presente). Chiusa.
Verità = METAR puntuale (aeroporti): affidabile per la temperatura, non per pioggia/temporali locali (un rovescio può mancare il punto). I confronti riguardano la temperatura.
Probabilità di pioggia calibrata e onesta
Errore corretto: La probabilità del provider era sovrastimata rispetto alla pioggia osservata al punto (METAR): 90% dichiarato ≈ 50% osservato. Metodo: Calibrazione reliability per (orizzonte, fascia di probabilità), applicata a ciò che vedi; icona e testo si allineano allo stesso evento.
Orizzonte
Brier prima→dopo
Skill (BSS) dopo
0-3h
0.0285 → 0.0253
-0.114
4-6h
0.0242 → 0.0225
+0.079
7-12h
0.0359 → 0.0346
+0.033
Ambito: skill positivo (meglio della climatologia) a 4–12 h; a 0–3 h la probabilità resta poco affidabile anche calibrata. Limiti: È una probabilità stimata e verificata sul METAR piu' vicino (<=12 km) all'ora bersaglio — un riferimento, NON il punto esatto dell'utente; probabilità ORARIA confrontata con la presenza di pioggia al METAR; orizzonte 0–12 h.
Pioggia nei prossimi minuti cosa abbiamo misurato
Distinte due verità: (a) campo radar futuro, (b) pioggia osservata al suolo (METAR).
Metodo
Esito
Dettaglio
Avvezione (moto delle celle), gridded e per-punto
BOCCIATO
Non batte la persistenza sul campo radar futuro (giorno convettivo 15/7: CSI 0.62 vs 0.63 a +15, 0.44 vs 0.45 a +30). Le celle crescono/decadono, il vettore di moto aggiunge rumore.
Cono d'incertezza (persistenza di vicinato)
PARZIALE
Batte la persistenza sul CAMPO RADAR futuro fuori campione (+60min ΔCSI +0.03/+0.08, POD 0.26→0.62-0.73), ma sulla PIOGGIA AL SUOLO peggiora (aggiunge falsi allarmi: la pioggia vicina spesso non raggiunge il punto). Non promosso agli avvisi.
Sulla verità METAR è il migliore a ogni orizzonte (CSI +15min 0.18, +30 0.20, +60 0.29; POD 0.27-0.38, FAR 0.44-0.64) e supera punto/vicinato/V1. È già il segnale usato dagli avvisi beta.
Iniziazione temporali (satellite/CAPE→fulmini)
BOCCIATO
Precisione 0.6% vs fulmini osservati (4756 previsioni, 27 hit). Non affidabile.
Regola pioggia V1-'live' pubblica
ROTTA
Recall 0.0: non si accende mai (condizioni auto-contraddittorie). Qualsiasi segnale osservato recupera eventi che questa manca.
In sintesi: Nessun nuovo modello di MOVIMENTO batte l'osservazione/persistenza sulla pioggia al suolo. Il miglior segnale a terra resta l'osservazione radar 'strict', già usata. L'avvezione e l'iniziazione temporali sono chiuse (risultato negativo). Fix agli avvisi: rimosso il 'minuto d'arrivo stimato' (ETA non validata).
Verifica su archivio DPC 5-min reale (giorni convettivi) + registrato METAR ~87gg. La verità METAR è puntuale/aeroportuale. Nessun confronto diretto con 3Bmeteo (loro nowcast e accuratezza non pubblici/misurabili).
In due parole
Dove ce la caviamo
Temperatura — errore a 6 ore di distanza: 14.7% meglio della media grezza dei modelli.
Temperatura — il prodotto completo, ancoraggio incluso: 9.7% meglio della media grezza dei modelli.
Dove non siamo ancora affidabili
Pioggia — la regola «sta per piovere»:
non c'è abbastanza per misurarla.
Temporali — i temporali contro i fulmini veri:
il campione è troppo piccolo per dire qualcosa.
Temperatura — quanto sbagliamo sulla temperatura: l'ultima verifica ha
91.4 giorni, oltre la soglia di 30.
Le famiglie non si sommano e non si mediano: la temperatura, la pioggia e i
temporali si misurano con verità diverse e campioni diversi. «Precisione
sulla temperatura» non vuol dire «precisione del sito».
Temperatura
Quanto sbagliamo sulla temperatura
Non aggiornata
Errore medio assoluto della temperatura corretta, confrontato con la media grezza dei modelli. Misurato su stazioni tenute FUORI dall'addestramento, così il risultato non è il ricordo di quello che ha già visto.
1.108°Cmedia grezza dei modelli: 1.359°C
ComeOggi1.108
media grezza dei modelli1.359
Scala da zero a 1.359°C.
Più corto è meglio.
Campione
40
Periodo
~12 mesi
Territorio
Lombardia, Emilia-Romagna e aeroporti nazionali
Aggiornata
91.4 giorni fa
Il campione conta stazioni, non osservazioni: 40 stazioni su circa dodici mesi.
È una validazione offline, non si aggiorna da sola.
Numeri completi e metodo
Quanto sbagliamo sulla temperatura — valori completi come li produce la verifica
Ogni previsione a 6 ore viene confrontata con l'osservazione arrivata dopo. Nessuna selezione: entrano tutte.
1.1°Cmedia grezza dei modelli: 1.29°C
ComeOggi1.1
media grezza dei modelli1.29
Scala da zero a 1.29°C.
Più corto è meglio.
Campione
1.014
Periodo
ultimi 31 giorni
Territorio
Italia
Aggiornata
0.2 giorni fa
Un solo orizzonte: dice come andiamo a 6 ore di distanza.
Numeri completi e metodo
Errore a 6 ore di distanza — valori completi come li produce la verifica
MAE corretto
1.1
MAE grezzo
1.29
MAE del miglior modello singolo
1.09
miglioramento vs miglior modello %
-0.9
orizzonte (ore)
6
Fonte
data/track_record.json
Generato
2026-09-08T12:06:34+00:00
Origine della data
dichiarata nel file (updated)
Soglia di freschezza
2 giorni
Il prodotto completo, ancoraggio incluso
Aggiornata
Il percorso intero — modelli, correzione ML, ancoraggio sulla stazione più vicina — contro l'osservazione reale.
1.369°Cmedia grezza dei modelli: 1.516°C
ComeOggi1.369
media grezza dei modelli1.516
Scala da zero a 1.516°C.
Più corto è meglio.
Campione
29.713
Periodo
2026-08-07 → 2026-09-06
Territorio
Italia
Aggiornata
1.5 giorni fa
Confronta col modello grezzo. Il confronto col miglior modello singolo sta nell'altra scheda, e non sempre ci dà ragione.
Numeri completi e metodo
Il prodotto completo, ancoraggio incluso — valori completi come li produce la verifica
MAE prodotto
1.369
MAE solo ML
1.357
MAE grezzo
1.516
stazioni
40
osservazioni
29713
metodo
prodotto completo (grezzo→ML→ancoraggio cross-station) vs osservazione reale ARPA; ancoraggio sulla stazione DIVERSA più vicina (no circolarità)
soglia ancoraggio ottima (km)
8
quota ancorate %
25.0
Fonte
data/product_accuracy.json
Generato
2026-09-07T05:31:16+00:00
Origine della data
dichiarata nel file (generato)
Soglia di freschezza
30 giorni
Pioggia
La regola «sta per piovere»
Non valutabile
Quando diciamo che la pioggia sta arrivando, quante volte arriva. Verificata contro la pioggia osservata all'aeroporto più vicino.
Nessun valore da mostrare. Non è un errore di lettura: la
misura non è calcolabile su questo campione, e lo diciamo invece di
riempire lo spazio.
Campione
143.631
Periodo
—
Territorio
Italia
Aggiornata
0.0 giorni fa
La regola che spediamo non si è accesa nemmeno una volta sul campione verificato: non c'è niente da misurare, e questo è il problema, non la misura.
La verità è la pioggia al METAR dell'aeroporto più vicino, che è un'osservazione puntuale e non sempre vicina.
Numeri completi e metodo
La regola «sta per piovere» — valori completi come li produce la verifica
recall (live)
0.0
POD (live)
0.0
CSI (live)
0.0
accensioni (tp+fp)
0
casi verificati
143631
variante strict — precision
0.414
variante strict — recall
0.188
variante strict — CSI
0.149
definizione evento
No live promotion until repeated runs show useful precision/recall and source/compliance review remains ok.
Fonte
data/radar_track_record.json (blocco `live`)
Generato
2026-09-08T16:51:08+00:00
Origine della data
dichiarata nel file (updated)
Soglia di freschezza
2 giorni
Il nowcast fuso, ancora fuori dal prodotto
Sperimentale
Radar, avvezione, innesco, fulmini e satellite messi insieme. Misurato da mesi, non collegato al sito: finché non batte quello che c'è già, resta fuori.
0.155
Campione
783.232
Periodo
2026-09-07T08:31:30Z → 2026-09-08T16:50:58Z
Territorio
Italia
Aggiornata
0.0 giorni fa
NON promuovere: manca il termine di paragone. La regola radar in produzione non ha accensioni verificate, quindi non esiste un CSI da battere.
Numeri completi e metodo
Il nowcast fuso, ancora fuori dal prodotto — valori completi come li produce la verifica
precision
0.155
recall
0.564
POD
0.564
FAR
0.845
CSI
0.138
frequenza di base
0.0134
previsioni positive
38132
eventi osservati
10471
tp / fp / fn
5908 / 32224 / 4563
regola
nowcast_fused.p_rain>=0.5@lead_30min
verità di riferimento
pioggia osservata dal radar DPC sul punto (mm_qui >= 0.5 mm/h), non il massimo del vicinato
stato
MISURATO
Fonte
data/nowcast_fused_record.json
Versione motore
4b3396ec19da
Generato
2026-09-08T16:50:58+00:00
Origine della data
dichiarata nel file (generato)
Soglia di freschezza
2 giorni
Temporali
I temporali contro i fulmini veri
Campione insufficiente
Il nostro segnale di temporale confrontato con i fulmini osservati dal satellite. È la prova più severa che facciamo, e la meno lusinghiera.
0.157frequenza di base dei fulmini: 0.002
ComeOggi0.157
frequenza di base dei…0.002
Scala da zero a 0.157.
Più lungo è meglio.
Campione
300
Periodo
finestra corrente del verificatore
Territorio
Italia, dove il satellite copre
Aggiornata
0.0 giorni fa
Questi numeri sono il motivo per cui le notifiche sui temporali restano spente.
Numeri completi e metodo
I temporali contro i fulmini veri — valori completi come li produce la verifica
Prova di allargare la validazione a fonti storiche aperte. Non entra nel prodotto: serve a sapere se varrebbe la pena.
1.322°C
Campione
39
Periodo
{'start': '2026-05-19', 'end': '2026-06-09'}
Territorio
Italia
Aggiornata
88.9 giorni fa
Marcato experimental_not_live dal file stesso.
Fermo da 88.9 giorni.
Numeri completi e metodo
Storico open, fuori dal motore — valori completi come li produce la verifica
modo
expanded
stato
experimental_not_live
Fonte
data/historical_open_spike.json
Generato
2026-06-11T19:12:38+00:00
Origine della data
dichiarata nel file (generated)
Soglia di freschezza
30 giorni
Le parole, senza equivoci
Cosa significano precision, recall, MAE e gli altri
MAE — errore medio assoluto
Di quanti gradi sbagliamo in media, senza compensare gli errori in
eccesso con quelli in difetto. Più basso è meglio.
Precision
Quando diciamo che succederà, quante volte succede. Non è
una probabilità e non è «accuratezza».
Recall, o POD
Di tutte le volte che è successo, quante l'avevamo detto.
FAR — tasso di falsi allarmi
La quota di annunci che non si è avverata. È l'opposto della precision.
CSI
Un indice unico che tiene insieme quello che abbiamo previsto,
quello che abbiamo mancato e quello che abbiamo annunciato a vuoto.
Accuratezza
La percentuale di volte che abbiamo azzeccato, comprese quelle in
cui abbiamo detto «non succede» e non è successo. Su fenomeni rari
è ingannevole: dire sempre «non piove» dà accuratezza altissima e
valore nullo. Per questo qui non la usiamo quasi mai.
Campione
Quante verifiche stanno dietro un numero. Conta più della metrica:
poche decine di casi senza nemmeno un evento danno accuratezza
perfetta e informazione nulla.
Come sono fatte queste misure
Ogni valore qui viene da un artefatto vivo. Se un campo manca resta vuoto e il limite è dichiarato: non si ricostruisce dal testo e non si eredita dal claim vicino.
Le soglie di freschezza sono dichiarate prima di guardare le date:
2 giorni per ciò che si rigenera da
solo, 30 per una validazione rifatta a
mano. Una soglia scelta a risultato noto non è una soglia.
Registro generato il 2026-09-08T16:59:52+00:00.
Le fonti e le loro licenze stanno in una pagina a parte.