Salta al contenuto
ComeOggi Precisione misurata, non dichiarata

Quanto ci sbagliamo,
misurato sul serio.

Ogni numero di questa pagina viene da una verifica automatica contro osservazioni reali. Nessuno è scritto a mano, e nessuno viene tolto quando non ci fa bella figura.

Errore a 6 ore di distanza

1.1°C contro 1.29°C della media grezza dei modelli

Miglioramento misurato: 14.7%

1.014 verifiche · ultimi 31 giorni · aggiornata 0.2 giorni fa

Confronto testa-a-testa accuratezza meteo

MAE temperatura (C) vs METAR osservato — piu' basso e' meglio. Previsioni archiviate prima dell'evento, stessi comuni e orizzonti, verità = stessa osservazione METAR. Campione 29598 confronti su 14 località, +1h/+3h/+6h. Ultima verifica 2026-09-08.

MotoreMAE temp (°C) ↓n
Com'è oggi ⭐ 1.146 12606
MET Norway 1.236 12687
Tomorrow.io 1.369 4305

Variabile: temperatura (l'unica con verità puntuale affidabile al METAR); non è un confronto su pioggia/temporali. 3Bmeteo NON è incluso: non abbiamo un accesso consentito ai loro dati archiviati → nessun confronto con loro finché non esiste.

Confronto appaiato stessi casi, stessa incertezza

Temperatura (°C), MAE. Per ogni coppia usiamo gli stessi identici casi e le stesse osservazioni, e riportiamo la differenza con intervallo di confidenza al 95% calcolato tenendo conto della dipendenza fra previsioni dello stesso giorno.

CoppiaMAE noiMAE altroΔ (95%)n
Com'è oggi vs MET Norway 1.135 1.240 -0.105 [-0.17,-0.05] 12507
Com'è oggi vs Tomorrow.io 1.078 1.414 -0.335 [-0.42,-0.25] 4129

Δ negativo = noi meglio; se l'intervallo non tocca lo zero, il vantaggio è statisticamente solido. Escluso: nessun accesso consentito ai loro archivi pre-evento → non misurabile, nessuna dichiarazione.

Correzione distribuita Debias diurno della temperatura

Errore corretto: Bias caldo sistematico a mezzogiorno/pomeriggio (+0.4/+0.9°C) e cold-miss serale nei giorni caldi (fino a -1.1°C); la media globale era ~0 perché si annullano.

Quanto migliora (Out-of-time (fit luglio → test agosto, dist METAR ≤15km)): MAE 1.320 → 1.263 (-4.3%), scarto medio +0.36 → -0.03, errori grossi (≥5°C) 418 → 181 (-57%).

Dove migliora: Ore diurne e serate calde; riduce del 57% gli errori ≥5°C (tipo i picchi di Bergamo). Dove resta incerto: Comuni lontani da ogni stazione (non-ancorati) a brevissimo termine: effetto piccolo o nullo. Il breve termine ancorato a osservazione reale non è toccato.

Onestà: Correzione ML del vento (LOS +4.1% vs stazioni riparate) NON distribuita: peggiorava vs METAR aeroportuali (sottostima già presente). Chiusa.

Verità = METAR puntuale (aeroporti): affidabile per la temperatura, non per pioggia/temporali locali (un rovescio può mancare il punto). I confronti riguardano la temperatura.

Probabilità di pioggia calibrata e onesta

Errore corretto: La probabilità del provider era sovrastimata rispetto alla pioggia osservata al punto (METAR): 90% dichiarato ≈ 50% osservato. Metodo: Calibrazione reliability per (orizzonte, fascia di probabilità), applicata a ciò che vedi; icona e testo si allineano allo stesso evento.

OrizzonteBrier prima→dopoSkill (BSS) dopo
0-3h 0.0285 → 0.0253 -0.114
4-6h 0.0242 → 0.0225 +0.079
7-12h 0.0359 → 0.0346 +0.033

Ambito: skill positivo (meglio della climatologia) a 4–12 h; a 0–3 h la probabilità resta poco affidabile anche calibrata. Limiti: È una probabilità stimata e verificata sul METAR piu' vicino (<=12 km) all'ora bersaglio — un riferimento, NON il punto esatto dell'utente; probabilità ORARIA confrontata con la presenza di pioggia al METAR; orizzonte 0–12 h.

Pioggia nei prossimi minuti cosa abbiamo misurato

Distinte due verità: (a) campo radar futuro, (b) pioggia osservata al suolo (METAR).

MetodoEsitoDettaglio
Avvezione (moto delle celle), gridded e per-punto BOCCIATO Non batte la persistenza sul campo radar futuro (giorno convettivo 15/7: CSI 0.62 vs 0.63 a +15, 0.44 vs 0.45 a +30). Le celle crescono/decadono, il vettore di moto aggiunge rumore.
Cono d'incertezza (persistenza di vicinato) PARZIALE Batte la persistenza sul CAMPO RADAR futuro fuori campione (+60min ΔCSI +0.03/+0.08, POD 0.26→0.62-0.73), ma sulla PIOGGIA AL SUOLO peggiora (aggiunge falsi allarmi: la pioggia vicina spesso non raggiunge il punto). Non promosso agli avvisi.
Segnale radar 'strict' (osservato, sul/vicino punto) MIGLIORE A TERRA Sulla verità METAR è il migliore a ogni orizzonte (CSI +15min 0.18, +30 0.20, +60 0.29; POD 0.27-0.38, FAR 0.44-0.64) e supera punto/vicinato/V1. È già il segnale usato dagli avvisi beta.
Iniziazione temporali (satellite/CAPE→fulmini) BOCCIATO Precisione 0.6% vs fulmini osservati (4756 previsioni, 27 hit). Non affidabile.
Regola pioggia V1-'live' pubblica ROTTA Recall 0.0: non si accende mai (condizioni auto-contraddittorie). Qualsiasi segnale osservato recupera eventi che questa manca.

In sintesi: Nessun nuovo modello di MOVIMENTO batte l'osservazione/persistenza sulla pioggia al suolo. Il miglior segnale a terra resta l'osservazione radar 'strict', già usata. L'avvezione e l'iniziazione temporali sono chiuse (risultato negativo). Fix agli avvisi: rimosso il 'minuto d'arrivo stimato' (ETA non validata).

Verifica su archivio DPC 5-min reale (giorni convettivi) + registrato METAR ~87gg. La verità METAR è puntuale/aeroportuale. Nessun confronto diretto con 3Bmeteo (loro nowcast e accuratezza non pubblici/misurabili).

In due parole

Dove ce la caviamo

  • Temperatura — errore a 6 ore di distanza: 14.7% meglio della media grezza dei modelli.
  • Temperatura — il prodotto completo, ancoraggio incluso: 9.7% meglio della media grezza dei modelli.

Dove non siamo ancora affidabili

  • Pioggia — la regola «sta per piovere»: non c'è abbastanza per misurarla.
  • Temporali — i temporali contro i fulmini veri: il campione è troppo piccolo per dire qualcosa.
  • Temperatura — quanto sbagliamo sulla temperatura: l'ultima verifica ha 91.4 giorni, oltre la soglia di 30.

Le famiglie non si sommano e non si mediano: la temperatura, la pioggia e i temporali si misurano con verità diverse e campioni diversi. «Precisione sulla temperatura» non vuol dire «precisione del sito».

Temperatura

Quanto sbagliamo sulla temperatura

Non aggiornata

Errore medio assoluto della temperatura corretta, confrontato con la media grezza dei modelli. Misurato su stazioni tenute FUORI dall'addestramento, così il risultato non è il ricordo di quello che ha già visto.

1.108°C media grezza dei modelli: 1.359°C
Campione
40
Periodo
~12 mesi
Territorio
Lombardia, Emilia-Romagna e aeroporti nazionali
Aggiornata
91.4 giorni fa
  • Il campione conta stazioni, non osservazioni: 40 stazioni su circa dodici mesi.
  • È una validazione offline, non si aggiorna da sola.
Numeri completi e metodo
Quanto sbagliamo sulla temperatura — valori completi come li produce la verifica
MAE corretto1.108
MAE grezzo1.359
metodoleave-stations-out (Lombardia + Emilia-Romagna + aeroporti nazionali)
Fontedata/accuracy.json
Generato2026-06-09T06:29:34+00:00
Origine della datadichiarata nel file (generato)
Soglia di freschezza30 giorni

Errore a 6 ore di distanza

Aggiornata

Ogni previsione a 6 ore viene confrontata con l'osservazione arrivata dopo. Nessuna selezione: entrano tutte.

1.1°C media grezza dei modelli: 1.29°C
Campione
1.014
Periodo
ultimi 31 giorni
Territorio
Italia
Aggiornata
0.2 giorni fa
  • Un solo orizzonte: dice come andiamo a 6 ore di distanza.
Numeri completi e metodo
Errore a 6 ore di distanza — valori completi come li produce la verifica
MAE corretto1.1
MAE grezzo1.29
MAE del miglior modello singolo1.09
miglioramento vs miglior modello %-0.9
orizzonte (ore)6
Fontedata/track_record.json
Generato2026-09-08T12:06:34+00:00
Origine della datadichiarata nel file (updated)
Soglia di freschezza2 giorni

Il prodotto completo, ancoraggio incluso

Aggiornata

Il percorso intero — modelli, correzione ML, ancoraggio sulla stazione più vicina — contro l'osservazione reale.

1.369°C media grezza dei modelli: 1.516°C
Campione
29.713
Periodo
2026-08-07 → 2026-09-06
Territorio
Italia
Aggiornata
1.5 giorni fa
  • Confronta col modello grezzo. Il confronto col miglior modello singolo sta nell'altra scheda, e non sempre ci dà ragione.
Numeri completi e metodo
Il prodotto completo, ancoraggio incluso — valori completi come li produce la verifica
MAE prodotto1.369
MAE solo ML1.357
MAE grezzo1.516
stazioni40
osservazioni29713
metodoprodotto completo (grezzo→ML→ancoraggio cross-station) vs osservazione reale ARPA; ancoraggio sulla stazione DIVERSA più vicina (no circolarità)
soglia ancoraggio ottima (km)8
quota ancorate %25.0
Fontedata/product_accuracy.json
Generato2026-09-07T05:31:16+00:00
Origine della datadichiarata nel file (generato)
Soglia di freschezza30 giorni

Pioggia

La regola «sta per piovere»

Non valutabile

Quando diciamo che la pioggia sta arrivando, quante volte arriva. Verificata contro la pioggia osservata all'aeroporto più vicino.

Nessun valore da mostrare. Non è un errore di lettura: la misura non è calcolabile su questo campione, e lo diciamo invece di riempire lo spazio.

Campione
143.631
Periodo
Territorio
Italia
Aggiornata
0.0 giorni fa
  • La regola che spediamo non si è accesa nemmeno una volta sul campione verificato: non c'è niente da misurare, e questo è il problema, non la misura.
  • La verità è la pioggia al METAR dell'aeroporto più vicino, che è un'osservazione puntuale e non sempre vicina.
Numeri completi e metodo
La regola «sta per piovere» — valori completi come li produce la verifica
recall (live)0.0
POD (live)0.0
CSI (live)0.0
accensioni (tp+fp)0
casi verificati143631
variante strict — precision0.414
variante strict — recall0.188
variante strict — CSI0.149
definizione eventoNo live promotion until repeated runs show useful precision/recall and source/compliance review remains ok.
Fontedata/radar_track_record.json (blocco `live`)
Generato2026-09-08T16:51:08+00:00
Origine della datadichiarata nel file (updated)
Soglia di freschezza2 giorni

Il nowcast fuso, ancora fuori dal prodotto

Sperimentale

Radar, avvezione, innesco, fulmini e satellite messi insieme. Misurato da mesi, non collegato al sito: finché non batte quello che c'è già, resta fuori.

0.155
Campione
783.232
Periodo
2026-09-07T08:31:30Z → 2026-09-08T16:50:58Z
Territorio
Italia
Aggiornata
0.0 giorni fa
  • NON promuovere: manca il termine di paragone. La regola radar in produzione non ha accensioni verificate, quindi non esiste un CSI da battere.
Numeri completi e metodo
Il nowcast fuso, ancora fuori dal prodotto — valori completi come li produce la verifica
precision0.155
recall0.564
POD0.564
FAR0.845
CSI0.138
frequenza di base0.0134
previsioni positive38132
eventi osservati10471
tp / fp / fn5908 / 32224 / 4563
regolanowcast_fused.p_rain>=0.5@lead_30min
verità di riferimentopioggia osservata dal radar DPC sul punto (mm_qui >= 0.5 mm/h), non il massimo del vicinato
statoMISURATO
Fontedata/nowcast_fused_record.json
Versione motore4b3396ec19da
Generato2026-09-08T16:50:58+00:00
Origine della datadichiarata nel file (generato)
Soglia di freschezza2 giorni

Temporali

I temporali contro i fulmini veri

Campione insufficiente

Il nostro segnale di temporale confrontato con i fulmini osservati dal satellite. È la prova più severa che facciamo, e la meno lusinghiera.

0.157 frequenza di base dei fulmini: 0.002
Campione
300
Periodo
finestra corrente del verificatore
Territorio
Italia, dove il satellite copre
Aggiornata
0.0 giorni fa
  • Questi numeri sono il motivo per cui le notifiche sui temporali restano spente.
Numeri completi e metodo
I temporali contro i fulmini veri — valori completi come li produce la verifica
tp47
fp253
fn84
precision0.157
recall0.359
fired300
previsioni verificabili54677
frequenza fulmini0.002
statoattivo
Fontedata/lightning_verification.json (segnale strict_signal)
Generato2026-09-08T16:50:46+00:00
Origine della datadichiarata nel file (generated)
Soglia di freschezza2 giorni

Sperimentale

Storico open, fuori dal motore

Sperimentale

Prova di allargare la validazione a fonti storiche aperte. Non entra nel prodotto: serve a sapere se varrebbe la pena.

1.322°C
Campione
39
Periodo
{'start': '2026-05-19', 'end': '2026-06-09'}
Territorio
Italia
Aggiornata
88.9 giorni fa
  • Marcato experimental_not_live dal file stesso.
  • Fermo da 88.9 giorni.
Numeri completi e metodo
Storico open, fuori dal motore — valori completi come li produce la verifica
modoexpanded
statoexperimental_not_live
Fontedata/historical_open_spike.json
Generato2026-06-11T19:12:38+00:00
Origine della datadichiarata nel file (generated)
Soglia di freschezza30 giorni

Le parole, senza equivoci

Cosa significano precision, recall, MAE e gli altri
MAE — errore medio assoluto
Di quanti gradi sbagliamo in media, senza compensare gli errori in eccesso con quelli in difetto. Più basso è meglio.
Precision
Quando diciamo che succederà, quante volte succede. Non è una probabilità e non è «accuratezza».
Recall, o POD
Di tutte le volte che è successo, quante l'avevamo detto.
FAR — tasso di falsi allarmi
La quota di annunci che non si è avverata. È l'opposto della precision.
CSI
Un indice unico che tiene insieme quello che abbiamo previsto, quello che abbiamo mancato e quello che abbiamo annunciato a vuoto.
Accuratezza
La percentuale di volte che abbiamo azzeccato, comprese quelle in cui abbiamo detto «non succede» e non è successo. Su fenomeni rari è ingannevole: dire sempre «non piove» dà accuratezza altissima e valore nullo. Per questo qui non la usiamo quasi mai.
Campione
Quante verifiche stanno dietro un numero. Conta più della metrica: poche decine di casi senza nemmeno un evento danno accuratezza perfetta e informazione nulla.

Come sono fatte queste misure

Ogni valore qui viene da un artefatto vivo. Se un campo manca resta vuoto e il limite è dichiarato: non si ricostruisce dal testo e non si eredita dal claim vicino.

Le soglie di freschezza sono dichiarate prima di guardare le date: 2 giorni per ciò che si rigenera da solo, 30 per una validazione rifatta a mano. Una soglia scelta a risultato noto non è una soglia.

Registro generato il 2026-09-08T16:59:52+00:00. Le fonti e le loro licenze stanno in una pagina a parte.

Vedi fonti e licenze