Comment le score est calculé — et où sont ses limites
Quatre modèles numériques pondérés, des seuils calibrés par niveau FFP, et un backtest publié — y compris quand il ne nous arrange pas.
Un ensemble de modèles, pas un seul
Aucun modèle numérique n'est le meilleur partout. AROME (Météo-France, 1.3 km) gagne sur l'orographie et les 0-48 h. ECMWF-IFS prend le relais au-delà de J+2. ARPEGE et ICON-EU apportent une variance utile sur le vent en altitude. Nous pondérons les quatre selon leur fiabilité mesurée au backtest ; leur désaccord s'affiche comme indice de confiance sur chaque heure — confiance basse : attendez un run plus récent avant de bloquer votre week-end. La confiance intègre aussi l'horizon : J+0 ≈ 100 %, J+7 ≈ 30 %.
Score 0-100, pas juste GO / NO-GO
Le score composite combine sept variables opérationnelles : vent sol soutenu, rafales, vent 1500 m / 3000 m, plafond nuageux (BKN/OVC), visibilité, précipitation, et instabilité convective (CAPE / Lifted Index). Le score est calibré par niveau FFP — ce qui est GO pour un Brevet D peut rester marginal pour un élève.
Une valeur proche d'un seuil (dès 70 % de la limite) pèse déjà sur le score : on voit la marge, pas juste une couleur.
Seuils FFP — où l'on suit la règle, où l'on s'en écarte
| Critère | Élève (PAC) / Brevet A | Brevet B | Brevet C/D |
|---|---|---|---|
| Vent sol (m/s) | ≤ 7 | ≤ 11 | ≤ 11 |
| Rafales (m/s) | ≤ 9 | ≤ 14 | ≤ 15 |
| Vent 1500 m (m/s) | ≤ 15 | ≤ 18 | ≤ 22 |
| Plafond BKN/OVC (m AGL) | ≥ 1500 | ≥ 1200 | ≥ 900 |
| Visibilité (m) | ≥ 5000 | ≥ 5000 | ≥ 5000 |
| Précipitations (mm/h) | < 0.05 | < 0.1 | < 0.2 |
| CAPE (J/kg) | < 300 | < 500 | < 800 |
Les limites vent sol (7 / 11 m/s) sont issues du règlement FFP. Le Brevet A est volontairement scoré aux seuils élève (7 m/s) — la prudence prime tant que l'autonomie est récente.
Une réserve sur le plafond : aucun modèle ne le publie directement. Nous le reconstruisons en cherchant, du sol vers le haut, la première couche nuageuse significative et son altitude — une estimation juste à environ 150 m près, mesurée contre les observations réelles d'aérodrome. Quand le plafond estimé tombe près du seuil, l'heure le signale et son indice de confiance baisse : nous préférons afficher un doute qu'une fausse netteté. Quand il est très au-dessus, la question ne se pose pas.
Même réserve sur la visibilité, pour une raison plus forte : un seul des quatre modèles la publie, donc aucun accord entre modèles ne vient l'étayer. Loin du seuil elle porte de l'information — elle repère 63 % des visibilités réellement basses pour 7 % de fausses alertes. À moins de 2 km du seuil, en revanche, elle se trompe une fois sur deux : l'heure baisse alors d'indice de confiance, sans que le verdict change. Les limites en altitude et les seuils doux (couverture, CAPE, plafond) sont des choix opérationnels basés sur la pratique — chaque directeur de saut garde la main, ces seuils sont des valeurs par défaut, pas des absolus.
Backtest et vérité terrain
Notre scoring est évalué contre des observations METAR réelles (aérodromes les plus proches, archives IEM (Iowa Environmental Mesonet)). Pour chaque variable on mesure RMSE, MAE et biais ; pour le binaire GO/NO-GO on suit la matrice de confusion et surtout le taux de faux positifs (FPR) — la métrique de sécurité : combien de fois le modèle dit « ça sautera » alors que la météo dit non.
La campagne — juin 2025 à août 2026
13 dropzones sur 15 mois : 125 710 heures de prévisions horaires confrontées aux observations réelles, modèle par modèle. La station METAR de référence est à moins de 8 km de la zone de saut dans tous les cas — au-delà, l'observation ne parle plus du même ciel que la prévision et l'écart mesuré n'est plus une erreur de modèle. La mesure est automatisée et la campagne se relance d'une commande, ce qui est la seule raison pour laquelle ces chiffres ne sont plus ceux d'un seul mois d'été.
Erreur sur le vent sol (le critère le plus déterminant)
| Modèle | RMSE (m/s) | MAE (m/s) | Biais (m/s) |
|---|---|---|---|
| ICON-EU | 1.49 | 1.13 | −0.55 |
| AROME (Météo-France) | 1.51 | 1.14 | −0.06 |
| ECMWF-IFS | 1.53 | 1.16 | −0.32 |
| ARPEGE (Météo-France) | 1.61 | 1.23 | −0.07 |
RMSE / MAE : l'erreur typique, en m/s. Biais : la tendance à sous-estimer (négatif) ou sur-estimer (positif) systématiquement.
En clair : l'erreur moyenne sur le vent sol est de 1,1 à 1,2 m/s selon le modèle — du même ordre que l'écart qui fait basculer un GO, ce qui explique la table suivante.
Classification binaire GO / NO-GO
| Modèle | Accuracy | Précision | Recall | FPR | MCC |
|---|---|---|---|---|---|
| AROME (Météo-France) | 56 % | 91 % | 46 % | 15 % | 0.28 |
| ICON-EU | 53 % | 91 % | 43 % | 15 % | 0.25 |
| ARPEGE (Météo-France) | 55 % | 90 % | 47 % | 18 % | 0.25 |
| ECMWF-IFS | 49 % | 84 % | 41 % | 26 % | 0.13 |
| Ensemble | 53 % | 94 % | 41 % | 8 % | 0.29 |
MCC : corrélation prévision ↔ réalité — 0 = hasard, 1 = parfait. Précision : quand on annonce GO, combien de fois c'est vrai. FPR : la métrique de sécurité — combien de fois on annonce GO à tort.
Lecture honnête : quand nous annonçons GO, c'est GO 94 fois sur 100, et il reste 8 % de faux GO — des heures annoncées sautables qui ne l'étaient pas. C'est la métrique qui compte pour la sécurité, et celle que nous cherchons à faire baisser. La corrélation globale entre prévision et réalité (MCC 0.29, accuracy 53 %) reste modeste : un verdict binaire sur une atmosphère continue restera toujours une simplification. AROME (Météo-France) est ici le modèle le plus prudent pris seul (15 %).
Ce que cette prudence coûte : sur les heures qui étaient réellement sautables, nous en avons annoncé 59 % comme NO-GO. C'est le revers assumé d'un faible taux de faux GO — nous préférons rater une heure sautable qu'en annoncer une qui ne l'est pas, et chaque resserrement d'un critère déplace ce curseur. Le dernier en date, en septembre 2026, a retiré une garde qui masquait des plafonds réels : moins de faux GO, un peu plus d'heures manquées.
Pourquoi ce résultat est attendu — et ce qu'on en fait. Les bascules GO↔NO-GO se jouent à ±1 m/s, soit exactement l'ordre de grandeur de l'erreur des modèles : une heure mesurée à 10,5 m/s et prévue à 11,5 change de verdict sans que le modèle se soit beaucoup trompé. Une heure « 65 » à confiance basse n'est pas la même information qu'une heure « 92 » à confiance haute. Le binaire GO/NO-GO de cette table est une simplification volontairement sévère pour mesurer la calibration ; le score lui-même est plus actionnable.
Limites connues
- La campagne porte sur 13 dropzones, pas sur les 45 : ailleurs, la station METAR la plus proche est trop loin pour servir de vérité terrain, ou n'archive rien. Gap-Tallard en fait partie — son aérodrome ne diffuse pas de METAR archivé, donc nous ne mesurons pas notre erreur là-bas, et nous ne prétendons pas le faire. La distance de la station est indiquée sur chaque fiche.
- La turbulence mécanique et le cisaillement de basses couches ne sont pas modélisés.
- Le catalogue est reconstruit chaque semaine depuis le site FFP ; le filtre qui écarte les structures sans terrain peut rater un cas.
- Au-delà de J+5, la prévision sert à repérer une tendance, pas à décider — revenez à J-2.