L'élagage des variables : ne garder que ce qui compte vraiment
Plus un modèle a de variables, plus il risque d'apprendre des corrélations fortuites sans signification réelle. Une fois le modèle entraîné une première fois, une méthode rigoureuse identifie et retire les variables qui n'apportent aucune information utile.
Le test du bruit
Imaginez un procès où l'on ajoute délibérément un faux témoin, dont on sait qu'il n'a rien vu et ne peut rien apporter. Tout témoin réel jugé moins crédible que ce faux témoin est écarté du dossier : s'il n'est pas plus utile qu'une source qu'on sait inutile par construction, il n'a pas sa place. C'est exactement ce principe qui est appliqué aux variables du modèle.
Une variable de bruit purement aléatoire, sans aucune relation causale avec le prix, est ajoutée au jeu de variables avant chaque passe de mesure d'importance. L'importance de gain de chaque variable réelle est alors comparée à celle de cette variable témoin ; toute variable dont l'importance ne dépasse pas ce niveau de référence, ou dont l'importance de gain est nulle, est considérée comme statistiquement non informative et devient candidate à la suppression — une approche directement inspirée de la méthode Boruta.
Suppression itérative par lots
Les variables jugées inutiles ne sont pas retirées d'un coup : elles le sont par petits groupes, avec à chaque fois une vérification que le modèle réentraîné reste presque aussi précis qu'avant. Cette prudence évite de retirer accidentellement une variable qui, combinée à d'autres, avait en réalité un rôle discret mais réel.
À chaque étape, un lot d'au plus 10 variables candidates est retiré simultanément, puis le modèle est réentraîné (avec une nouvelle recherche d'hyperparamètres complète tous les quelques passages, une réutilisation des meilleurs réglages précédents entre deux). La dégradation de la performance (mesurée en NLL, ou en MAPE selon le critère choisi) est comparée à une tolérance fixée à 2 % : en deçà, la suppression est validée et le processus continue ; au-delà, elle est rejetée. Le processus s'arrête après un nombre maximal d'étapes, ou lorsqu'il ne reste plus de candidat sous le seuil d'importance minimal, ou lorsqu'il ne reste plus que quelques variables.
Repli sur suppression individuelle
Si retirer tout un groupe de variables d'un coup dégrade trop le modèle, la méthode ne renonce pas immédiatement : elle retente en ne retirant que la moins utile du groupe, seule, avant de conclure que même cette suppression minime n'est pas acceptable.
Lorsqu'un lot de plus d'une variable est rejeté, l'algorithme retente automatiquement la suppression de la seule variable la moins importante du lot avant d'abandonner l'étape — une sonde individuelle qui évite de renoncer prématurément à un gain de simplicité partiel.
Les variables protégées
Certaines variables ne servent pas directement à fixer le prix, mais à mesurer la fiabilité de l'estimation elle-même (par exemple, la cohérence des données disponibles pour un bien donné). Celles-ci sont volontairement protégées de la suppression, même si leur contribution au prix semble faible.
Les variables dites de fiabilité (cohérence multi-résolution des indices spatiaux, complétude des features, dispersion des prix locaux, ancienneté des ventes de référence, etc.) sont pré-exclues du processus d'élagage, quel que soit leur niveau d'importance de gain mesuré, car elles alimentent la tête de dispersion (incertitude) plutôt que la tête de localisation (niveau de prix), et leur retrait dégraderait silencieusement la qualité de la calibration sans se voir sur le seul critère de prix.
Le bénéfice de l'élagage
Un modèle plus léger est plus rapide à faire fonctionner, plus facile à comprendre et à expliquer, et moins exposé au risque d'avoir appris des coïncidences statistiques plutôt que de vraies causes. C'est aussi un gage de transparence : on peut affirmer que chaque variable conservée a démontré son utilité, pas seulement supposé l'avoir.
Le résultat est un modèle final plus parcimonieux, dont l'ensemble des variables conservées est documenté (avec, pour chaque variable retirée, la raison précise : importance nulle, importance inférieure au bruit témoin, ou importance sous le seuil minimal), une performance quasiment identique au modèle complet, une meilleure robustesse au surapprentissage, et une explicabilité accrue puisque l'attribution du prix (voir la page suivante) ne porte plus que sur des variables dont le signal est statistiquement établi.
Méthode & sources citées sur cette page
- Mesure d'importance de gain (feature importance) issue du modèle entraîné, comparée à une variable de bruit témoin
Envie de voir la méthode à l'œuvre sur votre bien ?
Estimer mon bien →