Module 9 — Mesurer rendement, risque et incertitude
Validation hors échantillon, robustesse et décision
Le test final consulté dix fois n’est plus finalSituation réelle
Le test final consulté dix fois n’est plus final
Une équipe réserve 2023–2025 comme période hors échantillon. La première version échoue ; elle ajuste un filtre et regarde à nouveau 2023–2025. Après dix itérations, cette période a guidé les décisions et fait désormais partie de l’entraînement intellectuel. L’étiquette hors échantillon est restée, mais son indépendance a disparu.
La validation crédible organise le temps et le droit de regarder : développement, validation séquentielle, test verrouillé et éventuellement simulation en direct.
Objectifs d’apprentissage
- Séparer entraînement, validation et test final.
- Mettre en œuvre walk-forward et tests de robustesse.
- Définir des critères d’acceptation avant résultat.
- Savoir conclure « preuve insuffisante ».
- Limiter la conclusion à ce que les données permettent réellement d’affirmer.
Commencer par la bonne question
Quelles données ont réellement été protégées de toute décision de construction, et combien de fois avons-nous consulté chaque résultat ?
Une analyse utile commence par cette question avant de chercher une figure, un indicateur ou un paramètre. Elle force à préciser l’unité observée, l’horizon, la chronologie et le type de conclusion attendu. Sans ce cadre, une description a posteriori peut facilement être prise pour une règle prédictive.
Batterie de robustesse
- sous-périodes d’expansion, récession, inflation et stress ;
- marchés et zones non utilisés au développement ;
- paramètres voisins, pas seulement optimum ;
- exécution retardée et slippage accru ;
- exclusion des meilleures transactions ;
- variations raisonnables du fournisseur de données ;
- placebo ou permutation compatible avec la structure ;
- simulation papier prospective.
La robustesse ne veut pas dire que chaque sous-période doit gagner. Elle demande que le comportement soit compréhensible, que la perte soit compatible avec l’hypothèse et que le résultat ne dépende pas d’un accident unique.
Critères préétablis
Avant le test final, décide par exemple : nombre minimal d’événements, rendement net supérieur au benchmark pour un risque comparable, drawdown tolérable, stabilité des coûts, absence de concentration excessive et résultat directionnel cohérent dans plusieurs fenêtres. Ces seuils dépendent de l’usage ; ils ne doivent pas être choisis après lecture du résultat.
De la recherche à l’éventuelle exécution
- spécification et revue ;
- backtest reproductible ;
- validation hors échantillon ;
- simulation papier avec flux réels ;
- taille minimale si l’utilisateur décide d’aller plus loin ;
- limites de perte et procédure d’arrêt ;
- surveillance des écarts entre test et réalité.
Ce cours s’arrête à la compétence de recherche. Toute mise en risque appartient à l’apprenant et doit tenir compte de sa situation, de la réglementation et des caractéristiques de l’instrument.
Pourquoi une stratégie cesse de fonctionner
Le mécanisme peut disparaître, être arbitré, changer de coût, dépendre d’un régime, avoir été un artefact ou subir une exécution différente. Une dégradation n’est pas automatiquement une occasion de « renforcer ». Définis à l’avance les conditions de suspension : données invalides, slippage hors seuil, drawdown, écart de fréquence des signaux ou rupture structurelle.
Hors échantillon est un rôle
Une période devient in-sample dès qu’elle influence un paramètre, une feature, un filtre ou l’abandon d’une idée.
Walk-forward respecte l’ordre
On entraîne sur le passé et teste le bloc suivant, puis avance. Les fenêtres expanding et rolling répondent à des hypothèses différentes sur la stabilité.
Embargo et purge évitent le chevauchement
Lorsque les labels portent sur des horizons qui se chevauchent, des observations proches peuvent partager de l’information et doivent être séparées.
La robustesse cherche des invariances
Paramètres voisins, coûts plus élevés, univers alternatifs et sous-périodes testent si l’effet dépend d’un détail précis.
Méthode pas à pas
- Budgéter les consultations. Définir à l’avance qui peut voir le test final et quand.
- Construire les folds. Respecter l’ordre temporel et la durée nécessaire à l’apprentissage.
- Purger si nécessaire. Retirer les chevauchements de labels et appliquer un gap avant le test.
- Tester la robustesse. Appliquer des stress préenregistrés sans choisir seulement ceux qui passent.
- Décider. Utiliser des critères go/revise/stop fixés avant la lecture.
Laboratoire guidé
du concept au dossier de preuve
- Écris la fiche avant d’ouvrir le résultat. Reformule la question — « Quelles données ont réellement été protégées de toute décision de construction, et combien de fois avons-nous consulté chaque résultat ? » — sous forme d’une hypothèse réfutable. Indique la population, l’horizon, l’unité, le benchmark, la date de début et la date de fin. Donne un identifiant à cette version.
- Sépare données et interprétation. Crée une table brute en lecture seule, puis une table de variables dérivées. Pour chaque colonne calculée, conserve formule, paramètres, source, fuseau et premier instant d’utilisation. Une correction de donnée ne doit jamais être confondue avec une amélioration de stratégie.
- Produis un échantillon de contrôle. Utilise une règle plus simple, des dates décalées, une permutation ou un groupe comparable. Le contrôle doit conserver autant que possible fréquence, exposition et régime ; sinon la comparaison attribuerait au signal ce qui vient du marché général.
- Travaille à l’aveugle lorsque c’est possible. Masque la partie future lors de l’annotation et réserve un bloc temporel que tu ne consultes pas pendant la construction. Archive aussi les cas ambigus et les événements qui ne confirment pas le récit.
- Stress les hypothèses, pas seulement les paramètres. Augmente les coûts, retarde l’exécution, réduit la liquidité disponible et change raisonnablement la fenêtre. L’objectif n’est pas de trouver une variante qui réussit, mais de savoir dans quelles conditions la conclusion disparaît.
- Décide avec une règle écrite. Continue seulement si l’effet est mesurable, net de coûts, présent dans plusieurs segments et non concentré sur une valeur isolée. Sinon, classe le résultat « à réviser » ou « à arrêter » et explique précisément pourquoi.
Démonstration chiffrée
Walk-forward à cinq fenêtres
On entraîne sur 2010–2014 et teste 2015, puis entraîne sur 2010–2015 et teste 2016, jusqu’à cinq folds. Chaque fold choisit ses paramètres uniquement sur sa fenêtre d’entraînement. Les performances de test sont ensuite concaténées dans l’ordre, sans réoptimisation globale sur les années futures.
Si les positions ont un horizon de vingt jours, on introduit un gap ou une purge afin qu’un label d’entraînement ne chevauche pas la période test. On publie les cinq résultats, y compris les folds négatifs, et on mesure leur dispersion.

Interpréter sans surinterpréter
- Test recyclé. Regarder et corriger transforme progressivement le test final en données de développement.
- Folds trop courts. Ils peuvent contenir trop peu d’événements pour estimer une métrique stable.
- Régime unique. Un test indépendant mais concentré dans un seul contexte reste limité.
- Robustesse à la carte. Multiplier les stress puis ne montrer que ceux qui passent reproduit le problème de sélection.
La discipline consiste à écrire ces limites avant de consulter le résultat final. Une conclusion négative ou incertaine n’est pas un échec : elle évite de transformer le bruit historique en décision coûteuse.
Lire un résultat qui confirme
ou contredit — l’intuition
Si le résultat paraît confirmer l’idée, commence par rechercher ce qui pourrait l’expliquer autrement : test recyclé et folds trop courts constituent ici deux contrôles prioritaires. Vérifie ensuite si l’effet existe encore après coûts, sur des paramètres voisins et sur une période qui n’a guidé aucune décision. Une confirmation qui disparaît dès qu’un détail raisonnable change est une piste d’exploration, pas une base d’action.
Si le résultat contredit l’intuition, ne déplace pas immédiatement le seuil. Vérifie d’abord les données et la chronologie, puis accepte l’hypothèse nulle comme issue possible. Pour « Validation hors échantillon, robustesse et décision », une absence d’effet peut signifier que le phénomène est descriptif, trop faible face aux coûts, propre à un sous-régime ou simplement absent dans l’échantillon. Chacune de ces explications exige une nouvelle expérience identifiée, jamais une retouche silencieuse.
Exercice
- Sépare un historique en développement, folds walk-forward et test verrouillé.
- Justifie fenêtre expanding ou rolling selon ton hypothèse de stabilité.
- Calcule le chevauchement des labels et fixe purge ou gap.
- Préenregistre six stress : paramètres, coûts, délais, univers et sous-périodes.
- Écris des critères go/revise/stop avant de calculer les résultats.
Afficher le corrigé détaillé
La correction présente un calendrier où aucune date de test n’entre dans l’apprentissage antérieur. Le choix expanding suppose que l’histoire ancienne reste informative ; rolling privilégie l’adaptation mais jette des données. Le gap correspond au moins au chevauchement pertinent des labels. Les six stress sont conservés, pas filtrés. Une décision « go » exige par exemple une contribution positive dans plusieurs folds, un coût stressé supportable, l’absence de dépendance à un seul paramètre et un drawdown compatible. Si le test verrouillé est consulté puis la règle modifiée, une nouvelle période indépendante est nécessaire.
Le corrigé décrit une méthode, pas une unique valeur à mémoriser. Si ton résultat diffère, vérifie d’abord les unités, le calendrier, la définition des variables et l’instant où l’information devient disponible ; documente ensuite toute hypothèse alternative.
VÉRIFIER SA COMPRÉHENSION
Quiz corrigé
01Une période reste-t-elle hors échantillon après avoir guidé une modification ?
Non. Elle a participé au développement.
02Quelle différence entre expanding et rolling ?
Expanding conserve tout le passé ; rolling utilise une fenêtre mobile de longueur fixée.
03À quoi sert un gap ?
À réduire les fuites dues aux observations ou labels temporellement proches.
04Faut-il publier les folds négatifs ?
Oui. Ils renseignent sur la stabilité et évitent la sélection.
05Un test final réussi suffit-il ?
Non. Il réduit l’incertitude mais ne garantit ni stabilité future ni exécution réelle.
À retenir
- Hors échantillon décrit une indépendance décisionnelle.
- Chaque consultation consomme une partie de cette indépendance.
- Le walk-forward respecte l’ordre du temps.
- Purge et gap répondent aux chevauchements d’information.
- Les stress doivent être préenregistrés et tous rapportés.
- Les critères de décision précèdent les résultats.
Sources de référence
Enregistré uniquement dans ce navigateur pour l’aperçu gratuit.