Aller au contenu

2026-09-02 : ce que huit réplications apprennent, et pourquoi aucune n'est retenue

Question

Combien des stratégies les mieux documentées de la littérature survivent à leur propre publication, une fois les coûts payés et le nombre d'essais compté ?

La tension est la suivante. Ces huit articles sont parmi les plus cités de la finance empirique, ils sont publiés dans les meilleures revues, et leurs auteurs gèrent de l'argent avec. Si aucun ne survit, c'est notre méthode qu'il faut suspecter. S'ils survivent tous, c'est notre contrôle du surapprentissage qui ne sert à rien.

Hypothèse

Écrite avant de mesurer : la moitié environ se réplique dans sa fenêtre, une minorité survit hors échantillon, et la contrainte qui tue le plus souvent est le coût de transaction.

Expérience

Huit études menées de la donnée au verdict, chacune suivie d'un second passage chargé de la contredire. Chaque étude porte sa configuration écrite avant le premier téléchargement, son point d'entrée déterministe, ses résultats régénérables, et un verdict déduit par decide_verdict depuis des seuils fixés à l'avance.

Résultat

L'hypothèse est à moitié fausse, et l'erreur est instructive.

Sept articles sur huit se répliquent correctement dans leur propre fenêtre. La réplication n'est pas le problème. Le portage retrouve son coefficient de panel à 0,5 % près, 1,084 contre 1,09 publié. La gestion de volatilité retrouve huit chiffres sur huit, dont l'erreur type de l'alpha au centième. Le momentum transversal retrouve sa cellule principale à 1,7 % près.

Ce qui échoue est la survie, et pour trois raisons différentes.

Étude Verdict La contrainte qui tue
001 momentum temporel EXPERIMENTAL la publication, z = 3,239 sur la chute du Sharpe
002 momentum transversal EXPERIMENTAL la publication, t de 5,12 à 1,746
003 valeur et momentum EXPERIMENTAL 207 essais, ratio de Sharpe dégonflé à 0,000012
004 qualité EXPERIMENTAL notre construction ne reproduit pas le facteur publié
005 bêta défensif REJECTED une hypothèse de construction non discutée
006 gestion de volatilité REJECTED l'investissabilité, -1,30 %/an net
007 arbitrage statistique REJECTED les coûts, seuil de rentabilité à 3,92 points de base
008 portage REPLICATED trois classes d'actifs sur quatre non testables

Comment lire ce tableau, en trois constats. Le premier est que la contrainte fatale change d'une étude à l'autre, donc il n'existe pas un test unique qui les trierait toutes. Le deuxième est que deux études sur huit meurent d'une décision de méthode et non des données, ce qui rend le contrôle du surapprentissage aussi utile que le contrôle des coûts. Le troisième est qu'aucune n'atteint ROBUST, et que 715 essais au total n'ont produit aucune stratégie retenue.

Décision

Le parcours de validation est conservé tel quel. Il a rejeté ce qu'il devait rejeter sans rejeter la réplication elle-même, ce qui est le comportement attendu.

Quatre trouvailles sortent du cadre des articles et méritent d'être gardées.

L'échantillon de Moreira et Muir s'arrête en avril 2015 et non en décembre, ce qui referme l'écart de huit mois sur leur compte d'observations. Six comptes sur six tombent alors exactement, contrôlé deux fois de façon indépendante.

Le biais de survie retire au momentum au lieu de lui ajouter, de 2,04 à 4,34 points de pourcentage par an. Un décile perdant reconstitué sur un indice actuel se remplit de titres tombés puis remontés, puisqu'il a fallu remonter pour y figurer.

Un paramètre présenté comme un détail d'estimation peut porter tout le résultat. Le rétrécissement du bêta de Frazzini et Pedersen fait passer un ratio de Sharpe de 0,394 à -0,001 sans changer le classement des titres.

Une source publiée peut porter un défaut silencieux. Les colonnes hors actions du classeur d'AQR s'arrêtent au 2025-01-31 quand sa colonne agrégée court jusqu'au 2026-06-30, et le ratio de Sharpe hors échantillon en dépend du simple au double.

Question suivante

Quatre études restent EXPERIMENTAL, donc elles portent un résultat sans atteindre la robustesse. Leurs rendements sont-ils suffisamment décorrélés entre eux pour qu'un portefeuille les combinant vaille mieux que chacune prise seule ? C'est la question de la phase 7. L'étude 003 en donne déjà la forme : le mélange de deux jambes corrélées à -0,577 porte un ratio de Sharpe de 1,096, quand la meilleure jambe seule en porte 0,593.