C'est un réflexe courant : tracer deux intervalles, constater qu'ils se chevauchent, et conclure que les deux choses ne se distinguent pas. Ce test est bien plus sévère qu'il n'y paraît. Deux intervalles à 95 % ne cessent de se chevaucher qu'à partir de 3,92 erreurs types d'écart — et à cette séparation, la différence porte une valeur p de 0,0056. La vraie significativité au seuil de 0,05 arrive bien plus tôt, à 2,77 erreurs types. Entre ces deux chiffres s'étend une bande de 1,15 erreur type, presque un tiers du chemin, où les intervalles se chevauchent visiblement et où la différence est pourtant significative. Exiger un écart visible revient donc à un test à p < 0,006 : environ neuf fois plus dur que le 0,05 que vous pensiez appliquer, et un bon moyen de manquer un effet réel.