Leçon
La théorie — Calculateur d'horloge moléculaire
Une horloge moléculaire convertit des différences de séquence en temps écoulé en trois gestes : compter les différences, corriger ce décompte, puis diviser par un taux. Le premier et le troisième sont de l’arithmétique. C’est dans le deuxième que réside tout le comportement intéressant — y compris le point où la méthode cesse purement et simplement de fonctionner, ce que cette page vous montrera si vous le lui demandez.
Ce que signifie chaque symbole
p- la proportion brute de sites alignés qui diffèrent. La page l’affiche en pourcentage à côté du nombre de différences — 7.7% pour la paire par défaut, soit 1 site sur 13.
d- la distance évolutive corrigée, en substitutions par site. Toujours supérieure à
p, et l’écart entre les deux croît sans limite. μ- le taux de substitution par site et par an. Une entrée, pas un résultat : vous le fournissez, et tout l’aval hérite de son incertitude.
t- le temps de divergence que la page rapporte, en années avant le présent.
D’où vient la formule
- Modélisons un site isolé comme sautant au hasard entre les quatre bases. Sous l’hypothèse de Jukes–Cantor — chaque base également fréquente, chaque substitution également probable — la probabilité que deux séquences diffèrent en un site après une distance évolutive
dvautp = (3/4)(1 − e^(−4d/3)). Lisez-la comme une courbe : elle part de zéro, monte fortement, puis s’aplatit à mesure que l’exponentielle s’éteint, s’approchant de 3/4 sans jamais l’atteindre. - Vous observez
pet voulezd: il faut donc inverser. En réarrangeant,e^(−4d/3) = 1 − 4p/3, puis en prenant les logarithmes,d = −(3/4)·ln(1 − 4p/3). Essayons l’alignement par défaut : 1 différence sur 13 sites donnep = 0.0769, et la formule renvoie0.0812— exactement ce qu’affiche la page. À cette profondeur, la correction vaut environ 5%. - Regardons maintenant où ce logarithme meurt. Son argument
1 − 4p/3s’annule pourp = 3/4, etdy part à l’infini. Ce seuil n’est pas un artefact de l’algèbre : 3/4 est la fraction de sites où deux séquences totalement étrangères l’une à l’autre diffèrent, puisque quatre bases équiprobables coïncident une fois sur quatre par pur hasard. La correction explose donc précisément là où l’alignement devient statistiquement indiscernable d’un bruit — et l’infini est la réponse honnête, non un bogue. Chargez le préréglage « saturé », à 75.0%, et la page rapporte exactement cela. - La saturation est la limite célèbre, mais rarement celle qui mord la première. L’alignement par défaut fait treize bases. Une différence donne
d = 0.0812; le préréglage « virus rapide » reprend ces mêmes 13 sites avec deux différences et donned = 0.1722— une seule différence de plus fait plus que doubler la distance. (Son temps de divergence diffère pour une autre raison : ce préréglage fournit aussi un taux viral.) Avec des séquences aussi courtes, l’estimation avance par grands sauts discrets, et aucune correction n’y remédie. La longueur achète la précision ; la correction n’achète que la justesse.
Comment lire ce que vous voyez
Quatre lignes, à lire de haut en bas comme la chaîne de traitement. Longueur alignée et différences sont l’observation brute, le pourcentage étant p. La distance de Jukes–Cantor est cette observation après l’étape 2. Le temps de divergence est cette distance divisée par le double du taux. La ligne qu’il faut comprendre plutôt que lire est la troisième : lorsqu’elle indique ∞ (saturé), elle n’échoue pas à calculer, elle signale que les données sont compatibles avec n’importe quel âge.
- Suppose
- Tout ce que suppose Jukes–Cantor, et l’ADN réel n’en respecte exactement aucun point : quatre bases également fréquentes et douze substitutions également probables — alors que les transitions dépassent les transversions d’environ deux pour un et que le taux de GC varie fortement entre génomes et le long d’eux. Au-delà du modèle : un taux constant sur les deux lignées et dans le temps, des sites évoluant indépendamment et à la même vitesse, et un alignement déjà correct. L’horloge compte en outre des substitutions, non des mutations : elle mesure ce que la sélection a laissé passer.
- Ne tient plus quand
- Le nombre le plus faible de cette page est celui que vous avez saisi.
μest une entrée, et le calibrer est le véritable goulot d’étranglement de tout le domaine — les taux s’estiment à partir de fossiles ou de divergences connues, ils diffèrent selon les gènes, les lignées et les sites au sein d’un même gène, et un désaccord d’un facteur deux n’a rien de remarquable. La page vous rendra pourtant un temps de divergence à trois chiffres significatifs, précision que l’arithmétique supporte et que la biologie ne soutient pas. Traitez la distance corrigée comme la mesure, et la date comme cette mesure multipliée par un nombre qui mérite une barre d’erreur. Deux autres pressions sur le modèle, allant dans le même sens : Jukes–Cantor sous-corrige quand les sites évoluent à des vitesses différentes, car les sites rapides saturent tandis que les lents ont à peine commencé, et il sous-corrige encore quand les transitions dominent — la vraie distance est donc généralement supérieure à celle imprimée ici, et de plus en plus avec la profondeur.
Problème entièrement résolu
-
Deux séquences de 13 bases alignées différant sur un seul site 5 étapes
Deux séquences de 13 bases alignées diffèrent sur un seul site, et le taux de substitution est de 5 × 10⁻⁹ par site et par an. Datez la séparation — puis évaluez ce que cette date vaut réellement.
-
L'observation brute est la proportion de sites qui diffèrent : un sur treize, 7,7 %.
-
Cette proportion sous-estime la divergence réelle, car un site peut être touché deux fois et paraître intact, ou être touché deux fois tout en ressemblant à un seul changement. Jukes–Cantor corrige les changements invisibles, et la correction croît sans limite à mesure que p s'approche de 0,75 — le point où deux séquences non apparentées concorderaient par le seul fait du hasard.
-
C'est sur le facteur 2 que la plupart des gens se trompent. Les deux lignées ont muté depuis la séparation, de sorte que les différences se sont accumulées sur le double du temps écoulé. Divisez par μ seulement et vous daterez l'ancêtre commun au double de son âge réel.
-
Ici, la correction ne représente que 5,5 %, précisément parce que p est faible et que les doubles mutations sont rares. Sur des séquences plus éloignées, c'est la différence entre une réponse et un résultat dénué de sens.
-
Passons maintenant à l'évaluation honnête. Treize sites forment un échantillon de treize. Une discordance de plus donnerait p = 2/13, d = 0,1722, et une date de 17,2 millions d'années.
Réponse
L'outil affiche une divergence de 7,7 %, une distance de Jukes–Cantor de 0,0812 et une séparation à 8,1 Mya. Chaque étape est correcte et la réponse n'en a pas moins aucune valeur, parce que les données d'entrée se résument à treize bases : une discordance supplémentaire — une seule base, ce qui entre largement dans ce que l'on obtiendrait en choisissant un autre gène — double l'âge pour l'amener à 17,2 millions d'années. Les horloges moléculaires réelles utilisent des milliers de sites exactement pour cette raison, et l'arithmétique ne change aucunement lorsqu'elles le font. Ce qui change, c'est l'amplitude de la réponse, et cette amplitude est le résultat. Une date fournie sans cette amplitude n'est qu'un nombre qui se fait passer pour une mesure.
-
Parcours
Horloges dans la roche
Références (3)
- The correction in the second block, and the formula the lesson derives: T. H. Jukes and C. R. Cantor, "Evolution of protein molecules", in H. N. Munro (ed.), Mammalian Protein Metabolism III, 21–132. Academic Press, 1969.
- The lesson's closing point — why Jukes–Cantor under-corrects when sites evolve at different speeds: Z. Yang, "Among-site rate variation and its impact on phylogenetic analyses." Trends in Ecology & Evolution 11(9), 367–372, 1996.
- Calibrating the clock, and why the divergence factor is 2: M. Nei and S. Kumar, Molecular Evolution and Phylogenetics, ch. 2 and 10. Oxford University Press, 2000. ISBN 978-0-19-513585-5.