Problème entièrement résolu
-
Ce que pèse un exaoctet dans l'ADN, et ce que les contraintes ajoutent à la note 6 étapes
Calculez combien d'octets contient un gramme d'ADN avec les réglages fountain, puis indiquez combien pèse un exaoctet — et quelle part de ce poids existe uniquement du fait des contraintes plutôt que de l'information.
-
Partons du plafond brut, issu de la seule chimie. L'ADN simple brin pèse 330 g par mole de nucléotides, donc un gramme contient 6,022 × 10²³ ÷ 330 = 1,825 × 10²¹ nucléotides.
-
Quatre lettres représentent deux bits, ce gramme contient donc 3,650 × 10²¹ bits, et la division par huit donne 4,562 × 10²⁰ octets. C'est le chiffre cité de 456 exaoctets par gramme, et il suppose que chaque séquence est utilisable.
-
Toutes les séquences ne le sont pas. Interdire les répétitions de plus de trois bases identiques fait passer l'alphabet de 2 bits par base à 1,982 — soit une perte de moins de 1 %, et la contrainte que tout le monde cite en premier se révèle être la moins coûteuse.
-
La contrainte coûteuse, c'est le péage. Les amorces prennent 40 bases et l'index 13, ainsi 53 bases sur chaque brin de 152 bases ne transportent aucune donnée utile : seules 99 en transportent, soit 65,1 %. En multipliant le tout, le taux net est de 1,285 bits par base.
-
En appliquant ce ratio au gramme, 1,285 ÷ 2 de 4,562 × 10²⁰ donne 2,931 × 10²⁰ octets par gramme, soit 293 exaoctets — le chiffre qu'affiche le panneau.
-
Pesons maintenant une archive. Un exaoctet représente 10¹⁸ octets, il faut donc 10¹⁸ ÷ 2,931 × 10²⁰ = 3,41 mg. Au plafond intact de deux bits, ce même exaoctet pèserait 2,19 mg.
Réponse
Un exaoctet d'ADN pèse 3,41 mg, dont 1,22 mg — soit 56 % de plus — provient des contraintes plutôt que des données. Ce qui mérite d'être opposé à la façon dont cette technologie est habituellement vendue. Tout ce qui concerne le stockage sur ADN est cité à la limite de l'alphabet, or la limite de l'alphabet n'est pas ce que quiconque peut construire : ici, les deux tiers de la perte ne viennent pas de la chimie qui refuserait une séquence, mais des amorces et de l'index, et ceux-ci existent parce qu'un brin dans un tube n'a pas d'adresse. On ne peut pas accéder directement à l'octet 400 dans un mélange d'oligonucléotides, chaque fragment doit donc porter l'étiquette qui indique sa place, et cette étiquette est un pur surcoût payé sur chaque brin. La règle des homopolymères qui attire toute l'attention coûte moins de 1 %. L'impossibilité de pointer vers une molécule coûte 34,9 %.
-
Parcours
Calculer avec des molécules
Références (1)
- The storage architecture behind the default oligo dimensions and measured density comparison: Y. Erlich and D. Zielinski, “DNA Fountain enables a robust and efficient storage architecture.” Science 355(6328), 950–954, 2017.