Problema resuelto al detalle
-
Cuánto pesa un exabyte en ADN y cuánto añaden las restricciones a la factura 6 pasos
Calcule cuántos bytes almacena un gramo de ADN con la configuración Fountain; a continuación, determine cuánto pesa un exabyte y qué parte de ese peso existe únicamente debido a las restricciones y no a la información.
-
Comencemos por el límite teórico bruto, determinado solo por la química. El ADN monocatenario tiene una masa de 330 g por mol de nucleótidos, por lo que un gramo contiene 6,022 × 10²³ ÷ 330 = 1,825 × 10²¹ nucleótidos.
-
Cuatro letras equivalen a dos bits, por lo que ese gramo contiene 3,650 × 10²¹ bits, y al dividir entre ocho se obtienen 4,562 × 10²⁰ bytes. Esa es la cifra que se cita como 456 exabytes por gramo, la cual asume que todas las secuencias son utilizables.
-
Pero no todas las secuencias lo son. Prohibir las repeticiones de más de tres bases idénticas seguidas reduce el alfabeto de 2 bits por base a 1,982 —una pérdida inferior al 1 %—, y la restricción que todo el mundo menciona en primer lugar resulta ser la de menor coste.
-
La costosa es el peaje. Los cebadores ocupan 40 bases y el índice 13, por lo que 53 de cada cadena de 152 bases no transportan carga útil en absoluto: solo lo hacen 99, lo que supone un 65,1 %. Al multiplicar resulta una tasa neta de 1,285 bits por base.
-
Escale el gramo según esa proporción. Aplicar la relación 1,285 ÷ 2 sobre 4,562 × 10²⁰ deja 2,931 × 10²⁰ bytes por gramo, o 293 exabytes: la cifra que muestra el panel.
-
Calculemos ahora el peso de un archivo. Un exabyte son 10¹⁸ bytes, por lo que requiere 10¹⁸ ÷ 2,931 × 10²⁰ = 3,41 mg. En el límite teórico intacto de dos bits, ese mismo exabyte pesaría 2,19 mg.
Respuesta
Un exabyte de ADN pesa 3,41 mg, y 1,22 mg de esa cantidad —un 56 % adicional— corresponden a las restricciones y no a los datos. Conviene tener presente esto frente a la forma habitual en que se vende esta tecnología. Todo lo referente al almacenamiento en ADN se cita según el límite del alfabeto, y el límite del alfabeto no es algo que nadie pueda construir: dos tercios de la pérdida en este caso no se deben a que la química rechace una secuencia, sino a los cebadores y al índice, y estos existen porque una cadena en un tubo no tiene dirección. No se puede buscar el byte 400 en una mezcla de oligonucleótidos, por lo que cada fragmento tiene que llevar la etiqueta que indica a dónde pertenece, y esa etiqueta es un puro sobrecoste que se paga en todas y cada una de las cadenas. La regla de los homopolímeros a la que se presta toda la atención cuesta menos del 1 %. No poder apuntar a una molécula cuesta un 34,9 %.
-
Ruta de aprendizaje
Calcular con moléculas
Referencias (1)
- The storage architecture behind the default oligo dimensions and measured density comparison: Y. Erlich and D. Zielinski, “DNA Fountain enables a robust and efficient storage architecture.” Science 355(6328), 950–954, 2017.