Capacidad de almacenamiento en ADN

Dos bits por base son solo el límite del alfabeto. Limita repeticiones y reserva cebadores e índices para ver la tasa útil.

Cargando simulación interactiva...

Los bits ausentes cumplen una función 🖖

Un alfabeto de cuatro letras permite 2 bits por nucleótido solo si toda secuencia es utilizable. Los cebadores hacen direccionables las hebras, los índices ordenan fragmentos y la redundancia recupera hebras dañadas. La diferencia entre capacidad y tasa neta es el precio de un ADN legible.

La restricción famosa es la barata 🖖

Prohibir cualquier tramo de más de tres bases idénticas cuesta el 0,9 % de los dos bits que podría llevar una base: el canal sigue dando 1,982 bits por base. Los cebadores y el índice ocupan 53 de las 152 bases, un 34,9 %. La restricción que todo el mundo nombra primero es casi gratis; el direccionamiento que nadie menciona cuesta un tercio de la cadena.

Las cadenas largas son más densas, y la química es la razón de que sean cortas 🖖

Los cebadores y el índice son un peaje fijo por cadena, así que alargar un oligo de 152 a 500 bases eleva la fracción útil del 65 % al 89 % y la densidad de 293 a 402 exabytes por gramo: misma química, más archivo. Nada en la teoría de la información impide seguir. El error de síntesis se acumula con cada base añadida, y por eso los oligos reales se quedan en unos pocos cientos.

Problema resuelto al detalle

  1. Cuánto pesa un exabyte en ADN y cuánto añaden las restricciones a la factura 6 pasos

    Calcule cuántos bytes almacena un gramo de ADN con la configuración Fountain; a continuación, determine cuánto pesa un exabyte y qué parte de ese peso existe únicamente debido a las restricciones y no a la información.

    1. Comencemos por el límite teórico bruto, determinado solo por la química. El ADN monocatenario tiene una masa de 330 g por mol de nucleótidos, por lo que un gramo contiene 6,022 × 10²³ ÷ 330 = 1,825 × 10²¹ nucleótidos.

    2. Cuatro letras equivalen a dos bits, por lo que ese gramo contiene 3,650 × 10²¹ bits, y al dividir entre ocho se obtienen 4,562 × 10²⁰ bytes. Esa es la cifra que se cita como 456 exabytes por gramo, la cual asume que todas las secuencias son utilizables.

    3. Pero no todas las secuencias lo son. Prohibir las repeticiones de más de tres bases idénticas seguidas reduce el alfabeto de 2 bits por base a 1,982 —una pérdida inferior al 1 %—, y la restricción que todo el mundo menciona en primer lugar resulta ser la de menor coste.

    4. La costosa es el peaje. Los cebadores ocupan 40 bases y el índice 13, por lo que 53 de cada cadena de 152 bases no transportan carga útil en absoluto: solo lo hacen 99, lo que supone un 65,1 %. Al multiplicar resulta una tasa neta de 1,285 bits por base.

    5. Escale el gramo según esa proporción. Aplicar la relación 1,285 ÷ 2 sobre 4,562 × 10²⁰ deja 2,931 × 10²⁰ bytes por gramo, o 293 exabytes: la cifra que muestra el panel.

    6. Calculemos ahora el peso de un archivo. Un exabyte son 10¹⁸ bytes, por lo que requiere 10¹⁸ ÷ 2,931 × 10²⁰ = 3,41 mg. En el límite teórico intacto de dos bits, ese mismo exabyte pesaría 2,19 mg.

    Respuesta

    Un exabyte de ADN pesa 3,41 mg, y 1,22 mg de esa cantidad —un 56 % adicional— corresponden a las restricciones y no a los datos. Conviene tener presente esto frente a la forma habitual en que se vende esta tecnología. Todo lo referente al almacenamiento en ADN se cita según el límite del alfabeto, y el límite del alfabeto no es algo que nadie pueda construir: dos tercios de la pérdida en este caso no se deben a que la química rechace una secuencia, sino a los cebadores y al índice, y estos existen porque una cadena en un tubo no tiene dirección. No se puede buscar el byte 400 en una mezcla de oligonucleótidos, por lo que cada fragmento tiene que llevar la etiqueta que indica a dónde pertenece, y esa etiqueta es un puro sobrecoste que se paga en todas y cada una de las cadenas. La regla de los homopolímeros a la que se presta toda la atención cuesta menos del 1 %. No poder apuntar a una molécula cuesta un 34,9 %.

Ruta de aprendizaje

Calcular con moléculas

Lleva a Escala del cómputo con ADN bits por molécula: la capacidad de una hebra una vez que la química se ha llevado su parte.

Referencias (1)

Problemas de ejemplo

  • Tipo DNA Fountain - Sobrecarga realista al estilo DNA Fountain: el canal ofrece 1,982 bits por base y la cadena entrega 1,285.
  • Límite del alfabeto - Quita los cebadores, el índice y la redundancia y la tasa llega a 2,000 bits por base, en una cadena que nadie podría releer.
  • Sin repeticiones - Prohíbe del todo las repeticiones y la capacidad cae a 1,585 bits por base, que es log₂3: cada base debe diferir de la anterior.
  • Archivo redundante - Veinte veces más redundancia en una cadena más larga aterriza en los mismos 1,285 bits por base que la opción por defecto.