Cómo es una secuencia real
Cinco secuencias que conviene conocer — y una que no es un gen
El cuadro de arriba arranca con dieciocho bases inventadas. Estas cinco son reales: cuatro marcos de lectura tomados de las bases de datos de secuencias y un famoso trozo de ADN que no lo es. Haz clic en cualquiera para cargarla en la herramienta.
| Secuencia | Bases | Longitud | GC | Se traduce como |
|---|---|---|---|---|
| β-globina humana, primeros ocho codones | ATGGTGCATCTGACTCCTGAGGAG |
24 pb | 54,2% | Met-Val-His-Leu-Thr-Pro-Glu-Glu |
| La misma, con el cambio de la anemia falciforme | ATGGTGCATCTGACTCCTGTGGAG |
24 pb | 54,2% | Met-Val-His-Leu-Thr-Pro-Val-Glu |
| Proteína verde fluorescente, inicio | ATGAGTAAAGGAGAAGAACTTTTCACTGGA |
30 pb | 36,7% | Met-Ser-Lys-Gly-Glu-Glu-Leu-Phe-Thr-Gly |
| Péptido señal de la preproinsulina, inicio | ATGGCCCTGTGGATGCGCCTCCTGCCCCTGCTG |
33 pb | 69,7% | Met-Ala-Leu-Trp-Met-Arg-Leu-Leu-Pro-Leu-Leu |
| El contexto de Kozak — no es un marco de lectura | GCCACCATGG |
10 pb | 70,0% | Ala-Thr-Met |
Lee las dos primeras filas juntas: nada más en esta página pesa tanto. Difieren en una sola base de veinticuatro, la vigésima, y la columna de traducción lo convierte en esto: Glu pasa a ser Val en la séptima posición. Esa única sustitución es la anemia falciforme. Lo demás es escala y variedad: el GC va del 36,7 % en una proteína de medusa al 69,7 % en el péptido señal de la insulina humana, así que ser rico en GC dice más sobre el organismo y la parte del gen que sobre la función. Y la última fila es una advertencia sobre esta herramienta, no un ejemplo para ella. El contexto de Kozak es la señal que marca dónde debe EMPEZAR la traducción; no es en sí un marco de lectura, y aun así la herramienta lo traduce tan campante como Ala-Thr-Met. Una calculadora no puede decirte si tu pregunta tiene sentido.
Problema resuelto al detalle
-
Un codón de tres letras para dieciocho bases y un 33,3% de GC 5 pasos
Dieciocho bases, seis codones, 33,3% de GC. Averigüe por qué un codón de tres letras es el más corto que podría funcionar y qué aporta la capacidad sobrante.
-
La secuencia se divide en codones de tres, por lo que dieciocho bases dan seis; y el último es TAA, de parada, razón por la cual esto se lee como un gen corto completo.
-
El contenido de GC cuenta las bases G y C, seis de dieciocho. Importa porque los pares G–C tienen tres enlaces de hidrógeno frente a los dos de A–T, de modo que una secuencia rica en GC se desnaturaliza a una temperatura más alta.
-
Pasemos a la cuestión del tamaño. Cuatro bases tomadas de dos en dos dan 16 combinaciones, menos que los 20 aminoácidos que deben codificarse, por lo que los pares no pueden funcionar.
-
De tres en tres se obtienen 64, frente a las 21 entidades que hay que nombrar contando la señal de parada. Por lo tanto, tres es la longitud de palabra más corta que resulta viable, y se dedujo antes de que se observara.
-
Eso deja 64 combinaciones que se asignan a 21 significados, aproximadamente tres codones por significado. El exceso se emplea en la redundancia, no en la ambigüedad: varios codones nombran al mismo aminoácido, pero ninguno nombra a dos.
Respuesta
La herramienta muestra 18 bp, 6 codones y un 33,3% de GC. La redundancia es la parte que acarrea consecuencias. Puesto que los sinónimos suelen diferir en la tercera base, una mutación en esa posición a menudo no cambia absolutamente nada: el código posee una tolerancia a errores integrada que es una propiedad del mapa de asignación, no de ningún mecanismo de reparación. El marco de lectura posee la propiedad opuesta: al eliminar una base, todos los codones posteriores se reagrupan, convirtiendo el resto del gen en una secuencia sin sentido. La misma estructura de tres letras hace que un tipo de error resulte prácticamente gratuito y el otro sea catastrófico.
-
Referencias (6)
- The code the tool tabulates: F. H. C. Crick, L. Barnett, S. Brenner and R. J. Watts-Tobin, "General Nature of the Genetic Code for Proteins." Nature 192, 1227–1232, 1961.
- The error-minimising structure, and how strong that claim actually is: S. J. Freeland and L. D. Hurst, "The Genetic Code Is One in a Million." Journal of Molecular Evolution 47(3), 238–248, 1998.
- The sequence library below: where its bases were fetched from, accession by accession: NCBI Reference Sequence Database — HBB (NM_000518.5) and INS (NM_000207) coding sequences, and GFP (GenBank M62653.1). Retrieved 2026-08-06.
- And the result the first two rows of that table exist to show: V. M. Ingram, "Gene mutations in human haemoglobin: the chemical difference between normal and sickle cell haemoglobin." Nature 180, 326–328, 1957 — one amino acid.
- The jellyfish protein that made cell biology visible: D. C. Prasher, V. K. Eckenrode, W. W. Ward, F. G. Prendergast & M. J. Cormier, "Primary structure of the Aequorea victoria green-fluorescent protein." Gene 111(2), 229–233, 1992.
- And the context that tells a ribosome where to start, which is the last row and not a gene: M. Kozak, "An analysis of 5′-noncoding sequences from 699 vertebrate messenger RNAs." Nucleic Acids Research 15(20), 8125–8148, 1987.