DNAコドン翻訳ツール

DNA配列を入力すると、そのRNAコドン、アミノ酸翻訳、GC含量を確認できます。

インタラクティブシミュレーションを読み込んでいます...

20種のアミノ酸に64個のコドン 🖖

コドンは六十四通り、アミノ酸は二十種類、終止シグナルは三つ。したがって、遺伝暗号には必ず重複が生じる。ただし、その重複にははっきりした偏りがある。同じアミノ酸を指定するコドンは、ほとんどの場合、第3塩基だけが異なる。ここはtRNAのアンチコドンが最も緩やかに読み取る位置であり、クリックが提唱した「ゆらぎ」に当たる。そのため、第3塩基に起こる一塩基置換の多くは、DNA配列を変えてもタンパク質を変えない。同義変異をクリックし、続いて開始コドンを選んでみよう。違いは一塩基だけだが、並ぶ五つのアミノ酸は同じである。この仕組みはどれほど巧妙なのだろう。フリーランドとハーストが百万通りの別の遺伝暗号を生成して比較したところ、誤りの代償を表す彼らの尺度で、実際の遺伝暗号より高い緩衝効果を示したものは、わずか一つだった。

生命を3文字ずつ読む 🖖

細胞はDNAを三塩基ずつ、互いに重ならない単位に区切って読み取る。この単位をコドンという。翻訳は開始コドンATGから始まる。これはメチオニンも指定する。その後はコドンごとに進み、終止シグナルのTAATAG、またはTGAに達すると終了する。このツールは入力した配列を三塩基ずつに分け、それぞれが指定するアミノ酸を表示する。どこから読み始めるかは決定的に重要だ。開始位置を一塩基ずらすだけで、それ以降のコドンはすべて変わり、まったく別のタンパク質が生じる。

「普遍的」なコードにも方言がある 🖖

遺伝暗号はほぼ普遍的ですが、完全ではありません。あなた自身のミトコンドリアは、細胞の他の部分とは違う読み方をします。通常は終止シグナルの TGA はトリプトファンとして読まれ、ATA はイソロイシンではなくメチオニンになり、AGAAGG はアルギニンから終止へと変わります。単細胞の繊毛虫の中には、終止コドンをグルタミンに読み替えるものさえいます。つまり同じ三つ組でも、どのゲノムが読むかによって意味が変わるのです。

本物の配列はどう見えるか

知っておきたい五つの配列——と、遺伝子ではないもの一つ

上の入力欄は、誰かが作った十八塩基から始まります。ここに並ぶ五つは本物です。配列データベースから取った読み枠が四つと、読み枠ではない有名な DNA が一つ。どれでもクリックすればツールに読み込まれます。

配列 塩基 長さ GC 翻訳結果
ヒト β グロビン、最初の八コドン ATGGTGCATCTGACTCCTGAGGAG 24 bp 54.2% Met-Val-His-Leu-Thr-Pro-Glu-Glu
同じもの、鎌状赤血球の変異あり ATGGTGCATCTGACTCCTGTGGAG 24 bp 54.2% Met-Val-His-Leu-Thr-Pro-Val-Glu
緑色蛍光タンパク質の先頭 ATGAGTAAAGGAGAAGAACTTTTCACTGGA 30 bp 36.7% Met-Ser-Lys-Gly-Glu-Glu-Leu-Phe-Thr-Gly
プレプロインスリンのシグナルペプチド先頭 ATGGCCCTGTGGATGCGCCTCCTGCCCCTGCTG 33 bp 69.7% Met-Ala-Leu-Trp-Met-Arg-Leu-Leu-Pro-Leu-Leu
コザック配列——読み枠ではない GCCACCATGG 10 bp 70.0% Ala-Thr-Met

最初の二行は並べて読んでください。このページで、これ以上に重いものはありません。二十四塩基のうち一つ、二十番目だけが違い、翻訳の列はそれを「七番目の Glu が Val になる」という形にして見せます。このたった一つの置換が鎌状赤血球症です。残りは規模と幅の話です。GC はクラゲのタンパク質の 36.7% からヒトインスリンのシグナルペプチドの 69.7% まで幅があり、GC に富むということは、機能よりも「どの生物のどの部分か」を語っています。そして最後の行は、このツールの使用例ではなく、このツールへの警告です。コザック配列は翻訳がどこで「始まる」べきかを示す信号であって、それ自体は読み枠ではありません。それでもツールは平然と Ala-Thr-Met と訳します。問いが意味を成すかどうかは、計算機には判定できません。

全プロセスの詳細解説

  1. 18塩基および33.3% GCに対する3文字のコドン 5 ステップ

    18 塩基、6 コドン、33.3% GC。なぜ 3 塩基からなるコドンが理論上機能し得る最短の語長となるのか、そして余剰の容量が何をもたらすのかを解き明かせ。

    1. 塩基配列は 3 塩基ずつのコドンに分割されるため、18 塩基から 6 個のコドンが得られる。そして最後のコドンは終止信号である TAA であり、これが本配列を完全な短い遺伝子として読み取らせる理由である。

    2. GC 含量は G と C の塩基数を数えたもので、18 塩基中 6 個である。G–C ペアは 3 本の水素結合を形成するのに対し A–T ペアは 2 本であるため、これが重要であり、GC 含量が高い配列はより高い温度で融解する。

    3. 次に長さの問いに移る。4 種類の塩基から 2 つずつ選ぶと 16 通りの組み合わせとなり、符号化すべき 20 種類のアミノ酸に満たないため、2 塩基のペアでは機能しない。

    4. 3 つずつ選ぶと、終止信号を含めて指定すべき 21 個の要素に対し 64 通りが得られる。したがって、3 文字が機能し得る最短の語長であり、これは実際に観察される前に理論的に推論された。

    5. これにより 64 通りの暗号が 21 個の意味に対応し、1 つの意味につきおよそ 3 つのコドンが割り当てられる。この余剰は曖昧さではなく冗長性に費やされている。すなわち、複数のコドンが同じアミノ酸を指定することはあっても、1 つのコドンが 2 つのアミノ酸を指定することはない。

    解答

    ツールには 18 bp6 コドン、および 33.3% GC と表示される。この冗長性こそが重大な帰結をもたらす部分である。同義コドンは通常 3 番目の塩基のみが異なるため、そこでの変異は何も変化をもたらさないことが多い。遺伝暗号には、修復機構によるものではなく、マッピング(対応関係)自体の性質としてエラー耐性が組み込まれている。これに対し、読み枠(リーディングフレーム)は真逆の性質を持つ。1 つの塩基を欠失させると、それ以降のすべてのコドンが組み替えられ、遺伝子の残りの部分がナンセンス化する。同じ 3 文字構造でありながら、ある種のエラーはほぼ無害であり、別の種類のエラーは壊滅的な影響をもたらす。

参考文献 (6)

例題

  • 開始コドン - ATG AAA CGT TTT GCC TAA:Met-Lys-Arg-Phe-Ala-Stopと読まれる六つのコドンで、GC含量は33.3%。例題で扱う配列である。
  • GCリッチ - 16塩基中14塩基がGまたはCなので、GC含量は87.5%となり、融解温度も高い。16は3の倍数ではないため、末尾の一塩基はどのコドンにも含まれない。
  • オープンリーディングフレーム - 54塩基、18コドンからなり、末尾はTAA。第13コドンのATGは配列内部のメチオニンであり、二つ目の開始点ではない。一つの読み枠に始点は一つしかない。
  • 同義変異 - 開始コドンの例とは一塩基だけ異なり、CGTがCGCになっている。どちらもArgを指定するため、タンパク質は変わらない。変化するのはGC含量だけで、33.3%から38.9%になる。