コドン
タンパク質をコードする配列は3塩基ずつ読みます。3塩基のコドン1つがアミノ酸1つ、または終止を表します。ATGはメチオニンを表し、ふつう開始コドンです。標準遺伝暗号ではTAA・TAG・TGAが終止コドンです。ATGGCTTAAはM A *に翻訳され、*が終止を示します。
6つの読み枠
1番目・2番目・3番目のどの塩基から読み始めるかで、1本の鎖から3通りの翻訳ができ、逆相補鎖からさらに3通りできます。6つのうち本物のタンパク質はふつう1つだけです。正しい読み枠は、終止コドンのない長い区間、つまりオープンリーディングフレーム(ORF)であることがほとんどです。
長い配列からタンパク質を探す
- DNAをORF 検索に貼り付け、最小の長さを決めます。たとえば100コドンです。
- 両方の鎖で最も長いORFを確認します。
- 目的のORFをDNA をタンパク質に翻訳にコピーし、コドンごとに確認します。
遺伝暗号表
ほとんどの生物は標準遺伝暗号を使いますが、例外もあります。脊椎動物のミトコンドリアではTGAがトリプトファンを表し、AGAとAGGが終止になります。一部の細菌、酵母、繊毛虫にも独自の違いがあります。合ったNCBIの遺伝暗号表を選ばないと、ミトコンドリアの遺伝子が終止だらけに見えます。
逆方向の変換
ほとんどのアミノ酸には複数のコドンがあるため、タンパク質から1つに決まったDNA配列は得られません。逆翻訳は、可能性をIUPACコードで書くか、コドン使用頻度表で最も多いコドンを使います。