Toolyard

オープンリーディングフレーム(ORF)の見つけ方

ORF とは

オープンリーディングフレームは、開始コドンで始まり、同じ読み枠の最初の終止コドン(TAA、TAG、TGA)で終わるコドンの連なりです。配列のうちタンパク質に翻訳されうる部分にあたります。本物の遺伝子は ORF ですが、すべての ORF が遺伝子ではありません。短い ORF はどこにでも偶然現れます。

6 つの読み枠

配列は順方向の鎖で 1、2、3 番目の塩基から始まる 3 つの枠で読め、逆相補鎖でさらに 3 つの枠で読めます。逆鎖上の遺伝子は順方向の枠には現れないので、向きがわかっていない限り 6 枠すべてを探します。

設定の選び方

  • 開始コドン:真核生物と大半の検索では ATG。細菌では 10 遺伝子に 1 つ以上が GTG で、少数が TTG で始まるため、細菌 DNA ではそれらも含めます。「任意のコドン」は終止から終止までの枠を見つけるもので、開始のない部分配列に便利です。
  • 最小長:ランダム DNA では終止コドンが約 21 コドンに 1 回偶然現れるので、100 コドンのしきい値でノイズの大半が除けます。短いペプチドやウイルス遺伝子では下げ、ゲノム規模の走査では上げます。
  • 遺伝暗号:ミトコンドリアや一部の細菌の配列は終止・開始コドンが異なるため、正しい表を選びます。

本物を選ぶ

最長の ORF がたいてい遺伝子ですが、確認が必要です。本物のコード配列は、その生物に合ったコドン使用頻度を持ち、同じアミノ酸の長い連続のないもっともらしいタンパク質になり、真核生物の mRNA なら開始部周辺に Kozak 配列(GCCACCATGG)があります。ゲノム DNA ではイントロンが遺伝子を分断するので、ORF 検索が有効なのは cDNA と細菌ゲノムで、スプライシングされる遺伝子には向きません。

見つけて翻訳する

  1. ORF 検索に配列を貼り付け、読み枠、開始コドン、最小長を選びます。
  2. 各 ORF が読み枠、開始、終了、長さ、タンパク質配列とともに一覧されます。
  3. 選んだ領域は DNA をタンパク質に翻訳で翻訳でき、翻訳マップでは 6 枠を一度に見られます。

このガイドで使うツール

その他のガイド