ORF란
열린 번역틀은 개시 코돈으로 시작해 같은 틀의 첫 종결 코돈(TAA, TAG, TGA)에서 끝나는 코돈의 연속입니다. 서열에서 단백질로 번역될 수 있는 부분이죠. 진짜 유전자는 ORF이지만 모든 ORF가 유전자는 아닙니다. 짧은 ORF는 어디서나 우연히 생깁니다.
여섯 번역틀
서열은 정방향 가닥에서 1, 2, 3번째 염기에서 시작하는 세 틀로 읽을 수 있고, 역상보 가닥에서 세 틀을 더 읽을 수 있습니다. 역가닥의 유전자는 정방향 틀에서 보이지 않으므로, 방향을 알지 못하면 여섯 틀을 모두 검색해야 합니다.
설정 고르기
- 개시 코돈: 진핵생물과 대부분의 검색에는 ATG. 세균은 유전자 열 개 중 하나 이상이 GTG로, 일부는 TTG로 시작하므로 세균 DNA에는 이들도 포함합니다. "임의의 코돈"은 종결에서 종결까지의 틀을 찾아, 개시가 없는 부분 서열에 유용합니다.
- 최소 길이: 무작위 DNA에서는 약 21 코돈마다 종결 코돈이 우연히 나오므로, 100 코돈 기준이면 대부분의 잡음이 걸러집니다. 짧은 펩타이드나 바이러스 유전자에는 낮추고, 유전체 규모 검색에는 높입니다.
- 유전 암호: 미토콘드리아와 일부 세균 서열은 종결·개시 코돈이 다르므로 알맞은 표를 고릅니다.
진짜 고르기
가장 긴 ORF가 보통 유전자이지만 확인이 필요합니다. 진짜 코딩 서열은 생물에 맞는 코돈 사용 빈도를 보이고, 같은 아미노산이 길게 이어지지 않는 그럴듯한 단백질이 되며, 진핵생물 mRNA라면 개시 부위 주변에 Kozak 서열(GCCACCATGG)이 있습니다. 유전체 DNA에서는 인트론이 유전자를 조각내므로 ORF 검색은 cDNA와 세균 유전체에 쓰이고, 스플라이싱되는 유전자에는 맞지 않습니다.
찾고 번역하기
- 서열을 ORF 찾기에 붙여 넣고 번역틀, 개시 코돈, 최소 길이를 고릅니다.
- 각 ORF가 번역틀, 시작, 끝, 길이, 단백질 서열과 함께 나열됩니다.
- 고른 영역은 DNA를 단백질로 번역으로 번역하고, 번역 지도에서는 여섯 틀을 한꺼번에 볼 수 있습니다.