코돈
단백질을 암호화하는 서열은 세 염기씩 읽습니다. 세 염기로 된 코돈 하나가 아미노산 하나 또는 종결을 나타냅니다. ATG는 메싸이오닌을 나타내며 보통 개시 코돈입니다. 표준 유전 암호에서는 TAA·TAG·TGA가 종결 코돈입니다. ATGGCTTAA는 M A *로 번역되며, *가 종결을 뜻합니다.
여섯 가지 해독 틀
첫째·둘째·셋째 중 어느 염기부터 읽기 시작하느냐에 따라 한 가닥에서 번역이 세 가지 나오고, 역상보 가닥에서 세 가지가 더 나옵니다. 여섯 가지 중 진짜 단백질은 보통 하나뿐입니다. 올바른 해독 틀은 대개 종결 코돈이 없는 긴 구간, 즉 열린 해독 틀(ORF)입니다.
긴 서열에서 단백질 찾기
- DNA를 ORF 찾기에 붙여 넣고 최소 길이를 정합니다. 예를 들어 100코돈입니다.
- 양쪽 가닥에서 가장 긴 ORF를 확인합니다.
- 원하는 ORF를 DNA를 단백질로 번역에 복사해 코돈마다 확인합니다.
유전 암호표
대부분의 생물은 표준 유전 암호를 쓰지만 예외도 있습니다. 척추동물 미토콘드리아에서는 TGA가 트립토판을 나타내고, AGA와 AGG가 종결이 됩니다. 일부 세균, 효모, 섬모충에도 고유한 차이가 있습니다. 알맞은 NCBI 유전 암호표를 고르지 않으면 미토콘드리아 유전자가 종결투성이로 보입니다.
반대 방향 변환
대부분의 아미노산에는 코돈이 여러 개 있어서, 단백질로부터 하나로 정해진 DNA 서열은 얻을 수 없습니다. 역번역은 가능성을 IUPAC 코드로 쓰거나, 코돈 사용표에서 가장 많이 쓰인 코돈을 씁니다.