Toolyard

서열 동일성과 유사성(%) 계산하는 법

동일성과 유사성

둘 다 정렬을 열 단위로 읽어 구합니다. 동일성(%)은 두 서열이 같은 잔기를 갖는 열의 비율입니다. 유사성(%)은 잔기가 다르지만 화학적으로 비슷한 열(류신과 아이소류신, 아스파르트산과 글루탐산 등)도 셉니다. 유사성은 단백질에서만 의미가 있고, DNA에서는 동일성을 씁니다.

분모가 중요하다

동일한 열이 90개인 두 서열은 100열 정렬 기준 90% 동일, 120잔기짜리 긴 서열 기준 75%, 갭이 아닌 95열 기준 95%로 보고될 수 있습니다. 도구마다 다릅니다:

  • BLAST는 갭을 포함한 정렬 길이로 나눕니다.
  • EMBOSS Needle도 같지만 갭을 따로 보고합니다.
  • 짧은 서열로 나누는 도구도 있는데, 긴 단백질의 일부와 맞는 짧은 조각의 값을 부풀립니다.

수치를 인용할 때는 무엇으로 나눴는지, 정렬이 전역인지 지역인지 밝히세요.

어떤 잔기가 유사한가

유사성 그룹은 보통 BLOSUM62 행렬에서 양의 점수를 갖는 쌍을 따릅니다. 흔한 그룹: I, L, V, M; F, Y, W; K, R, H; D와 E; N과 Q; S와 T; A와 G. 대부분의 도구는 쓰는 규칙을 보여 주며, 이 사이트의 동일성과 유사성 도구는 동일한 열과 유사한 열을 따로 표시합니다.

숫자의 의미

전체 길이에 걸쳐 30% 넘게 동일한 두 단백질은 거의 언제나 상동이며 같은 접힘을 공유합니다. 20~30%는 "황혼 지대"로, 정렬이 진짜일 수도 우연일 수도 있어 데이터베이스 검색의 통계적 E값이 더 나은 지표입니다. DNA는 침묵 위치에서 더 빨리 갈라지므로, 거의 같은 단백질을 암호화하는 두 유전자가 DNA 수준에서는 70%만 동일할 수 있습니다.

계산하기

  1. 단백질 두 개 정렬이나 DNA 두 개 정렬로 서열을 정렬하거나, 이미 있는 정렬을 붙여 넣습니다.
  2. 정렬된 서열을 동일성과 유사성에 붙여 넣습니다. 동일한 열과 유사한 열을 세어 정렬 길이와 함께 두 비율을 보고합니다.

이 가이드에서 쓰는 도구

다른 가이드