정렬이란
정렬은 일치하는 위치가 같은 열에 오도록 서열 두 개를 늘어놓는 것입니다. 한쪽에 남는 염기나 잔기가 있는 곳에는 다른 쪽에 갭(-)을 넣습니다. 결과로 둘이 일치하는 곳, 다른 곳, 삽입이나 결실이 일어난 곳을 알 수 있습니다.
서열 두 개 정렬하기
- DNA 두 개 정렬이나 단백질 두 개 정렬을 엽니다.
- 서열 두 개를 붙여 넣습니다.
- 정렬과 그 아래의 동일성, 갭 수, 점수를 확인합니다.
두 도구 모두 서열을 처음부터 끝까지 맞추는 전역 정렬을 합니다. 같은 유전자나 단백질의 두 버전을 비교하는 데 알맞습니다. 긴 서열 속에서 짧은 부분을 찾는다면 패턴 찾기가 더 알맞습니다.
갭과 점수
일치하면 점수가 오르고, 불일치나 갭이 있으면 내려갑니다. 새 갭을 여는 것이 기존 갭을 늘리는 것보다 더 크게 감점됩니다. 이것을 아핀 갭 벌점이라고 합니다. 생물학적으로도 6염기 삽입이 한 번 일어나는 편이 1염기 삽입이 여섯 번 따로 일어나는 것보다 흔하기 때문입니다. 단백질 정렬에서는 불일치를 BLOSUM62 행렬로 채점해서, 류신과 아이소류신처럼 비슷한 아미노산끼리의 치환은 거의 일치로 다룹니다.
동일성과 유사성
동일성은 맞춰진 위치 가운데 완전히 같은 것의 비율입니다. 유사성은 단백질의 경우 화학적으로 비슷한 아미노산 위치도 셉니다. 두 단백질이 동일성 40%, 유사성 60%일 수도 있습니다. 이미 정렬된 서열 여러 개라면 동일성과 유사성으로 모든 쌍의 값을 구할 수 있습니다.