Toolyard

GenBank 파일 읽는 법

헤더

  • LOCUS: 이름, 염기쌍 길이, 분자 종류(DNA, mRNA), 선형인지 원형인지, 날짜.
  • DEFINITION: 한 줄 설명.
  • ACCESSION과 VERSION: NM_000546.6 같은 레코드 ID. 마침표 뒤의 숫자는 서열이 바뀌면 바뀝니다.
  • SOURCE와 ORGANISM: 서열의 출처.
  • REFERENCE: 서열을 보고한 논문.

FEATURES

각 피처에는 종류(gene, CDS, promoter, misc_feature)와 위치가 있고, 그 뒤에 /gene="TP53", /product=, CDS의 단백질 서열이 들어 있는 /translation= 같은 수식자가 붙습니다.

  • 100..500: 위 가닥의 100~500번 염기.
  • complement(100..500): 같은 범위를 반대 가닥에서 읽은 것.
  • join(100..200,300..450): 유전자의 엑손처럼 이어 붙인 조각.
  • <1..300이나 200..>900: 피처가 서열 끝을 넘어 이어짐을 뜻합니다.

ORIGIN

서열 자체로, 소문자 10개씩 묶여 있고 각 줄 앞에 위치가 붙으며 //로 끝납니다.

다루는 법

GenBank → FASTA 변환은 숫자와 공백을 없애고 대부분의 도구가 받는 순수한 서열을 줍니다. 피처를 지도로 보려면 파일을 플라스미드 지도 보기에서 여세요. 상보 가닥의 피처는 그 범위의 역상보 서열로 5'→3' 방향으로 읽습니다.

이 가이드에서 쓰는 도구

다른 가이드