La cabecera
- LOCUS: el nombre, la longitud en pares de bases, el tipo de molécula (DNA, mRNA), si es lineal o circular, y una fecha.
- DEFINITION: una descripción de una línea.
- ACCESSION y VERSION: el identificador del registro, como NM_000546.6. El número tras el punto cambia cuando cambia la secuencia.
- SOURCE y ORGANISM: de dónde procede la secuencia.
- REFERENCE: los artículos que la describen.
FEATURES
Cada elemento tiene un tipo (gene, CDS, promoter, misc_feature) y una ubicación, seguidos de calificadores como /gene="TP53", /product= o /translation=, que contiene la secuencia de proteína de un CDS.
100..500: bases 100 a 500 de la hebra superior.complement(100..500): las mismas bases, leídas en la hebra opuesta.join(100..200,300..450): fragmentos unidos, como los exones de un gen.<1..300o200..>900: el elemento continúa más allá del final de la secuencia.
ORIGIN
La secuencia en sí, en bloques de diez en minúscula con la posición al principio de cada línea, terminada con //.
Cómo trabajar con él
El conversor GenBank a FASTA quita los números y espacios y deja la secuencia limpia que esperan la mayoría de herramientas. Para ver los elementos dibujados como un mapa, abre el archivo en el Visor de mapas de plásmidos. Un elemento en la hebra complementaria se lee de 5' a 3' como la complementaria inversa de su rango.