L'en-tête
- LOCUS : le nom, la longueur en paires de bases, le type de molécule (DNA, mRNA), linéaire ou circulaire, et une date.
- DEFINITION : une description d'une ligne.
- ACCESSION et VERSION : l'identifiant de l'entrée, comme NM_000546.6. Le chiffre après le point change quand la séquence change.
- SOURCE et ORGANISM : l'origine de la séquence.
- REFERENCE : les articles qui la décrivent.
FEATURES
Chaque élément a un type (gene, CDS, promoter, misc_feature) et une position, suivis de qualificatifs comme /gene="TP53", /product= ou /translation=, qui contient la séquence protéique d'une CDS.
100..500: bases 100 à 500 du brin supérieur.complement(100..500): les mêmes bases, lues sur le brin opposé.join(100..200,300..450): des morceaux assemblés, comme les exons d'un gène.<1..300ou200..>900: l'élément continue au-delà de la fin de la séquence.
ORIGIN
La séquence elle-même, en blocs de dix en minuscules avec la position en début de ligne, terminée par //.
Travailler avec
Le convertisseur GenBank en FASTA retire les chiffres et les espaces et donne la séquence brute qu'attendent la plupart des outils. Pour voir les éléments dessinés sur une carte, ouvrez le fichier dans le Visualiseur de cartes de plasmides. Un élément sur le brin complémentaire se lit de 5' vers 3' comme le complément inverse de sa plage.