Der Kopf
- LOCUS: der Name, die Länge in Basenpaaren, der Molekültyp (DNA, mRNA), linear oder zirkulär, und ein Datum.
- DEFINITION: eine einzeilige Beschreibung.
- ACCESSION und VERSION: die ID des Eintrags, etwa NM_000546.6. Die Zahl nach dem Punkt ändert sich, wenn sich die Sequenz ändert.
- SOURCE und ORGANISM: woher die Sequenz stammt.
- REFERENCE: die Veröffentlichungen, die sie beschreiben.
FEATURES
Jedes Feature hat einen Typ (gene, CDS, promoter, misc_feature) und eine Position, gefolgt von Qualifiern wie /gene="TP53", /product= oder /translation=, das die Proteinsequenz einer CDS enthält.
100..500: Basen 100 bis 500 auf dem oberen Strang.complement(100..500): dieselben Basen, auf dem Gegenstrang gelesen.join(100..200,300..450): zusammengesetzte Stücke, etwa die Exons eines Gens.<1..300oder200..>900: das Feature reicht über das Ende der Sequenz hinaus.
ORIGIN
Die Sequenz selbst, in Zehnerblöcken in Kleinbuchstaben mit der Position am Zeilenanfang, abgeschlossen mit //.
Damit arbeiten
Der Umwandler GenBank in FASTA entfernt Zahlen und Leerzeichen und liefert die reine Sequenz, die die meisten Tools erwarten. Um die Features als Karte zu sehen, öffne die Datei im Plasmidkarten-Viewer. Ein Feature auf dem Gegenstrang liest sich von 5' nach 3' als reverses Komplement seines Bereichs.