Toolyard

Eine GenBank-Datei lesen

Der Kopf

  • LOCUS: der Name, die Länge in Basenpaaren, der Molekültyp (DNA, mRNA), linear oder zirkulär, und ein Datum.
  • DEFINITION: eine einzeilige Beschreibung.
  • ACCESSION und VERSION: die ID des Eintrags, etwa NM_000546.6. Die Zahl nach dem Punkt ändert sich, wenn sich die Sequenz ändert.
  • SOURCE und ORGANISM: woher die Sequenz stammt.
  • REFERENCE: die Veröffentlichungen, die sie beschreiben.

FEATURES

Jedes Feature hat einen Typ (gene, CDS, promoter, misc_feature) und eine Position, gefolgt von Qualifiern wie /gene="TP53", /product= oder /translation=, das die Proteinsequenz einer CDS enthält.

  • 100..500: Basen 100 bis 500 auf dem oberen Strang.
  • complement(100..500): dieselben Basen, auf dem Gegenstrang gelesen.
  • join(100..200,300..450): zusammengesetzte Stücke, etwa die Exons eines Gens.
  • <1..300 oder 200..>900: das Feature reicht über das Ende der Sequenz hinaus.

ORIGIN

Die Sequenz selbst, in Zehnerblöcken in Kleinbuchstaben mit der Position am Zeilenanfang, abgeschlossen mit //.

Damit arbeiten

Der Umwandler GenBank in FASTA entfernt Zahlen und Leerzeichen und liefert die reine Sequenz, die die meisten Tools erwarten. Um die Features als Karte zu sehen, öffne die Datei im Plasmidkarten-Viewer. Ein Feature auf dem Gegenstrang liest sich von 5' nach 3' als reverses Komplement seines Bereichs.

Tools in dieser Anleitung

Weitere Anleitungen