Les formats
- FASTA : une ligne de titre qui commence par >, suivie de la séquence. Presque tous les logiciels le lisent.
- GenBank : les entrées du NCBI ont un en-tête, une table FEATURES qui décrit les gènes et les autres éléments, et la séquence après ORIGIN, avec // à la fin.
- EMBL : les entrées de l’ENA contiennent les mêmes informations, avec un code de deux lettres au début de chaque ligne et la séquence après SQ.
Convertir toute la séquence
- Ouvrez GenBank en FASTA, ou EMBL en FASTA pour les fichiers EMBL.
- Collez l’entrée, ou plusieurs à la suite.
- Copiez ou téléchargez le FASTA. Le numéro d’accession et la description deviennent la ligne de titre.
Extraire un seul gène
Une entrée de génome peut contenir des milliers de features. L’Extracteur de features GenBank écrit l’ADN de chaque CDS, gène, ARNr ou autre type de feature choisi comme entrée FASTA séparée. Il suit join() pour les gènes découpés en exons et complement() pour les gènes du brin opposé, si bien que la séquence sort dans le bon ordre et la bonne orientation.
Obtenir la protéine
Pour les séquences codantes, la protéine figure en général déjà dans l’entrée, dans le qualificateur /translation. L’Extracteur de traductions GenBank liste ces protéines en FASTA sans rien retraduire.