Los formatos
- FASTA es una línea de título que empieza por >, seguida de la secuencia. Casi todos los programas lo leen.
- GenBank, los registros del NCBI, tienen una cabecera, una tabla FEATURES que describe los genes y otras partes, y la secuencia después de ORIGIN, con // al final.
- EMBL, los registros del ENA, contienen la misma información con un código de dos letras al principio de cada línea y la secuencia después de SQ.
Convertir la secuencia completa
- Abre GenBank a FASTA, o EMBL a FASTA para archivos EMBL.
- Pega el registro, o varios seguidos.
- Copia o descarga el FASTA. El número de acceso y la descripción pasan a ser la línea de título.
Sacar un solo gen
Un registro de un genoma puede tener miles de features. El Extractor de features GenBank escribe el ADN de cada CDS, gen, ARNr u otro tipo de feature que elijas como entrada FASTA propia. Sigue join() en los genes divididos en exones y complement() en los genes de la otra hebra, así que la secuencia sale en el orden y la orientación correctos.
Obtener la proteína
En las secuencias codificantes, la proteína suele estar ya escrita en el registro, en el calificador /translation. El Extractor de traducciones GenBank lista esas proteínas en FASTA sin volver a traducir nada.