I chose uniref90 DB from ->
ftp://ftp.ebi.ac.uk/pub/databases/uniprot/uniref/uniref90/
the same can also be found in:
ftp://ftp.uniprot.org/pub/databases/uniprot/uniref/uniref90/
Documentation
it has 14 205 227 sequences updated on 03/04/2013, Fasta file 6.0 GB
Using blast+
see manual
excellent blast to blast+
Make blast DB
CMD="dustmasker -in $fasta -infmt fasta -parse_seqids -outfmt maskinfo_asn1_bin -out $fasta_dust.asnb"
$CMD;
echo "$CMD";
(not strictly necesary: identifies and masks low complexity regions of protein, takes at least 4 hours using 10GB)
CMD2="makeblastdb -in $fasta -dbtype prot -parse_seqids -mask_data $fasta_dust.asnb -out uniref90DB_filtered"
blastx -query $FOLD/$filename -db $DB -out $OUTFOLD/$out -outfmt 7 -evalue 1e-10 -num_threads 4
#required resources 8 CPUs 10GB each for 24 hours
No comments:
Post a Comment