WSL (Ubuntu-20.04)
-
wsl --install -d Ubuntu-20.04
- libgomp1
-
sudo apt-get update sudo apt-get upgrade sudo apt-get install libgomp1
-
- Java
-
sudo apt-get update sudo apt-get install default-jre
-
- Anaconda 3
-
wget https://repo.anaconda.com/archive/Anaconda3-2023.03-1-Linux-x86_64.sh bash Anaconda3-2023.03-1-Linux-x86_64.sh
-
- biopython (Python package)
-
pip install biopython
-
- augustus-3.3.3
-
wget https://github.com/Gaius-Augustus/Augustus/releases/download/v3.3.3/augustus-3.3.3.tar.gz tar -xzvf augustus-3.3.3.tar.gz
-
- ncbi-blast-2.14.0+
-
a. Download ncbi-blast-2.14.0+
wget ftp://ftp.ncbi.nlm.nih.gov/blast/executables/blast+/2.14.0/ncbi-blast-2.14.0+-x64-linux.tar.gz tar -xzvf ncbi-blast-2.14.0+-x64-linux.tar.gz rm ncbi-blast-2.14.0+-x64-linux.tar.gz
b. Add blast database directory to path (also include in .bash_profile)
export BLASTDB=$HOME/Atlantic_Salmon_Proteogenomics_Project/data/reference/Actinopterygii/Actinopterygii_refseq/blast_dbc. Download RefSeq fasta ftp://ftp.ncbi.nlm.nih.gov/refseq/release/vertebrate_other/*.protein.faa.gz
d. Prepare blast database
python -u ./src/Prep_blastdb_Actinopterygii_RefSeq.py --input [vertebrate_other] --ouput ./data/reference/Actinopterygii/Actinopterygii_refseq --taxon_list ./data/reference/Actinopterygii/ancestor7898_proteomes.tsv --makeblastdb ./src/ncbi-blast-2.14.0+/bin/makeblastdb
-
1. Download "Atlantic_Salmon_Proteogenomics_Project/data" directory
Atlantic_Salmon_Proteogenomics_Project.tar.gz
Note To enable local Blastx and BlastP runs, this pipeline will use a smaller database representing RefSeq sequences from 106 taxon ids with Actinopterygii (7898) as the ancestor.
-
[Option 1] ProteoSAFe (beta) workflow
-
a. Salmon Proteogenomics Project | SpliceDB Creation
b. Download SpliceDB Fasta file (Example: heart)
[Option 2] Local script
-
a. Setup conda environment for python 2.7
conda create --name py2 python=2.7b. Construct SpliceDB
conda activate py2 python -u ./src/SpliceDBcreation/buildSpliceGraph_addSAMonly.py --RAMmemory 10 --dataset 2019_tissues_n23 --min_reads_per_coordinate 3 --dna_fasta_dir ./data/reference/RefSeq/GCF_000233375.1_ICSASG_v2_genomic.fna conda deactivate
-
-
c. Placement of "CUSTOM_COMPREHENSIVE_DB_SEARCH-xxxxxxxx-all_events-main.tsv" file
-
Output:
./data/[dataset]/1_RefSeq_SpliceDB_Search/workflow_output/[subdir]/[downloaded_events_file]- [dataset] = 2019_tissues_n23
- [subdir] = heart
- [downloaded_events_file] = CUSTOM_COMPREHENSIVE_DB_SEARCH-xxxxxxxx-all_events-main.tsv
- [dataset] = 2019_tissues_n23
-
-
a. Parse proteogenomic events & construct RefSeq+Ensembl database
-
python -u ./src/Combine_enosi_files.py --dataset 2019_tissues_n23Output:
./data/[dataset]/1_RefSeq_SpliceDB_Search/combined_Enosi_Output/GCF_000233375.1_ICSASG_v2_protein+Ensembl.fasta- [dataset] = 2019_tissues_n23
- [dataset] = 2019_tissues_n23
d. Placement of "ExactMatch_output" & "MSGF_combinedtsv" directories
-
Output:
./data/[dataset]/2_RefSeq_Ensembl_Search/workflow_output/ExactMatch_output
./data/[dataset]/2_RefSeq_Ensembl_Search/workflow_output/MSGF_combinedtsv- [dataset] = 2019_tissues_n23
e. Compute FDR and generate "MSGF_fdrdir" directory
-
conda activate py2 python -u ./src/Run_compute_FDR_customDB.py --dataset 2019_tissues_n23 --wo_output 2_RefSeq_Ensembl_Search conda deactivate
-
-
a. Run Blastx
-
python -u ./src/Run_blastx.py --dataset 2019_tissues_n23 --blastx ./src/ncbi-blast-2.14.0+/bin/blastx
b. Collect hints and run Augustus
-
python -u ./src/Run_Augustus.py --dataset 2019_tissues_n23 --augustus ./src/augustus-3.3.3/bin/augustus
-
-
a. Parse Augustus output and run BlastP
-
python -u ./src/Parse_Augustus_and_run_blastp.py --dataset 2019_tissues_n23 --blastp ./src/ncbi-blast-2.14.0+/bin/blastp
b. Parse BlastP output
-
python -u ./src/Parse_blastp_XML_output.py --dataset 2019_tissues_n23 --email email@email.com
c. Write evidence tables
-
python -u ./src/Write_evidence_tables.py --dataset 2019_tissues_n23
-
-
Note Requires manual inspection of Augustus predictions and construction of RefSeq+Ensembl+Augustus database.
c. Placement of "ExactMatch_output" & "MSGF_combinedtsv" directories
-
Output:
./data/[dataset]/5_RefSeq_Ensembl_Augustus_Search/workflow_output/ExactMatch_output
./data/[dataset]/5_RefSeq_Ensembl_Augustus_Search/workflow_output/MSGF_combinedtsv- [dataset] = 2019_tissues_n23
d. Compute FDR
-
conda activate py2 python -u ./src/Run_compute_FDR_customDB.py --dataset 2019_tissues_n23 --wo_output 5_RefSeq_Ensembl_Augustus_Search conda deactivate
e. Create normalized PSK expression matrix
-
python -u ./src/Create_PSK_matrix.py --dataset 2019_tissues_n23
-