Skip to content

miinslin/SalmonProteogenomics

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

6 Commits
 
 
 
 
 
 
 
 

Repository files navigation

Salmon Proteogenomics Project


Software Requirements

WSL (Ubuntu-20.04)

wsl --install -d Ubuntu-20.04
  • libgomp1
sudo apt-get update
sudo apt-get upgrade
sudo apt-get install libgomp1
  • Java
sudo apt-get update
sudo apt-get install default-jre
  • Anaconda 3
wget https://repo.anaconda.com/archive/Anaconda3-2023.03-1-Linux-x86_64.sh
bash Anaconda3-2023.03-1-Linux-x86_64.sh
  • biopython (Python package)
pip install biopython
  • augustus-3.3.3
wget https://github.com/Gaius-Augustus/Augustus/releases/download/v3.3.3/augustus-3.3.3.tar.gz
tar -xzvf augustus-3.3.3.tar.gz
  • ncbi-blast-2.14.0+

a. Download ncbi-blast-2.14.0+

wget ftp://ftp.ncbi.nlm.nih.gov/blast/executables/blast+/2.14.0/ncbi-blast-2.14.0+-x64-linux.tar.gz
tar -xzvf ncbi-blast-2.14.0+-x64-linux.tar.gz
rm ncbi-blast-2.14.0+-x64-linux.tar.gz

b. Add blast database directory to path (also include in .bash_profile)

export BLASTDB=$HOME/Atlantic_Salmon_Proteogenomics_Project/data/reference/Actinopterygii/Actinopterygii_refseq/blast_db

c. Download RefSeq fasta ftp://ftp.ncbi.nlm.nih.gov/refseq/release/vertebrate_other/*.protein.faa.gz

d. Prepare blast database

python -u ./src/Prep_blastdb_Actinopterygii_RefSeq.py --input [vertebrate_other] --ouput ./data/reference/Actinopterygii/Actinopterygii_refseq --taxon_list ./data/reference/Actinopterygii/ancestor7898_proteomes.tsv --makeblastdb ./src/ncbi-blast-2.14.0+/bin/makeblastdb

Files

1. Download "Atlantic_Salmon_Proteogenomics_Project/data" directory Atlantic_Salmon_Proteogenomics_Project.tar.gz

Pipeline

Note To enable local Blastx and BlastP runs, this pipeline will use a smaller database representing RefSeq sequences from 106 taxon ids with Actinopterygii (7898) as the ancestor.

1. SpliceDB construction

[Option 1] ProteoSAFe (beta) workflow

a. Salmon Proteogenomics Project | SpliceDB Creation image b. Download SpliceDB Fasta file (Example: heart)
image

[Option 2] Local script

a. Setup conda environment for python 2.7

conda create --name py2 python=2.7

b. Construct SpliceDB

conda activate py2
python -u ./src/SpliceDBcreation/buildSpliceGraph_addSAMonly.py --RAMmemory 10 --dataset 2019_tissues_n23 --min_reads_per_coordinate 3 --dna_fasta_dir ./data/reference/RefSeq/GCF_000233375.1_ICSASG_v2_genomic.fna
conda deactivate

2. MSGF+ (Known->SpliceDB)

a. Salmon Proteogenomics Project | Comprehensive Database Search (known, splice) workflow

image

b. Download output (Example: heart)

image

c. Placement of "CUSTOM_COMPREHENSIVE_DB_SEARCH-xxxxxxxx-all_events-main.tsv" file

Output:
./data/[dataset]/1_RefSeq_SpliceDB_Search/workflow_output/[subdir]/[downloaded_events_file]

  • [dataset] = 2019_tissues_n23
  • [subdir] = heart
  • [downloaded_events_file] = CUSTOM_COMPREHENSIVE_DB_SEARCH-xxxxxxxx-all_events-main.tsv

3. Construct RefSeq+Ensembl database and run MSGF+

a. Parse proteogenomic events & construct RefSeq+Ensembl database

python -u ./src/Combine_enosi_files.py --dataset 2019_tissues_n23

Output:
./data/[dataset]/1_RefSeq_SpliceDB_Search/combined_Enosi_Output/GCF_000233375.1_ICSASG_v2_protein+Ensembl.fasta

  • [dataset] = 2019_tissues_n23

b. Salmon Proteogenomics Project | MSGFPlus_PeptideMatchCMD workflow

image

c. Download output (Example: 2019_tissues_n23 dataset)

image

d. Placement of "ExactMatch_output" & "MSGF_combinedtsv" directories

Output:
./data/[dataset]/2_RefSeq_Ensembl_Search/workflow_output/ExactMatch_output
./data/[dataset]/2_RefSeq_Ensembl_Search/workflow_output/MSGF_combinedtsv

  • [dataset] = 2019_tissues_n23

e. Compute FDR and generate "MSGF_fdrdir" directory

conda activate py2
python -u ./src/Run_compute_FDR_customDB.py --dataset 2019_tissues_n23 --wo_output 2_RefSeq_Ensembl_Search
conda deactivate

4. Gene prediction

a. Run Blastx

python -u ./src/Run_blastx.py --dataset 2019_tissues_n23 --blastx ./src/ncbi-blast-2.14.0+/bin/blastx

b. Collect hints and run Augustus

python -u ./src/Run_Augustus.py --dataset 2019_tissues_n23 --augustus ./src/augustus-3.3.3/bin/augustus

5. Parse Augustus output

a. Parse Augustus output and run BlastP

python -u ./src/Parse_Augustus_and_run_blastp.py --dataset 2019_tissues_n23 --blastp ./src/ncbi-blast-2.14.0+/bin/blastp

b. Parse BlastP output

python -u ./src/Parse_blastp_XML_output.py --dataset 2019_tissues_n23 --email email@email.com

c. Write evidence tables

python -u ./src/Write_evidence_tables.py --dataset 2019_tissues_n23

6. Run MSGF+ against RefSeq+Ensembl+Augustus database

Note Requires manual inspection of Augustus predictions and construction of RefSeq+Ensembl+Augustus database.

a. Salmon Proteogenomics Project | MSGFPlus_PeptideMatchCMD workflow

image

b. Download output (Example: 2019_tissues_n23 dataset)

image

c. Placement of "ExactMatch_output" & "MSGF_combinedtsv" directories

Output:
./data/[dataset]/5_RefSeq_Ensembl_Augustus_Search/workflow_output/ExactMatch_output
./data/[dataset]/5_RefSeq_Ensembl_Augustus_Search/workflow_output/MSGF_combinedtsv

  • [dataset] = 2019_tissues_n23

d. Compute FDR

conda activate py2
python -u ./src/Run_compute_FDR_customDB.py --dataset 2019_tissues_n23 --wo_output 5_RefSeq_Ensembl_Augustus_Search
conda deactivate

e. Create normalized PSK expression matrix

python -u ./src/Create_PSK_matrix.py --dataset 2019_tissues_n23

About

No description, website, or topics provided.

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages