diff --git a/nextclade/config/config_dict.yaml b/nextclade/config/config_dict.yaml index 167a77a1..8a39a1eb 100644 --- a/nextclade/config/config_dict.yaml +++ b/nextclade/config/config_dict.yaml @@ -88,6 +88,12 @@ builds: hardmin_date: 2004 reference_EPI_ISL: EPI1857215 reference_strain: A/Darwin/6/2021 + CY114383: + filter: "--min-date 2009 --probabilistic-sampling --group-by year region --min-length 1400 --subsample-max-sequences 1500" + clade_offset: 0 + hardmin_date: 2004 + reference_EPI_ISL: EPI115646 + reference_strain: A/Wisconsin/67/2005 vic: ha: changelog: "seasonal_B-Vic_HA/main/CHANGELOG.md" diff --git a/nextclade/dataset_config/h3n2/na/CY114383/README.md b/nextclade/dataset_config/h3n2/na/CY114383/README.md new file mode 100644 index 00000000..dfc52ab0 --- /dev/null +++ b/nextclade/dataset_config/h3n2/na/CY114383/README.md @@ -0,0 +1,35 @@ +# Influenza A(H3N2) NA based on reference "A/Wisconsin/67/2005" + +| Key | Value | +| -------------------- | -------------------- | +| authors | [Richard Neher](https://neherlab.org), [Nextstrain](https://nextstrain.org) | +| name | Influenza A H3N2 NA | +| reference | A/Wisconsin/67/2005 | +| dataset path | flu/h3n2/na/CY114383 | +| reference accession | EPI115646 | +| clade definitions | [github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/](https://github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/) | + + + +## Features +This dataset supports + + * Assignment to clades and subclades based on the nomenclature defined in [github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/](https://github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/) + * Identification of glycosilation motifs + * Counting of mutations in the RBD + * Sequence QC + * Phylogenetic placement + +## Clades of seasonal influenza viruses + +The WHO Collaborating centers **do not** define "clades" for the neuraminidase segment. + +This dataset focuses on "subclades" that in analogy to the HA segment are defined to break down diversity at high resolution and allow following the spread of different viral groups. +These follow a Pango-like nomenclature consisting of a letter followed by a numbers separated by periods as in `C.1.2`. +The leading letter is an alias of a previous name. +Details of the nomenclature system can be found at [github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/](https://github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/). + + +## What is Nextclade dataset + +Read more about Nextclade datasets in Nextclade documentation: https://docs.nextstrain.org/projects/nextclade/en/stable/user/datasets.html diff --git a/nextclade/dataset_config/h3n2/na/CY114383/annotation.gff b/nextclade/dataset_config/h3n2/na/CY114383/annotation.gff new file mode 100644 index 00000000..aed63bf3 --- /dev/null +++ b/nextclade/dataset_config/h3n2/na/CY114383/annotation.gff @@ -0,0 +1,3 @@ +##gff-version 3 +##sequence-region CY114383 1 1436 +CY114383 feature gene 4 1413 . + . gene_name="NA" diff --git a/nextclade/dataset_config/h3n2/na/CY114383/pathogen.json b/nextclade/dataset_config/h3n2/na/CY114383/pathogen.json new file mode 100644 index 00000000..aaeabc49 --- /dev/null +++ b/nextclade/dataset_config/h3n2/na/CY114383/pathogen.json @@ -0,0 +1,26 @@ +{ + "nucMutLabelMap": {}, + "nucMutLabelMapReverse": {}, + "shortcuts": [ + "flu_h3n2_na_broad", + "nextstrain/flu/h3n2/na", + "nextstrain/flu/h3n2/na/wisconsin-67-2005" + ], + "aaMotifs": [ + { + "name": "glycosylation", + "nameShort": "Glyc.", + "nameFriendly": "Glycosylation", + "description": "N-linked glycosylation motifs (N-X-S/T with X any amino acid other than P)", + "includeCdses": [ + { + "cds":"NA", + "ranges":[{"begin":29, "end":466}] + } + ], + "motifs": [ + "N[^P][ST]" + ] + } + ] +} \ No newline at end of file diff --git a/nextclade/dataset_config/h3n2/na/CY114383/reference.fasta b/nextclade/dataset_config/h3n2/na/CY114383/reference.fasta new file mode 100644 index 00000000..5dd72368 --- /dev/null +++ b/nextclade/dataset_config/h3n2/na/CY114383/reference.fasta @@ -0,0 +1,22 @@ +>CY114383 +AAGATGAATCCAAATCAAAAGATAATAACGATTGGCTCTGTTTCTCTCACCATTTCCACAATATGCTTCT +TCATGCAAATTGCCATCTTGATAACTACTGTAACATTGCATTTCAAGCAATATGAATTCAACTCCCCCCC +AAACAACCAAGTGATGCTGTGTGAACCAACAATAATAGAAAGAAACATAACAGAGATAGTGTATCTGACC +AACACCACCATAGAGAAGGAAATATGCCCCAAACTAGCAGAATACAGAAATTGGTCAAAGCCGCAATGTA +ACATTACAGGATTTGCACCTTTTTCTAAGGACAATTCGATTAGGCTTTCCGCTGGTGGGGACATCTGGGT +GACAAGAGAACCTTATGTGTCATGCGATCCTGACAAGTGTTATCAATTTGCCCTTGGGCAGGGAACAACA +CTAAACAACGTGCATTCAAATGACACAGTACATGATAGGACCCCTTATCGGACCCTATTGATGAATGAGT +TAGGTGTTCCATTTCATCTGGGGACCAAGCAAGTGTGCATAGCATGGTCCAGCTCAAGTTGTCACGATGG +AAAAGCATGGCTGCATGTTTGTGTAACGGGGGATGATAAAAATGCAACTGCTAGCTTCATTTACAATGGG +AGGCTTGTAGATAGTATTGTTTCATGGTCCAAAGAAATCCTCAGGACCCAGGAGTCAGAATGCGTTTGTA +TCAATGGAACTTGTACAGTAGTAATGACTGATGGGAGTGCTTCAGGAAAAGCTGATACTAAAATACTATT +CATTGAGGAGGGGAAAATCGTTCATACTAGCACATTGTCAGGAAGTGCTCAGCATGTCGAGGAGTGCTCC +TGCTATCCTCGATATCTTGGTGTCAGATGTGTCTGCAGAGACAACTGGAAAGGCTCCAATAGGCCCATAG +TAGATATAAACATAAAGGATTATAGCATTGTTTCCAGTTATGTGTGCTCAGGACTTGTTGGAGACACACC +CAGAAAAAACGACAGCTCCAGCAGTAGCCATTGCTTGGATCCTAACAATGAAGAAGGTGGTCATGGAGTG +AAAGGCTGGGCCTTTGATGATGGAAATGACGTGTGGATGGGAAGAACGATCAGCGAGAAGTTACGCTCAG +GATATGAAACCTTCAAAGTCATTGAAGGCTGGTCCAACCCTAATTCCAAATTGCAGATAAATAGGCAAGT +CATAGTTGACAGAGGTAATAGGTCCGGTTATTCTGGTATTTTCTCTGTTGAAGGCAAAAGCTGCATCAAT +CGGTGCTTTTATGTGGAGTTGATAAGGGGAAGAAAAGAGGAAACTGAAGTCTTGTGGACCTCAAACAGTA +TTGTTGTGTTTTGTGGCACCTCAGGTACATATGGAACAGGCTCATGGCCTGATGGGGCGGACATCAATCT +CATGCCTATATAAGCTTTCGCAATTTTAGAAAAAAC \ No newline at end of file