Skip to content
Draft
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
6 changes: 6 additions & 0 deletions nextclade/config/config_dict.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -88,6 +88,12 @@ builds:
hardmin_date: 2004
reference_EPI_ISL: EPI1857215
reference_strain: A/Darwin/6/2021
CY114383:
filter: "--min-date 2009 --probabilistic-sampling --group-by year region --min-length 1400 --subsample-max-sequences 1500"
clade_offset: 0
hardmin_date: 2004
reference_EPI_ISL: EPI115646
reference_strain: A/Wisconsin/67/2005
vic:
ha:
changelog: "seasonal_B-Vic_HA/main/CHANGELOG.md"
Expand Down
35 changes: 35 additions & 0 deletions nextclade/dataset_config/h3n2/na/CY114383/README.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,35 @@
# Influenza A(H3N2) NA based on reference "A/Wisconsin/67/2005"

| Key | Value |
| -------------------- | -------------------- |
| authors | [Richard Neher](https://neherlab.org), [Nextstrain](https://nextstrain.org) |
| name | Influenza A H3N2 NA |
| reference | A/Wisconsin/67/2005 |
| dataset path | flu/h3n2/na/CY114383 |
| reference accession | EPI115646 |
| clade definitions | [github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/](https://github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/) |



## Features
This dataset supports

* Assignment to clades and subclades based on the nomenclature defined in [github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/](https://github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/)
* Identification of glycosilation motifs
* Counting of mutations in the RBD
* Sequence QC
* Phylogenetic placement

## Clades of seasonal influenza viruses

The WHO Collaborating centers **do not** define "clades" for the neuraminidase segment.

This dataset focuses on "subclades" that in analogy to the HA segment are defined to break down diversity at high resolution and allow following the spread of different viral groups.
These follow a Pango-like nomenclature consisting of a letter followed by a numbers separated by periods as in `C.1.2`.
The leading letter is an alias of a previous name.
Details of the nomenclature system can be found at [github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/](https://github.com/influenza-clade-nomenclature/seasonal_A-H3N2_NA/).


## What is Nextclade dataset

Read more about Nextclade datasets in Nextclade documentation: https://docs.nextstrain.org/projects/nextclade/en/stable/user/datasets.html
3 changes: 3 additions & 0 deletions nextclade/dataset_config/h3n2/na/CY114383/annotation.gff
Original file line number Diff line number Diff line change
@@ -0,0 +1,3 @@
##gff-version 3
##sequence-region CY114383 1 1436
CY114383 feature gene 4 1413 . + . gene_name="NA"
26 changes: 26 additions & 0 deletions nextclade/dataset_config/h3n2/na/CY114383/pathogen.json
Original file line number Diff line number Diff line change
@@ -0,0 +1,26 @@
{
"nucMutLabelMap": {},
"nucMutLabelMapReverse": {},
"shortcuts": [
"flu_h3n2_na_broad",
"nextstrain/flu/h3n2/na",
"nextstrain/flu/h3n2/na/wisconsin-67-2005"
],
"aaMotifs": [
{
"name": "glycosylation",
"nameShort": "Glyc.",
"nameFriendly": "Glycosylation",
"description": "N-linked glycosylation motifs (N-X-S/T with X any amino acid other than P)",
"includeCdses": [
{
"cds":"NA",
"ranges":[{"begin":29, "end":466}]
}
],
"motifs": [
"N[^P][ST]"
]
}
]
}
22 changes: 22 additions & 0 deletions nextclade/dataset_config/h3n2/na/CY114383/reference.fasta
Original file line number Diff line number Diff line change
@@ -0,0 +1,22 @@
>CY114383
AAGATGAATCCAAATCAAAAGATAATAACGATTGGCTCTGTTTCTCTCACCATTTCCACAATATGCTTCT
TCATGCAAATTGCCATCTTGATAACTACTGTAACATTGCATTTCAAGCAATATGAATTCAACTCCCCCCC
AAACAACCAAGTGATGCTGTGTGAACCAACAATAATAGAAAGAAACATAACAGAGATAGTGTATCTGACC
AACACCACCATAGAGAAGGAAATATGCCCCAAACTAGCAGAATACAGAAATTGGTCAAAGCCGCAATGTA
ACATTACAGGATTTGCACCTTTTTCTAAGGACAATTCGATTAGGCTTTCCGCTGGTGGGGACATCTGGGT
GACAAGAGAACCTTATGTGTCATGCGATCCTGACAAGTGTTATCAATTTGCCCTTGGGCAGGGAACAACA
CTAAACAACGTGCATTCAAATGACACAGTACATGATAGGACCCCTTATCGGACCCTATTGATGAATGAGT
TAGGTGTTCCATTTCATCTGGGGACCAAGCAAGTGTGCATAGCATGGTCCAGCTCAAGTTGTCACGATGG
AAAAGCATGGCTGCATGTTTGTGTAACGGGGGATGATAAAAATGCAACTGCTAGCTTCATTTACAATGGG
AGGCTTGTAGATAGTATTGTTTCATGGTCCAAAGAAATCCTCAGGACCCAGGAGTCAGAATGCGTTTGTA
TCAATGGAACTTGTACAGTAGTAATGACTGATGGGAGTGCTTCAGGAAAAGCTGATACTAAAATACTATT
CATTGAGGAGGGGAAAATCGTTCATACTAGCACATTGTCAGGAAGTGCTCAGCATGTCGAGGAGTGCTCC
TGCTATCCTCGATATCTTGGTGTCAGATGTGTCTGCAGAGACAACTGGAAAGGCTCCAATAGGCCCATAG
TAGATATAAACATAAAGGATTATAGCATTGTTTCCAGTTATGTGTGCTCAGGACTTGTTGGAGACACACC
CAGAAAAAACGACAGCTCCAGCAGTAGCCATTGCTTGGATCCTAACAATGAAGAAGGTGGTCATGGAGTG
AAAGGCTGGGCCTTTGATGATGGAAATGACGTGTGGATGGGAAGAACGATCAGCGAGAAGTTACGCTCAG
GATATGAAACCTTCAAAGTCATTGAAGGCTGGTCCAACCCTAATTCCAAATTGCAGATAAATAGGCAAGT
CATAGTTGACAGAGGTAATAGGTCCGGTTATTCTGGTATTTTCTCTGTTGAAGGCAAAAGCTGCATCAAT
CGGTGCTTTTATGTGGAGTTGATAAGGGGAAGAAAAGAGGAAACTGAAGTCTTGTGGACCTCAAACAGTA
TTGTTGTGTTTTGTGGCACCTCAGGTACATATGGAACAGGCTCATGGCCTGATGGGGCGGACATCAATCT
CATGCCTATATAAGCTTTCGCAATTTTAGAAAAAAC