Who Speaks When ? | Jeu de données pour la diarisation de locuteurs et la transcription de la parole
Ce dépôt fournit un jeu de données de référence destiné au benchmark des systèmes de reconnaissance automatique de la parole (ASR) et de diarisation de locuteurs.
Le jeu de données contient des transcriptions de parole ainsi que des annotations de diarisation, certaines produites automatiquement puis validées ou corrigées manuellement. Les enregistrements proviennent de plusieurs sources audio francophones et couvrent différents types de parole afin d'évaluer les modèles dans des conditions réalistes.
Certaines transcriptions originales ne peuvent pas être redistribués en raison de restrictions liées au droit d'auteur, aux licences ou aux conditions de diffusion.
Lorsque la redistribution n'est pas autorisée, seules les annotations sont fournies. Les instructions permettant d'obtenir les fichiers audio originaux sont indiquées dans le README du sous-ensemble.
Ce jeu de données fournit :
- des transcriptions de référence
- des annotations de diarisation de référence
- plusieurs sources audio et styles de parole
- des conversations naturelles ainsi que des scénarios synthétiques
Le dataset regroupe des enregistrements issus de plusieurs sources. Chaque sous-ensemble possède son propre fichier README.md, qui décrit :
- son origine
- ses caractéristiques
- les éventuelles restrictions de diffusion
- la procédure permettant de reconstruire le sous-ensemble lorsque les fichiers audio ne peuvent pas être redistribués
Chaque enregistrement est associé à deux fichiers de référence :
- un fichier de transcription contenant le texte de la parole
- un fichier de diarisation contenant les changements de locuteurs
Selon le sous-ensemble, les annotations peuvent provenir :
- directement du corpus d'origine
- d'une transformation des annotations existantes
- d'une génération automatique suivie d'une validation manuelle
La méthode exacte dépend du sous-ensemble concerné et est décrite dans son fichier README.md.
Les transcriptions de référence sont stockées sous forme de fichiers texte :
Bonjour à tous et bienvenue dans cette émission.
Les annotations de diarisation sont stockées au format JSON :
[
{
"speaker": "speaker_0",
"start": 0.00,
"end": 3.52
},
{
"speaker": "speaker_1",
"start": 3.52,
"end": 8.10
}
]Les temps sont exprimés en secondes.
Les enregistrements audio ne peuvent pas être mis dans le dépot, pour certains sous-ensemble il y a juste un script python a éxécuter pour les telecharger tandis que pour d'autres il y a plus d'étapes.
Les utilisateurs devront télécharger les enregistrements correspondants auprès de leur fournisseur d'origine afin de reproduire les expériences.
Les instructions détaillées sont disponibles dans le fichier README.md de chaque sous-ensemble.
Les scripts fournis dans ce dépôt ont été testés avec :
- Python 3.12.3
- pip
Pour chaque sous-ensemble, vous pouvez installer les dépendances python avec la commande :
pip install -r requirements.txtCe jeu de données est destiné à :
- l'évaluation de systèmes de reconnaissance automatique de la parole (ASR)
- l'évaluation de systèmes de diarisation de locuteurs
- l'évaluation de chaînes complètes de traitement de la parole
- la recherche académique reproductible
Les annotations distribuées dans ce dépôt sont publiées sous la licence indiquée dans le fichier LICENSE.
Les enregistrements audio originaux restent soumis aux licences et conditions d'utilisation de leurs fournisseurs respectifs.