Skip to content

Latest commit

 

History

1 Commit

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Who Speaks When ? | Jeu de données pour la diarisation de locuteurs et la transcription de la parole

Ce dépôt fournit un jeu de données de référence destiné au benchmark des systèmes de reconnaissance automatique de la parole (ASR) et de diarisation de locuteurs.

Le jeu de données contient des transcriptions de parole ainsi que des annotations de diarisation, certaines produites automatiquement puis validées ou corrigées manuellement. Les enregistrements proviennent de plusieurs sources audio francophones et couvrent différents types de parole afin d'évaluer les modèles dans des conditions réalistes.

Certaines transcriptions originales ne peuvent pas être redistribués en raison de restrictions liées au droit d'auteur, aux licences ou aux conditions de diffusion.

Lorsque la redistribution n'est pas autorisée, seules les annotations sont fournies. Les instructions permettant d'obtenir les fichiers audio originaux sont indiquées dans le README du sous-ensemble.


Présentation

Ce jeu de données fournit :

  • des transcriptions de référence
  • des annotations de diarisation de référence
  • plusieurs sources audio et styles de parole
  • des conversations naturelles ainsi que des scénarios synthétiques

Structure du dépôt

Le dataset regroupe des enregistrements issus de plusieurs sources. Chaque sous-ensemble possède son propre fichier README.md, qui décrit :

  • son origine
  • ses caractéristiques
  • les éventuelles restrictions de diffusion
  • la procédure permettant de reconstruire le sous-ensemble lorsque les fichiers audio ne peuvent pas être redistribués

Format des annotations

Chaque enregistrement est associé à deux fichiers de référence :

  • un fichier de transcription contenant le texte de la parole
  • un fichier de diarisation contenant les changements de locuteurs

Procédure d'annotation

Selon le sous-ensemble, les annotations peuvent provenir :

  • directement du corpus d'origine
  • d'une transformation des annotations existantes
  • d'une génération automatique suivie d'une validation manuelle

La méthode exacte dépend du sous-ensemble concerné et est décrite dans son fichier README.md.

Fichiers de transcription

Les transcriptions de référence sont stockées sous forme de fichiers texte :

Bonjour à tous et bienvenue dans cette émission.

Fichiers de diarisation

Les annotations de diarisation sont stockées au format JSON :

[
  {
    "speaker": "speaker_0",
    "start": 0.00,
    "end": 3.52
  },
  {
    "speaker": "speaker_1",
    "start": 3.52,
    "end": 8.10
  }
]

Les temps sont exprimés en secondes.


Obtenir les fichiers audio manquants

Les enregistrements audio ne peuvent pas être mis dans le dépot, pour certains sous-ensemble il y a juste un script python a éxécuter pour les telecharger tandis que pour d'autres il y a plus d'étapes.

Les utilisateurs devront télécharger les enregistrements correspondants auprès de leur fournisseur d'origine afin de reproduire les expériences.

Les instructions détaillées sont disponibles dans le fichier README.md de chaque sous-ensemble.


Prérequis

Les scripts fournis dans ce dépôt ont été testés avec :

  • Python 3.12.3
  • pip

Pour chaque sous-ensemble, vous pouvez installer les dépendances python avec la commande :

pip install -r requirements.txt

Utilisation prévue

Ce jeu de données est destiné à :

  • l'évaluation de systèmes de reconnaissance automatique de la parole (ASR)
  • l'évaluation de systèmes de diarisation de locuteurs
  • l'évaluation de chaînes complètes de traitement de la parole
  • la recherche académique reproductible

Licence

Les annotations distribuées dans ce dépôt sont publiées sous la licence indiquée dans le fichier LICENSE.

Les enregistrements audio originaux restent soumis aux licences et conditions d'utilisation de leurs fournisseurs respectifs.

About

Jeu de données de référence destiné au benchmark des systèmes de reconnaissance automatique de la parole (ASR) et de diarisation de locuteurs en langue française

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Contributors

Languages