Die Bremen Big Data Challenge (BBDC) 2026 konzentriert sich auf die Erkennung von altersbedingten Krankheiten basierend auf mehreren physiologischen Signalen in Alltagssituationen. Die physiologischen Daten wurden aufgenommen, während Studienteilnehmer:innen in einer virtuellen Realität mit simulierten Erkrankungen Alltagsaufgaben bewältigten.
Teilnehmer:innen des Wettbewerbs erhalten Daten für "gesunde" Personen sowie Daten für 6 Erkrankungen in verschiedenen Schweregraden. Die Daten umfassen Elektrodermale Aktivität (EDA), sowie Elektroenzephalographie (EEG) und Elektrokardiogramm (EKG) Daten. Die EDA Daten erfassen Änderungen in der Leitfähigkeit der Haut, die EEG Daten messen Gehirnaktivität und die EKG Daten zeichnen die elektrische Aktivität des Herzens auf. Zusammen ergeben diese Signale einen Einblick in diverse physiologische Zustände des menschlichen Körpers. Die Aufgabe der BBDC 2026 besteht darin, solche Zustände zu erkennen.
Für den Student Track werden zusätzlich bereits extrahierte Merkmale als Ausgangspunkt bereitgestellt. Alle Teilnehmer:innen werden jedoch dazu ermutigt, zusätzliche Merkmale zu generieren oder die physiologischen Daten in ihrer Ursprungsform zu verarbeiten. Grund hierfür ist, dass die zur Verfügung gestellten Merkmale nicht zwangsweise informationshaltig genug sind, um die Challenge optimal lösen zu können.
Des Weiteren werden den Teilnehmer:innen des Student Tracks die Schweregrade der Krankheiten für die Trainingsdaten bereitgestellt. Diese sind jedoch weder für die Testdaten gegeben, noch wird von den Student Track Teilnehmer:innen erwartet sie zu bestimmen. Sie dienen lediglich als zusätzliche Information zur Analyse der Daten. Die Schweregrade der Erkrankungen reichen von 0 (keine Erkrankung) bis hin zu 4 (schwere Erkrankung).
Teilnehmer:innen der BBDC 2026 sind verpflichtet den Datenlizenzvertrag zu lesen und einzuhalten (siehe Data_Licence_Agreement.txt).
Es gibt einen Ordner für das Training (train) und einen für das Testen (test).
In dem Ordner für das Training befinden sich sieben Unterordner. Sechs davon sind für die verschiedenen Erkrankungen und der siebte ist für "gesunde" Personen. Jeder dieser Unterordner enthält vier Dateien:
data.csvfeatures.csvlabels.csvstages.csv
Von jeder dieser Dateien gibt es somit eine pro vorherzusagende Klasse. Wir stellen des Weiteren Beispielcode bereit, welcher die Daten für alle Klassen in einer Tabelle kombiniert (siehe combine_files.py).
Im Folgenden wird der Aufbau der verschiedenen Dateien beschrieben.
data.csv: Enthält alle rohen EEG, EKG und EDA Trainingsdaten der jeweiligen Klasse. Alle Signale haben die gleiche Frequenz von 250 Hz und sind in 10-sekunden lange Segmente aufgeteilt. Jedes dieser Segmente besitzt eine eindeutige Identifikationsnummer.
| Spalte | Beschreibung |
|---|---|
| ID | Eindeutige ID des Segments. |
| EEG_CZ, EEG_FP2, EEG_F3, EEG_FZ, EEG_F4, EEG_T7, EEG_C3, EEG_FP1, EEG_C4, EEG_T8, EEG_P3, EEG_PZ, EEG_P4, EEG_PO7, EEG_PO8, EEG_OZ | Die 16 EEG Kanäle. Die Benennung und Positionierung entspricht dem internationalen 10-20 System. |
| ECG | Die EKG Daten. |
| EDA | Die EDA Daten. |
-
features.csv: Einige bereits extrahierte Merkmale. Diese können als Ausgangspunkt für die Modellentwicklung dienen. Jede Zeile repräsentiert die Merkmale für ein Segment. Für die EEG Daten stellen wir verschiedene Frequenzbänder bereit (delta, theta, alpha, beta, und gamma). Für die EKG und EDA Daten berechnen wir die Mittelwerte (mean) und die Streuungen (std), die minimalen (min) und maximalen (max) Ausprägungen inklusive Spannweiten (ptp), die effektiven Signalenergien (rms) sowie die maximalen zeitlichen Änderungsraten (max_slope) der jeweiligen Signale. -
labels.csv: Diese Datei zeigt, welche Erkrankung bei dem jeweiligen Segment vorliegt. Diese Werte sind das Zielfeld für das Training des Modells:
| Spalte | Beschreibung |
|---|---|
| ID | Eindeutige ID des Segments. |
| impairment_type | Eine Zahl im Intervall [0, 6], wobei 0 den "gesunden" Fall darstellt und 1-6 die Erkrankung angeben. |
stages.csv: Die Schweregrade der Krankheiten für die Trainingsdaten der jeweiligen Klasse. Sie dienen als zusätzliche Information zur Analyse der Daten.
| Spalte | Beschreibung |
|---|---|
| ID | Eindeutige ID des Segments. |
| impairment_stage | Eine Zahl im Intervall [0, 4], wobei 0 den "gesunden" Fall darstellt und 1-4 Grad der Erkrankung angeben. |
Der Ordner für das Testen enthält drei Dateien:
data.csvfeatures.csvstudent_skeleton.csv
Im Folgenden werden die Details dieser Dateien beschrieben.
-
data.csv: Enthält die rohen EEG, EKG und EDA Testdaten für alle Klassen vereint in einer Tabelle. Alle Signale haben die gleiche Frequenz von 250 Hz und sind in 10-sekunden lange Segmente aufgeteilt. Jedes dieser Segmente besitzt eine eindeutige Identifikationsnummer. Die Felder entsprechen denen, die in (1) angegeben sind. -
features.csv: Einige bereits extrahierte Merkmale der Testdaten. Jede Zeile repräsentiert die Merkmale für ein Segment. Die Felder entsprechen denen, die in (2) angegeben sind. -
student_skeleton.csv: Diese Datei muss mit den vorhergesagten Erkrankungen ausgefüllt werden. Die Felder entsprechen denen, die in (3) angegeben sind. Die Anzahl der Zeilen und die Reihenfolge derIDdürfen nicht geändert werden.
Sobald die Datei student_skeleton.csv ausgefüllt wurde, kann sie im BBDC 2026 Submission-Portal (https://bbdc.csl.uni-bremen.de/submission/) hochgeladen werden. Anschließend wird die Punktzahl automatisch berechnet und angezeigt, und die Rangliste wird aktualisiert.
Die endgültige Punktzahl ergibt sich aus dem Macro-F1-score für die Erkrankungen. Die Mindestpunktzahl beträgt 0,0 (0 %), und die Höchstpunktzahl 1,0 (100 %). Eine höhere Punktzahl ist also besser.