Skip to content

Commit 074593f

Browse files
author
Artyom Kozhevnikov
committed
early exit
1 parent 1e69b88 commit 074593f

1 file changed

Lines changed: 9 additions & 5 deletions

File tree

src/fairseq2/datasets/asr.py

Lines changed: 9 additions & 5 deletions
Original file line numberDiff line numberDiff line change
@@ -8,19 +8,17 @@
88

99
from abc import ABC, abstractmethod
1010
from functools import partial
11-
from typing import Any, Dict, Final, Tuple, cast
12-
13-
from typing_extensions import override
11+
from typing import Any, cast, Dict, Final, Tuple
1412

1513
from fairseq2.data import (
1614
CollateOptionsOverride,
1715
Collater,
1816
DataPipeline,
1917
DataPipelineBuilder,
20-
SequenceData,
2118
read_sequence,
19+
SequenceData,
2220
)
23-
from fairseq2.data.text import StrSplitter, read_text
21+
from fairseq2.data.text import read_text, StrSplitter
2422
from fairseq2.data.text.tokenizers import TextTokenizer
2523
from fairseq2.datasets import (
2624
DataPipelineReader,
@@ -38,6 +36,8 @@
3836
from fairseq2.nn.padding import get_seqs_and_padding_mask
3937
from fairseq2.typing import Device
4038

39+
from typing_extensions import override
40+
4141

4242
class AsrDataset(ABC):
4343
"""Represents an automatic speech recognition dataset."""
@@ -167,6 +167,10 @@ def add_tokenization_pipeline(
167167
) -> DataPipelineBuilder:
168168
# Tokenize target text.
169169
text_encoder = tokenizer.create_encoder()
170+
171+
# to avoid to tokenize empty text, we filter out them out first
172+
builder = builder.filter(lambda x: bool(len(x["text"]) > 0))
173+
170174
builder.map(text_encoder, selector="text")
171175

172176
unk_idx = tokenizer.vocab_info.unk_idx

0 commit comments

Comments
 (0)