1313from darija_translator .evaluate import compute_translation_metrics , generate_translations
1414from darija_translator .model import attach_lora , load_model_and_tokenizer
1515from darija_translator .train import build_trainer , save_model
16- from dotenv import load_dotenv
16+ # from dotenv import load_dotenv
1717
1818
19- def prepare_data (dataset_name : str , data_config : DataConfig , tokenizer ):
19+ def prepare_data (dataset_name : str ,
20+ data_config : DataConfig ,
21+ tokenizer ,
22+ remove_columns : bool = True ) -> tuple :
2023 dataset = load_dataset (dataset_name , split = "train" )
21- dataset = dataset .filter (is_darija_script )
22- dataset = dataset .map (lambda b : to_conversations (b , data_config ),
23- batched = True )
24- dataset = dataset .map (lambda b : format_conversations (b , tokenizer ),
25- batched = True )
26- dataset = dataset .filter (lambda ex : is_within_length (ex , data_config ))
24+ # dataset = dataset.filter(is_darija_script)
25+ # dataset = dataset.map(lambda b: to_conversations(b, data_config),
26+ # batched=True)
27+ # dataset = dataset.map(lambda b: format_conversations(b, tokenizer),
28+ # batched=True)
29+ # dataset = dataset.filter(lambda ex: is_within_length(ex, data_config))
30+ if remove_columns :
31+ dataset = dataset .remove_columns (
32+ [c for c in dataset .column_names if c != "text" ])
2733 return split_dataset (dataset , data_config )
2834
2935
@@ -43,7 +49,10 @@ def run_train(args):
4349def run_evaluate (args ):
4450 model_config , data_config = ModelConfig (), DataConfig ()
4551 model , tokenizer = load_model_and_tokenizer (model_config )
46- _ , eval_dataset = prepare_data (args .dataset , data_config , tokenizer )
52+ _ , eval_dataset = prepare_data (args .dataset ,
53+ data_config ,
54+ tokenizer ,
55+ remove_columns = False )
4756 predictions = generate_translations (
4857 model ,
4958 tokenizer ,
@@ -59,13 +68,15 @@ def main():
5968 subparsers = parser .add_subparsers (required = True )
6069
6170 train_parser = subparsers .add_parser ("train" )
62- train_parser .add_argument ("--dataset" ,
63- default = "atlasia/darija-english-combined" )
71+ train_parser .add_argument (
72+ "--dataset" ,
73+ default = "atlasia/english-to-darija-arabic-script-formatted" )
6474 train_parser .set_defaults (func = run_train )
6575
6676 eval_parser = subparsers .add_parser ("evaluate" )
67- eval_parser .add_argument ("--dataset" ,
68- default = "atlasia/darija-english-combined" )
77+ eval_parser .add_argument (
78+ "--dataset" ,
79+ default = "atlasia/english-to-darija-arabic-script-formatted" )
6980 eval_parser .set_defaults (func = run_evaluate )
7081
7182 args = parser .parse_args ()
0 commit comments