Skip to content

Commit 2ddb0f9

Browse files
committed
chaange extended suite to lighteval
1 parent d2fd5e1 commit 2ddb0f9

8 files changed

Lines changed: 21 additions & 11 deletions

File tree

src/lighteval/tasks/tasks/gsm8k.py

Lines changed: 10 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -25,6 +25,16 @@
2525
from lighteval.tasks.lighteval_task import LightevalTaskConfig
2626

2727

28+
"""
29+
GSM8K is a dataset of 8,000+ high-quality, single-step arithmetic word problems.
30+
31+
https://huggingface.co/datasets/openai/gsm8k
32+
33+
languages: en
34+
fields: math, reasoning
35+
"""
36+
37+
2838
# gsm8k = LightevalTaskConfig_inspect(
2939
# name="gsm8k",
3040
# prompt_function=prompt.gsm8k,

src/lighteval/tasks/tasks/ifbench/main.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -104,7 +104,7 @@ def agg_inst_level_acc(items):
104104
ifbench_test = LightevalTaskConfig(
105105
name="ifbench_test",
106106
prompt_function=ifbench_prompt,
107-
suite=["extended"],
107+
suite=["lighteval"],
108108
hf_repo="allenai/IFBench_test",
109109
hf_subset="default",
110110
metrics=[ifbench_metrics],
@@ -121,7 +121,7 @@ def agg_inst_level_acc(items):
121121
ifbench_multiturn = LightevalTaskConfig(
122122
name="ifbench_multiturn",
123123
prompt_function=ifbench_prompt,
124-
suite=["extended"],
124+
suite=["lighteval"],
125125
hf_repo="allenai/IFBench_multi-turn",
126126
hf_subset="default",
127127
metrics=[ifbench_metrics],

src/lighteval/tasks/tasks/ifeval/main.py

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -149,7 +149,7 @@ def agg_inst_level_acc(items):
149149
ifeval = LightevalTaskConfig(
150150
name="ifeval",
151151
prompt_function=ifeval_prompt,
152-
suite=["extended"],
152+
suite=["lighteval"],
153153
hf_repo="google/IFEval",
154154
hf_subset="default",
155155
metrics=[ifeval_metrics],

src/lighteval/tasks/tasks/lcb/main.py

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -154,7 +154,7 @@ def compute(self, model_response: ModelResponse, doc: Doc, **kwargs) -> dict:
154154
name = "lcb:codegeneration" if subset == "v4_v5" else f"lcb:codegeneration_{subset}"
155155
task = LightevalTaskConfig(
156156
name=name,
157-
suite=["extended"],
157+
suite=["lighteval"],
158158
prompt_function=lcb_codegeneration_prompt_fn,
159159
hf_repo="lighteval/code_generation_lite",
160160
hf_subset=subset, # https://github.com/LiveCodeBench/LiveCodeBench/tree/main?tab=readme-ov-file#dataset-versions

src/lighteval/tasks/tasks/mix_eval/main.py

Lines changed: 4 additions & 4 deletions
Original file line numberDiff line numberDiff line change
@@ -174,7 +174,7 @@ def mean_dv_5(x):
174174
mixeval_freeform_easy = LightevalTaskConfig(
175175
name="mixeval_easy:freeform",
176176
prompt_function=mixeval_freeform_prompt,
177-
suite=["extended"],
177+
suite=["lighteval"],
178178
hf_repo="MixEval/MixEval",
179179
hf_subset="MixEval",
180180
metrics=[llm_judge_mixeval_freeform_flow_judge, llm_judge_mixeval_freeform_gpt_judge],
@@ -191,7 +191,7 @@ def mean_dv_5(x):
191191
mixeval_multichoice_easy = LightevalTaskConfig(
192192
name="mixeval_easy:multichoice",
193193
prompt_function=mixeval_multichoice_prompt,
194-
suite=["extended"],
194+
suite=["lighteval"],
195195
hf_repo="MixEval/MixEval",
196196
hf_subset="MixEval",
197197
metrics=[llm_judge_mixeval_multichoice_flow_judge, llm_judge_mixeval_multichoice_gpt_judge],
@@ -207,7 +207,7 @@ def mean_dv_5(x):
207207
mixeval_freeform_hard = LightevalTaskConfig(
208208
name="mixeval_hard:freeform",
209209
prompt_function=mixeval_freeform_prompt,
210-
suite=["extended"],
210+
suite=["lighteval"],
211211
hf_repo="MixEval/MixEval",
212212
hf_subset="MixEval_Hard",
213213
metrics=[llm_judge_mixeval_freeform_flow_judge, llm_judge_mixeval_freeform_gpt_judge],
@@ -224,7 +224,7 @@ def mean_dv_5(x):
224224
mixeval_multichoice_hard = LightevalTaskConfig(
225225
name="mixeval_hard:multichoice",
226226
prompt_function=mixeval_multichoice_prompt,
227-
suite=["extended"],
227+
suite=["lighteval"],
228228
hf_repo="MixEval/MixEval",
229229
hf_subset="MixEval_Hard",
230230
metrics=[llm_judge_mixeval_multichoice_flow_judge, llm_judge_mixeval_multichoice_gpt_judge],

src/lighteval/tasks/tasks/mt_bench/main.py

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -80,7 +80,7 @@ def flow_judge_mt_bench_prompt(question, answer, options, gold):
8080
task = LightevalTaskConfig(
8181
name="mt_bench",
8282
prompt_function=mt_bench_prompt, # must be defined in the file or imported from src/lighteval/tasks/tasks_prompt_formatting.py
83-
suite=["extended"],
83+
suite=["lighteval"],
8484
hf_repo="lighteval/mt-bench",
8585
hf_subset="default",
8686
hf_avail_splits=["train"],

src/lighteval/tasks/tasks/olympiade_bench/main.py

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -224,7 +224,7 @@ def olympiad_bench_prompt(line, task_name: str = None):
224224
LightevalTaskConfig(
225225
name="olympiad_bench:" + subset,
226226
prompt_function=olympiad_bench_prompt,
227-
suite=["extended"],
227+
suite=["lighteval"],
228228
hf_repo="Hothan/OlympiadBench",
229229
hf_subset=subset,
230230
metrics=[metric],

src/lighteval/tasks/tasks/tiny_benchmarks/main.py

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -249,7 +249,7 @@ def compute_corpus(self, y_input):
249249
task = LightevalTaskConfig(
250250
name=f"tiny:{name}",
251251
prompt_function=task["prompt"],
252-
suite=["extended"],
252+
suite=["lighteval"],
253253
hf_repo=task["dataset"],
254254
hf_subset=task["subset"],
255255
hf_avail_splits=task["splits"],

0 commit comments

Comments
 (0)