Skip to content

Commit ee97122

Browse files
committed
chaange extended suite to lighteval
1 parent 2ddb0f9 commit ee97122

20 files changed

Lines changed: 768 additions & 1805 deletions

src/lighteval/tasks/default_prompts.py

Lines changed: 1 addition & 11 deletions
Original file line numberDiff line numberDiff line change
@@ -330,7 +330,7 @@ def bbh_harness(line, task_name: str = None):
330330
)
331331

332332

333-
def bbh_lighteval(line, task_name: str = None):
333+
def bbh(line, task_name: str = None):
334334
line = {k: v for k, v in line.items() if v is not None}
335335

336336
query = line.get("task_prefix", "")
@@ -349,16 +349,6 @@ def bbh_lighteval(line, task_name: str = None):
349349
)
350350

351351

352-
def bbh(line, instruction, choices, task_name: str = None):
353-
return Doc(
354-
task_name=task_name,
355-
query=f"{instruction}Q: {line['input']}\nA:",
356-
choices=choices,
357-
gold_index=choices.index(line["target"]),
358-
instruction=instruction,
359-
)
360-
361-
362352
def bbh_boolean_expressions(line, task_name: str = None):
363353
instruction = "Evaluate the result of a random Boolean expression.\n\n"
364354
choices = ["False", "True"]

src/lighteval/tasks/tasks/babi_qa.py

Lines changed: 5 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -25,9 +25,13 @@
2525
from lighteval.tasks.lighteval_task import LightevalTaskConfig
2626

2727

28+
"""
29+
helm task
30+
"""
31+
2832
babi_qa = LightevalTaskConfig(
2933
name="babi_qa",
30-
suite=["helm"],
34+
suite=["lighteval"],
3135
prompt_function=prompt.babi_qa,
3236
hf_repo="facebook/babi_qa",
3337
hf_subset="en-valid-qa1",

src/lighteval/tasks/tasks/bigbench_hard.py

Lines changed: 18 additions & 18 deletions
Original file line numberDiff line numberDiff line change
@@ -33,7 +33,7 @@
3333
causal_judgment = LightevalTaskConfig(
3434
name="bigbench_hard:causal_judgment",
3535
suite=["lighteval"],
36-
prompt_function=prompt.bbh_lighteval,
36+
prompt_function=prompt.bbh,
3737
hf_repo="lighteval/bbh",
3838
hf_subset="causal_judgement",
3939
hf_avail_splits=["train"],
@@ -49,7 +49,7 @@
4949
date_understanding = LightevalTaskConfig(
5050
name="bigbench_hard:date_understanding",
5151
suite=["lighteval"],
52-
prompt_function=prompt.bbh_lighteval,
52+
prompt_function=prompt.bbh,
5353
hf_repo="lighteval/bbh",
5454
hf_subset="date_understanding",
5555
hf_avail_splits=["train"],
@@ -65,7 +65,7 @@
6565
disambiguation_qa = LightevalTaskConfig(
6666
name="bigbench_hard:disambiguation_qa",
6767
suite=["lighteval"],
68-
prompt_function=prompt.bbh_lighteval,
68+
prompt_function=prompt.bbh,
6969
hf_repo="lighteval/bbh",
7070
hf_subset="disambiguation_qa",
7171
hf_avail_splits=["train"],
@@ -81,7 +81,7 @@
8181
geometric_shapes = LightevalTaskConfig(
8282
name="bigbench_hard:geometric_shapes",
8383
suite=["lighteval"],
84-
prompt_function=prompt.bbh_lighteval,
84+
prompt_function=prompt.bbh,
8585
hf_repo="lighteval/bbh",
8686
hf_subset="geometric_shapes",
8787
hf_avail_splits=["train"],
@@ -97,7 +97,7 @@
9797
logical_deduction_five_objects = LightevalTaskConfig(
9898
name="bigbench_hard:logical_deduction_five_objects",
9999
suite=["lighteval"],
100-
prompt_function=prompt.bbh_lighteval,
100+
prompt_function=prompt.bbh,
101101
hf_repo="lighteval/bbh",
102102
hf_subset="logical_deduction_five_objects",
103103
hf_avail_splits=["train"],
@@ -113,7 +113,7 @@
113113
logical_deduction_seven_objects = LightevalTaskConfig(
114114
name="bigbench_hard:logical_deduction_seven_objects",
115115
suite=["lighteval"],
116-
prompt_function=prompt.bbh_lighteval,
116+
prompt_function=prompt.bbh,
117117
hf_repo="lighteval/bbh",
118118
hf_subset="logical_deduction_seven_objects",
119119
hf_avail_splits=["train"],
@@ -129,7 +129,7 @@
129129
logical_deduction_three_objects = LightevalTaskConfig(
130130
name="bigbench_hard:logical_deduction_three_objects",
131131
suite=["lighteval"],
132-
prompt_function=prompt.bbh_lighteval,
132+
prompt_function=prompt.bbh,
133133
hf_repo="lighteval/bbh",
134134
hf_subset="logical_deduction_three_objects",
135135
hf_avail_splits=["train"],
@@ -145,7 +145,7 @@
145145
movie_recommendation = LightevalTaskConfig(
146146
name="bigbench_hard:movie_recommendation",
147147
suite=["lighteval"],
148-
prompt_function=prompt.bbh_lighteval,
148+
prompt_function=prompt.bbh,
149149
hf_repo="lighteval/bbh",
150150
hf_subset="movie_recommendation",
151151
hf_avail_splits=["train"],
@@ -161,7 +161,7 @@
161161
navigate = LightevalTaskConfig(
162162
name="bigbench_hard:navigate",
163163
suite=["lighteval"],
164-
prompt_function=prompt.bbh_lighteval,
164+
prompt_function=prompt.bbh,
165165
hf_repo="lighteval/bbh",
166166
hf_subset="navigate",
167167
hf_avail_splits=["train"],
@@ -177,7 +177,7 @@
177177
reasoning_about_colored_objects = LightevalTaskConfig(
178178
name="bigbench_hard:reasoning_about_colored_objects",
179179
suite=["lighteval"],
180-
prompt_function=prompt.bbh_lighteval,
180+
prompt_function=prompt.bbh,
181181
hf_repo="lighteval/bbh",
182182
hf_subset="reasoning_about_colored_objects",
183183
hf_avail_splits=["train"],
@@ -193,7 +193,7 @@
193193
ruin_names = LightevalTaskConfig(
194194
name="bigbench_hard:ruin_names",
195195
suite=["lighteval"],
196-
prompt_function=prompt.bbh_lighteval,
196+
prompt_function=prompt.bbh,
197197
hf_repo="lighteval/bbh",
198198
hf_subset="ruin_names",
199199
hf_avail_splits=["train"],
@@ -209,7 +209,7 @@
209209
salient_translation_error_detection = LightevalTaskConfig(
210210
name="bigbench_hard:salient_translation_error_detection",
211211
suite=["lighteval"],
212-
prompt_function=prompt.bbh_lighteval,
212+
prompt_function=prompt.bbh,
213213
hf_repo="lighteval/bbh",
214214
hf_subset="salient_translation_error_detection",
215215
hf_avail_splits=["train"],
@@ -225,7 +225,7 @@
225225
snarks = LightevalTaskConfig(
226226
name="bigbench_hard:snarks",
227227
suite=["lighteval"],
228-
prompt_function=prompt.bbh_lighteval,
228+
prompt_function=prompt.bbh,
229229
hf_repo="lighteval/bbh",
230230
hf_subset="snarks",
231231
hf_avail_splits=["train"],
@@ -241,7 +241,7 @@
241241
sports_understanding = LightevalTaskConfig(
242242
name="bigbench_hard:sports_understanding",
243243
suite=["lighteval"],
244-
prompt_function=prompt.bbh_lighteval,
244+
prompt_function=prompt.bbh,
245245
hf_repo="lighteval/bbh",
246246
hf_subset="sports_understanding",
247247
hf_avail_splits=["train"],
@@ -257,7 +257,7 @@
257257
temporal_sequences = LightevalTaskConfig(
258258
name="bigbench_hard:temporal_sequences",
259259
suite=["lighteval"],
260-
prompt_function=prompt.bbh_lighteval,
260+
prompt_function=prompt.bbh,
261261
hf_repo="lighteval/bbh",
262262
hf_subset="temporal_sequences",
263263
hf_avail_splits=["train"],
@@ -273,7 +273,7 @@
273273
tracking_shuffled_objects_five_objects = LightevalTaskConfig(
274274
name="bigbench_hard:tracking_shuffled_objects_five_objects",
275275
suite=["lighteval"],
276-
prompt_function=prompt.bbh_lighteval,
276+
prompt_function=prompt.bbh,
277277
hf_repo="lighteval/bbh",
278278
hf_subset="tracking_shuffled_objects_five_objects",
279279
hf_avail_splits=["train"],
@@ -289,7 +289,7 @@
289289
tracking_shuffled_objects_seven_objects = LightevalTaskConfig(
290290
name="bigbench_hard:tracking_shuffled_objects_seven_objects",
291291
suite=["lighteval"],
292-
prompt_function=prompt.bbh_lighteval,
292+
prompt_function=prompt.bbh,
293293
hf_repo="lighteval/bbh",
294294
hf_subset="tracking_shuffled_objects_seven_objects",
295295
hf_avail_splits=["train"],
@@ -305,7 +305,7 @@
305305
tracking_shuffled_objects_three_objects = LightevalTaskConfig(
306306
name="bigbench_hard:tracking_shuffled_objects_three_objects",
307307
suite=["lighteval"],
308-
prompt_function=prompt.bbh_lighteval,
308+
prompt_function=prompt.bbh,
309309
hf_repo="lighteval/bbh",
310310
hf_subset="tracking_shuffled_objects_three_objects",
311311
hf_avail_splits=["train"],

src/lighteval/tasks/tasks/commonsenseqa.py

Lines changed: 4 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -25,9 +25,12 @@
2525
from lighteval.tasks.lighteval_task import LightevalTaskConfig
2626

2727

28+
"""
29+
helm task
30+
"""
2831
commonsenseqa = LightevalTaskConfig(
2932
name="commonsenseqa",
30-
suite=["helm", "commonsense_scenario"],
33+
suite=["lighteval"],
3134
prompt_function=prompt.commonsense_qa,
3235
hf_repo="commonsense_qa",
3336
hf_subset="default",

src/lighteval/tasks/tasks/covid_dialogue.py

Lines changed: 4 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -25,9 +25,12 @@
2525
from lighteval.tasks.lighteval_task import LightevalTaskConfig
2626

2727

28+
"""
29+
helm task
30+
"""
2831
covid_dialogue = LightevalTaskConfig(
2932
name="covid_dialogue",
30-
suite=["helm"],
33+
suite=["lighteval"],
3134
prompt_function=prompt.covid_dialogue,
3235
hf_repo="lighteval/covid_dialogue",
3336
hf_subset="default",

src/lighteval/tasks/tasks/glue.py

Lines changed: 17 additions & 17 deletions
Original file line numberDiff line numberDiff line change
@@ -25,7 +25,7 @@
2525
from lighteval.tasks.lighteval_task import LightevalTaskConfig
2626

2727

28-
glue_cola_lighteval = LightevalTaskConfig(
28+
glue_cola = LightevalTaskConfig(
2929
name="glue:cola",
3030
suite=["lighteval"],
3131
prompt_function=prompt.cola,
@@ -41,7 +41,7 @@
4141
version=0,
4242
)
4343

44-
glue_mnli_lighteval = LightevalTaskConfig(
44+
glue_mnli = LightevalTaskConfig(
4545
name="glue:mnli",
4646
suite=["lighteval"],
4747
prompt_function=prompt.mnli,
@@ -57,7 +57,7 @@
5757
version=0,
5858
)
5959

60-
glue_mnli_mismatched_lighteval = LightevalTaskConfig(
60+
glue_mnli_mismatched = LightevalTaskConfig(
6161
name="glue:mnli_mismatched",
6262
suite=["lighteval"],
6363
prompt_function=prompt.mnli,
@@ -73,7 +73,7 @@
7373
version=0,
7474
)
7575

76-
glue_mrpc_lighteval = LightevalTaskConfig(
76+
glue_mrpc = LightevalTaskConfig(
7777
name="glue:mrpc",
7878
suite=["lighteval"],
7979
prompt_function=prompt.mrpc,
@@ -89,7 +89,7 @@
8989
version=0,
9090
)
9191

92-
glue_qnli_lighteval = LightevalTaskConfig(
92+
glue_qnli = LightevalTaskConfig(
9393
name="glue:qnli",
9494
suite=["lighteval"],
9595
prompt_function=prompt.qnli,
@@ -105,7 +105,7 @@
105105
version=0,
106106
)
107107

108-
glue_qqp_lighteval = LightevalTaskConfig(
108+
glue_qqp = LightevalTaskConfig(
109109
name="glue:qqp",
110110
suite=["lighteval"],
111111
prompt_function=prompt.qqp,
@@ -121,7 +121,7 @@
121121
version=0,
122122
)
123123

124-
glue_rte_lighteval = LightevalTaskConfig(
124+
glue_rte = LightevalTaskConfig(
125125
name="glue:rte",
126126
suite=["lighteval"],
127127
prompt_function=prompt.rte,
@@ -137,7 +137,7 @@
137137
version=0,
138138
)
139139

140-
glue_sst2_lighteval = LightevalTaskConfig(
140+
glue_sst2 = LightevalTaskConfig(
141141
name="glue:sst2",
142142
suite=["lighteval"],
143143
prompt_function=prompt.sst,
@@ -153,7 +153,7 @@
153153
version=0,
154154
)
155155

156-
glue_stsb_lighteval = LightevalTaskConfig(
156+
glue_stsb = LightevalTaskConfig(
157157
name="glue:stsb",
158158
suite=["lighteval"],
159159
prompt_function=prompt.stsb,
@@ -169,7 +169,7 @@
169169
version=0,
170170
)
171171

172-
glue_wnli_lighteval = LightevalTaskConfig(
172+
glue_wnli = LightevalTaskConfig(
173173
name="glue:wnli",
174174
suite=["lighteval"],
175175
prompt_function=prompt.wnli,
@@ -185,7 +185,7 @@
185185
version=0,
186186
)
187187

188-
super_glue_boolq_lighteval = LightevalTaskConfig(
188+
super_glue_boolq = LightevalTaskConfig(
189189
name="super_glue:boolq",
190190
suite=["lighteval"],
191191
prompt_function=prompt.boolq_harness,
@@ -201,7 +201,7 @@
201201
version=0,
202202
)
203203

204-
super_glue_cb_lighteval = LightevalTaskConfig(
204+
super_glue_cb = LightevalTaskConfig(
205205
name="super_glue:cb",
206206
suite=["lighteval"],
207207
prompt_function=prompt.cb,
@@ -217,7 +217,7 @@
217217
version=0,
218218
)
219219

220-
super_glue_copa_lighteval = LightevalTaskConfig(
220+
super_glue_copa = LightevalTaskConfig(
221221
name="super_glue:copa",
222222
suite=["lighteval"],
223223
prompt_function=prompt.copa,
@@ -233,7 +233,7 @@
233233
version=0,
234234
)
235235

236-
super_glue_rte_lighteval = LightevalTaskConfig(
236+
super_glue_rte = LightevalTaskConfig(
237237
name="super_glue:rte",
238238
suite=["lighteval"],
239239
prompt_function=prompt.rte,
@@ -249,7 +249,7 @@
249249
version=0,
250250
)
251251

252-
super_glue_multirc_lighteval = LightevalTaskConfig(
252+
super_glue_multirc = LightevalTaskConfig(
253253
name="super_glue:multirc",
254254
suite=["lighteval"],
255255
prompt_function=prompt.multirc,
@@ -265,7 +265,7 @@
265265
version=0,
266266
)
267267

268-
super_glue_wic_lighteval = LightevalTaskConfig(
268+
super_glue_wic = LightevalTaskConfig(
269269
name="super_glue:wic",
270270
suite=["lighteval"],
271271
prompt_function=prompt.wic,
@@ -281,7 +281,7 @@
281281
version=0,
282282
)
283283

284-
super_glue_wsc_lighteval = LightevalTaskConfig(
284+
super_glue_wsc = LightevalTaskConfig(
285285
name="super_glue:wsc",
286286
suite=["lighteval"],
287287
prompt_function=prompt.wsc,

0 commit comments

Comments
 (0)