1- import logging
2- import math
3- from typing import List , Literal
4-
5- import numpy as np
6- from aenum import extend_enum
7- from pydantic import BaseModel
8-
9- from lighteval .metrics .metrics import Metrics
10- from lighteval .metrics .metrics_sample import JudgeLLM
11- from lighteval .metrics .utils .metric_utils import CorpusLevelMetricGrouping
12- from lighteval .tasks .lighteval_task import LightevalTaskConfig
13- from lighteval .tasks .requests import Doc , SamplingMethod
14-
15-
161"""
172abstract:
183Humanity's Last Exam (HLE) is a global collaborative effort, with questions from
3015https://arxiv.org/abs/2501.14249
3116"""
3217
18+ import logging
19+ import math
20+ from typing import List , Literal
21+
22+ import numpy as np
23+ from aenum import extend_enum
24+ from pydantic import BaseModel
25+
26+ from lighteval .metrics .metrics import Metrics
27+ from lighteval .metrics .metrics_sample import JudgeLLM
28+ from lighteval .metrics .utils .metric_utils import CorpusLevelMetricGrouping
29+ from lighteval .tasks .lighteval_task import LightevalTaskConfig
30+ from lighteval .tasks .requests import Doc , SamplingMethod
31+
3332
3433logger = logging .getLogger (__name__ )
3534
@@ -42,8 +41,7 @@ class ExtractedAnswer(BaseModel):
4241 strict : Literal [True ] # 100% reliability
4342
4443
45- """Adaptation from https://github.com/centerforaisafety/hle/blob/main/hle_eval/run_judge_results.py
46- """
44+ # Adaptation from https://github.com/centerforaisafety/hle/blob/main/hle_eval/run_judge_results.py
4745
4846
4947def get_judge_prompt (question : str , answer : str , gold : str , ** kwargs ):
0 commit comments