eval-framework 0.9.0__tar.gz → 0.9.1__tar.gz
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- {eval_framework-0.9.0 → eval_framework-0.9.1}/PKG-INFO +3 -1
- {eval_framework-0.9.0 → eval_framework-0.9.1}/README.md +2 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/pyproject.toml +1 -1
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/base.py +22 -6
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/registry.py +18 -22
- eval_framework-0.9.1/src/eval_framework/tasks/task_names.py +213 -0
- eval_framework-0.9.0/src/eval_framework/tasks/task_names.py +0 -82
- {eval_framework-0.9.0 → eval_framework-0.9.1}/LICENSE +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/base_config.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/context/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/context/determined.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/context/eval.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/context/local.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/evaluation_generator.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/exceptions.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/drop_process_results.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/README.md +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/instructions.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/instructions_registry.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/instructions_util.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/utils.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/aleph_alpha.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/base.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/huggingface.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/models.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/openai.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/logger.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/main.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/aggregators/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/aggregators/aggregators.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/base.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/accuracy_completion.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/code_assertion.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/code_execution_pass_at_one.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/concordance_index.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/csv_format.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/drop_completion.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/exponential_similarity.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/f1.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/format_checker.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/grid_difference.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/ifeval.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/json_format.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/language_checker.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/length_control.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/math_minerva_completion.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/math_reasoning_completion.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/minerva_math_utils.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/multipl_e_assertion.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/placeholder_checker.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/repetition.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/rouge_1.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/rouge_2.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/rouge_geometric_mean.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/rouge_l.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/text_counter.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/efficiency/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/efficiency/bytes_per_sequence_position.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/base.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/chatbot_style_grader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/coherence_grader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/comparison_grader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/conciseness_grader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/contains_names_grader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/format_correctness_grader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/instruction_grader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/language.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/long_context_grader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/models.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/refusal_grader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/sql_quality_grader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/summary_world_knowledge_grader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_chatbot_style.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_coherence.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_completion_accuracy.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_conciseness.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_contains_names.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_format_correctness.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_instruction.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_mtbench_pair.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_mtbench_single.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_refusal.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_sql.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_world_knowledge.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/utils.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/accuracy_loglikelihood.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/base.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/bits_per_byte.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/confidence_weighted_accuracy.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/dcs.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/probability_mass.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/ternary.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/py.typed +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/response_generator.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/base.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/hf_uploader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/result_processor.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/wandb_uploader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/run.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/run_direct.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/shared/types.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/suite.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/Dockerfile_codebench +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/arc.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/arc_de.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/bigcodebench.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/copa.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/csqa.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/drop.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/global_mmlu.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/goldenswag.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/gpqa.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/gsm8k.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/hellaswag.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/humaneval.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/ifeval.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/math_reasoning.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/mbpp.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/medqa.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/mmlu.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/mmlu_pro.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/multipl_e.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/naturalqs_open.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/piqa.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/sciq.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/social_iqa.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/squad.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/winogrande.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/dataset_revisions.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/eval_config.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/frozen-hf-dataset-revisions.json +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/hf-dataset-revisions.json +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/markdown_doc.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/perturbation.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/task_loader.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/task_style.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/utils.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/constants.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/file_ops.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/helpers.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/logging.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/packaging.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/tqdm_handler.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/template_formatting/README.md +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/template_formatting/__init__.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/template_formatting/formatter.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/template_formatting/mistral_formatter.py +0 -0
- {eval_framework-0.9.0 → eval_framework-0.9.1}/src/template_formatting/py.typed +0 -0
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
Metadata-Version: 2.3
|
|
2
2
|
Name: eval-framework
|
|
3
|
-
Version: 0.9.
|
|
3
|
+
Version: 0.9.1
|
|
4
4
|
Summary: Evaluation Framework
|
|
5
5
|
Author: Aleph Alpha Research
|
|
6
6
|
License: Apache License
|
|
@@ -450,11 +450,13 @@ from eval_framework.main import main
|
|
|
450
450
|
from eval_framework.tasks.eval_config import EvalConfig
|
|
451
451
|
from template_formatting.formatter import HFFormatter
|
|
452
452
|
|
|
453
|
+
|
|
453
454
|
# Define your model
|
|
454
455
|
class MyHuggingFaceModel(HFLLM):
|
|
455
456
|
LLM_NAME = "microsoft/DialoGPT-medium"
|
|
456
457
|
DEFAULT_FORMATTER = partial(HFFormatter, "microsoft/DialoGPT-medium")
|
|
457
458
|
|
|
459
|
+
|
|
458
460
|
if __name__ == "__main__":
|
|
459
461
|
# Initialize your model
|
|
460
462
|
llm = MyHuggingFaceModel()
|
|
@@ -189,11 +189,13 @@ from eval_framework.main import main
|
|
|
189
189
|
from eval_framework.tasks.eval_config import EvalConfig
|
|
190
190
|
from template_formatting.formatter import HFFormatter
|
|
191
191
|
|
|
192
|
+
|
|
192
193
|
# Define your model
|
|
193
194
|
class MyHuggingFaceModel(HFLLM):
|
|
194
195
|
LLM_NAME = "microsoft/DialoGPT-medium"
|
|
195
196
|
DEFAULT_FORMATTER = partial(HFFormatter, "microsoft/DialoGPT-medium")
|
|
196
197
|
|
|
198
|
+
|
|
197
199
|
if __name__ == "__main__":
|
|
198
200
|
# Initialize your model
|
|
199
201
|
llm = MyHuggingFaceModel()
|
|
@@ -190,11 +190,27 @@ class BaseTask[SubjectType](Task):
|
|
|
190
190
|
|
|
191
191
|
assert hasattr(self, "SUBJECTS") and len(self.SUBJECTS) > 0
|
|
192
192
|
if isinstance(self.SUBJECTS[0], tuple):
|
|
193
|
-
# subjects are specified as strings but
|
|
194
|
-
|
|
193
|
+
# subjects are specified as comma-separated strings but tuple positions may each hold a
|
|
194
|
+
# different type (e.g. tuple[str, int, str]). Infer the expected type per position from an
|
|
195
|
+
# actual subject and cast each part back to it, so it compares equal to the real values
|
|
196
|
+
# below instead of just their str() form. "*" is a wildcard sentinel and stays a string.
|
|
197
|
+
num_items = len(self.SUBJECTS[0])
|
|
198
|
+
position_types = [type(self.SUBJECTS[0][i]) for i in range(num_items)]
|
|
199
|
+
|
|
200
|
+
def cast(raw: str, i: int) -> Any:
|
|
201
|
+
raw = raw.strip()
|
|
202
|
+
return raw if raw == "*" else position_types[i](raw)
|
|
203
|
+
|
|
204
|
+
filters = []
|
|
205
|
+
for custom_subject in custom_subjects:
|
|
206
|
+
parts = custom_subject.split(",")
|
|
207
|
+
assert len(parts) == num_items, (
|
|
208
|
+
f"Subject '{custom_subject}' has {len(parts)} parts, expected {num_items} for "
|
|
209
|
+
f"task {self.display_name()}"
|
|
210
|
+
)
|
|
211
|
+
filters.append(tuple(cast(part, i) for i, part in enumerate(parts)))
|
|
195
212
|
|
|
196
213
|
# check if all parts of custom subjects exists (* is a wildcard)
|
|
197
|
-
num_items = len(self.SUBJECTS[0])
|
|
198
214
|
legal_values = [
|
|
199
215
|
set([s[i] for s in self.SUBJECTS if isinstance(s, tuple)] + ["*"]) for i in range(num_items)
|
|
200
216
|
]
|
|
@@ -204,18 +220,18 @@ class BaseTask[SubjectType](Task):
|
|
|
204
220
|
assert v in legal_values[i], f"Subject part {v} not found in task {self.__class__.__name__}"
|
|
205
221
|
|
|
206
222
|
# filter task subjects. * is a supported wildcard for a specific item in a tuple, e.g. "DE_DE, *"
|
|
207
|
-
chosen_subjects = []
|
|
223
|
+
chosen_subjects: list[tuple] = []
|
|
208
224
|
for subject in self.SUBJECTS:
|
|
209
225
|
subject_tuple = subject if isinstance(subject, tuple) else tuple(str(subject).split(","))
|
|
210
226
|
for filter in filters:
|
|
211
227
|
if all(filter[i] == "*" or filter[i] == subject_tuple[i] for i in range(num_items)):
|
|
212
228
|
chosen_subjects.append(subject_tuple)
|
|
213
229
|
break
|
|
214
|
-
return chosen_subjects
|
|
230
|
+
return chosen_subjects
|
|
215
231
|
else:
|
|
216
232
|
for cs in custom_subjects:
|
|
217
233
|
assert cs in self.SUBJECTS, f"Subject {cs} not found in task {self.__class__.__name__}"
|
|
218
|
-
return custom_subjects
|
|
234
|
+
return custom_subjects
|
|
219
235
|
|
|
220
236
|
def _load_hf_dataset(self, **kwargs: Any) -> Any:
|
|
221
237
|
cache_dir: str = os.environ.get("HF_DATASET_CACHE_DIR", f"{Path.home()}/.cache/huggingface/datasets")
|
|
@@ -223,20 +223,15 @@ class _Eager(EvalFactory):
|
|
|
223
223
|
|
|
224
224
|
|
|
225
225
|
class Registry:
|
|
226
|
-
"""A registry for
|
|
227
|
-
|
|
228
|
-
Task names are hashed based on the upper-case name, to avoid issues with
|
|
229
|
-
ambiguous naming.
|
|
230
|
-
"""
|
|
226
|
+
"""A registry for Tasks"""
|
|
231
227
|
|
|
232
228
|
def __init__(self) -> None:
|
|
233
|
-
|
|
234
|
-
self._registry: dict[str, tuple[str, EvalFactory]] = dict()
|
|
229
|
+
self._registry: dict[str, EvalFactory] = dict()
|
|
235
230
|
|
|
236
231
|
def __iter__(self) -> Iterator[str]:
|
|
237
232
|
"""Iterate over all task names in the registry."""
|
|
238
|
-
for
|
|
239
|
-
yield
|
|
233
|
+
for factory in self._registry.values():
|
|
234
|
+
yield factory.id()
|
|
240
235
|
|
|
241
236
|
def task_names(self) -> list[str]:
|
|
242
237
|
"""The names of all registered tasks."""
|
|
@@ -244,7 +239,8 @@ class Registry:
|
|
|
244
239
|
|
|
245
240
|
def items(self) -> Iterator[tuple[str, EvalFactory]]:
|
|
246
241
|
"""Iterate over `(task name, EvalFactory)` pairs in the registry."""
|
|
247
|
-
|
|
242
|
+
for factory in self._registry.values():
|
|
243
|
+
yield factory.id(), factory
|
|
248
244
|
|
|
249
245
|
@staticmethod
|
|
250
246
|
def _task_key(name: str, /) -> str:
|
|
@@ -262,26 +258,25 @@ class Registry:
|
|
|
262
258
|
def __getitem__(self, name: str, /) -> EvalFactory:
|
|
263
259
|
task_key = self._task_key(name)
|
|
264
260
|
try:
|
|
265
|
-
|
|
261
|
+
return self._registry[task_key]
|
|
266
262
|
except KeyError:
|
|
267
263
|
raise KeyError(f"Task not found: {name=} with task_key {task_key=}")
|
|
268
264
|
|
|
269
|
-
|
|
270
|
-
|
|
271
|
-
|
|
272
|
-
task_key = self._task_key(name)
|
|
265
|
+
def add(self, factory: EvalFactory) -> None:
|
|
266
|
+
"""Register a factory under the key derived from its ``id()``."""
|
|
267
|
+
task_key = self._task_key(factory.id())
|
|
273
268
|
if task_key in self._registry:
|
|
274
269
|
raise ValueError(f"Cannot register duplicate task with key: {task_key}")
|
|
275
270
|
|
|
276
|
-
self._registry[task_key] =
|
|
271
|
+
self._registry[task_key] = factory
|
|
277
272
|
|
|
278
273
|
def register(self, task: type[BaseTask]) -> str:
|
|
279
274
|
"""The class name is used as the task name."""
|
|
280
275
|
if not issubclass(task, BaseTask):
|
|
281
276
|
raise ValueError(f"Can only register subclasses of BaseTask, got {task}")
|
|
282
|
-
|
|
283
|
-
self
|
|
284
|
-
return
|
|
277
|
+
factory = _Eager(task)
|
|
278
|
+
self.add(factory)
|
|
279
|
+
return factory.id()
|
|
285
280
|
|
|
286
281
|
def register_lazy(self, class_path: str, /) -> None:
|
|
287
282
|
"""Register a task by its dotted class path, without importing its module."""
|
|
@@ -291,7 +286,7 @@ class Registry:
|
|
|
291
286
|
"`eval_framework.tasks.benchmarks.mmlu.MMLU`): "
|
|
292
287
|
)
|
|
293
288
|
base_module, class_name = class_path.rsplit(".", maxsplit=1)
|
|
294
|
-
self
|
|
289
|
+
self.add(_Lazy(class_name=class_name, module=base_module))
|
|
295
290
|
|
|
296
291
|
|
|
297
292
|
_REGISTRY = Registry()
|
|
@@ -335,6 +330,7 @@ def register_task(task: type[BaseTask]) -> str:
|
|
|
335
330
|
return registry().register(task)
|
|
336
331
|
|
|
337
332
|
|
|
338
|
-
def register_lazy_task(class_path: str,
|
|
333
|
+
def register_lazy_task(class_path: str, /, registry: Registry | None = None) -> None:
|
|
339
334
|
"""Register a task by its dotted class path, without importing its module."""
|
|
340
|
-
registry
|
|
335
|
+
r = registry if registry is not None else _REGISTRY
|
|
336
|
+
r.register_lazy(class_path)
|
|
@@ -0,0 +1,213 @@
|
|
|
1
|
+
from enum import Enum
|
|
2
|
+
|
|
3
|
+
from eval_framework.tasks.base import BaseTask
|
|
4
|
+
from eval_framework.tasks.registry import Registry, register_lazy_task
|
|
5
|
+
from eval_framework.tasks.registry import registry as global_registry
|
|
6
|
+
|
|
7
|
+
|
|
8
|
+
class TaskNameEnum(Enum):
|
|
9
|
+
@property
|
|
10
|
+
def value(self) -> type[BaseTask]:
|
|
11
|
+
return super().value
|
|
12
|
+
|
|
13
|
+
|
|
14
|
+
def register_all_tasks(registry: Registry | None = None) -> None:
|
|
15
|
+
"""Register all the benchmark tasks with the eval framework
|
|
16
|
+
|
|
17
|
+
Uses global registry by default.
|
|
18
|
+
"""
|
|
19
|
+
registry = registry if registry is not None else global_registry()
|
|
20
|
+
|
|
21
|
+
register_math_reasoning_tasks(registry=registry)
|
|
22
|
+
register_arc_tasks(registry=registry)
|
|
23
|
+
register_arc_de_tasks(registry=registry)
|
|
24
|
+
register_bigcodebench_tasks(registry=registry)
|
|
25
|
+
register_copa_tasks(registry=registry)
|
|
26
|
+
register_goldenswag_tasks(registry=registry)
|
|
27
|
+
register_gpqa_tasks(registry=registry)
|
|
28
|
+
register_gsm8k_tasks(registry=registry)
|
|
29
|
+
register_hellaswag_tasks(registry=registry)
|
|
30
|
+
register_humaneval_tasks(registry=registry)
|
|
31
|
+
register_ifeval_tasks(registry=registry)
|
|
32
|
+
register_multipl_e_tasks(registry=registry)
|
|
33
|
+
register_mbpp_tasks(registry=registry)
|
|
34
|
+
register_mmlu_tasks(registry=registry)
|
|
35
|
+
register_mmlu_pro_tasks(registry=registry)
|
|
36
|
+
register_global_mmlu_tasks(registry=registry)
|
|
37
|
+
register_piqa_tasks(registry=registry)
|
|
38
|
+
register_sciq_tasks(registry=registry)
|
|
39
|
+
register_squad_tasks(registry=registry)
|
|
40
|
+
register_winogrande_tasks(registry=registry)
|
|
41
|
+
register_csqa_tasks(registry=registry)
|
|
42
|
+
register_drop_tasks(registry=registry)
|
|
43
|
+
register_naturalqs_open_tasks(registry=registry)
|
|
44
|
+
register_social_iqa_tasks(registry=registry)
|
|
45
|
+
register_medqa_tasks(registry=registry)
|
|
46
|
+
|
|
47
|
+
|
|
48
|
+
def register_arc_tasks(registry: Registry) -> None:
|
|
49
|
+
"""Register arc benchmark tasks."""
|
|
50
|
+
register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC", registry=registry)
|
|
51
|
+
register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC_IDK", registry=registry)
|
|
52
|
+
register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC_OLMES", registry=registry)
|
|
53
|
+
|
|
54
|
+
|
|
55
|
+
def register_hellaswag_tasks(registry: Registry) -> None:
|
|
56
|
+
"""Register hellaswag benchmark tasks."""
|
|
57
|
+
register_lazy_task("eval_framework.tasks.benchmarks.hellaswag.HELLASWAG", registry=registry)
|
|
58
|
+
register_lazy_task("eval_framework.tasks.benchmarks.hellaswag.HELLASWAG_OLMES", registry=registry)
|
|
59
|
+
|
|
60
|
+
|
|
61
|
+
def register_piqa_tasks(registry: Registry) -> None:
|
|
62
|
+
"""Register piqa benchmark tasks."""
|
|
63
|
+
register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA", registry=registry)
|
|
64
|
+
register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA_IDK", registry=registry)
|
|
65
|
+
register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA_OLMES", registry=registry)
|
|
66
|
+
|
|
67
|
+
|
|
68
|
+
def register_gpqa_tasks(registry: Registry) -> None:
|
|
69
|
+
"""Register gpqa benchmark tasks."""
|
|
70
|
+
register_lazy_task("eval_framework.tasks.benchmarks.gpqa.GPQA_OLMES", registry=registry)
|
|
71
|
+
register_lazy_task("eval_framework.tasks.benchmarks.gpqa.GPQA_DIAMOND_COT", registry=registry)
|
|
72
|
+
|
|
73
|
+
|
|
74
|
+
def register_gsm8k_tasks(registry: Registry) -> None:
|
|
75
|
+
"""Register gsm8k benchmark tasks."""
|
|
76
|
+
register_lazy_task("eval_framework.tasks.benchmarks.gsm8k.GSM8K_OLMES", registry=registry)
|
|
77
|
+
register_lazy_task("eval_framework.tasks.benchmarks.gsm8k.GSM8KBPB", registry=registry)
|
|
78
|
+
|
|
79
|
+
|
|
80
|
+
def register_math_reasoning_tasks(registry: Registry) -> None:
|
|
81
|
+
"""Register math_reasoning benchmark tasks."""
|
|
82
|
+
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2024", registry=registry)
|
|
83
|
+
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2026", registry=registry)
|
|
84
|
+
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2025", registry=registry)
|
|
85
|
+
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinervaBPB", registry=registry)
|
|
86
|
+
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.GSM8KReasoning", registry=registry)
|
|
87
|
+
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATH500", registry=registry)
|
|
88
|
+
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinerva_OLMES", registry=registry)
|
|
89
|
+
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinerva_OLMES_NONL", registry=registry)
|
|
90
|
+
|
|
91
|
+
|
|
92
|
+
def register_mmlu_tasks(registry: Registry) -> None:
|
|
93
|
+
"""Register mmlu benchmark tasks."""
|
|
94
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU", registry=registry)
|
|
95
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_IDK", registry=registry)
|
|
96
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_OLMES", registry=registry)
|
|
97
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mmlu.FullTextMMLU", registry=registry)
|
|
98
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_COT", registry=registry)
|
|
99
|
+
|
|
100
|
+
|
|
101
|
+
def register_humaneval_tasks(registry: Registry) -> None:
|
|
102
|
+
"""Register humaneval benchmark tasks."""
|
|
103
|
+
register_lazy_task("eval_framework.tasks.benchmarks.humaneval.HumanEvalBPB", registry=registry)
|
|
104
|
+
register_lazy_task("eval_framework.tasks.benchmarks.humaneval.HumanEval_OLMES", registry=registry)
|
|
105
|
+
|
|
106
|
+
|
|
107
|
+
def register_mbpp_tasks(registry: Registry) -> None:
|
|
108
|
+
"""Register mbpp benchmark tasks."""
|
|
109
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPPBPB", registry=registry)
|
|
110
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_OLMES", registry=registry)
|
|
111
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_EvalPlus", registry=registry)
|
|
112
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_BPB_EvalPlus", registry=registry)
|
|
113
|
+
|
|
114
|
+
|
|
115
|
+
def register_bigcodebench_tasks(registry: Registry) -> None:
|
|
116
|
+
"""Register bigcodebench benchmark tasks."""
|
|
117
|
+
register_lazy_task("eval_framework.tasks.benchmarks.bigcodebench.BigCodeBench_OLMES", registry=registry)
|
|
118
|
+
|
|
119
|
+
|
|
120
|
+
def register_arc_de_tasks(registry: Registry) -> None:
|
|
121
|
+
"""Register arc_de benchmark tasks."""
|
|
122
|
+
register_lazy_task("eval_framework.tasks.benchmarks.arc_de.ARC_DE", registry=registry)
|
|
123
|
+
|
|
124
|
+
|
|
125
|
+
def register_copa_tasks(registry: Registry) -> None:
|
|
126
|
+
"""Register copa benchmark tasks."""
|
|
127
|
+
register_lazy_task("eval_framework.tasks.benchmarks.copa.COPA_OLMES", registry=registry)
|
|
128
|
+
|
|
129
|
+
|
|
130
|
+
def register_goldenswag_tasks(registry: Registry) -> None:
|
|
131
|
+
"""Register goldenswag benchmark tasks."""
|
|
132
|
+
register_lazy_task("eval_framework.tasks.benchmarks.goldenswag.GOLDENSWAG", registry=registry)
|
|
133
|
+
register_lazy_task("eval_framework.tasks.benchmarks.goldenswag.GOLDENSWAG_IDK", registry=registry)
|
|
134
|
+
|
|
135
|
+
|
|
136
|
+
def register_ifeval_tasks(registry: Registry) -> None:
|
|
137
|
+
"""Register ifeval benchmark tasks."""
|
|
138
|
+
register_lazy_task("eval_framework.tasks.benchmarks.ifeval.IFEval", registry=registry)
|
|
139
|
+
register_lazy_task("eval_framework.tasks.benchmarks.ifeval.IFEvalDe", registry=registry)
|
|
140
|
+
|
|
141
|
+
|
|
142
|
+
def register_multipl_e_tasks(registry: Registry) -> None:
|
|
143
|
+
"""Register multipl_e benchmark tasks."""
|
|
144
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalCpp", registry=registry)
|
|
145
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalJava", registry=registry)
|
|
146
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalJs", registry=registry)
|
|
147
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalPhp", registry=registry)
|
|
148
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalRs", registry=registry)
|
|
149
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalSh", registry=registry)
|
|
150
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPCpp", registry=registry)
|
|
151
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPJava", registry=registry)
|
|
152
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPJs", registry=registry)
|
|
153
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPPhp", registry=registry)
|
|
154
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPRs", registry=registry)
|
|
155
|
+
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPSh", registry=registry)
|
|
156
|
+
|
|
157
|
+
|
|
158
|
+
def register_mmlu_pro_tasks(registry: Registry) -> None:
|
|
159
|
+
"""Register mmlu_pro benchmark tasks."""
|
|
160
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO", registry=registry)
|
|
161
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_IDK", registry=registry)
|
|
162
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_OLMES", registry=registry)
|
|
163
|
+
register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_COT", registry=registry)
|
|
164
|
+
|
|
165
|
+
|
|
166
|
+
def register_global_mmlu_tasks(registry: Registry) -> None:
|
|
167
|
+
"""Register global_mmlu benchmark tasks."""
|
|
168
|
+
register_lazy_task("eval_framework.tasks.benchmarks.global_mmlu.GlobalMMLU", registry=registry)
|
|
169
|
+
register_lazy_task("eval_framework.tasks.benchmarks.global_mmlu.GlobalMMLU_German", registry=registry)
|
|
170
|
+
|
|
171
|
+
|
|
172
|
+
def register_sciq_tasks(registry: Registry) -> None:
|
|
173
|
+
"""Register sciq benchmark tasks."""
|
|
174
|
+
register_lazy_task("eval_framework.tasks.benchmarks.sciq.SCIQ_OLMES", registry=registry)
|
|
175
|
+
|
|
176
|
+
|
|
177
|
+
def register_squad_tasks(registry: Registry) -> None:
|
|
178
|
+
"""Register squad benchmark tasks."""
|
|
179
|
+
register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD_OLMES", registry=registry)
|
|
180
|
+
register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD2_MA", registry=registry)
|
|
181
|
+
register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD2_MA_NO_SYSPROMPT", registry=registry)
|
|
182
|
+
|
|
183
|
+
|
|
184
|
+
def register_winogrande_tasks(registry: Registry) -> None:
|
|
185
|
+
"""Register winogrande benchmark tasks."""
|
|
186
|
+
register_lazy_task("eval_framework.tasks.benchmarks.winogrande.WINOGRANDECloze", registry=registry)
|
|
187
|
+
|
|
188
|
+
|
|
189
|
+
def register_csqa_tasks(registry: Registry) -> None:
|
|
190
|
+
"""Register csqa benchmark tasks."""
|
|
191
|
+
register_lazy_task("eval_framework.tasks.benchmarks.csqa.CommonsenseQAMC_OLMES", registry=registry)
|
|
192
|
+
|
|
193
|
+
|
|
194
|
+
def register_drop_tasks(registry: Registry) -> None:
|
|
195
|
+
"""Register drop benchmark tasks."""
|
|
196
|
+
register_lazy_task("eval_framework.tasks.benchmarks.drop.DropCompletion_OLMES", registry=registry)
|
|
197
|
+
register_lazy_task("eval_framework.tasks.benchmarks.drop.DropMC_OLMES", registry=registry)
|
|
198
|
+
|
|
199
|
+
|
|
200
|
+
def register_naturalqs_open_tasks(registry: Registry) -> None:
|
|
201
|
+
"""Register naturalqs_open benchmark tasks."""
|
|
202
|
+
register_lazy_task("eval_framework.tasks.benchmarks.naturalqs_open.NaturalQsOpen", registry=registry)
|
|
203
|
+
register_lazy_task("eval_framework.tasks.benchmarks.naturalqs_open.NaturalQsOpenMC_OLMES", registry=registry)
|
|
204
|
+
|
|
205
|
+
|
|
206
|
+
def register_social_iqa_tasks(registry: Registry) -> None:
|
|
207
|
+
"""Register social_iqa benchmark tasks."""
|
|
208
|
+
register_lazy_task("eval_framework.tasks.benchmarks.social_iqa.SocialIQAMC_OLMES", registry=registry)
|
|
209
|
+
|
|
210
|
+
|
|
211
|
+
def register_medqa_tasks(registry: Registry) -> None:
|
|
212
|
+
"""Register medqa benchmark tasks."""
|
|
213
|
+
register_lazy_task("eval_framework.tasks.benchmarks.medqa.MedQAMC_OLMES", registry=registry)
|
|
@@ -1,82 +0,0 @@
|
|
|
1
|
-
from enum import Enum
|
|
2
|
-
|
|
3
|
-
from eval_framework.tasks.base import BaseTask
|
|
4
|
-
from eval_framework.tasks.registry import register_lazy_task
|
|
5
|
-
|
|
6
|
-
|
|
7
|
-
class TaskNameEnum(Enum):
|
|
8
|
-
@property
|
|
9
|
-
def value(self) -> type[BaseTask]:
|
|
10
|
-
return super().value
|
|
11
|
-
|
|
12
|
-
|
|
13
|
-
def register_all_tasks() -> None:
|
|
14
|
-
"""Register all the benchmark tasks with the eval framework."""
|
|
15
|
-
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2024")
|
|
16
|
-
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2025")
|
|
17
|
-
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2026")
|
|
18
|
-
register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC")
|
|
19
|
-
register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC_IDK")
|
|
20
|
-
register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC_OLMES")
|
|
21
|
-
register_lazy_task("eval_framework.tasks.benchmarks.arc_de.ARC_DE")
|
|
22
|
-
register_lazy_task("eval_framework.tasks.benchmarks.bigcodebench.BigCodeBench_OLMES")
|
|
23
|
-
register_lazy_task("eval_framework.tasks.benchmarks.copa.COPA_OLMES")
|
|
24
|
-
register_lazy_task("eval_framework.tasks.benchmarks.goldenswag.GOLDENSWAG")
|
|
25
|
-
register_lazy_task("eval_framework.tasks.benchmarks.goldenswag.GOLDENSWAG_IDK")
|
|
26
|
-
register_lazy_task("eval_framework.tasks.benchmarks.gpqa.GPQA_OLMES")
|
|
27
|
-
register_lazy_task("eval_framework.tasks.benchmarks.gpqa.GPQA_DIAMOND_COT")
|
|
28
|
-
register_lazy_task("eval_framework.tasks.benchmarks.gsm8k.GSM8K_OLMES")
|
|
29
|
-
register_lazy_task("eval_framework.tasks.benchmarks.gsm8k.GSM8KBPB")
|
|
30
|
-
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinervaBPB")
|
|
31
|
-
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.GSM8KReasoning")
|
|
32
|
-
register_lazy_task("eval_framework.tasks.benchmarks.hellaswag.HELLASWAG")
|
|
33
|
-
register_lazy_task("eval_framework.tasks.benchmarks.hellaswag.HELLASWAG_OLMES")
|
|
34
|
-
register_lazy_task("eval_framework.tasks.benchmarks.humaneval.HumanEvalBPB")
|
|
35
|
-
register_lazy_task("eval_framework.tasks.benchmarks.humaneval.HumanEval_OLMES")
|
|
36
|
-
register_lazy_task("eval_framework.tasks.benchmarks.ifeval.IFEval")
|
|
37
|
-
register_lazy_task("eval_framework.tasks.benchmarks.ifeval.IFEvalDe")
|
|
38
|
-
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATH500")
|
|
39
|
-
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinerva_OLMES")
|
|
40
|
-
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinerva_OLMES_NONL")
|
|
41
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalCpp")
|
|
42
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalJava")
|
|
43
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalJs")
|
|
44
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalPhp")
|
|
45
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalRs")
|
|
46
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalSh")
|
|
47
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPCpp")
|
|
48
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPJava")
|
|
49
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPJs")
|
|
50
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPPhp")
|
|
51
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPRs")
|
|
52
|
-
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPSh")
|
|
53
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPPBPB")
|
|
54
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_OLMES")
|
|
55
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_EvalPlus")
|
|
56
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_BPB_EvalPlus")
|
|
57
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU")
|
|
58
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_IDK")
|
|
59
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_OLMES")
|
|
60
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mmlu.FullTextMMLU")
|
|
61
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO")
|
|
62
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_IDK")
|
|
63
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_OLMES")
|
|
64
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_COT")
|
|
65
|
-
register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_COT")
|
|
66
|
-
register_lazy_task("eval_framework.tasks.benchmarks.global_mmlu.GlobalMMLU")
|
|
67
|
-
register_lazy_task("eval_framework.tasks.benchmarks.global_mmlu.GlobalMMLU_German")
|
|
68
|
-
register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA")
|
|
69
|
-
register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA_IDK")
|
|
70
|
-
register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA_OLMES")
|
|
71
|
-
register_lazy_task("eval_framework.tasks.benchmarks.sciq.SCIQ_OLMES")
|
|
72
|
-
register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD_OLMES")
|
|
73
|
-
register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD2_MA")
|
|
74
|
-
register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD2_MA_NO_SYSPROMPT")
|
|
75
|
-
register_lazy_task("eval_framework.tasks.benchmarks.winogrande.WINOGRANDECloze")
|
|
76
|
-
register_lazy_task("eval_framework.tasks.benchmarks.csqa.CommonsenseQAMC_OLMES")
|
|
77
|
-
register_lazy_task("eval_framework.tasks.benchmarks.drop.DropCompletion_OLMES")
|
|
78
|
-
register_lazy_task("eval_framework.tasks.benchmarks.drop.DropMC_OLMES")
|
|
79
|
-
register_lazy_task("eval_framework.tasks.benchmarks.naturalqs_open.NaturalQsOpen")
|
|
80
|
-
register_lazy_task("eval_framework.tasks.benchmarks.naturalqs_open.NaturalQsOpenMC_OLMES")
|
|
81
|
-
register_lazy_task("eval_framework.tasks.benchmarks.social_iqa.SocialIQAMC_OLMES")
|
|
82
|
-
register_lazy_task("eval_framework.tasks.benchmarks.medqa.MedQAMC_OLMES")
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/drop_process_results.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/README.md
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/utils.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/aggregators/__init__.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/aggregators/aggregators.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/csv_format.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/ifeval.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/json_format.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/repetition.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/rouge_1.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/rouge_2.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/rouge_l.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/text_counter.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/efficiency/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/language.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/models.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_coherence.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_refusal.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_sql.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/base.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/dcs.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/ternary.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/hf_uploader.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/wandb_uploader.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/bigcodebench.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/global_mmlu.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/goldenswag.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/hellaswag.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/humaneval.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/math_reasoning.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/mmlu_pro.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/multipl_e.py
RENAMED
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/naturalqs_open.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/social_iqa.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/winogrande.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/hf-dataset-revisions.json
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|