eval-framework 0.9.0__tar.gz → 0.9.1__tar.gz

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (157) hide show
  1. {eval_framework-0.9.0 → eval_framework-0.9.1}/PKG-INFO +3 -1
  2. {eval_framework-0.9.0 → eval_framework-0.9.1}/README.md +2 -0
  3. {eval_framework-0.9.0 → eval_framework-0.9.1}/pyproject.toml +1 -1
  4. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/base.py +22 -6
  5. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/registry.py +18 -22
  6. eval_framework-0.9.1/src/eval_framework/tasks/task_names.py +213 -0
  7. eval_framework-0.9.0/src/eval_framework/tasks/task_names.py +0 -82
  8. {eval_framework-0.9.0 → eval_framework-0.9.1}/LICENSE +0 -0
  9. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/__init__.py +0 -0
  10. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/base_config.py +0 -0
  11. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/context/__init__.py +0 -0
  12. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/context/determined.py +0 -0
  13. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/context/eval.py +0 -0
  14. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/context/local.py +0 -0
  15. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/evaluation_generator.py +0 -0
  16. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/exceptions.py +0 -0
  17. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/drop_process_results.py +0 -0
  18. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/README.md +0 -0
  19. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/instructions.py +0 -0
  20. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/instructions_registry.py +0 -0
  21. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/instructions_util.py +0 -0
  22. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/external/ifeval_impl/utils.py +0 -0
  23. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/__init__.py +0 -0
  24. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/aleph_alpha.py +0 -0
  25. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/base.py +0 -0
  26. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/huggingface.py +0 -0
  27. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/models.py +0 -0
  28. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/llm/openai.py +0 -0
  29. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/logger.py +0 -0
  30. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/main.py +0 -0
  31. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/__init__.py +0 -0
  32. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/aggregators/__init__.py +0 -0
  33. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/aggregators/aggregators.py +0 -0
  34. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/base.py +0 -0
  35. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/__init__.py +0 -0
  36. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/accuracy_completion.py +0 -0
  37. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/code_assertion.py +0 -0
  38. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/code_execution_pass_at_one.py +0 -0
  39. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/concordance_index.py +0 -0
  40. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/csv_format.py +0 -0
  41. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/drop_completion.py +0 -0
  42. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/exponential_similarity.py +0 -0
  43. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/f1.py +0 -0
  44. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/format_checker.py +0 -0
  45. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/grid_difference.py +0 -0
  46. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/ifeval.py +0 -0
  47. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/json_format.py +0 -0
  48. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/language_checker.py +0 -0
  49. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/length_control.py +0 -0
  50. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/math_minerva_completion.py +0 -0
  51. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/math_reasoning_completion.py +0 -0
  52. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/minerva_math_utils.py +0 -0
  53. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/multipl_e_assertion.py +0 -0
  54. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/placeholder_checker.py +0 -0
  55. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/repetition.py +0 -0
  56. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/rouge_1.py +0 -0
  57. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/rouge_2.py +0 -0
  58. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/rouge_geometric_mean.py +0 -0
  59. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/rouge_l.py +0 -0
  60. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/completion/text_counter.py +0 -0
  61. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/efficiency/__init__.py +0 -0
  62. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/efficiency/bytes_per_sequence_position.py +0 -0
  63. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/__init__.py +0 -0
  64. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/base.py +0 -0
  65. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/chatbot_style_grader.py +0 -0
  66. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/coherence_grader.py +0 -0
  67. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/comparison_grader.py +0 -0
  68. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/conciseness_grader.py +0 -0
  69. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/contains_names_grader.py +0 -0
  70. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/format_correctness_grader.py +0 -0
  71. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/instruction_grader.py +0 -0
  72. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/language.py +0 -0
  73. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/long_context_grader.py +0 -0
  74. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/models.py +0 -0
  75. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/refusal_grader.py +0 -0
  76. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/sql_quality_grader.py +0 -0
  77. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/graders/summary_world_knowledge_grader.py +0 -0
  78. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_chatbot_style.py +0 -0
  79. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_coherence.py +0 -0
  80. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_completion_accuracy.py +0 -0
  81. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_conciseness.py +0 -0
  82. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_contains_names.py +0 -0
  83. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_format_correctness.py +0 -0
  84. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_instruction.py +0 -0
  85. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_mtbench_pair.py +0 -0
  86. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_mtbench_single.py +0 -0
  87. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_refusal.py +0 -0
  88. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_sql.py +0 -0
  89. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/llm_judge_world_knowledge.py +0 -0
  90. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/llm/utils.py +0 -0
  91. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/__init__.py +0 -0
  92. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/accuracy_loglikelihood.py +0 -0
  93. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/base.py +0 -0
  94. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/bits_per_byte.py +0 -0
  95. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/confidence_weighted_accuracy.py +0 -0
  96. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/dcs.py +0 -0
  97. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/probability_mass.py +0 -0
  98. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/metrics/loglikelihood/ternary.py +0 -0
  99. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/py.typed +0 -0
  100. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/response_generator.py +0 -0
  101. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/__init__.py +0 -0
  102. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/base.py +0 -0
  103. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/hf_uploader.py +0 -0
  104. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/result_processor.py +0 -0
  105. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/result_processors/wandb_uploader.py +0 -0
  106. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/run.py +0 -0
  107. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/run_direct.py +0 -0
  108. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/shared/types.py +0 -0
  109. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/suite.py +0 -0
  110. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/Dockerfile_codebench +0 -0
  111. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/__init__.py +0 -0
  112. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/__init__.py +0 -0
  113. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/arc.py +0 -0
  114. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/arc_de.py +0 -0
  115. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/bigcodebench.py +0 -0
  116. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/copa.py +0 -0
  117. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/csqa.py +0 -0
  118. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/drop.py +0 -0
  119. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/global_mmlu.py +0 -0
  120. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/goldenswag.py +0 -0
  121. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/gpqa.py +0 -0
  122. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/gsm8k.py +0 -0
  123. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/hellaswag.py +0 -0
  124. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/humaneval.py +0 -0
  125. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/ifeval.py +0 -0
  126. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/math_reasoning.py +0 -0
  127. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/mbpp.py +0 -0
  128. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/medqa.py +0 -0
  129. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/mmlu.py +0 -0
  130. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/mmlu_pro.py +0 -0
  131. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/multipl_e.py +0 -0
  132. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/naturalqs_open.py +0 -0
  133. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/piqa.py +0 -0
  134. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/sciq.py +0 -0
  135. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/social_iqa.py +0 -0
  136. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/squad.py +0 -0
  137. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/benchmarks/winogrande.py +0 -0
  138. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/dataset_revisions.py +0 -0
  139. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/eval_config.py +0 -0
  140. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/frozen-hf-dataset-revisions.json +0 -0
  141. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/hf-dataset-revisions.json +0 -0
  142. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/markdown_doc.py +0 -0
  143. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/perturbation.py +0 -0
  144. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/task_loader.py +0 -0
  145. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/task_style.py +0 -0
  146. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/tasks/utils.py +0 -0
  147. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/constants.py +0 -0
  148. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/file_ops.py +0 -0
  149. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/helpers.py +0 -0
  150. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/logging.py +0 -0
  151. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/packaging.py +0 -0
  152. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/eval_framework/utils/tqdm_handler.py +0 -0
  153. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/template_formatting/README.md +0 -0
  154. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/template_formatting/__init__.py +0 -0
  155. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/template_formatting/formatter.py +0 -0
  156. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/template_formatting/mistral_formatter.py +0 -0
  157. {eval_framework-0.9.0 → eval_framework-0.9.1}/src/template_formatting/py.typed +0 -0
@@ -1,6 +1,6 @@
1
1
  Metadata-Version: 2.3
2
2
  Name: eval-framework
3
- Version: 0.9.0
3
+ Version: 0.9.1
4
4
  Summary: Evaluation Framework
5
5
  Author: Aleph Alpha Research
6
6
  License: Apache License
@@ -450,11 +450,13 @@ from eval_framework.main import main
450
450
  from eval_framework.tasks.eval_config import EvalConfig
451
451
  from template_formatting.formatter import HFFormatter
452
452
 
453
+
453
454
  # Define your model
454
455
  class MyHuggingFaceModel(HFLLM):
455
456
  LLM_NAME = "microsoft/DialoGPT-medium"
456
457
  DEFAULT_FORMATTER = partial(HFFormatter, "microsoft/DialoGPT-medium")
457
458
 
459
+
458
460
  if __name__ == "__main__":
459
461
  # Initialize your model
460
462
  llm = MyHuggingFaceModel()
@@ -189,11 +189,13 @@ from eval_framework.main import main
189
189
  from eval_framework.tasks.eval_config import EvalConfig
190
190
  from template_formatting.formatter import HFFormatter
191
191
 
192
+
192
193
  # Define your model
193
194
  class MyHuggingFaceModel(HFLLM):
194
195
  LLM_NAME = "microsoft/DialoGPT-medium"
195
196
  DEFAULT_FORMATTER = partial(HFFormatter, "microsoft/DialoGPT-medium")
196
197
 
198
+
197
199
  if __name__ == "__main__":
198
200
  # Initialize your model
199
201
  llm = MyHuggingFaceModel()
@@ -1,6 +1,6 @@
1
1
  [project]
2
2
  name = "eval-framework"
3
- version = "0.9.0"
3
+ version = "0.9.1"
4
4
  description = "Evaluation Framework"
5
5
  readme = "README.md"
6
6
  license = { file = "LICENSE" }
@@ -190,11 +190,27 @@ class BaseTask[SubjectType](Task):
190
190
 
191
191
  assert hasattr(self, "SUBJECTS") and len(self.SUBJECTS) > 0
192
192
  if isinstance(self.SUBJECTS[0], tuple):
193
- # subjects are specified as strings but we need tuples
194
- filters = [tuple(item.strip() for item in subject.split(",")) for subject in custom_subjects]
193
+ # subjects are specified as comma-separated strings but tuple positions may each hold a
194
+ # different type (e.g. tuple[str, int, str]). Infer the expected type per position from an
195
+ # actual subject and cast each part back to it, so it compares equal to the real values
196
+ # below instead of just their str() form. "*" is a wildcard sentinel and stays a string.
197
+ num_items = len(self.SUBJECTS[0])
198
+ position_types = [type(self.SUBJECTS[0][i]) for i in range(num_items)]
199
+
200
+ def cast(raw: str, i: int) -> Any:
201
+ raw = raw.strip()
202
+ return raw if raw == "*" else position_types[i](raw)
203
+
204
+ filters = []
205
+ for custom_subject in custom_subjects:
206
+ parts = custom_subject.split(",")
207
+ assert len(parts) == num_items, (
208
+ f"Subject '{custom_subject}' has {len(parts)} parts, expected {num_items} for "
209
+ f"task {self.display_name()}"
210
+ )
211
+ filters.append(tuple(cast(part, i) for i, part in enumerate(parts)))
195
212
 
196
213
  # check if all parts of custom subjects exists (* is a wildcard)
197
- num_items = len(self.SUBJECTS[0])
198
214
  legal_values = [
199
215
  set([s[i] for s in self.SUBJECTS if isinstance(s, tuple)] + ["*"]) for i in range(num_items)
200
216
  ]
@@ -204,18 +220,18 @@ class BaseTask[SubjectType](Task):
204
220
  assert v in legal_values[i], f"Subject part {v} not found in task {self.__class__.__name__}"
205
221
 
206
222
  # filter task subjects. * is a supported wildcard for a specific item in a tuple, e.g. "DE_DE, *"
207
- chosen_subjects = []
223
+ chosen_subjects: list[tuple] = []
208
224
  for subject in self.SUBJECTS:
209
225
  subject_tuple = subject if isinstance(subject, tuple) else tuple(str(subject).split(","))
210
226
  for filter in filters:
211
227
  if all(filter[i] == "*" or filter[i] == subject_tuple[i] for i in range(num_items)):
212
228
  chosen_subjects.append(subject_tuple)
213
229
  break
214
- return chosen_subjects # type: ignore[return-value]
230
+ return chosen_subjects
215
231
  else:
216
232
  for cs in custom_subjects:
217
233
  assert cs in self.SUBJECTS, f"Subject {cs} not found in task {self.__class__.__name__}"
218
- return custom_subjects # type: ignore[return-value]
234
+ return custom_subjects
219
235
 
220
236
  def _load_hf_dataset(self, **kwargs: Any) -> Any:
221
237
  cache_dir: str = os.environ.get("HF_DATASET_CACHE_DIR", f"{Path.home()}/.cache/huggingface/datasets")
@@ -223,20 +223,15 @@ class _Eager(EvalFactory):
223
223
 
224
224
 
225
225
  class Registry:
226
- """A registry for tasks with support for lazy loading.
227
-
228
- Task names are hashed based on the upper-case name, to avoid issues with
229
- ambiguous naming.
230
- """
226
+ """A registry for Tasks"""
231
227
 
232
228
  def __init__(self) -> None:
233
- # TODO: Lookup only with upper names
234
- self._registry: dict[str, tuple[str, EvalFactory]] = dict()
229
+ self._registry: dict[str, EvalFactory] = dict()
235
230
 
236
231
  def __iter__(self) -> Iterator[str]:
237
232
  """Iterate over all task names in the registry."""
238
- for name, _ in self._registry.values():
239
- yield name
233
+ for factory in self._registry.values():
234
+ yield factory.id()
240
235
 
241
236
  def task_names(self) -> list[str]:
242
237
  """The names of all registered tasks."""
@@ -244,7 +239,8 @@ class Registry:
244
239
 
245
240
  def items(self) -> Iterator[tuple[str, EvalFactory]]:
246
241
  """Iterate over `(task name, EvalFactory)` pairs in the registry."""
247
- yield from self._registry.values()
242
+ for factory in self._registry.values():
243
+ yield factory.id(), factory
248
244
 
249
245
  @staticmethod
250
246
  def _task_key(name: str, /) -> str:
@@ -262,26 +258,25 @@ class Registry:
262
258
  def __getitem__(self, name: str, /) -> EvalFactory:
263
259
  task_key = self._task_key(name)
264
260
  try:
265
- _, factory = self._registry[task_key]
261
+ return self._registry[task_key]
266
262
  except KeyError:
267
263
  raise KeyError(f"Task not found: {name=} with task_key {task_key=}")
268
264
 
269
- return factory
270
-
271
- def __setitem__(self, name: str, factory: EvalFactory) -> None:
272
- task_key = self._task_key(name)
265
+ def add(self, factory: EvalFactory) -> None:
266
+ """Register a factory under the key derived from its ``id()``."""
267
+ task_key = self._task_key(factory.id())
273
268
  if task_key in self._registry:
274
269
  raise ValueError(f"Cannot register duplicate task with key: {task_key}")
275
270
 
276
- self._registry[task_key] = (name, factory)
271
+ self._registry[task_key] = factory
277
272
 
278
273
  def register(self, task: type[BaseTask]) -> str:
279
274
  """The class name is used as the task name."""
280
275
  if not issubclass(task, BaseTask):
281
276
  raise ValueError(f"Can only register subclasses of BaseTask, got {task}")
282
- name = task.__name__
283
- self[name] = _Eager(task)
284
- return name
277
+ factory = _Eager(task)
278
+ self.add(factory)
279
+ return factory.id()
285
280
 
286
281
  def register_lazy(self, class_path: str, /) -> None:
287
282
  """Register a task by its dotted class path, without importing its module."""
@@ -291,7 +286,7 @@ class Registry:
291
286
  "`eval_framework.tasks.benchmarks.mmlu.MMLU`): "
292
287
  )
293
288
  base_module, class_name = class_path.rsplit(".", maxsplit=1)
294
- self[class_name] = _Lazy(class_name=class_name, module=base_module)
289
+ self.add(_Lazy(class_name=class_name, module=base_module))
295
290
 
296
291
 
297
292
  _REGISTRY = Registry()
@@ -335,6 +330,7 @@ def register_task(task: type[BaseTask]) -> str:
335
330
  return registry().register(task)
336
331
 
337
332
 
338
- def register_lazy_task(class_path: str, /) -> None:
333
+ def register_lazy_task(class_path: str, /, registry: Registry | None = None) -> None:
339
334
  """Register a task by its dotted class path, without importing its module."""
340
- registry().register_lazy(class_path)
335
+ r = registry if registry is not None else _REGISTRY
336
+ r.register_lazy(class_path)
@@ -0,0 +1,213 @@
1
+ from enum import Enum
2
+
3
+ from eval_framework.tasks.base import BaseTask
4
+ from eval_framework.tasks.registry import Registry, register_lazy_task
5
+ from eval_framework.tasks.registry import registry as global_registry
6
+
7
+
8
+ class TaskNameEnum(Enum):
9
+ @property
10
+ def value(self) -> type[BaseTask]:
11
+ return super().value
12
+
13
+
14
+ def register_all_tasks(registry: Registry | None = None) -> None:
15
+ """Register all the benchmark tasks with the eval framework
16
+
17
+ Uses global registry by default.
18
+ """
19
+ registry = registry if registry is not None else global_registry()
20
+
21
+ register_math_reasoning_tasks(registry=registry)
22
+ register_arc_tasks(registry=registry)
23
+ register_arc_de_tasks(registry=registry)
24
+ register_bigcodebench_tasks(registry=registry)
25
+ register_copa_tasks(registry=registry)
26
+ register_goldenswag_tasks(registry=registry)
27
+ register_gpqa_tasks(registry=registry)
28
+ register_gsm8k_tasks(registry=registry)
29
+ register_hellaswag_tasks(registry=registry)
30
+ register_humaneval_tasks(registry=registry)
31
+ register_ifeval_tasks(registry=registry)
32
+ register_multipl_e_tasks(registry=registry)
33
+ register_mbpp_tasks(registry=registry)
34
+ register_mmlu_tasks(registry=registry)
35
+ register_mmlu_pro_tasks(registry=registry)
36
+ register_global_mmlu_tasks(registry=registry)
37
+ register_piqa_tasks(registry=registry)
38
+ register_sciq_tasks(registry=registry)
39
+ register_squad_tasks(registry=registry)
40
+ register_winogrande_tasks(registry=registry)
41
+ register_csqa_tasks(registry=registry)
42
+ register_drop_tasks(registry=registry)
43
+ register_naturalqs_open_tasks(registry=registry)
44
+ register_social_iqa_tasks(registry=registry)
45
+ register_medqa_tasks(registry=registry)
46
+
47
+
48
+ def register_arc_tasks(registry: Registry) -> None:
49
+ """Register arc benchmark tasks."""
50
+ register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC", registry=registry)
51
+ register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC_IDK", registry=registry)
52
+ register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC_OLMES", registry=registry)
53
+
54
+
55
+ def register_hellaswag_tasks(registry: Registry) -> None:
56
+ """Register hellaswag benchmark tasks."""
57
+ register_lazy_task("eval_framework.tasks.benchmarks.hellaswag.HELLASWAG", registry=registry)
58
+ register_lazy_task("eval_framework.tasks.benchmarks.hellaswag.HELLASWAG_OLMES", registry=registry)
59
+
60
+
61
+ def register_piqa_tasks(registry: Registry) -> None:
62
+ """Register piqa benchmark tasks."""
63
+ register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA", registry=registry)
64
+ register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA_IDK", registry=registry)
65
+ register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA_OLMES", registry=registry)
66
+
67
+
68
+ def register_gpqa_tasks(registry: Registry) -> None:
69
+ """Register gpqa benchmark tasks."""
70
+ register_lazy_task("eval_framework.tasks.benchmarks.gpqa.GPQA_OLMES", registry=registry)
71
+ register_lazy_task("eval_framework.tasks.benchmarks.gpqa.GPQA_DIAMOND_COT", registry=registry)
72
+
73
+
74
+ def register_gsm8k_tasks(registry: Registry) -> None:
75
+ """Register gsm8k benchmark tasks."""
76
+ register_lazy_task("eval_framework.tasks.benchmarks.gsm8k.GSM8K_OLMES", registry=registry)
77
+ register_lazy_task("eval_framework.tasks.benchmarks.gsm8k.GSM8KBPB", registry=registry)
78
+
79
+
80
+ def register_math_reasoning_tasks(registry: Registry) -> None:
81
+ """Register math_reasoning benchmark tasks."""
82
+ register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2024", registry=registry)
83
+ register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2026", registry=registry)
84
+ register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2025", registry=registry)
85
+ register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinervaBPB", registry=registry)
86
+ register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.GSM8KReasoning", registry=registry)
87
+ register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATH500", registry=registry)
88
+ register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinerva_OLMES", registry=registry)
89
+ register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinerva_OLMES_NONL", registry=registry)
90
+
91
+
92
+ def register_mmlu_tasks(registry: Registry) -> None:
93
+ """Register mmlu benchmark tasks."""
94
+ register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU", registry=registry)
95
+ register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_IDK", registry=registry)
96
+ register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_OLMES", registry=registry)
97
+ register_lazy_task("eval_framework.tasks.benchmarks.mmlu.FullTextMMLU", registry=registry)
98
+ register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_COT", registry=registry)
99
+
100
+
101
+ def register_humaneval_tasks(registry: Registry) -> None:
102
+ """Register humaneval benchmark tasks."""
103
+ register_lazy_task("eval_framework.tasks.benchmarks.humaneval.HumanEvalBPB", registry=registry)
104
+ register_lazy_task("eval_framework.tasks.benchmarks.humaneval.HumanEval_OLMES", registry=registry)
105
+
106
+
107
+ def register_mbpp_tasks(registry: Registry) -> None:
108
+ """Register mbpp benchmark tasks."""
109
+ register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPPBPB", registry=registry)
110
+ register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_OLMES", registry=registry)
111
+ register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_EvalPlus", registry=registry)
112
+ register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_BPB_EvalPlus", registry=registry)
113
+
114
+
115
+ def register_bigcodebench_tasks(registry: Registry) -> None:
116
+ """Register bigcodebench benchmark tasks."""
117
+ register_lazy_task("eval_framework.tasks.benchmarks.bigcodebench.BigCodeBench_OLMES", registry=registry)
118
+
119
+
120
+ def register_arc_de_tasks(registry: Registry) -> None:
121
+ """Register arc_de benchmark tasks."""
122
+ register_lazy_task("eval_framework.tasks.benchmarks.arc_de.ARC_DE", registry=registry)
123
+
124
+
125
+ def register_copa_tasks(registry: Registry) -> None:
126
+ """Register copa benchmark tasks."""
127
+ register_lazy_task("eval_framework.tasks.benchmarks.copa.COPA_OLMES", registry=registry)
128
+
129
+
130
+ def register_goldenswag_tasks(registry: Registry) -> None:
131
+ """Register goldenswag benchmark tasks."""
132
+ register_lazy_task("eval_framework.tasks.benchmarks.goldenswag.GOLDENSWAG", registry=registry)
133
+ register_lazy_task("eval_framework.tasks.benchmarks.goldenswag.GOLDENSWAG_IDK", registry=registry)
134
+
135
+
136
+ def register_ifeval_tasks(registry: Registry) -> None:
137
+ """Register ifeval benchmark tasks."""
138
+ register_lazy_task("eval_framework.tasks.benchmarks.ifeval.IFEval", registry=registry)
139
+ register_lazy_task("eval_framework.tasks.benchmarks.ifeval.IFEvalDe", registry=registry)
140
+
141
+
142
+ def register_multipl_e_tasks(registry: Registry) -> None:
143
+ """Register multipl_e benchmark tasks."""
144
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalCpp", registry=registry)
145
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalJava", registry=registry)
146
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalJs", registry=registry)
147
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalPhp", registry=registry)
148
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalRs", registry=registry)
149
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalSh", registry=registry)
150
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPCpp", registry=registry)
151
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPJava", registry=registry)
152
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPJs", registry=registry)
153
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPPhp", registry=registry)
154
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPRs", registry=registry)
155
+ register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPSh", registry=registry)
156
+
157
+
158
+ def register_mmlu_pro_tasks(registry: Registry) -> None:
159
+ """Register mmlu_pro benchmark tasks."""
160
+ register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO", registry=registry)
161
+ register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_IDK", registry=registry)
162
+ register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_OLMES", registry=registry)
163
+ register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_COT", registry=registry)
164
+
165
+
166
+ def register_global_mmlu_tasks(registry: Registry) -> None:
167
+ """Register global_mmlu benchmark tasks."""
168
+ register_lazy_task("eval_framework.tasks.benchmarks.global_mmlu.GlobalMMLU", registry=registry)
169
+ register_lazy_task("eval_framework.tasks.benchmarks.global_mmlu.GlobalMMLU_German", registry=registry)
170
+
171
+
172
+ def register_sciq_tasks(registry: Registry) -> None:
173
+ """Register sciq benchmark tasks."""
174
+ register_lazy_task("eval_framework.tasks.benchmarks.sciq.SCIQ_OLMES", registry=registry)
175
+
176
+
177
+ def register_squad_tasks(registry: Registry) -> None:
178
+ """Register squad benchmark tasks."""
179
+ register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD_OLMES", registry=registry)
180
+ register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD2_MA", registry=registry)
181
+ register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD2_MA_NO_SYSPROMPT", registry=registry)
182
+
183
+
184
+ def register_winogrande_tasks(registry: Registry) -> None:
185
+ """Register winogrande benchmark tasks."""
186
+ register_lazy_task("eval_framework.tasks.benchmarks.winogrande.WINOGRANDECloze", registry=registry)
187
+
188
+
189
+ def register_csqa_tasks(registry: Registry) -> None:
190
+ """Register csqa benchmark tasks."""
191
+ register_lazy_task("eval_framework.tasks.benchmarks.csqa.CommonsenseQAMC_OLMES", registry=registry)
192
+
193
+
194
+ def register_drop_tasks(registry: Registry) -> None:
195
+ """Register drop benchmark tasks."""
196
+ register_lazy_task("eval_framework.tasks.benchmarks.drop.DropCompletion_OLMES", registry=registry)
197
+ register_lazy_task("eval_framework.tasks.benchmarks.drop.DropMC_OLMES", registry=registry)
198
+
199
+
200
+ def register_naturalqs_open_tasks(registry: Registry) -> None:
201
+ """Register naturalqs_open benchmark tasks."""
202
+ register_lazy_task("eval_framework.tasks.benchmarks.naturalqs_open.NaturalQsOpen", registry=registry)
203
+ register_lazy_task("eval_framework.tasks.benchmarks.naturalqs_open.NaturalQsOpenMC_OLMES", registry=registry)
204
+
205
+
206
+ def register_social_iqa_tasks(registry: Registry) -> None:
207
+ """Register social_iqa benchmark tasks."""
208
+ register_lazy_task("eval_framework.tasks.benchmarks.social_iqa.SocialIQAMC_OLMES", registry=registry)
209
+
210
+
211
+ def register_medqa_tasks(registry: Registry) -> None:
212
+ """Register medqa benchmark tasks."""
213
+ register_lazy_task("eval_framework.tasks.benchmarks.medqa.MedQAMC_OLMES", registry=registry)
@@ -1,82 +0,0 @@
1
- from enum import Enum
2
-
3
- from eval_framework.tasks.base import BaseTask
4
- from eval_framework.tasks.registry import register_lazy_task
5
-
6
-
7
- class TaskNameEnum(Enum):
8
- @property
9
- def value(self) -> type[BaseTask]:
10
- return super().value
11
-
12
-
13
- def register_all_tasks() -> None:
14
- """Register all the benchmark tasks with the eval framework."""
15
- register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2024")
16
- register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2025")
17
- register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.AIME2026")
18
- register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC")
19
- register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC_IDK")
20
- register_lazy_task("eval_framework.tasks.benchmarks.arc.ARC_OLMES")
21
- register_lazy_task("eval_framework.tasks.benchmarks.arc_de.ARC_DE")
22
- register_lazy_task("eval_framework.tasks.benchmarks.bigcodebench.BigCodeBench_OLMES")
23
- register_lazy_task("eval_framework.tasks.benchmarks.copa.COPA_OLMES")
24
- register_lazy_task("eval_framework.tasks.benchmarks.goldenswag.GOLDENSWAG")
25
- register_lazy_task("eval_framework.tasks.benchmarks.goldenswag.GOLDENSWAG_IDK")
26
- register_lazy_task("eval_framework.tasks.benchmarks.gpqa.GPQA_OLMES")
27
- register_lazy_task("eval_framework.tasks.benchmarks.gpqa.GPQA_DIAMOND_COT")
28
- register_lazy_task("eval_framework.tasks.benchmarks.gsm8k.GSM8K_OLMES")
29
- register_lazy_task("eval_framework.tasks.benchmarks.gsm8k.GSM8KBPB")
30
- register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinervaBPB")
31
- register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.GSM8KReasoning")
32
- register_lazy_task("eval_framework.tasks.benchmarks.hellaswag.HELLASWAG")
33
- register_lazy_task("eval_framework.tasks.benchmarks.hellaswag.HELLASWAG_OLMES")
34
- register_lazy_task("eval_framework.tasks.benchmarks.humaneval.HumanEvalBPB")
35
- register_lazy_task("eval_framework.tasks.benchmarks.humaneval.HumanEval_OLMES")
36
- register_lazy_task("eval_framework.tasks.benchmarks.ifeval.IFEval")
37
- register_lazy_task("eval_framework.tasks.benchmarks.ifeval.IFEvalDe")
38
- register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATH500")
39
- register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinerva_OLMES")
40
- register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinerva_OLMES_NONL")
41
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalCpp")
42
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalJava")
43
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalJs")
44
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalPhp")
45
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalRs")
46
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalSh")
47
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPCpp")
48
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPJava")
49
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPJs")
50
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPPhp")
51
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPRs")
52
- register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEMBPPSh")
53
- register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPPBPB")
54
- register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_OLMES")
55
- register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_EvalPlus")
56
- register_lazy_task("eval_framework.tasks.benchmarks.mbpp.MBPP_BPB_EvalPlus")
57
- register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU")
58
- register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_IDK")
59
- register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_OLMES")
60
- register_lazy_task("eval_framework.tasks.benchmarks.mmlu.FullTextMMLU")
61
- register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO")
62
- register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_IDK")
63
- register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_OLMES")
64
- register_lazy_task("eval_framework.tasks.benchmarks.mmlu_pro.MMLU_PRO_COT")
65
- register_lazy_task("eval_framework.tasks.benchmarks.mmlu.MMLU_COT")
66
- register_lazy_task("eval_framework.tasks.benchmarks.global_mmlu.GlobalMMLU")
67
- register_lazy_task("eval_framework.tasks.benchmarks.global_mmlu.GlobalMMLU_German")
68
- register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA")
69
- register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA_IDK")
70
- register_lazy_task("eval_framework.tasks.benchmarks.piqa.PIQA_OLMES")
71
- register_lazy_task("eval_framework.tasks.benchmarks.sciq.SCIQ_OLMES")
72
- register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD_OLMES")
73
- register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD2_MA")
74
- register_lazy_task("eval_framework.tasks.benchmarks.squad.SQuAD2_MA_NO_SYSPROMPT")
75
- register_lazy_task("eval_framework.tasks.benchmarks.winogrande.WINOGRANDECloze")
76
- register_lazy_task("eval_framework.tasks.benchmarks.csqa.CommonsenseQAMC_OLMES")
77
- register_lazy_task("eval_framework.tasks.benchmarks.drop.DropCompletion_OLMES")
78
- register_lazy_task("eval_framework.tasks.benchmarks.drop.DropMC_OLMES")
79
- register_lazy_task("eval_framework.tasks.benchmarks.naturalqs_open.NaturalQsOpen")
80
- register_lazy_task("eval_framework.tasks.benchmarks.naturalqs_open.NaturalQsOpenMC_OLMES")
81
- register_lazy_task("eval_framework.tasks.benchmarks.social_iqa.SocialIQAMC_OLMES")
82
- register_lazy_task("eval_framework.tasks.benchmarks.medqa.MedQAMC_OLMES")
File without changes