eval-framework 0.8.0__tar.gz → 0.8.1__tar.gz
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- {eval_framework-0.8.0 → eval_framework-0.8.1}/PKG-INFO +2 -2
- {eval_framework-0.8.0 → eval_framework-0.8.1}/pyproject.toml +2 -2
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/math_reasoning.py +11 -4
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/task_names.py +1 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/LICENSE +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/README.md +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/base_config.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/context/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/context/determined.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/context/eval.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/context/local.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/evaluation_generator.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/exceptions.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/external/drop_process_results.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/external/ifeval_impl/README.md +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/external/ifeval_impl/instructions.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/external/ifeval_impl/instructions_registry.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/external/ifeval_impl/instructions_util.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/external/ifeval_impl/utils.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/llm/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/llm/aleph_alpha.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/llm/base.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/llm/huggingface.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/llm/models.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/llm/openai.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/logger.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/main.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/aggregators/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/aggregators/aggregators.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/base.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/accuracy_completion.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/code_assertion.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/code_execution_pass_at_one.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/concordance_index.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/csv_format.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/drop_completion.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/exponential_similarity.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/f1.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/format_checker.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/grid_difference.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/ifeval.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/json_format.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/language_checker.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/length_control.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/math_minerva_completion.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/math_reasoning_completion.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/minerva_math_utils.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/multipl_e_assertion.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/placeholder_checker.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/repetition.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/rouge_1.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/rouge_2.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/rouge_geometric_mean.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/rouge_l.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/text_counter.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/efficiency/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/efficiency/bytes_per_sequence_position.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/base.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/chatbot_style_grader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/coherence_grader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/comparison_grader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/conciseness_grader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/contains_names_grader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/format_correctness_grader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/instruction_grader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/language.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/long_context_grader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/models.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/refusal_grader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/sql_quality_grader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/summary_world_knowledge_grader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_chatbot_style.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_coherence.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_completion_accuracy.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_conciseness.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_contains_names.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_format_correctness.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_instruction.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_mtbench_pair.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_mtbench_single.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_refusal.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_sql.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_world_knowledge.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/utils.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/accuracy_loglikelihood.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/base.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/bits_per_byte.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/confidence_weighted_accuracy.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/dcs.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/probability_mass.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/ternary.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/py.typed +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/response_generator.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/result_processors/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/result_processors/base.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/result_processors/hf_uploader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/result_processors/result_processor.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/result_processors/wandb_uploader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/run.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/run_direct.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/shared/types.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/suite.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/Dockerfile_codebench +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/base.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/arc.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/arc_de.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/bigcodebench.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/copa.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/csqa.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/drop.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/global_mmlu.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/goldenswag.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/gpqa.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/gsm8k.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/hellaswag.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/humaneval.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/ifeval.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/mbpp.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/medqa.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/mmlu.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/mmlu_pro.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/multipl_e.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/naturalqs_open.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/piqa.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/sciq.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/social_iqa.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/squad.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/triviaqa.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/winogrande.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/dataset_revisions.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/eval_config.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/frozen-hf-dataset-revisions.json +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/hf-dataset-revisions.json +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/perturbation.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/registry.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/task_loader.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/task_style.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/utils.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/utils/constants.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/utils/file_ops.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/utils/generate_task_docs.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/utils/helpers.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/utils/logging.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/utils/packaging.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/utils/tqdm_handler.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/template_formatting/README.md +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/template_formatting/__init__.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/template_formatting/formatter.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/template_formatting/mistral_formatter.py +0 -0
- {eval_framework-0.8.0 → eval_framework-0.8.1}/src/template_formatting/py.typed +0 -0
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
Metadata-Version: 2.3
|
|
2
2
|
Name: eval-framework
|
|
3
|
-
Version: 0.8.
|
|
3
|
+
Version: 0.8.1
|
|
4
4
|
Summary: Evaluation Framework
|
|
5
5
|
Author: Aleph Alpha Research
|
|
6
6
|
License: Apache License
|
|
@@ -246,7 +246,7 @@ Requires-Dist: transformers>=4.45.2,<5 ; extra == 'openai'
|
|
|
246
246
|
Requires-Dist: transformers>=4.45.2,<5 ; extra == 'optional'
|
|
247
247
|
Requires-Dist: jinja2>=3.1.6,<4 ; extra == 'optional'
|
|
248
248
|
Requires-Dist: transformers>=4.45.2,<5 ; extra == 'transformers'
|
|
249
|
-
Requires-Dist: torch>=2.
|
|
249
|
+
Requires-Dist: torch>=2.13.0,<3 ; extra == 'transformers'
|
|
250
250
|
Requires-Dist: accelerate>=1.14.0,<2 ; extra == 'transformers'
|
|
251
251
|
Requires-Python: >=3.12, <3.13
|
|
252
252
|
Project-URL: repository, https://github.com/Aleph-Alpha-Research/eval-framework
|
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
[project]
|
|
2
2
|
name = "eval-framework"
|
|
3
|
-
version = "0.8.
|
|
3
|
+
version = "0.8.1"
|
|
4
4
|
description = "Evaluation Framework"
|
|
5
5
|
readme = "README.md"
|
|
6
6
|
license = { file = "LICENSE" }
|
|
@@ -60,7 +60,7 @@ openai = [
|
|
|
60
60
|
]
|
|
61
61
|
transformers = [
|
|
62
62
|
"transformers>=4.45.2,<5",
|
|
63
|
-
"torch>=2.
|
|
63
|
+
"torch>=2.13.0,<3",
|
|
64
64
|
"accelerate>=1.14.0,<2",
|
|
65
65
|
]
|
|
66
66
|
accelerate = ["accelerate"]
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/math_reasoning.py
RENAMED
|
@@ -10,10 +10,7 @@ from eval_framework.metrics.completion.math_minerva_completion import (
|
|
|
10
10
|
MathMinervaCompletionRelaxed,
|
|
11
11
|
)
|
|
12
12
|
from eval_framework.metrics.completion.math_reasoning_completion import MathReasoningCompletion
|
|
13
|
-
from eval_framework.metrics.completion.minerva_math_utils import
|
|
14
|
-
extract_answers,
|
|
15
|
-
normalized_gold_from_solution,
|
|
16
|
-
)
|
|
13
|
+
from eval_framework.metrics.completion.minerva_math_utils import extract_answers, normalized_gold_from_solution
|
|
17
14
|
from eval_framework.tasks.base import NO_SUBJECT, RANDOM_SEED, BaseTask, Language, ResponseType, Sample, SubjectType
|
|
18
15
|
from eval_framework.tasks.dataset_revisions import HF_REVISIONS_LOCKFILE
|
|
19
16
|
from eval_framework.tasks.task_style import BPBStyle
|
|
@@ -775,6 +772,16 @@ class MATHMinerva_OLMES(MATHMinerva):
|
|
|
775
772
|
return _OLMES_FEWSHOTS[: self.num_fewshot]
|
|
776
773
|
|
|
777
774
|
|
|
775
|
+
class MATHMinerva_OLMES_NONL(MATHMinerva_OLMES):
|
|
776
|
+
NAME = "MATHMinerva_OLMES_NONL"
|
|
777
|
+
|
|
778
|
+
def __init__(self, num_fewshot: int = 4) -> None:
|
|
779
|
+
if num_fewshot != 4:
|
|
780
|
+
logger.warning("MATHMinerva_OLMES_NONL supports a fixed num_fewshot of 4.")
|
|
781
|
+
super().__init__(num_fewshot=4)
|
|
782
|
+
self.stop_sequences = ["Problem:"]
|
|
783
|
+
|
|
784
|
+
|
|
778
785
|
class MATHMinervaBPB(MATHMinerva_OLMES):
|
|
779
786
|
REVISION_LOCKFILE = HF_REVISIONS_LOCKFILE
|
|
780
787
|
NAME = "MATHMinervaBPB"
|
|
@@ -36,6 +36,7 @@ def register_all_tasks() -> None:
|
|
|
36
36
|
register_lazy_task("eval_framework.tasks.benchmarks.ifeval.IFEvalDe")
|
|
37
37
|
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATH500")
|
|
38
38
|
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinerva_OLMES")
|
|
39
|
+
register_lazy_task("eval_framework.tasks.benchmarks.math_reasoning.MATHMinerva_OLMES_NONL")
|
|
39
40
|
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalCpp")
|
|
40
41
|
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalJava")
|
|
41
42
|
register_lazy_task("eval_framework.tasks.benchmarks.multipl_e.MultiPLEHumanEvalJs")
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/external/drop_process_results.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/external/ifeval_impl/README.md
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/external/ifeval_impl/utils.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/aggregators/__init__.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/aggregators/aggregators.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/csv_format.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/ifeval.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/json_format.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/repetition.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/rouge_1.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/rouge_2.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/rouge_l.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/completion/text_counter.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/efficiency/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/language.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/graders/models.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_coherence.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_refusal.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/llm/llm_judge_sql.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/base.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/dcs.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/metrics/loglikelihood/ternary.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/result_processors/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/result_processors/hf_uploader.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/result_processors/wandb_uploader.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/bigcodebench.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/global_mmlu.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/goldenswag.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/hellaswag.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/humaneval.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/mmlu_pro.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/multipl_e.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/naturalqs_open.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/social_iqa.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/triviaqa.py
RENAMED
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/benchmarks/winogrande.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/tasks/hf-dataset-revisions.json
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.8.0 → eval_framework-0.8.1}/src/eval_framework/utils/generate_task_docs.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|