eval-framework 0.13.3__tar.gz → 0.13.4__tar.gz
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- {eval_framework-0.13.3 → eval_framework-0.13.4}/PKG-INFO +2 -2
- {eval_framework-0.13.3 → eval_framework-0.13.4}/pyproject.toml +3 -3
- {eval_framework-0.13.3 → eval_framework-0.13.4}/pyproject.toml.orig +3 -3
- {eval_framework-0.13.3 → eval_framework-0.13.4}/LICENSE +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/README.md +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/answer.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/base_config.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/arc.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/arc_de.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/arc_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/copa.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/cot.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/csqa.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/csqa_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/goldenswag.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/gpqa.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/gpqa_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/hellaswag.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/hellaswag_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/hle_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/medqa.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/mmlu.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/mmlu_pro.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/piqa.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/piqa_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/sciq.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/simpleqa_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/siqa_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/social_iqa.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/winogrande.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/winogrande_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/choices.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/composed.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/context/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/context/determined.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/context/eval.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/context/local.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/contract.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/eval_kind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/evaluation_generator.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/exceptions.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/external/drop_process_results.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/external/ifeval_impl/README.md +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/external/ifeval_impl/instructions.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/external/ifeval_impl/instructions_registry.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/external/ifeval_impl/instructions_util.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/external/ifeval_impl/utils.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/fewshot.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/llm/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/llm/aleph_alpha.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/llm/base.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/llm/huggingface.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/llm/models.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/llm/openai.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/logger.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/main.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/aggregators/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/aggregators/aggregators.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/base.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/accuracy_completion.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/code_assertion.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/code_execution_pass_at_one.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/concordance_index.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/csv_format.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/drop_completion.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/exponential_similarity.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/f1.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/format_checker.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/grid_difference.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/ifeval.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/json_format.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/language_checker.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/length_control.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/math_minerva_completion.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/math_reasoning_completion.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/minerva_math_utils.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/multipl_e_assertion.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/placeholder_checker.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/repetition.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/rouge_1.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/rouge_2.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/rouge_geometric_mean.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/rouge_l.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/text_counter.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/efficiency/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/efficiency/bytes_per_sequence_position.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/efficiency/finish_reason.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/efficiency/token_counters.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/base.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/chatbot_style_grader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/coherence_grader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/comparison_grader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/conciseness_grader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/contains_names_grader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/format_correctness_grader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/instruction_grader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/language.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/long_context_grader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/models.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/refusal_grader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/sql_quality_grader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/summary_world_knowledge_grader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_chatbot_style.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_coherence.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_completion_accuracy.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_conciseness.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_contains_names.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_format_correctness.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_instruction.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_mtbench_pair.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_mtbench_single.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_refusal.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_sql.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_world_knowledge.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/utils.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/accuracy_loglikelihood.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/base.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/bits_per_byte.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/confidence_weighted_accuracy.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/dcs.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/probability_mass.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/ternary.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/py.typed +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/response_generator.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/result_processors/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/result_processors/base.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/result_processors/hf_uploader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/result_processors/result_processor.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/result_processors/wandb_uploader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/run.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/run_direct.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/shared/errors.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/shared/types.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/subjects.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/suite.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/Dockerfile_codebench +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/base.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/bigcodebench.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/drop.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/global_mmlu.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/gsm8k.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/gsm8k_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/hendrycks_math_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/humaneval.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/humaneval_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/humaneval_plus.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/ifeval.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/math_reasoning.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/mbpp.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/mbpp_ellamind.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/multipl_e.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/naturalqs_open.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/squad.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/dataset_loading.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/dataset_revisions.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/eval_config.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/frozen-hf-dataset-revisions.json +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/hf-dataset-revisions.json +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/lazy.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/markdown_doc.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/registry.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/task_loader.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/task_names.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/task_style.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/utils.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/utils/constants.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/utils/file_ops.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/utils/helpers.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/utils/logging.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/utils/packaging.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/utils/tqdm_handler.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/template_formatting/README.md +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/template_formatting/__init__.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/template_formatting/formatter.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/template_formatting/mistral_formatter.py +0 -0
- {eval_framework-0.13.3 → eval_framework-0.13.4}/src/template_formatting/py.typed +0 -0
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
Metadata-Version: 2.3
|
|
2
2
|
Name: eval-framework
|
|
3
|
-
Version: 0.13.
|
|
3
|
+
Version: 0.13.4
|
|
4
4
|
Summary: Evaluation Framework
|
|
5
5
|
Author: Aleph Alpha Research
|
|
6
6
|
License: Apache License
|
|
@@ -232,7 +232,7 @@ Requires-Dist: jsonlines>=4,<5
|
|
|
232
232
|
Requires-Dist: lxml>=6.1.3,<7
|
|
233
233
|
Requires-Dist: python-iso639>=2026.7.23
|
|
234
234
|
Requires-Dist: wandb>=0.30.0,<1
|
|
235
|
-
Requires-Dist: boto3>=1.43.
|
|
235
|
+
Requires-Dist: boto3>=1.43.96,<2
|
|
236
236
|
Requires-Dist: numpy>=2.5.3
|
|
237
237
|
Requires-Dist: antlr4-python3-runtime==4.11.0
|
|
238
238
|
Requires-Dist: scipy>=1.18.1,<2
|
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
[project]
|
|
2
2
|
name = "eval-framework"
|
|
3
|
-
version = "0.13.
|
|
3
|
+
version = "0.13.4"
|
|
4
4
|
description = "Evaluation Framework"
|
|
5
5
|
readme = "README.md"
|
|
6
6
|
requires-python = ">=3.12,<3.15"
|
|
@@ -35,7 +35,7 @@ dependencies = [
|
|
|
35
35
|
"lxml>=6.1.3,<7",
|
|
36
36
|
"python-iso639>=2026.7.23",
|
|
37
37
|
"wandb>=0.30.0,<1",
|
|
38
|
-
"boto3>=1.43.
|
|
38
|
+
"boto3>=1.43.96,<2",
|
|
39
39
|
"numpy>=2.5.3",
|
|
40
40
|
"antlr4-python3-runtime==4.11.0",
|
|
41
41
|
"scipy>=1.18.1,<2",
|
|
@@ -87,7 +87,7 @@ dev = [
|
|
|
87
87
|
"types-python-dateutil>=2.9.0.20260807,<3",
|
|
88
88
|
"types-requests>=2.33.0.20260906,<3",
|
|
89
89
|
"plotly>=7.1.0,<8",
|
|
90
|
-
"ruff>=0.16.
|
|
90
|
+
"ruff>=0.16.8",
|
|
91
91
|
"pip-licenses>=5.5.5",
|
|
92
92
|
]
|
|
93
93
|
flash-attn = [
|
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
[project]
|
|
2
2
|
name = "eval-framework"
|
|
3
|
-
version = "0.13.
|
|
3
|
+
version = "0.13.4"
|
|
4
4
|
description = "Evaluation Framework"
|
|
5
5
|
readme = "README.md"
|
|
6
6
|
license = { file = "LICENSE" }
|
|
@@ -39,7 +39,7 @@ dependencies = [
|
|
|
39
39
|
"lxml>=6.1.3,<7",
|
|
40
40
|
"python-iso639>=2026.7.23",
|
|
41
41
|
"wandb>=0.30.0,<1",
|
|
42
|
-
"boto3>=1.43.
|
|
42
|
+
"boto3>=1.43.96,<2",
|
|
43
43
|
"numpy>=2.5.3",
|
|
44
44
|
# is a dependency of sympy, but not explicitly listed in the requirements.txt
|
|
45
45
|
# https://github.com/sympy/sympy/blob/0204fa34e8f6f6f8ccb4de01209be9a2345c9d6e/doc/src/contributing/dependencies.md?plain=1#L125
|
|
@@ -93,7 +93,7 @@ dev = [
|
|
|
93
93
|
"types-python-dateutil>=2.9.0.20260807,<3",
|
|
94
94
|
"types-requests>=2.33.0.20260906,<3",
|
|
95
95
|
"plotly>=7.1.0,<8",
|
|
96
|
-
"ruff>=0.16.
|
|
96
|
+
"ruff>=0.16.8",
|
|
97
97
|
"pip-licenses>=5.5.5",
|
|
98
98
|
]
|
|
99
99
|
flash-attn = [
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/arc_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/csqa_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/gpqa_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/hellaswag_ellamind.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/hle_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/piqa_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/simpleqa_ellamind.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/siqa_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/benchmarks/winogrande_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/external/drop_process_results.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/external/ifeval_impl/README.md
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/external/ifeval_impl/utils.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/aggregators/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/csv_format.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/ifeval.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/json_format.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/repetition.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/rouge_1.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/rouge_2.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/completion/rouge_l.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/efficiency/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/language.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/graders/models.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_refusal.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/llm/llm_judge_sql.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/base.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/dcs.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/metrics/loglikelihood/ternary.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/result_processors/__init__.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/result_processors/base.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/result_processors/hf_uploader.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/Dockerfile_codebench
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/__init__.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/bigcodebench.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/global_mmlu.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/gsm8k.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/humaneval.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/ifeval.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/mbpp_ellamind.py
RENAMED
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/multipl_e.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/benchmarks/squad.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/dataset_revisions.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/eval_framework/tasks/hf-dataset-revisions.json
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.3 → eval_framework-0.13.4}/src/template_formatting/mistral_formatter.py
RENAMED
|
File without changes
|
|
File without changes
|