eval-framework 0.13.4__tar.gz → 0.13.5__tar.gz
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- {eval_framework-0.13.4 → eval_framework-0.13.5}/PKG-INFO +3 -3
- {eval_framework-0.13.4 → eval_framework-0.13.5}/pyproject.toml +4 -4
- {eval_framework-0.13.4 → eval_framework-0.13.5}/pyproject.toml.orig +4 -4
- {eval_framework-0.13.4 → eval_framework-0.13.5}/LICENSE +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/README.md +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/answer.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/base_config.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/arc.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/arc_de.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/arc_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/copa.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/cot.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/csqa.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/csqa_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/goldenswag.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/gpqa.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/gpqa_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/hellaswag.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/hellaswag_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/hle_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/medqa.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/mmlu.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/mmlu_pro.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/piqa.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/piqa_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/sciq.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/simpleqa_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/siqa_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/social_iqa.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/winogrande.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/winogrande_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/choices.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/composed.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/context/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/context/determined.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/context/eval.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/context/local.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/contract.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/eval_kind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/evaluation_generator.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/exceptions.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/external/drop_process_results.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/external/ifeval_impl/README.md +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/external/ifeval_impl/instructions.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/external/ifeval_impl/instructions_registry.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/external/ifeval_impl/instructions_util.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/external/ifeval_impl/utils.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/fewshot.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/llm/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/llm/aleph_alpha.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/llm/base.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/llm/huggingface.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/llm/models.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/llm/openai.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/logger.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/main.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/aggregators/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/aggregators/aggregators.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/base.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/accuracy_completion.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/code_assertion.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/code_execution_pass_at_one.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/concordance_index.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/csv_format.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/drop_completion.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/exponential_similarity.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/f1.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/format_checker.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/grid_difference.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/ifeval.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/json_format.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/language_checker.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/length_control.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/math_minerva_completion.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/math_reasoning_completion.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/minerva_math_utils.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/multipl_e_assertion.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/placeholder_checker.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/repetition.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/rouge_1.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/rouge_2.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/rouge_geometric_mean.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/rouge_l.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/text_counter.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/efficiency/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/efficiency/bytes_per_sequence_position.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/efficiency/finish_reason.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/efficiency/token_counters.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/base.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/chatbot_style_grader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/coherence_grader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/comparison_grader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/conciseness_grader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/contains_names_grader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/format_correctness_grader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/instruction_grader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/language.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/long_context_grader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/models.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/refusal_grader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/sql_quality_grader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/summary_world_knowledge_grader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_chatbot_style.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_coherence.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_completion_accuracy.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_conciseness.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_contains_names.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_format_correctness.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_instruction.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_mtbench_pair.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_mtbench_single.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_refusal.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_sql.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_world_knowledge.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/utils.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/accuracy_loglikelihood.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/base.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/bits_per_byte.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/confidence_weighted_accuracy.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/dcs.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/probability_mass.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/ternary.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/py.typed +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/response_generator.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/result_processors/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/result_processors/base.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/result_processors/hf_uploader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/result_processors/result_processor.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/result_processors/wandb_uploader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/run.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/run_direct.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/shared/errors.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/shared/types.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/subjects.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/suite.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/Dockerfile_codebench +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/base.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/bigcodebench.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/drop.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/global_mmlu.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/gsm8k.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/gsm8k_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/hendrycks_math_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/humaneval.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/humaneval_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/humaneval_plus.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/ifeval.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/math_reasoning.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/mbpp.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/mbpp_ellamind.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/multipl_e.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/naturalqs_open.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/squad.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/dataset_loading.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/dataset_revisions.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/eval_config.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/frozen-hf-dataset-revisions.json +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/hf-dataset-revisions.json +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/lazy.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/markdown_doc.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/registry.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/task_loader.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/task_names.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/task_style.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/utils.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/utils/constants.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/utils/file_ops.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/utils/helpers.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/utils/logging.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/utils/packaging.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/utils/tqdm_handler.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/template_formatting/README.md +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/template_formatting/__init__.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/template_formatting/formatter.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/template_formatting/mistral_formatter.py +0 -0
- {eval_framework-0.13.4 → eval_framework-0.13.5}/src/template_formatting/py.typed +0 -0
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
Metadata-Version: 2.3
|
|
2
2
|
Name: eval-framework
|
|
3
|
-
Version: 0.13.
|
|
3
|
+
Version: 0.13.5
|
|
4
4
|
Summary: Evaluation Framework
|
|
5
5
|
Author: Aleph Alpha Research
|
|
6
6
|
License: Apache License
|
|
@@ -232,7 +232,7 @@ Requires-Dist: jsonlines>=4,<5
|
|
|
232
232
|
Requires-Dist: lxml>=6.1.3,<7
|
|
233
233
|
Requires-Dist: python-iso639>=2026.7.23
|
|
234
234
|
Requires-Dist: wandb>=0.30.0,<1
|
|
235
|
-
Requires-Dist: boto3>=1.43.
|
|
235
|
+
Requires-Dist: boto3>=1.43.97,<2
|
|
236
236
|
Requires-Dist: numpy>=2.5.3
|
|
237
237
|
Requires-Dist: antlr4-python3-runtime==4.11.0
|
|
238
238
|
Requires-Dist: scipy>=1.18.1,<2
|
|
@@ -241,7 +241,7 @@ Requires-Dist: eval-framework[determined,api,openai,transformers,accelerate,opti
|
|
|
241
241
|
Requires-Dist: aleph-alpha-client>=11.5.1 ; extra == 'api'
|
|
242
242
|
Requires-Dist: determined>=0.38.1,<0.39 ; extra == 'determined'
|
|
243
243
|
Requires-Dist: tensorboard==2.21.0 ; extra == 'determined'
|
|
244
|
-
Requires-Dist: openai>=3.
|
|
244
|
+
Requires-Dist: openai>=3.15.0,<4 ; extra == 'openai'
|
|
245
245
|
Requires-Dist: tiktoken>=0.14.0,<1 ; extra == 'openai'
|
|
246
246
|
Requires-Dist: transformers>=4.45.2,<5 ; extra == 'openai'
|
|
247
247
|
Requires-Dist: transformers>=4.45.2,<5 ; extra == 'optional'
|
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
[project]
|
|
2
2
|
name = "eval-framework"
|
|
3
|
-
version = "0.13.
|
|
3
|
+
version = "0.13.5"
|
|
4
4
|
description = "Evaluation Framework"
|
|
5
5
|
readme = "README.md"
|
|
6
6
|
requires-python = ">=3.12,<3.15"
|
|
@@ -35,7 +35,7 @@ dependencies = [
|
|
|
35
35
|
"lxml>=6.1.3,<7",
|
|
36
36
|
"python-iso639>=2026.7.23",
|
|
37
37
|
"wandb>=0.30.0,<1",
|
|
38
|
-
"boto3>=1.43.
|
|
38
|
+
"boto3>=1.43.97,<2",
|
|
39
39
|
"numpy>=2.5.3",
|
|
40
40
|
"antlr4-python3-runtime==4.11.0",
|
|
41
41
|
"scipy>=1.18.1,<2",
|
|
@@ -54,7 +54,7 @@ determined = [
|
|
|
54
54
|
]
|
|
55
55
|
api = ["aleph-alpha-client>=11.5.1"]
|
|
56
56
|
openai = [
|
|
57
|
-
"openai>=3.
|
|
57
|
+
"openai>=3.15.0,<4",
|
|
58
58
|
"tiktoken>=0.14.0,<1",
|
|
59
59
|
"transformers>=4.45.2,<5",
|
|
60
60
|
]
|
|
@@ -96,7 +96,7 @@ flash-attn = [
|
|
|
96
96
|
]
|
|
97
97
|
|
|
98
98
|
[build-system]
|
|
99
|
-
requires = ["uv_build>=0.12.
|
|
99
|
+
requires = ["uv_build>=0.12.16,<0.12.17"]
|
|
100
100
|
build-backend = "uv_build"
|
|
101
101
|
|
|
102
102
|
[tool.uv]
|
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
[project]
|
|
2
2
|
name = "eval-framework"
|
|
3
|
-
version = "0.13.
|
|
3
|
+
version = "0.13.5"
|
|
4
4
|
description = "Evaluation Framework"
|
|
5
5
|
readme = "README.md"
|
|
6
6
|
license = { file = "LICENSE" }
|
|
@@ -39,7 +39,7 @@ dependencies = [
|
|
|
39
39
|
"lxml>=6.1.3,<7",
|
|
40
40
|
"python-iso639>=2026.7.23",
|
|
41
41
|
"wandb>=0.30.0,<1",
|
|
42
|
-
"boto3>=1.43.
|
|
42
|
+
"boto3>=1.43.97,<2",
|
|
43
43
|
"numpy>=2.5.3",
|
|
44
44
|
# is a dependency of sympy, but not explicitly listed in the requirements.txt
|
|
45
45
|
# https://github.com/sympy/sympy/blob/0204fa34e8f6f6f8ccb4de01209be9a2345c9d6e/doc/src/contributing/dependencies.md?plain=1#L125
|
|
@@ -55,7 +55,7 @@ determined = [
|
|
|
55
55
|
]
|
|
56
56
|
api = ["aleph-alpha-client>=11.5.1"]
|
|
57
57
|
openai = [
|
|
58
|
-
"openai>=3.
|
|
58
|
+
"openai>=3.15.0,<4",
|
|
59
59
|
"tiktoken>=0.14.0,<1",
|
|
60
60
|
"transformers>=4.45.2,<5",
|
|
61
61
|
]
|
|
@@ -102,7 +102,7 @@ flash-attn = [
|
|
|
102
102
|
]
|
|
103
103
|
|
|
104
104
|
[build-system]
|
|
105
|
-
requires = ["uv_build>=0.12.
|
|
105
|
+
requires = ["uv_build>=0.12.16,<0.12.17"]
|
|
106
106
|
build-backend = "uv_build"
|
|
107
107
|
|
|
108
108
|
[tool.uv.build-backend]
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/arc_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/csqa_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/gpqa_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/hellaswag_ellamind.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/hle_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/piqa_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/simpleqa_ellamind.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/siqa_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/benchmarks/winogrande_ellamind.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/external/drop_process_results.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/external/ifeval_impl/README.md
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/external/ifeval_impl/utils.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/aggregators/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/csv_format.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/ifeval.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/json_format.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/repetition.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/rouge_1.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/rouge_2.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/completion/rouge_l.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/efficiency/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/language.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/graders/models.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_refusal.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/llm/llm_judge_sql.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/__init__.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/base.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/dcs.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/metrics/loglikelihood/ternary.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/result_processors/__init__.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/result_processors/base.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/result_processors/hf_uploader.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/Dockerfile_codebench
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/__init__.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/bigcodebench.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/global_mmlu.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/gsm8k.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/humaneval.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/ifeval.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/mbpp_ellamind.py
RENAMED
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/multipl_e.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/benchmarks/squad.py
RENAMED
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/dataset_revisions.py
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/eval_framework/tasks/hf-dataset-revisions.json
RENAMED
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
|
File without changes
|
{eval_framework-0.13.4 → eval_framework-0.13.5}/src/template_formatting/mistral_formatter.py
RENAMED
|
File without changes
|
|
File without changes
|