benchflow 0.7.6.dev2072__tar.gz → 0.7.6.dev2096__tar.gz
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/PKG-INFO +1 -1
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/pyproject.toml +1 -1
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/eval_artifacts.py +44 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/main.py +29 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/eval_artifacts.py +57 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/eval_plan.py +12 -2
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/publish/huggingface.py +108 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_cli_arg_validation.py +23 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_eval_artifact_cli.py +248 -0
- benchflow-0.7.6.dev2096/tests/test_publish_huggingface.py +147 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/.gitignore +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/CHANGELOG.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/LICENSE +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/README.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_dotenv.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_paths.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_run.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_types.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/benchmark_repos.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/build_context_stage.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/config.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/config_override.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/content_address.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/dataset_registry.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/env_registry.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/evaluation_results.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/hf_datasets.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/json_safe.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/learner_memory.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/live_activity.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/result_metadata.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/reward_events.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/scoring.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/source_provenance.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/task_authoring/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/task_authoring/_evidence_paths.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/task_authoring/acceptance_evidence.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/task_authoring/scaffolding.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/task_authoring/structural_checks.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/text.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/_utils/yaml_loader.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/acp/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/acp/client.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/acp/container_transport.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/acp/runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/acp/selection.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/acp/session.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/acp/transport.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/acp/types.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/_toolathlon.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/_toolathlon_container.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/_toolathlon_fake_mail.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/_toolathlon_poste_users.tsv +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/_toolathlon_services.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/harbor.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/inbound.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/inspect_ai.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/ors.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/resources/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/resources/mcp_atlas_bridge.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/resources/mcp_atlas_judge.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/adapters/source.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agent_router.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agent_router_guide.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agent_router_parity.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agent_router_scaffold.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/codex_config.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/credentials.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/deepagents_acp_shim.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/env.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/errors.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/harvey_lab_acp_shim.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/install.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/manifest.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/openclaw_acp_shim.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/pi_acp_launcher.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/protocol.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/providers.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/registry.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/agents/remote_manifests.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/branch.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/_failure_evidence.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/_hosted_env.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/_live_progress.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/_options.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/_shared.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/_traj_tui.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/_traj_upload_ui.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/adopt.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/agent.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/continue_cmd.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/environment.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/eval_lift.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/hub.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/monitor.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/review.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/sandbox.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/skills.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/tasks.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/trace_import.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/train.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/cli/traj.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/continue_run/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/continue_run/batch.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/continue_run/orchestrator.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/continue_run/replay_proxy.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/continue_run/run_folder.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/continue_run/sandbox_proxy.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/contracts/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/contracts/planes.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/contracts/user.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/demo_task/environment/Dockerfile +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/demo_task/instruction.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/demo_task/task.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/demo_task/task.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/demo_task/tests/test.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/diagnostics.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/environment/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/environment/_registry/env0@outage.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/environment/_registry/env0@prod.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/environment/manifest.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/environment/manifest_env.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/environment/protocol.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/environment/readiness.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/eval_lift.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/eval_sharding.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/eval_worker.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/evaluation.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/experimental/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/experimental/mcp/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/experimental/mcp/hooks.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/experimental/mcp/reviewer_server.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/hosted_env.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/hub/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/hub/harbor_registry.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/integrations/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/integrations/trl/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/integrations/trl/spec.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/learner_skills.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/learner_store.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/loop_strategies.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/loop_sweep.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/metrics.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/models.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/monitor.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/providers/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/providers/litellm_bedrock_patch.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/providers/litellm_bedrock_preflight.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/providers/litellm_config.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/providers/litellm_logging.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/providers/litellm_runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/providers/runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/publish/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/publish/_progress.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/publish/azure_blob.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/publish/broker.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/publish/redact.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/publish/traj_capture.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/publish/traj_report.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/py.typed +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/review/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/review/config.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/review/default-rubric.json +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/review/prompts.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/review/runner.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/review/scoring.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/review/wrapper.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/README.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/builtins.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/events.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/file_readers.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/llm.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/memory_scorer.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/node.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/protocol.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/rubric.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/rubric_config.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rewards/validation.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout/_config.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout/_deadline.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout/_results.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout/_setup.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout/_skills.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout/_usage.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout/_user_loop.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout/session_factory_runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout/task_runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout_branch.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/rollout_planes.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/_base.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/_cache_reclaim.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/_compose.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/_compose_files/docker-compose-base.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/_compose_files/docker-compose-build.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/_compose_files/docker-compose-no-network.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/_compose_files/docker-compose-prebuilt.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/_sdk_ops.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/agentcore.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/agentcore_builder.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/agentcore_image.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/agentcore_provisioning.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/agentcore_reaper.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/agentcore_sealed.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/apple_container.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/daytona.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/daytona_dind.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/daytona_pty.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/daytona_reaper.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/daytona_strategies.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/docker.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/lockdown.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/metadata.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/modal_impl.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/process/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/process/_base.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/process/agentcore.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/process/apple.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/process/daytona.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/process/docker.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/protocol.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/providers.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/services.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/setup.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/snapshot.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sandbox/user.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/scenes.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/sdk.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/self_gen.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/skill_eval/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/skill_eval/_core.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/skill_eval/gepa_export.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/skill_eval/schema.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/skill_policy.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/skills.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/_document_evidence.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/_document_normalize.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/_document_parse.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/_document_profiles.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/acceptance_live.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/acceptance_live_model.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/acceptance_live_report.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/acceptance_live_validation.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/config.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/discovery.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/document.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/env.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/export.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/imports.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/output_format.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/package.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/paths.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/prompts.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/runtime_capabilities.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/runtime_view.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/task.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/verifier.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/verifier_core.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/verifier_document.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/verifier_errors.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/verifier_judge_inputs.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/verifier_ors_episode.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/verifier_reward_kit.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/verifier_scan.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/task/verifier_script_strategy.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/templates/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/templates/judge.py.tmpl +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/templates/test.sh.tmpl +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/traces/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/traces/huggingface.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/traces/local.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/traces/models.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/traces/parsers.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/traces/task_gen.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/training/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/training/backends/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/training/backends/prime_rl.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/training/run_manifest.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/_capture.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/_export_common.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/_llm_capture.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/call_purpose.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/export.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/export_adp.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/export_atif.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/export_prime_sft.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/export_trl_sft.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/metrics.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/results.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/sessions.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/tree.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/trl_sft_tokenization.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/types.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/trajectories/viewer.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/src/benchflow/usage_tracking.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/acceptance_live_harness.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/agents/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/agents/test_manifest_dirscan.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/agents/test_manifest_loader.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/agents/test_manifest_parity.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/agents/test_manifest_wiring.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/agents/test_namespace_shorthand.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/agents/test_plugin_entry_points.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/agents/test_protocol.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/agents/test_remote_manifest_autoload.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/README.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/acp_smoke/environment/Dockerfile +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/acp_smoke/environment/docker-compose.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/acp_smoke/environment/skills/conformance-writer/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/acp_smoke/instruction.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/acp_smoke/solution/solve.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/acp_smoke/task.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/acp_smoke/task.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/acp_smoke/tests/test.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/conformance-results.json +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/proof_multi_agent.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/proof_snapshot.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/run_conformance.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conformance/self_gen_smoke_skills/skill-creator/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/conftest.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/continue_run/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/continue_run/_helpers.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/continue_run/test_batch.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/continue_run/test_orchestrator.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/continue_run/test_replay_proxy.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/continue_run/test_run_folder.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/environment/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/environment/test_chibench_manifest.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/environment/test_clawsbench_manifest.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/environment/test_manifest.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/environment/test_manifest_env.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/environment/test_protocol.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/environment/test_readiness.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/hello-world-task/environment/Dockerfile +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/hello-world-task/instruction.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/hello-world-task/solution/solve.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/hello-world-task/task.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/hello-world-task/task.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/hello-world-task/tests/test.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/test_claude.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/test_codex.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/test_codex_custom_provider.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/test_gemini.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/test_openclaw.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/traces/minimal-claude.jsonl +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/examples/traces/minimal-opentraces.jsonl +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/digest/README.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/digest/alpha-task/environment/Dockerfile +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/digest/alpha-task/instruction.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/digest/alpha-task/task.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/digest/alpha-task/tests/test.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/digest/beta-task/data/empty.bin +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/digest/beta-task/data/unicode.txt +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/digest/beta-task/instruction.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/digest/beta-task/task.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/digest/not-a-task/notes.txt +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/mock_acp_agent.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/mock_acp_agent_interleaved.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/mock_acp_agent_multi_turn.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/mock_openai_responses_server.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/flood-risk-analysis/environment/Dockerfile +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/flood-risk-analysis/environment/data/michigan_stations.txt +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/flood-risk-analysis/environment/skills/flood-detection/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/flood-risk-analysis/environment/skills/nws-flood-thresholds/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/flood-risk-analysis/environment/skills/usgs-data-download/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/flood-risk-analysis/instruction.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/flood-risk-analysis/solution/solve.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/flood-risk-analysis/task.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/flood-risk-analysis/tests/test.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/flood-risk-analysis/tests/test_outputs.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/environment/Dockerfile +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/environment/data/climate.csv +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/environment/data/hydrology.csv +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/environment/data/land_cover.csv +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/environment/data/water_temperature.csv +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/environment/skills/contribution-analysis/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/environment/skills/meteorology-driver-classification/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/environment/skills/pca-decomposition/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/environment/skills/trend-analysis/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/instruction.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/solution/solve.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/task.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/tests/test.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/lake-warming-attribution/tests/test_outputs.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/manifest.json +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/environment/Dockerfile +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/environment/r2r_simulator.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/environment/skills/finite-horizon-lqr/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/environment/skills/integral-action-design/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/environment/skills/mpc-horizon-tuning/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/environment/skills/state-space-linearization/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/environment/system_config.json +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/instruction.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/solution/solve.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/task.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/tests/test.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/r2r-mpc-control/tests/test_outputs.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/environment/Dockerfile +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/environment/generate_training_pcaps.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/environment/local.rules +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/environment/skills/pcap-triage-tshark/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/environment/skills/pcap-triage-tshark/scripts/summarize_http_requests.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/environment/skills/suricata-offline-evejson/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/environment/skills/suricata-offline-evejson/scripts/run_suricata_offline.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/environment/skills/suricata-rules-basics/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/environment/suricata.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/instruction.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/solution/solve.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/task.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/tests/test.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/suricata-custom-exfil/tests/test_outputs.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/syzkaller-ppdev-syzlang/environment/Dockerfile +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/syzkaller-ppdev-syzlang/environment/skills/syz-extract-constants/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/syzkaller-ppdev-syzlang/environment/skills/syzkaller-build-loop/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/syzkaller-ppdev-syzlang/environment/skills/syzlang-ioctl-basics/SKILL.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/syzkaller-ppdev-syzlang/instruction.md +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/syzkaller-ppdev-syzlang/solution/solve.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/syzkaller-ppdev-syzlang/task.toml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/syzkaller-ppdev-syzlang/tests/test.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/fixtures/skillsbench_slice/syzkaller-ppdev-syzlang/tests/test_outputs.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/_consistency.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/agent_judge.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/check_adapter_evidence.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/check_hosted_env_evidence.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/check_results.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/check_skillsbench_harbor_parity.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/check_trace_to_task_evidence.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/configs/claude-agent-acp.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/configs/codex-acp.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/configs/gemini.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/configs/harvey-lab-harness.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/configs/mimo.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/configs/openclaw.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/configs/opencode.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/configs/openhands.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/configs/pi-acp.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/deepagents_harness.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/rubric_checks.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/run.sh +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/run_suite.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/scenarios.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/integration/suites/release.yaml +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_acceptance_evidence.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_acceptance_live.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_acceptance_live_execution.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_acp.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_acp_capability_advertising.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_acp_mcp_servers.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_acp_model_config_dispatch.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_acp_pinned_protocol_guard.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_acp_setup_failure_propagation.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_adapter_scripts.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_adapters.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agent_cli.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agent_env_resolution.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agent_gemini_defaults.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agent_idle_timeout_cli.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agent_model_decouple.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agent_registry.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agent_router.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agent_router_cli_e2e.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agent_router_scaffold.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agent_setup.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agent_spec.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agentcore_builder.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agentcore_parallel.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agentcore_reaper.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agentcore_sandbox.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_agentcore_transport.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_api_error_capture.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_apple_container_sandbox.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_bare_model_provider.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_base_install_imports.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_bedrock_thinking.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_benchflow_experiment_review_validator.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_benchmark_repos_resolve_repo_path.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_branch.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_build_context_stage.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_build_review_pack.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_capture_trajectory.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_check_skillsbench_harbor_parity.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_clawsbench_slice.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_cli_adopt_aliases.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_cli_daytona.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_cli_docs_drift.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_cli_edge_case_hardening.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_cli_hub_env.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_cli_live_progress.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_cli_misc.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_codex_review.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_codex_self_write_auth.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_config_override.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_config_redaction.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_connect_as_env.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_console_error_truncation.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_console_progress.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_continuallearningbench_adapter.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_dataset_registry.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_daytona_command_polling.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_daytona_dind_compose_up.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_daytona_download.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_daytona_litellm_runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_daytona_poll_deadline.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_daytona_reap.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_deepagents_agent.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_diagnostics.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_docker_prune_scoping.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_docker_uploads.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_docs_examples.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_eng50_capabilities.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_env_registry.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_env_setup.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_environment_manifest_controls.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_eval_filters_applied.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_eval_lift.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_eval_sharding.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_eval_single_task_summary.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_eval_source_provenance.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_eval_worker_retry.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_eval_zero_task_guard.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_evaluation_environment_manifest.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_exclude_tasks.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_filter_credentialed_cells.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_harvey_lab_shim.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_hilbench_adapter.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_hosted_env.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_hosted_env_rollout_contract.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_hub_harbor_registry.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_inbound_adapter_manifest.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_inbound_adapters.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_integration_agent_judge.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_integration_check_results.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_integration_consistency.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_integration_matrix.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_integration_provider_selection.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_integration_run_suite.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_integration_suite.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_internet_policy.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_job.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_job_sequential_shared.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_job_sequential_shared_resume.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_judge_robustness.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_judge_symlink_ingestion.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_learner_skills.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_learner_skills_traversal.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_learner_store.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_learner_store_persistence.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_litellm_config.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_litellm_hardening.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_litellm_logging.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_litellm_model_via_env_generic.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_litellm_reasoning_passthrough.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_litellm_runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_litellm_smoke.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_live_llm_trajectory.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_llm_judge.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_llm_judge_event_tags.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_llm_judge_verifier.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_loop_strategies.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_loop_summary.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_loop_sweep.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_memory_scorer.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_metrics.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_mle_bench_adapter.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_mock_openai_responses_server.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_monitor_scaffold.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_native_acp_usage.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_no_cross_provider_fallback.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_notification_order_real.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_opencode_family_proxy_tracking.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_oracle.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_oracle_chokepoint.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_paths_safe.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_paths_symlink_helpers.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_pi_acp_launcher.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_pi_acp_proxy_routing.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_process.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_project_skills_layout.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_provider_auth_detection.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_providers.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_publish_azure_blob.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_reexport.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_registry_invariants.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_release_hardening_r5.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_release_version.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_release_workflow_wiring.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_resolve_env_helpers.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_review_boundaries.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_review_rubric.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_review_runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_reward_lenient.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_reward_node.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_reward_range.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_reward_unified_contract.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rewards.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rewards_jsonl.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_architecture.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_branch.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_config_path_coercion.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_environment.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_hard_deadline.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_import_no_side_effects.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_on_ask_user_wiring.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_planes_contract.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_probe_sandbox_health.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_session_factory_dispatch.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_setup_commands.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rollout_upload.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rubric_checks.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_rubric_config.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_runtime_capabilities.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_runtime_config_wired.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_runtime_live_sandbox.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_exec_secret_handling.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_hardening.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_isolation_copy_traversal.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_live_process.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_multi_service.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_prebuilt_validation.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_protocol.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_provider_registry_drift.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_setup.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_snapshot_contract.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_upload_symlink.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sandbox_verifier_workspace.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_scene.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_scene_outbox_trial.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_scene_parallel_group.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_scene_result_aggregation.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_scoring.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sdk_internals.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sdk_lockdown.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sdk_run_alias.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_sealed_channel_container.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_self_gen_cli.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_self_gen_export_error_channel.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_self_gen_export_failures.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_self_gen_orchestration.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_session_factory_runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_session_request_permission_dispatch.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_skill_eval.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_skill_eval_dryrun.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_skill_eval_integration.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_skill_eval_sweep.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_skill_eval_traversal.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_skill_invocation_artifacts.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_skill_policy.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_skills.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_skills_dir_agent_home_link.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_skillsbench_conversion_conformance.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_skillsbench_harbor_run_suite.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_smoke.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_smoke_wiring.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_source_adapters.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_subscription_auth.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_task_check_eval_consistency.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_task_config.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_task_digest.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_task_document.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_task_download.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_task_export.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_task_output_format.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_task_package.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_task_runtime_primitive.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_tasks.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_token_usage_normalization.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_trace_import_cli.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_trace_task_gen_traversal.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_trace_to_task_evidence.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_traces_huggingface.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_traces_parsers.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_traces_task_gen.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_train_cli.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_train_mode_artifact_emission.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_train_trl_cli.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_traj_report.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_traj_staging_phases.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_traj_tui.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_traj_upload_cli.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_traj_upload_skill.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_traj_workspace.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_trajectory_integration.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_trajectory_streaming.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_trajectory_upload_layout.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_trajectory_upload_service.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_trial_agent_timeout_verify.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_trial_install_agent_timeout.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_trial_litellm_runtime.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_trl_integration.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_usage_litellm.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_usage_required.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_usage_tracking.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_user.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_v06_guard_ports.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_verifier_document.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_verifier_multi_container.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_verifier_output.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_verifier_output_freshness.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_verifier_strategies.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_verifier_wedge_retry.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_verify.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_viewer_confirm.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_workflow_action_pinning.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/test_yaml_config.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/trajectories/__init__.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/trajectories/test_export.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/trajectories/test_export_adp.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/trajectories/test_export_atif.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/trajectories/test_export_common.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/trajectories/test_export_nan_handling.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/trajectories/test_export_prime_sft.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/trajectories/test_redaction.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/trajectories/test_step_granularity.py +0 -0
- {benchflow-0.7.6.dev2072 → benchflow-0.7.6.dev2096}/tests/trajectories/test_tree.py +0 -0
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
Metadata-Version: 2.5
|
|
2
2
|
Name: benchflow
|
|
3
|
-
Version: 0.7.6.
|
|
3
|
+
Version: 0.7.6.dev2096
|
|
4
4
|
Summary: Multi-turn agent benchmarking with ACP — run any agent, any model, any provider.
|
|
5
5
|
Project-URL: Homepage, https://github.com/benchflow-ai/benchflow
|
|
6
6
|
Project-URL: Repository, https://github.com/benchflow-ai/benchflow
|
|
@@ -66,7 +66,9 @@ def postprocess_eval_artifacts(
|
|
|
66
66
|
eval_config = _apply_source_sidecar(eval_config, resolved_tasks_dir)
|
|
67
67
|
from benchflow.eval_artifacts import (
|
|
68
68
|
TaskManifestOptions,
|
|
69
|
+
canonical_task_rows,
|
|
69
70
|
materialize_canonical_job,
|
|
71
|
+
render_run_summary_markdown,
|
|
70
72
|
write_canonical_selection,
|
|
71
73
|
write_health_summary,
|
|
72
74
|
write_task_manifest,
|
|
@@ -138,6 +140,12 @@ def postprocess_eval_artifacts(
|
|
|
138
140
|
console.print(
|
|
139
141
|
f"[green]Canonical jobs:[/green] {escape(str(req.canonical_jobs_dir))}"
|
|
140
142
|
)
|
|
143
|
+
if req.publish_hf is not None or req.publish_bucket is not None:
|
|
144
|
+
(job_dir / "README.md").write_text(
|
|
145
|
+
render_run_summary_markdown(
|
|
146
|
+
job_dir, agent=eval_config.agent, model=eval_config.model
|
|
147
|
+
)
|
|
148
|
+
)
|
|
141
149
|
if req.publish_hf is not None:
|
|
142
150
|
from benchflow.publish.huggingface import publish_folder_to_hf
|
|
143
151
|
|
|
@@ -154,6 +162,42 @@ def postprocess_eval_artifacts(
|
|
|
154
162
|
print_error(str(exc))
|
|
155
163
|
raise typer.Exit(1) from None
|
|
156
164
|
console.print(f"[green]Published HF artifacts:[/green] {escape(published.url)}")
|
|
165
|
+
if req.publish_bucket is not None:
|
|
166
|
+
from benchflow.publish.huggingface import publish_folder_to_bucket
|
|
167
|
+
|
|
168
|
+
prefix = req.hf_prefix or job_dir.name
|
|
169
|
+
try:
|
|
170
|
+
published = publish_folder_to_bucket(
|
|
171
|
+
job_dir, bucket_id=req.publish_bucket, path_in_repo=prefix
|
|
172
|
+
)
|
|
173
|
+
except ValueError as exc:
|
|
174
|
+
print_error(str(exc))
|
|
175
|
+
raise typer.Exit(1) from None
|
|
176
|
+
console.print(f"[green]Published HF bucket:[/green] {escape(published.url)}")
|
|
177
|
+
if req.eval_results_model is not None:
|
|
178
|
+
from benchflow.publish.huggingface import open_eval_results_pr
|
|
179
|
+
|
|
180
|
+
rewards = [
|
|
181
|
+
row["reward"] for row in canonical_task_rows(job_dir) if row["scored"]
|
|
182
|
+
]
|
|
183
|
+
if rewards:
|
|
184
|
+
value = round(100.0 * sum(rewards) / len(rewards), 2)
|
|
185
|
+
try:
|
|
186
|
+
pr_url = open_eval_results_pr(
|
|
187
|
+
model_repo=req.eval_results_model,
|
|
188
|
+
dataset_id=cast(str, req.eval_results_dataset),
|
|
189
|
+
task_id=cast(str, req.eval_results_task),
|
|
190
|
+
value=value,
|
|
191
|
+
)
|
|
192
|
+
except ValueError as exc:
|
|
193
|
+
print_error(str(exc))
|
|
194
|
+
raise typer.Exit(1) from None
|
|
195
|
+
console.print(f"[green]Eval-results PR:[/green] {escape(pr_url or '')}")
|
|
196
|
+
else:
|
|
197
|
+
console.print(
|
|
198
|
+
"[yellow]--eval-results-model set but no scored rollouts were "
|
|
199
|
+
"found; skipping eval-results PR[/yellow]"
|
|
200
|
+
)
|
|
157
201
|
|
|
158
202
|
|
|
159
203
|
def _load_eval_matrix(path: Path) -> dict[str, dict]:
|
|
@@ -581,6 +581,31 @@ def eval_run(
|
|
|
581
581
|
"--hf-public-read-check", help="Verify public HF reads after upload"
|
|
582
582
|
),
|
|
583
583
|
] = False,
|
|
584
|
+
publish_bucket: Annotated[
|
|
585
|
+
str | None,
|
|
586
|
+
typer.Option(
|
|
587
|
+
"--publish-bucket", help="Upload final eval artifacts to a HF bucket"
|
|
588
|
+
),
|
|
589
|
+
] = None,
|
|
590
|
+
eval_results_model: Annotated[
|
|
591
|
+
str | None,
|
|
592
|
+
typer.Option(
|
|
593
|
+
"--eval-results-model",
|
|
594
|
+
help="HF model repo to open a community eval-results PR on",
|
|
595
|
+
),
|
|
596
|
+
] = None,
|
|
597
|
+
eval_results_dataset: Annotated[
|
|
598
|
+
str | None,
|
|
599
|
+
typer.Option(
|
|
600
|
+
"--eval-results-dataset", help="HF benchmark dataset id, e.g. org/benchmark"
|
|
601
|
+
),
|
|
602
|
+
] = None,
|
|
603
|
+
eval_results_task: Annotated[
|
|
604
|
+
str | None,
|
|
605
|
+
typer.Option(
|
|
606
|
+
"--eval-results-task", help="Benchmark task_id from the dataset's eval.yaml"
|
|
607
|
+
),
|
|
608
|
+
] = None,
|
|
584
609
|
matrix: Annotated[
|
|
585
610
|
Path | None,
|
|
586
611
|
typer.Option("--matrix", help="YAML model matrix for repeated evals"),
|
|
@@ -653,6 +678,10 @@ def eval_run(
|
|
|
653
678
|
publish_hf=publish_hf,
|
|
654
679
|
hf_prefix=hf_prefix,
|
|
655
680
|
hf_public_read_check=hf_public_read_check,
|
|
681
|
+
publish_bucket=publish_bucket,
|
|
682
|
+
eval_results_model=eval_results_model,
|
|
683
|
+
eval_results_dataset=eval_results_dataset,
|
|
684
|
+
eval_results_task=eval_results_task,
|
|
656
685
|
matrix=matrix,
|
|
657
686
|
trials=trials,
|
|
658
687
|
)
|
|
@@ -9,6 +9,7 @@ from pathlib import Path
|
|
|
9
9
|
from typing import Any, Literal
|
|
10
10
|
|
|
11
11
|
from benchflow._utils.task_authoring import task_digest
|
|
12
|
+
from benchflow._utils.text import truncate_end
|
|
12
13
|
from benchflow.task.discovery import is_task_dir, resolve_task_collection_root
|
|
13
14
|
from benchflow.trajectories.export_prime_sft import (
|
|
14
15
|
PrimeSftTrajectoryJsonlError,
|
|
@@ -268,6 +269,62 @@ def write_health_summary(path: Path, job_dir: Path) -> dict[str, Any]:
|
|
|
268
269
|
return summary
|
|
269
270
|
|
|
270
271
|
|
|
272
|
+
def _escape_md_cell(text: str) -> str:
|
|
273
|
+
return text.replace("|", "\\|").replace("\n", " ").strip()
|
|
274
|
+
|
|
275
|
+
|
|
276
|
+
_ISSUE_CELL_LIMIT = 120
|
|
277
|
+
|
|
278
|
+
|
|
279
|
+
def canonical_task_rows(job_dir: Path) -> list[dict[str, Any]]:
|
|
280
|
+
"""One row per task_id — the best-scored/highest-reward rollout.
|
|
281
|
+
|
|
282
|
+
Reused by the README summary and ``--eval-results-model`` so retry
|
|
283
|
+
attempts (multiple rollout dirs for the same task) are never counted
|
|
284
|
+
or averaged as if they were distinct tasks.
|
|
285
|
+
"""
|
|
286
|
+
return build_canonical_selection(job_dir, policy="one-healthy-per-task")["selected"]
|
|
287
|
+
|
|
288
|
+
|
|
289
|
+
def render_run_summary_markdown(
|
|
290
|
+
job_dir: Path, *, agent: str | None = None, model: str | None = None
|
|
291
|
+
) -> str:
|
|
292
|
+
"""Render a Markdown run summary (results + issues) for publish folders."""
|
|
293
|
+
rows = canonical_task_rows(job_dir)
|
|
294
|
+
rewards = [row["reward"] for row in rows if row["scored"]]
|
|
295
|
+
mean_reward = sum(rewards) / len(rewards) if rewards else None
|
|
296
|
+
scored_count = sum(1 for row in rows if row["scored"])
|
|
297
|
+
tool_call_count = sum(1 for row in rows if row["tool_calls"] > 0)
|
|
298
|
+
|
|
299
|
+
lines = ["# BenchFlow run summary", ""]
|
|
300
|
+
if agent:
|
|
301
|
+
lines.append(f"- Agent: `{agent}`")
|
|
302
|
+
if model:
|
|
303
|
+
lines.append(f"- Model: `{model}`")
|
|
304
|
+
lines += [
|
|
305
|
+
f"- Tasks: {len(rows)}",
|
|
306
|
+
f"- Scored: {scored_count} / Unscored: {len(rows) - scored_count}",
|
|
307
|
+
f"- Mean reward: {mean_reward:.3f}"
|
|
308
|
+
if mean_reward is not None
|
|
309
|
+
else "- Mean reward: n/a",
|
|
310
|
+
f"- Tasks with tool calls: {tool_call_count}",
|
|
311
|
+
"",
|
|
312
|
+
"## Tasks",
|
|
313
|
+
"",
|
|
314
|
+
"| Task | Reward | Tool calls | Issue |",
|
|
315
|
+
"| --- | --- | --- | --- |",
|
|
316
|
+
]
|
|
317
|
+
for row in rows:
|
|
318
|
+
reward = f"{row['reward']:.3f}" if isinstance(row["reward"], float) else "—"
|
|
319
|
+
issue = row.get("error") or row.get("verifier_error") or ""
|
|
320
|
+
issue = truncate_end(_escape_md_cell(str(issue)), _ISSUE_CELL_LIMIT)
|
|
321
|
+
lines.append(
|
|
322
|
+
f"| {_escape_md_cell(str(row['task_id']))} | {reward} | "
|
|
323
|
+
f"{row['tool_calls']} | {issue} |"
|
|
324
|
+
)
|
|
325
|
+
return "\n".join(lines) + "\n"
|
|
326
|
+
|
|
327
|
+
|
|
271
328
|
def _canonical_score(row: dict[str, Any]) -> tuple[int, float, int]:
|
|
272
329
|
scored = 1 if row["scored"] else 0
|
|
273
330
|
reward = row["reward"] if isinstance(row["reward"], float) else float("-inf")
|
|
@@ -126,6 +126,10 @@ class EvalCreateRequest:
|
|
|
126
126
|
publish_hf: str | None = None
|
|
127
127
|
hf_prefix: str | None = None
|
|
128
128
|
hf_public_read_check: bool = False
|
|
129
|
+
publish_bucket: str | None = None
|
|
130
|
+
eval_results_model: str | None = None
|
|
131
|
+
eval_results_dataset: str | None = None
|
|
132
|
+
eval_results_task: str | None = None
|
|
129
133
|
matrix: Path | None = None
|
|
130
134
|
trials: int = 1
|
|
131
135
|
|
|
@@ -274,8 +278,14 @@ def build_eval_plan(request: EvalCreateRequest) -> EvalPlan:
|
|
|
274
278
|
raise EvalPlanError("--retry-attempts must be >= 0")
|
|
275
279
|
if request.retry_concurrency is not None and request.retry_concurrency < 1:
|
|
276
280
|
raise EvalPlanError("--retry-concurrency must be >= 1")
|
|
277
|
-
if request.hf_prefix and not request.publish_hf:
|
|
278
|
-
raise EvalPlanError("--hf-prefix requires --publish-hf")
|
|
281
|
+
if request.hf_prefix and not (request.publish_hf or request.publish_bucket):
|
|
282
|
+
raise EvalPlanError("--hf-prefix requires --publish-hf or --publish-bucket")
|
|
283
|
+
if request.eval_results_model and not (
|
|
284
|
+
request.eval_results_dataset and request.eval_results_task
|
|
285
|
+
):
|
|
286
|
+
raise EvalPlanError(
|
|
287
|
+
"--eval-results-model requires --eval-results-dataset and --eval-results-task"
|
|
288
|
+
)
|
|
279
289
|
if request.tasks_dir and not Path(request.tasks_dir).exists():
|
|
280
290
|
raise EvalPlanError(f"--tasks-dir not found: {request.tasks_dir}")
|
|
281
291
|
if request.matrix is not None and not Path(request.matrix).is_file():
|
|
@@ -38,6 +38,14 @@ def _resolve_url(repo_id: str, repo_type: str, path_in_repo: str) -> str:
|
|
|
38
38
|
return f"https://huggingface.co/{kind}{repo_id}/resolve/main/{path_in_repo}"
|
|
39
39
|
|
|
40
40
|
|
|
41
|
+
def _bucket_tree_url(bucket_id: str, path_in_repo: str) -> str:
|
|
42
|
+
# Buckets are non-versioned (no "main" branch), so the browsable listing
|
|
43
|
+
# is /tree/<path> directly, not /resolve/<path> (which 404s) or
|
|
44
|
+
# /tree/main/<path> (the git-repo convention _tree_url uses).
|
|
45
|
+
suffix = f"/tree/{path_in_repo.strip('/')}" if path_in_repo else ""
|
|
46
|
+
return f"https://huggingface.co/buckets/{bucket_id}{suffix}"
|
|
47
|
+
|
|
48
|
+
|
|
41
49
|
def _check_public_files(repo_id: str, repo_type: str, path_in_repo: str) -> None:
|
|
42
50
|
index_url = _tree_url(repo_id, repo_type, path_in_repo)
|
|
43
51
|
response = httpx.get(index_url, follow_redirects=True, timeout=20)
|
|
@@ -79,6 +87,106 @@ def publish_folder_to_hf(
|
|
|
79
87
|
)
|
|
80
88
|
|
|
81
89
|
|
|
90
|
+
def publish_folder_to_bucket(
|
|
91
|
+
folder: Path,
|
|
92
|
+
*,
|
|
93
|
+
bucket_id: str,
|
|
94
|
+
path_in_repo: str = "",
|
|
95
|
+
private: bool = False,
|
|
96
|
+
) -> HfPublishResult:
|
|
97
|
+
if not folder.is_dir():
|
|
98
|
+
raise ValueError(f"publish source folder not found: {folder}")
|
|
99
|
+
try:
|
|
100
|
+
from huggingface_hub import create_bucket, sync_bucket
|
|
101
|
+
from huggingface_hub.errors import HfHubHTTPError
|
|
102
|
+
except ImportError as exc: # pragma: no cover - depends on env
|
|
103
|
+
raise ValueError(
|
|
104
|
+
"huggingface_hub with bucket support (create_bucket/sync_bucket) is "
|
|
105
|
+
"required for --publish-bucket; upgrade huggingface_hub"
|
|
106
|
+
) from exc
|
|
107
|
+
try:
|
|
108
|
+
create_bucket(bucket_id, private=private)
|
|
109
|
+
except HfHubHTTPError as exc:
|
|
110
|
+
if exc.response is None or exc.response.status_code != 409:
|
|
111
|
+
raise
|
|
112
|
+
prefix = path_in_repo.strip("/")
|
|
113
|
+
remote = (
|
|
114
|
+
f"hf://buckets/{bucket_id}/{prefix}" if prefix else f"hf://buckets/{bucket_id}"
|
|
115
|
+
)
|
|
116
|
+
sync_bucket(str(folder), remote)
|
|
117
|
+
return HfPublishResult(
|
|
118
|
+
repo_id=bucket_id,
|
|
119
|
+
repo_type="bucket",
|
|
120
|
+
path_in_repo=prefix,
|
|
121
|
+
url=_bucket_tree_url(bucket_id, prefix),
|
|
122
|
+
)
|
|
123
|
+
|
|
124
|
+
|
|
125
|
+
_EVAL_RESULTS_PATH = ".eval_results/benchflow.yaml"
|
|
126
|
+
|
|
127
|
+
|
|
128
|
+
def _existing_eval_results(model_repo: str) -> list[dict]:
|
|
129
|
+
from huggingface_hub import hf_hub_download
|
|
130
|
+
from huggingface_hub.errors import EntryNotFoundError, RepositoryNotFoundError
|
|
131
|
+
|
|
132
|
+
try:
|
|
133
|
+
downloaded = hf_hub_download(
|
|
134
|
+
repo_id=model_repo, filename=_EVAL_RESULTS_PATH, repo_type="model"
|
|
135
|
+
)
|
|
136
|
+
except (EntryNotFoundError, RepositoryNotFoundError):
|
|
137
|
+
return []
|
|
138
|
+
import yaml
|
|
139
|
+
|
|
140
|
+
data = yaml.safe_load(Path(downloaded).read_text())
|
|
141
|
+
return data if isinstance(data, list) else []
|
|
142
|
+
|
|
143
|
+
|
|
144
|
+
def _upsert_eval_result(existing: list[dict], entry: dict) -> list[dict]:
|
|
145
|
+
key = (entry["dataset"]["id"], entry["dataset"]["task_id"])
|
|
146
|
+
kept = [
|
|
147
|
+
row
|
|
148
|
+
for row in existing
|
|
149
|
+
if (row.get("dataset", {}).get("id"), row.get("dataset", {}).get("task_id"))
|
|
150
|
+
!= key
|
|
151
|
+
]
|
|
152
|
+
return [*kept, entry]
|
|
153
|
+
|
|
154
|
+
|
|
155
|
+
def open_eval_results_pr(
|
|
156
|
+
*,
|
|
157
|
+
model_repo: str,
|
|
158
|
+
dataset_id: str,
|
|
159
|
+
task_id: str,
|
|
160
|
+
value: float,
|
|
161
|
+
source_url: str | None = None,
|
|
162
|
+
notes: str | None = None,
|
|
163
|
+
) -> str | None:
|
|
164
|
+
try:
|
|
165
|
+
import yaml
|
|
166
|
+
from huggingface_hub import CommitOperationAdd, HfApi
|
|
167
|
+
except ImportError as exc: # pragma: no cover - depends on env
|
|
168
|
+
raise ValueError(
|
|
169
|
+
"huggingface_hub is required for --eval-results-model"
|
|
170
|
+
) from exc
|
|
171
|
+
entry: dict = {"dataset": {"id": dataset_id, "task_id": task_id}, "value": value}
|
|
172
|
+
if source_url:
|
|
173
|
+
entry["source"] = {"url": source_url}
|
|
174
|
+
if notes:
|
|
175
|
+
entry["notes"] = notes
|
|
176
|
+
merged = _upsert_eval_result(_existing_eval_results(model_repo), entry)
|
|
177
|
+
content = yaml.safe_dump(merged, sort_keys=False).encode("utf-8")
|
|
178
|
+
commit = HfApi().create_commit(
|
|
179
|
+
repo_id=model_repo,
|
|
180
|
+
repo_type="model",
|
|
181
|
+
operations=[
|
|
182
|
+
CommitOperationAdd(path_in_repo=_EVAL_RESULTS_PATH, path_or_fileobj=content)
|
|
183
|
+
],
|
|
184
|
+
commit_message=f"Add {dataset_id} eval results",
|
|
185
|
+
create_pr=True,
|
|
186
|
+
)
|
|
187
|
+
return commit.pr_url
|
|
188
|
+
|
|
189
|
+
|
|
82
190
|
def publish_file_to_hf(
|
|
83
191
|
file_path: Path,
|
|
84
192
|
*,
|
|
@@ -393,6 +393,29 @@ def test_agent_timeout_sec_accepts_positive_or_none(ok):
|
|
|
393
393
|
# --- v0.6 CLI-dogfood guards: clean fail-fast instead of raw tracebacks -------
|
|
394
394
|
|
|
395
395
|
|
|
396
|
+
def test_hf_prefix_accepted_with_publish_bucket(tmp_path: Path):
|
|
397
|
+
# Guards against --hf-prefix rejecting --publish-bucket: the bucket
|
|
398
|
+
# postprocess path reads req.hf_prefix, so it must be a valid pairing.
|
|
399
|
+
plan = build_eval_plan(
|
|
400
|
+
EvalCreateRequest(
|
|
401
|
+
tasks_dir=_task_dir(tmp_path),
|
|
402
|
+
agent="oracle",
|
|
403
|
+
publish_bucket="org/bucket",
|
|
404
|
+
hf_prefix="runs/x",
|
|
405
|
+
)
|
|
406
|
+
)
|
|
407
|
+
assert plan.request.hf_prefix == "runs/x"
|
|
408
|
+
|
|
409
|
+
|
|
410
|
+
def test_hf_prefix_without_publish_hf_or_bucket_rejected(tmp_path: Path):
|
|
411
|
+
with pytest.raises(EvalPlanError, match="--publish-hf or --publish-bucket"):
|
|
412
|
+
build_eval_plan(
|
|
413
|
+
EvalCreateRequest(
|
|
414
|
+
tasks_dir=_task_dir(tmp_path), agent="oracle", hf_prefix="runs/x"
|
|
415
|
+
)
|
|
416
|
+
)
|
|
417
|
+
|
|
418
|
+
|
|
396
419
|
def test_config_missing_path_rejected_cleanly(tmp_path: Path):
|
|
397
420
|
# Was: a raw FileNotFoundError traceback from Evaluation.from_yaml's open().
|
|
398
421
|
with pytest.raises(EvalPlanError, match="--config not found"):
|
|
@@ -142,6 +142,254 @@ def test_eval_run_writes_manifest_health_and_canonical_artifacts(
|
|
|
142
142
|
assert (canonical_jobs / "task-a__abc" / "result.json").is_file()
|
|
143
143
|
|
|
144
144
|
|
|
145
|
+
def test_eval_run_publish_bucket_writes_readme_summary(
|
|
146
|
+
tmp_path: Path, monkeypatch
|
|
147
|
+
) -> None:
|
|
148
|
+
"""--publish-bucket writes a README.md run summary into job_dir before upload."""
|
|
149
|
+
tasks = tmp_path / "tasks"
|
|
150
|
+
_write_task(tasks / "task-a")
|
|
151
|
+
|
|
152
|
+
async def fake_run(self):
|
|
153
|
+
job_dir = self._jobs_dir / self._job_name
|
|
154
|
+
_write_rollout(job_dir / "task-a__abc", "task-a")
|
|
155
|
+
return SimpleNamespace(
|
|
156
|
+
job_name=self._job_name,
|
|
157
|
+
passed=1,
|
|
158
|
+
failed=0,
|
|
159
|
+
errored=0,
|
|
160
|
+
verifier_errored=0,
|
|
161
|
+
total=1,
|
|
162
|
+
score=1.0,
|
|
163
|
+
score_excl_errors=1.0,
|
|
164
|
+
)
|
|
165
|
+
|
|
166
|
+
monkeypatch.setattr(Evaluation, "run", fake_run)
|
|
167
|
+
|
|
168
|
+
captured: dict[str, Path] = {}
|
|
169
|
+
|
|
170
|
+
def fake_publish_folder_to_bucket(
|
|
171
|
+
folder, *, bucket_id, path_in_repo="", private=False
|
|
172
|
+
):
|
|
173
|
+
captured["folder"] = folder
|
|
174
|
+
return SimpleNamespace(url=f"https://huggingface.co/buckets/{bucket_id}")
|
|
175
|
+
|
|
176
|
+
import benchflow.publish.huggingface as hf_publish
|
|
177
|
+
|
|
178
|
+
monkeypatch.setattr(
|
|
179
|
+
hf_publish, "publish_folder_to_bucket", fake_publish_folder_to_bucket
|
|
180
|
+
)
|
|
181
|
+
|
|
182
|
+
jobs_dir = tmp_path / "jobs"
|
|
183
|
+
result = runner.invoke(
|
|
184
|
+
app,
|
|
185
|
+
[
|
|
186
|
+
"eval",
|
|
187
|
+
"run",
|
|
188
|
+
"--tasks-dir",
|
|
189
|
+
str(tasks),
|
|
190
|
+
"--agent",
|
|
191
|
+
"oracle",
|
|
192
|
+
"--jobs-dir",
|
|
193
|
+
str(jobs_dir),
|
|
194
|
+
"--publish-bucket",
|
|
195
|
+
"org/some-bucket",
|
|
196
|
+
],
|
|
197
|
+
)
|
|
198
|
+
|
|
199
|
+
assert result.exit_code == 0, result.output
|
|
200
|
+
readme = captured["folder"] / "README.md"
|
|
201
|
+
assert readme.is_file()
|
|
202
|
+
text = readme.read_text()
|
|
203
|
+
assert "task-a" in text
|
|
204
|
+
assert "Mean reward: 1.000" in text
|
|
205
|
+
assert "`oracle`" in text
|
|
206
|
+
|
|
207
|
+
|
|
208
|
+
def test_eval_run_publish_bucket_readme_dedupes_retry_attempts(
|
|
209
|
+
tmp_path: Path, monkeypatch
|
|
210
|
+
) -> None:
|
|
211
|
+
"""Retry rollout dirs for the same task must count as one task, best-scored.
|
|
212
|
+
|
|
213
|
+
Guards against README.md (and the --eval-results-model reward mean)
|
|
214
|
+
treating each retry attempt as a distinct task.
|
|
215
|
+
"""
|
|
216
|
+
tasks = tmp_path / "tasks"
|
|
217
|
+
_write_task(tasks / "task-a")
|
|
218
|
+
|
|
219
|
+
async def fake_run(self):
|
|
220
|
+
job_dir = self._jobs_dir / self._job_name
|
|
221
|
+
_write_rollout(job_dir / "task-a__attempt1", "task-a")
|
|
222
|
+
(job_dir / "task-a__attempt1" / "result.json").write_text(
|
|
223
|
+
json.dumps({"task_name": "task-a", "rewards": {"reward": 0.0}}),
|
|
224
|
+
encoding="utf-8",
|
|
225
|
+
)
|
|
226
|
+
_write_rollout(job_dir / "task-a__attempt2", "task-a")
|
|
227
|
+
return SimpleNamespace(
|
|
228
|
+
job_name=self._job_name,
|
|
229
|
+
passed=1,
|
|
230
|
+
failed=0,
|
|
231
|
+
errored=0,
|
|
232
|
+
verifier_errored=0,
|
|
233
|
+
total=1,
|
|
234
|
+
score=1.0,
|
|
235
|
+
score_excl_errors=1.0,
|
|
236
|
+
)
|
|
237
|
+
|
|
238
|
+
monkeypatch.setattr(Evaluation, "run", fake_run)
|
|
239
|
+
|
|
240
|
+
captured: dict[str, Path] = {}
|
|
241
|
+
|
|
242
|
+
def fake_publish_folder_to_bucket(
|
|
243
|
+
folder, *, bucket_id, path_in_repo="", private=False
|
|
244
|
+
):
|
|
245
|
+
captured["folder"] = folder
|
|
246
|
+
return SimpleNamespace(url=f"https://huggingface.co/buckets/{bucket_id}")
|
|
247
|
+
|
|
248
|
+
import benchflow.publish.huggingface as hf_publish
|
|
249
|
+
|
|
250
|
+
monkeypatch.setattr(
|
|
251
|
+
hf_publish, "publish_folder_to_bucket", fake_publish_folder_to_bucket
|
|
252
|
+
)
|
|
253
|
+
|
|
254
|
+
result = runner.invoke(
|
|
255
|
+
app,
|
|
256
|
+
[
|
|
257
|
+
"eval",
|
|
258
|
+
"run",
|
|
259
|
+
"--tasks-dir",
|
|
260
|
+
str(tasks),
|
|
261
|
+
"--agent",
|
|
262
|
+
"oracle",
|
|
263
|
+
"--jobs-dir",
|
|
264
|
+
str(tmp_path / "jobs"),
|
|
265
|
+
"--publish-bucket",
|
|
266
|
+
"org/some-bucket",
|
|
267
|
+
],
|
|
268
|
+
)
|
|
269
|
+
|
|
270
|
+
assert result.exit_code == 0, result.output
|
|
271
|
+
text = (captured["folder"] / "README.md").read_text()
|
|
272
|
+
assert "- Tasks: 1" in text
|
|
273
|
+
assert "- Mean reward: 1.000" in text
|
|
274
|
+
assert text.count("| task-a |") == 1
|
|
275
|
+
|
|
276
|
+
|
|
277
|
+
def test_eval_run_eval_results_dedupes_retry_attempts(
|
|
278
|
+
tmp_path: Path, monkeypatch
|
|
279
|
+
) -> None:
|
|
280
|
+
"""The --eval-results-model reward mean must not double-count retries."""
|
|
281
|
+
tasks = tmp_path / "tasks"
|
|
282
|
+
_write_task(tasks / "task-a")
|
|
283
|
+
|
|
284
|
+
async def fake_run(self):
|
|
285
|
+
job_dir = self._jobs_dir / self._job_name
|
|
286
|
+
_write_rollout(job_dir / "task-a__attempt1", "task-a")
|
|
287
|
+
(job_dir / "task-a__attempt1" / "result.json").write_text(
|
|
288
|
+
json.dumps({"task_name": "task-a", "rewards": {"reward": 0.0}}),
|
|
289
|
+
encoding="utf-8",
|
|
290
|
+
)
|
|
291
|
+
_write_rollout(job_dir / "task-a__attempt2", "task-a")
|
|
292
|
+
return SimpleNamespace(
|
|
293
|
+
job_name=self._job_name,
|
|
294
|
+
passed=1,
|
|
295
|
+
failed=0,
|
|
296
|
+
errored=0,
|
|
297
|
+
verifier_errored=0,
|
|
298
|
+
total=1,
|
|
299
|
+
score=1.0,
|
|
300
|
+
score_excl_errors=1.0,
|
|
301
|
+
)
|
|
302
|
+
|
|
303
|
+
monkeypatch.setattr(Evaluation, "run", fake_run)
|
|
304
|
+
|
|
305
|
+
captured: dict[str, float] = {}
|
|
306
|
+
|
|
307
|
+
def fake_open_eval_results_pr(
|
|
308
|
+
*, model_repo, dataset_id, task_id, value, source_url=None, notes=None
|
|
309
|
+
):
|
|
310
|
+
captured["value"] = value
|
|
311
|
+
return "https://huggingface.co/org/model/discussions/1"
|
|
312
|
+
|
|
313
|
+
import benchflow.publish.huggingface as hf_publish
|
|
314
|
+
|
|
315
|
+
monkeypatch.setattr(hf_publish, "open_eval_results_pr", fake_open_eval_results_pr)
|
|
316
|
+
|
|
317
|
+
result = runner.invoke(
|
|
318
|
+
app,
|
|
319
|
+
[
|
|
320
|
+
"eval",
|
|
321
|
+
"run",
|
|
322
|
+
"--tasks-dir",
|
|
323
|
+
str(tasks),
|
|
324
|
+
"--agent",
|
|
325
|
+
"oracle",
|
|
326
|
+
"--jobs-dir",
|
|
327
|
+
str(tmp_path / "jobs"),
|
|
328
|
+
"--eval-results-model",
|
|
329
|
+
"org/model",
|
|
330
|
+
"--eval-results-dataset",
|
|
331
|
+
"org/bench",
|
|
332
|
+
"--eval-results-task",
|
|
333
|
+
"t1",
|
|
334
|
+
],
|
|
335
|
+
)
|
|
336
|
+
|
|
337
|
+
assert result.exit_code == 0, result.output
|
|
338
|
+
# Best-of-retries reward is 1.0 -> 100.0, not the naive two-attempt mean (50.0).
|
|
339
|
+
assert captured["value"] == 100.0
|
|
340
|
+
|
|
341
|
+
|
|
342
|
+
def test_eval_run_eval_results_warns_when_nothing_scored(
|
|
343
|
+
tmp_path: Path, monkeypatch
|
|
344
|
+
) -> None:
|
|
345
|
+
tasks = tmp_path / "tasks"
|
|
346
|
+
_write_task(tasks / "task-a")
|
|
347
|
+
|
|
348
|
+
async def fake_run(self):
|
|
349
|
+
job_dir = self._jobs_dir / self._job_name
|
|
350
|
+
rollout = job_dir / "task-a__abc"
|
|
351
|
+
rollout.mkdir(parents=True)
|
|
352
|
+
(rollout / "result.json").write_text(
|
|
353
|
+
json.dumps({"task_name": "task-a", "rewards": None}),
|
|
354
|
+
encoding="utf-8",
|
|
355
|
+
)
|
|
356
|
+
return SimpleNamespace(
|
|
357
|
+
job_name=self._job_name,
|
|
358
|
+
passed=0,
|
|
359
|
+
failed=1,
|
|
360
|
+
errored=0,
|
|
361
|
+
verifier_errored=0,
|
|
362
|
+
total=1,
|
|
363
|
+
score=0.0,
|
|
364
|
+
score_excl_errors=0.0,
|
|
365
|
+
)
|
|
366
|
+
|
|
367
|
+
monkeypatch.setattr(Evaluation, "run", fake_run)
|
|
368
|
+
|
|
369
|
+
result = runner.invoke(
|
|
370
|
+
app,
|
|
371
|
+
[
|
|
372
|
+
"eval",
|
|
373
|
+
"run",
|
|
374
|
+
"--tasks-dir",
|
|
375
|
+
str(tasks),
|
|
376
|
+
"--agent",
|
|
377
|
+
"oracle",
|
|
378
|
+
"--jobs-dir",
|
|
379
|
+
str(tmp_path / "jobs"),
|
|
380
|
+
"--eval-results-model",
|
|
381
|
+
"org/model",
|
|
382
|
+
"--eval-results-dataset",
|
|
383
|
+
"org/bench",
|
|
384
|
+
"--eval-results-task",
|
|
385
|
+
"t1",
|
|
386
|
+
],
|
|
387
|
+
)
|
|
388
|
+
|
|
389
|
+
assert result.exit_code == 0, result.output
|
|
390
|
+
assert "no scored rollouts" in result.output
|
|
391
|
+
|
|
392
|
+
|
|
145
393
|
def test_sharded_health_and_selection_discover_worker_shards(tmp_path: Path) -> None:
|
|
146
394
|
jobs_dir = tmp_path / "jobs"
|
|
147
395
|
advertised_job_dir = jobs_dir / "worker-sharded"
|