PyPI - deepeval - Versions diffs - 3.7.4__py3-none-any.whl → 3.7.5__py3-none-any.whl - Mend

deepeval 3.7.4py3-none-any.whl → 3.7.5py3-none-any.whl

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.

Files changed (155) hide show

deepeval/_version.py +1 -1
deepeval/dataset/golden.py +54 -2
deepeval/evaluate/evaluate.py +16 -8
deepeval/evaluate/execute.py +70 -26
deepeval/evaluate/utils.py +26 -22
deepeval/integrations/pydantic_ai/agent.py +19 -2
deepeval/integrations/pydantic_ai/instrumentator.py +62 -23
deepeval/metrics/__init__.py +14 -12
deepeval/metrics/answer_relevancy/answer_relevancy.py +74 -29
deepeval/metrics/answer_relevancy/template.py +188 -92
deepeval/metrics/base_metric.py +2 -5
deepeval/metrics/contextual_precision/contextual_precision.py +53 -15
deepeval/metrics/contextual_precision/template.py +115 -66
deepeval/metrics/contextual_recall/contextual_recall.py +50 -13
deepeval/metrics/contextual_recall/template.py +106 -55
deepeval/metrics/contextual_relevancy/contextual_relevancy.py +47 -15
deepeval/metrics/contextual_relevancy/template.py +87 -58
deepeval/metrics/dag/templates.py +2 -2
deepeval/metrics/faithfulness/faithfulness.py +70 -27
deepeval/metrics/faithfulness/schema.py +1 -1
deepeval/metrics/faithfulness/template.py +200 -115
deepeval/metrics/g_eval/utils.py +2 -2
deepeval/metrics/indicator.py +4 -4
deepeval/metrics/multimodal_metrics/__init__.py +0 -18
deepeval/metrics/multimodal_metrics/image_coherence/image_coherence.py +24 -17
deepeval/metrics/multimodal_metrics/image_editing/image_editing.py +26 -21
deepeval/metrics/multimodal_metrics/image_helpfulness/image_helpfulness.py +24 -17
deepeval/metrics/multimodal_metrics/image_reference/image_reference.py +24 -17
deepeval/metrics/multimodal_metrics/multimodal_g_eval/multimodal_g_eval.py +19 -19
deepeval/metrics/multimodal_metrics/multimodal_g_eval/template.py +63 -78
deepeval/metrics/multimodal_metrics/multimodal_g_eval/utils.py +20 -20
deepeval/metrics/multimodal_metrics/text_to_image/text_to_image.py +71 -50
deepeval/metrics/ragas.py +3 -3
deepeval/metrics/tool_correctness/tool_correctness.py +2 -2
deepeval/metrics/turn_contextual_precision/schema.py +21 -0
deepeval/metrics/turn_contextual_precision/template.py +187 -0
deepeval/metrics/turn_contextual_precision/turn_contextual_precision.py +550 -0
deepeval/metrics/turn_contextual_recall/schema.py +21 -0
deepeval/metrics/turn_contextual_recall/template.py +178 -0
deepeval/metrics/turn_contextual_recall/turn_contextual_recall.py +520 -0
deepeval/metrics/{multimodal_metrics/multimodal_contextual_relevancy → turn_contextual_relevancy}/schema.py +7 -1
deepeval/metrics/turn_contextual_relevancy/template.py +161 -0
deepeval/metrics/turn_contextual_relevancy/turn_contextual_relevancy.py +535 -0
deepeval/metrics/{multimodal_metrics/multimodal_faithfulness → turn_faithfulness}/schema.py +11 -3
deepeval/metrics/turn_faithfulness/template.py +218 -0
deepeval/metrics/turn_faithfulness/turn_faithfulness.py +596 -0
deepeval/metrics/utils.py +39 -58
deepeval/models/__init__.py +0 -12
deepeval/models/base_model.py +16 -38
deepeval/models/embedding_models/__init__.py +7 -0
deepeval/models/embedding_models/azure_embedding_model.py +52 -28
deepeval/models/embedding_models/local_embedding_model.py +18 -14
deepeval/models/embedding_models/ollama_embedding_model.py +38 -16
deepeval/models/embedding_models/openai_embedding_model.py +40 -21
deepeval/models/llms/amazon_bedrock_model.py +1 -2
deepeval/models/llms/anthropic_model.py +44 -23
deepeval/models/llms/azure_model.py +121 -36
deepeval/models/llms/deepseek_model.py +18 -13
deepeval/models/llms/gemini_model.py +129 -43
deepeval/models/llms/grok_model.py +18 -13
deepeval/models/llms/kimi_model.py +18 -13
deepeval/models/llms/litellm_model.py +42 -22
deepeval/models/llms/local_model.py +12 -7
deepeval/models/llms/ollama_model.py +114 -12
deepeval/models/llms/openai_model.py +137 -41
deepeval/models/llms/portkey_model.py +24 -7
deepeval/models/llms/utils.py +5 -3
deepeval/models/retry_policy.py +17 -14
deepeval/models/utils.py +46 -1
deepeval/optimizer/__init__.py +5 -0
deepeval/optimizer/algorithms/__init__.py +6 -0
deepeval/optimizer/algorithms/base.py +29 -0
deepeval/optimizer/algorithms/configs.py +18 -0
deepeval/optimizer/algorithms/copro/__init__.py +5 -0
deepeval/{optimization/copro/loop.py → optimizer/algorithms/copro/copro.py} +112 -113
deepeval/optimizer/algorithms/gepa/__init__.py +5 -0
deepeval/{optimization/gepa/loop.py → optimizer/algorithms/gepa/gepa.py} +175 -115
deepeval/optimizer/algorithms/miprov2/__init__.py +17 -0
deepeval/optimizer/algorithms/miprov2/bootstrapper.py +435 -0
deepeval/optimizer/algorithms/miprov2/miprov2.py +752 -0
deepeval/optimizer/algorithms/miprov2/proposer.py +301 -0
deepeval/optimizer/algorithms/simba/__init__.py +5 -0
deepeval/{optimization/simba/loop.py → optimizer/algorithms/simba/simba.py} +128 -112
deepeval/{optimization → optimizer}/configs.py +5 -8
deepeval/{optimization/policies/selection.py → optimizer/policies.py} +63 -2
deepeval/optimizer/prompt_optimizer.py +263 -0
deepeval/optimizer/rewriter/__init__.py +5 -0
deepeval/optimizer/rewriter/rewriter.py +124 -0
deepeval/optimizer/rewriter/utils.py +214 -0
deepeval/optimizer/scorer/__init__.py +5 -0
deepeval/optimizer/scorer/base.py +86 -0
deepeval/optimizer/scorer/scorer.py +316 -0
deepeval/optimizer/scorer/utils.py +30 -0
deepeval/optimizer/types.py +148 -0
deepeval/{optimization → optimizer}/utils.py +47 -165
deepeval/prompt/prompt.py +5 -9
deepeval/test_case/__init__.py +1 -3
deepeval/test_case/api.py +12 -10
deepeval/test_case/conversational_test_case.py +19 -1
deepeval/test_case/llm_test_case.py +152 -1
deepeval/test_case/utils.py +4 -8
deepeval/test_run/api.py +15 -14
deepeval/test_run/test_run.py +3 -3
deepeval/tracing/patchers.py +9 -4
deepeval/tracing/tracing.py +2 -2
deepeval/utils.py +65 -0
{deepeval-3.7.4.dist-info → deepeval-3.7.5.dist-info}/METADATA +1 -4
{deepeval-3.7.4.dist-info → deepeval-3.7.5.dist-info}/RECORD +116 -125
deepeval/metrics/multimodal_metrics/multimodal_answer_relevancy/multimodal_answer_relevancy.py +0 -343
deepeval/metrics/multimodal_metrics/multimodal_answer_relevancy/schema.py +0 -19
deepeval/metrics/multimodal_metrics/multimodal_answer_relevancy/template.py +0 -122
deepeval/metrics/multimodal_metrics/multimodal_contextual_precision/multimodal_contextual_precision.py +0 -301
deepeval/metrics/multimodal_metrics/multimodal_contextual_precision/schema.py +0 -15
deepeval/metrics/multimodal_metrics/multimodal_contextual_precision/template.py +0 -132
deepeval/metrics/multimodal_metrics/multimodal_contextual_recall/multimodal_contextual_recall.py +0 -285
deepeval/metrics/multimodal_metrics/multimodal_contextual_recall/schema.py +0 -15
deepeval/metrics/multimodal_metrics/multimodal_contextual_recall/template.py +0 -112
deepeval/metrics/multimodal_metrics/multimodal_contextual_relevancy/multimodal_contextual_relevancy.py +0 -282
deepeval/metrics/multimodal_metrics/multimodal_contextual_relevancy/template.py +0 -102
deepeval/metrics/multimodal_metrics/multimodal_faithfulness/__init__.py +0 -0
deepeval/metrics/multimodal_metrics/multimodal_faithfulness/multimodal_faithfulness.py +0 -356
deepeval/metrics/multimodal_metrics/multimodal_faithfulness/template.py +0 -175
deepeval/metrics/multimodal_metrics/multimodal_tool_correctness/__init__.py +0 -0
deepeval/metrics/multimodal_metrics/multimodal_tool_correctness/multimodal_tool_correctness.py +0 -290
deepeval/models/mlllms/__init__.py +0 -4
deepeval/models/mlllms/azure_model.py +0 -343
deepeval/models/mlllms/gemini_model.py +0 -313
deepeval/models/mlllms/ollama_model.py +0 -175
deepeval/models/mlllms/openai_model.py +0 -309
deepeval/optimization/__init__.py +0 -13
deepeval/optimization/adapters/__init__.py +0 -2
deepeval/optimization/adapters/deepeval_scoring_adapter.py +0 -588
deepeval/optimization/aggregates.py +0 -14
deepeval/optimization/copro/configs.py +0 -31
deepeval/optimization/gepa/__init__.py +0 -7
deepeval/optimization/gepa/configs.py +0 -115
deepeval/optimization/miprov2/configs.py +0 -134
deepeval/optimization/miprov2/loop.py +0 -785
deepeval/optimization/mutations/__init__.py +0 -0
deepeval/optimization/mutations/prompt_rewriter.py +0 -458
deepeval/optimization/policies/__init__.py +0 -16
deepeval/optimization/policies/tie_breaker.py +0 -67
deepeval/optimization/prompt_optimizer.py +0 -462
deepeval/optimization/simba/__init__.py +0 -0
deepeval/optimization/simba/configs.py +0 -33
deepeval/optimization/types.py +0 -361
deepeval/test_case/mllm_test_case.py +0 -170
/deepeval/metrics/{multimodal_metrics/multimodal_answer_relevancy → turn_contextual_precision}/__init__.py +0 -0
/deepeval/metrics/{multimodal_metrics/multimodal_contextual_precision → turn_contextual_recall}/__init__.py +0 -0
/deepeval/metrics/{multimodal_metrics/multimodal_contextual_recall → turn_contextual_relevancy}/__init__.py +0 -0
/deepeval/metrics/{multimodal_metrics/multimodal_contextual_relevancy → turn_faithfulness}/__init__.py +0 -0
/deepeval/{optimization → optimizer/algorithms}/simba/types.py +0 -0
{deepeval-3.7.4.dist-info → deepeval-3.7.5.dist-info}/LICENSE.md +0 -0
{deepeval-3.7.4.dist-info → deepeval-3.7.5.dist-info}/WHEEL +0 -0
{deepeval-3.7.4.dist-info → deepeval-3.7.5.dist-info}/entry_points.txt +0 -0

deepeval/metrics/multimodal_metrics/multimodal_g_eval/template.py CHANGED Viewed

@@ -53,53 +53,45 @@ class MultimodalGEvalTemplate:
             else ""
         )
-        return (
-            [
-                textwrap.dedent(
-                    f"""You are an evaluator. Given the following {dependencies}, assess the response below and return a JSON object with two fields:
-                - `"score"`: an integer between {score_range[0]} and {score_range[1]}, {score_explanation}.
-                - `"reason"`: a brief explanation for why the score was given. This must mention specific strengths or shortcomings, referencing relevant details from the input. Do **not** quote the score itself in the explanation.
-                Your explanation should:
-                - {reasoning_expectation}
-                - Mention key details from the test case parameters.
-                - Be concise, clear, and focused on the evaluation logic.
-                Only return valid JSON. Do **not** include any extra commentary or text.
-                ---
-                Evaluation Steps:
-                {evaluation_steps}
-                {rubric_text}
-                Test Case:
-                ************************
-                """
-                )
-            ]
-            + test_case_list
-            + [
-                textwrap.dedent(
-                    f"""
-                ************************
-                \n\n\n
-                Parameters:
-                {parameters}
-                {additional_context}
-                ---
-                **Example JSON:**
-                {{
-                    "reason": "your concise and informative reason here",
-                    "score": {score_range[0]}
-                }}
-                JSON:
-                """
-                )
-            ]
+        return textwrap.dedent(
+            f"""You are an evaluator. Given the following {dependencies}, assess the response below and return a JSON object with two fields:
+            - `"score"`: an integer between {score_range[0]} and {score_range[1]}, {score_explanation}.
+            - `"reason"`: a brief explanation for why the score was given. This must mention specific strengths or shortcomings, referencing relevant details from the input. Do **not** quote the score itself in the explanation.
+            Your explanation should:
+            - {reasoning_expectation}
+            - Mention key details from the test case parameters.
+            - Be concise, clear, and focused on the evaluation logic.
+            Only return valid JSON. Do **not** include any extra commentary or text.
+            ---
+            Evaluation Steps:
+            {evaluation_steps}
+            {rubric_text}
+            Test Case:
+            ************************
+            {test_case_list}
+            ************************
+            \n\n\n
+            Parameters:
+            {parameters}
+            {additional_context}
+            ---
+            **Example JSON:**
+            {{
+                "reason": "your concise and informative reason here",
+                "score": {score_range[0]}
+            }}
+            JSON:
+            """
         )
     @staticmethod
@@ -114,35 +106,28 @@ class MultimodalGEvalTemplate:
             if _additional_context
             else ""
         )
-        return (
-            [
-                textwrap.dedent(
-                    f"""Given the evaluation steps, return a JSON with two keys: 1) a `score` key that is STRICTLY EITHER 1 (follows the criteria 100% outlined in the evaluation steps), OR 0 (does not follow the criteria), and 2) a `reason` key, a reason for the given score, but DO NOT QUOTE THE SCORE in your reason. Please mention specific information from {parameters} in your reason, but be very concise with it!
-                Evaluation Steps:
-                {evaluation_steps}
-                ************************
-                """
-                )
-            ]
-            + test_case_list
-            + [
-                textwrap.dedent(
-                    f"""
-                ************************
-                {additional_context}
-                **
-                IMPORTANT: Please make sure to only return in JSON format, with the "score" and "reason" key. No words or explanation is needed.
-                Example JSON:
-                {{
-                    "reason": "The text does not follow the evaluation steps provided.",
-                    "score": 0
-                }}
-                **
-                JSON:
-                """
-                )
-            ]
+        return textwrap.dedent(
+            f"""Given the evaluation steps, return a JSON with two keys: 1) a `score` key that is STRICTLY EITHER 1 (follows the criteria 100% outlined in the evaluation steps), OR 0 (does not follow the criteria), and 2) a `reason` key, a reason for the given score, but DO NOT QUOTE THE SCORE in your reason. Please mention specific information from {parameters} in your reason, but be very concise with it!
+            Evaluation Steps:
+            {evaluation_steps}
+            ************************
+            {test_case_list}
+            ************************
+            {additional_context}
+            **
+            IMPORTANT: Please make sure to only return in JSON format, with the "score" and "reason" key. No words or explanation is needed.
+            Example JSON:
+            {{
+                "reason": "The text does not follow the evaluation steps provided.",
+                "score": 0
+            }}
+            **
+            JSON:
+            """
         )

deepeval/metrics/multimodal_metrics/multimodal_g_eval/utils.py CHANGED Viewed

@@ -1,29 +1,26 @@
-from deepeval.test_case import MLLMTestCaseParams, MLLMTestCase, ToolCall
-from deepeval.test_case.mllm_test_case import MLLMImage
-from deepeval.models.mlllms.openai_model import (
+from deepeval.test_case import LLMTestCaseParams, LLMTestCase, ToolCall
+from deepeval.test_case import MLLMImage
+from deepeval.models.llms.openai_model import (
     unsupported_log_probs_multimodal_gpt_models,
 )
-from deepeval.models import (
-    DeepEvalBaseMLLM,
-    MultimodalOpenAIModel,
-)
+from deepeval.models import DeepEvalBaseLLM, GPTModel
 from typing import List, Union
 G_EVAL_PARAMS = {
-    MLLMTestCaseParams.INPUT: "Input",
-    MLLMTestCaseParams.ACTUAL_OUTPUT: "Actual Output",
-    MLLMTestCaseParams.EXPECTED_OUTPUT: "Expected Output",
-    MLLMTestCaseParams.CONTEXT: "Context",
-    MLLMTestCaseParams.RETRIEVAL_CONTEXT: "Retrieval Context",
-    MLLMTestCaseParams.EXPECTED_TOOLS: "Expected Tools",
-    MLLMTestCaseParams.TOOLS_CALLED: "Tools Called",
+    LLMTestCaseParams.INPUT: "Input",
+    LLMTestCaseParams.ACTUAL_OUTPUT: "Actual Output",
+    LLMTestCaseParams.EXPECTED_OUTPUT: "Expected Output",
+    LLMTestCaseParams.CONTEXT: "Context",
+    LLMTestCaseParams.RETRIEVAL_CONTEXT: "Retrieval Context",
+    LLMTestCaseParams.EXPECTED_TOOLS: "Expected Tools",
+    LLMTestCaseParams.TOOLS_CALLED: "Tools Called",
 }
 def construct_g_eval_params_string(
-    mllm_test_case_params: List[MLLMTestCaseParams],
+    mllm_test_case_params: List[LLMTestCaseParams],
 ):
     g_eval_params = [G_EVAL_PARAMS[param] for param in mllm_test_case_params]
     if len(g_eval_params) == 1:
@@ -39,12 +36,14 @@ def construct_g_eval_params_string(
 def construct_test_case_list(
-    evaluation_params: List[MLLMTestCaseParams], test_case: MLLMTestCase
+    evaluation_params: List[LLMTestCaseParams], test_case: LLMTestCase
 ) -> List[Union[str, MLLMImage]]:
+    from deepeval.utils import convert_to_multi_modal_array
     test_case_list = []
     for param in evaluation_params:
         test_case_param_list = [f"\n\n\n{G_EVAL_PARAMS[param]}:\n"]
-        value = getattr(test_case, param.value)
+        value = convert_to_multi_modal_array(getattr(test_case, param.value))
         for v in value:
             if isinstance(v, ToolCall):
                 test_case_param_list.append(repr(v))
@@ -54,15 +53,16 @@ def construct_test_case_list(
     return test_case_list
-def no_multimodal_log_prob_support(model: Union[str, DeepEvalBaseMLLM]):
+def no_multimodal_log_prob_support(model: Union[str, DeepEvalBaseLLM]):
     if (
         isinstance(model, str)
         and model in unsupported_log_probs_multimodal_gpt_models
     ):
         return True
     elif (
-        isinstance(model, MultimodalOpenAIModel)
-        and model.model_name in unsupported_log_probs_multimodal_gpt_models
+        isinstance(model, GPTModel)
+        and model.get_model_name()
+        in unsupported_log_probs_multimodal_gpt_models
     ):
         return True
     return False

deepeval/metrics/multimodal_metrics/text_to_image/text_to_image.py CHANGED Viewed

@@ -4,37 +4,40 @@ import math
 import textwrap
 from deepeval.metrics import BaseMultimodalMetric
-from deepeval.test_case import MLLMTestCaseParams, MLLMTestCase, MLLMImage
+from deepeval.test_case import LLMTestCaseParams, LLMTestCase, MLLMImage
 from deepeval.metrics.multimodal_metrics.text_to_image.template import (
     TextToImageTemplate,
 )
-from deepeval.utils import get_or_create_event_loop
+from deepeval.utils import (
+    get_or_create_event_loop,
+    convert_to_multi_modal_array,
+)
 from deepeval.metrics.utils import (
     construct_verbose_logs,
     trimAndLoadJson,
     check_mllm_test_case_params,
-    initialize_multimodal_model,
+    initialize_model,
 )
-from deepeval.models import DeepEvalBaseMLLM
+from deepeval.models import DeepEvalBaseLLM
 from deepeval.metrics.multimodal_metrics.text_to_image.schema import ReasonScore
 from deepeval.metrics.indicator import metric_progress_indicator
-required_params: List[MLLMTestCaseParams] = [
-    MLLMTestCaseParams.INPUT,
-    MLLMTestCaseParams.ACTUAL_OUTPUT,
+required_params: List[LLMTestCaseParams] = [
+    LLMTestCaseParams.INPUT,
+    LLMTestCaseParams.ACTUAL_OUTPUT,
 ]
 class TextToImageMetric(BaseMultimodalMetric):
     def __init__(
         self,
-        model: Optional[Union[str, DeepEvalBaseMLLM]] = None,
+        model: Optional[Union[str, DeepEvalBaseLLM]] = None,
         threshold: float = 0.5,
         async_mode: bool = True,
         strict_mode: bool = False,
         verbose_mode: bool = False,
     ):
-        self.model, self.using_native_model = initialize_multimodal_model(model)
+        self.model, self.using_native_model = initialize_model(model)
         self.evaluation_model = self.model.get_model_name()
         self.threshold = 1 if strict_mode else threshold
         self.strict_mode = strict_mode
@@ -43,11 +46,13 @@ class TextToImageMetric(BaseMultimodalMetric):
     def measure(
         self,
-        test_case: MLLMTestCase,
+        test_case: LLMTestCase,
         _show_indicator: bool = True,
         _in_component: bool = False,
     ) -> float:
-        check_mllm_test_case_params(test_case, required_params, 0, 1, self)
+        check_mllm_test_case_params(
+            test_case, required_params, 0, 1, self, self.model
+        )
         self.evaluation_cost = 0 if self.using_native_model else None
         with metric_progress_indicator(
@@ -63,10 +68,12 @@ class TextToImageMetric(BaseMultimodalMetric):
                     )
                 )
             else:
-                input_texts, _ = self.separate_images_from_text(test_case.input)
-                _, output_images = self.separate_images_from_text(
+                input = convert_to_multi_modal_array(test_case.input)
+                actual_output = convert_to_multi_modal_array(
                     test_case.actual_output
                 )
+                input_texts, _ = self.separate_images_from_text(input)
+                _, output_images = self.separate_images_from_text(actual_output)
                 self.SC_scores, self.SC_reasoning = (
                     self._evaluate_semantic_consistency(
@@ -99,11 +106,13 @@ class TextToImageMetric(BaseMultimodalMetric):
     async def a_measure(
         self,
-        test_case: MLLMTestCase,
+        test_case: LLMTestCase,
         _show_indicator: bool = True,
         _in_component: bool = False,
     ) -> float:
-        check_mllm_test_case_params(test_case, required_params, 0, 1, self)
+        check_mllm_test_case_params(
+            test_case, required_params, 0, 1, self, self.model
+        )
         self.evaluation_cost = 0 if self.using_native_model else None
         with metric_progress_indicator(
@@ -112,10 +121,12 @@ class TextToImageMetric(BaseMultimodalMetric):
             _show_indicator=_show_indicator,
             _in_component=_in_component,
         ):
-            input_texts, _ = self.separate_images_from_text(test_case.input)
-            _, output_images = self.separate_images_from_text(
+            input = convert_to_multi_modal_array(test_case.input)
+            actual_output = convert_to_multi_modal_array(
                 test_case.actual_output
             )
+            input_texts, _ = self.separate_images_from_text(input)
+            _, output_images = self.separate_images_from_text(actual_output)
             (self.SC_scores, self.SC_reasoning), (
                 self.PQ_scores,
                 self.PQ_reasoning,
@@ -165,27 +176,27 @@ class TextToImageMetric(BaseMultimodalMetric):
     ) -> Tuple[List[int], str]:
         images: List[MLLMImage] = []
         images.append(actual_image_output)
-        prompt = [
-            TextToImageTemplate.generate_semantic_consistency_evaluation_results(
-                text_prompt=text_prompt
-            )
-        ]
+        prompt = f"""
+            {
+                TextToImageTemplate.generate_semantic_consistency_evaluation_results(
+                    text_prompt=text_prompt
+                )
+            }
+            Images:
+            {images}
+        """
         if self.using_native_model:
-            res, cost = await self.model.a_generate(
-                prompt + images, ReasonScore
-            )
+            res, cost = await self.model.a_generate(prompt, ReasonScore)
             self.evaluation_cost += cost
             return res.score, res.reasoning
         else:
             try:
                 res: ReasonScore = await self.model.a_generate(
-                    prompt + images, schema=ReasonScore
+                    prompt, schema=ReasonScore
                 )
                 return res.score, res.reasoning
             except TypeError:
-                res = await self.model.a_generate(
-                    prompt + images, input_text=prompt
-                )
+                res = await self.model.a_generate(prompt, input_text=prompt)
                 data = trimAndLoadJson(res, self)
                 return data["score"], data["reasoning"]
@@ -196,23 +207,27 @@ class TextToImageMetric(BaseMultimodalMetric):
     ) -> Tuple[List[int], str]:
         images: List[MLLMImage] = []
         images.append(actual_image_output)
-        prompt = [
-            TextToImageTemplate.generate_semantic_consistency_evaluation_results(
-                text_prompt=text_prompt
-            )
-        ]
+        prompt = f"""
+            {
+                TextToImageTemplate.generate_semantic_consistency_evaluation_results(
+                    text_prompt=text_prompt
+                )
+            }
+            Images:
+            {images}
+        """
         if self.using_native_model:
-            res, cost = self.model.generate(prompt + images, ReasonScore)
+            res, cost = self.model.generate(prompt, ReasonScore)
             self.evaluation_cost += cost
             return res.score, res.reasoning
         else:
             try:
                 res: ReasonScore = self.model.generate(
-                    prompt + images, schema=ReasonScore
+                    prompt, schema=ReasonScore
                 )
                 return res.score, res.reasoning
             except TypeError:
-                res = self.model.generate(prompt + images)
+                res = self.model.generate(prompt)
                 data = trimAndLoadJson(res, self)
                 return data["score"], data["reasoning"]
@@ -220,23 +235,25 @@ class TextToImageMetric(BaseMultimodalMetric):
         self, actual_image_output: MLLMImage
     ) -> Tuple[List[int], str]:
         images: List[MLLMImage] = [actual_image_output]
-        prompt = [
-            TextToImageTemplate.generate_perceptual_quality_evaluation_results()
-        ]
+        prompt = f"""
+            {
+                TextToImageTemplate.generate_perceptual_quality_evaluation_results()
+            }
+            Images:
+            {images}
+        """
         if self.using_native_model:
-            res, cost = await self.model.a_generate(
-                prompt + images, ReasonScore
-            )
+            res, cost = await self.model.a_generate(prompt, ReasonScore)
             self.evaluation_cost += cost
             return res.score, res.reasoning
         else:
             try:
                 res: ReasonScore = await self.model.a_generate(
-                    prompt + images, schema=ReasonScore
+                    prompt, schema=ReasonScore
                 )
                 return res.score, res.reasoning
             except TypeError:
-                res = await self.model.a_generate(prompt + images)
+                res = await self.model.a_generate(prompt)
                 data = trimAndLoadJson(res, self)
                 return data["score"], data["reasoning"]
@@ -244,9 +261,13 @@ class TextToImageMetric(BaseMultimodalMetric):
         self, actual_image_output: MLLMImage
     ) -> Tuple[List[int], str]:
         images: List[MLLMImage] = [actual_image_output]
-        prompt = [
-            TextToImageTemplate.generate_perceptual_quality_evaluation_results()
-        ]
+        prompt = f"""
+            {
+                TextToImageTemplate.generate_perceptual_quality_evaluation_results()
+            }
+            Images:
+            {images}
+        """
         if self.using_native_model:
             res, cost = self.model.generate(prompt + images, ReasonScore)
             self.evaluation_cost += cost
@@ -254,11 +275,11 @@ class TextToImageMetric(BaseMultimodalMetric):
         else:
             try:
                 res: ReasonScore = self.model.generate(
-                    prompt + images, schema=ReasonScore
+                    prompt, schema=ReasonScore
                 )
                 return res.score, res.reasoning
             except TypeError:
-                res = self.model.generate(prompt + images)
+                res = self.model.generate(prompt)
                 data = trimAndLoadJson(res, self)
                 return data["score"], data["reasoning"]

deepeval/metrics/ragas.py CHANGED Viewed

@@ -10,7 +10,7 @@ from deepeval.telemetry import capture_metric_type
 # check langchain availability
 try:
-    import langchain_core
+    import langchain_core  # noqa: F401
     from langchain_core.language_models import BaseChatModel
     from langchain_core.embeddings import Embeddings
@@ -501,7 +501,7 @@ class RagasMetric(BaseMetric):
     def measure(self, test_case: LLMTestCase):
         # sends to server
         try:
-            from ragas import evaluate
+            from ragas import evaluate  # noqa: F401
         except ModuleNotFoundError:
             raise ModuleNotFoundError(
                 "Please install ragas to use this metric. `pip install ragas`."
@@ -509,7 +509,7 @@ class RagasMetric(BaseMetric):
         try:
             # How do i make sure this isn't just huggingface dataset
-            from datasets import Dataset
+            from datasets import Dataset  # noqa: F401
         except ModuleNotFoundError:
             raise ModuleNotFoundError("Please install dataset")

deepeval/metrics/tool_correctness/tool_correctness.py CHANGED Viewed

@@ -83,7 +83,7 @@ class ToolCorrectnessMetric(BaseMetric):
                 self.tools_called: List[ToolCall] = test_case.tools_called
                 self.expected_tools: List[ToolCall] = test_case.expected_tools
                 tool_calling_score = self._calculate_score()
-                if self.available_tools:
+                if self.available_tools and not test_case.multimodal:
                     tool_selection_score = self._get_tool_selection_score(
                         test_case.input,
                         test_case.tools_called,
@@ -177,7 +177,7 @@ class ToolCorrectnessMetric(BaseMetric):
             self.tools_called: List[ToolCall] = test_case.tools_called
             self.expected_tools: List[ToolCall] = test_case.expected_tools
             tool_calling_score = self._calculate_score()
-            if self.available_tools:
+            if self.available_tools and not test_case.multimodal:
                 tool_selection_score = await self._a_get_tool_selection_score(
                     test_case.input,
                     test_case.tools_called,

deepeval/metrics/turn_contextual_precision/schema.py ADDED Viewed

@@ -0,0 +1,21 @@
+from typing import List
+from pydantic import BaseModel
+class ContextualPrecisionVerdict(BaseModel):
+    verdict: str
+    reason: str
+class Verdicts(BaseModel):
+    verdicts: List[ContextualPrecisionVerdict]
+class ContextualPrecisionScoreReason(BaseModel):
+    reason: str
+class InteractionContextualPrecisionScore(BaseModel):
+    score: float
+    reason: str
+    verdicts: List[ContextualPrecisionVerdict]

deepeval 3.7.4__py3-none-any.whl → 3.7.5__py3-none-any.whl

deepeval 3.7.4py3-none-any.whl → 3.7.5py3-none-any.whl