judgeval 0.2.9 → 0.3.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/dist/constants.d.ts +2 -0
- package/dist/constants.d.ts.map +1 -0
- package/dist/constants.js +2 -0
- package/dist/constants.js.map +1 -0
- package/dist/data/example-params.d.ts +13 -0
- package/dist/data/example-params.d.ts.map +1 -0
- package/dist/data/example-params.js +12 -0
- package/dist/data/example-params.js.map +1 -0
- package/dist/data/example.d.ts +4 -0
- package/dist/data/example.d.ts.map +1 -0
- package/dist/data/example.js +10 -0
- package/dist/data/example.js.map +1 -0
- package/dist/data/index.d.ts +3 -0
- package/dist/data/index.d.ts.map +1 -0
- package/dist/data/index.js +3 -0
- package/dist/data/index.js.map +1 -0
- package/dist/env.d.ts +6 -0
- package/dist/env.d.ts.map +1 -0
- package/dist/env.js +13 -0
- package/dist/env.js.map +1 -0
- package/dist/index.d.ts +9 -0
- package/dist/index.d.ts.map +1 -0
- package/dist/index.js +2 -0
- package/dist/index.js.map +1 -0
- package/dist/index.mjs +2 -0
- package/dist/index.mjs.map +1 -0
- package/dist/index.umd.js +2 -0
- package/dist/index.umd.js.map +1 -0
- package/dist/internal/api/index.d.ts +23 -0
- package/dist/internal/api/index.d.ts.map +1 -0
- package/dist/internal/api/index.js +132 -0
- package/dist/internal/api/index.js.map +1 -0
- package/dist/internal/api/models/BaseScorer.d.ts +23 -0
- package/dist/internal/api/models/BaseScorer.d.ts.map +1 -0
- package/dist/internal/api/models/BaseScorer.js +6 -0
- package/dist/internal/api/models/BaseScorer.js.map +1 -0
- package/dist/internal/api/models/EvalResults.d.ts +12 -0
- package/dist/internal/api/models/EvalResults.d.ts.map +1 -0
- package/dist/internal/api/models/EvalResults.js +6 -0
- package/dist/internal/api/models/EvalResults.js.map +1 -0
- package/dist/internal/api/models/EvalResultsFetch.d.ts +9 -0
- package/dist/internal/api/models/EvalResultsFetch.d.ts.map +1 -0
- package/dist/internal/api/models/EvalResultsFetch.js +6 -0
- package/dist/internal/api/models/EvalResultsFetch.js.map +1 -0
- package/dist/internal/api/models/Example.d.ts +10 -0
- package/dist/internal/api/models/Example.d.ts.map +1 -0
- package/dist/internal/api/models/Example.js +6 -0
- package/dist/internal/api/models/Example.js.map +1 -0
- package/dist/internal/api/models/ExampleEvaluationRun.d.ts +20 -0
- package/dist/internal/api/models/ExampleEvaluationRun.d.ts.map +1 -0
- package/dist/internal/api/models/ExampleEvaluationRun.js +6 -0
- package/dist/internal/api/models/ExampleEvaluationRun.js.map +1 -0
- package/dist/internal/api/models/FetchPromptScorersRequest.d.ts +8 -0
- package/dist/internal/api/models/FetchPromptScorersRequest.d.ts.map +1 -0
- package/dist/internal/api/models/FetchPromptScorersRequest.js +6 -0
- package/dist/internal/api/models/FetchPromptScorersRequest.js.map +1 -0
- package/dist/internal/api/models/FetchPromptScorersResponse.d.ts +9 -0
- package/dist/internal/api/models/FetchPromptScorersResponse.d.ts.map +1 -0
- package/dist/internal/api/models/FetchPromptScorersResponse.js +6 -0
- package/dist/internal/api/models/FetchPromptScorersResponse.js.map +1 -0
- package/dist/internal/api/models/OtelTraceSpan.d.ts +33 -0
- package/dist/internal/api/models/OtelTraceSpan.d.ts.map +1 -0
- package/dist/internal/api/models/OtelTraceSpan.js +6 -0
- package/dist/internal/api/models/OtelTraceSpan.js.map +1 -0
- package/dist/internal/api/models/PromptScorer.d.ts +14 -0
- package/dist/internal/api/models/PromptScorer.d.ts.map +1 -0
- package/dist/internal/api/models/PromptScorer.js +6 -0
- package/dist/internal/api/models/PromptScorer.js.map +1 -0
- package/dist/internal/api/models/ResolveProjectNameRequest.d.ts +8 -0
- package/dist/internal/api/models/ResolveProjectNameRequest.d.ts.map +1 -0
- package/dist/internal/api/models/ResolveProjectNameRequest.js +6 -0
- package/dist/internal/api/models/ResolveProjectNameRequest.js.map +1 -0
- package/dist/internal/api/models/ResolveProjectNameResponse.d.ts +8 -0
- package/dist/internal/api/models/ResolveProjectNameResponse.d.ts.map +1 -0
- package/dist/internal/api/models/ResolveProjectNameResponse.js +6 -0
- package/dist/internal/api/models/ResolveProjectNameResponse.js.map +1 -0
- package/dist/internal/api/models/SavePromptScorerRequest.d.ts +12 -0
- package/dist/internal/api/models/SavePromptScorerRequest.d.ts.map +1 -0
- package/dist/internal/api/models/SavePromptScorerRequest.js +6 -0
- package/dist/internal/api/models/SavePromptScorerRequest.js.map +1 -0
- package/dist/internal/api/models/SavePromptScorerResponse.d.ts +9 -0
- package/dist/internal/api/models/SavePromptScorerResponse.d.ts.map +1 -0
- package/dist/internal/api/models/SavePromptScorerResponse.js +6 -0
- package/dist/internal/api/models/SavePromptScorerResponse.js.map +1 -0
- package/dist/internal/api/models/ScorerConfig.d.ts +13 -0
- package/dist/internal/api/models/ScorerConfig.d.ts.map +1 -0
- package/dist/internal/api/models/ScorerConfig.js +6 -0
- package/dist/internal/api/models/ScorerConfig.js.map +1 -0
- package/dist/internal/api/models/ScorerData.d.ts +17 -0
- package/dist/internal/api/models/ScorerData.d.ts.map +1 -0
- package/dist/internal/api/models/ScorerData.js +6 -0
- package/dist/internal/api/models/ScorerData.js.map +1 -0
- package/dist/internal/api/models/ScorerExistsRequest.d.ts +8 -0
- package/dist/internal/api/models/ScorerExistsRequest.d.ts.map +1 -0
- package/dist/internal/api/models/ScorerExistsRequest.js +6 -0
- package/dist/internal/api/models/ScorerExistsRequest.js.map +1 -0
- package/dist/internal/api/models/ScorerExistsResponse.d.ts +8 -0
- package/dist/internal/api/models/ScorerExistsResponse.d.ts.map +1 -0
- package/dist/internal/api/models/ScorerExistsResponse.js +6 -0
- package/dist/internal/api/models/ScorerExistsResponse.js.map +1 -0
- package/dist/internal/api/models/ScoringResult.d.ts +17 -0
- package/dist/internal/api/models/ScoringResult.d.ts.map +1 -0
- package/dist/internal/api/models/ScoringResult.js +6 -0
- package/dist/internal/api/models/ScoringResult.js.map +1 -0
- package/dist/internal/api/models/TraceEvaluationRun.d.ts +18 -0
- package/dist/internal/api/models/TraceEvaluationRun.d.ts.map +1 -0
- package/dist/internal/api/models/TraceEvaluationRun.js +6 -0
- package/dist/internal/api/models/TraceEvaluationRun.js.map +1 -0
- package/dist/internal/api/models.d.ts +24 -0
- package/dist/internal/api/models.d.ts.map +1 -0
- package/dist/internal/api/models.js +24 -0
- package/dist/internal/api/models.js.map +1 -0
- package/dist/scorers/api-scorer.d.ts +23 -0
- package/dist/scorers/api-scorer.d.ts.map +1 -0
- package/dist/scorers/api-scorer.js +36 -0
- package/dist/scorers/api-scorer.js.map +1 -0
- package/dist/scorers/api_scorers/answer-correctness-scorer.d.ts +11 -0
- package/dist/scorers/api_scorers/answer-correctness-scorer.d.ts.map +1 -0
- package/dist/scorers/api_scorers/answer-correctness-scorer.js +20 -0
- package/dist/scorers/api_scorers/answer-correctness-scorer.js.map +1 -0
- package/dist/scorers/api_scorers/answer-relevancy-scorer.d.ts +11 -0
- package/dist/scorers/api_scorers/answer-relevancy-scorer.d.ts.map +1 -0
- package/dist/scorers/api_scorers/answer-relevancy-scorer.js +19 -0
- package/dist/scorers/api_scorers/answer-relevancy-scorer.js.map +1 -0
- package/dist/scorers/api_scorers/faithfulness-scorer.d.ts +11 -0
- package/dist/scorers/api_scorers/faithfulness-scorer.d.ts.map +1 -0
- package/dist/scorers/api_scorers/faithfulness-scorer.js +20 -0
- package/dist/scorers/api_scorers/faithfulness-scorer.js.map +1 -0
- package/dist/scorers/api_scorers/index.d.ts +2 -0
- package/dist/scorers/api_scorers/index.d.ts.map +1 -0
- package/dist/scorers/api_scorers/index.js +2 -0
- package/dist/scorers/api_scorers/index.js.map +1 -0
- package/dist/scorers/api_scorers/instruction-adherence-scorer.d.ts +11 -0
- package/dist/scorers/api_scorers/instruction-adherence-scorer.d.ts.map +1 -0
- package/dist/scorers/api_scorers/instruction-adherence-scorer.js +20 -0
- package/dist/scorers/api_scorers/instruction-adherence-scorer.js.map +1 -0
- package/dist/scorers/api_scorers/prompt_scorer/base-prompt-scorer.d.ts +48 -0
- package/dist/scorers/api_scorers/prompt_scorer/base-prompt-scorer.d.ts.map +1 -0
- package/dist/scorers/api_scorers/prompt_scorer/base-prompt-scorer.js +133 -0
- package/dist/scorers/api_scorers/prompt_scorer/base-prompt-scorer.js.map +1 -0
- package/dist/scorers/api_scorers/prompt_scorer/index.d.ts +5 -0
- package/dist/scorers/api_scorers/prompt_scorer/index.d.ts.map +1 -0
- package/dist/scorers/api_scorers/prompt_scorer/index.js +5 -0
- package/dist/scorers/api_scorers/prompt_scorer/index.js.map +1 -0
- package/dist/scorers/api_scorers/prompt_scorer/prompt-scorer-utils.d.ts +14 -0
- package/dist/scorers/api_scorers/prompt_scorer/prompt-scorer-utils.d.ts.map +1 -0
- package/dist/scorers/api_scorers/prompt_scorer/prompt-scorer-utils.js +44 -0
- package/dist/scorers/api_scorers/prompt_scorer/prompt-scorer-utils.js.map +1 -0
- package/dist/scorers/api_scorers/prompt_scorer/prompt-scorer.d.ts +7 -0
- package/dist/scorers/api_scorers/prompt_scorer/prompt-scorer.d.ts.map +1 -0
- package/dist/scorers/api_scorers/prompt_scorer/prompt-scorer.js +9 -0
- package/dist/scorers/api_scorers/prompt_scorer/prompt-scorer.js.map +1 -0
- package/dist/scorers/api_scorers/prompt_scorer/trace-prompt-scorer.d.ts +6 -0
- package/dist/scorers/api_scorers/prompt_scorer/trace-prompt-scorer.d.ts.map +1 -0
- package/dist/scorers/api_scorers/prompt_scorer/trace-prompt-scorer.js +8 -0
- package/dist/scorers/api_scorers/prompt_scorer/trace-prompt-scorer.js.map +1 -0
- package/dist/scorers/base-scorer.d.ts +10 -0
- package/dist/scorers/base-scorer.d.ts.map +1 -0
- package/dist/scorers/base-scorer.js +41 -0
- package/dist/scorers/base-scorer.js.map +1 -0
- package/dist/scorers/index.d.ts +4 -0
- package/dist/scorers/index.d.ts.map +1 -0
- package/dist/scorers/index.js +4 -0
- package/dist/scorers/index.js.map +1 -0
- package/dist/tracer/OpenTelemetryKeys.d.ts +12 -0
- package/dist/tracer/OpenTelemetryKeys.d.ts.map +1 -0
- package/dist/tracer/OpenTelemetryKeys.js +12 -0
- package/dist/tracer/OpenTelemetryKeys.js.map +1 -0
- package/dist/tracer/Tracer.d.ts +47 -0
- package/dist/tracer/Tracer.d.ts.map +1 -0
- package/dist/tracer/Tracer.js +235 -0
- package/dist/tracer/Tracer.js.map +1 -0
- package/dist/tracer/TracerConfiguration.d.ts +71 -0
- package/dist/tracer/TracerConfiguration.d.ts.map +1 -0
- package/dist/tracer/TracerConfiguration.js +111 -0
- package/dist/tracer/TracerConfiguration.js.map +1 -0
- package/dist/tracer/exporters/JudgmentSpanExporter.d.ts +36 -0
- package/dist/tracer/exporters/JudgmentSpanExporter.d.ts.map +1 -0
- package/dist/tracer/exporters/JudgmentSpanExporter.js +72 -0
- package/dist/tracer/exporters/JudgmentSpanExporter.js.map +1 -0
- package/dist/tracer/exporters/NoOpSpanExporter.d.ts +12 -0
- package/dist/tracer/exporters/NoOpSpanExporter.d.ts.map +1 -0
- package/dist/tracer/exporters/NoOpSpanExporter.js +16 -0
- package/dist/tracer/exporters/NoOpSpanExporter.js.map +1 -0
- package/dist/tracer/exporters/index.d.ts +3 -0
- package/dist/tracer/exporters/index.d.ts.map +1 -0
- package/dist/tracer/exporters/index.js +3 -0
- package/dist/tracer/exporters/index.js.map +1 -0
- package/dist/tracer/index.d.ts +5 -0
- package/dist/tracer/index.d.ts.map +1 -0
- package/dist/tracer/index.js +5 -0
- package/dist/tracer/index.js.map +1 -0
- package/dist/umd.d.ts +2 -0
- package/dist/umd.d.ts.map +1 -0
- package/dist/umd.js +2 -0
- package/dist/umd.js.map +1 -0
- package/dist/utils/annotate.d.ts +2 -0
- package/dist/utils/annotate.d.ts.map +1 -0
- package/dist/utils/annotate.js +27 -0
- package/dist/utils/annotate.js.map +1 -0
- package/dist/utils/index.d.ts +5 -0
- package/dist/utils/index.d.ts.map +1 -0
- package/dist/utils/index.js +5 -0
- package/dist/utils/index.js.map +1 -0
- package/dist/utils/logger.d.ts +27 -0
- package/dist/utils/logger.d.ts.map +1 -0
- package/dist/utils/logger.js +70 -0
- package/dist/utils/logger.js.map +1 -0
- package/dist/utils/types.d.ts +4 -0
- package/dist/utils/types.d.ts.map +1 -0
- package/dist/utils/types.js +2 -0
- package/dist/utils/types.js.map +1 -0
- package/dist/utils/validation.d.ts +11 -0
- package/dist/utils/validation.d.ts.map +1 -0
- package/dist/utils/validation.js +16 -0
- package/dist/utils/validation.js.map +1 -0
- package/dist/version.d.ts +2 -0
- package/dist/version.d.ts.map +1 -0
- package/dist/version.js +2 -0
- package/dist/version.js.map +1 -0
- package/package.json +57 -108
- package/LICENSE.md +0 -202
- package/README.md +0 -372
- package/dist/cjs/clients.js +0 -78
- package/dist/cjs/clients.js.map +0 -1
- package/dist/cjs/common/integrations/langgraph.js +0 -471
- package/dist/cjs/common/integrations/langgraph.js.map +0 -1
- package/dist/cjs/common/logger-instance.js +0 -64
- package/dist/cjs/common/logger-instance.js.map +0 -1
- package/dist/cjs/common/logger.js +0 -225
- package/dist/cjs/common/logger.js.map +0 -1
- package/dist/cjs/common/token-costs.js +0 -95
- package/dist/cjs/common/token-costs.js.map +0 -1
- package/dist/cjs/common/tracer.js +0 -1099
- package/dist/cjs/common/tracer.js.map +0 -1
- package/dist/cjs/constants.js +0 -347
- package/dist/cjs/constants.js.map +0 -1
- package/dist/cjs/data/datasets/eval-dataset-client.js +0 -394
- package/dist/cjs/data/datasets/eval-dataset-client.js.map +0 -1
- package/dist/cjs/data/datasets/eval-dataset.js +0 -405
- package/dist/cjs/data/datasets/eval-dataset.js.map +0 -1
- package/dist/cjs/data/example.js +0 -159
- package/dist/cjs/data/example.js.map +0 -1
- package/dist/cjs/data/result.js +0 -83
- package/dist/cjs/data/result.js.map +0 -1
- package/dist/cjs/e2etests/eval-operations.test.js +0 -282
- package/dist/cjs/e2etests/eval-operations.test.js.map +0 -1
- package/dist/cjs/e2etests/judgee-traces.test.js +0 -278
- package/dist/cjs/e2etests/judgee-traces.test.js.map +0 -1
- package/dist/cjs/evaluation-run.js +0 -136
- package/dist/cjs/evaluation-run.js.map +0 -1
- package/dist/cjs/exporters/otel-exporter.js +0 -352
- package/dist/cjs/exporters/otel-exporter.js.map +0 -1
- package/dist/cjs/index.js +0 -78
- package/dist/cjs/index.js.map +0 -1
- package/dist/cjs/judges/index.js +0 -237
- package/dist/cjs/judges/index.js.map +0 -1
- package/dist/cjs/judgment-client.js +0 -798
- package/dist/cjs/judgment-client.js.map +0 -1
- package/dist/cjs/rules.js +0 -322
- package/dist/cjs/rules.js.map +0 -1
- package/dist/cjs/run-evaluation.js +0 -700
- package/dist/cjs/run-evaluation.js.map +0 -1
- package/dist/cjs/scorers/api-scorer.js +0 -304
- package/dist/cjs/scorers/api-scorer.js.map +0 -1
- package/dist/cjs/scorers/base-scorer.js +0 -293
- package/dist/cjs/scorers/base-scorer.js.map +0 -1
- package/dist/cjs/scorers/metrics/answer-correctness/answer-correctness.js +0 -562
- package/dist/cjs/scorers/metrics/answer-correctness/answer-correctness.js.map +0 -1
- package/dist/cjs/scorers/metrics/answer-correctness/index.js +0 -19
- package/dist/cjs/scorers/metrics/answer-correctness/index.js.map +0 -1
- package/dist/cjs/scorers/metrics/answer-correctness/prompts.js +0 -175
- package/dist/cjs/scorers/metrics/answer-correctness/prompts.js.map +0 -1
- package/dist/cjs/scorers/metrics/answer-relevancy/answer-relevancy.js +0 -514
- package/dist/cjs/scorers/metrics/answer-relevancy/answer-relevancy.js.map +0 -1
- package/dist/cjs/scorers/metrics/answer-relevancy/index.js +0 -19
- package/dist/cjs/scorers/metrics/answer-relevancy/index.js.map +0 -1
- package/dist/cjs/scorers/metrics/answer-relevancy/prompts.js +0 -179
- package/dist/cjs/scorers/metrics/answer-relevancy/prompts.js.map +0 -1
- package/dist/cjs/scorers/metrics/faithfulness/faithfulness.js +0 -512
- package/dist/cjs/scorers/metrics/faithfulness/faithfulness.js.map +0 -1
- package/dist/cjs/scorers/metrics/faithfulness/index.js +0 -19
- package/dist/cjs/scorers/metrics/faithfulness/index.js.map +0 -1
- package/dist/cjs/scorers/metrics/faithfulness/prompts.js +0 -232
- package/dist/cjs/scorers/metrics/faithfulness/prompts.js.map +0 -1
- package/dist/cjs/scorers/metrics/hallucination/hallucination.js +0 -386
- package/dist/cjs/scorers/metrics/hallucination/hallucination.js.map +0 -1
- package/dist/cjs/scorers/metrics/hallucination/index.js +0 -11
- package/dist/cjs/scorers/metrics/hallucination/index.js.map +0 -1
- package/dist/cjs/scorers/metrics/hallucination/prompts.js +0 -106
- package/dist/cjs/scorers/metrics/hallucination/prompts.js.map +0 -1
- package/dist/cjs/scorers/metrics/instruction-adherence/index.js +0 -19
- package/dist/cjs/scorers/metrics/instruction-adherence/index.js.map +0 -1
- package/dist/cjs/scorers/metrics/instruction-adherence/instruction-adherence.js +0 -378
- package/dist/cjs/scorers/metrics/instruction-adherence/instruction-adherence.js.map +0 -1
- package/dist/cjs/scorers/metrics/instruction-adherence/prompts.js +0 -124
- package/dist/cjs/scorers/metrics/instruction-adherence/prompts.js.map +0 -1
- package/dist/esm/clients.js +0 -47
- package/dist/esm/clients.js.map +0 -1
- package/dist/esm/common/integrations/langgraph.js +0 -444
- package/dist/esm/common/integrations/langgraph.js.map +0 -1
- package/dist/esm/common/logger-instance.js +0 -59
- package/dist/esm/common/logger-instance.js.map +0 -1
- package/dist/esm/common/logger.js +0 -208
- package/dist/esm/common/logger.js.map +0 -1
- package/dist/esm/common/token-costs.js +0 -91
- package/dist/esm/common/token-costs.js.map +0 -1
- package/dist/esm/common/tracer.js +0 -1093
- package/dist/esm/common/tracer.js.map +0 -1
- package/dist/esm/constants.js +0 -341
- package/dist/esm/constants.js.map +0 -1
- package/dist/esm/data/datasets/eval-dataset-client.js +0 -387
- package/dist/esm/data/datasets/eval-dataset-client.js.map +0 -1
- package/dist/esm/data/datasets/eval-dataset.js +0 -375
- package/dist/esm/data/datasets/eval-dataset.js.map +0 -1
- package/dist/esm/data/example.js +0 -154
- package/dist/esm/data/example.js.map +0 -1
- package/dist/esm/data/result.js +0 -78
- package/dist/esm/data/result.js.map +0 -1
- package/dist/esm/e2etests/eval-operations.test.js +0 -254
- package/dist/esm/e2etests/eval-operations.test.js.map +0 -1
- package/dist/esm/e2etests/judgee-traces.test.js +0 -253
- package/dist/esm/e2etests/judgee-traces.test.js.map +0 -1
- package/dist/esm/evaluation-run.js +0 -132
- package/dist/esm/evaluation-run.js.map +0 -1
- package/dist/esm/exporters/otel-exporter.js +0 -348
- package/dist/esm/exporters/otel-exporter.js.map +0 -1
- package/dist/esm/index.js +0 -20
- package/dist/esm/index.js.map +0 -1
- package/dist/esm/judges/index.js +0 -205
- package/dist/esm/judges/index.js.map +0 -1
- package/dist/esm/judgment-client.js +0 -768
- package/dist/esm/judgment-client.js.map +0 -1
- package/dist/esm/rules.js +0 -314
- package/dist/esm/rules.js.map +0 -1
- package/dist/esm/run-evaluation.js +0 -681
- package/dist/esm/run-evaluation.js.map +0 -1
- package/dist/esm/scorers/api-scorer.js +0 -286
- package/dist/esm/scorers/api-scorer.js.map +0 -1
- package/dist/esm/scorers/base-scorer.js +0 -287
- package/dist/esm/scorers/base-scorer.js.map +0 -1
- package/dist/esm/scorers/metrics/answer-correctness/answer-correctness.js +0 -558
- package/dist/esm/scorers/metrics/answer-correctness/answer-correctness.js.map +0 -1
- package/dist/esm/scorers/metrics/answer-correctness/index.js +0 -3
- package/dist/esm/scorers/metrics/answer-correctness/index.js.map +0 -1
- package/dist/esm/scorers/metrics/answer-correctness/prompts.js +0 -171
- package/dist/esm/scorers/metrics/answer-correctness/prompts.js.map +0 -1
- package/dist/esm/scorers/metrics/answer-relevancy/answer-relevancy.js +0 -510
- package/dist/esm/scorers/metrics/answer-relevancy/answer-relevancy.js.map +0 -1
- package/dist/esm/scorers/metrics/answer-relevancy/index.js +0 -3
- package/dist/esm/scorers/metrics/answer-relevancy/index.js.map +0 -1
- package/dist/esm/scorers/metrics/answer-relevancy/prompts.js +0 -175
- package/dist/esm/scorers/metrics/answer-relevancy/prompts.js.map +0 -1
- package/dist/esm/scorers/metrics/faithfulness/faithfulness.js +0 -508
- package/dist/esm/scorers/metrics/faithfulness/faithfulness.js.map +0 -1
- package/dist/esm/scorers/metrics/faithfulness/index.js +0 -3
- package/dist/esm/scorers/metrics/faithfulness/index.js.map +0 -1
- package/dist/esm/scorers/metrics/faithfulness/prompts.js +0 -228
- package/dist/esm/scorers/metrics/faithfulness/prompts.js.map +0 -1
- package/dist/esm/scorers/metrics/hallucination/hallucination.js +0 -382
- package/dist/esm/scorers/metrics/hallucination/hallucination.js.map +0 -1
- package/dist/esm/scorers/metrics/hallucination/index.js +0 -3
- package/dist/esm/scorers/metrics/hallucination/index.js.map +0 -1
- package/dist/esm/scorers/metrics/hallucination/prompts.js +0 -102
- package/dist/esm/scorers/metrics/hallucination/prompts.js.map +0 -1
- package/dist/esm/scorers/metrics/instruction-adherence/index.js +0 -3
- package/dist/esm/scorers/metrics/instruction-adherence/index.js.map +0 -1
- package/dist/esm/scorers/metrics/instruction-adherence/instruction-adherence.js +0 -374
- package/dist/esm/scorers/metrics/instruction-adherence/instruction-adherence.js.map +0 -1
- package/dist/esm/scorers/metrics/instruction-adherence/prompts.js +0 -120
- package/dist/esm/scorers/metrics/instruction-adherence/prompts.js.map +0 -1
- package/dist/types/clients.d.ts +0 -6
- package/dist/types/common/integrations/langgraph.d.ts +0 -39
- package/dist/types/common/logger-instance.d.ts +0 -3
- package/dist/types/common/logger.d.ts +0 -54
- package/dist/types/common/token-costs.d.ts +0 -36
- package/dist/types/common/tracer.d.ts +0 -249
- package/dist/types/constants.d.ts +0 -51
- package/dist/types/data/datasets/eval-dataset-client.d.ts +0 -44
- package/dist/types/data/datasets/eval-dataset.d.ts +0 -45
- package/dist/types/data/example.d.ts +0 -82
- package/dist/types/data/result.d.ts +0 -51
- package/dist/types/e2etests/eval-operations.test.d.ts +0 -5
- package/dist/types/e2etests/judgee-traces.test.d.ts +0 -5
- package/dist/types/evaluation-run.d.ts +0 -44
- package/dist/types/exporters/otel-exporter.d.ts +0 -16
- package/dist/types/index.d.ts +0 -11
- package/dist/types/judges/index.d.ts +0 -50
- package/dist/types/judgment-client.d.ts +0 -149
- package/dist/types/rules.d.ts +0 -120
- package/dist/types/run-evaluation.d.ts +0 -78
- package/dist/types/scorers/api-scorer.d.ts +0 -84
- package/dist/types/scorers/base-scorer.d.ts +0 -162
- package/dist/types/scorers/metrics/answer-correctness/answer-correctness.d.ts +0 -80
- package/dist/types/scorers/metrics/answer-correctness/index.d.ts +0 -2
- package/dist/types/scorers/metrics/answer-correctness/prompts.d.ts +0 -71
- package/dist/types/scorers/metrics/answer-relevancy/answer-relevancy.d.ts +0 -74
- package/dist/types/scorers/metrics/answer-relevancy/index.d.ts +0 -2
- package/dist/types/scorers/metrics/answer-relevancy/prompts.d.ts +0 -71
- package/dist/types/scorers/metrics/faithfulness/faithfulness.d.ts +0 -73
- package/dist/types/scorers/metrics/faithfulness/index.d.ts +0 -2
- package/dist/types/scorers/metrics/faithfulness/prompts.d.ts +0 -94
- package/dist/types/scorers/metrics/hallucination/hallucination.d.ts +0 -63
- package/dist/types/scorers/metrics/hallucination/index.d.ts +0 -3
- package/dist/types/scorers/metrics/hallucination/prompts.d.ts +0 -63
- package/dist/types/scorers/metrics/instruction-adherence/index.d.ts +0 -2
- package/dist/types/scorers/metrics/instruction-adherence/instruction-adherence.d.ts +0 -63
- package/dist/types/scorers/metrics/instruction-adherence/prompts.d.ts +0 -78
|
@@ -1,39 +0,0 @@
|
|
|
1
|
-
import { BaseCallbackHandler } from "@langchain/core/callbacks/base";
|
|
2
|
-
import type { LLMResult } from "@langchain/core/outputs";
|
|
3
|
-
import { BaseMessage } from "@langchain/core/messages";
|
|
4
|
-
import type { Document } from "@langchain/core/documents";
|
|
5
|
-
import type { Serialized } from "@langchain/core/load/serializable";
|
|
6
|
-
import { Tracer } from "../tracer.js";
|
|
7
|
-
export declare class JudgevalLanggraphCallbackHandler extends BaseCallbackHandler {
|
|
8
|
-
name: string;
|
|
9
|
-
private tracer;
|
|
10
|
-
private traceClient;
|
|
11
|
-
private previousNode;
|
|
12
|
-
private _startTime;
|
|
13
|
-
private finished;
|
|
14
|
-
private rootSpanStarted;
|
|
15
|
-
readonly executedNodeTools: string[];
|
|
16
|
-
readonly executedNodes: string[];
|
|
17
|
-
readonly executedTools: string[];
|
|
18
|
-
constructor(tracer?: Tracer);
|
|
19
|
-
private initializeRunState;
|
|
20
|
-
private startSpan;
|
|
21
|
-
private endSpan;
|
|
22
|
-
private getOrCreateRootTraceClient;
|
|
23
|
-
handleRetrieverStart(serialized: Serialized, query: string, runId: string, parentRunId?: string | undefined, tags?: string[] | undefined, metadata?: Record<string, unknown> | undefined, name?: string | undefined, options?: Record<string, any>): Promise<void>;
|
|
24
|
-
handleRetrieverEnd(documents: Document[], runId: string, parentRunId?: string | undefined, tags?: string[] | undefined, options?: Record<string, any>): Promise<void>;
|
|
25
|
-
handleRetrieverError(error: Error | any, runId: string, parentRunId?: string | undefined, tags?: string[] | undefined, options?: Record<string, any>): Promise<void>;
|
|
26
|
-
handleChainStart(serialized: Serialized, inputs: Record<string, unknown>, runId: string, parentRunId?: string | undefined, tags?: string[] | undefined, metadata?: Record<string, unknown> | undefined, runType?: string | undefined, name?: string | undefined, options?: Record<string, any>): Promise<void>;
|
|
27
|
-
handleChainEnd(outputs: Record<string, unknown> | string, runId: string, parentRunId?: string | undefined, tags?: string[] | undefined, metadata?: Record<string, unknown> | undefined, // Need metadata
|
|
28
|
-
name?: string | undefined, options?: Record<string, any>): Promise<void>;
|
|
29
|
-
handleChainError(error: Error | any, runId: string, parentRunId?: string | undefined, tags?: string[] | undefined, metadata?: Record<string, unknown> | undefined, name?: string | undefined, options?: Record<string, any>): Promise<void>;
|
|
30
|
-
handleToolStart(serialized: Serialized, inputStr: string, runId: string, parentRunId?: string | undefined, tags?: string[] | undefined, metadata?: Record<string, unknown> | undefined, name?: string | undefined, options?: Record<string, any>): Promise<void>;
|
|
31
|
-
handleToolEnd(output: string, runId: string, parentRunId?: string | undefined, tags?: string[] | undefined, options?: Record<string, any>): Promise<void>;
|
|
32
|
-
handleToolError(error: Error | any, runId: string, parentRunId?: string | undefined, tags?: string[] | undefined, options?: Record<string, any>): Promise<void>;
|
|
33
|
-
handleAgentAction(): Promise<void>;
|
|
34
|
-
handleAgentFinish(): Promise<void>;
|
|
35
|
-
handleLLMStart(serialized: Serialized, prompts: string[], runId: string, parentRunId?: string | undefined, extraParams?: Record<string, unknown> | undefined, tags?: string[] | undefined, metadata?: Record<string, unknown> | undefined, name?: string | undefined, options?: Record<string, any>): Promise<void>;
|
|
36
|
-
handleLLMEnd(output: LLMResult, runId: string, parentRunId?: string | undefined, tags?: string[] | undefined, options?: Record<string, any>): Promise<void>;
|
|
37
|
-
handleLLMError(error: Error | any, runId: string, parentRunId?: string | undefined, tags?: string[] | undefined, options?: Record<string, any>): Promise<void>;
|
|
38
|
-
handleChatModelStart(serialized: Serialized, messages: BaseMessage[][], runId: string, parentRunId?: string | undefined, extraParams?: Record<string, unknown> | undefined, tags?: string[] | undefined, metadata?: Record<string, unknown> | undefined, name?: string | undefined, options?: Record<string, any>): Promise<void>;
|
|
39
|
-
}
|
|
@@ -1,54 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Logger utilities and result printing for the JudgEval TypeScript SDK
|
|
3
|
-
*/
|
|
4
|
-
/**
|
|
5
|
-
* Log a debug message
|
|
6
|
-
*/
|
|
7
|
-
export declare function debug(message: string, meta?: Record<string, any>): void;
|
|
8
|
-
/**
|
|
9
|
-
* Log an info message (alias for info)
|
|
10
|
-
*/
|
|
11
|
-
export declare function log(message: string, meta?: Record<string, any>): void;
|
|
12
|
-
/**
|
|
13
|
-
* Log an info message
|
|
14
|
-
*/
|
|
15
|
-
export declare function info(message: string, meta?: Record<string, any>): void;
|
|
16
|
-
/**
|
|
17
|
-
* Log a warning message
|
|
18
|
-
*/
|
|
19
|
-
export declare function warning(message: string, meta?: Record<string, any>): void;
|
|
20
|
-
/**
|
|
21
|
-
* Alias for warning
|
|
22
|
-
*/
|
|
23
|
-
export declare function warn(message: string, meta?: Record<string, any>): void;
|
|
24
|
-
/**
|
|
25
|
-
* Log an error message
|
|
26
|
-
*/
|
|
27
|
-
export declare function error(message: string, meta?: Record<string, any>): void;
|
|
28
|
-
/**
|
|
29
|
-
* Set the current example context for logging (Keep for potential context integration)
|
|
30
|
-
*/
|
|
31
|
-
export declare function setExampleContext(exampleId: string, timestamp: string): void;
|
|
32
|
-
/**
|
|
33
|
-
* Clear the current example context (Keep for potential context integration)
|
|
34
|
-
*/
|
|
35
|
-
export declare function clearExampleContext(): void;
|
|
36
|
-
/**
|
|
37
|
-
* Create a context for example-specific logging (Keep for potential context integration)
|
|
38
|
-
*/
|
|
39
|
-
export declare function withExampleContext<T>(exampleId: string, timestamp: string, fn: () => T): T;
|
|
40
|
-
/**
|
|
41
|
-
* Format evaluation results for display
|
|
42
|
-
* This matches the Python SDK's output format with clickable links
|
|
43
|
-
*/
|
|
44
|
-
export declare function formatEvaluationResults(results: any[], projectName?: string, evalName?: string): string;
|
|
45
|
-
/**
|
|
46
|
-
* Print evaluation results to the console
|
|
47
|
-
* This matches the Python SDK's output format exactly
|
|
48
|
-
*/
|
|
49
|
-
export declare function printResults(results: any[], projectName?: string, evalName?: string): void;
|
|
50
|
-
/**
|
|
51
|
-
* Simplified print function for results - matches Python SDK's print(results) behavior
|
|
52
|
-
* This is the preferred way to print results
|
|
53
|
-
*/
|
|
54
|
-
export declare function print(data: any): void;
|
|
@@ -1,36 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Token cost utilities for the JudgEval TypeScript SDK
|
|
3
|
-
* This provides a local implementation of token cost calculation
|
|
4
|
-
* similar to LiteLLM's cost_per_token function in Python
|
|
5
|
-
*/
|
|
6
|
-
/**
|
|
7
|
-
* Calculate cost per token for a given model
|
|
8
|
-
* This mimics LiteLLM's cost_per_token function in Python
|
|
9
|
-
*
|
|
10
|
-
* @param model Model name (e.g., 'gpt-3.5-turbo')
|
|
11
|
-
* @param promptTokens Number of prompt tokens (used for total calculation)
|
|
12
|
-
* @param completionTokens Number of completion tokens (used for total calculation)
|
|
13
|
-
* @returns [promptCostPerToken, completionCostPerToken] - Cost per token for prompt and completion
|
|
14
|
-
*/
|
|
15
|
-
export declare function costPerToken(model: string, promptTokens?: number, completionTokens?: number): [number, number];
|
|
16
|
-
/**
|
|
17
|
-
* Calculate total token costs for a given model and token counts
|
|
18
|
-
*
|
|
19
|
-
* @param model Model name (e.g., 'gpt-3.5-turbo')
|
|
20
|
-
* @param promptTokens Number of prompt tokens
|
|
21
|
-
* @param completionTokens Number of completion tokens
|
|
22
|
-
* @returns Object with token counts and costs
|
|
23
|
-
*/
|
|
24
|
-
export declare function calculateTokenCosts(model: string, promptTokens: number, completionTokens: number): TokenCostResult;
|
|
25
|
-
/**
|
|
26
|
-
* Token cost calculation result interface
|
|
27
|
-
*/
|
|
28
|
-
export interface TokenCostResult {
|
|
29
|
-
model: string;
|
|
30
|
-
promptTokens: number;
|
|
31
|
-
completionTokens: number;
|
|
32
|
-
totalTokens: number;
|
|
33
|
-
promptTokensCostUsd: number;
|
|
34
|
-
completionTokensCostUsd: number;
|
|
35
|
-
totalCostUsd: number;
|
|
36
|
-
}
|
|
@@ -1,249 +0,0 @@
|
|
|
1
|
-
import OpenAI from 'openai';
|
|
2
|
-
import Anthropic from '@anthropic-ai/sdk';
|
|
3
|
-
import { APIJudgmentScorer, Scorer } from '../scorers/base-scorer.js';
|
|
4
|
-
interface NotificationConfig {
|
|
5
|
-
enabled?: boolean;
|
|
6
|
-
communication_methods?: string[];
|
|
7
|
-
email_addresses?: string[];
|
|
8
|
-
send_at?: number;
|
|
9
|
-
}
|
|
10
|
-
interface Condition {
|
|
11
|
-
metric: Scorer;
|
|
12
|
-
}
|
|
13
|
-
type CombineType = "all" | "any";
|
|
14
|
-
interface Rule {
|
|
15
|
-
rule_id?: string;
|
|
16
|
-
name: string;
|
|
17
|
-
description?: string;
|
|
18
|
-
conditions: Condition[];
|
|
19
|
-
combine_type: CombineType;
|
|
20
|
-
notification?: NotificationConfig;
|
|
21
|
-
}
|
|
22
|
-
type ApiClient = OpenAI | Anthropic | any;
|
|
23
|
-
type SpanType = string;
|
|
24
|
-
interface TraceEntry {
|
|
25
|
-
type: 'enter' | 'exit' | 'input' | 'output' | 'error';
|
|
26
|
-
function: string;
|
|
27
|
-
span_id: string;
|
|
28
|
-
depth: number;
|
|
29
|
-
created_at: number;
|
|
30
|
-
duration?: number;
|
|
31
|
-
output?: any;
|
|
32
|
-
inputs?: Record<string, any>;
|
|
33
|
-
span_type: SpanType;
|
|
34
|
-
parent_span_id?: string;
|
|
35
|
-
trace_id?: string;
|
|
36
|
-
message?: string;
|
|
37
|
-
}
|
|
38
|
-
interface EvaluationRunPayload {
|
|
39
|
-
organization_id: string;
|
|
40
|
-
log_results: boolean;
|
|
41
|
-
project_name: string;
|
|
42
|
-
eval_name: string;
|
|
43
|
-
examples: {
|
|
44
|
-
input?: string;
|
|
45
|
-
actual_output?: string;
|
|
46
|
-
expected_output?: string;
|
|
47
|
-
context?: string[];
|
|
48
|
-
retrieval_context?: string[];
|
|
49
|
-
tools_called?: string[];
|
|
50
|
-
expected_tools?: string[];
|
|
51
|
-
additional_metadata?: Record<string, any>;
|
|
52
|
-
trace_id: string;
|
|
53
|
-
}[];
|
|
54
|
-
scorers: APIJudgmentScorer[];
|
|
55
|
-
model?: string;
|
|
56
|
-
metadata?: Record<string, any>;
|
|
57
|
-
judgment_api_key: string;
|
|
58
|
-
override?: boolean;
|
|
59
|
-
rules?: Rule[];
|
|
60
|
-
trace_span_id?: string;
|
|
61
|
-
}
|
|
62
|
-
interface TraceSavePayload {
|
|
63
|
-
trace_id: string;
|
|
64
|
-
name: string;
|
|
65
|
-
project_name: string;
|
|
66
|
-
created_at: string;
|
|
67
|
-
duration: number;
|
|
68
|
-
token_counts: {
|
|
69
|
-
prompt_tokens: number;
|
|
70
|
-
completion_tokens: number;
|
|
71
|
-
total_tokens: number;
|
|
72
|
-
prompt_tokens_cost_usd: number;
|
|
73
|
-
completion_tokens_cost_usd: number;
|
|
74
|
-
total_cost_usd: number;
|
|
75
|
-
};
|
|
76
|
-
entries: CondensedSpanEntry[];
|
|
77
|
-
evaluation_runs: EvaluationRunPayload[];
|
|
78
|
-
overwrite: boolean;
|
|
79
|
-
parent_trace_id?: string | null;
|
|
80
|
-
parent_name?: string | null;
|
|
81
|
-
}
|
|
82
|
-
interface CondensedSpanEntry {
|
|
83
|
-
span_id: string;
|
|
84
|
-
function: string;
|
|
85
|
-
depth: number;
|
|
86
|
-
created_at: string;
|
|
87
|
-
parent_span_id?: string | null;
|
|
88
|
-
span_type: SpanType;
|
|
89
|
-
inputs: Record<string, any> | null;
|
|
90
|
-
output: any | null;
|
|
91
|
-
duration: number | null;
|
|
92
|
-
trace_id?: string;
|
|
93
|
-
children?: CondensedSpanEntry[];
|
|
94
|
-
}
|
|
95
|
-
interface TokenCostResponse {
|
|
96
|
-
model: string;
|
|
97
|
-
prompt_tokens: number;
|
|
98
|
-
completion_tokens: number;
|
|
99
|
-
total_tokens: number;
|
|
100
|
-
prompt_tokens_cost_usd: number;
|
|
101
|
-
completion_tokens_cost_usd: number;
|
|
102
|
-
total_cost_usd: number;
|
|
103
|
-
}
|
|
104
|
-
/**
|
|
105
|
-
* Client for interacting with Judgment trace API endpoints.
|
|
106
|
-
*/
|
|
107
|
-
declare class TraceManagerClient {
|
|
108
|
-
private apiKey;
|
|
109
|
-
private organizationId;
|
|
110
|
-
constructor(apiKey: string, organizationId: string);
|
|
111
|
-
private _fetch;
|
|
112
|
-
fetchTrace(traceId: string): Promise<any>;
|
|
113
|
-
saveTrace(traceData: TraceSavePayload): Promise<any>;
|
|
114
|
-
deleteTrace(traceId: string): Promise<any>;
|
|
115
|
-
deleteTraces(traceIds: string[]): Promise<any>;
|
|
116
|
-
/**
|
|
117
|
-
* Calculate token costs directly using the API endpoint.
|
|
118
|
-
* This is more accurate than client-side calculation as it uses the most up-to-date pricing.
|
|
119
|
-
*
|
|
120
|
-
* @param model The model name (e.g. 'gpt-4', 'claude-3-opus-20240229')
|
|
121
|
-
* @param promptTokens Number of tokens in the prompt/input
|
|
122
|
-
* @param completionTokens Number of tokens in the completion/output
|
|
123
|
-
* @returns Object containing token counts and calculated costs in USD
|
|
124
|
-
*/
|
|
125
|
-
calculateTokenCosts(model: string, promptTokens: number, completionTokens: number): Promise<TokenCostResponse | null>;
|
|
126
|
-
}
|
|
127
|
-
/**
|
|
128
|
-
* Represents an ongoing trace context.
|
|
129
|
-
*/
|
|
130
|
-
declare class TraceClient {
|
|
131
|
-
readonly traceId: string;
|
|
132
|
-
readonly name: string;
|
|
133
|
-
readonly projectName: string;
|
|
134
|
-
readonly overwrite: boolean;
|
|
135
|
-
readonly rules: Rule[];
|
|
136
|
-
readonly enableMonitoring: boolean;
|
|
137
|
-
readonly enableEvaluations: boolean;
|
|
138
|
-
readonly parentTraceId?: string | null;
|
|
139
|
-
readonly parentName?: string | null;
|
|
140
|
-
private startTime;
|
|
141
|
-
traceManager: TraceManagerClient | null;
|
|
142
|
-
private apiKey;
|
|
143
|
-
private organizationId;
|
|
144
|
-
private originalName;
|
|
145
|
-
private _spanDepths;
|
|
146
|
-
private pendingEvaluationRuns;
|
|
147
|
-
constructor(config: {
|
|
148
|
-
tracer: Tracer;
|
|
149
|
-
traceId?: string;
|
|
150
|
-
name?: string;
|
|
151
|
-
projectName?: string;
|
|
152
|
-
overwrite?: boolean;
|
|
153
|
-
rules?: Rule[];
|
|
154
|
-
enableMonitoring?: boolean;
|
|
155
|
-
enableEvaluations?: boolean;
|
|
156
|
-
parentTraceId?: string | null;
|
|
157
|
-
parentName?: string | null;
|
|
158
|
-
apiKey: string;
|
|
159
|
-
organizationId: string;
|
|
160
|
-
});
|
|
161
|
-
addEntry(entry: Partial<TraceEntry>): void;
|
|
162
|
-
recordInput(inputs: any): void;
|
|
163
|
-
recordOutput(output: any): void;
|
|
164
|
-
recordError(error: any): void;
|
|
165
|
-
startSpan(name: string, options?: {
|
|
166
|
-
spanType?: SpanType;
|
|
167
|
-
}): void;
|
|
168
|
-
endSpan(): void;
|
|
169
|
-
span(name: string, options?: {
|
|
170
|
-
spanType?: SpanType;
|
|
171
|
-
}): Generator<TraceClient>;
|
|
172
|
-
/**
|
|
173
|
-
* Retrieves the ID of the currently active span in this trace context.
|
|
174
|
-
* Relies on AsyncLocalStorage context established by observe/span.
|
|
175
|
-
* @returns {string | undefined} The ID of the current span, or undefined if none is active.
|
|
176
|
-
*/
|
|
177
|
-
getCurrentSpanId(): string | undefined;
|
|
178
|
-
getDuration(): number;
|
|
179
|
-
private condenseTrace;
|
|
180
|
-
save(emptySave?: boolean): Promise<{
|
|
181
|
-
traceId: string;
|
|
182
|
-
traceData: TraceSavePayload;
|
|
183
|
-
} | null>;
|
|
184
|
-
print(): void;
|
|
185
|
-
delete(): Promise<any>;
|
|
186
|
-
/**
|
|
187
|
-
* Asynchronously evaluate an example using the provided scorers,
|
|
188
|
-
* embedding the evaluation request into the trace data.
|
|
189
|
-
* Ported from the Python SDK's async_evaluate method.
|
|
190
|
-
*
|
|
191
|
-
* @param scorers Array of scorers to use for evaluation
|
|
192
|
-
* @param options Evaluation options including input, outputs, and metadata
|
|
193
|
-
* @returns Promise that resolves when the evaluation entry has been added to the trace
|
|
194
|
-
*/
|
|
195
|
-
asyncEvaluate(scorers: Scorer[], options?: {
|
|
196
|
-
input?: string;
|
|
197
|
-
actualOutput?: string;
|
|
198
|
-
expectedOutput?: string;
|
|
199
|
-
context?: string[];
|
|
200
|
-
retrievalContext?: string[];
|
|
201
|
-
toolsCalled?: string[];
|
|
202
|
-
expectedTools?: string[];
|
|
203
|
-
additionalMetadata?: Record<string, any>;
|
|
204
|
-
model?: string;
|
|
205
|
-
logResults?: boolean;
|
|
206
|
-
}): Promise<void>;
|
|
207
|
-
getOriginalName(): string;
|
|
208
|
-
}
|
|
209
|
-
/**
|
|
210
|
-
* Singleton Tracer class. Manages overall tracing configuration and trace creation.
|
|
211
|
-
*/
|
|
212
|
-
declare class Tracer {
|
|
213
|
-
private static instance;
|
|
214
|
-
readonly apiKey: string;
|
|
215
|
-
readonly organizationId: string;
|
|
216
|
-
readonly projectName: string;
|
|
217
|
-
readonly defaultRules: Rule[];
|
|
218
|
-
readonly enableMonitoring: boolean;
|
|
219
|
-
readonly enableEvaluations: boolean;
|
|
220
|
-
private initialized;
|
|
221
|
-
private currentTrace?;
|
|
222
|
-
private constructor();
|
|
223
|
-
static getInstance(config?: {
|
|
224
|
-
apiKey?: string;
|
|
225
|
-
organizationId?: string;
|
|
226
|
-
projectName?: string;
|
|
227
|
-
rules?: Rule[];
|
|
228
|
-
enableMonitoring?: boolean;
|
|
229
|
-
enableEvaluations?: boolean;
|
|
230
|
-
}): Tracer;
|
|
231
|
-
getCurrentTrace(): TraceClient | undefined;
|
|
232
|
-
startTrace(name: string, config: {
|
|
233
|
-
projectName?: string;
|
|
234
|
-
overwrite?: boolean;
|
|
235
|
-
rules?: Rule[];
|
|
236
|
-
}): TraceClient;
|
|
237
|
-
trace(name: string, options?: {
|
|
238
|
-
projectName?: string;
|
|
239
|
-
overwrite?: boolean;
|
|
240
|
-
createRootSpan?: boolean;
|
|
241
|
-
rules?: Rule[];
|
|
242
|
-
}): Generator<TraceClient>;
|
|
243
|
-
observe(options?: {
|
|
244
|
-
name?: string;
|
|
245
|
-
spanType?: SpanType;
|
|
246
|
-
}): <T extends any[], S>(func: (...args: T) => S) => (...args: T) => Promise<S>;
|
|
247
|
-
}
|
|
248
|
-
export declare function wrap<T extends ApiClient>(client: T): T;
|
|
249
|
-
export { Tracer, TraceClient, TraceManagerClient, Rule, Condition, NotificationConfig, CombineType, TraceEntry, SpanType, ApiClient, TraceSavePayload, CondensedSpanEntry };
|
|
@@ -1,51 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Collection of proprietary scorers implemented by Judgment.
|
|
3
|
-
*
|
|
4
|
-
* These are ready-made evaluation scorers that can be used to evaluate
|
|
5
|
-
* Examples via the Judgment API.
|
|
6
|
-
*/
|
|
7
|
-
export declare enum APIScorer {
|
|
8
|
-
FAITHFULNESS = "faithfulness",
|
|
9
|
-
ANSWER_RELEVANCY = "answer_relevancy",
|
|
10
|
-
ANSWER_CORRECTNESS = "answer_correctness",
|
|
11
|
-
HALLUCINATION = "hallucination",
|
|
12
|
-
SUMMARIZATION = "summarization",
|
|
13
|
-
CONTEXTUAL_RECALL = "contextual_recall",
|
|
14
|
-
CONTEXTUAL_RELEVANCY = "contextual_relevancy",
|
|
15
|
-
CONTEXTUAL_PRECISION = "contextual_precision",
|
|
16
|
-
INSTRUCTION_ADHERENCE = "instruction_adherence",
|
|
17
|
-
EXECUTION_ORDER = "execution_order",
|
|
18
|
-
JSON_CORRECTNESS = "json_correctness",
|
|
19
|
-
COMPARISON = "comparison",
|
|
20
|
-
GROUNDEDNESS = "groundedness"
|
|
21
|
-
}
|
|
22
|
-
export declare const UNBOUNDED_SCORERS: Set<APIScorer>;
|
|
23
|
-
export declare const ROOT_API = "https://api.judgmentlabs.ai";
|
|
24
|
-
export declare const JUDGMENT_DATASETS_PUSH_API_URL = "https://api.judgmentlabs.ai/datasets/push/";
|
|
25
|
-
export declare const JUDGMENT_DATASETS_APPEND_API_URL = "https://api.judgmentlabs.ai/datasets/insert_examples/";
|
|
26
|
-
export declare const JUDGMENT_DATASETS_PULL_API_URL = "https://api.judgmentlabs.ai/datasets/pull/";
|
|
27
|
-
export declare const JUDGMENT_DATASETS_DELETE_API_URL = "https://api.judgmentlabs.ai/datasets/delete/";
|
|
28
|
-
export declare const JUDGMENT_DATASETS_EXPORT_JSONL_API_URL = "https://api.judgmentlabs.ai/datasets/export_jsonl/";
|
|
29
|
-
export declare const JUDGMENT_DATASETS_PROJECT_STATS_API_URL = "https://api.judgmentlabs.ai/datasets/fetch_stats_by_project/";
|
|
30
|
-
export declare const JUDGMENT_DATASETS_INSERT_API_URL = "https://api.judgmentlabs.ai/datasets/insert_examples/";
|
|
31
|
-
export declare const JUDGMENT_EVAL_FETCH_API_URL = "https://api.judgmentlabs.ai/fetch_eval_results/";
|
|
32
|
-
export declare const JUDGMENT_EVAL_API_URL = "https://api.judgmentlabs.ai/evaluate/";
|
|
33
|
-
export declare const JUDGMENT_EVAL_LOG_API_URL = "https://api.judgmentlabs.ai/log_eval_results/";
|
|
34
|
-
export declare const JUDGMENT_EVAL_DELETE_API_URL = "https://api.judgmentlabs.ai/delete_eval_results_by_project_and_run_names/";
|
|
35
|
-
export declare const JUDGMENT_EVAL_DELETE_PROJECT_API_URL = "https://api.judgmentlabs.ai/delete_eval_results_by_project/";
|
|
36
|
-
export declare const JUDGMENT_PROJECT_DELETE_API_URL = "https://api.judgmentlabs.ai/projects/delete/";
|
|
37
|
-
export declare const JUDGMENT_PROJECT_CREATE_API_URL = "https://api.judgmentlabs.ai/projects/add/";
|
|
38
|
-
export declare const JUDGMENT_TRACES_FETCH_API_URL = "https://api.judgmentlabs.ai/traces/fetch/";
|
|
39
|
-
export declare const JUDGMENT_TRACES_SAVE_API_URL = "https://api.judgmentlabs.ai/traces/save/";
|
|
40
|
-
export declare const JUDGMENT_TRACES_DELETE_API_URL = "https://api.judgmentlabs.ai/traces/delete/";
|
|
41
|
-
export declare const JUDGMENT_CALCULATE_TOKEN_COSTS_API_URL = "https://api.judgmentlabs.ai/calculate-token-costs";
|
|
42
|
-
export declare const JUDGMENT_ADD_TO_RUN_EVAL_QUEUE_API_URL = "https://api.judgmentlabs.ai/add_to_run_eval_queue/";
|
|
43
|
-
export declare const RABBITMQ_HOST: string;
|
|
44
|
-
export declare const RABBITMQ_PORT: number;
|
|
45
|
-
export declare const RABBITMQ_QUEUE: string;
|
|
46
|
-
export declare const LITELLM_SUPPORTED_MODELS: Set<string>;
|
|
47
|
-
export declare const TOGETHER_SUPPORTED_MODELS: string[];
|
|
48
|
-
export declare const JUDGMENT_SUPPORTED_MODELS: Set<string>;
|
|
49
|
-
export declare const ACCEPTABLE_MODELS: Set<string>;
|
|
50
|
-
export declare const MAX_WORKER_THREADS = 10;
|
|
51
|
-
export declare const MAX_CONCURRENT_EVALUATIONS = 50;
|
|
@@ -1,44 +0,0 @@
|
|
|
1
|
-
import { Example } from '../example.js';
|
|
2
|
-
import { EvalDataset } from './eval-dataset.js';
|
|
3
|
-
import { AxiosResponse } from 'axios';
|
|
4
|
-
export declare class EvalDatasetClient {
|
|
5
|
-
private judgmentApiKey;
|
|
6
|
-
private organizationId;
|
|
7
|
-
constructor(judgmentApiKey: string, organizationId: string);
|
|
8
|
-
createDataset(examples?: Example[]): EvalDataset;
|
|
9
|
-
/**
|
|
10
|
-
* Pushes the dataset to the Judgment platform.
|
|
11
|
-
* @returns True if successful, false otherwise.
|
|
12
|
-
*/
|
|
13
|
-
pushDataset(dataset: EvalDataset, alias: string, projectName: string, overwrite?: boolean): Promise<boolean>;
|
|
14
|
-
/**
|
|
15
|
-
* Pulls the dataset from the Judgment platform.
|
|
16
|
-
*/
|
|
17
|
-
pullDataset(alias: string, projectName: string): Promise<EvalDataset>;
|
|
18
|
-
/**
|
|
19
|
-
* Deletes the dataset from the Judgment platform.
|
|
20
|
-
* @returns True if successful, false otherwise.
|
|
21
|
-
*/
|
|
22
|
-
deleteDataset(alias: string, projectName: string): Promise<boolean>;
|
|
23
|
-
/**
|
|
24
|
-
* Pulls dataset statistics for a project from the Judgment platform.
|
|
25
|
-
*/
|
|
26
|
-
pullProjectDatasetStats(projectName: string): Promise<Record<string, any>>;
|
|
27
|
-
/**
|
|
28
|
-
* Inserts new examples into an existing dataset on the Judgment platform.
|
|
29
|
-
* @returns True if successful, false otherwise.
|
|
30
|
-
*/
|
|
31
|
-
insertDataset(alias: string, examples: Example[], projectName: string): Promise<boolean>;
|
|
32
|
-
/**
|
|
33
|
-
* Exports a dataset in JSONL format from the Judgment platform.
|
|
34
|
-
* @returns AxiosResponse containing the stream if successful.
|
|
35
|
-
*/
|
|
36
|
-
exportJsonl(alias: string, projectName: string): Promise<AxiosResponse>;
|
|
37
|
-
/**
|
|
38
|
-
* Appends examples to an existing dataset on the Judgment platform.
|
|
39
|
-
* @returns True if successful, false otherwise.
|
|
40
|
-
*/
|
|
41
|
-
append(alias: string, examples: Example[], projectName: string): Promise<boolean>;
|
|
42
|
-
private getAuthHeaders;
|
|
43
|
-
private handleApiError;
|
|
44
|
-
}
|
|
@@ -1,45 +0,0 @@
|
|
|
1
|
-
import { Example, ExampleOptions } from '../example.js';
|
|
2
|
-
type SaveFileType = 'json' | 'csv' | 'yaml';
|
|
3
|
-
export declare class EvalDataset {
|
|
4
|
-
examples: Example[];
|
|
5
|
-
private _alias;
|
|
6
|
-
private _id;
|
|
7
|
-
constructor(examples?: Example[]);
|
|
8
|
-
addExample(e: Example): void;
|
|
9
|
-
get length(): number;
|
|
10
|
-
get alias(): string | null;
|
|
11
|
-
set alias(value: string | null);
|
|
12
|
-
get id(): string | null;
|
|
13
|
-
set id(value: string | null);
|
|
14
|
-
/**
|
|
15
|
-
* Adds examples from a JSON file.
|
|
16
|
-
* Assumes the JSON file has a top-level key "examples" containing an array of example objects.
|
|
17
|
-
* @param filePath Path to the JSON file.
|
|
18
|
-
*/
|
|
19
|
-
addFromJson(filePath: string): void;
|
|
20
|
-
/**
|
|
21
|
-
* Adds examples from a YAML file.
|
|
22
|
-
* Assumes the YAML file has a top-level key "examples" containing an array of example objects.
|
|
23
|
-
* @param filePath Path to the YAML file.
|
|
24
|
-
*/
|
|
25
|
-
addFromYaml(filePath: string): void;
|
|
26
|
-
/**
|
|
27
|
-
* Adds examples from a CSV file.
|
|
28
|
-
* @param filePath Path to the CSV file.
|
|
29
|
-
* @param headerMapping Dictionary mapping Example headers (keys) to custom headers in the CSV (values).
|
|
30
|
-
* @param primaryDelimiter Main delimiter used in CSV file. Defaults to ",".
|
|
31
|
-
* @param secondaryDelimiter Secondary delimiter for list fields (context, retrieval_context, etc.). Defaults to ";".
|
|
32
|
-
*/
|
|
33
|
-
addFromCsv(filePath: string, headerMapping: {
|
|
34
|
-
[key in keyof ExampleOptions]?: string;
|
|
35
|
-
}, primaryDelimiter?: string, secondaryDelimiter?: string): void;
|
|
36
|
-
/**
|
|
37
|
-
* Saves the dataset as a file.
|
|
38
|
-
* @param fileType The file type to save as ('json', 'csv', 'yaml').
|
|
39
|
-
* @param dirPath The directory path to save the file to.
|
|
40
|
-
* @param saveName Optional: The name of the file (without extension). Defaults to a timestamp.
|
|
41
|
-
* @param secondaryDelimiter Optional: The delimiter used for joining list fields in CSV output. Defaults to ";".
|
|
42
|
-
*/
|
|
43
|
-
saveAs(fileType: SaveFileType, dirPath: string, saveName?: string, secondaryDelimiter?: string): void;
|
|
44
|
-
}
|
|
45
|
-
export {};
|
|
@@ -1,82 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Represents an example for evaluation
|
|
3
|
-
*/
|
|
4
|
-
export interface ExampleOptions {
|
|
5
|
-
input: string;
|
|
6
|
-
actualOutput?: string | string[];
|
|
7
|
-
expectedOutput?: string | string[];
|
|
8
|
-
context?: string[];
|
|
9
|
-
retrievalContext?: string[];
|
|
10
|
-
additionalMetadata?: Record<string, any>;
|
|
11
|
-
toolsCalled?: string[];
|
|
12
|
-
expectedTools?: string[];
|
|
13
|
-
name?: string;
|
|
14
|
-
exampleId?: string;
|
|
15
|
-
exampleIndex?: number;
|
|
16
|
-
timestamp?: string;
|
|
17
|
-
traceId?: string;
|
|
18
|
-
example?: boolean;
|
|
19
|
-
}
|
|
20
|
-
export declare class Example {
|
|
21
|
-
input: string;
|
|
22
|
-
actualOutput?: string | string[];
|
|
23
|
-
expectedOutput?: string | string[];
|
|
24
|
-
context?: string[];
|
|
25
|
-
retrievalContext?: string[];
|
|
26
|
-
additionalMetadata?: Record<string, any>;
|
|
27
|
-
toolsCalled?: string[];
|
|
28
|
-
expectedTools?: string[];
|
|
29
|
-
name?: string;
|
|
30
|
-
exampleId: string;
|
|
31
|
-
exampleIndex?: number;
|
|
32
|
-
timestamp?: string;
|
|
33
|
-
traceId?: string;
|
|
34
|
-
example?: boolean;
|
|
35
|
-
constructor(options: ExampleOptions);
|
|
36
|
-
/**
|
|
37
|
-
* Generate a UUID for the example ID
|
|
38
|
-
*/
|
|
39
|
-
private generateUUID;
|
|
40
|
-
/**
|
|
41
|
-
* Builder pattern for creating an Example
|
|
42
|
-
*/
|
|
43
|
-
static builder(): ExampleBuilder;
|
|
44
|
-
/**
|
|
45
|
-
* Convert the example to a plain object
|
|
46
|
-
*/
|
|
47
|
-
toJSON(): Record<string, any>;
|
|
48
|
-
}
|
|
49
|
-
/**
|
|
50
|
-
* Builder for creating Example instances
|
|
51
|
-
*/
|
|
52
|
-
export declare class ExampleBuilder {
|
|
53
|
-
private _input;
|
|
54
|
-
private _actualOutput?;
|
|
55
|
-
private _expectedOutput?;
|
|
56
|
-
private _context?;
|
|
57
|
-
private _retrievalContext?;
|
|
58
|
-
private _additionalMetadata?;
|
|
59
|
-
private _toolsCalled?;
|
|
60
|
-
private _expectedTools?;
|
|
61
|
-
private _name?;
|
|
62
|
-
private _exampleId?;
|
|
63
|
-
private _exampleIndex?;
|
|
64
|
-
private _timestamp?;
|
|
65
|
-
private _traceId?;
|
|
66
|
-
private _example?;
|
|
67
|
-
input(input: string): ExampleBuilder;
|
|
68
|
-
actualOutput(actualOutput: string | string[]): ExampleBuilder;
|
|
69
|
-
expectedOutput(expectedOutput: string | string[]): ExampleBuilder;
|
|
70
|
-
context(context: string[]): ExampleBuilder;
|
|
71
|
-
retrievalContext(retrievalContext: string[]): ExampleBuilder;
|
|
72
|
-
additionalMetadata(additionalMetadata: Record<string, any>): ExampleBuilder;
|
|
73
|
-
toolsCalled(toolsCalled: string[]): ExampleBuilder;
|
|
74
|
-
expectedTools(expectedTools: string[]): ExampleBuilder;
|
|
75
|
-
name(name: string): ExampleBuilder;
|
|
76
|
-
exampleId(exampleId: string): ExampleBuilder;
|
|
77
|
-
exampleIndex(exampleIndex: number): ExampleBuilder;
|
|
78
|
-
timestamp(timestamp: string): ExampleBuilder;
|
|
79
|
-
traceId(traceId: string): ExampleBuilder;
|
|
80
|
-
example(example: boolean): ExampleBuilder;
|
|
81
|
-
build(): Example;
|
|
82
|
-
}
|
|
@@ -1,51 +0,0 @@
|
|
|
1
|
-
import { Example } from './example.js';
|
|
2
|
-
/**
|
|
3
|
-
* Represents the data for a single scorer
|
|
4
|
-
*/
|
|
5
|
-
export interface ScorerData {
|
|
6
|
-
name: string;
|
|
7
|
-
score: number;
|
|
8
|
-
threshold: number;
|
|
9
|
-
success: boolean;
|
|
10
|
-
reason: string | null;
|
|
11
|
-
strict_mode: boolean | null;
|
|
12
|
-
evaluation_model: string | null;
|
|
13
|
-
error: string | null;
|
|
14
|
-
evaluation_cost: number | null;
|
|
15
|
-
verbose_logs: any | null;
|
|
16
|
-
additional_metadata: Record<string, any>;
|
|
17
|
-
}
|
|
18
|
-
/**
|
|
19
|
-
* Represents the result of scoring an example
|
|
20
|
-
*/
|
|
21
|
-
export interface ScoringResultOptions {
|
|
22
|
-
dataObject: Example;
|
|
23
|
-
scorersData?: ScorerData[];
|
|
24
|
-
error?: string;
|
|
25
|
-
}
|
|
26
|
-
export declare class ScoringResult {
|
|
27
|
-
dataObject: Example;
|
|
28
|
-
scorersData?: ScorerData[];
|
|
29
|
-
error?: string;
|
|
30
|
-
constructor(options: ScoringResultOptions);
|
|
31
|
-
/**
|
|
32
|
-
* Builder pattern for creating a ScoringResult
|
|
33
|
-
*/
|
|
34
|
-
static builder(): ScoringResultBuilder;
|
|
35
|
-
/**
|
|
36
|
-
* Convert the scoring result to a plain object
|
|
37
|
-
*/
|
|
38
|
-
toJSON(): Record<string, any>;
|
|
39
|
-
}
|
|
40
|
-
/**
|
|
41
|
-
* Builder for creating ScoringResult instances
|
|
42
|
-
*/
|
|
43
|
-
export declare class ScoringResultBuilder {
|
|
44
|
-
private _dataObject;
|
|
45
|
-
private _scorersData?;
|
|
46
|
-
private _error?;
|
|
47
|
-
dataObject(dataObject: Example): ScoringResultBuilder;
|
|
48
|
-
scorersData(scorersData: ScorerData[]): ScoringResultBuilder;
|
|
49
|
-
error(error: string): ScoringResultBuilder;
|
|
50
|
-
build(): ScoringResult;
|
|
51
|
-
}
|