@gleanwork/mcp-server-tester 2.0.0-beta.4 → 2.0.0-beta.5

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
@@ -1,4 +1,4 @@
1
- export { A as AuthType, K as BuiltInRubric, N as BuiltInSanitizer, Q as CLIConfig, W as CLIOAuthClientConfig, X as CLIOAuthResult, Y as CLIOutputFormat, Z as CaseComparisonResult, _ as ClientCredentialsConfig, $ as CompareEvalRunsOptions, a0 as ComparisonOutcome, a1 as ContentBlock, a2 as CreateMCPClientOptions, a3 as CustomJudgeExecutor, a4 as CustomJudgeResult, a9 as EvalCase, aa as EvalCaseComparison, ab as EvalCaseComparisonOutcome, ac as EvalCaseRequest, l as EvalCaseResult, ae as EvalContext, o as EvalDataset, ag as EvalExpectBlock, ah as EvalExpectationResult, ak as EvalMode, ao as EvalRunComparisonLabels, ap as EvalRunComparisonResult, aq as EvalRunMetadata, ar as EvalRunnerOptions, r as EvalRunnerResult, ay as ExpectationBreakdown, az as ExpectationResultMap, aA as ExpectationType, aB as ExperimentMetric, aJ as FieldRemovalSanitizer, aT as HostDiagnostics, a_ as HostType, a$ as HttpMCPConfig, b0 as IterationResult, G as Judge, F as JudgeConfig, b1 as JudgeExpectConfig, J as JudgeMatcherOptions, b2 as JudgeResult, b3 as JudgeValidatorConfig, L as LLMProvider, b4 as LLMToolCall, b6 as LoadDatasetOptions, b7 as MCPAuthConfig, b8 as MCPAuthFixtures, b9 as MCPClientCredentialsConfig, p as MCPConfig, bb as MCPConformanceCheck, bc as MCPConformanceOptions, bd as MCPConformanceRaw, be as MCPConformanceResult, bf as MCPConformanceResultData, bg as MCPEvalData, bh as MCPEvalHistoricalSummary, bi as MCPEvalReporterConfig, bj as MCPEvalRunData, M as MCPFixtureApi, bk as MCPFixtureOptions, bl as MCPHostCapabilities, a as MCPHostConfig, b as MCPHostSimulationResult, bm as MCPHostSimulator, bn as MCPOAuthConfig, bo as MCPServerCapabilitiesData, br as NormalizedToolResponse, O as OAuthSetupConfig, P as PatternValidatorOptions, bu as PlaywrightOAuthClientProviderConfig, bv as PredicateResult, bw as ProposeVariantsContext, bx as ProtectedResourceDiscoveryResult, by as ProtectedResourceMetadata, bz as ProviderKind, bA as RegexSanitizer, bB as ResultSource, R as RubricSpec, bE as SaveBaselineOptions, bF as SaveEvalRunComparisonOptions, bG as SaveServerComparisonOptions, bH as SchemaRegistry, S as SchemaValidatorOptions, bI as SerializedEvalDataset, bJ as ServerComparisonOptions, bK as ServerComparisonResult, c as SizeValidatorOptions, d as SnapshotSanitizer, bL as SnapshotSanitizers, bM as StdioMCPConfig, bP as StoredClientInfo, bS as StoredEvalResultLoadOptions, bT as StoredEvalResultRef, bU as StoredEvalResultSaveOptions, bV as StoredEvalRunRef, bW as StoredOAuthState, bX as StoredServerMetadata, bY as StoredTokens, T as TextValidatorOptions, b_ as TokenResult, g as ToolCallCountOptions, f as ToolCallExpectation, b$ as ToolMetadataOverride, c0 as ToolOverrideVariant, e as ToolPredicate, c2 as UsageMetrics, V as ValidationResult, c3 as VariantCandidateResult, c4 as VariantExperimentOptions, c5 as VariantExperimentReason, c6 as VariantExperimentResult, c7 as VariantExperimentRound, c8 as VariantImprovementProposal, c9 as VariantRecommendation } from '../index-CwFHKIoN.cjs';
1
+ export { A as AuthType, K as BuiltInRubric, N as BuiltInSanitizer, Q as CLIConfig, W as CLIOAuthClientConfig, X as CLIOAuthResult, Y as CLIOutputFormat, Z as CaseComparisonResult, _ as ClientCredentialsConfig, $ as CompareEvalRunsOptions, a0 as ComparisonOutcome, a1 as ContentBlock, a2 as CreateMCPClientOptions, a3 as CustomJudgeExecutor, a4 as CustomJudgeResult, a9 as EvalCase, aa as EvalCaseComparison, ab as EvalCaseComparisonOutcome, ac as EvalCaseRequest, l as EvalCaseResult, ae as EvalContext, o as EvalDataset, ag as EvalExpectBlock, ah as EvalExpectationResult, ak as EvalMode, ao as EvalRunComparisonLabels, ap as EvalRunComparisonResult, aq as EvalRunMetadata, ar as EvalRunnerOptions, r as EvalRunnerResult, ay as ExpectationBreakdown, az as ExpectationResultMap, aA as ExpectationType, aB as ExperimentMetric, aJ as FieldRemovalSanitizer, aT as HostDiagnostics, a_ as HostType, a$ as HttpMCPConfig, b0 as IterationResult, G as Judge, F as JudgeConfig, b1 as JudgeExpectConfig, J as JudgeMatcherOptions, b2 as JudgeResult, b3 as JudgeValidatorConfig, L as LLMProvider, b4 as LLMToolCall, b6 as LoadDatasetOptions, b7 as MCPAuthConfig, b8 as MCPAuthFixtures, b9 as MCPClientCredentialsConfig, p as MCPConfig, bb as MCPConformanceCheck, bc as MCPConformanceOptions, bd as MCPConformanceRaw, be as MCPConformanceResult, bf as MCPConformanceResultData, bg as MCPEvalData, bh as MCPEvalHistoricalSummary, bi as MCPEvalReporterConfig, bj as MCPEvalRunData, M as MCPFixtureApi, bk as MCPFixtureOptions, bl as MCPHostCapabilities, a as MCPHostConfig, b as MCPHostSimulationResult, bm as MCPHostSimulator, bn as MCPOAuthConfig, bo as MCPServerCapabilitiesData, br as NormalizedToolResponse, O as OAuthSetupConfig, P as PatternValidatorOptions, bu as PlaywrightOAuthClientProviderConfig, bv as PredicateResult, bw as ProposeVariantsContext, bx as ProtectedResourceDiscoveryResult, by as ProtectedResourceMetadata, bz as ProviderKind, bA as RegexSanitizer, bB as ResultSource, R as RubricSpec, bE as SaveBaselineOptions, bF as SaveEvalRunComparisonOptions, bG as SaveServerComparisonOptions, bH as SchemaRegistry, S as SchemaValidatorOptions, bI as SerializedEvalDataset, bJ as ServerComparisonOptions, bK as ServerComparisonResult, c as SizeValidatorOptions, d as SnapshotSanitizer, bL as SnapshotSanitizers, bM as StdioMCPConfig, bP as StoredClientInfo, bS as StoredEvalResultLoadOptions, bT as StoredEvalResultRef, bU as StoredEvalResultSaveOptions, bV as StoredEvalRunRef, bW as StoredOAuthState, bX as StoredServerMetadata, bY as StoredTokens, T as TextValidatorOptions, b_ as TokenResult, g as ToolCallCountOptions, f as ToolCallExpectation, b$ as ToolMetadataOverride, c0 as ToolOverrideVariant, e as ToolPredicate, c2 as UsageMetrics, V as ValidationResult, c3 as VariantCandidateResult, c4 as VariantExperimentOptions, c5 as VariantExperimentReason, c6 as VariantExperimentResult, c7 as VariantExperimentRound, c8 as VariantImprovementProposal, c9 as VariantRecommendation } from '../index-BTEdKnrn.cjs';
2
2
  import 'zod';
3
3
  import '@playwright/test';
4
4
  import '@modelcontextprotocol/sdk/client/index.js';
@@ -1,4 +1,4 @@
1
- export { A as AuthType, K as BuiltInRubric, N as BuiltInSanitizer, Q as CLIConfig, W as CLIOAuthClientConfig, X as CLIOAuthResult, Y as CLIOutputFormat, Z as CaseComparisonResult, _ as ClientCredentialsConfig, $ as CompareEvalRunsOptions, a0 as ComparisonOutcome, a1 as ContentBlock, a2 as CreateMCPClientOptions, a3 as CustomJudgeExecutor, a4 as CustomJudgeResult, a9 as EvalCase, aa as EvalCaseComparison, ab as EvalCaseComparisonOutcome, ac as EvalCaseRequest, l as EvalCaseResult, ae as EvalContext, o as EvalDataset, ag as EvalExpectBlock, ah as EvalExpectationResult, ak as EvalMode, ao as EvalRunComparisonLabels, ap as EvalRunComparisonResult, aq as EvalRunMetadata, ar as EvalRunnerOptions, r as EvalRunnerResult, ay as ExpectationBreakdown, az as ExpectationResultMap, aA as ExpectationType, aB as ExperimentMetric, aJ as FieldRemovalSanitizer, aT as HostDiagnostics, a_ as HostType, a$ as HttpMCPConfig, b0 as IterationResult, G as Judge, F as JudgeConfig, b1 as JudgeExpectConfig, J as JudgeMatcherOptions, b2 as JudgeResult, b3 as JudgeValidatorConfig, L as LLMProvider, b4 as LLMToolCall, b6 as LoadDatasetOptions, b7 as MCPAuthConfig, b8 as MCPAuthFixtures, b9 as MCPClientCredentialsConfig, p as MCPConfig, bb as MCPConformanceCheck, bc as MCPConformanceOptions, bd as MCPConformanceRaw, be as MCPConformanceResult, bf as MCPConformanceResultData, bg as MCPEvalData, bh as MCPEvalHistoricalSummary, bi as MCPEvalReporterConfig, bj as MCPEvalRunData, M as MCPFixtureApi, bk as MCPFixtureOptions, bl as MCPHostCapabilities, a as MCPHostConfig, b as MCPHostSimulationResult, bm as MCPHostSimulator, bn as MCPOAuthConfig, bo as MCPServerCapabilitiesData, br as NormalizedToolResponse, O as OAuthSetupConfig, P as PatternValidatorOptions, bu as PlaywrightOAuthClientProviderConfig, bv as PredicateResult, bw as ProposeVariantsContext, bx as ProtectedResourceDiscoveryResult, by as ProtectedResourceMetadata, bz as ProviderKind, bA as RegexSanitizer, bB as ResultSource, R as RubricSpec, bE as SaveBaselineOptions, bF as SaveEvalRunComparisonOptions, bG as SaveServerComparisonOptions, bH as SchemaRegistry, S as SchemaValidatorOptions, bI as SerializedEvalDataset, bJ as ServerComparisonOptions, bK as ServerComparisonResult, c as SizeValidatorOptions, d as SnapshotSanitizer, bL as SnapshotSanitizers, bM as StdioMCPConfig, bP as StoredClientInfo, bS as StoredEvalResultLoadOptions, bT as StoredEvalResultRef, bU as StoredEvalResultSaveOptions, bV as StoredEvalRunRef, bW as StoredOAuthState, bX as StoredServerMetadata, bY as StoredTokens, T as TextValidatorOptions, b_ as TokenResult, g as ToolCallCountOptions, f as ToolCallExpectation, b$ as ToolMetadataOverride, c0 as ToolOverrideVariant, e as ToolPredicate, c2 as UsageMetrics, V as ValidationResult, c3 as VariantCandidateResult, c4 as VariantExperimentOptions, c5 as VariantExperimentReason, c6 as VariantExperimentResult, c7 as VariantExperimentRound, c8 as VariantImprovementProposal, c9 as VariantRecommendation } from '../index-CwFHKIoN.js';
1
+ export { A as AuthType, K as BuiltInRubric, N as BuiltInSanitizer, Q as CLIConfig, W as CLIOAuthClientConfig, X as CLIOAuthResult, Y as CLIOutputFormat, Z as CaseComparisonResult, _ as ClientCredentialsConfig, $ as CompareEvalRunsOptions, a0 as ComparisonOutcome, a1 as ContentBlock, a2 as CreateMCPClientOptions, a3 as CustomJudgeExecutor, a4 as CustomJudgeResult, a9 as EvalCase, aa as EvalCaseComparison, ab as EvalCaseComparisonOutcome, ac as EvalCaseRequest, l as EvalCaseResult, ae as EvalContext, o as EvalDataset, ag as EvalExpectBlock, ah as EvalExpectationResult, ak as EvalMode, ao as EvalRunComparisonLabels, ap as EvalRunComparisonResult, aq as EvalRunMetadata, ar as EvalRunnerOptions, r as EvalRunnerResult, ay as ExpectationBreakdown, az as ExpectationResultMap, aA as ExpectationType, aB as ExperimentMetric, aJ as FieldRemovalSanitizer, aT as HostDiagnostics, a_ as HostType, a$ as HttpMCPConfig, b0 as IterationResult, G as Judge, F as JudgeConfig, b1 as JudgeExpectConfig, J as JudgeMatcherOptions, b2 as JudgeResult, b3 as JudgeValidatorConfig, L as LLMProvider, b4 as LLMToolCall, b6 as LoadDatasetOptions, b7 as MCPAuthConfig, b8 as MCPAuthFixtures, b9 as MCPClientCredentialsConfig, p as MCPConfig, bb as MCPConformanceCheck, bc as MCPConformanceOptions, bd as MCPConformanceRaw, be as MCPConformanceResult, bf as MCPConformanceResultData, bg as MCPEvalData, bh as MCPEvalHistoricalSummary, bi as MCPEvalReporterConfig, bj as MCPEvalRunData, M as MCPFixtureApi, bk as MCPFixtureOptions, bl as MCPHostCapabilities, a as MCPHostConfig, b as MCPHostSimulationResult, bm as MCPHostSimulator, bn as MCPOAuthConfig, bo as MCPServerCapabilitiesData, br as NormalizedToolResponse, O as OAuthSetupConfig, P as PatternValidatorOptions, bu as PlaywrightOAuthClientProviderConfig, bv as PredicateResult, bw as ProposeVariantsContext, bx as ProtectedResourceDiscoveryResult, by as ProtectedResourceMetadata, bz as ProviderKind, bA as RegexSanitizer, bB as ResultSource, R as RubricSpec, bE as SaveBaselineOptions, bF as SaveEvalRunComparisonOptions, bG as SaveServerComparisonOptions, bH as SchemaRegistry, S as SchemaValidatorOptions, bI as SerializedEvalDataset, bJ as ServerComparisonOptions, bK as ServerComparisonResult, c as SizeValidatorOptions, d as SnapshotSanitizer, bL as SnapshotSanitizers, bM as StdioMCPConfig, bP as StoredClientInfo, bS as StoredEvalResultLoadOptions, bT as StoredEvalResultRef, bU as StoredEvalResultSaveOptions, bV as StoredEvalRunRef, bW as StoredOAuthState, bX as StoredServerMetadata, bY as StoredTokens, T as TextValidatorOptions, b_ as TokenResult, g as ToolCallCountOptions, f as ToolCallExpectation, b$ as ToolMetadataOverride, c0 as ToolOverrideVariant, e as ToolPredicate, c2 as UsageMetrics, V as ValidationResult, c3 as VariantCandidateResult, c4 as VariantExperimentOptions, c5 as VariantExperimentReason, c6 as VariantExperimentResult, c7 as VariantExperimentRound, c8 as VariantImprovementProposal, c9 as VariantRecommendation } from '../index-BTEdKnrn.js';
2
2
  import 'zod';
3
3
  import '@playwright/test';
4
4
  import '@modelcontextprotocol/sdk/client/index.js';
package/package.json CHANGED
@@ -1,6 +1,6 @@
1
1
  {
2
2
  "name": "@gleanwork/mcp-server-tester",
3
- "version": "2.0.0-beta.4",
3
+ "version": "2.0.0-beta.5",
4
4
  "description": "Playwright-based testing and evaluation framework for MCP servers",
5
5
  "keywords": [
6
6
  "playwright",
@@ -30,6 +30,7 @@
30
30
  },
31
31
  "./cowork-runtime": "./scripts/cowork_computer_use.py",
32
32
  "./cowork-linux-runtime": "./scripts/cowork_linux.py",
33
+ "./chatgpt-linux-runtime": "./scripts/chatgpt_linux.py",
33
34
  "./cowork-requirements": "./scripts/cowork-requirements.txt",
34
35
  "./types": {
35
36
  "types": "./dist/types/index.d.ts",
@@ -60,6 +61,8 @@
60
61
  "dist",
61
62
  "scripts/cowork_computer_use.py",
62
63
  "scripts/cowork_linux.py",
64
+ "scripts/chatgpt_linux.py",
65
+ "scripts/chatgpt_linux_contract.json",
63
66
  "scripts/cowork-requirements.txt"
64
67
  ],
65
68
  "scripts": {
@@ -100,6 +103,7 @@
100
103
  "open": "^10.1.0",
101
104
  "react": "^18.3.1",
102
105
  "undici": "^7.24.0",
106
+ "smol-toml": "^1.4.2",
103
107
  "zod": "^4.3.6"
104
108
  },
105
109
  "devDependencies": {