npm - @templmf/temp-solf-lmf - Versions diffs - 0.0.43 → 0.0.45 - Mend

@templmf/temp-solf-lmf 0.0.43 → 0.0.45

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.

Files changed (46) hide show

package/ai-gateway/.env +42 -0
package/ai-gateway/README.md +295 -0
package/ai-gateway/package-lock.json +1370 -0
package/ai-gateway/package.json +18 -0
package/ai-gateway/src/index.js +132 -0
package/ai-gateway/src/middleware/auth.js +45 -0
package/ai-gateway/src/middleware/rateLimit.js +87 -0
package/ai-gateway/src/routes/chat.js +657 -0
package/ai-gateway/src/skills/detector.js +145 -0
package/ai-gateway/src/skills/html.md +18 -0
package/ai-gateway/src/skills/markdown.md +18 -0
package/ai-gateway/src/skills/react.md +27 -0
package/ai-gateway/src/skills/registry.js +441 -0
package/ai-gateway/src/skills/skill-creator/LICENSE.txt +202 -0
package/ai-gateway/src/skills/skill-creator/SKILL.md +485 -0
package/ai-gateway/src/skills/skill-creator/agents/analyzer.md +274 -0
package/ai-gateway/src/skills/skill-creator/agents/comparator.md +202 -0
package/ai-gateway/src/skills/skill-creator/agents/grader.md +223 -0
package/ai-gateway/src/skills/skill-creator/assets/eval_review.html +146 -0
package/ai-gateway/src/skills/skill-creator/eval-viewer/generate_review.py +471 -0
package/ai-gateway/src/skills/skill-creator/eval-viewer/viewer.html +1325 -0
package/ai-gateway/src/skills/skill-creator/references/schemas.md +430 -0
package/ai-gateway/src/skills/skill-creator/scripts/__init__.py +0 -0
package/ai-gateway/src/skills/skill-creator/scripts/aggregate_benchmark.py +401 -0
package/ai-gateway/src/skills/skill-creator/scripts/generate_report.py +326 -0
package/ai-gateway/src/skills/skill-creator/scripts/improve_description.py +247 -0
package/ai-gateway/src/skills/skill-creator/scripts/package_skill.py +136 -0
package/ai-gateway/src/skills/skill-creator/scripts/quick_validate.py +103 -0
package/ai-gateway/src/skills/skill-creator/scripts/run_eval.py +310 -0
package/ai-gateway/src/skills/skill-creator/scripts/run_loop.py +328 -0
package/ai-gateway/src/skills/skill-creator/scripts/utils.py +47 -0
package/ai-gateway/src/skills/skill-creator/skill-creator.skill +0 -0
package/ai-gateway/src/skills/ticket.md +36 -0
package/ai-gateway/src/skills/vue.md +31 -0
package/ai-gateway/src/utils/logger.js +21 -0
package/ai-gateway/src/utils/retry.js +90 -0
package/ai-gateway/src/utils/sessionManager.js +159 -0
package/ai-gateway/src/utils/structuredResponse.js +144 -0
package/ai-gateway/src/utils/toolAdapter.js +151 -0
package/package.json +1 -1
package//345/216/213/347/274/251/345/220/216/347/232/204/346/226/207/344/273/266.7z +0 -0
package/skill-mcp/README.md +0 -74
package/skill-mcp/index.ts +0 -336
package/skill-mcp/package (1).json +0 -19
package/skill-mcp/tsconfig.json +0 -16
package//347/247/273/345/212/250/345/272/224/347/224/250/345/217/260/350/264/246/347/247/273/344/272/244/346/270/205/345/215/225.xlsx +0 -0

package/ai-gateway/src/skills/skill-creator/scripts/run_loop.py ADDED Viewed

@@ -0,0 +1,328 @@
+#!/usr/bin/env python3
+"""Run the eval + improve loop until all pass or max iterations reached.
+Combines run_eval.py and improve_description.py in a loop, tracking history
+and returning the best description found. Supports train/test split to prevent
+overfitting.
+"""
+import argparse
+import json
+import random
+import sys
+import tempfile
+import time
+import webbrowser
+from pathlib import Path
+from scripts.generate_report import generate_html
+from scripts.improve_description import improve_description
+from scripts.run_eval import find_project_root, run_eval
+from scripts.utils import parse_skill_md
+def split_eval_set(eval_set: list[dict], holdout: float, seed: int = 42) -> tuple[list[dict], list[dict]]:
+    """Split eval set into train and test sets, stratified by should_trigger."""
+    random.seed(seed)
+    # Separate by should_trigger
+    trigger = [e for e in eval_set if e["should_trigger"]]
+    no_trigger = [e for e in eval_set if not e["should_trigger"]]
+    # Shuffle each group
+    random.shuffle(trigger)
+    random.shuffle(no_trigger)
+    # Calculate split points
+    n_trigger_test = max(1, int(len(trigger) * holdout))
+    n_no_trigger_test = max(1, int(len(no_trigger) * holdout))
+    # Split
+    test_set = trigger[:n_trigger_test] + no_trigger[:n_no_trigger_test]
+    train_set = trigger[n_trigger_test:] + no_trigger[n_no_trigger_test:]
+    return train_set, test_set
+def run_loop(
+    eval_set: list[dict],
+    skill_path: Path,
+    description_override: str | None,
+    num_workers: int,
+    timeout: int,
+    max_iterations: int,
+    runs_per_query: int,
+    trigger_threshold: float,
+    holdout: float,
+    model: str,
+    verbose: bool,
+    live_report_path: Path | None = None,
+    log_dir: Path | None = None,
+) -> dict:
+    """Run the eval + improvement loop."""
+    project_root = find_project_root()
+    name, original_description, content = parse_skill_md(skill_path)
+    current_description = description_override or original_description
+    # Split into train/test if holdout > 0
+    if holdout > 0:
+        train_set, test_set = split_eval_set(eval_set, holdout)
+        if verbose:
+            print(f"Split: {len(train_set)} train, {len(test_set)} test (holdout={holdout})", file=sys.stderr)
+    else:
+        train_set = eval_set
+        test_set = []
+    history = []
+    exit_reason = "unknown"
+    for iteration in range(1, max_iterations + 1):
+        if verbose:
+            print(f"\n{'='*60}", file=sys.stderr)
+            print(f"Iteration {iteration}/{max_iterations}", file=sys.stderr)
+            print(f"Description: {current_description}", file=sys.stderr)
+            print(f"{'='*60}", file=sys.stderr)
+        # Evaluate train + test together in one batch for parallelism
+        all_queries = train_set + test_set
+        t0 = time.time()
+        all_results = run_eval(
+            eval_set=all_queries,
+            skill_name=name,
+            description=current_description,
+            num_workers=num_workers,
+            timeout=timeout,
+            project_root=project_root,
+            runs_per_query=runs_per_query,
+            trigger_threshold=trigger_threshold,
+            model=model,
+        )
+        eval_elapsed = time.time() - t0
+        # Split results back into train/test by matching queries
+        train_queries_set = {q["query"] for q in train_set}
+        train_result_list = [r for r in all_results["results"] if r["query"] in train_queries_set]
+        test_result_list = [r for r in all_results["results"] if r["query"] not in train_queries_set]
+        train_passed = sum(1 for r in train_result_list if r["pass"])
+        train_total = len(train_result_list)
+        train_summary = {"passed": train_passed, "failed": train_total - train_passed, "total": train_total}
+        train_results = {"results": train_result_list, "summary": train_summary}
+        if test_set:
+            test_passed = sum(1 for r in test_result_list if r["pass"])
+            test_total = len(test_result_list)
+            test_summary = {"passed": test_passed, "failed": test_total - test_passed, "total": test_total}
+            test_results = {"results": test_result_list, "summary": test_summary}
+        else:
+            test_results = None
+            test_summary = None
+        history.append({
+            "iteration": iteration,
+            "description": current_description,
+            "train_passed": train_summary["passed"],
+            "train_failed": train_summary["failed"],
+            "train_total": train_summary["total"],
+            "train_results": train_results["results"],
+            "test_passed": test_summary["passed"] if test_summary else None,
+            "test_failed": test_summary["failed"] if test_summary else None,
+            "test_total": test_summary["total"] if test_summary else None,
+            "test_results": test_results["results"] if test_results else None,
+            # For backward compat with report generator
+            "passed": train_summary["passed"],
+            "failed": train_summary["failed"],
+            "total": train_summary["total"],
+            "results": train_results["results"],
+        })
+        # Write live report if path provided
+        if live_report_path:
+            partial_output = {
+                "original_description": original_description,
+                "best_description": current_description,
+                "best_score": "in progress",
+                "iterations_run": len(history),
+                "holdout": holdout,
+                "train_size": len(train_set),
+                "test_size": len(test_set),
+                "history": history,
+            }
+            live_report_path.write_text(generate_html(partial_output, auto_refresh=True, skill_name=name))
+        if verbose:
+            def print_eval_stats(label, results, elapsed):
+                pos = [r for r in results if r["should_trigger"]]
+                neg = [r for r in results if not r["should_trigger"]]
+                tp = sum(r["triggers"] for r in pos)
+                pos_runs = sum(r["runs"] for r in pos)
+                fn = pos_runs - tp
+                fp = sum(r["triggers"] for r in neg)
+                neg_runs = sum(r["runs"] for r in neg)
+                tn = neg_runs - fp
+                total = tp + tn + fp + fn
+                precision = tp / (tp + fp) if (tp + fp) > 0 else 1.0
+                recall = tp / (tp + fn) if (tp + fn) > 0 else 1.0
+                accuracy = (tp + tn) / total if total > 0 else 0.0
+                print(f"{label}: {tp+tn}/{total} correct, precision={precision:.0%} recall={recall:.0%} accuracy={accuracy:.0%} ({elapsed:.1f}s)", file=sys.stderr)
+                for r in results:
+                    status = "PASS" if r["pass"] else "FAIL"
+                    rate_str = f"{r['triggers']}/{r['runs']}"
+                    print(f"  [{status}] rate={rate_str} expected={r['should_trigger']}: {r['query'][:60]}", file=sys.stderr)
+            print_eval_stats("Train", train_results["results"], eval_elapsed)
+            if test_summary:
+                print_eval_stats("Test ", test_results["results"], 0)
+        if train_summary["failed"] == 0:
+            exit_reason = f"all_passed (iteration {iteration})"
+            if verbose:
+                print(f"\nAll train queries passed on iteration {iteration}!", file=sys.stderr)
+            break
+        if iteration == max_iterations:
+            exit_reason = f"max_iterations ({max_iterations})"
+            if verbose:
+                print(f"\nMax iterations reached ({max_iterations}).", file=sys.stderr)
+            break
+        # Improve the description based on train results
+        if verbose:
+            print(f"\nImproving description...", file=sys.stderr)
+        t0 = time.time()
+        # Strip test scores from history so improvement model can't see them
+        blinded_history = [
+            {k: v for k, v in h.items() if not k.startswith("test_")}
+            for h in history
+        ]
+        new_description = improve_description(
+            skill_name=name,
+            skill_content=content,
+            current_description=current_description,
+            eval_results=train_results,
+            history=blinded_history,
+            model=model,
+            log_dir=log_dir,
+            iteration=iteration,
+        )
+        improve_elapsed = time.time() - t0
+        if verbose:
+            print(f"Proposed ({improve_elapsed:.1f}s): {new_description}", file=sys.stderr)
+        current_description = new_description
+    # Find the best iteration by TEST score (or train if no test set)
+    if test_set:
+        best = max(history, key=lambda h: h["test_passed"] or 0)
+        best_score = f"{best['test_passed']}/{best['test_total']}"
+    else:
+        best = max(history, key=lambda h: h["train_passed"])
+        best_score = f"{best['train_passed']}/{best['train_total']}"
+    if verbose:
+        print(f"\nExit reason: {exit_reason}", file=sys.stderr)
+        print(f"Best score: {best_score} (iteration {best['iteration']})", file=sys.stderr)
+    return {
+        "exit_reason": exit_reason,
+        "original_description": original_description,
+        "best_description": best["description"],
+        "best_score": best_score,
+        "best_train_score": f"{best['train_passed']}/{best['train_total']}",
+        "best_test_score": f"{best['test_passed']}/{best['test_total']}" if test_set else None,
+        "final_description": current_description,
+        "iterations_run": len(history),
+        "holdout": holdout,
+        "train_size": len(train_set),
+        "test_size": len(test_set),
+        "history": history,
+    }
+def main():
+    parser = argparse.ArgumentParser(description="Run eval + improve loop")
+    parser.add_argument("--eval-set", required=True, help="Path to eval set JSON file")
+    parser.add_argument("--skill-path", required=True, help="Path to skill directory")
+    parser.add_argument("--description", default=None, help="Override starting description")
+    parser.add_argument("--num-workers", type=int, default=10, help="Number of parallel workers")
+    parser.add_argument("--timeout", type=int, default=30, help="Timeout per query in seconds")
+    parser.add_argument("--max-iterations", type=int, default=5, help="Max improvement iterations")
+    parser.add_argument("--runs-per-query", type=int, default=3, help="Number of runs per query")
+    parser.add_argument("--trigger-threshold", type=float, default=0.5, help="Trigger rate threshold")
+    parser.add_argument("--holdout", type=float, default=0.4, help="Fraction of eval set to hold out for testing (0 to disable)")
+    parser.add_argument("--model", required=True, help="Model for improvement")
+    parser.add_argument("--verbose", action="store_true", help="Print progress to stderr")
+    parser.add_argument("--report", default="auto", help="Generate HTML report at this path (default: 'auto' for temp file, 'none' to disable)")
+    parser.add_argument("--results-dir", default=None, help="Save all outputs (results.json, report.html, log.txt) to a timestamped subdirectory here")
+    args = parser.parse_args()
+    eval_set = json.loads(Path(args.eval_set).read_text())
+    skill_path = Path(args.skill_path)
+    if not (skill_path / "SKILL.md").exists():
+        print(f"Error: No SKILL.md found at {skill_path}", file=sys.stderr)
+        sys.exit(1)
+    name, _, _ = parse_skill_md(skill_path)
+    # Set up live report path
+    if args.report != "none":
+        if args.report == "auto":
+            timestamp = time.strftime("%Y%m%d_%H%M%S")
+            live_report_path = Path(tempfile.gettempdir()) / f"skill_description_report_{skill_path.name}_{timestamp}.html"
+        else:
+            live_report_path = Path(args.report)
+        # Open the report immediately so the user can watch
+        live_report_path.write_text("<html><body><h1>Starting optimization loop...</h1><meta http-equiv='refresh' content='5'></body></html>")
+        webbrowser.open(str(live_report_path))
+    else:
+        live_report_path = None
+    # Determine output directory (create before run_loop so logs can be written)
+    if args.results_dir:
+        timestamp = time.strftime("%Y-%m-%d_%H%M%S")
+        results_dir = Path(args.results_dir) / timestamp
+        results_dir.mkdir(parents=True, exist_ok=True)
+    else:
+        results_dir = None
+    log_dir = results_dir / "logs" if results_dir else None
+    output = run_loop(
+        eval_set=eval_set,
+        skill_path=skill_path,
+        description_override=args.description,
+        num_workers=args.num_workers,
+        timeout=args.timeout,
+        max_iterations=args.max_iterations,
+        runs_per_query=args.runs_per_query,
+        trigger_threshold=args.trigger_threshold,
+        holdout=args.holdout,
+        model=args.model,
+        verbose=args.verbose,
+        live_report_path=live_report_path,
+        log_dir=log_dir,
+    )
+    # Save JSON output
+    json_output = json.dumps(output, indent=2)
+    print(json_output)
+    if results_dir:
+        (results_dir / "results.json").write_text(json_output)
+    # Write final HTML report (without auto-refresh)
+    if live_report_path:
+        live_report_path.write_text(generate_html(output, auto_refresh=False, skill_name=name))
+        print(f"\nReport: {live_report_path}", file=sys.stderr)
+    if results_dir and live_report_path:
+        (results_dir / "report.html").write_text(generate_html(output, auto_refresh=False, skill_name=name))
+    if results_dir:
+        print(f"Results saved to: {results_dir}", file=sys.stderr)
+if __name__ == "__main__":
+    main()

package/ai-gateway/src/skills/skill-creator/scripts/utils.py ADDED Viewed

@@ -0,0 +1,47 @@
+"""Shared utilities for skill-creator scripts."""
+from pathlib import Path
+def parse_skill_md(skill_path: Path) -> tuple[str, str, str]:
+    """Parse a SKILL.md file, returning (name, description, full_content)."""
+    content = (skill_path / "SKILL.md").read_text()
+    lines = content.split("\n")
+    if lines[0].strip() != "---":
+        raise ValueError("SKILL.md missing frontmatter (no opening ---)")
+    end_idx = None
+    for i, line in enumerate(lines[1:], start=1):
+        if line.strip() == "---":
+            end_idx = i
+            break
+    if end_idx is None:
+        raise ValueError("SKILL.md missing frontmatter (no closing ---)")
+    name = ""
+    description = ""
+    frontmatter_lines = lines[1:end_idx]
+    i = 0
+    while i < len(frontmatter_lines):
+        line = frontmatter_lines[i]
+        if line.startswith("name:"):
+            name = line[len("name:"):].strip().strip('"').strip("'")
+        elif line.startswith("description:"):
+            value = line[len("description:"):].strip()
+            # Handle YAML multiline indicators (>, |, >-, |-)
+            if value in (">", "|", ">-", "|-"):
+                continuation_lines: list[str] = []
+                i += 1
+                while i < len(frontmatter_lines) and (frontmatter_lines[i].startswith("  ") or frontmatter_lines[i].startswith("\t")):
+                    continuation_lines.append(frontmatter_lines[i].strip())
+                    i += 1
+                description = " ".join(continuation_lines)
+                continue
+            else:
+                description = value.strip('"').strip("'")
+        i += 1
+    return name, description, content

package/ai-gateway/src/skills/skill-creator/skill-creator.skill ADDED Viewed

File without changes

package/ai-gateway/src/skills/ticket.md ADDED Viewed

@@ -0,0 +1,36 @@
+# 提单助手操作规范
+你是一个智能提单助手。你的职责是通过自然语言对话，引导用户完成工单填写。
+## 工单类型与字段
+### 故障单（incident）
+必填：title, severity（P1/P2/P3/P4）, affected_system, description
+选填：steps_to_reproduce, expected_behavior, contact
+### 需求单（feature）
+必填：title, priority（high/medium/low）, description, expected_value
+选填：deadline, stakeholder
+### 变更单（change）
+必填：title, change_type（deploy/config/infra）, description, risk_level（high/medium/low）, rollback_plan
+选填：maintenance_window, approver
+## 交互规则
+1. 先识别工单类型，不确定时直接问用户
+2. 每次只追问 1-2 个缺失字段，不要一次列出所有字段
+3. 用口语化、友好的语气追问
+4. 字段收集完毕后，输出摘要请用户确认
+## 输出格式
+每次回复必须严格返回以下 JSON，不要有任何额外文字：
+```json
+{
+  "reply": "对用户说的话",
+  "form_draft": {},
+  "missing_fields": [],
+  "is_complete": false
+}
+```

package/ai-gateway/src/skills/vue.md ADDED Viewed

@@ -0,0 +1,31 @@
+# Vue 3 组件生成规范
+生成 Vue 3 单文件组件（SFC）。
+## 规范
+- 使用 `<script setup>` + Composition API
+- TypeScript 支持（lang="ts"）
+- Props 使用 defineProps<Interface>()
+- Emits 使用 defineEmits<Interface>()
+- 样式使用 `<style scoped>`
+## 组件结构
+```vue
+<template>
+  <!-- 模板 -->
+</template>
+<script setup lang="ts">
+interface Props { /* ... */ }
+const props = defineProps<Props>()
+// 逻辑
+</script>
+<style scoped>
+/* 样式 */
+</style>
+```
+## 禁止
+- 不要使用 Options API（除非用户明确要求）
+- 不要使用 Vue 2 语法

package/ai-gateway/src/utils/logger.js ADDED Viewed

@@ -0,0 +1,21 @@
+import { createLogger, format, transports } from "winston";
+export const logger = createLogger({
+  level: process.env.LOG_LEVEL || "info",
+  format: format.combine(
+    format.timestamp({ format: "YYYY-MM-DD HH:mm:ss" }),
+    format.errors({ stack: true }),
+    format.json()
+  ),
+  transports: [
+    new transports.Console({
+      format: format.combine(
+        format.colorize(),
+        format.printf(({ timestamp, level, message, ...meta }) => {
+          const metaStr = Object.keys(meta).length ? " " + JSON.stringify(meta) : "";
+          return `${timestamp} [${level}] ${message}${metaStr}`;
+        })
+      )
+    })
+  ]
+});

package/ai-gateway/src/utils/retry.js ADDED Viewed

@@ -0,0 +1,90 @@
+/**
+ * 重试工具 - 指数退避
+ *
+ * 对上游模型请求的以下错误自动重试：
+ *   - 429 Rate Limit（等待 Retry-After 后重试）
+ *   - 500 / 502 / 503 服务端错误
+ *   - 网络超时
+ *
+ * 结构化输出解析失败时也会触发一次重试（追加格式纠正指令）
+ */
+import { logger } from "./logger.js";
+const RETRYABLE_STATUS = new Set([429, 500, 502, 503, 504]);
+// ─────────────────────────────────────────────────────
+// 通用重试包装器
+// ─────────────────────────────────────────────────────
+export async function withRetry(fn, options = {}) {
+  const {
+    maxRetries = 2,
+    baseDelayMs = 500,
+    maxDelayMs = 8000,
+    requestId = "unknown",
+    label = "request"
+  } = options;
+  let lastError;
+  for (let attempt = 0; attempt <= maxRetries; attempt++) {
+    try {
+      return await fn(attempt);
+    } catch (err) {
+      lastError = err;
+      const status = err.status || err.response?.status;
+      // 非重试错误：鉴权失败、参数错误 → 直接抛出
+      if (status && !RETRYABLE_STATUS.has(status)) {
+        throw err;
+      }
+      if (attempt === maxRetries) break;
+      // 计算等待时间
+      let delayMs;
+      if (status === 429 && err.headers?.["retry-after"]) {
+        // 尊重上游的 Retry-After
+        delayMs = parseInt(err.headers["retry-after"]) * 1000;
+      } else {
+        // 指数退避 + 随机抖动
+        delayMs = Math.min(
+          baseDelayMs * Math.pow(2, attempt) + Math.random() * 200,
+          maxDelayMs
+        );
+      }
+      logger.warn(`${label} retry`, {
+        requestId,
+        attempt: attempt + 1,
+        maxRetries,
+        delayMs,
+        error: err.message,
+        status
+      });
+      await sleep(delayMs);
+    }
+  }
+  throw lastError;
+}
+// ─────────────────────────────────────────────────────
+// 结构化输出解析失败时的重试：追加纠正指令
+// ─────────────────────────────────────────────────────
+export function buildJsonCorrectionMessages(originalMessages, failedContent, schema) {
+  const correctionPrompt = schema
+    ? `你上次的回复无法解析为合法 JSON。请严格按照以下 Schema 重新输出，只输出 JSON，不要任何解释：\n\`\`\`json\n${JSON.stringify(schema, null, 2)}\n\`\`\``
+    : `你上次的回复无法解析为合法 JSON。请重新输出，只输出 JSON 对象，不要任何解释文字或代码块包裹。`;
+  return [
+    ...originalMessages,
+    { role: "assistant", content: failedContent },
+    { role: "user", content: correctionPrompt }
+  ];
+}
+function sleep(ms) {
+  return new Promise(resolve => setTimeout(resolve, ms));
+}