@guandata/guanetl 0.1.19 → 0.1.21
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +14 -0
- package/README.md +22 -2
- package/bin/postinstall.js +58 -0
- package/bin/run.js +32 -1
- package/binaries/guanetl-darwin-arm64 +0 -0
- package/binaries/guanetl-darwin-x64 +0 -0
- package/binaries/guanetl-linux-arm64 +0 -0
- package/binaries/guanetl-linux-x64 +0 -0
- package/binaries/guanetl-win32-x64.exe +0 -0
- package/package.json +2 -1
- package/skills/guanetl/SKILL.md +15 -4
- package/skills/guanetl/references/ETL_AI_DEVELOP.md +12 -4
package/CHANGELOG.md
CHANGED
|
@@ -1,5 +1,19 @@
|
|
|
1
1
|
# Changelog
|
|
2
2
|
|
|
3
|
+
## @guandata/guanetl 0.1.21 - 2026-07-23
|
|
4
|
+
|
|
5
|
+
- JOIN 字段类型检查覆盖预览、保存和运行全过程,可提前发现字符串、数值、日期等类型不匹配风险。
|
|
6
|
+
- 增强字段别名、计算字段和多级上游 ETL 的识别,复杂 ETL 保存与运行前的诊断更准确。
|
|
7
|
+
- 优化多数据集结构读取效率,批量检查复杂 ETL 时等待更少。
|
|
8
|
+
|
|
9
|
+
## @guandata/guanetl 0.1.20 - 2026-07-20
|
|
10
|
+
|
|
11
|
+
- `save` 会按“同一输出目录 + 同名 + 唯一匹配”自动恢复已绑定输出的节点 id 和 dsId,避免 AI 重写输出节点 id 时误建新数据集并断开下游依赖。
|
|
12
|
+
- 移除或替换已绑定输出时默认阻止 `direct-save`;仅在显式使用 `--allow-output-replacement` 后放行,并提示调用方自行迁移下游 dsId 引用。
|
|
13
|
+
- `preview` 返回 0 行时不再误报“预览验证通过”,默认输出数据质量 warning;新增 `--require-nonempty`,供自动化流程在空结果时返回错误并阻止后续保存。
|
|
14
|
+
- 新建 ETL 首次 `save` 缺少服务端 edit 基线时改为输出带 `save.first_save_fallback` 标记的正常回退信息;其他 edit 读取失败继续以 `save.edit_fallback` warning 呈现。
|
|
15
|
+
- 全局安装或升级后自动刷新 AI Skill,并随包提供完整使用说明和参考资料。
|
|
16
|
+
|
|
3
17
|
## @guandata/guanetl 0.1.19 - 2026-07-08
|
|
4
18
|
|
|
5
19
|
- 新增 `move` 命令,支持将一个或多个智能 ETL 移动到指定 ETL 目录,并在接口异常时读回确认移动结果。
|
package/README.md
CHANGED
|
@@ -18,6 +18,7 @@ npm link
|
|
|
18
18
|
guanetl edit <etl_id> --dir <work_dir>
|
|
19
19
|
guanetl export --dir <work_dir>
|
|
20
20
|
guanetl preview <node_id> --dir <work_dir>
|
|
21
|
+
guanetl preview <node_id> --dir <work_dir> --require-nonempty
|
|
21
22
|
guanetl save --dir <work_dir>
|
|
22
23
|
```
|
|
23
24
|
|
|
@@ -25,14 +26,18 @@ guanetl save --dir <work_dir>
|
|
|
25
26
|
|
|
26
27
|
标准 ETL 写入闭环:`create/edit → export → preview → save → run --wait`。如果目标 ETL 依赖的智能 ETL 上游也需要刷新,可先用 `guanetl run <etl_id> --run-upstream --dry-run` 查看拓扑计划,再用 `guanetl run <etl_id> --run-upstream` 从最上游依次执行并等待完成。
|
|
27
28
|
|
|
28
|
-
|
|
29
|
+
`preview` 返回 0 行时默认输出 warning 并保持兼容的成功退出码;自动化发布或要求输出必须有数据时使用 `preview --require-nonempty`,并仅在命令成功后继续 `save`。
|
|
30
|
+
|
|
31
|
+
新建 ETL 首次 `save` 时若服务端尚无 edit 基线,CLI 会输出 `信息 [save.first_save_fallback]` 并使用本地 base,这是正常路径。`警告 [save.edit_fallback]` 则表示其他 edit 读取故障后发生了兼容回退,需要检查网络、权限和本地基线。
|
|
32
|
+
|
|
33
|
+
> **触发成功 ≠ ETL 执行成功**:`run` 返回"执行已触发"仅表示后端接受了请求。使用 `run --wait` 等待终态,FAILED 时会展示真实错误消息;如果同一 ETL 已被级联触发并正在运行,`run --wait` 会改为等待当前运行中的任务。触发前会检查直接上游数据集状态和服务端 JOIN 键类型;发现风险时先告警但继续执行,可分别用 `--skip-upstream-check`、`--skip-join-type-check` 跳过检查。
|
|
29
34
|
> `run --run-upstream` 会包含目标 ETL 本身,并对计划内每个 ETL 等待终态;任一上游执行失败时会停止后续节点。
|
|
30
35
|
|
|
31
36
|
新建 ETL 时注意目录树不同:`create --parent-dir` 使用 ETL 目录树 id,输出数据集目录使用 DATA_SET 目录树 id。可用 `guancli etl tree` / `guancli ds tree` 分别查询,或用 `guanetl mkdir-pair` 成对创建。`guancli workflow tree` 是工作流/经典数据流目录树,不能作为智能 ETL 的 `create --parent-dir`。
|
|
32
37
|
|
|
33
38
|
移动已有 ETL 使用 `guanetl move <etl_id> [etl_id...] --dir-id <etl_dir_id>`;目标目录同样来自 `guancli etl tree`,可先加 `--dry-run` 查看请求体。
|
|
34
39
|
|
|
35
|
-
`export`
|
|
40
|
+
`export` 成功后会自动输出本地静态检查提示;`preview` 和 `save` 也会在远端调用前重新检查 `_exported.json`。其中 `BasicCalculator` 的每个 `Formula` 都应显式填写 `Type`,否则可能导致下游原生 GroupBy/Join 节点出现静态类型警告。JOIN 键两侧类型不一致时会提示隐式 coercion 风险;STRING 与数值类型 JOIN 时,纯数字字符串可能匹配,`"001"` 可能折叠后匹配数值 `1`,非数字值可能无法匹配,超长 ID 可能丢失精度,业务标识键应统一为 STRING。warning 不阻断执行,确定性 lint error 会在 preview/save 的远端调用前阻断;`save --dry-run --format json` 的 warning 只写 stderr,不污染 JSON stdout。
|
|
36
41
|
|
|
37
42
|
也可以为 AI Coding Assistant 安装 Skill:
|
|
38
43
|
|
|
@@ -40,8 +45,23 @@ guanetl save --dir <work_dir>
|
|
|
40
45
|
guanetl install-skill
|
|
41
46
|
```
|
|
42
47
|
|
|
48
|
+
> `npm install -g` / `npm link` 全局安装时会通过 postinstall 自动执行一次 skill 安装/刷新;上述命令用于手动重装或排查。CI 等无需 skill 的环境可设 `GUAN_SKIP_INSTALL_SKILL=1` 跳过。
|
|
49
|
+
|
|
43
50
|
## 版本更新
|
|
44
51
|
|
|
52
|
+
### @guandata/guanetl 0.1.21
|
|
53
|
+
|
|
54
|
+
- JOIN 字段类型检查覆盖预览、保存和运行全过程,可提前发现字符串、数值、日期等类型不匹配风险。
|
|
55
|
+
- 增强字段别名、计算字段和多级上游 ETL 的识别,复杂 ETL 保存与运行前的诊断更准确。
|
|
56
|
+
- 优化多数据集结构读取效率,批量检查复杂 ETL 时等待更少。
|
|
57
|
+
|
|
58
|
+
### @guandata/guanetl 0.1.20
|
|
59
|
+
|
|
60
|
+
- `save` 会在同目录同名输出唯一匹配时自动恢复原输出节点 id 和 dsId,避免编辑已有 ETL 时误建新输出数据集。
|
|
61
|
+
- 替换或移除已绑定输出默认阻断;确需替换时显式使用 `--allow-output-replacement`,并自行迁移下游 dsId 引用。
|
|
62
|
+
- 预览结果为空时会明确提醒;自动化流程可要求必须返回数据后再继续保存。
|
|
63
|
+
- 全局安装或升级后自动刷新 AI Skill,并随包提供完整使用说明和参考资料。
|
|
64
|
+
|
|
45
65
|
### @guandata/guanetl 0.1.19
|
|
46
66
|
|
|
47
67
|
- 新增 `move` 命令,支持将一个或多个智能 ETL 移动到指定 ETL 目录,并在接口异常时读回确认移动结果。
|
|
@@ -0,0 +1,58 @@
|
|
|
1
|
+
#!/usr/bin/env node
|
|
2
|
+
|
|
3
|
+
/**
|
|
4
|
+
* Best-effort post-install hook: refresh the installed AI skill right after
|
|
5
|
+
* a global npm install/upgrade, so users cannot forget to run
|
|
6
|
+
* `guanetl install-skill` and end up with a stale SKILL.md.
|
|
7
|
+
*
|
|
8
|
+
* Constraints:
|
|
9
|
+
* - MUST never fail the npm install: every failure path still exits 0.
|
|
10
|
+
* - Only runs for global installs (`npm install -g` / `npm link`); a local
|
|
11
|
+
* `npm install` inside a project never touches the user's home dirs.
|
|
12
|
+
* - Escape hatch: GUAN_SKIP_INSTALL_SKILL=1 skips entirely (e.g. CI images
|
|
13
|
+
* that install the CLI but never run an AI agent are skipped by default).
|
|
14
|
+
*/
|
|
15
|
+
|
|
16
|
+
"use strict";
|
|
17
|
+
|
|
18
|
+
const { spawnSync } = require("child_process");
|
|
19
|
+
const path = require("path");
|
|
20
|
+
|
|
21
|
+
const CLI_NAME = "guanetl";
|
|
22
|
+
|
|
23
|
+
function skipReason() {
|
|
24
|
+
if (process.env.GUAN_SKIP_INSTALL_SKILL === "1") return "GUAN_SKIP_INSTALL_SKILL=1";
|
|
25
|
+
if (process.env.npm_config_global !== "true") return "not a global install";
|
|
26
|
+
if (process.env.CI) return "CI environment";
|
|
27
|
+
return "";
|
|
28
|
+
}
|
|
29
|
+
|
|
30
|
+
function main() {
|
|
31
|
+
const reason = skipReason();
|
|
32
|
+
if (reason) {
|
|
33
|
+
console.log(`[${CLI_NAME}] postinstall: skipping automatic install-skill (${reason}).`);
|
|
34
|
+
return;
|
|
35
|
+
}
|
|
36
|
+
console.log(`[${CLI_NAME}] postinstall: refreshing AI skill (${CLI_NAME} install-skill)...`);
|
|
37
|
+
const result = spawnSync(
|
|
38
|
+
process.execPath,
|
|
39
|
+
[path.join(__dirname, "run.js"), "install-skill"],
|
|
40
|
+
{ stdio: "inherit", env: process.env, timeout: 180000 }
|
|
41
|
+
);
|
|
42
|
+
if (result.error || result.status !== 0) {
|
|
43
|
+
console.warn(
|
|
44
|
+
`[${CLI_NAME}] postinstall: automatic skill install did not complete` +
|
|
45
|
+
(result.error ? ` (${result.error.message})` : ` (exit ${result.status})`) +
|
|
46
|
+
`; run \`${CLI_NAME} install-skill\` manually to refresh SKILL.md.`
|
|
47
|
+
);
|
|
48
|
+
}
|
|
49
|
+
}
|
|
50
|
+
|
|
51
|
+
try {
|
|
52
|
+
main();
|
|
53
|
+
} catch (err) {
|
|
54
|
+
console.warn(
|
|
55
|
+
`[${CLI_NAME}] postinstall: ${err.message}; run \`${CLI_NAME} install-skill\` manually.`
|
|
56
|
+
);
|
|
57
|
+
}
|
|
58
|
+
process.exit(0);
|
package/bin/run.js
CHANGED
|
@@ -86,10 +86,36 @@ if (process.argv[2] === "version" && process.argv.length === 3) {
|
|
|
86
86
|
process.exit(0);
|
|
87
87
|
}
|
|
88
88
|
|
|
89
|
+
|
|
90
|
+
// 定位 npm 自带的 npx-cli.js 并用 node 直接执行(与 guanskill 保持一致),
|
|
91
|
+
// 避免 Windows 上 spawn npx.cmd 的两类问题:shell:true 不做参数 quoting
|
|
92
|
+
// (全局安装路径含空格时会被拆参),以及新版 Node 禁止无 shell 的 .cmd
|
|
93
|
+
// spawn(CVE-2024-27980)。postinstall 场景下 npm_execpath 必然可用。
|
|
94
|
+
function resolveNpxInvocation() {
|
|
95
|
+
const executableDir = path.dirname(process.execPath);
|
|
96
|
+
const candidates = [];
|
|
97
|
+
if (process.env.npm_execpath) {
|
|
98
|
+
candidates.push(path.join(path.dirname(process.env.npm_execpath), "npx-cli.js"));
|
|
99
|
+
}
|
|
100
|
+
candidates.push(path.join(executableDir, "node_modules", "npm", "bin", "npx-cli.js"));
|
|
101
|
+
candidates.push(path.resolve(executableDir, "..", "node_modules", "npm", "bin", "npx-cli.js"));
|
|
102
|
+
candidates.push(path.resolve(executableDir, "..", "lib", "node_modules", "npm", "bin", "npx-cli.js"));
|
|
103
|
+
const npxCliPath = candidates.find((candidate) => fs.existsSync(candidate));
|
|
104
|
+
if (npxCliPath) {
|
|
105
|
+
return { command: process.execPath, argsPrefix: [npxCliPath] };
|
|
106
|
+
}
|
|
107
|
+
if (process.platform === "win32") {
|
|
108
|
+
throw new Error("Cannot locate npm/bin/npx-cli.js for safe Windows execution");
|
|
109
|
+
}
|
|
110
|
+
return { command: "npx", argsPrefix: [] };
|
|
111
|
+
}
|
|
112
|
+
|
|
89
113
|
if (process.argv[2] === "install-skill") {
|
|
90
114
|
const pkgRoot = path.join(__dirname, "..");
|
|
91
115
|
const extraArgs = process.argv.slice(3);
|
|
92
116
|
const args = [
|
|
117
|
+
// --yes: postinstall 等非交互环境下 npx 需要免确认下载 skills CLI
|
|
118
|
+
"--yes",
|
|
93
119
|
"skills",
|
|
94
120
|
"add",
|
|
95
121
|
pkgRoot,
|
|
@@ -100,7 +126,12 @@ if (process.argv[2] === "install-skill") {
|
|
|
100
126
|
...extraArgs,
|
|
101
127
|
];
|
|
102
128
|
console.log("Installing guanetl to AI coding assistants...");
|
|
103
|
-
const
|
|
129
|
+
const npxInvocation = resolveNpxInvocation();
|
|
130
|
+
const result = spawnSync(npxInvocation.command, [...npxInvocation.argsPrefix, ...args], {
|
|
131
|
+
stdio: "inherit",
|
|
132
|
+
env: process.env,
|
|
133
|
+
shell: false,
|
|
134
|
+
});
|
|
104
135
|
if (result.error) throw result.error;
|
|
105
136
|
const status = result.status || 0;
|
|
106
137
|
if (status === 0) installBuddySkills(pkgRoot, "guanetl");
|
|
Binary file
|
|
Binary file
|
|
Binary file
|
|
Binary file
|
|
Binary file
|
package/package.json
CHANGED
|
@@ -1,11 +1,12 @@
|
|
|
1
1
|
{
|
|
2
2
|
"name": "@guandata/guanetl",
|
|
3
|
-
"version": "0.1.
|
|
3
|
+
"version": "0.1.21",
|
|
4
4
|
"description": "观远 ETL 本地开发工具 - 拉取、编辑、导出、预览、保存 ETL",
|
|
5
5
|
"bin": {
|
|
6
6
|
"guanetl": "bin/run.js"
|
|
7
7
|
},
|
|
8
8
|
"scripts": {
|
|
9
|
+
"postinstall": "node bin/postinstall.js",
|
|
9
10
|
"build": "node scripts/build.js && node scripts/sync-skill.js",
|
|
10
11
|
"test:build-script": "node scripts/build.test.js",
|
|
11
12
|
"changelog": "node ../../scripts/generate-release-changelog.js .",
|
package/skills/guanetl/SKILL.md
CHANGED
|
@@ -132,7 +132,8 @@ guanetl edit <etl_id> --dir <work_dir>
|
|
|
132
132
|
|
|
133
133
|
```bash
|
|
134
134
|
guanetl export --dir <work_dir>
|
|
135
|
-
|
|
135
|
+
# 保存闭环默认要求预览至少返回 1 行;明确允许合法空结果时可省略 --require-nonempty
|
|
136
|
+
guanetl preview <node_id> --dir <work_dir> --require-nonempty
|
|
136
137
|
guanetl save --dir <work_dir> --dry-run
|
|
137
138
|
guanetl save --dir <work_dir>
|
|
138
139
|
guanetl run <etl_id> --wait # 可选:保存后触发执行并等待完成
|
|
@@ -140,13 +141,19 @@ guanetl run <etl_id> --wait # 可选:保存后触发执行并等待
|
|
|
140
141
|
|
|
141
142
|
**再次修改已 save 过的 ETL 时**:即使本地还保留着上次的工作目录,也必须重新执行 `guanetl edit <etl_id> --dir <新目录>` 拉取服务端最新版本,不要在旧工作目录上直接改了再 save。原因:服务端版本可能已经变化,直接复用旧 base 会导致合并冲突(如"输出数据集目录中存在同名文件")。
|
|
142
143
|
|
|
143
|
-
|
|
144
|
+
`save` 会协调已保存 ETL 的输出身份:当本地 `OUTPUT_DATASET` 节点 id 变化,但它与服务端已绑定输出在同一目录、同名且双方唯一时,CLI 会自动恢复原节点 id 和 dsId,继续原地更新已有输出数据集。该协调不会修改本地 `_exported.json`,保存影响报告会显示 `save.output_binding_reconciled`。
|
|
144
145
|
|
|
145
|
-
|
|
146
|
+
如果 `save` 在 direct-save 前提示输出数据集绑定风险,按提示处理,不要手动删除或重命名旧输出数据集。跨目录、重名歧义、删除旧输出或无法唯一匹配时,CLI 不会猜测并默认停止保存。修复优先级:重新 `edit` 到新目录、同步 `outputDsName`、确认输出目录;确实要替换已绑定输出时,设置新的节点 id、`outputDsName` 或 `parentDirId`,并显式加 `--allow-output-replacement`。该选项只放行保存,不会迁移任何下游 dsId 引用。
|
|
147
|
+
|
|
148
|
+
只追加输出列是安全例外:新增列、不改名、不删已有列、不改已有列类型,并保持输出名称和目录时,可以原地 `save`,保存前仍需 `preview` 目标输出确认结果。改列名、删列、改类型、换输入数据集或重接输出链路仍按下游 schema 风险处理;输出节点 id 变化仅在唯一匹配时自动协调。
|
|
146
149
|
|
|
147
150
|
保存前优先执行 `save --dry-run` 查看影响报告;`--format json` 可用于自动化检查。dry-run 不调用 direct-save,若报告出现阻断风险,先修 `etl/` 后重新 `export -> preview -> save --dry-run`。
|
|
148
151
|
如果报告出现“输出字段风险”,表示同一输出数据集中的同名字段发生类型或来源变化,服务端可能重建该列 fdId;保存前先用 `guands dataset cards <输出dsId>` 看下游卡片,保存执行后再按列名核对并重绑页面卡片 fdId。
|
|
149
152
|
|
|
153
|
+
`preview` 和 `save` 会在远端调用前重新检查本地 `_exported.json`。启发式 warning(包括 JOIN 键类型不一致)会提示风险但继续执行;确定性 lint error 会在创建预览任务或保存请求前阻断。`save --dry-run --format json` 的 warning 写入 stderr,stdout 仍只输出结构化 JSON。
|
|
154
|
+
|
|
155
|
+
不要把“JOIN 键类型不一致”直接判断为零匹配。STRING 与 LONG/DOUBLE 等数值类型 JOIN 时,Spark 可能做隐式数值 coercion:纯数字字符串可能匹配,`"001"` 可能折叠后匹配数值 `1`,非数字值可能无法匹配,超长 ID 可能丢失精度。业务标识键应在 JOIN 前显式统一为 STRING。
|
|
156
|
+
|
|
150
157
|
### 新建 ETL
|
|
151
158
|
|
|
152
159
|
1. 先用 `guancli` 查输入数据集和字段。
|
|
@@ -199,6 +206,8 @@ guanetl move <etl_id1> <etl_id2> --dir-id <etl_dir_id>
|
|
|
199
206
|
|
|
200
207
|
`save --dry-run` 只执行到合并和保存影响检查,不执行第 4 步。
|
|
201
208
|
|
|
209
|
+
新建 ETL 首次保存前,服务端可能还没有可供 edit API 读取的完整基线。此时 `save` 会使用 `create` 生成的本地 `_base_etl.json`,并输出 `信息 [save.first_save_fallback]`;这是正常的首次保存路径,不代表 create 或 save 失败。其他服务端 edit 读取失败会输出 `警告 [save.edit_fallback]`,表示虽然已回退本地 base,但仍需确认网络、权限及本地基线是否可靠。
|
|
210
|
+
|
|
202
211
|
用户不需要手写服务端保存 payload。只要 `etl/` 修改正确、`export` 通过,`save` 就能完成服务端保存。
|
|
203
212
|
|
|
204
213
|
### run --wait、run --run-upstream 与任务状态
|
|
@@ -210,6 +219,7 @@ guanetl move <etl_id1> <etl_id2> --dir-id <etl_dir_id>
|
|
|
210
219
|
- 需要递归刷新智能 ETL 上游链路时,用 `run <etl_id> --run-upstream`。CLI 会读取目标 ETL 的输入数据集,按数据集的生产 ETL 继续向上解析,生成拓扑顺序后从最上游依次执行,包含目标 ETL;每个 ETL 都会等待终态,任一失败即停止并报告失败节点。
|
|
211
220
|
- 不确定上游范围时,先用 `run <etl_id> --run-upstream --dry-run` 输出执行计划;dry-run 只读拓扑,不触发任何 ETL。
|
|
212
221
|
- 触发前,`run` 会检查直接上游数据集状态;若发现上游处于 `FAILED`/`失败` 态,会先输出警告但继续触发执行。确认不需要检查时可加 `--skip-upstream-check`。
|
|
222
|
+
- `run <etl_id>` 还会读取服务端 edit 结构,按 JOIN 键类型组合提示隐式 coercion、精度或日期时间风险;`--run-upstream` 会在每个计划节点执行前做同样检查,检查失败不阻断执行。`preview` / `save` 会阻断明确不可用于行级 JOIN 的 aggregation/window 字段,并按服务端字段身份解析 JOIN predicate alias。批量自动化确认不需要运行前检查时可加 `--skip-join-type-check`。
|
|
213
223
|
- 如果不加 `--wait` 后想查状态:`task status <taskId>` 或 `task wait <taskId>`。
|
|
214
224
|
|
|
215
225
|
### 排查执行失败
|
|
@@ -236,7 +246,7 @@ guancli task detail <taskId>
|
|
|
236
246
|
|
|
237
247
|
### preview 返回 0 行
|
|
238
248
|
|
|
239
|
-
preview 成功但行数为 0
|
|
249
|
+
preview 成功但行数为 0 是合法结果,**不一定代表有错误**。CLI 默认返回成功但会输出 warning,且不会再宣称“预览验证通过”。自动化发布或确认输出必须有数据时使用 `preview --require-nonempty`;零行将返回非零退出码,应停止后续 `save`。排查顺序:
|
|
240
250
|
1. 确认输入数据集本身有数据(用 `guancli ds preview <dsId> --limit 5`)
|
|
241
251
|
2. 如果节点有 FILTER_ROWS 或 WHERE 条件,临时简化筛选条件再 preview
|
|
242
252
|
|
|
@@ -308,6 +318,7 @@ guanetl task cancel <t1> <t2> # 批量取消多个任务
|
|
|
308
318
|
|
|
309
319
|
## 硬约束
|
|
310
320
|
|
|
321
|
+
- **编辑 ≠ 删除重建**:编辑已有 ETL 永远走 `edit → export → preview → save` 原地保存闭环,保留原 etlId/dataFlowId 和输出数据集 dsId。guanetl 没有提供 ETL 重命名和删除命令:用户要求给 ETL 改名或删除 ETL 时,直接说明 CLI 暂不支持;**禁止**用"新建一个 ETL 替代旧 ETL"来模拟编辑或改名——新 ETL 会创建新的输出数据集(dsId 变化),下游卡片、指标、其他 ETL 的输入引用全部断链,旧 ETL 的调度配置、权限和运行历史也不会迁移。只有用户明确指示"新建替代、再废弃旧的"时才允许,且执行前必须列出上述影响并获得确认。
|
|
311
322
|
- 不要改 `DefineETL()` 函数签名。
|
|
312
323
|
- 节点 ID 必须唯一,且是 `id_数字`。
|
|
313
324
|
- 节点顺序必须满足依赖顺序。
|
|
@@ -104,6 +104,9 @@ calc := BasicCalculator("id_1002", "解析展示格式度量", inputA, []Formula
|
|
|
104
104
|
- 新版 ETL 默认使用输入字段别名:如果数据集字段有 `alias`,进入 ETL 算子后的列名通常是 `alias`;没有 `alias` 时才是原始 `name`。
|
|
105
105
|
- 输入字段别名的事实源是数据集字段元数据;可用 `guands dataset fields <dsId>` 回读,用 `guands dataset alias <dsId> --fd-id <fdId> --alias "展示名"` 更新。`BasicInputDataset(..., []Field{...})` 中的字段 schema 主要用于导入/导出和本地 lint,不会把一个未设置过数据集 alias 的字段强制变成展示名列。
|
|
106
106
|
- 本地校验按 `alias -> displayName/showName/title -> name` 解析有效字段名;同一来源下两个字段解析成相同有效名会被视为歧义,建模前应先改名或明确上游输出。
|
|
107
|
+
- 不要把 JOIN 键类型不一致直接断言为零匹配。STRING 与 LONG/DOUBLE 等数值类型 JOIN 时,Spark 可能做隐式数值 coercion:纯数字字符串可能匹配,`"001"` 可能折叠后匹配数值 `1`,非数字值可能无法匹配,超长 ID 可能丢失精度。业务标识键应在 JOIN 前显式统一为 STRING,并用 preview 验证真实匹配率。
|
|
108
|
+
- `preview` / `save` 会从数据集元数据补齐 `fdId -> alias` 的运行时映射,并把 JOIN predicate 中的输入 alias 归一化为 raw name;本地 `BasicInputDataset` 声明与服务端不一致时,以服务端字段身份为准,且不会修改工作区中的原始 `_exported.json`。当前服务端仍不支持把“设置过 alias 的数据集计算字段”直接选作 JOIN 输出列,应输出其原始依赖列或先在 ETL 中生成普通列。
|
|
109
|
+
- aggregation/window 计算字段不是行级字段,不能直接作为 JOIN 键;请先在 ETL 中生成普通计算列。`preview` / `save` 会在提交远端请求前拦截该用法。
|
|
107
110
|
- SQL 节点使用上游表 `input1`、`input2` 的当前列名。字段有中文展示名时,SQL 里应写展示名并用反引号,例如 ``SELECT `门店ID` FROM input1``。
|
|
108
111
|
- `SELECT_COLUMNS`、`FILTER_ROWS`、`REMOVE_DUPLICATES`、`GROUP_BY` 等直接列名算子,也以当前上游列名为准。
|
|
109
112
|
- 底层数据集读取和数据集元数据仍保留原始 `name`,所以 `guancli` / `guands` 输出字段时要同时关注 `name` 和 `alias`。
|
|
@@ -339,7 +342,7 @@ func DefineETL() []Node {
|
|
|
339
342
|
始终按这个顺序:
|
|
340
343
|
|
|
341
344
|
1. `guanetl export --dir <work_dir>`
|
|
342
|
-
2. 需要看结果时:`guanetl preview <node_id> --dir <work_dir
|
|
345
|
+
2. 需要看结果时:`guanetl preview <node_id> --dir <work_dir>`;保存前要求非空时追加 `--require-nonempty`,零行会返回错误并阻止命令链继续执行
|
|
343
346
|
3. 保存前先看影响:`guanetl save --dir <work_dir> --dry-run`
|
|
344
347
|
4. 确认无误后:`guanetl save --dir <work_dir>`
|
|
345
348
|
|
|
@@ -347,16 +350,21 @@ func DefineETL() []Node {
|
|
|
347
350
|
|
|
348
351
|
## save 输出数据集冲突
|
|
349
352
|
|
|
350
|
-
`save` 会先拉取服务端当前 ETL,再把本地 `_exported.json` 合并进去。修改已保存 ETL
|
|
353
|
+
`save` 会先拉取服务端当前 ETL,再把本地 `_exported.json` 合并进去。修改已保存 ETL 时,输出节点必须复用服务端已有输出数据集绑定,否则 direct-save 可能把它当成“创建新输出数据集”,触发“输出数据集目录中存在同名文件”。
|
|
354
|
+
|
|
355
|
+
新建 ETL 首次保存时,服务端 edit API 可能返回 ETL 不存在。若当前本地 base 与工作区 ETL ID 一致且尚无 actions,CLI 会将其识别为正常首次保存回退并输出 `save.first_save_fallback`;其他 edit 故障使用 `save.edit_fallback` warning,不应静默当作首次保存。
|
|
356
|
+
|
|
357
|
+
当本地输出节点 id 被重新生成,但 `outputDsName + parentDirId` 与一个服务端已绑定输出唯一匹配时,`save` 会在请求副本中自动恢复原节点 id 和 dsId,并在影响报告中输出 `save.output_binding_reconciled`。源 `_exported.json` 不会被改写。跨目录、双方重名歧义、删除旧输出或无法唯一匹配时不会自动协调。
|
|
351
358
|
|
|
352
359
|
- 再次修改已保存 ETL,优先重新执行 `guanetl edit <etl_id> --dir <新目录>`,不要长期复用旧工作目录。
|
|
353
360
|
- 只追加输出列时,可以原地 `save`:新增列,不改名、不删已有列、不改已有列类型,并保持原 `OUTPUT_DATASET` 节点 id 和 `outputDsName`。
|
|
354
361
|
- 修改已有输出 schema 时,保持原 `OUTPUT_DATASET` 节点 id;改列名、删列、改已有列类型、换输入数据集或重接输出链路都可能影响下游绑定,保存前必须重新 `preview` 并评估下游。
|
|
355
362
|
- 如果用 `guands dataset rename` 改过 ETL 输出数据集名称,必须同步 `etl.go` 中 `BasicOutputDataset(..., outputDsName, ...)` 或 `BasicOutputDatasetInDir(..., outputDsName, ...)` 的名称。
|
|
356
363
|
- 不要为了绕过同名错误手动删除旧输出数据集;旧输出通常仍被 ETL 依赖。
|
|
357
|
-
-
|
|
364
|
+
- 如果只是在保留旧输出的同时增加新输出,使用新的节点 id 和不同的 `outputDsName` 或 `parentDirId` 即可。
|
|
365
|
+
- 如果确实要移除已绑定输出并创建新输出数据集,必须使用新的节点 id、`outputDsName` 或 `parentDirId`,并显式加 `--allow-output-replacement`。该选项不会迁移下游 dsId 引用,调用方必须自行完成依赖迁移。
|
|
358
366
|
- `save` 如果在 direct-save 前提示输出绑定风险,先修本地 `etl.go` / `meta.json`,再重新 `export -> preview -> save`。
|
|
359
|
-
- `save --dry-run` 只生成保存影响报告,不调用 direct-save;需要机器可读结果时加 `--format json
|
|
367
|
+
- `save --dry-run` 只生成保存影响报告,不调用 direct-save;需要机器可读结果时加 `--format json`。报告里出现阻断级输出绑定风险时,必须先修本地定义,或在确认主动替换且已规划下游迁移后显式使用 `--allow-output-replacement`。
|
|
360
368
|
|
|
361
369
|
## Appendix: Framework Surface
|
|
362
370
|
|