@pippit-dev/cli 1.0.12 → 1.0.14
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +11 -2
- package/checksums.txt +6 -6
- package/cmd/generate_image/generate_image.go +2 -0
- package/cmd/generate_image_test.go +7 -3
- package/cmd/generate_video_test.go +1 -1
- package/internal/generate_image/generate_image.go +3 -0
- package/internal/generate_image/generate_image_test.go +19 -3
- package/package.json +1 -1
- package/skills/short-drama/SKILL.md +8 -0
- package/skills/xyq-nest-skill/SKILL.md +113 -15
package/README.md
CHANGED
|
@@ -9,11 +9,19 @@
|
|
|
9
9
|
| 技能 | 说明 | 路径 |
|
|
10
10
|
|-------|-------------|------|
|
|
11
11
|
| `xyq-short-drama-skill` | 短剧工作流技能,支持提交创作任务、上传参考文件、查询进度、列出会话文件和下载产物。 | `skills/short-drama/` |
|
|
12
|
-
| `xyq-skill` |
|
|
12
|
+
| `xyq-skill` | 通用创作技能,支持 NestAgent 图片/视频生成与编辑,并在视频模型直出时调用 `pippit-tool-cli generate-video`。 | `skills/xyq-nest-skill/` |
|
|
13
|
+
|
|
14
|
+
### 技能路由
|
|
15
|
+
|
|
16
|
+
- 通用图片/视频生成、编辑和复杂参考素材编排使用 `xyq-skill`。
|
|
17
|
+
- 用户明确要求视频模型直出、指定视频模型或直接调用 CLI 时,由 `xyq-skill` 调用 `pippit-tool-cli generate-video`,再用 `query-result` 查询和下载结果。
|
|
18
|
+
- 短剧生成、续写、改写、人物设定、分集创作和短剧会话文件处理使用 `xyq-short-drama-skill`,不要与通用创作流程混用。
|
|
19
|
+
|
|
20
|
+
两份技能需要用户补充、选择或确认时,优先调用宿主的结构化提问工具:Codex 使用 `request_user_input`,WorkBuddy 使用 `ask_user_question`,Trae 和其他宿主使用实际暴露的同类工具;没有同类工具时退回普通聊天提问。
|
|
13
21
|
|
|
14
22
|
## 通用 NestAgent 技能
|
|
15
23
|
|
|
16
|
-
`xyq-skill` 通过接入小云雀 NestAgent 的综合创作能力,实现 AI 图片/视频生成、编辑、风格转换、图片/视频/mp3或wav
|
|
24
|
+
`xyq-skill` 通过接入小云雀 NestAgent 的综合创作能力,实现 AI 图片/视频生成、编辑、风格转换、图片/视频/mp3或wav音频文件上传、进度查询和结果下载;视频模型直出请求直接使用 `pippit-tool-cli generate-video`。
|
|
17
25
|
|
|
18
26
|
### 功能特性
|
|
19
27
|
|
|
@@ -23,6 +31,7 @@
|
|
|
23
31
|
| 查询会话进展 | 增量拉取会话消息,轮询创作进度和产物结果。 |
|
|
24
32
|
| 上传文件 | 上传图片/视频/mp3或wav音频到小云雀资产库,获取 `asset_id` 用于编辑和参考。 |
|
|
25
33
|
| 下载结果 | 批量下载生成的图片/视频到本地,支持并行下载。 |
|
|
34
|
+
| 视频模型直出 | 调用 `generate-video` 提交请求,展示 `web_thread_link`,再用 `query-result` 查询并下载视频。 |
|
|
26
35
|
|
|
27
36
|
小云雀平台能力覆盖:
|
|
28
37
|
|
package/checksums.txt
CHANGED
|
@@ -1,6 +1,6 @@
|
|
|
1
|
-
|
|
2
|
-
|
|
3
|
-
|
|
4
|
-
|
|
5
|
-
|
|
6
|
-
|
|
1
|
+
7e8b88e21ebfd05357f0183c408bfbacaf6c583398e9ab8f3edd24063be911b1 pippit-tool-cli-1.0.14-darwin-amd64.tar.gz
|
|
2
|
+
e514b59bb83b59130deb9cec6cb0f114fd11fe47921d7a65e2f697ad5d528e07 pippit-tool-cli-1.0.14-darwin-arm64.tar.gz
|
|
3
|
+
436efcab90026d8e0d3e593943d8cbd473a5219017685c1099f09992a7034d4b pippit-tool-cli-1.0.14-linux-amd64.tar.gz
|
|
4
|
+
d4a7916d18a16b7b179db6251931796440e236a6d8d841e385bf02e4de9bca29 pippit-tool-cli-1.0.14-linux-arm64.tar.gz
|
|
5
|
+
9688067ffd270653e81570ff2cd395e51d92f82248573c3682a3d7c3fd6cbb89 pippit-tool-cli-1.0.14-windows-amd64.zip
|
|
6
|
+
98d211cd42c0d1a7b526f9a0cca7456d0e9acbf56a0f4da4c7dc1b2d25d457ff pippit-tool-cli-1.0.14-windows-arm64.zip
|
|
@@ -33,6 +33,7 @@ func NewCommand(stdout, stderr io.Writer, runner *common.Runner) *cobra.Command
|
|
|
33
33
|
"image": strings.Join(opts.ImagePaths, ","),
|
|
34
34
|
"model": strings.TrimSpace(opts.Model),
|
|
35
35
|
"ratio": strings.TrimSpace(opts.Ratio),
|
|
36
|
+
"resolution": strings.ToUpper(strings.TrimSpace(opts.Resolution)),
|
|
36
37
|
"generate_image_count": optionalIntString(opts.GenerateImageCount),
|
|
37
38
|
})
|
|
38
39
|
return err
|
|
@@ -47,6 +48,7 @@ func NewCommand(stdout, stderr io.Writer, runner *common.Runner) *cobra.Command
|
|
|
47
48
|
flags.StringArrayVar(&opts.ImagePaths, "image", nil, "local reference image path; repeat for multiple images")
|
|
48
49
|
flags.StringVar(&opts.Model, "model", "", "image model; supported: seedream_5.0_pro, seedream_5.0, seedream_4.3, nova2, seedream_4.5, seedream_4.1, seedream_4")
|
|
49
50
|
flags.StringVar(&opts.Ratio, "ratio", "", "image ratio; "+internalgen.SupportedRatioUsage())
|
|
51
|
+
flags.StringVar(&opts.Resolution, "resolution", "", "image resolution; only seedream_5.0_pro supports these options: 1K, 2K, 4K")
|
|
50
52
|
flags.IntVar(&generateImageCount, "generate-image-count", 0, "generated image count")
|
|
51
53
|
return cmd
|
|
52
54
|
}
|
|
@@ -66,12 +66,15 @@ func TestGenerateImage(t *testing.T) {
|
|
|
66
66
|
if !ok {
|
|
67
67
|
t.Fatalf("general_agent_settings = %#v, want object", body["general_agent_settings"])
|
|
68
68
|
}
|
|
69
|
-
if settings["image_model"] != "
|
|
70
|
-
t.Fatalf("image_model = %v, want
|
|
69
|
+
if settings["image_model"] != "seedream_5.0_pro" {
|
|
70
|
+
t.Fatalf("image_model = %v, want seedream_5.0_pro", settings["image_model"])
|
|
71
71
|
}
|
|
72
72
|
if settings["ratio"] != float64(6) {
|
|
73
73
|
t.Fatalf("ratio = %v, want 6", settings["ratio"])
|
|
74
74
|
}
|
|
75
|
+
if settings["resolution"] != "4K" {
|
|
76
|
+
t.Fatalf("resolution = %v, want 4K", settings["resolution"])
|
|
77
|
+
}
|
|
75
78
|
if settings["generate_image_count"] != float64(2) {
|
|
76
79
|
t.Fatalf("generate_image_count = %v, want 2", settings["generate_image_count"])
|
|
77
80
|
}
|
|
@@ -97,8 +100,9 @@ func TestGenerateImage(t *testing.T) {
|
|
|
97
100
|
"generate-image",
|
|
98
101
|
"--prompt", "生成小猫海报",
|
|
99
102
|
"--image", image,
|
|
100
|
-
"--model", "
|
|
103
|
+
"--model", "seedream_5.0_pro",
|
|
101
104
|
"--ratio", "6",
|
|
105
|
+
"--resolution", "4K",
|
|
102
106
|
"--generate-image-count", "2",
|
|
103
107
|
})
|
|
104
108
|
|
|
@@ -446,7 +446,7 @@ func TestQueryResultIgnoresVideoDataWithoutVideoSubType(t *testing.T) {
|
|
|
446
446
|
if got["thread_id"] != "thread_123" || got["run_id"] != "run_456" {
|
|
447
447
|
t.Fatalf("ids = (%v, %v), want thread/run ids", got["thread_id"], got["run_id"])
|
|
448
448
|
}
|
|
449
|
-
if got["error_message"] != "
|
|
449
|
+
if got["error_message"] != "下载失败:未找到可下载的产物" {
|
|
450
450
|
t.Fatalf("error_message = %v, want no downloadable video error", got["error_message"])
|
|
451
451
|
}
|
|
452
452
|
videos, ok := got["videos"].([]any)
|
|
@@ -27,12 +27,14 @@ type Options struct {
|
|
|
27
27
|
ImagePaths []string
|
|
28
28
|
Model string
|
|
29
29
|
Ratio string
|
|
30
|
+
Resolution string
|
|
30
31
|
GenerateImageCount *int
|
|
31
32
|
}
|
|
32
33
|
|
|
33
34
|
type generalAgentSettings struct {
|
|
34
35
|
ImageModel string `json:"image_model"`
|
|
35
36
|
Ratio *int `json:"ratio,omitempty"`
|
|
37
|
+
Resolution string `json:"resolution,omitempty"`
|
|
36
38
|
GenerateImageCount *int `json:"generate_image_count,omitempty"`
|
|
37
39
|
}
|
|
38
40
|
|
|
@@ -142,6 +144,7 @@ func buildSubmitRunBody(opts *Options, imageAssetIDs []string) map[string]any {
|
|
|
142
144
|
"general_agent_settings": generalAgentSettings{
|
|
143
145
|
ImageModel: strings.TrimSpace(opts.Model),
|
|
144
146
|
Ratio: ratio,
|
|
147
|
+
Resolution: strings.ToUpper(strings.TrimSpace(opts.Resolution)),
|
|
145
148
|
GenerateImageCount: opts.GenerateImageCount,
|
|
146
149
|
},
|
|
147
150
|
}
|
|
@@ -42,6 +42,18 @@ func TestValidateOptionsAllowsServerDecidedRatio(t *testing.T) {
|
|
|
42
42
|
}
|
|
43
43
|
}
|
|
44
44
|
|
|
45
|
+
func TestValidateOptionsAllowsServerDecidedResolution(t *testing.T) {
|
|
46
|
+
opts := &Options{
|
|
47
|
+
Prompt: "x",
|
|
48
|
+
Model: "seedream_4.5",
|
|
49
|
+
Resolution: "8K",
|
|
50
|
+
}
|
|
51
|
+
|
|
52
|
+
if err := ValidateOptions(opts); err != nil {
|
|
53
|
+
t.Fatalf("ValidateOptions() error = %v, want nil", err)
|
|
54
|
+
}
|
|
55
|
+
}
|
|
56
|
+
|
|
45
57
|
func TestValidateOptionsRejectsNegativeGenerateImageCount(t *testing.T) {
|
|
46
58
|
count := -1
|
|
47
59
|
opts := &Options{
|
|
@@ -116,8 +128,9 @@ func TestBuildSubmitRunBodyWithGeneralAgentSettings(t *testing.T) {
|
|
|
116
128
|
count := 2
|
|
117
129
|
opts := &Options{
|
|
118
130
|
Prompt: " 生成小猫海报 ",
|
|
119
|
-
Model: "
|
|
131
|
+
Model: " seedream_5.0_pro ",
|
|
120
132
|
Ratio: "6",
|
|
133
|
+
Resolution: " 4k ",
|
|
121
134
|
GenerateImageCount: &count,
|
|
122
135
|
}
|
|
123
136
|
|
|
@@ -132,12 +145,15 @@ func TestBuildSubmitRunBodyWithGeneralAgentSettings(t *testing.T) {
|
|
|
132
145
|
if !ok {
|
|
133
146
|
t.Fatalf("general_agent_settings = %#v, want object", body["general_agent_settings"])
|
|
134
147
|
}
|
|
135
|
-
if settings.ImageModel != "
|
|
136
|
-
t.Fatalf("image_model = %q, want
|
|
148
|
+
if settings.ImageModel != "seedream_5.0_pro" {
|
|
149
|
+
t.Fatalf("image_model = %q, want seedream_5.0_pro", settings.ImageModel)
|
|
137
150
|
}
|
|
138
151
|
if settings.Ratio == nil || *settings.Ratio != 6 {
|
|
139
152
|
t.Fatalf("ratio = %#v, want 6", settings.Ratio)
|
|
140
153
|
}
|
|
154
|
+
if settings.Resolution != "4K" {
|
|
155
|
+
t.Fatalf("resolution = %q, want 4K", settings.Resolution)
|
|
156
|
+
}
|
|
141
157
|
if settings.GenerateImageCount == nil || *settings.GenerateImageCount != 2 {
|
|
142
158
|
t.Fatalf("generate_image_count = %#v, want 2", settings.GenerateImageCount)
|
|
143
159
|
}
|
package/package.json
CHANGED
|
@@ -63,6 +63,12 @@ metadata:
|
|
|
63
63
|
|
|
64
64
|
当后端 Agent 通过 `readable_text` 要求用户补充信息、选择选项、确认流程或确认创意内容时,优先使用当前宿主提供的 ask-question / confirmation / form 类工具向用户提问,而不是只在普通聊天里输出问题。
|
|
65
65
|
|
|
66
|
+
按宿主选择准确工具:
|
|
67
|
+
|
|
68
|
+
- **Codex**:优先调用 `request_user_input`。仅在工具已暴露且当前模式允许时调用;不可用时退回普通聊天提问。不要在 Codex 中调用 `ask_user_question`。
|
|
69
|
+
- **WorkBuddy**:优先调用 `ask_user_question`(Ask User Question);工具未暴露时才退回普通聊天提问。
|
|
70
|
+
- **Trae 及其他宿主**:先查看当前宿主实际暴露的工具,再使用同类结构化提问、确认或表单工具;不要臆造具体工具名。没有同类工具时退回普通聊天提问。
|
|
71
|
+
|
|
66
72
|
使用宿主提问工具前,先按“表单与问卷选项处理原则”清洗问题和选项:
|
|
67
73
|
|
|
68
74
|
- 只把当前阶段合理、必要、可执行的选项放进提问工具。
|
|
@@ -70,6 +76,8 @@ metadata:
|
|
|
70
76
|
- 对普通开放问题,用单个清晰问题询问用户;对明确互斥选项,用宿主支持的选择控件。
|
|
71
77
|
- 如果当前宿主没有暴露可调用的 ask-question / confirmation / form 工具,才退回普通聊天提问,并说明需要用户回复后才能继续。
|
|
72
78
|
|
|
79
|
+
真实提交将进入消耗 credits 的图片生成、视频生成或编辑阶段时,如果用户本轮尚未明确确认执行,必须使用上述工具征得明确确认。不要设置默认同意、自动选择或超时后继续;纯文本规划和查询进展不需要额外确认。
|
|
80
|
+
|
|
73
81
|
## 前置要求
|
|
74
82
|
|
|
75
83
|
需要已安装 `pippit-tool-cli`:
|
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
---
|
|
2
2
|
name: xyq-skill
|
|
3
|
-
description: 通过小云雀的 AI
|
|
3
|
+
description: 通过小云雀的 AI 能力进行综合创作,支持生成和编辑图片/视频,并在用户明确要求图片或视频模型直出、指定图片或视频模型或直接调用 CLI 时使用 pippit-tool-cli generate-image / generate-video。覆盖文生图、文生视频、图生视频、视频编辑、风格转换、视频续写、视频复刻、TVC、宣传片、音乐 MV、产品广告、分镜和教育短视频等场景。当用户提到小云雀、xyq、上传参考图/视频/mp3或wav音频、查看生成进度时也应触发。短剧生成、续写、改写、人物设定和分集创作应使用 xyq-short-drama-skill,不在本技能中执行。
|
|
4
4
|
user-invocable: true
|
|
5
5
|
metadata:
|
|
6
6
|
{
|
|
@@ -17,7 +17,7 @@ metadata:
|
|
|
17
17
|
}
|
|
18
18
|
---
|
|
19
19
|
|
|
20
|
-
#
|
|
20
|
+
# 小云雀创作与图片/视频模型直出
|
|
21
21
|
|
|
22
22
|
通过 小云雀的API 创建会话、发送消息(生图、生视频、编辑视频等)、上传图片/视频/mp3或wav音频文件,并查询会话消息进展。
|
|
23
23
|
|
|
@@ -26,9 +26,93 @@ metadata:
|
|
|
26
26
|
**平台核心能力:**
|
|
27
27
|
- **生成**:文生图、文生视频、图生视频、视频续写
|
|
28
28
|
- **编辑**:局部修改、元素替换、镜头调整、风格迁移
|
|
29
|
-
-
|
|
29
|
+
- **复杂创作**:复刻已有视频风格做 TVC/宣传片、用音乐生成 MV、产品展示片制作
|
|
30
30
|
|
|
31
|
-
|
|
31
|
+
除“图片/视频模型直出”外,创作和编辑需求通过发送自然语言消息来完成,后端 Agent 会自主编排工作流。复杂任务耗时较长,需耐心轮询。
|
|
32
|
+
|
|
33
|
+
## 执行路由(必须先判断)
|
|
34
|
+
|
|
35
|
+
### 路由 A:图片模型直出
|
|
36
|
+
|
|
37
|
+
满足任一条件时,必须直接使用 `pippit-tool-cli generate-image`,不要改走 `submit_run.py`:
|
|
38
|
+
|
|
39
|
+
- 用户明确说“图片模型直出”、“直接调图片模型”或明确要求用 CLI 生图。
|
|
40
|
+
- 用户指定了具体图片模型(如 `seedream_5.0_pro`),并希望单次直接生成图片。
|
|
41
|
+
- 上游流程已明确将任务标记为图片 direct-model / 模型直出。
|
|
42
|
+
|
|
43
|
+
执行原则:
|
|
44
|
+
|
|
45
|
+
1. 执行前用 `command -v pippit-tool-cli` 确认 CLI 可用;不可用时报告阻塞,不要悄悄降级到会话 API。
|
|
46
|
+
2. 真实提交会消耗 credits;如果用户本轮尚未明确确认生成,按“用户确认与反问”规则征得明确确认后再运行。
|
|
47
|
+
3. 保留用户原始 prompt,不要自行扩写、润色、翻译或增加风格词。
|
|
48
|
+
4. `--model` 必填;用户未提供图片模型时,先询问使用哪个模型。只添加用户已经给出的 `--ratio`、`--resolution`、`--generate-image-count`、`--image` 参数,不补默认值。
|
|
49
|
+
5. `--resolution` 的使用说明是:仅 `seedream_5.0_pro` 支持 `1K`、`2K`、`4K`。不要在 skill 侧维护额外 allowlist 或自行改写用户值,实际合法性由服务端决定。
|
|
50
|
+
6. `generate-image` 返回后,保存 `thread_id`、`run_id`,并立即向用户展示 `web_thread_link`。
|
|
51
|
+
7. 每隔 10 秒调用 `query-result`,直到 `completed=true`。出现 `error_message` 时停止并报告;成功时展示并下载 `images[].output_path`。
|
|
52
|
+
|
|
53
|
+
```bash
|
|
54
|
+
pippit-tool-cli generate-image \
|
|
55
|
+
--prompt "用户原始描述" \
|
|
56
|
+
--model IMAGE_MODEL
|
|
57
|
+
--ratio RATIO
|
|
58
|
+
--resolution RESOLUTION
|
|
59
|
+
--generate-image-count COUNT
|
|
60
|
+
--image 参考图路径
|
|
61
|
+
|
|
62
|
+
pippit-tool-cli query-result \
|
|
63
|
+
--thread-id THREAD_ID \
|
|
64
|
+
--run-id RUN_ID \
|
|
65
|
+
--download-dir OUTPUT_DIR
|
|
66
|
+
```
|
|
67
|
+
|
|
68
|
+
### 路由 B:视频模型直出
|
|
69
|
+
|
|
70
|
+
满足任一条件时,必须直接使用 `pippit-tool-cli generate-video`,不要改走 `submit_run.py`:
|
|
71
|
+
|
|
72
|
+
- 用户明确说“视频模型直出”、“直接调模型”或“直接调用 CLI”。
|
|
73
|
+
- 用户指定了具体视频模型(如 Seedance),并希望单次直接生成视频。
|
|
74
|
+
- 上游流程已明确将任务标记为 direct-model / 模型直出。
|
|
75
|
+
|
|
76
|
+
执行原则:
|
|
77
|
+
|
|
78
|
+
1. 执行前用 `command -v pippit-tool-cli` 确认 CLI 可用;不可用时报告阻塞,不要悄悄降级到会话 API。
|
|
79
|
+
2. 真实提交会消耗 credits;如果用户本轮尚未明确确认生成,按“用户确认与反问”规则征得明确确认后再运行。
|
|
80
|
+
3. 保留用户原始 prompt,不要自行扩写、润色、翻译或增加风格词。
|
|
81
|
+
4. 只添加用户已经给出的 `--model`、`--duration`、`--ratio`、`--resolution`、`--image`、`--video`、`--audio` 参数;未给参数交给 CLI 默认值。
|
|
82
|
+
5. `generate-video` 返回后,保存 `thread_id`、`run_id`,并立即向用户展示 `web_thread_link`。
|
|
83
|
+
6. 每隔 10 秒调用 `query-result`,直到 `completed=true`。出现 `error_message` 时停止并报告;成功时展示并下载 `videos[].output_path`。
|
|
84
|
+
|
|
85
|
+
```bash
|
|
86
|
+
pippit-tool-cli generate-video --prompt "用户原始描述"
|
|
87
|
+
|
|
88
|
+
pippit-tool-cli query-result \
|
|
89
|
+
--thread-id THREAD_ID \
|
|
90
|
+
--run-id RUN_ID \
|
|
91
|
+
--download-dir OUTPUT_DIR
|
|
92
|
+
```
|
|
93
|
+
|
|
94
|
+
`--image` 最多重复 9 次,`--video` 和 `--audio` 最多各重复 3 次。
|
|
95
|
+
|
|
96
|
+
### 路由 C:小云雀后端 Agent 编排
|
|
97
|
+
|
|
98
|
+
需要意图确认、脚本/分镜拆解、MV、TVC、局部编辑、复杂参考素材编排,或者用户未明确要求模型直出时,继续使用本技能内置的 `submit_run.py` / `get_thread.py` 会话工作流。
|
|
99
|
+
|
|
100
|
+
### 路由 D:短剧工作流
|
|
101
|
+
|
|
102
|
+
用户要求短剧生成、续写、改写、剧情扩展、人物设定、分集草稿或短剧会话文件处理时,停止本技能流程并转交 `xyq-short-drama-skill`,不要用 `submit_run.py`、`generate-image` 或 `generate-video` 假装执行完整短剧流程。
|
|
103
|
+
|
|
104
|
+
## 用户确认与反问
|
|
105
|
+
|
|
106
|
+
后端返回意图确认问题、真实提交前需要 credits 确认,或缺少无法安全推断的必需信息时,暂停执行并向用户提问。
|
|
107
|
+
|
|
108
|
+
1. 优先使用当前 Agent 宿主提供的结构化用户提问或确认工具。
|
|
109
|
+
- **Codex**:准确工具名是 `request_user_input`。仅在工具已暴露且当前模式允许时调用;不可用时退回普通聊天提问。不要在 Codex 中调用 `ask_user_question`。
|
|
110
|
+
- **WorkBuddy**:准确工具名是 `ask_user_question`(Ask User Question)。需要用户补充、选择或确认时优先调用;工具未暴露时才退回普通聊天提问。
|
|
111
|
+
- **Trae 及其他宿主**:先查看当前宿主实际暴露的工具,再使用同类结构化提问、确认或表单工具;不要臆造具体工具名。没有同类工具时退回普通聊天提问。
|
|
112
|
+
2. 涉及 credits、真实生成、外部提交或不可逆操作时,必须等待用户明确答复;不要默认同意或超时后继续。
|
|
113
|
+
3. 后端已经给出问题或选项时,保持原意传给用户,不要代替用户回答。
|
|
114
|
+
4. 当前宿主没有结构化提问工具,或当前模式不允许调用时,使用一条简洁的普通聊天问题并暂停。
|
|
115
|
+
5. 收到回复后,把用户答案原样发回同一 `thread_id`,获取新的 `run_id`,再继续轮询;不要新开会话。
|
|
32
116
|
|
|
33
117
|
## 功能
|
|
34
118
|
|
|
@@ -36,6 +120,8 @@ metadata:
|
|
|
36
120
|
2. **查询会话进展** - 根据 `thread_id` 、 `run_id`、`after_seq` 增量拉取该会话的消息列表,用于轮询创作过程的消息和最终产物结果
|
|
37
121
|
3. **上传文件** - 支持上传`单张图片`、`单个视频文件`或`单个mp3/wav音频文件`到小云雀资产库,得到文件对应的 `asset_id`(编辑或参考已有图片/视频/音频时需要先上传)
|
|
38
122
|
4. **下载结果** - 将会话中生成的图片/视频批量下载到本地,支持指定输出目录和文件名前缀。
|
|
123
|
+
5. **图片模型直出** - 使用 `pippit-tool-cli generate-image` 直接调用图片模型,使用 `query-result` 查询并下载图片结果。
|
|
124
|
+
6. **视频模型直出** - 使用 `pippit-tool-cli generate-video` 直接调用视频模型,使用 `query-result` 查询并下载视频结果。
|
|
39
125
|
|
|
40
126
|
|
|
41
127
|
## 前置要求
|
|
@@ -46,7 +132,7 @@ export XYQ_ACCESS_KEY="your-access-key"
|
|
|
46
132
|
|
|
47
133
|
可选:`XYQ_OPENAPI_BASE` 或 `XYQ_BASE_URL`,默认 `https://xyq.jianying.com`。
|
|
48
134
|
|
|
49
|
-
|
|
135
|
+
会话 API 路由无需安装额外依赖,仅使用 Python 标准库。图片/视频模型直出路由额外要求 `pippit-tool-cli` 在 `PATH` 中可用。
|
|
50
136
|
|
|
51
137
|
## 使用方法
|
|
52
138
|
|
|
@@ -98,7 +184,7 @@ python3 {baseDir}/scripts/download_results.py --urls URL1 URL2 URL3 --output-dir
|
|
|
98
184
|
|
|
99
185
|
理解这些工作流,才能正确组合上面的脚本完成用户需求。
|
|
100
186
|
|
|
101
|
-
### 场景 1
|
|
187
|
+
### 场景 1:用户要求生成图片或视频(非模型直出)
|
|
102
188
|
|
|
103
189
|
```
|
|
104
190
|
1. submit_run.py --message "用户的描述" → 拿到 thread_id、run_id 和 web_thread_link
|
|
@@ -109,7 +195,7 @@ python3 {baseDir}/scripts/download_results.py --urls URL1 URL2 URL3 --output-dir
|
|
|
109
195
|
- 将过程创作信息展示给用户,继续轮询
|
|
110
196
|
- 当任务完成(run 结束):
|
|
111
197
|
- 如果涉及意图确认/流程中断(如"请回答以下问题"):
|
|
112
|
-
→
|
|
198
|
+
→ 优先调用当前宿主的结构化用户提问工具展示问题,等待用户回复
|
|
113
199
|
→ 使用 `thread_id` 重新提交任务(保持同一会话,产生新的 run_id)
|
|
114
200
|
→ 回到步骤 2 继续轮询(可能多轮,直到不再意图确认)
|
|
115
201
|
- 如果 content 中包含产物 URL:
|
|
@@ -118,7 +204,18 @@ python3 {baseDir}/scripts/download_results.py --urls URL1 URL2 URL3 --output-dir
|
|
|
118
204
|
6. 向用户展示:过程中的创作信息,以及下载后的本地文件列表
|
|
119
205
|
```
|
|
120
206
|
|
|
121
|
-
### 场景 2
|
|
207
|
+
### 场景 2:用户明确要求图片模型直出
|
|
208
|
+
|
|
209
|
+
```
|
|
210
|
+
1. command -v pippit-tool-cli → 确认 CLI 可用
|
|
211
|
+
2. 检查图片模型:用户未提供时先询问,不要自行选择
|
|
212
|
+
3. pippit-tool-cli generate-image --prompt "用户原始描述" --model IMAGE_MODEL [仅添加用户已给出的其他参数]
|
|
213
|
+
4. 拿到 thread_id、run_id 和 web_thread_link,立即展示 web_thread_link
|
|
214
|
+
5. 每隔 10 秒调用 query-result --thread-id THREAD_ID --run-id RUN_ID --download-dir OUTPUT_DIR
|
|
215
|
+
6. completed=true 后展示并下载 images[].output_path;出现 error_message 时停止并报告
|
|
216
|
+
```
|
|
217
|
+
|
|
218
|
+
### 场景 3:用户提供图片/视频/音频要求编辑修改或作为参考(如"参考这个视频做一个新的"、"用这首歌做MV")
|
|
122
219
|
|
|
123
220
|
```
|
|
124
221
|
1. upload_file.py /path/to/video.mp4 → 拿到 asset_id1
|
|
@@ -129,7 +226,7 @@ python3 {baseDir}/scripts/download_results.py --urls URL1 URL2 URL3 --output-dir
|
|
|
129
226
|
|
|
130
227
|
用户给了文件路径 + 编辑指令 = 先上传文件,再把编辑指令和 所有asset_id 一起发送。
|
|
131
228
|
|
|
132
|
-
### 场景
|
|
229
|
+
### 场景 4:用户提供参考图/视频/音频要求生成新内容
|
|
133
230
|
|
|
134
231
|
```
|
|
135
232
|
1. upload_file.py /path/to/ref1.png → 拿到 asset_id1
|
|
@@ -140,7 +237,7 @@ python3 {baseDir}/scripts/download_results.py --urls URL1 URL2 URL3 --output-dir
|
|
|
140
237
|
6. 后续同场景 1 的步骤 2-6
|
|
141
238
|
```
|
|
142
239
|
|
|
143
|
-
### 场景
|
|
240
|
+
### 场景 5:在已有会话中追加新需求
|
|
144
241
|
|
|
145
242
|
```
|
|
146
243
|
1. submit_run.py --message "新的描述" --thread-id THREAD_ID → 拿到 thread_id、run_id、web_thread_link
|
|
@@ -211,18 +308,18 @@ python3 {baseDir}/scripts/download_results.py --urls URL1 URL2 URL3 --output-dir
|
|
|
211
308
|
- 任务在创作中:
|
|
212
309
|
- 展示过程中的创作信息等,继续轮询
|
|
213
310
|
- 任务完成(run 结束):
|
|
214
|
-
- 若涉及意图确认/流程中断(如"请回答以下问题")→
|
|
311
|
+
- 若涉及意图确认/流程中断(如"请回答以下问题")→ 按“用户确认与反问”规则优先调用结构化提问工具 → 等待用户回复 → 使用同一 `thread_id` 重新提交任务 → 继续轮询(可能多轮)
|
|
215
312
|
- 若 content 中包含产物 URL:
|
|
216
313
|
- 结果地址:来自 `get_thread` 返回的 `messages` 中,任务创作完成会包含产物 URL,将产物链接、下载的本地文件等信息告知用户。
|
|
217
314
|
|
|
218
315
|
## 核心原则:用户侧不做创作,只做传话
|
|
219
316
|
|
|
220
|
-
你(用户侧 Agent
|
|
317
|
+
你(用户侧 Agent)的职责是**搬运工**,不是创作者。会话 API 路由由后端 Agent 负责理解需求、拆解分镜、编排工作流、选模型、写 prompt;图片/视频模型直出路由把用户原始参数传给 CLI。你要做的是:
|
|
221
318
|
|
|
222
|
-
1.
|
|
223
|
-
2.
|
|
319
|
+
1. **准备素材**:会话 API 路由用 `upload_file.py` 把本地文件转为 asset_id;图片/视频模型直出路由把本地路径直接交给 CLI 的 `--image` / `--video` / `--audio` 参数
|
|
320
|
+
2. **提交任务**:先按“执行路由”判断;图片模型直出调用 `pippit-tool-cli generate-image`,视频模型直出调用 `pippit-tool-cli generate-video`,其余任务把用户的原始描述 + asset_id 原封不动发给 `submit_run.py`
|
|
224
321
|
3. **传话**:根据 `get_thread.py` 返回的消息列表,展示过程中的意图询问、创作信息等
|
|
225
|
-
4.
|
|
322
|
+
4. **取件**:会话 API 路由用 `get_thread.py` 轮询,图片/视频模型直出路由用 `query-result` 轮询 → 检查结果 → 下载产物 → 结果展示给用户
|
|
226
323
|
|
|
227
324
|
**绝对不要做的事:**
|
|
228
325
|
- 不要替用户扩写、润色、翻译 prompt(用户说"帮我推演分镜",就直接传"帮我推演分镜",不要自己先写个分镜表再逐条发)
|
|
@@ -258,3 +355,4 @@ python3 {baseDir}/scripts/download_results.py --urls URL1 URL2 URL3 --output-dir
|
|
|
258
355
|
- 查询会话时可用 --after-seq 做增量拉取,便于轮询新消息(含 assistant 回复与生图/生视频结果)
|
|
259
356
|
- 上传文件仅支持图片(image/*)、视频(video/*)和 `.mp3/.wav` 音频文件,其他类型会被拒绝,文件大小须在 200MB 以下
|
|
260
357
|
- 生成过程中将过程中的创作信息展示给用户;任务完成后给出**产物结果(图片/视频)URL链接**和下载的**本地文件列表**。
|
|
358
|
+
- 图片/视频模型直出任务必须保留 `generate-image` / `generate-video` 返回的 `thread_id` / `run_id`,并用 `query-result` 取回最终图片或视频。
|