picturereader 2.0.0 → 2.0.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +10 -17
- package/package.json +1 -1
package/README.md
CHANGED
|
@@ -30,6 +30,8 @@
|
|
|
30
30
|
两个版本共用同一套业务核心(`src/core.js`)与读图方法论 skill(`image-reading`),
|
|
31
31
|
四个工具行为完全一致:`image_scan` / `image_ocr` / `image_sample` / `vision_analyze`。
|
|
32
32
|
|
|
33
|
+
> **兼容性**:DSH 版已验证兼容 **DeepSeek Harness EAC 4.2.0** 及 `@deepseek-ai/dsh-client-ui-workspace` **rc.7**(4.2.0 配套的官方工作区插件版本)。
|
|
34
|
+
|
|
33
35
|
> **ZCode 版性能说明**:ZCode 版通过 MCP(stdio 子进程)暴露工具,每次调用都要
|
|
34
36
|
> 经历进程通信与序列化开销,**速度明显慢于 DSH 版**(DSH 版为插件内直接调用)。
|
|
35
37
|
> 高频看图、批量看图任务请优先使用 DSH 版;ZCode 版适合轻量、偶发看图。
|
|
@@ -176,26 +178,17 @@ node scripts/setup-ocr.mjs # 可选
|
|
|
176
178
|
|
|
177
179
|
## 优势
|
|
178
180
|
|
|
179
|
-
- **一个插件全包含,无需另装**:独立的伪多模态识图 + 可选外部视觉 API,融合在一个包里,不需要再装 `dsh-universal-vision`
|
|
180
|
-
- **核心链路零外部依赖**:扫描/取样/解码纯本地纯 JS,不调任何视觉 API
|
|
181
|
-
-
|
|
182
|
-
-
|
|
183
|
-
-
|
|
184
|
-
-
|
|
181
|
+
- **一个插件全包含,无需另装**:独立的伪多模态识图 + 可选外部视觉 API,融合在一个包里,不需要再装 `dsh-universal-vision` 或其他任何读图插件
|
|
182
|
+
- **核心链路零外部依赖**:扫描/取样/解码纯本地纯 JS,不调任何视觉 API;语义理解要么交给主模型,要么按需桥接你自己的 VLM
|
|
183
|
+
- **双版本独立分发,互不污染**:DSH 用 `picturereader`(本页),ZCode 用 `picturereader-zcode`(zcode 分支);DSH 版带 `dsh.bundle`、ZCode 版带 `mcp` + `.zcode-plugin`,各装各的宿主,**不会把 ZCode 版误装进 DSH,也不会把 DSH 版误装进 ZCode**
|
|
184
|
+
- **外部 API 可选、即插即用**:默认不配置 `SEE_BASE` 保持纯本地;配了即接入语义理解,本地 llama-server / LM Studio / vLLM / 云端 OpenAI 兼容端点通吃
|
|
185
|
+
- **低信息量拦截**(v2.0.0):自动识别空白/未渲染/简单图,避免小 VLM 幻觉、省调用成本
|
|
186
|
+
- **证据交叉验证**(v2.0.0):VLM 描述与像素/OCR 实测冲突时以实测为准——伪多模态与真 VLM 互为印证,抑制幻觉
|
|
187
|
+
- **多次提问**(v2.0.0):同一张图可换不同 `prompt` 反复 `vision_analyze`,从多角度复核
|
|
188
|
+
- **可追溯、可验证**:每个结论都有数据支撑(hue 占比、色块坐标、OCR 文本+置信度)
|
|
185
189
|
- **成本低**:一次扫描 ≈0.6–2.2K tokens;PaddleOCR 本地跑,无 API 费用
|
|
186
190
|
- **方法论沉淀**:附带的 image-reading skill 把读图经验固化(场景指纹/校验规则),模型每次看图都带着经过大量图片验证的经验
|
|
187
191
|
|
|
188
|
-
## 局限性(重要)
|
|
189
|
-
|
|
190
|
-
- **不是真正的视觉模型**:伪多模态部分文本网格信息量有限,**人脸/表情/花纹等像素级细节读不出**;这是文本模态的硬上限,放大(px_per_cell)只能缩小差距,不能消除
|
|
191
|
-
- **语义推断依赖主模型或外部 API 能力**:物体识别是 LLM 基于结构证据的推测,不是视觉编码器的确证;接入 VLM 可大幅增强,但外部 API 也可能出错
|
|
192
|
-
- **VLM 可选即插即用**:未配置 `SEE_BASE` 时无语义描述;配置后依赖端点可用性与网络/本地资源
|
|
193
|
-
- **OCR 引擎边界**:Windows OCR 对发光/弯曲/艺术字失效;PaddleOCR 强很多但需选装,且对极小文字/极端艺术字仍可能失败(可配合放大)
|
|
194
|
-
- **性能**:4K 图解码 ~230ms;PaddleOCR 每次调用需 ~2s 加载模型;VLM 调用需 2-5s(取决于端点);大图网格渲染 token 随 size 增长(64×64 color ≈ 3–5K tokens)
|
|
195
|
-
- **ZCode 版 MCP 开销**:ZCode 版工具经 MCP stdio 子进程通信,单次调用比 DSH 版慢;高频/批量看图建议用 DSH 版
|
|
196
|
-
- **WebP 不支持**(提示转 PNG/JPEG);GIF 只读首帧
|
|
197
|
-
- **多模态模型的描述不可全信**(本插件可交叉验证,但最终语义仍需人工判断关键场景)
|
|
198
|
-
|
|
199
192
|
## License
|
|
200
193
|
|
|
201
194
|
MIT
|
package/package.json
CHANGED
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
{
|
|
2
2
|
"name": "picturereader",
|
|
3
|
-
"version": "2.0.
|
|
3
|
+
"version": "2.0.1",
|
|
4
4
|
"description": "Unified image understanding plugin for DeepSeek Harness (DSH). Fuses frame-free pseudo-multimodal reading (pixel scan + OCR + sample) with an optional external vision API bridge (local llama-server / LM Studio / any OpenAI-compatible endpoint) for full semantic understanding. No extra plugin needed.",
|
|
5
5
|
"type": "module",
|
|
6
6
|
"main": "src/index.js",
|