picturereader 0.1.0 → 0.1.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +7 -6
- package/package.json +1 -1
package/README.md
CHANGED
|
@@ -10,7 +10,7 @@
|
|
|
10
10
|
## 这是什么
|
|
11
11
|
|
|
12
12
|
DeepSeek 等纯文本模型没有视觉编码器,无法直接看图。picturereader 把"看图"翻译成
|
|
13
|
-
|
|
13
|
+
模型能理解的**结构化文本证据**,并提供一套经过大量真实图片迭代验证的**读图方法论
|
|
14
14
|
skill(image-reading)**,让模型像人一样分步看图:
|
|
15
15
|
|
|
16
16
|
1. **全局定调**:hue families(纯色相指纹)→ structure(条带/对称)→ texture(写实度)→ regions(色块结构)
|
|
@@ -29,12 +29,13 @@ skill(image-reading)**,让模型像人一样分步看图:
|
|
|
29
29
|
|
|
30
30
|
### 读图方法论 skill(image-reading)
|
|
31
31
|
|
|
32
|
-
`skills/image-reading.md`
|
|
33
|
-
|
|
32
|
+
`skills/image-reading.md` 是一套**经大量真实图片场景迭代验证**的读图方法论
|
|
33
|
+
(按 experience / skill / principle / insight 分层,教训有据可依、找主导模式),
|
|
34
|
+
安装后模型自动掌握:
|
|
34
35
|
- **hue 场景指纹**:cyan 高=水/雾/湖泊,green 高=森林,orange/red 高=暖色人物/火光,
|
|
35
36
|
blue 高=夜晚科幻,achromatic+rough=废墟,green+yellow=翠绿能量/浮空仙境
|
|
36
|
-
-
|
|
37
|
-
发光元素颜色以 hue
|
|
37
|
+
- **多模态模型校验规则**:游戏名/品牌等文字必须 OCR 实读(多模态模型会猜错);
|
|
38
|
+
发光元素颜色以 hue 实测为准(多模态模型对发光色的描述系统性不可靠)
|
|
38
39
|
- **主动验证**:低对比主体(暗色人物/小色块)必须放大确认
|
|
39
40
|
|
|
40
41
|
## 安装
|
|
@@ -97,7 +98,7 @@ node scripts/preview.mjs # 生成 fixtures 并预览渲染
|
|
|
97
98
|
- **成本低**:一次扫描 ≈0.6–2.2K tokens;PaddleOCR 本地跑,无 API 费用
|
|
98
99
|
- **可选增强**:PaddleOCR 一键安装(`scripts/setup-ocr.mjs`),缺失自动降级不崩溃
|
|
99
100
|
- **方法论沉淀**:附带的 image-reading skill 把读图经验固化(场景指纹/校验规则),
|
|
100
|
-
|
|
101
|
+
模型每次看图都带着经过大量图片验证的经验
|
|
101
102
|
|
|
102
103
|
## 局限性(重要)
|
|
103
104
|
|
package/package.json
CHANGED
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
{
|
|
2
2
|
"name": "picturereader",
|
|
3
|
-
"version": "0.1.
|
|
3
|
+
"version": "0.1.1",
|
|
4
4
|
"description": "DSH plugin: pixel-to-text image reading for text-only models. Downscales and color-quantizes PNG/JPEG/GIF/BMP and feeds the coarse pixel grid to the model so DeepSeek can 'see' layout, colors and rough shapes without a vision model.",
|
|
5
5
|
"type": "module",
|
|
6
6
|
"main": "src/index.js",
|