@nebulacomponents/citable 1.10.0 → 1.11.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (96) hide show
  1. package/CHANGELOG.md +11 -0
  2. package/README.md +3 -0
  3. package/dist/universal/.agents/skills/citable/SKILL.md +2 -1
  4. package/dist/universal/.agents/skills/citable/VERSION +1 -1
  5. package/dist/universal/.agents/skills/citable/commands/README.md +1 -0
  6. package/dist/universal/.agents/skills/citable/commands/media-evidence.md +17 -0
  7. package/dist/universal/.agents/skills/citable/manifest.json +9 -7
  8. package/dist/universal/.agents/skills/citable/schemas/media-manifest.schema.json +2 -0
  9. package/dist/universal/.agents/skills/citable/schemas/observation.schema.json +1 -1
  10. package/dist/universal/.claude/skills/citable/SKILL.md +2 -1
  11. package/dist/universal/.claude/skills/citable/VERSION +1 -1
  12. package/dist/universal/.claude/skills/citable/commands/README.md +1 -0
  13. package/dist/universal/.claude/skills/citable/commands/media-evidence.md +17 -0
  14. package/dist/universal/.claude/skills/citable/manifest.json +9 -7
  15. package/dist/universal/.claude/skills/citable/schemas/media-manifest.schema.json +2 -0
  16. package/dist/universal/.claude/skills/citable/schemas/observation.schema.json +1 -1
  17. package/dist/universal/.cursor/skills/citable/SKILL.md +2 -1
  18. package/dist/universal/.cursor/skills/citable/VERSION +1 -1
  19. package/dist/universal/.cursor/skills/citable/commands/README.md +1 -0
  20. package/dist/universal/.cursor/skills/citable/commands/media-evidence.md +17 -0
  21. package/dist/universal/.cursor/skills/citable/manifest.json +9 -7
  22. package/dist/universal/.cursor/skills/citable/schemas/media-manifest.schema.json +2 -0
  23. package/dist/universal/.cursor/skills/citable/schemas/observation.schema.json +1 -1
  24. package/dist/universal/.gemini/skills/citable/SKILL.md +2 -1
  25. package/dist/universal/.gemini/skills/citable/VERSION +1 -1
  26. package/dist/universal/.gemini/skills/citable/commands/README.md +1 -0
  27. package/dist/universal/.gemini/skills/citable/commands/media-evidence.md +17 -0
  28. package/dist/universal/.gemini/skills/citable/manifest.json +9 -7
  29. package/dist/universal/.gemini/skills/citable/schemas/media-manifest.schema.json +2 -0
  30. package/dist/universal/.gemini/skills/citable/schemas/observation.schema.json +1 -1
  31. package/dist/universal/.github/skills/citable/SKILL.md +2 -1
  32. package/dist/universal/.github/skills/citable/VERSION +1 -1
  33. package/dist/universal/.github/skills/citable/commands/README.md +1 -0
  34. package/dist/universal/.github/skills/citable/commands/media-evidence.md +17 -0
  35. package/dist/universal/.github/skills/citable/manifest.json +9 -7
  36. package/dist/universal/.github/skills/citable/schemas/media-manifest.schema.json +2 -0
  37. package/dist/universal/.github/skills/citable/schemas/observation.schema.json +1 -1
  38. package/dist/universal/.kiro/skills/citable/SKILL.md +2 -1
  39. package/dist/universal/.kiro/skills/citable/VERSION +1 -1
  40. package/dist/universal/.kiro/skills/citable/commands/README.md +1 -0
  41. package/dist/universal/.kiro/skills/citable/commands/media-evidence.md +17 -0
  42. package/dist/universal/.kiro/skills/citable/manifest.json +9 -7
  43. package/dist/universal/.kiro/skills/citable/schemas/media-manifest.schema.json +2 -0
  44. package/dist/universal/.kiro/skills/citable/schemas/observation.schema.json +1 -1
  45. package/dist/universal/.opencode/skills/citable/SKILL.md +2 -1
  46. package/dist/universal/.opencode/skills/citable/VERSION +1 -1
  47. package/dist/universal/.opencode/skills/citable/commands/README.md +1 -0
  48. package/dist/universal/.opencode/skills/citable/commands/media-evidence.md +17 -0
  49. package/dist/universal/.opencode/skills/citable/manifest.json +9 -7
  50. package/dist/universal/.opencode/skills/citable/schemas/media-manifest.schema.json +2 -0
  51. package/dist/universal/.opencode/skills/citable/schemas/observation.schema.json +1 -1
  52. package/dist/universal/.pi/agent/skills/citable/SKILL.md +2 -1
  53. package/dist/universal/.pi/agent/skills/citable/VERSION +1 -1
  54. package/dist/universal/.pi/agent/skills/citable/commands/README.md +1 -0
  55. package/dist/universal/.pi/agent/skills/citable/commands/media-evidence.md +17 -0
  56. package/dist/universal/.pi/agent/skills/citable/manifest.json +9 -7
  57. package/dist/universal/.pi/agent/skills/citable/schemas/media-manifest.schema.json +2 -0
  58. package/dist/universal/.pi/agent/skills/citable/schemas/observation.schema.json +1 -1
  59. package/dist/universal/.qoder/skills/citable/SKILL.md +2 -1
  60. package/dist/universal/.qoder/skills/citable/VERSION +1 -1
  61. package/dist/universal/.qoder/skills/citable/commands/README.md +1 -0
  62. package/dist/universal/.qoder/skills/citable/commands/media-evidence.md +17 -0
  63. package/dist/universal/.qoder/skills/citable/manifest.json +9 -7
  64. package/dist/universal/.qoder/skills/citable/schemas/media-manifest.schema.json +2 -0
  65. package/dist/universal/.qoder/skills/citable/schemas/observation.schema.json +1 -1
  66. package/dist/universal/.rovodev/skills/citable/SKILL.md +2 -1
  67. package/dist/universal/.rovodev/skills/citable/VERSION +1 -1
  68. package/dist/universal/.rovodev/skills/citable/commands/README.md +1 -0
  69. package/dist/universal/.rovodev/skills/citable/commands/media-evidence.md +17 -0
  70. package/dist/universal/.rovodev/skills/citable/manifest.json +9 -7
  71. package/dist/universal/.rovodev/skills/citable/schemas/media-manifest.schema.json +2 -0
  72. package/dist/universal/.rovodev/skills/citable/schemas/observation.schema.json +1 -1
  73. package/dist/universal/.trae/skills/citable/SKILL.md +2 -1
  74. package/dist/universal/.trae/skills/citable/VERSION +1 -1
  75. package/dist/universal/.trae/skills/citable/commands/README.md +1 -0
  76. package/dist/universal/.trae/skills/citable/commands/media-evidence.md +17 -0
  77. package/dist/universal/.trae/skills/citable/manifest.json +9 -7
  78. package/dist/universal/.trae/skills/citable/schemas/media-manifest.schema.json +2 -0
  79. package/dist/universal/.trae/skills/citable/schemas/observation.schema.json +1 -1
  80. package/dist/universal/.trae-cn/skills/citable/SKILL.md +2 -1
  81. package/dist/universal/.trae-cn/skills/citable/VERSION +1 -1
  82. package/dist/universal/.trae-cn/skills/citable/commands/README.md +1 -0
  83. package/dist/universal/.trae-cn/skills/citable/commands/media-evidence.md +17 -0
  84. package/dist/universal/.trae-cn/skills/citable/manifest.json +9 -7
  85. package/dist/universal/.trae-cn/skills/citable/schemas/media-manifest.schema.json +2 -0
  86. package/dist/universal/.trae-cn/skills/citable/schemas/observation.schema.json +1 -1
  87. package/dist/universal/manifest.json +111 -87
  88. package/package.json +8 -3
  89. package/schemas/media-manifest.schema.json +2 -0
  90. package/schemas/observation.schema.json +1 -1
  91. package/skill/SKILL.md +2 -1
  92. package/skill/commands/README.md +1 -0
  93. package/skill/commands/media-evidence.md +17 -0
  94. package/src/cli/index.js +3 -1
  95. package/src/commands/observe.js +3 -1
  96. package/src/observations/media.js +75 -0
package/package.json CHANGED
@@ -1,6 +1,6 @@
1
1
  {
2
2
  "name": "@nebulacomponents/citable",
3
- "version": "1.10.0",
3
+ "version": "1.11.0",
4
4
  "description": "Production-grade SEO, AEO, and GEO agent skill with auditable detection, claim governance, evidence validation, and multi-agent installation.",
5
5
  "keywords": [
6
6
  "seo",
@@ -90,14 +90,19 @@
90
90
  "ajv-formats": "^3.0.1",
91
91
  "csv-parse": "^7.0.1",
92
92
  "js-yaml": "^5.2.1",
93
- "node-html-parser": "^9.0.0"
93
+ "node-html-parser": "^9.0.0",
94
+ "pdfjs-dist": "^6.1.200"
94
95
  },
95
96
  "peerDependencies": {
96
- "playwright": ">=1.50.0"
97
+ "playwright": ">=1.50.0",
98
+ "tesseract.js": ">=7.0.0"
97
99
  },
98
100
  "peerDependenciesMeta": {
99
101
  "playwright": {
100
102
  "optional": true
103
+ },
104
+ "tesseract.js": {
105
+ "optional": true
101
106
  }
102
107
  }
103
108
  }
@@ -0,0 +1,2 @@
1
+ {
2
+ "$id":"citable://schemas/media-manifest.schema.json","$schema":"http://json-schema.org/draft-07/schema#","title":"Media evidence import manifest","type":"object","additionalProperties":false,"required":["version","items"],"properties":{"version":{"const":1},"items":{"type":"array","minItems":1,"items":{"type":"object","additionalProperties":false,"required":["media_id","type","path","source_url","page_url","claim_ids","permission_status"],"properties":{"media_id":{"type":"string","pattern":"^MEDIA-[A-Z0-9][A-Z0-9_-]*$"},"type":{"type":"string","enum":["pdf","transcript","image"]},"path":{"type":"string","minLength":1},"source_url":{"type":["string","null"]},"page_url":{"type":["string","null"]},"claim_ids":{"type":"array","uniqueItems":true,"items":{"type":"string"}},"permission_status":{"type":"string","enum":["owner_authorized","licensed","public_unknown","internal"]},"image_src":{"type":"string"},"language":{"type":"string"},"published_at":{"type":"string","format":"date-time"}}}}}}
@@ -7,7 +7,7 @@
7
7
  "required": ["observation_id", "kind", "state", "collected_at", "collection_method", "confidence", "source", "evidence_hash", "data"],
8
8
  "properties": {
9
9
  "observation_id": { "type": "string", "minLength": 1 },
10
- "kind": { "type": "string", "enum": ["render", "index", "citation", "citation_review", "crawler_log", "bing_webmaster", "passage", "canonical_freshness", "performance", "corroboration", "metric"] },
10
+ "kind": { "type": "string", "enum": ["render", "index", "citation", "citation_review", "crawler_log", "bing_webmaster", "passage", "canonical_freshness", "performance", "corroboration", "metric", "media_pdf", "media_transcript", "media_image"] },
11
11
  "state": { "type": "string", "enum": ["observed", "not_observed", "not_evidenced", "incomplete", "review_required", "failed"] },
12
12
  "collected_at": { "type": "string", "format": "date-time" },
13
13
  "collection_method": { "type": "string", "enum": ["live_api", "browser", "owner_import", "synthetic_fetch", "static_analysis", "human_review"] },
package/skill/SKILL.md CHANGED
@@ -7,7 +7,7 @@ description: >
7
7
  generative engine optimization, structured data governance, claim substantiation,
8
8
  crawler policy, entity consistency, content discoverability, or wants a site audited
9
9
  for how search and AI systems will retrieve, understand, cite, or recommend it.
10
- version: 1.10.0
10
+ version: 1.11.0
11
11
  ---
12
12
 
13
13
  # Citable — evidence and change control for search and AI citation readiness
@@ -117,6 +117,7 @@ citable reviews sample <sampling-plan-id> [--write]
117
117
  citable reviews evaluate
118
118
  citable schedules run <schedule-id> [--ref-date YYYY-MM-DD]
119
119
  citable project github <run-id>
120
+ citable observe media --input <manifest.json> [--ocr]
120
121
  ```
121
122
 
122
123
  Audit scopes: `technical seo aeo geo architecture entity claims evidence schema
@@ -30,6 +30,7 @@ intent, not executability, so statuses are strict:
30
30
  | /citable governance validate / evaluate | implemented — validates reviewer and exception authority and emits immutable dispositions without changing failed findings |
31
31
  | /citable reviews queue / prioritize / plan / sample / evaluate | implemented — materiality queues, reproducible sampling, stale-decision checks, and independent disagreement adjudication |
32
32
  | /citable schedules run / project github | implemented — canonical scheduled audits and hash-bound non-authoritative GitHub projections |
33
+ | /citable observe media | implemented — bounded PDF, transcript, image-context, optional OCR, and declared claim-link evidence |
33
34
  | /citable ingest, map-site, map-queries, map-prompts, map-entities, map-evidence | specified (ingest.md) |
34
35
  | /citable optimize-page | specified (optimize-page.md) — requires source-to-render mapping, claim-preserving rewrites, build execution, rollback; none of that is proven yet |
35
36
  | /citable create-page, answer-block, architect, interlink, consolidate, metadata | specified (page-work.md) |
@@ -0,0 +1,17 @@
1
+ # Media evidence collection
2
+
3
+ Use `citable observe media --input <manifest.json>` for bounded local-media
4
+ evidence. The manifest declares source URL, owning page, permission status, and
5
+ linked claim IDs for each PDF, transcript, or image-context source.
6
+
7
+ PDF collection extracts native text, basic metadata, and stable page anchors.
8
+ It does not establish reading order, table structure, footnote linkage,
9
+ signatures, revisions, scan accuracy, accessibility, or claim support.
10
+ Transcript collection preserves cues but does not verify speakers, timing,
11
+ accuracy, or source-media parity. Image collection records alt text, captions,
12
+ and nearby figure text without inferring visual entailment.
13
+
14
+ OCR is off by default. `--ocr` explicitly requests the optional `tesseract.js`
15
+ path; an unavailable engine or image produces incomplete evidence, never guessed
16
+ text. Every media-to-claim relationship is declarative and still requires
17
+ human-authoritative semantic review.
package/src/cli/index.js CHANGED
@@ -43,7 +43,7 @@ Commands
43
43
  compare-snapshots [a b] Regression diff between two audit runs
44
44
  action-plan [run] Turn audit findings into ordered remediation work
45
45
  observe <mode> Collect render, index, citation, log, Bing, passage,
46
- consensus, performance, or corroboration evidence
46
+ consensus, performance, corroboration, or media evidence
47
47
  apply Apply a reviewed, hash-locked remediation spec
48
48
  monitor [runA runB] Compare observation runs and emit regression alerts
49
49
  metrics import Import declared metric observations from CSV/JSON
@@ -84,6 +84,7 @@ Options
84
84
  --access-token <token> OAuth token (prefer provider environment variables)
85
85
  --endpoint <url> Controlled citation adapter endpoint
86
86
  --repeat <count> Repetitions per prompt for citation experiments
87
+ --ocr Explicitly request optional OCR for media images
87
88
  --write Persist registry changes (map-claims, substantiate)
88
89
  --json Machine-readable output only
89
90
 
@@ -96,6 +97,7 @@ function parseArgs(argv) {
96
97
  const a = argv[i];
97
98
  if (a === '--write') args.write = true;
98
99
  else if (a === '--json') args.json = true;
100
+ else if (a === '--ocr') args.ocr = true;
99
101
  else if (a === '--target') args.target = argv[++i];
100
102
  else if (a === '--base-url') args.baseUrl = argv[++i];
101
103
  else if (a === '--ref-date') args.refDate = argv[++i];
@@ -7,6 +7,7 @@ import path from 'node:path';
7
7
  import { parse as parseCsv } from 'csv-parse/sync';
8
8
  import { crawlerIdentity } from '../observations/crawlerIdentity.js';
9
9
  import { validateAgainst } from '../shared/schemaValidator.js';
10
+ import { observeMedia } from '../observations/media.js';
10
11
 
11
12
  const originOf = (value) => { try { return new URL(value).origin; } catch { return null; } };
12
13
  const words = (text) => String(text || '').trim().split(/\s+/).filter(Boolean);
@@ -289,6 +290,7 @@ export async function observe(root, mode, options = {}) {
289
290
  case 'consensus': return observeConsensus(root, options);
290
291
  case 'performance': return observePerformance(root, options);
291
292
  case 'corroboration': return observeCorroboration(root, options);
292
- default: throw new Error('observe mode must be render, index, citations, logs, bing, passages, consensus, performance, or corroboration');
293
+ case 'media': return observeMedia(root, options);
294
+ default: throw new Error('observe mode must be render, index, citations, logs, bing, passages, consensus, performance, corroboration, or media');
293
295
  }
294
296
  }
@@ -0,0 +1,75 @@
1
+ import fs from 'node:fs';
2
+ import path from 'node:path';
3
+ import { parse } from 'node-html-parser';
4
+ import { envelope, observationRun, readInput } from './common.js';
5
+ import { loadRegistries } from '../registries/index.js';
6
+ import { validateAgainst } from '../shared/schemaValidator.js';
7
+
8
+ function resolveMediaPath(manifestFile, value) {
9
+ const file = path.resolve(path.dirname(manifestFile), value);
10
+ if (!fs.existsSync(file) || !fs.statSync(file).isFile()) throw new Error(`media file not found: ${value}`);
11
+ return file;
12
+ }
13
+
14
+ async function pdfEvidence(item, file, artifacts) {
15
+ const pdfjs = await import('pdfjs-dist/legacy/build/pdf.mjs');
16
+ const bytes = new Uint8Array(fs.readFileSync(file));
17
+ const document = await pdfjs.getDocument({ data: bytes, disableWorker: true, useSystemFonts: true }).promise;
18
+ const metadata = await document.getMetadata().catch(() => ({ info: {}, metadata: null }));
19
+ const pages = [];
20
+ for (let number = 1; number <= document.numPages; number++) {
21
+ const page = await document.getPage(number);
22
+ const content = await page.getTextContent();
23
+ const text = content.items.map((entry) => entry.str).join(' ').replace(/\s+/g, ' ').trim();
24
+ pages.push({ page: number, text, word_count: text ? text.split(/\s+/).length : 0, anchor: `${item.source_url || file}#page=${number}` });
25
+ }
26
+ artifacts[`media/${item.media_id}/extracted.txt`] = pages.map((page) => `--- page ${page.page} ---\n${page.text}`).join('\n');
27
+ return envelope('media_pdf', { media_id: item.media_id, source_url: item.source_url, page_url: item.page_url, claim_ids: item.claim_ids, permission_status: item.permission_status, page_count: document.numPages, pages, metadata: metadata.info || {}, tagged: Boolean(metadata.info?.IsTagged) }, { method: 'static_analysis', source: file, raw: bytes, confidence: 'high', limitations: ['Reading order, tables, footnotes, signatures, revisions, accessibility tags, and scanned text are not fully validated.', 'Page text extraction does not establish that linked claims are supported.'] });
28
+ }
29
+
30
+ function transcriptEvidence(item, file, artifacts) {
31
+ const raw = fs.readFileSync(file, 'utf8');
32
+ const cues = raw.split(/\r?\n\r?\n/).map((block) => { const lines = block.split(/\r?\n/).filter(Boolean); const timing = lines.find((line) => line.includes('-->')) || null; const text = lines.filter((line) => line !== 'WEBVTT' && line !== timing && !/^\d+$/.test(line)).join(' ').replace(/<[^>]+>/g, '').trim(); return text ? { timing, text } : null; }).filter(Boolean);
33
+ const text = cues.map((cue) => cue.text).join(' ');
34
+ artifacts[`media/${item.media_id}/transcript.txt`] = text;
35
+ return envelope('media_transcript', { media_id: item.media_id, source_url: item.source_url, page_url: item.page_url, claim_ids: item.claim_ids, permission_status: item.permission_status, language: item.language || null, published_at: item.published_at || null, cues, word_count: text ? text.split(/\s+/).length : 0 }, { method: 'owner_import', source: file, raw, limitations: ['Speaker identity, transcription accuracy, timing accuracy, and media parity require human verification.', 'Transcript ingestion does not establish that linked claims are supported.'] });
36
+ }
37
+
38
+ async function imageEvidence(item, file, options) {
39
+ const html = fs.readFileSync(file, 'utf8');
40
+ const root = parse(html);
41
+ const images = root.querySelectorAll('img');
42
+ const image = item.image_src ? images.find((node) => node.getAttribute('src') === item.image_src) : images[0];
43
+ if (!image) return envelope('media_image', { media_id: item.media_id, image_src: item.image_src || null, page_url: item.page_url, claim_ids: item.claim_ids }, { method: 'static_analysis', source: file, raw: html, state: 'not_observed', limitations: ['No matching image was found in the supplied HTML.'] });
44
+ const figure = image.closest('figure');
45
+ const caption = figure?.querySelector('figcaption')?.text.replace(/\s+/g, ' ').trim() || null;
46
+ const alt = image.getAttribute('alt');
47
+ const nearby_text = (figure || image.parentNode)?.text?.replace(/\s+/g, ' ').trim() || null;
48
+ let ocr = { state: 'not_requested', text: null };
49
+ if (options.ocr) {
50
+ try { const tesseract = await import('tesseract.js'); const result = await tesseract.recognize(path.resolve(path.dirname(file), image.getAttribute('src')), item.language || 'eng'); ocr = { state: 'observed', text: result.data.text }; }
51
+ catch { ocr = { state: 'not_evidenced', text: null }; }
52
+ }
53
+ return envelope('media_image', { media_id: item.media_id, image_src: image.getAttribute('src'), source_url: item.source_url, page_url: item.page_url, claim_ids: item.claim_ids, permission_status: item.permission_status, alt: alt ?? null, caption, nearby_text, ocr }, { method: 'static_analysis', source: file, raw: html, state: options.ocr && ocr.state === 'not_evidenced' ? 'incomplete' : 'observed', confidence: 'high', limitations: [...(!alt && !caption ? ['Neither alt text nor a figure caption supplies textual context.'] : []), ...(ocr.state === 'not_evidenced' ? ['OCR was explicitly requested but the optional tesseract.js dependency or image resource was unavailable.'] : []), 'Alt text, captions, nearby text, and OCR do not establish semantic equivalence or claim support.'] });
54
+ }
55
+
56
+ export async function observeMedia(root, options) {
57
+ const input = readInput(options.input);
58
+ const check = validateAgainst('media-manifest.schema.json', input.value);
59
+ if (!check.valid) throw new Error(`media manifest violates contract: ${check.errors.join('; ')}`);
60
+ const { registries, problems } = loadRegistries(root);
61
+ if (problems.length) throw new Error(`registry validation failed: ${problems.join('; ')}`);
62
+ const claimIds = new Set(registries.claims.entries.map((claim) => claim.claim_id));
63
+ const observations = [], artifacts = {}, rawInputs = { media_manifest: input.raw };
64
+ for (const item of input.value.items) {
65
+ const unknown = item.claim_ids.filter((id) => !claimIds.has(id));
66
+ if (unknown.length) throw new Error(`${item.media_id} references unknown claim ids: ${unknown.join(', ')}`);
67
+ const file = resolveMediaPath(input.file, item.path);
68
+ rawInputs[`media_${item.media_id}`] = fs.readFileSync(file);
69
+ if (item.type === 'pdf') observations.push(await pdfEvidence(item, file, artifacts));
70
+ else if (item.type === 'transcript') observations.push(transcriptEvidence(item, file, artifacts));
71
+ else observations.push(await imageEvidence(item, file, options));
72
+ }
73
+ const incomplete = observations.filter((item) => item.state === 'incomplete').map((item) => `${item.data.media_id}: requested extraction is incomplete`);
74
+ return observationRun(root, 'observe media', input.file, observations, { rawInputs, artifacts, incomplete });
75
+ }