kordoc 4.2.2 → 4.2.4

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (103) hide show
  1. package/README.md +15 -3
  2. package/dist/{-NFHVGTVM.js → -2M56QRNH.js} +9 -9
  3. package/dist/{chunk-MYD3QLBL.js → chunk-7KRCQE3P.js} +2 -2
  4. package/dist/{chunk-OLDIDBJ2.js → chunk-7Z3NHIRR.js} +3 -3
  5. package/dist/{chunk-KKZATKQW.cjs → chunk-BLNOGMIM.cjs} +2 -2
  6. package/dist/chunk-BLNOGMIM.cjs.map +1 -0
  7. package/dist/{chunk-TXYQJXOV.js → chunk-CAA6DVEE.js} +91 -30
  8. package/dist/chunk-CAA6DVEE.js.map +1 -0
  9. package/dist/chunk-DCZVOIEO.cjs.map +1 -1
  10. package/dist/{chunk-MOOVF6CT.js → chunk-DOLK5KIS.js} +2 -2
  11. package/dist/{chunk-2L7MIKOM.js → chunk-E2K4SNMD.js} +2 -2
  12. package/dist/{chunk-X77U36TV.js → chunk-GFTAPAJS.js} +2 -2
  13. package/dist/{chunk-ZF7QL4IY.js → chunk-GJO3ORFW.js} +1 -1
  14. package/dist/chunk-GJO3ORFW.js.map +1 -0
  15. package/dist/chunk-GS7T56RP.cjs.map +1 -1
  16. package/dist/{chunk-FHYLLKIP.js → chunk-H6O65EPK.js} +2 -2
  17. package/dist/chunk-H7OWEYH2.cjs.map +1 -1
  18. package/dist/{chunk-DSL6EVFJ.js → chunk-I53FOXZR.js} +2 -2
  19. package/dist/{chunk-GHMVNMUN.js → chunk-LWNFAIYG.js} +3 -3
  20. package/dist/{chunk-EFF2JPPA.cjs → chunk-LXUZUUUG.cjs} +9 -9
  21. package/dist/chunk-LXUZUUUG.cjs.map +1 -0
  22. package/dist/{chunk-GUYIXVV7.js → chunk-OBX3VSIZ.js} +2 -2
  23. package/dist/chunk-OBX3VSIZ.js.map +1 -0
  24. package/dist/{chunk-T4AWY45Q.js → chunk-PMBWFYZQ.js} +2 -2
  25. package/dist/{chunk-IXHBRMDB.js → chunk-PQ46DC6Y.js} +2 -2
  26. package/dist/{chunk-WMU2KJHF.cjs → chunk-SCJLAOY3.cjs} +4 -4
  27. package/dist/chunk-SCJLAOY3.cjs.map +1 -0
  28. package/dist/{chunk-L5B7PQOP.js → chunk-WMM6XVQX.js} +2 -2
  29. package/dist/{chunk-DLFZAU4X.cjs → chunk-YFSYLEXO.cjs} +3 -3
  30. package/dist/chunk-YFSYLEXO.cjs.map +1 -0
  31. package/dist/{chunk-LUJN3VFB.js → chunk-ZHRYLT3N.js} +3 -3
  32. package/dist/chunks-GT45ALC5.js +10 -0
  33. package/dist/cli.js +18 -18
  34. package/dist/formula-SB3NHDUM.cjs.map +1 -1
  35. package/dist/{image-ocr-S4REURLR.js → image-ocr-HY42AVXC.js} +5 -5
  36. package/dist/{image-ocr-3AFBDDJI.cjs → image-ocr-JWAX5EOB.cjs} +9 -9
  37. package/dist/image-ocr-JWAX5EOB.cjs.map +1 -0
  38. package/dist/{image-ocr-TGHAMIQL.js → image-ocr-WCIDB6RY.js} +4 -4
  39. package/dist/index.cjs +508 -447
  40. package/dist/index.cjs.map +1 -1
  41. package/dist/index.d.cts +7 -2
  42. package/dist/index.d.ts +7 -2
  43. package/dist/index.js +86 -25
  44. package/dist/index.js.map +1 -1
  45. package/dist/mcp.js +15 -15
  46. package/dist/page-range-P7SDW6LR.cjs.map +1 -1
  47. package/dist/{parser-MRM6WICO.cjs → parser-6RDEBLSB.cjs} +24 -24
  48. package/dist/parser-6RDEBLSB.cjs.map +1 -0
  49. package/dist/{parser-C3APVZGT.js → parser-SVZPCCRG.js} +6 -6
  50. package/dist/{parser-KMC4YOZH.js → parser-WRNS6MX2.js} +5 -5
  51. package/dist/pdf-ocr-4SGVLUNL.cjs +13 -0
  52. package/dist/pdf-ocr-4SGVLUNL.cjs.map +1 -0
  53. package/dist/pdf-ocr-7AAHJOXQ.js +12 -0
  54. package/dist/{pdf-ocr-UURMV6FD.js → pdf-ocr-WM3RZMZY.js} +5 -5
  55. package/dist/{profile-io-RLQ62KS5.js → profile-io-SWGUQSCL.js} +3 -3
  56. package/dist/{rasterize-LBABF2WI.js → rasterize-QA7W6QUF.js} +2 -2
  57. package/dist/render-DRUIPV77.js +10 -0
  58. package/dist/seal-3M4ZSW66.js +10 -0
  59. package/dist/{setup-Q2PRE7UA.js → setup-GUQT5ELJ.js} +23 -3
  60. package/dist/setup-GUQT5ELJ.js.map +1 -0
  61. package/dist/{watch-XEUEGOXW.js → watch-SFQNFU7Q.js} +9 -9
  62. package/package.json +1 -1
  63. package/dist/chunk-DLFZAU4X.cjs.map +0 -1
  64. package/dist/chunk-EFF2JPPA.cjs.map +0 -1
  65. package/dist/chunk-GUYIXVV7.js.map +0 -1
  66. package/dist/chunk-KKZATKQW.cjs.map +0 -1
  67. package/dist/chunk-TXYQJXOV.js.map +0 -1
  68. package/dist/chunk-WMU2KJHF.cjs.map +0 -1
  69. package/dist/chunk-ZF7QL4IY.js.map +0 -1
  70. package/dist/chunks-N4CWHTJI.js +0 -10
  71. package/dist/image-ocr-3AFBDDJI.cjs.map +0 -1
  72. package/dist/parser-MRM6WICO.cjs.map +0 -1
  73. package/dist/pdf-ocr-5BRMIJAT.cjs +0 -13
  74. package/dist/pdf-ocr-5BRMIJAT.cjs.map +0 -1
  75. package/dist/pdf-ocr-UDTEQEWA.js +0 -12
  76. package/dist/render-CYXQEHS7.js +0 -10
  77. package/dist/seal-SV6PFFYU.js +0 -10
  78. package/dist/setup-Q2PRE7UA.js.map +0 -1
  79. /package/dist/{-NFHVGTVM.js.map → -2M56QRNH.js.map} +0 -0
  80. /package/dist/{chunk-MYD3QLBL.js.map → chunk-7KRCQE3P.js.map} +0 -0
  81. /package/dist/{chunk-OLDIDBJ2.js.map → chunk-7Z3NHIRR.js.map} +0 -0
  82. /package/dist/{chunk-MOOVF6CT.js.map → chunk-DOLK5KIS.js.map} +0 -0
  83. /package/dist/{chunk-2L7MIKOM.js.map → chunk-E2K4SNMD.js.map} +0 -0
  84. /package/dist/{chunk-X77U36TV.js.map → chunk-GFTAPAJS.js.map} +0 -0
  85. /package/dist/{chunk-FHYLLKIP.js.map → chunk-H6O65EPK.js.map} +0 -0
  86. /package/dist/{chunk-DSL6EVFJ.js.map → chunk-I53FOXZR.js.map} +0 -0
  87. /package/dist/{chunk-GHMVNMUN.js.map → chunk-LWNFAIYG.js.map} +0 -0
  88. /package/dist/{chunk-T4AWY45Q.js.map → chunk-PMBWFYZQ.js.map} +0 -0
  89. /package/dist/{chunk-IXHBRMDB.js.map → chunk-PQ46DC6Y.js.map} +0 -0
  90. /package/dist/{chunk-L5B7PQOP.js.map → chunk-WMM6XVQX.js.map} +0 -0
  91. /package/dist/{chunk-LUJN3VFB.js.map → chunk-ZHRYLT3N.js.map} +0 -0
  92. /package/dist/{chunks-N4CWHTJI.js.map → chunks-GT45ALC5.js.map} +0 -0
  93. /package/dist/{image-ocr-S4REURLR.js.map → image-ocr-HY42AVXC.js.map} +0 -0
  94. /package/dist/{image-ocr-TGHAMIQL.js.map → image-ocr-WCIDB6RY.js.map} +0 -0
  95. /package/dist/{parser-C3APVZGT.js.map → parser-SVZPCCRG.js.map} +0 -0
  96. /package/dist/{parser-KMC4YOZH.js.map → parser-WRNS6MX2.js.map} +0 -0
  97. /package/dist/{pdf-ocr-UDTEQEWA.js.map → pdf-ocr-7AAHJOXQ.js.map} +0 -0
  98. /package/dist/{pdf-ocr-UURMV6FD.js.map → pdf-ocr-WM3RZMZY.js.map} +0 -0
  99. /package/dist/{profile-io-RLQ62KS5.js.map → profile-io-SWGUQSCL.js.map} +0 -0
  100. /package/dist/{rasterize-LBABF2WI.js.map → rasterize-QA7W6QUF.js.map} +0 -0
  101. /package/dist/{render-CYXQEHS7.js.map → render-DRUIPV77.js.map} +0 -0
  102. /package/dist/{seal-SV6PFFYU.js.map → seal-3M4ZSW66.js.map} +0 -0
  103. /package/dist/{watch-XEUEGOXW.js.map → watch-SFQNFU7Q.js.map} +0 -0
@@ -1 +1 @@
1
- {"version":3,"sources":["/Users/chris_gomdori/workspace/kordoc/dist/chunk-DCZVOIEO.cjs","../src/page-range.ts"],"names":[],"mappings":"AAAA;ACSO,SAAS,cAAA,CAAe,IAAA,EAAyB,QAAA,EAA+B;AACrF,EAAA,MAAM,OAAA,kBAAS,IAAI,GAAA,CAAY,CAAA;AAC/B,EAAA,GAAA,CAAI,SAAA,GAAY,CAAA,EAAG,OAAO,MAAA;AAE1B,EAAA,GAAA,CAAI,KAAA,CAAM,OAAA,CAAQ,IAAI,CAAA,EAAG;AACvB,IAAA,IAAA,CAAA,MAAW,EAAA,GAAK,IAAA,EAAM;AACpB,MAAA,MAAM,KAAA,EAAO,IAAA,CAAK,KAAA,CAAM,CAAC,CAAA;AACzB,MAAA,GAAA,CAAI,KAAA,GAAQ,EAAA,GAAK,KAAA,GAAQ,QAAA,EAAU,MAAA,CAAO,GAAA,CAAI,IAAI,CAAA;AAAA,IACpD;AACA,IAAA,OAAO,MAAA;AAAA,EACT;AAEA,EAAA,GAAA,CAAI,OAAO,KAAA,IAAS,SAAA,GAAY,IAAA,CAAK,IAAA,CAAK,EAAA,IAAM,EAAA,EAAI,OAAO,MAAA;AAE3D,EAAA,MAAM,MAAA,EAAQ,IAAA,CAAK,KAAA,CAAM,GAAG,CAAA;AAC5B,EAAA,IAAA,CAAA,MAAW,KAAA,GAAQ,KAAA,EAAO;AACxB,IAAA,MAAM,QAAA,EAAU,IAAA,CAAK,IAAA,CAAK,CAAA;AAC1B,IAAA,GAAA,CAAI,CAAC,OAAA,EAAS,QAAA;AAEd,IAAA,MAAM,WAAA,EAAa,OAAA,CAAQ,KAAA,CAAM,qBAAqB,CAAA;AACtD,IAAA,GAAA,CAAI,UAAA,EAAY;AACd,MAAA,MAAM,MAAA,EAAQ,IAAA,CAAK,GAAA,CAAI,CAAA,EAAG,QAAA,CAAS,UAAA,CAAW,CAAC,CAAA,EAAG,EAAE,CAAC,CAAA;AACrD,MAAA,MAAM,IAAA,EAAM,IAAA,CAAK,GAAA,CAAI,QAAA,EAAU,QAAA,CAAS,UAAA,CAAW,CAAC,CAAA,EAAG,EAAE,CAAC,CAAA;AAC1D,MAAA,IAAA,CAAA,IAAS,EAAA,EAAI,KAAA,EAAO,EAAA,GAAK,GAAA,EAAK,CAAA,EAAA,EAAK,MAAA,CAAO,GAAA,CAAI,CAAC,CAAA;AAAA,IACjD,EAAA,KAAO;AACL,MAAA,MAAM,KAAA,EAAO,QAAA,CAAS,OAAA,EAAS,EAAE,CAAA;AACjC,MAAA,GAAA,CAAI,CAAC,KAAA,CAAM,IAAI,EAAA,GAAK,KAAA,GAAQ,EAAA,GAAK,KAAA,GAAQ,QAAA,EAAU,MAAA,CAAO,GAAA,CAAI,IAAI,CAAA;AAAA,IACpE;AAAA,EACF;AAEA,EAAA,OAAO,MAAA;AACT;ADZA;AACA;AACE;AACF,wCAAC","file":"/Users/chris_gomdori/workspace/kordoc/dist/chunk-DCZVOIEO.cjs","sourcesContent":[null,"/** 페이지/섹션 범위 파싱 유틸리티 */\n\n/**\n * 페이지 범위 지정을 1-based Set<number>로 변환.\n *\n * @param spec - [1,2,3] 또는 \"1-3\" 또는 \"1,3,5-7\"\n * @param maxPages - 최대 페이지 수 (클램핑 상한)\n * @returns 1-based 페이지 번호 Set\n */\nexport function parsePageRange(spec: number[] | string, maxPages: number): Set<number> {\n const result = new Set<number>()\n if (maxPages <= 0) return result\n\n if (Array.isArray(spec)) {\n for (const n of spec) {\n const page = Math.round(n)\n if (page >= 1 && page <= maxPages) result.add(page)\n }\n return result\n }\n\n if (typeof spec !== \"string\" || spec.trim() === \"\") return result\n\n const parts = spec.split(\",\")\n for (const part of parts) {\n const trimmed = part.trim()\n if (!trimmed) continue\n\n const rangeMatch = trimmed.match(/^(\\d+)\\s*-\\s*(\\d+)$/)\n if (rangeMatch) {\n const start = Math.max(1, parseInt(rangeMatch[1], 10))\n const end = Math.min(maxPages, parseInt(rangeMatch[2], 10))\n for (let i = start; i <= end; i++) result.add(i)\n } else {\n const page = parseInt(trimmed, 10)\n if (!isNaN(page) && page >= 1 && page <= maxPages) result.add(page)\n }\n }\n\n return result\n}\n"]}
1
+ {"version":3,"sources":["/Users/mong-e/workspace/kordoc/dist/chunk-DCZVOIEO.cjs","../src/page-range.ts"],"names":[],"mappings":"AAAA;ACSO,SAAS,cAAA,CAAe,IAAA,EAAyB,QAAA,EAA+B;AACrF,EAAA,MAAM,OAAA,kBAAS,IAAI,GAAA,CAAY,CAAA;AAC/B,EAAA,GAAA,CAAI,SAAA,GAAY,CAAA,EAAG,OAAO,MAAA;AAE1B,EAAA,GAAA,CAAI,KAAA,CAAM,OAAA,CAAQ,IAAI,CAAA,EAAG;AACvB,IAAA,IAAA,CAAA,MAAW,EAAA,GAAK,IAAA,EAAM;AACpB,MAAA,MAAM,KAAA,EAAO,IAAA,CAAK,KAAA,CAAM,CAAC,CAAA;AACzB,MAAA,GAAA,CAAI,KAAA,GAAQ,EAAA,GAAK,KAAA,GAAQ,QAAA,EAAU,MAAA,CAAO,GAAA,CAAI,IAAI,CAAA;AAAA,IACpD;AACA,IAAA,OAAO,MAAA;AAAA,EACT;AAEA,EAAA,GAAA,CAAI,OAAO,KAAA,IAAS,SAAA,GAAY,IAAA,CAAK,IAAA,CAAK,EAAA,IAAM,EAAA,EAAI,OAAO,MAAA;AAE3D,EAAA,MAAM,MAAA,EAAQ,IAAA,CAAK,KAAA,CAAM,GAAG,CAAA;AAC5B,EAAA,IAAA,CAAA,MAAW,KAAA,GAAQ,KAAA,EAAO;AACxB,IAAA,MAAM,QAAA,EAAU,IAAA,CAAK,IAAA,CAAK,CAAA;AAC1B,IAAA,GAAA,CAAI,CAAC,OAAA,EAAS,QAAA;AAEd,IAAA,MAAM,WAAA,EAAa,OAAA,CAAQ,KAAA,CAAM,qBAAqB,CAAA;AACtD,IAAA,GAAA,CAAI,UAAA,EAAY;AACd,MAAA,MAAM,MAAA,EAAQ,IAAA,CAAK,GAAA,CAAI,CAAA,EAAG,QAAA,CAAS,UAAA,CAAW,CAAC,CAAA,EAAG,EAAE,CAAC,CAAA;AACrD,MAAA,MAAM,IAAA,EAAM,IAAA,CAAK,GAAA,CAAI,QAAA,EAAU,QAAA,CAAS,UAAA,CAAW,CAAC,CAAA,EAAG,EAAE,CAAC,CAAA;AAC1D,MAAA,IAAA,CAAA,IAAS,EAAA,EAAI,KAAA,EAAO,EAAA,GAAK,GAAA,EAAK,CAAA,EAAA,EAAK,MAAA,CAAO,GAAA,CAAI,CAAC,CAAA;AAAA,IACjD,EAAA,KAAO;AACL,MAAA,MAAM,KAAA,EAAO,QAAA,CAAS,OAAA,EAAS,EAAE,CAAA;AACjC,MAAA,GAAA,CAAI,CAAC,KAAA,CAAM,IAAI,EAAA,GAAK,KAAA,GAAQ,EAAA,GAAK,KAAA,GAAQ,QAAA,EAAU,MAAA,CAAO,GAAA,CAAI,IAAI,CAAA;AAAA,IACpE;AAAA,EACF;AAEA,EAAA,OAAO,MAAA;AACT;ADZA;AACA;AACE;AACF,wCAAC","file":"/Users/mong-e/workspace/kordoc/dist/chunk-DCZVOIEO.cjs","sourcesContent":[null,"/** 페이지/섹션 범위 파싱 유틸리티 */\n\n/**\n * 페이지 범위 지정을 1-based Set<number>로 변환.\n *\n * @param spec - [1,2,3] 또는 \"1-3\" 또는 \"1,3,5-7\"\n * @param maxPages - 최대 페이지 수 (클램핑 상한)\n * @returns 1-based 페이지 번호 Set\n */\nexport function parsePageRange(spec: number[] | string, maxPages: number): Set<number> {\n const result = new Set<number>()\n if (maxPages <= 0) return result\n\n if (Array.isArray(spec)) {\n for (const n of spec) {\n const page = Math.round(n)\n if (page >= 1 && page <= maxPages) result.add(page)\n }\n return result\n }\n\n if (typeof spec !== \"string\" || spec.trim() === \"\") return result\n\n const parts = spec.split(\",\")\n for (const part of parts) {\n const trimmed = part.trim()\n if (!trimmed) continue\n\n const rangeMatch = trimmed.match(/^(\\d+)\\s*-\\s*(\\d+)$/)\n if (rangeMatch) {\n const start = Math.max(1, parseInt(rangeMatch[1], 10))\n const end = Math.min(maxPages, parseInt(rangeMatch[2], 10))\n for (let i = start; i <= end; i++) result.add(i)\n } else {\n const page = parseInt(trimmed, 10)\n if (!isNaN(page) && page >= 1 && page <= maxPages) result.add(page)\n }\n }\n\n return result\n}\n"]}
@@ -4,7 +4,7 @@ import {
4
4
  } from "./chunk-J2RZ444H.js";
5
5
  import {
6
6
  extractPageBlocksWithLines
7
- } from "./chunk-X77U36TV.js";
7
+ } from "./chunk-GFTAPAJS.js";
8
8
 
9
9
  // src/ocr/ruling-lines.ts
10
10
  var INK_LUMA_MAX = 190;
@@ -557,4 +557,4 @@ export {
557
557
  runPdfOcr,
558
558
  ocrItemsToBlocks
559
559
  };
560
- //# sourceMappingURL=chunk-MOOVF6CT.js.map
560
+ //# sourceMappingURL=chunk-DOLK5KIS.js.map
@@ -1,7 +1,7 @@
1
1
  #!/usr/bin/env node
2
2
 
3
3
  // src/utils.ts
4
- var VERSION = true ? "4.2.2" : "0.0.0-dev";
4
+ var VERSION = true ? "4.2.4" : "0.0.0-dev";
5
5
  function toArrayBuffer(buf) {
6
6
  if (buf.byteOffset === 0 && buf.byteLength === buf.buffer.byteLength) {
7
7
  return buf.buffer;
@@ -121,4 +121,4 @@ export {
121
121
  safeMax,
122
122
  classifyError
123
123
  };
124
- //# sourceMappingURL=chunk-2L7MIKOM.js.map
124
+ //# sourceMappingURL=chunk-E2K4SNMD.js.map
@@ -4,7 +4,7 @@ import {
4
4
  HEADING_RATIO_H3,
5
5
  safeMax,
6
6
  safeMin
7
- } from "./chunk-GUYIXVV7.js";
7
+ } from "./chunk-OBX3VSIZ.js";
8
8
 
9
9
  // src/pdf/image-regions.ts
10
10
  import { OPS } from "pdfjs-dist/legacy/build/pdf.mjs";
@@ -3340,4 +3340,4 @@ export {
3340
3340
  extractPageBlocksWithLines,
3341
3341
  mergeCrossPageTables
3342
3342
  };
3343
- //# sourceMappingURL=chunk-X77U36TV.js.map
3343
+ //# sourceMappingURL=chunk-GFTAPAJS.js.map
@@ -10,4 +10,4 @@ export {
10
10
  HEADING_RATIO_H2,
11
11
  HEADING_RATIO_H3
12
12
  };
13
- //# sourceMappingURL=chunk-ZF7QL4IY.js.map
13
+ //# sourceMappingURL=chunk-GJO3ORFW.js.map
@@ -0,0 +1 @@
1
+ {"version":3,"sources":["../src/types.ts"],"sourcesContent":["/** kordoc 공통 타입 정의 */\n\n// ─── 중간 표현 (Intermediate Representation) ─────────\n\nexport interface CellContext {\n text: string\n colSpan: number\n rowSpan: number\n /** HWP5 셀 열 주소 (0-based) — 병합 테이블 배치용 */\n colAddr?: number\n /** HWP5 셀 행 주소 (0-based) — 병합 테이블 배치용 */\n rowAddr?: number\n}\n\n/** 블록 타입 — v2.0에서 heading, list, image, separator 추가 */\nexport type IRBlockType = \"paragraph\" | \"table\" | \"heading\" | \"list\" | \"image\" | \"separator\"\n\n/** 인라인 강조 run-span — 문단 텍스트를 서식 단위로 쪼갠 조각 (텍스트 연결 = block.text) */\nexport interface IRSpan {\n text: string\n bold?: boolean\n italic?: boolean\n strike?: boolean\n code?: boolean\n}\n\nexport interface IRBlock {\n type: IRBlockType\n text?: string\n table?: IRTable\n /** 헤딩 레벨 (1-6), type=\"heading\"일 때 사용 */\n level?: number\n /** 원본 페이지 번호 (1-based) */\n pageNumber?: number\n /** 바운딩 박스 — PDF에서만 제공 */\n bbox?: BoundingBox\n /** 텍스트 스타일 정보 (선택) */\n style?: InlineStyle\n /** 리스트 타입, type=\"list\"일 때 사용 */\n listType?: \"ordered\" | \"unordered\"\n /** 중첩 리스트 아이템 */\n children?: IRBlock[]\n /** 하이퍼링크 URL */\n href?: string\n /** 각주/미주 텍스트 (인라인 삽입용) */\n footnoteText?: string\n /** 이미지 데이터 (type=\"image\"일 때) */\n imageData?: ImageData\n /** 인라인 강조 run-span (선택 — kordoc 생성 hwpx 왕복 채널 + 외래 실속성 볼드/이탤릭).\n * 존재하면 마크다운 변환이 **·*·` 마커를 재방출한다 */\n spans?: IRSpan[]\n /** 인용문 문단 (선택 — kordoc 생성 hwpx 왕복 채널) — 마크다운 변환이 \"> \" 접두 재방출 */\n quote?: boolean\n /**\n * 문단 들여쓰기(HWPUNIT, 선택) — HWPX paraPr `<hh:margin>` 자식요소형 hc:left\n * (+양수 hc:intent 첫줄분). 마크다운 방출엔 쓰지 않는 관찰 슬롯 — gongmun 리스트\n * depth 재유도·양식 분석 등 소비자 몫 (v4.0.4)\n */\n indent?: number\n /**\n * gongmun 리스트 단계(1~7, 선택) — indent를 levelIndent 단위로 역산한 소비 결과\n * (v4.0.5). md 리스트 문법과 충돌하는 부호('- '·'1) ') 문단에만 채워지며,\n * 마크다운 변환이 2칸/단계 선행 공백을 방출해 재생성 시 depth가 복원된다\n */\n listDepth?: number\n}\n\n/** 추출된 이미지 바이너리 데이터 */\nexport interface ImageData {\n /** 이미지 바이너리 */\n data: Uint8Array\n /** MIME 타입 (image/png, image/jpeg, image/gif, image/bmp, image/wmf, image/emf) */\n mimeType: string\n /** 원본 파일명 (있는 경우) */\n filename?: string\n}\n\n/** 바운딩 박스 — PDF 포인트 단위 (72pt = 1인치) */\nexport interface BoundingBox {\n page: number\n x: number\n y: number\n width: number\n height: number\n}\n\n/** 인라인 텍스트 스타일 */\nexport interface InlineStyle {\n bold?: boolean\n italic?: boolean\n /** 취소선 — 법령 개정문 등의 삭제 표시. 판정은 취소선 모양 whitelist (비트만 믿으면 오탐) */\n strike?: boolean\n fontSize?: number\n fontName?: string\n}\n\nexport interface IRTable {\n rows: number\n cols: number\n cells: IRCell[][]\n /** 첫 행을 헤더로 렌더링할지 여부 (현재: rows > 1이면 true — 의미적 감지가 아닌 레이아웃 힌트) */\n hasHeader: boolean\n /** 표 캡션 (예: \"표 1. 부서별 예산\") — v3.0 */\n caption?: string\n}\n\nexport interface IRCell {\n text: string\n colSpan: number\n rowSpan: number\n /**\n * 셀 내부 블록 콘텐츠 — v3.0.\n * 중첩 표·이미지·다중 문단을 구조 그대로, 문서(원문) 순서대로 보존한다.\n * 표와 텍스트가 한 줄에 번갈아 놓인 셀도 배치 순서를 따른다 (v4.2.3, #49).\n * blocks가 있으면 text는 blocks의 평탄화 텍스트(하위 호환용)다.\n */\n blocks?: IRBlock[]\n /** 제목 셀 여부 (HWP5 width_ref bit2 / HWPX header 속성) — v3.0 */\n isHeader?: boolean\n}\n\n// ─── 메타데이터 ─────────────────────────────────────\n\n/** 문서 메타데이터 — 각 포맷에서 추출 가능한 필드만 채워짐 */\nexport interface DocumentMetadata {\n /** 문서 제목 */\n title?: string\n /** 작성자 */\n author?: string\n /** 작성 프로그램 (예: \"한글 2020\", \"Adobe Acrobat\") */\n creator?: string\n /** 생성일시 (ISO 8601) */\n createdAt?: string\n /** 수정일시 (ISO 8601) */\n modifiedAt?: string\n /** 페이지/섹션 수 */\n pageCount?: number\n /** 문서 포맷 버전 (예: HWP \"5.1.0.1\") */\n version?: string\n /** 설명 */\n description?: string\n /** 키워드 */\n keywords?: string[]\n}\n\n// ─── 파싱 옵션 ──────────────────────────────────────\n\n/** 파싱 옵션 — parse() 함수에 전달 */\nexport interface ParseOptions {\n /**\n * 파싱할 페이지/섹션 범위 (1-based).\n * - 배열: [1, 2, 3]\n * - 문자열: \"1-3\", \"1,3,5-7\"\n *\n * PDF: 정확한 페이지 단위. HWP/HWPX: 섹션 단위 근사치.\n */\n pages?: number[] | string\n /** 이미지 기반 PDF OCR (선택).\n * - `true`: 내장 엔진(PP-OCRv5 korean, ~18MB 자동 다운로드)으로 OCR 필요 판정\n * 페이지만 인식 (스캔 페이지·글꼴 매핑 깨진 페이지). 정상 페이지는 파싱 결과 유지.\n * - `\"force\"`: 전 페이지를 내장 엔진으로 강제 OCR.\n * - 함수: 사용자 제공 OcrProvider (Claude Vision·Tesseract 등) — 판정은 `true`와 동일. */\n ocr?: boolean | \"force\" | OcrProvider\n /** 진행률 콜백 — current: 현재 페이지/섹션, total: 전체 수 */\n onProgress?: (current: number, total: number) => void\n /** PDF 머리글/바닥글 자동 제거 */\n removeHeaderFooter?: boolean\n /** 표 오른쪽 끝의 빈 열(서식 문서의 입력란) 보존 (#47).\n * 기본 false: 마크다운 가독성을 위해 후행 빈 열을 트림.\n * 양식 인식 경로(parse_form·fill)는 내부적으로 항상 켠다. */\n keepTrailingEmptyCols?: boolean\n /** 원본 파일 경로 (DRM COM fallback에 필요, 내부 전용) */\n filePath?: string\n /**\n * PDF 수식 OCR 활성화 (기본 false).\n *\n * 활성화 시 각 PDF 페이지를 이미지로 렌더링 → YOLOv8 기반 수식 영역 검출 →\n * TrOCR 기반 LaTeX 인식. 감지된 수식은 `$...$` (inline) / `$$...$$` (display) 로\n * 블록 텍스트에 삽입된다.\n *\n * 필수 optional 의존성: `onnxruntime-node`, `@huggingface/transformers`,\n * `@hyzyla/pdfium`, `sharp`. 미설치 시 parse 에 실패하지 않고 **경고만** 남기고\n * 수식 인식은 skip 한다 (일반 텍스트 추출은 정상 동작).\n *\n * 모델(~155MB) 은 첫 사용 시 HuggingFace 에서 자동 다운로드 되어\n * `~/.cache/kordoc/models/pix2text/` 에 SHA-256 검증과 함께 저장된다.\n */\n formulaOcr?: boolean\n /**\n * 레이아웃 표 페이지 반복 헤더(러닝 헤더) 정리 휴리스틱 활성화 (기본 false).\n *\n * 구형 HWP5 문서가 페이지마다 재삽입한 짧은 번호매김 러닝 헤더\n * (\"2. 과제 구축 내용\")를 최초 1회만 남기고 이후 중복을 제거한다.\n * 다만 페이지 위치 정보가 없는 HWP5 특성상 이 휴리스틱은 정당하게 반복되는\n * 번호매김 문단(예: 붙임/별지별 재번호 \"1. 목적\")도 삭제할 수 있어 opt-in 으로\n * 둔다. 활성 시 제거가 발생하면 HIDDEN_TEXT_FILTERED 경고를 남긴다.\n */\n dedupeRunningHeaders?: boolean\n /**\n * 추출된 이미지를 마크다운에 base64 data URI 로 인라인 (기본 false).\n *\n * 활성화 시 `![image](image_001.bmp)` 참조를 `![image](data:image/png;base64,...)` 로\n * 치환한다. 임베드된 BMP 는 PNG 로 무손실 압축 후 인라인하여 용량을 크게 줄인다.\n * 별도 이미지 파일 없이 자체 완결형 마크다운이 되어 MCP/AI 에이전트 소비에 적합하다.\n * (현재 HWP5 경로 지원)\n */\n inlineImages?: boolean\n}\n\n// ─── 파싱 경고 ──────────────────────────────────────\n\n/** 파싱 중 스킵/실패한 요소 보고 */\nexport interface ParseWarning {\n /** 관련 페이지 번호 (알 수 있는 경우) */\n page?: number\n /** 경고 메시지 */\n message: string\n /** 구조화된 경고 코드 */\n code: WarningCode\n}\n\nexport type WarningCode =\n | \"SKIPPED_IMAGE\"\n | \"SKIPPED_OLE\"\n | \"TRUNCATED_TABLE\"\n | \"OCR_FALLBACK\"\n | \"UNSUPPORTED_ELEMENT\"\n | \"BROKEN_ZIP_RECOVERY\"\n | \"HIDDEN_TEXT_FILTERED\"\n | \"MALFORMED_XML\"\n | \"PARTIAL_PARSE\"\n | \"LENIENT_CFB_RECOVERY\"\n | \"NEEDS_OCR\"\n | \"OCR_FAILED\"\n | \"OCR_APPLIED\"\n | \"COM_EMPTY\"\n | \"DRM_COM_FALLBACK\"\n\n/** 문서 구조 (헤딩 트리) */\nexport interface OutlineItem {\n level: number\n text: string\n pageNumber?: number\n}\n\n// ─── 에러 코드 ──────────────────────────────────────\n\n/** 구조화된 에러 코드 — 프로그래밍적 에러 핸들링용 */\nexport type ErrorCode =\n | \"EMPTY_INPUT\"\n | \"UNSUPPORTED_FORMAT\"\n | \"ENCRYPTED\"\n | \"DRM_PROTECTED\"\n | \"CORRUPTED\"\n | \"DECOMPRESSION_BOMB\"\n | \"ZIP_BOMB\"\n | \"IMAGE_BASED_PDF\"\n | \"NO_SECTIONS\"\n | \"PARSE_ERROR\"\n | \"MISSING_DEPENDENCY\"\n\n// ─── 파싱 결과 (discriminated union) ────────────────\n\nexport type FileType = \"hwpx\" | \"hwp\" | \"hwp3\" | \"hwpml\" | \"pdf\" | \"xlsx\" | \"xls\" | \"docx\" | \"image\" | \"unknown\"\n\ninterface ParseResultBase {\n fileType: FileType\n /** 페이지/섹션 수 — PDF: 실제 페이지 수, HWP/HWPX: 섹션 수, XLSX: 시트 수 */\n pageCount?: number\n /** 이미지 기반 PDF 여부 (텍스트 추출 불가) */\n isImageBased?: boolean\n}\n\nexport interface ParseSuccess extends ParseResultBase {\n success: true\n /** 추출된 마크다운 텍스트 */\n markdown: string\n /**\n * 중간 표현 블록 (구조화된 데이터 접근용).\n * 블록은 문서(원문) 읽기 순서를 따른다 — 한 문단 안에 글자취급(treatAsChar)\n * 표와 텍스트가 섞여 있어도 배치 순서대로 방출된다 (v4.2.3, #50).\n */\n blocks: IRBlock[]\n /** 문서 메타데이터 */\n metadata?: DocumentMetadata\n /** 문서 구조 (헤딩 트리) — v2.0 */\n outline?: OutlineItem[]\n /** 파싱 중 발생한 경고 — v2.0 */\n warnings?: ParseWarning[]\n /** 추출된 이미지 목록 — 마크다운에서 파일명으로 참조됨 */\n images?: ExtractedImage[]\n /** 페이지별 텍스트 품질 신호 — PDF에서만 제공 */\n pageQuality?: PageQuality[]\n /** 문서 단위 품질 요약 — PDF에서만 제공 */\n qualitySummary?: DocumentQualitySummary\n}\n\n/** 페이지별 텍스트 품질 신호 (PDF 전용). 자세한 설명은 src/pdf/quality.ts */\nexport interface PageQuality {\n page: number\n textChars: number\n hangulRatio: number\n controlCharRatio: number\n replacementCharRatio: number\n puaRatio: number\n needsOcr: boolean\n ocrReason?: \"low_text\" | \"high_pua\" | \"high_control\" | \"high_replacement\" | \"garbled_hangul\"\n}\n\n/** 문서 단위 품질 요약 (PDF 전용). */\nexport interface DocumentQualitySummary {\n totalPages: number\n totalTextChars: number\n avgHangulRatio: number\n avgControlCharRatio: number\n avgReplacementCharRatio: number\n avgPuaRatio: number\n lowTextPageCount: number\n highPuaPageCount: number\n needsOcr: boolean\n ocrCandidatePages: number[]\n}\n\n/** 추출된 이미지 — ParseSuccess.images에 포함 */\nexport interface ExtractedImage {\n /** 마크다운에서 참조되는 파일명 (예: image_001.png) */\n filename: string\n /** 이미지 바이너리 */\n data: Uint8Array\n /** MIME 타입 */\n mimeType: string\n}\n\nexport interface ParseFailure extends ParseResultBase {\n success: false\n /** 오류 메시지 */\n error: string\n /** 구조화된 에러 코드 */\n code?: ErrorCode\n}\n\nexport type ParseResult = ParseSuccess | ParseFailure\n\n// ─── 문서 비교 (Diff) ───────────────────────────────\n\nexport type DiffChangeType = \"added\" | \"removed\" | \"modified\" | \"unchanged\"\n\nexport interface BlockDiff {\n type: DiffChangeType\n /** 원본 블록 (added이면 undefined) */\n before?: IRBlock\n /** 변경 후 블록 (removed이면 undefined) */\n after?: IRBlock\n /** modified 테이블의 셀 단위 diff */\n cellDiffs?: CellDiff[][]\n /** 유사도 (0-1) */\n similarity?: number\n}\n\nexport interface CellDiff {\n type: DiffChangeType\n before?: string\n after?: string\n}\n\nexport interface DiffResult {\n stats: { added: number; removed: number; modified: number; unchanged: number }\n diffs: BlockDiff[]\n}\n\n// ─── 라운드트립 패치 (v3.0) ─────────────────────────\n\n/** 패치 중 매핑 실패/미지원으로 건너뛴 항목 — silent 실패 금지 */\nexport interface PatchSkip {\n /** 건너뛴 사유 */\n reason: string\n /** 원본 쪽 내용 요약 (최대 80자) */\n before?: string\n /** 편집 쪽 내용 요약 (최대 80자) */\n after?: string\n /**\n * 부분 적용 표시 — 변경이 적용은 됐지만(applied 계상) 편집 원형 그대로는\n * 아님 (예: 셀 내 줄 추가를 마지막 문단에 병합). 완전 미적용 skip과 구분.\n */\n partial?: boolean\n}\n\n/** patchHwpx 옵션 */\nexport interface PatchOptions {\n /** 패치 후 재파싱 자동 검증 (기본 true) */\n verify?: boolean\n}\n\n/** patchHwpx / patchBlocks 결과 */\nexport interface PatchResult {\n success: boolean\n /** 패치된 HWPX (success=true) */\n data?: Uint8Array\n /** 적용된 변경 수 */\n applied: number\n /** 매핑 실패 항목 (이유 포함) */\n skipped: PatchSkip[]\n /**\n * 무손실 검증 (patchHwpx/patchHwp 전용): 패치본 재파싱 vs 편집 마크다운의\n * 잔차 diff — modified/added/removed가 0이어야 의도가 전부 반영된 것.\n * session.patchBlocks는 이 필드를 채우지 않는다 (changes 참조).\n */\n verification?: DiffResult\n /**\n * 변경 가시화 (session.patchBlocks 전용): 패치 전 → 후 문서 diff —\n * 적용된 편집 수만큼 modified가 나오는 것이 정상. verification과 의미가\n * 정반대이므로 혼용 금지.\n */\n changes?: DiffResult\n /** 실패 사유 (success=false) */\n error?: string\n}\n\n// ─── 양식 인식 ──────────────────────────────────────\n\nexport interface FormField {\n label: string\n value: string\n /** 0-based 소스 행 */\n row: number\n /** 0-based 소스 열 */\n col: number\n /** 매칭된 입력 키(정규화) — 모호 라벨 거부 가드(fillWithUniqueGuard)의 집계 기준 */\n key?: string\n}\n\nexport interface FormResult {\n fields: FormField[]\n /** 양식 확신도 (0-1) */\n confidence: number\n}\n\n// ─── OCR 프로바이더 ─────────────────────────────────\n\n/** 사용자 제공 OCR 함수 — 페이지 이미지를 받아 텍스트 반환 */\nexport type OcrProvider = (\n pageImage: Uint8Array,\n pageNumber: number,\n mimeType: \"image/png\"\n) => Promise<string>\n\n// ─── Watch 모드 ─────────────────────────────────────\n\nexport interface WatchOptions {\n dir: string\n outDir?: string\n webhook?: string\n format?: \"markdown\" | \"json\"\n pages?: string\n silent?: boolean\n}\n\n// ─── 헤딩 감지 공통 임계값 ──────────────────────────\n\n/** 폰트 크기 비율 → heading level (전 파서 공통) */\nexport const HEADING_RATIO_H1 = 1.5\nexport const HEADING_RATIO_H2 = 1.3\nexport const HEADING_RATIO_H3 = 1.15\n\n// ─── 내부 파서 반환 타입 ─────────────────────────────\n\n/** 내부 파서가 index.ts에 반환하는 공통 타입 (HWP5/HWPX/PDF/XLSX/DOCX) */\nexport interface InternalParseResult {\n markdown: string\n blocks: IRBlock[]\n metadata?: DocumentMetadata\n outline?: OutlineItem[]\n warnings?: ParseWarning[]\n images?: ExtractedImage[]\n /** PDF 전용: 이미지 기반 PDF 여부 */\n isImageBased?: boolean\n /** PDF 전용: 페이지별 품질 신호 */\n pageQuality?: PageQuality[]\n /** PDF 전용: 문서 단위 품질 요약 */\n qualitySummary?: DocumentQualitySummary\n}\n"],"mappings":";;;AA4cO,IAAM,mBAAmB;AACzB,IAAM,mBAAmB;AACzB,IAAM,mBAAmB;","names":[]}
@@ -1 +1 @@
1
- {"version":3,"sources":["/Users/chris_gomdori/workspace/kordoc/dist/chunk-GS7T56RP.cjs","../node_modules/tsup/assets/cjs_shims.js"],"names":[],"mappings":"AAAA;ACKA,IAAM,iBAAA,EAAmB,CAAA,EAAA,GACvB,OAAO,SAAA,IAAa,YAAA,EAChB,IAAI,GAAA,CAAI,CAAA,KAAA,EAAQ,UAAU,CAAA,CAAA;AAK8B;ADT4B;AACA;AACA;AACA","file":"/Users/chris_gomdori/workspace/kordoc/dist/chunk-GS7T56RP.cjs","sourcesContent":[null,"// Shim globals in cjs bundle\n// There's a weird bug that esbuild will always inject importMetaUrl\n// if we export it as `const importMetaUrl = ... __filename ...`\n// But using a function will not cause this issue\n\nconst getImportMetaUrl = () => \n typeof document === \"undefined\" \n ? new URL(`file:${__filename}`).href \n : (document.currentScript && document.currentScript.tagName.toUpperCase() === 'SCRIPT') \n ? document.currentScript.src \n : new URL(\"main.js\", document.baseURI).href;\n\nexport const importMetaUrl = /* @__PURE__ */ getImportMetaUrl()\n"]}
1
+ {"version":3,"sources":["/Users/mong-e/workspace/kordoc/dist/chunk-GS7T56RP.cjs","../node_modules/tsup/assets/cjs_shims.js"],"names":[],"mappings":"AAAA;ACKA,IAAM,iBAAA,EAAmB,CAAA,EAAA,GACvB,OAAO,SAAA,IAAa,YAAA,EAChB,IAAI,GAAA,CAAI,CAAA,KAAA,EAAQ,UAAU,CAAA,CAAA;AAK8B;ADT4B;AACA;AACA;AACA","file":"/Users/mong-e/workspace/kordoc/dist/chunk-GS7T56RP.cjs","sourcesContent":[null,"// Shim globals in cjs bundle\n// There's a weird bug that esbuild will always inject importMetaUrl\n// if we export it as `const importMetaUrl = ... __filename ...`\n// But using a function will not cause this issue\n\nconst getImportMetaUrl = () => \n typeof document === \"undefined\" \n ? new URL(`file:${__filename}`).href \n : (document.currentScript && document.currentScript.tagName.toUpperCase() === 'SCRIPT') \n ? document.currentScript.src \n : new URL(\"main.js\", document.baseURI).href;\n\nexport const importMetaUrl = /* @__PURE__ */ getImportMetaUrl()\n"]}
@@ -1,7 +1,7 @@
1
1
  #!/usr/bin/env node
2
2
  import {
3
3
  KordocError
4
- } from "./chunk-2L7MIKOM.js";
4
+ } from "./chunk-E2K4SNMD.js";
5
5
 
6
6
  // src/hwpx/parser-shared.ts
7
7
  import { DOMParser } from "@xmldom/xmldom";
@@ -273,4 +273,4 @@ export {
273
273
  DEFAULT_CHAR,
274
274
  parseRenderStyles
275
275
  };
276
- //# sourceMappingURL=chunk-FHYLLKIP.js.map
276
+ //# sourceMappingURL=chunk-H6O65EPK.js.map
@@ -1 +1 @@
1
- {"version":3,"sources":["/Users/chris_gomdori/workspace/kordoc/dist/chunk-H7OWEYH2.cjs","../src/pdf/formula/models.ts"],"names":[],"mappings":"AAAA;ACUA,gCAA2B;AAC3B,wBAAiC;AACjC,uCAA4C;AAC5C;AACA,wBAAwB;AACxB,4BAA8B;AAC9B,4CAAyB;AACzB,gCAAyB;AAWlB,IAAM,UAAA,EAAuB;AAAA,EAClC,IAAA,EAAM,cAAA;AAAA,EACN,QAAA,EAAU,UAAA;AAAA,EACV,GAAA,EAAK,gFAAA;AAAA,EACL,MAAA,EAAQ,kEAAA;AAAA,EACR,MAAA,EAAQ;AACV,CAAA;AAEO,IAAM,kBAAA,EAA+B;AAAA,EAC1C,IAAA,EAAM,sBAAA;AAAA,EACN,QAAA,EAAU,oBAAA;AAAA,EACV,GAAA,EAAK,gFAAA;AAAA,EACL,MAAA,EAAQ,kEAAA;AAAA,EACR,MAAA,EAAQ;AACV,CAAA;AAEO,IAAM,kBAAA,EAA+B;AAAA,EAC1C,IAAA,EAAM,sBAAA;AAAA,EACN,QAAA,EAAU,oBAAA;AAAA,EACV,GAAA,EAAK,gFAAA;AAAA,EACL,MAAA,EAAQ,kEAAA;AAAA,EACR,MAAA,EAAQ;AACV,CAAA;AAEO,IAAM,cAAA,EAA2B;AAAA,EACtC,IAAA,EAAM,wBAAA;AAAA,EACN,QAAA,EAAU,gBAAA;AAAA,EACV,GAAA,EAAK,4EAAA;AAAA,EACL,MAAA,EAAQ,kEAAA;AAAA,EACR,MAAA,EAAQ;AACV,CAAA;AAEO,IAAM,mBAAA,EAA+C;AAAA,EAC1D,SAAA;AAAA,EACA,iBAAA;AAAA,EACA,iBAAA;AAAA,EACA;AACF,CAAA;AAOO,SAAS,YAAA,CAAa,MAAA,EAAwB;AACnD,EAAA,MAAM,SAAA,EAAW,OAAA,CAAQ,GAAA,CAAI,kBAAA;AAC7B,EAAA,GAAA,CAAI,SAAA,GAAY,QAAA,CAAS,IAAA,CAAK,CAAA,EAAG;AAC/B,IAAA,OAAO,wBAAA,QAAK,EAAU,MAAM,CAAA;AAAA,EAC9B;AACA,EAAA,OAAO,wBAAA,yBAAK,CAAQ,EAAG,QAAA,EAAU,QAAA,EAAU,QAAA,EAAU,MAAM,CAAA;AAC7D;AAEO,SAAS,mBAAA,CAAA,EAA8B;AAC5C,EAAA,OAAO,YAAA,CAAa,UAAU,CAAA;AAChC;AAaA,MAAA,SAAsB,gBAAA,CAAiB,GAAA,EAAa,KAAA,EAAyD;AAC3G,EAAA,MAAM,OAAA,EAAwB,CAAC,CAAA;AAC/B,EAAA,IAAA,CAAA,MAAW,KAAA,GAAQ,KAAA,EAAO;AACxB,IAAA,MAAM,UAAA,EAAY,wBAAA,GAAK,EAAK,IAAA,CAAK,QAAQ,CAAA;AACzC,IAAA,IAAI,OAAA,EAAS,KAAA;AACb,IAAA,IAAI;AACF,MAAA,MAAM,EAAA,EAAI,MAAM,4BAAA,SAAc,CAAA;AAC9B,MAAA,OAAA,EAAS,CAAA,CAAE,MAAA,CAAO,EAAA,GAAK,CAAA,CAAE,KAAA,EAAO,CAAA;AAAA,IAClC,EAAA,WAAQ;AACN,MAAA,OAAA,EAAS,KAAA;AAAA,IACX;AACA,IAAA,GAAA,CAAI,CAAC,MAAA,EAAQ;AACX,MAAA,MAAA,CAAO,IAAA,CAAK,EAAE,IAAA,EAAM,SAAA,EAAW,MAAA,EAAQ,KAAA,EAAO,QAAA,EAAU,MAAM,CAAC,CAAA;AAC/D,MAAA,QAAA;AAAA,IACF;AACA,IAAA,IAAI;AACF,MAAA,MAAM,OAAA,EAAS,MAAM,YAAA,CAAa,SAAS,CAAA;AAC3C,MAAA,GAAA,CAAI,OAAA,IAAW,IAAA,CAAK,MAAA,EAAQ;AAC1B,QAAA,MAAA,CAAO,IAAA,CAAK,EAAE,IAAA,EAAM,SAAA,EAAW,MAAA,EAAQ,IAAA,EAAM,QAAA,EAAU,KAAK,CAAC,CAAA;AAAA,MAC/D,EAAA,KAAO;AACL,QAAA,MAAA,CAAO,IAAA,CAAK;AAAA,UACV,IAAA;AAAA,UACA,SAAA;AAAA,UACA,MAAA,EAAQ,IAAA;AAAA,UACR,QAAA,EAAU,KAAA;AAAA,UACV,aAAA,EAAe,CAAA,0BAAA,EAA6B,IAAA,CAAK,MAAM,CAAA,MAAA,EAAS,MAAM,CAAA;AAAA,QAAA;AACvE,MAAA;AACH,IAAA;AAEA,MAAA;AAAY,QAAA;AACV,QAAA;AACA,QAAA;AACQ,QAAA;AACE,QAAA;AACgD,MAAA;AAC3D,IAAA;AACH,EAAA;AAEF,EAAA;AACF;AAGA;AACE,EAAA;AACF;AAoBA;AACE,EAAA;AAEA,EAAA;AACE,IAAA;AAEA,IAAA;AACE,sBAAA;AAAa,QAAA;AACX,QAAA;AACY,QAAA;AACL,QAAA;AACA,QAAA;AACE,MAAA;AAEX,MAAA;AAAA,IAAA;AAIF,IAAA;AACE,MAAA;AAAsB,IAAA;AAChB,IAAA;AAIR,IAAA;AAAgD,EAAA;AAEpD;AAGA;AACE,EAAA;AACF;AAGA;AACE,EAAA;AACA,EAAA;AACA,EAAA;AACA,EAAA;AACE,oBAAA;AACA,IAAA;AAAA,EAAA;AAEF,EAAA;AACE,IAAA;AAAsB,EAAA;AAChB,EAAA;AACR,EAAA;AACF;AAEA;AACE,EAAA;AACE,IAAA;AACA,IAAA;AAAwC,EAAA;AAExC,IAAA;AAAO,EAAA;AAET,EAAA;AACE,IAAA;AACA,IAAA;AAAkB,EAAA;AAElB,IAAA;AAAO,EAAA;AAEX;AAEA;AAME,EAAA;AACA,EAAA;AAEA,EAAA;AAAmC,IAAA;AACxB;AAAA,MAAA;AAEO,IAAA;AAChB,EAAA;AAEF,EAAA;AACE,IAAA;AAAU,MAAA;AACiE,IAAA;AAC3E,EAAA;AAGF,EAAA;AACA,EAAA;AACA,EAAA;AAEA,EAAA;AACA,EAAA;AACE,IAAA;AACA,IAAA;AACE,MAAA;AACA,sBAAA;AAAa,QAAA;AACX,QAAA;AACA,QAAA;AACA,QAAA;AACO,MAAA;AACR,IAAA;AAEH,IAAA;AAAyB,EAAA;AAEzB,IAAA;AACE,MAAA;AAAqB,IAAA;AACf,IAAA;AACR,IAAA;AAA+D,EAAA;AAGjE,kBAAA;AAAa,IAAA;AACX,IAAA;AACA,IAAA;AACA,IAAA;AACO,EAAA;AAIT,EAAA;AACA,EAAA;AACE,IAAA;AAAoC,EAAA;AAEpC,IAAA;AACE,MAAA;AAAqB,IAAA;AACf,IAAA;AACR,IAAA;AAAiE,EAAA;AAGnE,EAAA;AACE,IAAA;AACE,MAAA;AAAqB,IAAA;AACf,IAAA;AACR,IAAA;AAAU,MAAA;AAC4D,IAAA;AACtE,EAAA;AAGF,EAAA;AACA,kBAAA;AAAa,IAAA;AACX,IAAA;AACA,IAAA;AACA,IAAA;AACO,EAAA;AAEX;AAEA;AACE,EAAA;AACA,EAAA;AACA,EAAA;AACE,IAAA;AACE,MAAA;AAAc,IAAA;AAEhB,EAAA;AAEF,EAAA;AACF;ADrFA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA","file":"/Users/chris_gomdori/workspace/kordoc/dist/chunk-H7OWEYH2.cjs","sourcesContent":[null,"/**\n * 수식 OCR 모델 자동 다운로드 + SHA-256 검증\n *\n * 캐시 위치: `~/.cache/kordoc/models/pix2text/`\n * 총 ~155MB (MFD 44MB + MFR encoder 87MB + MFR decoder 30MB + tokenizer 40KB)\n *\n * HF URL + SHA 는 Docufinder archive/rust-formula-ocr-wip 에서 검증 완료됨.\n * 모델 버전 갱신 시 URL + SHA 를 함께 갱신해야 한다.\n */\n\nimport { createHash } from \"crypto\"\nimport { createReadStream } from \"fs\"\nimport { mkdir, stat, unlink, rename } from \"fs/promises\"\nimport { createWriteStream } from \"fs\"\nimport { homedir } from \"os\"\nimport { join, dirname } from \"path\"\nimport { pipeline } from \"stream/promises\"\nimport { Readable } from \"stream\"\n\nexport interface ModelSpec {\n name: string\n filename: string\n url: string\n sha256: string\n sizeMb: number\n}\n\n/** 모델 스펙 (SHA-256 은 실제 다운로드로 검증됨 — 변경 금지) */\nexport const MFD_MODEL: ModelSpec = {\n name: \"Pix2Text MFD\",\n filename: \"mfd.onnx\",\n url: \"https://huggingface.co/breezedeus/pix2text-mfd/resolve/main/mfd-v20240618.onnx\",\n sha256: \"51a8854743b17ae654729af8db82a630c1ccfa06debf4856c8b28055f87d02c1\",\n sizeMb: 42,\n}\n\nexport const MFR_ENCODER_MODEL: ModelSpec = {\n name: \"Pix2Text MFR encoder\",\n filename: \"encoder_model.onnx\",\n url: \"https://huggingface.co/breezedeus/pix2text-mfr/resolve/main/encoder_model.onnx\",\n sha256: \"bd8d5c322792e9ec45793af5569e9748f82a3d728a9e00213dbfc56c1486f37d\",\n sizeMb: 87,\n}\n\nexport const MFR_DECODER_MODEL: ModelSpec = {\n name: \"Pix2Text MFR decoder\",\n filename: \"decoder_model.onnx\",\n url: \"https://huggingface.co/breezedeus/pix2text-mfr/resolve/main/decoder_model.onnx\",\n sha256: \"fd0f92d7a012f3dae41e1ac79421aea0ea888b5a66cb3f9a004e424f82f3daed\",\n sizeMb: 30,\n}\n\nexport const MFR_TOKENIZER: ModelSpec = {\n name: \"Pix2Text MFR tokenizer\",\n filename: \"tokenizer.json\",\n url: \"https://huggingface.co/breezedeus/pix2text-mfr/resolve/main/tokenizer.json\",\n sha256: \"3e2ab757277d22639bec28c9d7972e352d3d1dba223051fa674002dc5ab64df3\",\n sizeMb: 1,\n}\n\nexport const ALL_FORMULA_MODELS: ReadonlyArray<ModelSpec> = [\n MFD_MODEL,\n MFR_ENCODER_MODEL,\n MFR_DECODER_MODEL,\n MFR_TOKENIZER,\n]\n\n/**\n * 모델 캐시 하위 디렉토리 경로. 환경 변수 `KORDOC_MODEL_CACHE` 가 설정되면\n * 해당 경로를 우선 사용, 없으면 `~/.cache/kordoc/models/<subdir>/`.\n * (수식 OCR 외 텍스트 OCR 등 다른 모델군도 공용 — subdir 로 격리)\n */\nexport function getModelsDir(subdir: string): string {\n const override = process.env.KORDOC_MODEL_CACHE\n if (override && override.trim()) {\n return join(override, subdir)\n }\n return join(homedir(), \".cache\", \"kordoc\", \"models\", subdir)\n}\n\nexport function getFormulaModelsDir(): string {\n return getModelsDir(\"pix2text\")\n}\n\nexport interface ModelStatus {\n spec: ModelSpec\n localPath: string\n exists: boolean\n /** SHA 검증까지 끝났는가 (exists && valid) */\n verified: boolean\n /** 검증 실패 시 이유 */\n invalidReason?: string\n}\n\n/** 지정 모델군의 존재/유효성 상태 반환 (다운로드 없이 확인만) */\nexport async function getModelStatusIn(dir: string, specs: ReadonlyArray<ModelSpec>): Promise<ModelStatus[]> {\n const result: ModelStatus[] = []\n for (const spec of specs) {\n const localPath = join(dir, spec.filename)\n let exists = false\n try {\n const s = await stat(localPath)\n exists = s.isFile() && s.size > 0\n } catch {\n exists = false\n }\n if (!exists) {\n result.push({ spec, localPath, exists: false, verified: false })\n continue\n }\n try {\n const actual = await sha256OfFile(localPath)\n if (actual === spec.sha256) {\n result.push({ spec, localPath, exists: true, verified: true })\n } else {\n result.push({\n spec,\n localPath,\n exists: true,\n verified: false,\n invalidReason: `SHA256 mismatch: expected ${spec.sha256}, got ${actual}`,\n })\n }\n } catch (e) {\n result.push({\n spec,\n localPath,\n exists: true,\n verified: false,\n invalidReason: `SHA compute failed: ${(e as Error).message}`,\n })\n }\n }\n return result\n}\n\n/** 모든 수식 모델의 존재/유효성 상태 반환 (다운로드 없이 확인만) */\nexport async function getFormulaModelStatus(): Promise<ModelStatus[]> {\n return getModelStatusIn(getFormulaModelsDir(), ALL_FORMULA_MODELS)\n}\n\nexport interface DownloadProgress {\n spec: ModelSpec\n /** 현재까지 다운로드한 바이트 */\n downloaded: number\n /** 전체 바이트 (알 수 있으면) */\n total: number | null\n /** \"download\" | \"verify\" | \"done\" | \"skip\" */\n phase: \"download\" | \"verify\" | \"done\" | \"skip\" | \"error\"\n message?: string\n}\n\nexport type ProgressHandler = (p: DownloadProgress) => void\n\n/**\n * 지정 모델군을 다운로드/검증한다.\n * - 이미 있고 SHA 일치 → skip\n * - 없음 → 다운로드 후 SHA 검증. 실패 시 파일 삭제.\n */\nexport async function ensureModelsIn(dir: string, specs: ReadonlyArray<ModelSpec>, onProgress?: ProgressHandler): Promise<void> {\n await mkdir(dir, { recursive: true })\n\n for (const spec of specs) {\n const localPath = join(dir, spec.filename)\n\n if (await isExistingValid(localPath, spec.sha256)) {\n onProgress?.({\n spec,\n downloaded: 0,\n total: null,\n phase: \"skip\",\n message: \"이미 존재 + SHA 일치\",\n })\n continue\n }\n\n // 기존 파일 있지만 SHA 불일치 → 삭제\n try {\n await unlink(localPath)\n } catch {\n // 없을 수 있음\n }\n\n await downloadToFile(spec, localPath, onProgress)\n }\n}\n\n/** 필요한 모든 수식 모델을 다운로드/검증한다. */\nexport async function ensureFormulaModels(onProgress?: ProgressHandler): Promise<void> {\n return ensureModelsIn(getFormulaModelsDir(), ALL_FORMULA_MODELS, onProgress)\n}\n\n/** 단일 모델만 확인/다운로드 (진단 UI 에서 개별 상태 새로고침용) */\nexport async function ensureSingleModel(spec: ModelSpec, onProgress?: ProgressHandler): Promise<void> {\n const dir = getFormulaModelsDir()\n await mkdir(dir, { recursive: true })\n const localPath = join(dir, spec.filename)\n if (await isExistingValid(localPath, spec.sha256)) {\n onProgress?.({ spec, downloaded: 0, total: null, phase: \"skip\" })\n return\n }\n try {\n await unlink(localPath)\n } catch {}\n await downloadToFile(spec, localPath, onProgress)\n}\n\nasync function isExistingValid(localPath: string, sha256Expected: string): Promise<boolean> {\n try {\n const s = await stat(localPath)\n if (!s.isFile() || s.size === 0) return false\n } catch {\n return false\n }\n try {\n const actual = await sha256OfFile(localPath)\n return actual === sha256Expected\n } catch {\n return false\n }\n}\n\nasync function downloadToFile(\n spec: ModelSpec,\n localPath: string,\n onProgress?: ProgressHandler,\n): Promise<void> {\n // 먼저 .part 로 받고 검증 후 rename — 중단된 다운로드가 \"정상 파일\"로 오인되는 걸 방지\n const partPath = `${localPath}.part`\n await mkdir(dirname(localPath), { recursive: true })\n\n const resp = await fetch(spec.url, {\n headers: {\n // HF CDN 은 UA 없으면 가끔 403 을 뱉는다\n \"User-Agent\": \"kordoc-formula-ocr/1.0 (+https://github.com/chrisryugj/kordoc)\",\n },\n })\n if (!resp.ok || !resp.body) {\n throw new Error(\n `${spec.name} 다운로드 실패: HTTP ${resp.status} ${resp.statusText} (${spec.url})`,\n )\n }\n\n const lenHeader = resp.headers.get(\"content-length\")\n const total = lenHeader ? Number.parseInt(lenHeader, 10) : null\n let downloaded = 0\n\n const ws = createWriteStream(partPath)\n try {\n const reader = Readable.fromWeb(resp.body as unknown as import(\"stream/web\").ReadableStream)\n reader.on(\"data\", (chunk: Buffer | Uint8Array) => {\n downloaded += chunk.length\n onProgress?.({\n spec,\n downloaded,\n total,\n phase: \"download\",\n })\n })\n await pipeline(reader, ws)\n } catch (e) {\n try {\n await unlink(partPath)\n } catch {}\n throw new Error(`${spec.name} 스트리밍 실패: ${(e as Error).message}`)\n }\n\n onProgress?.({\n spec,\n downloaded,\n total,\n phase: \"verify\",\n })\n\n // SHA 검증\n let actual: string\n try {\n actual = await sha256OfFile(partPath)\n } catch (e) {\n try {\n await unlink(partPath)\n } catch {}\n throw new Error(`${spec.name} SHA 계산 실패: ${(e as Error).message}`)\n }\n\n if (actual !== spec.sha256) {\n try {\n await unlink(partPath)\n } catch {}\n throw new Error(\n `${spec.name} SHA256 mismatch: expected ${spec.sha256}, got ${actual} — 모델 URL 이 오염되었거나 전송 중 손상되었습니다.`,\n )\n }\n\n await rename(partPath, localPath)\n onProgress?.({\n spec,\n downloaded,\n total,\n phase: \"done\",\n })\n}\n\nasync function sha256OfFile(p: string): Promise<string> {\n const h = createHash(\"sha256\")\n const stream = createReadStream(p)\n await pipeline(stream, async function* (src) {\n for await (const chunk of src) {\n h.update(chunk)\n // yield 안 함 (소비만)\n }\n })\n return h.digest(\"hex\")\n}\n"]}
1
+ {"version":3,"sources":["/Users/mong-e/workspace/kordoc/dist/chunk-H7OWEYH2.cjs","../src/pdf/formula/models.ts"],"names":[],"mappings":"AAAA;ACUA,gCAA2B;AAC3B,wBAAiC;AACjC,uCAA4C;AAC5C;AACA,wBAAwB;AACxB,4BAA8B;AAC9B,4CAAyB;AACzB,gCAAyB;AAWlB,IAAM,UAAA,EAAuB;AAAA,EAClC,IAAA,EAAM,cAAA;AAAA,EACN,QAAA,EAAU,UAAA;AAAA,EACV,GAAA,EAAK,gFAAA;AAAA,EACL,MAAA,EAAQ,kEAAA;AAAA,EACR,MAAA,EAAQ;AACV,CAAA;AAEO,IAAM,kBAAA,EAA+B;AAAA,EAC1C,IAAA,EAAM,sBAAA;AAAA,EACN,QAAA,EAAU,oBAAA;AAAA,EACV,GAAA,EAAK,gFAAA;AAAA,EACL,MAAA,EAAQ,kEAAA;AAAA,EACR,MAAA,EAAQ;AACV,CAAA;AAEO,IAAM,kBAAA,EAA+B;AAAA,EAC1C,IAAA,EAAM,sBAAA;AAAA,EACN,QAAA,EAAU,oBAAA;AAAA,EACV,GAAA,EAAK,gFAAA;AAAA,EACL,MAAA,EAAQ,kEAAA;AAAA,EACR,MAAA,EAAQ;AACV,CAAA;AAEO,IAAM,cAAA,EAA2B;AAAA,EACtC,IAAA,EAAM,wBAAA;AAAA,EACN,QAAA,EAAU,gBAAA;AAAA,EACV,GAAA,EAAK,4EAAA;AAAA,EACL,MAAA,EAAQ,kEAAA;AAAA,EACR,MAAA,EAAQ;AACV,CAAA;AAEO,IAAM,mBAAA,EAA+C;AAAA,EAC1D,SAAA;AAAA,EACA,iBAAA;AAAA,EACA,iBAAA;AAAA,EACA;AACF,CAAA;AAOO,SAAS,YAAA,CAAa,MAAA,EAAwB;AACnD,EAAA,MAAM,SAAA,EAAW,OAAA,CAAQ,GAAA,CAAI,kBAAA;AAC7B,EAAA,GAAA,CAAI,SAAA,GAAY,QAAA,CAAS,IAAA,CAAK,CAAA,EAAG;AAC/B,IAAA,OAAO,wBAAA,QAAK,EAAU,MAAM,CAAA;AAAA,EAC9B;AACA,EAAA,OAAO,wBAAA,yBAAK,CAAQ,EAAG,QAAA,EAAU,QAAA,EAAU,QAAA,EAAU,MAAM,CAAA;AAC7D;AAEO,SAAS,mBAAA,CAAA,EAA8B;AAC5C,EAAA,OAAO,YAAA,CAAa,UAAU,CAAA;AAChC;AAaA,MAAA,SAAsB,gBAAA,CAAiB,GAAA,EAAa,KAAA,EAAyD;AAC3G,EAAA,MAAM,OAAA,EAAwB,CAAC,CAAA;AAC/B,EAAA,IAAA,CAAA,MAAW,KAAA,GAAQ,KAAA,EAAO;AACxB,IAAA,MAAM,UAAA,EAAY,wBAAA,GAAK,EAAK,IAAA,CAAK,QAAQ,CAAA;AACzC,IAAA,IAAI,OAAA,EAAS,KAAA;AACb,IAAA,IAAI;AACF,MAAA,MAAM,EAAA,EAAI,MAAM,4BAAA,SAAc,CAAA;AAC9B,MAAA,OAAA,EAAS,CAAA,CAAE,MAAA,CAAO,EAAA,GAAK,CAAA,CAAE,KAAA,EAAO,CAAA;AAAA,IAClC,EAAA,WAAQ;AACN,MAAA,OAAA,EAAS,KAAA;AAAA,IACX;AACA,IAAA,GAAA,CAAI,CAAC,MAAA,EAAQ;AACX,MAAA,MAAA,CAAO,IAAA,CAAK,EAAE,IAAA,EAAM,SAAA,EAAW,MAAA,EAAQ,KAAA,EAAO,QAAA,EAAU,MAAM,CAAC,CAAA;AAC/D,MAAA,QAAA;AAAA,IACF;AACA,IAAA,IAAI;AACF,MAAA,MAAM,OAAA,EAAS,MAAM,YAAA,CAAa,SAAS,CAAA;AAC3C,MAAA,GAAA,CAAI,OAAA,IAAW,IAAA,CAAK,MAAA,EAAQ;AAC1B,QAAA,MAAA,CAAO,IAAA,CAAK,EAAE,IAAA,EAAM,SAAA,EAAW,MAAA,EAAQ,IAAA,EAAM,QAAA,EAAU,KAAK,CAAC,CAAA;AAAA,MAC/D,EAAA,KAAO;AACL,QAAA,MAAA,CAAO,IAAA,CAAK;AAAA,UACV,IAAA;AAAA,UACA,SAAA;AAAA,UACA,MAAA,EAAQ,IAAA;AAAA,UACR,QAAA,EAAU,KAAA;AAAA,UACV,aAAA,EAAe,CAAA,0BAAA,EAA6B,IAAA,CAAK,MAAM,CAAA,MAAA,EAAS,MAAM,CAAA;AAAA,QAAA;AACvE,MAAA;AACH,IAAA;AAEA,MAAA;AAAY,QAAA;AACV,QAAA;AACA,QAAA;AACQ,QAAA;AACE,QAAA;AACgD,MAAA;AAC3D,IAAA;AACH,EAAA;AAEF,EAAA;AACF;AAGA;AACE,EAAA;AACF;AAoBA;AACE,EAAA;AAEA,EAAA;AACE,IAAA;AAEA,IAAA;AACE,sBAAA;AAAa,QAAA;AACX,QAAA;AACY,QAAA;AACL,QAAA;AACA,QAAA;AACE,MAAA;AAEX,MAAA;AAAA,IAAA;AAIF,IAAA;AACE,MAAA;AAAsB,IAAA;AAChB,IAAA;AAIR,IAAA;AAAgD,EAAA;AAEpD;AAGA;AACE,EAAA;AACF;AAGA;AACE,EAAA;AACA,EAAA;AACA,EAAA;AACA,EAAA;AACE,oBAAA;AACA,IAAA;AAAA,EAAA;AAEF,EAAA;AACE,IAAA;AAAsB,EAAA;AAChB,EAAA;AACR,EAAA;AACF;AAEA;AACE,EAAA;AACE,IAAA;AACA,IAAA;AAAwC,EAAA;AAExC,IAAA;AAAO,EAAA;AAET,EAAA;AACE,IAAA;AACA,IAAA;AAAkB,EAAA;AAElB,IAAA;AAAO,EAAA;AAEX;AAEA;AAME,EAAA;AACA,EAAA;AAEA,EAAA;AAAmC,IAAA;AACxB;AAAA,MAAA;AAEO,IAAA;AAChB,EAAA;AAEF,EAAA;AACE,IAAA;AAAU,MAAA;AACiE,IAAA;AAC3E,EAAA;AAGF,EAAA;AACA,EAAA;AACA,EAAA;AAEA,EAAA;AACA,EAAA;AACE,IAAA;AACA,IAAA;AACE,MAAA;AACA,sBAAA;AAAa,QAAA;AACX,QAAA;AACA,QAAA;AACA,QAAA;AACO,MAAA;AACR,IAAA;AAEH,IAAA;AAAyB,EAAA;AAEzB,IAAA;AACE,MAAA;AAAqB,IAAA;AACf,IAAA;AACR,IAAA;AAA+D,EAAA;AAGjE,kBAAA;AAAa,IAAA;AACX,IAAA;AACA,IAAA;AACA,IAAA;AACO,EAAA;AAIT,EAAA;AACA,EAAA;AACE,IAAA;AAAoC,EAAA;AAEpC,IAAA;AACE,MAAA;AAAqB,IAAA;AACf,IAAA;AACR,IAAA;AAAiE,EAAA;AAGnE,EAAA;AACE,IAAA;AACE,MAAA;AAAqB,IAAA;AACf,IAAA;AACR,IAAA;AAAU,MAAA;AAC4D,IAAA;AACtE,EAAA;AAGF,EAAA;AACA,kBAAA;AAAa,IAAA;AACX,IAAA;AACA,IAAA;AACA,IAAA;AACO,EAAA;AAEX;AAEA;AACE,EAAA;AACA,EAAA;AACA,EAAA;AACE,IAAA;AACE,MAAA;AAAc,IAAA;AAEhB,EAAA;AAEF,EAAA;AACF;ADrFA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA","file":"/Users/mong-e/workspace/kordoc/dist/chunk-H7OWEYH2.cjs","sourcesContent":[null,"/**\n * 수식 OCR 모델 자동 다운로드 + SHA-256 검증\n *\n * 캐시 위치: `~/.cache/kordoc/models/pix2text/`\n * 총 ~155MB (MFD 44MB + MFR encoder 87MB + MFR decoder 30MB + tokenizer 40KB)\n *\n * HF URL + SHA 는 Docufinder archive/rust-formula-ocr-wip 에서 검증 완료됨.\n * 모델 버전 갱신 시 URL + SHA 를 함께 갱신해야 한다.\n */\n\nimport { createHash } from \"crypto\"\nimport { createReadStream } from \"fs\"\nimport { mkdir, stat, unlink, rename } from \"fs/promises\"\nimport { createWriteStream } from \"fs\"\nimport { homedir } from \"os\"\nimport { join, dirname } from \"path\"\nimport { pipeline } from \"stream/promises\"\nimport { Readable } from \"stream\"\n\nexport interface ModelSpec {\n name: string\n filename: string\n url: string\n sha256: string\n sizeMb: number\n}\n\n/** 모델 스펙 (SHA-256 은 실제 다운로드로 검증됨 — 변경 금지) */\nexport const MFD_MODEL: ModelSpec = {\n name: \"Pix2Text MFD\",\n filename: \"mfd.onnx\",\n url: \"https://huggingface.co/breezedeus/pix2text-mfd/resolve/main/mfd-v20240618.onnx\",\n sha256: \"51a8854743b17ae654729af8db82a630c1ccfa06debf4856c8b28055f87d02c1\",\n sizeMb: 42,\n}\n\nexport const MFR_ENCODER_MODEL: ModelSpec = {\n name: \"Pix2Text MFR encoder\",\n filename: \"encoder_model.onnx\",\n url: \"https://huggingface.co/breezedeus/pix2text-mfr/resolve/main/encoder_model.onnx\",\n sha256: \"bd8d5c322792e9ec45793af5569e9748f82a3d728a9e00213dbfc56c1486f37d\",\n sizeMb: 87,\n}\n\nexport const MFR_DECODER_MODEL: ModelSpec = {\n name: \"Pix2Text MFR decoder\",\n filename: \"decoder_model.onnx\",\n url: \"https://huggingface.co/breezedeus/pix2text-mfr/resolve/main/decoder_model.onnx\",\n sha256: \"fd0f92d7a012f3dae41e1ac79421aea0ea888b5a66cb3f9a004e424f82f3daed\",\n sizeMb: 30,\n}\n\nexport const MFR_TOKENIZER: ModelSpec = {\n name: \"Pix2Text MFR tokenizer\",\n filename: \"tokenizer.json\",\n url: \"https://huggingface.co/breezedeus/pix2text-mfr/resolve/main/tokenizer.json\",\n sha256: \"3e2ab757277d22639bec28c9d7972e352d3d1dba223051fa674002dc5ab64df3\",\n sizeMb: 1,\n}\n\nexport const ALL_FORMULA_MODELS: ReadonlyArray<ModelSpec> = [\n MFD_MODEL,\n MFR_ENCODER_MODEL,\n MFR_DECODER_MODEL,\n MFR_TOKENIZER,\n]\n\n/**\n * 모델 캐시 하위 디렉토리 경로. 환경 변수 `KORDOC_MODEL_CACHE` 가 설정되면\n * 해당 경로를 우선 사용, 없으면 `~/.cache/kordoc/models/<subdir>/`.\n * (수식 OCR 외 텍스트 OCR 등 다른 모델군도 공용 — subdir 로 격리)\n */\nexport function getModelsDir(subdir: string): string {\n const override = process.env.KORDOC_MODEL_CACHE\n if (override && override.trim()) {\n return join(override, subdir)\n }\n return join(homedir(), \".cache\", \"kordoc\", \"models\", subdir)\n}\n\nexport function getFormulaModelsDir(): string {\n return getModelsDir(\"pix2text\")\n}\n\nexport interface ModelStatus {\n spec: ModelSpec\n localPath: string\n exists: boolean\n /** SHA 검증까지 끝났는가 (exists && valid) */\n verified: boolean\n /** 검증 실패 시 이유 */\n invalidReason?: string\n}\n\n/** 지정 모델군의 존재/유효성 상태 반환 (다운로드 없이 확인만) */\nexport async function getModelStatusIn(dir: string, specs: ReadonlyArray<ModelSpec>): Promise<ModelStatus[]> {\n const result: ModelStatus[] = []\n for (const spec of specs) {\n const localPath = join(dir, spec.filename)\n let exists = false\n try {\n const s = await stat(localPath)\n exists = s.isFile() && s.size > 0\n } catch {\n exists = false\n }\n if (!exists) {\n result.push({ spec, localPath, exists: false, verified: false })\n continue\n }\n try {\n const actual = await sha256OfFile(localPath)\n if (actual === spec.sha256) {\n result.push({ spec, localPath, exists: true, verified: true })\n } else {\n result.push({\n spec,\n localPath,\n exists: true,\n verified: false,\n invalidReason: `SHA256 mismatch: expected ${spec.sha256}, got ${actual}`,\n })\n }\n } catch (e) {\n result.push({\n spec,\n localPath,\n exists: true,\n verified: false,\n invalidReason: `SHA compute failed: ${(e as Error).message}`,\n })\n }\n }\n return result\n}\n\n/** 모든 수식 모델의 존재/유효성 상태 반환 (다운로드 없이 확인만) */\nexport async function getFormulaModelStatus(): Promise<ModelStatus[]> {\n return getModelStatusIn(getFormulaModelsDir(), ALL_FORMULA_MODELS)\n}\n\nexport interface DownloadProgress {\n spec: ModelSpec\n /** 현재까지 다운로드한 바이트 */\n downloaded: number\n /** 전체 바이트 (알 수 있으면) */\n total: number | null\n /** \"download\" | \"verify\" | \"done\" | \"skip\" */\n phase: \"download\" | \"verify\" | \"done\" | \"skip\" | \"error\"\n message?: string\n}\n\nexport type ProgressHandler = (p: DownloadProgress) => void\n\n/**\n * 지정 모델군을 다운로드/검증한다.\n * - 이미 있고 SHA 일치 → skip\n * - 없음 → 다운로드 후 SHA 검증. 실패 시 파일 삭제.\n */\nexport async function ensureModelsIn(dir: string, specs: ReadonlyArray<ModelSpec>, onProgress?: ProgressHandler): Promise<void> {\n await mkdir(dir, { recursive: true })\n\n for (const spec of specs) {\n const localPath = join(dir, spec.filename)\n\n if (await isExistingValid(localPath, spec.sha256)) {\n onProgress?.({\n spec,\n downloaded: 0,\n total: null,\n phase: \"skip\",\n message: \"이미 존재 + SHA 일치\",\n })\n continue\n }\n\n // 기존 파일 있지만 SHA 불일치 → 삭제\n try {\n await unlink(localPath)\n } catch {\n // 없을 수 있음\n }\n\n await downloadToFile(spec, localPath, onProgress)\n }\n}\n\n/** 필요한 모든 수식 모델을 다운로드/검증한다. */\nexport async function ensureFormulaModels(onProgress?: ProgressHandler): Promise<void> {\n return ensureModelsIn(getFormulaModelsDir(), ALL_FORMULA_MODELS, onProgress)\n}\n\n/** 단일 모델만 확인/다운로드 (진단 UI 에서 개별 상태 새로고침용) */\nexport async function ensureSingleModel(spec: ModelSpec, onProgress?: ProgressHandler): Promise<void> {\n const dir = getFormulaModelsDir()\n await mkdir(dir, { recursive: true })\n const localPath = join(dir, spec.filename)\n if (await isExistingValid(localPath, spec.sha256)) {\n onProgress?.({ spec, downloaded: 0, total: null, phase: \"skip\" })\n return\n }\n try {\n await unlink(localPath)\n } catch {}\n await downloadToFile(spec, localPath, onProgress)\n}\n\nasync function isExistingValid(localPath: string, sha256Expected: string): Promise<boolean> {\n try {\n const s = await stat(localPath)\n if (!s.isFile() || s.size === 0) return false\n } catch {\n return false\n }\n try {\n const actual = await sha256OfFile(localPath)\n return actual === sha256Expected\n } catch {\n return false\n }\n}\n\nasync function downloadToFile(\n spec: ModelSpec,\n localPath: string,\n onProgress?: ProgressHandler,\n): Promise<void> {\n // 먼저 .part 로 받고 검증 후 rename — 중단된 다운로드가 \"정상 파일\"로 오인되는 걸 방지\n const partPath = `${localPath}.part`\n await mkdir(dirname(localPath), { recursive: true })\n\n const resp = await fetch(spec.url, {\n headers: {\n // HF CDN 은 UA 없으면 가끔 403 을 뱉는다\n \"User-Agent\": \"kordoc-formula-ocr/1.0 (+https://github.com/chrisryugj/kordoc)\",\n },\n })\n if (!resp.ok || !resp.body) {\n throw new Error(\n `${spec.name} 다운로드 실패: HTTP ${resp.status} ${resp.statusText} (${spec.url})`,\n )\n }\n\n const lenHeader = resp.headers.get(\"content-length\")\n const total = lenHeader ? Number.parseInt(lenHeader, 10) : null\n let downloaded = 0\n\n const ws = createWriteStream(partPath)\n try {\n const reader = Readable.fromWeb(resp.body as unknown as import(\"stream/web\").ReadableStream)\n reader.on(\"data\", (chunk: Buffer | Uint8Array) => {\n downloaded += chunk.length\n onProgress?.({\n spec,\n downloaded,\n total,\n phase: \"download\",\n })\n })\n await pipeline(reader, ws)\n } catch (e) {\n try {\n await unlink(partPath)\n } catch {}\n throw new Error(`${spec.name} 스트리밍 실패: ${(e as Error).message}`)\n }\n\n onProgress?.({\n spec,\n downloaded,\n total,\n phase: \"verify\",\n })\n\n // SHA 검증\n let actual: string\n try {\n actual = await sha256OfFile(partPath)\n } catch (e) {\n try {\n await unlink(partPath)\n } catch {}\n throw new Error(`${spec.name} SHA 계산 실패: ${(e as Error).message}`)\n }\n\n if (actual !== spec.sha256) {\n try {\n await unlink(partPath)\n } catch {}\n throw new Error(\n `${spec.name} SHA256 mismatch: expected ${spec.sha256}, got ${actual} — 모델 URL 이 오염되었거나 전송 중 손상되었습니다.`,\n )\n }\n\n await rename(partPath, localPath)\n onProgress?.({\n spec,\n downloaded,\n total,\n phase: \"done\",\n })\n}\n\nasync function sha256OfFile(p: string): Promise<string> {\n const h = createHash(\"sha256\")\n const stream = createReadStream(p)\n await pipeline(stream, async function* (src) {\n for await (const chunk of src) {\n h.update(chunk)\n // yield 안 함 (소비만)\n }\n })\n return h.digest(\"hex\")\n}\n"]}
@@ -1,7 +1,7 @@
1
1
  #!/usr/bin/env node
2
2
  import {
3
3
  sanitizeHref
4
- } from "./chunk-2L7MIKOM.js";
4
+ } from "./chunk-E2K4SNMD.js";
5
5
 
6
6
  // src/shared/pua.ts
7
7
  var BMP_SYMBOL_MAP = {
@@ -613,4 +613,4 @@ export {
613
613
  dedupeRunningHeaders,
614
614
  blocksToMarkdown
615
615
  };
616
- //# sourceMappingURL=chunk-DSL6EVFJ.js.map
616
+ //# sourceMappingURL=chunk-I53FOXZR.js.map
@@ -7,11 +7,11 @@ import {
7
7
  createXmlParser,
8
8
  findChildByLocalName,
9
9
  parseRenderStyles
10
- } from "./chunk-FHYLLKIP.js";
10
+ } from "./chunk-H6O65EPK.js";
11
11
  import {
12
12
  KordocError,
13
13
  precheckZipSize
14
- } from "./chunk-2L7MIKOM.js";
14
+ } from "./chunk-E2K4SNMD.js";
15
15
 
16
16
  // src/render/svg-render.ts
17
17
  import JSZip from "jszip";
@@ -1281,4 +1281,4 @@ export {
1281
1281
  fitRatioForFewerLines,
1282
1282
  renderHwpxToSvg
1283
1283
  };
1284
- //# sourceMappingURL=chunk-GHMVNMUN.js.map
1284
+ //# sourceMappingURL=chunk-LWNFAIYG.js.map
@@ -4,7 +4,7 @@
4
4
 
5
5
 
6
6
 
7
- var _chunkKKZATKQWcjs = require('./chunk-KKZATKQW.cjs');
7
+ var _chunkBLNOGMIMcjs = require('./chunk-BLNOGMIM.cjs');
8
8
 
9
9
  // src/pdf/image-regions.ts
10
10
  var _pdfmjs = require('pdfjs-dist/legacy/build/pdf.mjs');
@@ -1536,9 +1536,9 @@ function detectHeadings(blocks, medianFontSize) {
1536
1536
  if (/^\d+$/.test(text)) continue;
1537
1537
  const ratio = block.style.fontSize / medianFontSize;
1538
1538
  let level = 0;
1539
- if (ratio >= _chunkKKZATKQWcjs.HEADING_RATIO_H1) level = 1;
1540
- else if (ratio >= _chunkKKZATKQWcjs.HEADING_RATIO_H2) level = 2;
1541
- else if (ratio >= _chunkKKZATKQWcjs.HEADING_RATIO_H3) level = 3;
1539
+ if (ratio >= _chunkBLNOGMIMcjs.HEADING_RATIO_H1) level = 1;
1540
+ else if (ratio >= _chunkBLNOGMIMcjs.HEADING_RATIO_H2) level = 2;
1541
+ else if (ratio >= _chunkBLNOGMIMcjs.HEADING_RATIO_H3) level = 3;
1542
1542
  if (level > 0) {
1543
1543
  block.type = "heading";
1544
1544
  block.level = level;
@@ -2658,14 +2658,14 @@ function isProseSpread(items) {
2658
2658
  for (let i = 1; i < sorted.length; i++) {
2659
2659
  gaps.push(sorted[i].x - (sorted[i - 1].x + sorted[i - 1].w));
2660
2660
  }
2661
- const maxGap = _chunkKKZATKQWcjs.safeMax.call(void 0, gaps);
2661
+ const maxGap = _chunkBLNOGMIMcjs.safeMax.call(void 0, gaps);
2662
2662
  const avgLen = items.reduce((s, i) => s + i.text.length, 0) / items.length;
2663
2663
  return maxGap < 40 && avgLen < 5;
2664
2664
  }
2665
2665
  function detectColumns(yLines) {
2666
2666
  const allItems = yLines.flat();
2667
2667
  if (allItems.length === 0) return null;
2668
- const pageWidth = _chunkKKZATKQWcjs.safeMax.call(void 0, allItems.map((i) => i.x + i.w)) - _chunkKKZATKQWcjs.safeMin.call(void 0, allItems.map((i) => i.x));
2668
+ const pageWidth = _chunkBLNOGMIMcjs.safeMax.call(void 0, allItems.map((i) => i.x + i.w)) - _chunkBLNOGMIMcjs.safeMin.call(void 0, allItems.map((i) => i.x));
2669
2669
  if (pageWidth < 100) return null;
2670
2670
  let bigoLineIdx = -1;
2671
2671
  for (let i = 0; i < yLines.length; i++) {
@@ -3113,7 +3113,7 @@ function extractBlocksWithGrids(items, pageNum, grids, horizontals, verticals) {
3113
3113
  let finalTextBlocks = [];
3114
3114
  if (remaining.length > 0) {
3115
3115
  const allY = remaining.map((i) => i.y);
3116
- const pageH = _chunkKKZATKQWcjs.safeMax.call(void 0, allY) - _chunkKKZATKQWcjs.safeMin.call(void 0, allY);
3116
+ const pageH = _chunkBLNOGMIMcjs.safeMax.call(void 0, allY) - _chunkBLNOGMIMcjs.safeMin.call(void 0, allY);
3117
3117
  const groups = xyCutOrder(remaining, Math.max(15, pageH * 0.03));
3118
3118
  const textBlocks = [];
3119
3119
  for (const group of groups) {
@@ -3301,7 +3301,7 @@ function extractPageBlocksFallback(items, pageNum, fullPage = false) {
3301
3301
  blocks.push({ type: "paragraph", text: tableText, pageNumber: pageNum, bbox, style: dominantStyle(items) });
3302
3302
  } else {
3303
3303
  const allY = items.map((i) => i.y);
3304
- const pageHeight = _chunkKKZATKQWcjs.safeMax.call(void 0, allY) - _chunkKKZATKQWcjs.safeMin.call(void 0, allY);
3304
+ const pageHeight = _chunkBLNOGMIMcjs.safeMax.call(void 0, allY) - _chunkBLNOGMIMcjs.safeMin.call(void 0, allY);
3305
3305
  const gapThreshold = Math.max(15, pageHeight * 0.03);
3306
3306
  const orderedGroups = proseCutX !== null ? splitTwoColumnProse(items, proseCutX) : xyCutOrder(items, gapThreshold);
3307
3307
  for (const group of orderedGroups) {
@@ -3340,4 +3340,4 @@ function extractPageBlocksFallback(items, pageNum, fullPage = false) {
3340
3340
 
3341
3341
 
3342
3342
  exports.extractImageRegions = extractImageRegions; exports.filterHiddenText = filterHiddenText; exports.collapseEvenSpacing = collapseEvenSpacing; exports.normalizeItems = normalizeItems; exports.computeMedianFontSizeFromFreq = computeMedianFontSizeFromFreq; exports.detectHeadings = detectHeadings; exports.detectMarkerHeadings = detectMarkerHeadings; exports.detectTableCaptions = detectTableCaptions; exports.detectKoreanListBlocks = detectKoreanListBlocks; exports.removeHeaderFooterBlocks = removeHeaderFooterBlocks; exports.extractPageBlocksWithLines = extractPageBlocksWithLines; exports.mergeCrossPageTables = mergeCrossPageTables;
3343
- //# sourceMappingURL=chunk-EFF2JPPA.cjs.map
3343
+ //# sourceMappingURL=chunk-LXUZUUUG.cjs.map