kordoc 4.2.2 → 4.2.4

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (103) hide show
  1. package/README.md +15 -3
  2. package/dist/{-NFHVGTVM.js → -2M56QRNH.js} +9 -9
  3. package/dist/{chunk-MYD3QLBL.js → chunk-7KRCQE3P.js} +2 -2
  4. package/dist/{chunk-OLDIDBJ2.js → chunk-7Z3NHIRR.js} +3 -3
  5. package/dist/{chunk-KKZATKQW.cjs → chunk-BLNOGMIM.cjs} +2 -2
  6. package/dist/chunk-BLNOGMIM.cjs.map +1 -0
  7. package/dist/{chunk-TXYQJXOV.js → chunk-CAA6DVEE.js} +91 -30
  8. package/dist/chunk-CAA6DVEE.js.map +1 -0
  9. package/dist/chunk-DCZVOIEO.cjs.map +1 -1
  10. package/dist/{chunk-MOOVF6CT.js → chunk-DOLK5KIS.js} +2 -2
  11. package/dist/{chunk-2L7MIKOM.js → chunk-E2K4SNMD.js} +2 -2
  12. package/dist/{chunk-X77U36TV.js → chunk-GFTAPAJS.js} +2 -2
  13. package/dist/{chunk-ZF7QL4IY.js → chunk-GJO3ORFW.js} +1 -1
  14. package/dist/chunk-GJO3ORFW.js.map +1 -0
  15. package/dist/chunk-GS7T56RP.cjs.map +1 -1
  16. package/dist/{chunk-FHYLLKIP.js → chunk-H6O65EPK.js} +2 -2
  17. package/dist/chunk-H7OWEYH2.cjs.map +1 -1
  18. package/dist/{chunk-DSL6EVFJ.js → chunk-I53FOXZR.js} +2 -2
  19. package/dist/{chunk-GHMVNMUN.js → chunk-LWNFAIYG.js} +3 -3
  20. package/dist/{chunk-EFF2JPPA.cjs → chunk-LXUZUUUG.cjs} +9 -9
  21. package/dist/chunk-LXUZUUUG.cjs.map +1 -0
  22. package/dist/{chunk-GUYIXVV7.js → chunk-OBX3VSIZ.js} +2 -2
  23. package/dist/chunk-OBX3VSIZ.js.map +1 -0
  24. package/dist/{chunk-T4AWY45Q.js → chunk-PMBWFYZQ.js} +2 -2
  25. package/dist/{chunk-IXHBRMDB.js → chunk-PQ46DC6Y.js} +2 -2
  26. package/dist/{chunk-WMU2KJHF.cjs → chunk-SCJLAOY3.cjs} +4 -4
  27. package/dist/chunk-SCJLAOY3.cjs.map +1 -0
  28. package/dist/{chunk-L5B7PQOP.js → chunk-WMM6XVQX.js} +2 -2
  29. package/dist/{chunk-DLFZAU4X.cjs → chunk-YFSYLEXO.cjs} +3 -3
  30. package/dist/chunk-YFSYLEXO.cjs.map +1 -0
  31. package/dist/{chunk-LUJN3VFB.js → chunk-ZHRYLT3N.js} +3 -3
  32. package/dist/chunks-GT45ALC5.js +10 -0
  33. package/dist/cli.js +18 -18
  34. package/dist/formula-SB3NHDUM.cjs.map +1 -1
  35. package/dist/{image-ocr-S4REURLR.js → image-ocr-HY42AVXC.js} +5 -5
  36. package/dist/{image-ocr-3AFBDDJI.cjs → image-ocr-JWAX5EOB.cjs} +9 -9
  37. package/dist/image-ocr-JWAX5EOB.cjs.map +1 -0
  38. package/dist/{image-ocr-TGHAMIQL.js → image-ocr-WCIDB6RY.js} +4 -4
  39. package/dist/index.cjs +508 -447
  40. package/dist/index.cjs.map +1 -1
  41. package/dist/index.d.cts +7 -2
  42. package/dist/index.d.ts +7 -2
  43. package/dist/index.js +86 -25
  44. package/dist/index.js.map +1 -1
  45. package/dist/mcp.js +15 -15
  46. package/dist/page-range-P7SDW6LR.cjs.map +1 -1
  47. package/dist/{parser-MRM6WICO.cjs → parser-6RDEBLSB.cjs} +24 -24
  48. package/dist/parser-6RDEBLSB.cjs.map +1 -0
  49. package/dist/{parser-C3APVZGT.js → parser-SVZPCCRG.js} +6 -6
  50. package/dist/{parser-KMC4YOZH.js → parser-WRNS6MX2.js} +5 -5
  51. package/dist/pdf-ocr-4SGVLUNL.cjs +13 -0
  52. package/dist/pdf-ocr-4SGVLUNL.cjs.map +1 -0
  53. package/dist/pdf-ocr-7AAHJOXQ.js +12 -0
  54. package/dist/{pdf-ocr-UURMV6FD.js → pdf-ocr-WM3RZMZY.js} +5 -5
  55. package/dist/{profile-io-RLQ62KS5.js → profile-io-SWGUQSCL.js} +3 -3
  56. package/dist/{rasterize-LBABF2WI.js → rasterize-QA7W6QUF.js} +2 -2
  57. package/dist/render-DRUIPV77.js +10 -0
  58. package/dist/seal-3M4ZSW66.js +10 -0
  59. package/dist/{setup-Q2PRE7UA.js → setup-GUQT5ELJ.js} +23 -3
  60. package/dist/setup-GUQT5ELJ.js.map +1 -0
  61. package/dist/{watch-XEUEGOXW.js → watch-SFQNFU7Q.js} +9 -9
  62. package/package.json +1 -1
  63. package/dist/chunk-DLFZAU4X.cjs.map +0 -1
  64. package/dist/chunk-EFF2JPPA.cjs.map +0 -1
  65. package/dist/chunk-GUYIXVV7.js.map +0 -1
  66. package/dist/chunk-KKZATKQW.cjs.map +0 -1
  67. package/dist/chunk-TXYQJXOV.js.map +0 -1
  68. package/dist/chunk-WMU2KJHF.cjs.map +0 -1
  69. package/dist/chunk-ZF7QL4IY.js.map +0 -1
  70. package/dist/chunks-N4CWHTJI.js +0 -10
  71. package/dist/image-ocr-3AFBDDJI.cjs.map +0 -1
  72. package/dist/parser-MRM6WICO.cjs.map +0 -1
  73. package/dist/pdf-ocr-5BRMIJAT.cjs +0 -13
  74. package/dist/pdf-ocr-5BRMIJAT.cjs.map +0 -1
  75. package/dist/pdf-ocr-UDTEQEWA.js +0 -12
  76. package/dist/render-CYXQEHS7.js +0 -10
  77. package/dist/seal-SV6PFFYU.js +0 -10
  78. package/dist/setup-Q2PRE7UA.js.map +0 -1
  79. /package/dist/{-NFHVGTVM.js.map → -2M56QRNH.js.map} +0 -0
  80. /package/dist/{chunk-MYD3QLBL.js.map → chunk-7KRCQE3P.js.map} +0 -0
  81. /package/dist/{chunk-OLDIDBJ2.js.map → chunk-7Z3NHIRR.js.map} +0 -0
  82. /package/dist/{chunk-MOOVF6CT.js.map → chunk-DOLK5KIS.js.map} +0 -0
  83. /package/dist/{chunk-2L7MIKOM.js.map → chunk-E2K4SNMD.js.map} +0 -0
  84. /package/dist/{chunk-X77U36TV.js.map → chunk-GFTAPAJS.js.map} +0 -0
  85. /package/dist/{chunk-FHYLLKIP.js.map → chunk-H6O65EPK.js.map} +0 -0
  86. /package/dist/{chunk-DSL6EVFJ.js.map → chunk-I53FOXZR.js.map} +0 -0
  87. /package/dist/{chunk-GHMVNMUN.js.map → chunk-LWNFAIYG.js.map} +0 -0
  88. /package/dist/{chunk-T4AWY45Q.js.map → chunk-PMBWFYZQ.js.map} +0 -0
  89. /package/dist/{chunk-IXHBRMDB.js.map → chunk-PQ46DC6Y.js.map} +0 -0
  90. /package/dist/{chunk-L5B7PQOP.js.map → chunk-WMM6XVQX.js.map} +0 -0
  91. /package/dist/{chunk-LUJN3VFB.js.map → chunk-ZHRYLT3N.js.map} +0 -0
  92. /package/dist/{chunks-N4CWHTJI.js.map → chunks-GT45ALC5.js.map} +0 -0
  93. /package/dist/{image-ocr-S4REURLR.js.map → image-ocr-HY42AVXC.js.map} +0 -0
  94. /package/dist/{image-ocr-TGHAMIQL.js.map → image-ocr-WCIDB6RY.js.map} +0 -0
  95. /package/dist/{parser-C3APVZGT.js.map → parser-SVZPCCRG.js.map} +0 -0
  96. /package/dist/{parser-KMC4YOZH.js.map → parser-WRNS6MX2.js.map} +0 -0
  97. /package/dist/{pdf-ocr-UDTEQEWA.js.map → pdf-ocr-7AAHJOXQ.js.map} +0 -0
  98. /package/dist/{pdf-ocr-UURMV6FD.js.map → pdf-ocr-WM3RZMZY.js.map} +0 -0
  99. /package/dist/{profile-io-RLQ62KS5.js.map → profile-io-SWGUQSCL.js.map} +0 -0
  100. /package/dist/{rasterize-LBABF2WI.js.map → rasterize-QA7W6QUF.js.map} +0 -0
  101. /package/dist/{render-CYXQEHS7.js.map → render-DRUIPV77.js.map} +0 -0
  102. /package/dist/{seal-SV6PFFYU.js.map → seal-3M4ZSW66.js.map} +0 -0
  103. /package/dist/{watch-XEUEGOXW.js.map → watch-SFQNFU7Q.js.map} +0 -0
package/README.md CHANGED
@@ -26,7 +26,7 @@ npx -y kordoc setup
26
26
  ```
27
27
 
28
28
  대화형 마법사가:
29
- 1. 사용 중인 AI 클라이언트 번호 선택 (Claude Desktop / Cursor / Claude Code / Windsurf / VS Code / Gemini CLI / Zed / Antigravity — 설치된 건 `[감지됨]` 표시)
29
+ 1. 사용 중인 AI 클라이언트 번호 선택 (Claude Desktop / Cursor / Claude Code / Windsurf / VS Code / Gemini CLI / Zed / Antigravity / Codex — 설치된 건 `[감지됨]` 표시)
30
30
  2. 설정 파일 자동 패치 → 클라이언트 재시작
31
31
 
32
32
  Windows 도 자동으로 `cmd /c npx` 래핑. 수동 JSON 편집 불필요. 재시작하면 15개 문서 도구 (`parse_document`, `parse_table`, `fill_form`, `patch_document`, `generate_document` 등) 활성화.
@@ -82,10 +82,14 @@ MCP 등록 대신 스킬(SKILL.md) 형태로 쓰려면:
82
82
  * **📊 차트 생성 (v3.16)**: 마크다운의 ```chart 펜스(type/cat/계열 라인)가 한컴 네이티브 차트(OOXML chartSpace)로 생성됩니다 — 막대·선·원·도넛·영역·분산·방사형 등 20종, 계열/조각 색 지정 가능.
83
83
  * **🔴 도장/서명 자동 날인 (v3.16)**: "(인)"·"서명 또는 인" 같은 앵커 문구를 찾아 도장 PNG를 글 앞 부유로 배치합니다. 표/페이지를 키우지 않아 날인 후 서식이 밀리지 않습니다 (`kordoc seal`).
84
84
  * **✏️ 양식 자동 채우기**: 공문서 양식 템플릿(신청서, 보고서)에 값을 넣으면 자동으로 빈칸을 채웁니다. 원본 서식(글꼴, 크기, 정렬)을 100% 보존합니다.
85
- * **🤖 AI 에이전트 연동 (MCP)**: `Claude`, `Cursor`와 같은 도구에서 직접 `kordoc`을 호출해 문서를 읽고 코딩할 수 있습니다.
85
+ * **🤖 AI 에이전트 연동 (MCP)**: `Claude Desktop`, `Cursor`, `Codex`와 같은 도구에서 직접 `kordoc`을 호출해 문서를 읽고 코딩할 수 있습니다.
86
86
 
87
87
  ---
88
88
 
89
+ ## v4.2.3 변경사항
90
+
91
+ - **인라인 표·텍스트 순서 보존 (#49·#50)**: 한 문단이나 한 셀 안에서 글자취급(treatAsChar) 표와 텍스트가 번갈아 놓일 때(`[날짜] 부터 [날짜] 까지` 같은 서식 기간 입력란) 텍스트가 표 앞으로 끌려나오던 순서 역전을 수정했습니다. 최상위 `blocks`와 `IRCell.blocks` 모두 원문 배치 순서를 따르고, 생성기도 같은 순서로 방출해 라운드트립이 대칭입니다. float·페이지 앵커 표는 종전대로 텍스트 흐름에 불참합니다. (@jumaniac 제보)
92
+
89
93
  ## v4.2.2 변경사항
90
94
 
91
95
  - **~~취소선~~ 추출 (HWP5·HWPX)**: 법령 개정문 등의 삭제 표시가 마크다운 `~~취소선~~`으로 살아납니다. 판정은 취소선 **모양** whitelist — 한컴은 취소선 없는 문자에도 취소선 비트를 기본값으로 저장하므로(원저장소 rhwp 실측) 모양이 실제 선 종류일 때만 인정, 미지 값은 안전하게 무시. HWPX는 부분 취소선까지, HWP5는 문단 단위.
@@ -720,7 +724,7 @@ npx kordoc watch ./수신함 -d ./변환결과 # 폴더 감시 모
720
724
  npx kordoc watch ./문서 --webhook https://api/hook # 웹훅 알림
721
725
  ```
722
726
 
723
- ## MCP 서버 (Claude / Cursor / Windsurf)
727
+ ## MCP 서버 (Claude / Cursor / Windsurf / Codex)
724
728
 
725
729
  **자동 설치 (추천)**:
726
730
 
@@ -730,6 +734,14 @@ npx -y kordoc setup
730
734
 
731
735
  대화형으로 AI 클라이언트를 감지해 설정 파일을 자동 패치. Windows 에서 `cmd /c npx` 래핑도 자동. 상세는 위 [30초 설치](#-30초-설치-ai-에이전트-연동) 섹션.
732
736
 
737
+ Codex는 설정 파일을 직접 수정하지 않고 `codex mcp add` 명령으로 안전하게 등록합니다.
738
+
739
+ **Codex 수동 등록**:
740
+
741
+ ```bash
742
+ codex mcp add kordoc -- npx -y kordoc mcp
743
+ ```
744
+
733
745
  **수동 등록 (macOS / Linux)**:
734
746
 
735
747
  ```json
@@ -40,9 +40,9 @@ import {
40
40
  renderHtml,
41
41
  unknownFontWarnings,
42
42
  validateHwpx
43
- } from "./chunk-TXYQJXOV.js";
43
+ } from "./chunk-CAA6DVEE.js";
44
44
  import "./chunk-7FCNOKOR.js";
45
- import "./chunk-ZF7QL4IY.js";
45
+ import "./chunk-GJO3ORFW.js";
46
46
  import {
47
47
  detectFormat,
48
48
  detectOle2Format,
@@ -59,7 +59,7 @@ import {
59
59
  buildRangeSplices,
60
60
  placeSealHwpx,
61
61
  scanSectionXml
62
- } from "./chunk-LUJN3VFB.js";
62
+ } from "./chunk-ZHRYLT3N.js";
63
63
  import {
64
64
  DEFAULT_REDACT_RULES,
65
65
  redactMarkdown,
@@ -67,10 +67,10 @@ import {
67
67
  } from "./chunk-DZIXKL7E.js";
68
68
  import {
69
69
  blocksToChunks
70
- } from "./chunk-L5B7PQOP.js";
70
+ } from "./chunk-WMM6XVQX.js";
71
71
  import {
72
72
  blocksToMarkdown
73
- } from "./chunk-DSL6EVFJ.js";
73
+ } from "./chunk-I53FOXZR.js";
74
74
  import {
75
75
  SPACE_EM_FIXED,
76
76
  SPACE_EM_FONT,
@@ -80,11 +80,11 @@ import {
80
80
  renderHwpxToSvg,
81
81
  simulateWrap,
82
82
  simulateWrapKeepWord
83
- } from "./chunk-GHMVNMUN.js";
84
- import "./chunk-FHYLLKIP.js";
83
+ } from "./chunk-LWNFAIYG.js";
84
+ import "./chunk-H6O65EPK.js";
85
85
  import {
86
86
  VERSION
87
- } from "./chunk-2L7MIKOM.js";
87
+ } from "./chunk-E2K4SNMD.js";
88
88
  export {
89
89
  DEFAULT_REDACT_RULES,
90
90
  HwpxSession,
@@ -153,4 +153,4 @@ export {
153
153
  unknownFontWarnings,
154
154
  validateHwpx
155
155
  };
156
- //# sourceMappingURL=-NFHVGTVM.js.map
156
+ //# sourceMappingURL=-2M56QRNH.js.map
@@ -1,7 +1,7 @@
1
1
  #!/usr/bin/env node
2
2
  import {
3
3
  KordocError
4
- } from "./chunk-2L7MIKOM.js";
4
+ } from "./chunk-E2K4SNMD.js";
5
5
 
6
6
  // src/hwpx/profile-io.ts
7
7
  import { z } from "zod";
@@ -89,4 +89,4 @@ export {
89
89
  formatProfileSchema,
90
90
  parseFormatProfileJson
91
91
  };
92
- //# sourceMappingURL=chunk-MYD3QLBL.js.map
92
+ //# sourceMappingURL=chunk-7KRCQE3P.js.map
@@ -3,11 +3,11 @@ import {
3
3
  HEADING_RATIO_H1,
4
4
  HEADING_RATIO_H2,
5
5
  HEADING_RATIO_H3
6
- } from "./chunk-ZF7QL4IY.js";
6
+ } from "./chunk-GJO3ORFW.js";
7
7
  import {
8
8
  safeMax,
9
9
  safeMin
10
- } from "./chunk-2L7MIKOM.js";
10
+ } from "./chunk-E2K4SNMD.js";
11
11
 
12
12
  // src/pdf/image-regions.ts
13
13
  import { OPS } from "pdfjs-dist/legacy/build/pdf.mjs";
@@ -3343,4 +3343,4 @@ export {
3343
3343
  extractPageBlocksWithLines,
3344
3344
  mergeCrossPageTables
3345
3345
  };
3346
- //# sourceMappingURL=chunk-OLDIDBJ2.js.map
3346
+ //# sourceMappingURL=chunk-7Z3NHIRR.js.map
@@ -1,5 +1,5 @@
1
1
  "use strict";Object.defineProperty(exports, "__esModule", {value: true}); function _nullishCoalesce(lhs, rhsFn) { if (lhs != null) { return lhs; } else { return rhsFn(); } } function _optionalChain(ops) { let lastAccessLHS = undefined; let value = ops[0]; let i = 1; while (i < ops.length) { const op = ops[i]; const fn = ops[i + 1]; i += 2; if ((op === 'optionalAccess' || op === 'optionalCall') && value == null) { return undefined; } if (op === 'access' || op === 'optionalAccess') { lastAccessLHS = value; value = fn(value); } else if (op === 'call' || op === 'optionalCall') { value = fn((...args) => value.call(lastAccessLHS, ...args)); lastAccessLHS = undefined; } } return value; }// src/utils.ts
2
- var VERSION = true ? "4.2.2" : "0.0.0-dev";
2
+ var VERSION = true ? "4.2.4" : "0.0.0-dev";
3
3
  function toArrayBuffer(buf) {
4
4
  if (buf.byteOffset === 0 && buf.byteLength === buf.buffer.byteLength) {
5
5
  return buf.buffer;
@@ -127,4 +127,4 @@ var HEADING_RATIO_H3 = 1.15;
127
127
 
128
128
 
129
129
  exports.VERSION = VERSION; exports.toArrayBuffer = toArrayBuffer; exports.KordocError = KordocError; exports.sanitizeError = sanitizeError; exports.isPathTraversal = isPathTraversal; exports.normalizeSectionHref = normalizeSectionHref; exports.compareSectionPaths = compareSectionPaths; exports.precheckZipSize = precheckZipSize; exports.stripDtd = stripDtd; exports.sanitizeHref = sanitizeHref; exports.safeMin = safeMin; exports.safeMax = safeMax; exports.classifyError = classifyError; exports.HEADING_RATIO_H1 = HEADING_RATIO_H1; exports.HEADING_RATIO_H2 = HEADING_RATIO_H2; exports.HEADING_RATIO_H3 = HEADING_RATIO_H3;
130
- //# sourceMappingURL=chunk-KKZATKQW.cjs.map
130
+ //# sourceMappingURL=chunk-BLNOGMIM.cjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"sources":["/Users/mong-e/workspace/kordoc/dist/chunk-BLNOGMIM.cjs","../src/utils.ts","../src/types.ts"],"names":[],"mappings":"AAAA;ACIO,IAAM,QAAA,EAAkB,KAAA,EAA4C,QAAA,EAAqB,WAAA;AAOzF,SAAS,aAAA,CAAc,GAAA,EAA0B;AACtD,EAAA,GAAA,CAAI,GAAA,CAAI,WAAA,IAAe,EAAA,GAAK,GAAA,CAAI,WAAA,IAAe,GAAA,CAAI,MAAA,CAAO,UAAA,EAAY;AACpE,IAAA,OAAO,GAAA,CAAI,MAAA;AAAA,EACb;AACA,EAAA,OAAO,GAAA,CAAI,MAAA,CAAO,KAAA,CAAM,GAAA,CAAI,UAAA,EAAY,GAAA,CAAI,WAAA,EAAa,GAAA,CAAI,UAAU,CAAA;AACzE;AAMO,IAAM,YAAA,EAAN,MAAA,QAA0B,MAAM;AAAA,EACrC,WAAA,CAAY,OAAA,EAAiB;AAC3B,IAAA,KAAA,CAAM,OAAO,CAAA;AACb,IAAA,IAAA,CAAK,KAAA,EAAO,aAAA;AAAA,EACd;AACF,CAAA;AAMO,SAAS,aAAA,CAAc,GAAA,EAAsB;AAClD,EAAA,GAAA,CAAI,IAAA,WAAe,WAAA,EAAa,OAAO,GAAA,CAAI,OAAA;AAC3C,EAAA,OAAO,0FAAA;AACT;AAMO,SAAS,eAAA,CAAgB,IAAA,EAAuB;AACrD,EAAA,GAAA,CAAI,IAAA,CAAK,QAAA,CAAS,IAAM,CAAA,EAAG,OAAO,IAAA;AAClC,EAAA,MAAM,WAAA,EAAa,IAAA,CAAK,OAAA,CAAQ,KAAA,EAAO,GAAG,CAAA;AAC1C,EAAA,MAAM,SAAA,EAAW,UAAA,CAAW,KAAA,CAAM,GAAG,CAAA;AACrC,EAAA,OAAO,QAAA,CAAS,IAAA,CAAK,CAAA,CAAA,EAAA,GAAK,EAAA,IAAM,IAAI,EAAA,GAAK,UAAA,CAAW,UAAA,CAAW,GAAG,EAAA,GAAK,YAAA,CAAa,IAAA,CAAK,UAAU,CAAA;AACrG;AASO,SAAS,oBAAA,CAAqB,IAAA,EAA6B;AAChE,EAAA,GAAA,CAAI,CAAC,IAAA,EAAM,OAAO,IAAA;AAClB,EAAA,IAAI,WAAA,EAAa,IAAA,CAAK,OAAA,CAAQ,KAAA,EAAO,GAAG,CAAA,CAAE,OAAA,CAAQ,MAAA,EAAQ,EAAE,CAAA;AAC5D,EAAA,GAAA,CAAI,eAAA,CAAgB,UAAU,CAAA,EAAG,OAAO,IAAA;AACxC,EAAA,GAAA,CAAI,sBAAA,CAAuB,IAAA,CAAK,UAAU,CAAA,EAAG,WAAA,EAAa,YAAA,EAAc,UAAA;AACxE,EAAA,OAAO,6BAAA,CAA8B,IAAA,CAAK,UAAU,EAAA,EAAI,WAAA,EAAa,IAAA;AACvE;AAGO,SAAS,mBAAA,CAAoB,CAAA,EAAW,CAAA,EAAmB;AAChE,EAAA,MAAM,GAAA,EAAK,MAAA,kCAAO,CAAA,mBAAE,KAAA,mBAAM,uBAAuB,CAAA,4BAAA,CAAI,CAAC,GAAA,UAAK,MAAA,CAAO,kBAAgB,CAAA;AAClF,EAAA,MAAM,GAAA,EAAK,MAAA,kCAAO,CAAA,qBAAE,KAAA,mBAAM,uBAAuB,CAAA,4BAAA,CAAI,CAAC,GAAA,UAAK,MAAA,CAAO,kBAAgB,CAAA;AAClF,EAAA,OAAO,GAAA,IAAO,GAAA,EAAK,CAAA,CAAE,aAAA,CAAc,CAAC,EAAA,EAAI,GAAA,EAAK,EAAA;AAC/C;AAQO,SAAS,eAAA,CACd,MAAA,EACA,oBAAA,EAAsB,IAAA,EAAM,KAAA,EAAO,IAAA,EACnC,WAAA,EAAa,GAAA,EACsC;AACnD,EAAA,IAAI;AACF,IAAA,MAAM,KAAA,EAAO,IAAI,QAAA,CAAS,MAAM,CAAA;AAChC,IAAA,MAAM,IAAA,EAAM,MAAA,CAAO,UAAA;AAEnB,IAAA,IAAI,WAAA,EAAa,CAAA,CAAA;AACjB,IAAA,IAAA,CAAA,IAAS,EAAA,EAAI,IAAA,EAAM,EAAA,EAAI,EAAA,GAAK,IAAA,CAAK,GAAA,CAAI,CAAA,EAAG,IAAA,EAAM,KAAK,CAAA,EAAG,CAAA,EAAA,EAAK;AACzD,MAAA,GAAA,CAAI,IAAA,CAAK,SAAA,CAAU,CAAA,EAAG,IAAI,EAAA,IAAM,SAAA,EAAY;AAAE,QAAA,WAAA,EAAa,CAAA;AAAG,QAAA,KAAA;AAAA,MAAM;AAAA,IACtE;AACA,IAAA,GAAA,CAAI,WAAA,EAAa,CAAA,EAAG,OAAO,EAAE,iBAAA,EAAmB,CAAA,EAAG,UAAA,EAAY,EAAE,CAAA;AAEjE,IAAA,MAAM,WAAA,EAAa,IAAA,CAAK,SAAA,CAAU,WAAA,EAAa,EAAA,EAAI,IAAI,CAAA;AACvD,IAAA,GAAA,CAAI,WAAA,EAAa,UAAA,EAAY;AAC3B,MAAA,MAAM,IAAI,WAAA,CAAY,CAAA,4CAAA,EAAiB,UAAU,CAAA,eAAA,EAAQ,UAAU,CAAA,CAAA,CAAG,CAAA;AAAA,IACxE;AAEA,IAAA,MAAM,OAAA,EAAS,IAAA,CAAK,SAAA,CAAU,WAAA,EAAa,EAAA,EAAI,IAAI,CAAA;AACnD,IAAA,MAAM,SAAA,EAAW,IAAA,CAAK,SAAA,CAAU,WAAA,EAAa,EAAA,EAAI,IAAI,CAAA;AACrD,IAAA,GAAA,CAAI,SAAA,EAAW,OAAA,EAAS,GAAA,EAAK,OAAO,EAAE,iBAAA,EAAmB,CAAA,EAAG,WAAW,CAAA;AAEvE,IAAA,IAAI,kBAAA,EAAoB,CAAA;AACxB,IAAA,IAAI,IAAA,EAAM,QAAA;AACV,IAAA,IAAA,CAAA,IAAS,EAAA,EAAI,CAAA,EAAG,EAAA,EAAI,WAAA,GAAc,IAAA,EAAM,GAAA,GAAM,SAAA,EAAW,MAAA,EAAQ,CAAA,EAAA,EAAK;AACpE,MAAA,GAAA,CAAI,IAAA,CAAK,SAAA,CAAU,GAAA,EAAK,IAAI,EAAA,IAAM,QAAA,EAAY,KAAA;AAC9C,MAAA,kBAAA,GAAqB,IAAA,CAAK,SAAA,CAAU,IAAA,EAAM,EAAA,EAAI,IAAI,CAAA;AAClD,MAAA,MAAM,QAAA,EAAU,IAAA,CAAK,SAAA,CAAU,IAAA,EAAM,EAAA,EAAI,IAAI,CAAA;AAC7C,MAAA,MAAM,SAAA,EAAW,IAAA,CAAK,SAAA,CAAU,IAAA,EAAM,EAAA,EAAI,IAAI,CAAA;AAC9C,MAAA,MAAM,WAAA,EAAa,IAAA,CAAK,SAAA,CAAU,IAAA,EAAM,EAAA,EAAI,IAAI,CAAA;AAChD,MAAA,IAAA,GAAO,GAAA,EAAK,QAAA,EAAU,SAAA,EAAW,UAAA;AAAA,IACnC;AAEA,IAAA,GAAA,CAAI,kBAAA,EAAoB,mBAAA,EAAqB;AAC3C,MAAA,MAAM,IAAI,WAAA,CAAY,CAAA,kDAAA,EAAA,CAAmB,kBAAA,EAAoB,KAAA,EAAO,IAAA,CAAA,CAAM,OAAA,CAAQ,CAAC,CAAC,CAAA,iBAAA,EAAU,oBAAA,EAAsB,KAAA,EAAO,IAAI,CAAA,GAAA,CAAK,CAAA;AAAA,IACtI;AAEA,IAAA,OAAO,EAAE,iBAAA,EAAmB,WAAW,CAAA;AAAA,EACzC,EAAA,MAAA,CAAS,GAAA,EAAK;AACZ,IAAA,GAAA,CAAI,IAAA,WAAe,WAAA,EAAa,MAAM,GAAA;AACtC,IAAA,OAAO,EAAE,iBAAA,EAAmB,CAAA,EAAG,UAAA,EAAY,EAAE,CAAA;AAAA,EAC/C;AACF;AAGO,SAAS,QAAA,CAAS,GAAA,EAAqB;AAC5C,EAAA,OAAO,GAAA,CAAI,OAAA,CAAQ,wCAAA,EAA0C,EAAE,CAAA;AACjE;AAGA,IAAM,aAAA,EAAe,8BAAA;AACd,SAAS,YAAA,CAAa,IAAA,EAA6B;AACxD,EAAA,MAAM,QAAA,EAAU,IAAA,CAAK,IAAA,CAAK,CAAA;AAC1B,EAAA,GAAA,CAAI,CAAC,QAAA,GAAW,CAAC,YAAA,CAAa,IAAA,CAAK,OAAO,CAAA,EAAG,OAAO,IAAA;AAGpD,EAAA,OAAO,OAAA,CAAQ,OAAA,CAAQ,KAAA,EAAO,KAAK,CAAA,CAAE,OAAA,CAAQ,KAAA,EAAO,KAAK,CAAA;AAC3D;AAKO,SAAS,OAAA,CAAQ,GAAA,EAAuB;AAC7C,EAAA,IAAI,IAAA,EAAM,QAAA;AACV,EAAA,IAAA,CAAA,IAAS,EAAA,EAAI,CAAA,EAAG,EAAA,EAAI,GAAA,CAAI,MAAA,EAAQ,CAAA,EAAA,EAAK,GAAA,CAAI,GAAA,CAAI,CAAC,EAAA,EAAI,GAAA,EAAK,IAAA,EAAM,GAAA,CAAI,CAAC,CAAA;AAClE,EAAA,OAAO,GAAA;AACT;AAGO,SAAS,OAAA,CAAQ,GAAA,EAAuB;AAC7C,EAAA,IAAI,IAAA,EAAM,CAAA,QAAA;AACV,EAAA,IAAA,CAAA,IAAS,EAAA,EAAI,CAAA,EAAG,EAAA,EAAI,GAAA,CAAI,MAAA,EAAQ,CAAA,EAAA,EAAK,GAAA,CAAI,GAAA,CAAI,CAAC,EAAA,EAAI,GAAA,EAAK,IAAA,EAAM,GAAA,CAAI,CAAC,CAAA;AAClE,EAAA,OAAO,GAAA;AACT;AAOO,SAAS,aAAA,CAAc,GAAA,EAAyB;AACrD,EAAA,GAAA,CAAI,CAAA,CAAE,IAAA,WAAe,KAAA,CAAA,EAAQ,OAAO,aAAA;AACpC,EAAA,MAAM,IAAA,EAAM,GAAA,CAAI,OAAA;AAChB,EAAA,GAAA,CAAI,GAAA,CAAI,QAAA,CAAS,oBAAK,CAAA,EAAG,OAAO,WAAA;AAChC,EAAA,GAAA,CAAI,GAAA,CAAI,QAAA,CAAS,KAAK,CAAA,EAAG,OAAO,eAAA;AAChC,EAAA,GAAA,CAAI,GAAA,CAAI,QAAA,CAAS,UAAU,EAAA,GAAK,GAAA,CAAI,QAAA,CAAS,kDAAe,EAAA,GAAK,GAAA,CAAI,QAAA,CAAS,4CAAc,CAAA,EAAG,OAAO,UAAA;AACtG,EAAA,GAAA,CAAI,GAAA,CAAI,QAAA,CAAS,MAAM,EAAA,GAAK,GAAA,CAAI,QAAA,CAAS,2BAAO,EAAA,GAAK,GAAA,CAAI,QAAA,CAAS,2BAAO,CAAA,EAAG,OAAO,oBAAA;AACnF,EAAA,GAAA,CAAI,GAAA,CAAI,QAAA,CAAS,iCAAQ,CAAA,EAAG,OAAO,iBAAA;AACnC,EAAA,GAAA,CAAI,GAAA,CAAI,QAAA,CAAS,cAAI,EAAA,GAAA,CAAM,GAAA,CAAI,QAAA,CAAS,4BAAQ,EAAA,GAAK,GAAA,CAAI,QAAA,CAAS,cAAI,CAAA,CAAA,EAAI,OAAO,aAAA;AACjF,EAAA,GAAA,CAAI,GAAA,CAAI,QAAA,CAAS,0BAAM,EAAA,GAAK,GAAA,CAAI,QAAA,CAAS,kCAAS,CAAA,EAAG,OAAO,WAAA;AAC5D,EAAA,OAAO,aAAA;AACT;ADjEA;AACA;AEkWO,IAAM,iBAAA,EAAmB,GAAA;AACzB,IAAM,iBAAA,EAAmB,GAAA;AACzB,IAAM,iBAAA,EAAmB,IAAA;AFhWhC;AACA;AACE;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACA;AACF,+mBAAC","file":"/Users/mong-e/workspace/kordoc/dist/chunk-BLNOGMIM.cjs","sourcesContent":[null,"/** kordoc 공용 유틸리티 */\n\n/** 빌드 타임에 tsup define으로 주입되는 버전 */\ndeclare const __KORDOC_VERSION__: string\nexport const VERSION: string = typeof __KORDOC_VERSION__ !== \"undefined\" ? __KORDOC_VERSION__ : \"0.0.0-dev\"\n\n/**\n * Node.js Buffer → ArrayBuffer 변환\n * pool Buffer의 공유 ArrayBuffer 문제를 안전하게 처리.\n * offset=0이고 전체 ArrayBuffer를 차지하면 복사 없이 직접 반환.\n */\nexport function toArrayBuffer(buf: Buffer): ArrayBuffer {\n if (buf.byteOffset === 0 && buf.byteLength === buf.buffer.byteLength) {\n return buf.buffer as ArrayBuffer\n }\n return buf.buffer.slice(buf.byteOffset, buf.byteOffset + buf.byteLength) as ArrayBuffer\n}\n\n/**\n * kordoc 내부 에러 클래스 — 사용자에게 노출해도 안전한 메시지만 포함.\n * MCP 에러 정제에서 instanceof로 판별하여 allowlist 패턴 매칭 없이 안전하게 통과.\n */\nexport class KordocError extends Error {\n constructor(message: string) {\n super(message)\n this.name = \"KordocError\"\n }\n}\n\n/**\n * 에러 메시지 정제 — KordocError는 그대로, 나머지는 일반 메시지로 대체.\n * 파일시스템 경로, 스택 트레이스 등 내부 정보 노출 방지.\n */\nexport function sanitizeError(err: unknown): string {\n if (err instanceof KordocError) return err.message\n return \"문서 처리 중 오류가 발생했습니다\"\n}\n\n/**\n * ZIP 엔트리 경로의 경로 순회 여부 판별.\n * 백슬래시 정규화, .., 절대경로, Windows 드라이브 문자 모두 차단.\n */\nexport function isPathTraversal(name: string): boolean {\n if (name.includes(\"\\x00\")) return true\n const normalized = name.replace(/\\\\/g, \"/\")\n const segments = normalized.split(\"/\")\n return segments.some(s => s === \"..\") || normalized.startsWith(\"/\") || /^[A-Za-z]:/.test(normalized)\n}\n\n// ─── HWPX 섹션 href 해석 (parser/roundtrip 공용) ────────────────────\n\n/**\n * manifest href를 본문 섹션 경로(`Contents/sectionN.xml`)로 정규화.\n * 비본문 XML(header/script/settings)·path traversal·드라이브 경로는 null로 거른다.\n * 백슬래시 구분자를 슬래시로 통일해 parser와 roundtrip이 동일한 목록을 만든다.\n */\nexport function normalizeSectionHref(href: string): string | null {\n if (!href) return null\n let normalized = href.replace(/\\\\/g, \"/\").replace(/^\\/+/, \"\")\n if (isPathTraversal(normalized)) return null\n if (/^[Ss]ection\\d+\\.xml$/.test(normalized)) normalized = \"Contents/\" + normalized\n return /(?:^|\\/)[Ss]ection\\d+\\.xml$/.test(normalized) ? normalized : null\n}\n\n/** sectionN.xml을 N 숫자 순서로 정렬 (section10 > section2). */\nexport function compareSectionPaths(a: string, b: string): number {\n const ai = Number(a.match(/[Ss]ection(\\d+)\\.xml$/)?.[1] ?? Number.MAX_SAFE_INTEGER)\n const bi = Number(b.match(/[Ss]ection(\\d+)\\.xml$/)?.[1] ?? Number.MAX_SAFE_INTEGER)\n return ai === bi ? a.localeCompare(b) : ai - bi\n}\n\n// ─── ZIP 안전 로딩 (ZIP bomb 방지) ────────────────────\n\n/**\n * ZIP bomb 사전 검사 — Central Directory에서 비압축 합계와 엔트리 수 확인.\n * HWPX/XLSX/DOCX 등 모든 ZIP 기반 포맷에서 공통 사용.\n */\nexport function precheckZipSize(\n buffer: ArrayBuffer,\n maxUncompressedSize = 256 * 1024 * 1024, // parser-shared MAX_DECOMPRESS_SIZE 와 동기\n maxEntries = 500,\n): { totalUncompressed: number; entryCount: number } {\n try {\n const data = new DataView(buffer)\n const len = buffer.byteLength\n // EOCD 시그니처 역방향 스캔\n let eocdOffset = -1\n for (let i = len - 22; i >= Math.max(0, len - 65557); i--) {\n if (data.getUint32(i, true) === 0x06054b50) { eocdOffset = i; break }\n }\n if (eocdOffset < 0) return { totalUncompressed: 0, entryCount: 0 }\n\n const entryCount = data.getUint16(eocdOffset + 10, true)\n if (entryCount > maxEntries) {\n throw new KordocError(`ZIP 엔트리 수 초과: ${entryCount} (최대 ${maxEntries})`)\n }\n\n const cdSize = data.getUint32(eocdOffset + 12, true)\n const cdOffset = data.getUint32(eocdOffset + 16, true)\n if (cdOffset + cdSize > len) return { totalUncompressed: 0, entryCount }\n\n let totalUncompressed = 0\n let pos = cdOffset\n for (let i = 0; i < entryCount && pos + 46 <= cdOffset + cdSize; i++) {\n if (data.getUint32(pos, true) !== 0x02014b50) break\n totalUncompressed += data.getUint32(pos + 24, true)\n const nameLen = data.getUint16(pos + 28, true)\n const extraLen = data.getUint16(pos + 30, true)\n const commentLen = data.getUint16(pos + 32, true)\n pos += 46 + nameLen + extraLen + commentLen\n }\n\n if (totalUncompressed > maxUncompressedSize) {\n throw new KordocError(`ZIP 비압축 크기 초과: ${(totalUncompressed / 1024 / 1024).toFixed(1)}MB (최대 ${maxUncompressedSize / 1024 / 1024}MB)`)\n }\n\n return { totalUncompressed, entryCount }\n } catch (err) {\n if (err instanceof KordocError) throw err\n return { totalUncompressed: 0, entryCount: 0 }\n }\n}\n\n/** XXE/Billion Laughs 방지 — DOCTYPE 제거 (내부 DTD 서브셋 포함) */\nexport function stripDtd(xml: string): string {\n return xml.replace(/<!DOCTYPE\\s[^[>]*(\\[[\\s\\S]*?\\])?\\s*>/gi, \"\")\n}\n\n/** 하이퍼링크 URL 살균 — javascript: 등 XSS 위험 스킴 차단 */\nconst SAFE_HREF_RE = /^(?:https?:|mailto:|tel:|#)/i\nexport function sanitizeHref(href: string): string | null {\n const trimmed = href.trim()\n if (!trimmed || !SAFE_HREF_RE.test(trimmed)) return null\n // 괄호 percent-encoding — 마크다운 링크 목적지에서 불균형 ')'는 링크를 조기 종료시켜\n // 문법이 깨진다 (원문 하이퍼링크에 ')'가 박힌 실문서 존재). %28/%29는 의미 동일.\n return trimmed.replace(/\\(/g, \"%28\").replace(/\\)/g, \"%29\")\n}\n\n// ─── 안전한 min/max (스택 오버플로 방지) ─────────────\n\n/** Math.min(...arr) 대체 — 대형 배열에서 스택 오버플로 방지 */\nexport function safeMin(arr: number[]): number {\n let min = Infinity\n for (let i = 0; i < arr.length; i++) if (arr[i] < min) min = arr[i]\n return min\n}\n\n/** Math.max(...arr) 대체 — 대형 배열에서 스택 오버플로 방지 */\nexport function safeMax(arr: number[]): number {\n let max = -Infinity\n for (let i = 0; i < arr.length; i++) if (arr[i] > max) max = arr[i]\n return max\n}\n\n// ─── 에러 분류 ──────────────────────────────────────\n\nimport type { ErrorCode } from \"./types.js\"\n\n/** 에러를 구조화된 ErrorCode로 분류 — KordocError 메시지 패턴 매칭 */\nexport function classifyError(err: unknown): ErrorCode {\n if (!(err instanceof Error)) return \"PARSE_ERROR\"\n const msg = err.message\n if (msg.includes(\"암호화\")) return \"ENCRYPTED\"\n if (msg.includes(\"DRM\")) return \"DRM_PROTECTED\"\n if (msg.includes(\"ZIP bomb\") || msg.includes(\"ZIP 비압축 크기 초과\") || msg.includes(\"ZIP 엔트리 수 초과\")) return \"ZIP_BOMB\"\n if (msg.includes(\"bomb\") || msg.includes(\"크기 초과\") || msg.includes(\"압축 해제\")) return \"DECOMPRESSION_BOMB\"\n if (msg.includes(\"이미지 기반\")) return \"IMAGE_BASED_PDF\"\n if (msg.includes(\"섹션\") && (msg.includes(\"찾을 수 없\") || msg.includes(\"없음\"))) return \"NO_SECTIONS\"\n if (msg.includes(\"시그니처\") || msg.includes(\"복구할 수 없\")) return \"CORRUPTED\"\n return \"PARSE_ERROR\"\n}\n","/** kordoc 공통 타입 정의 */\n\n// ─── 중간 표현 (Intermediate Representation) ─────────\n\nexport interface CellContext {\n text: string\n colSpan: number\n rowSpan: number\n /** HWP5 셀 열 주소 (0-based) — 병합 테이블 배치용 */\n colAddr?: number\n /** HWP5 셀 행 주소 (0-based) — 병합 테이블 배치용 */\n rowAddr?: number\n}\n\n/** 블록 타입 — v2.0에서 heading, list, image, separator 추가 */\nexport type IRBlockType = \"paragraph\" | \"table\" | \"heading\" | \"list\" | \"image\" | \"separator\"\n\n/** 인라인 강조 run-span — 문단 텍스트를 서식 단위로 쪼갠 조각 (텍스트 연결 = block.text) */\nexport interface IRSpan {\n text: string\n bold?: boolean\n italic?: boolean\n strike?: boolean\n code?: boolean\n}\n\nexport interface IRBlock {\n type: IRBlockType\n text?: string\n table?: IRTable\n /** 헤딩 레벨 (1-6), type=\"heading\"일 때 사용 */\n level?: number\n /** 원본 페이지 번호 (1-based) */\n pageNumber?: number\n /** 바운딩 박스 — PDF에서만 제공 */\n bbox?: BoundingBox\n /** 텍스트 스타일 정보 (선택) */\n style?: InlineStyle\n /** 리스트 타입, type=\"list\"일 때 사용 */\n listType?: \"ordered\" | \"unordered\"\n /** 중첩 리스트 아이템 */\n children?: IRBlock[]\n /** 하이퍼링크 URL */\n href?: string\n /** 각주/미주 텍스트 (인라인 삽입용) */\n footnoteText?: string\n /** 이미지 데이터 (type=\"image\"일 때) */\n imageData?: ImageData\n /** 인라인 강조 run-span (선택 — kordoc 생성 hwpx 왕복 채널 + 외래 실속성 볼드/이탤릭).\n * 존재하면 마크다운 변환이 **·*·` 마커를 재방출한다 */\n spans?: IRSpan[]\n /** 인용문 문단 (선택 — kordoc 생성 hwpx 왕복 채널) — 마크다운 변환이 \"> \" 접두 재방출 */\n quote?: boolean\n /**\n * 문단 들여쓰기(HWPUNIT, 선택) — HWPX paraPr `<hh:margin>` 자식요소형 hc:left\n * (+양수 hc:intent 첫줄분). 마크다운 방출엔 쓰지 않는 관찰 슬롯 — gongmun 리스트\n * depth 재유도·양식 분석 등 소비자 몫 (v4.0.4)\n */\n indent?: number\n /**\n * gongmun 리스트 단계(1~7, 선택) — indent를 levelIndent 단위로 역산한 소비 결과\n * (v4.0.5). md 리스트 문법과 충돌하는 부호('- '·'1) ') 문단에만 채워지며,\n * 마크다운 변환이 2칸/단계 선행 공백을 방출해 재생성 시 depth가 복원된다\n */\n listDepth?: number\n}\n\n/** 추출된 이미지 바이너리 데이터 */\nexport interface ImageData {\n /** 이미지 바이너리 */\n data: Uint8Array\n /** MIME 타입 (image/png, image/jpeg, image/gif, image/bmp, image/wmf, image/emf) */\n mimeType: string\n /** 원본 파일명 (있는 경우) */\n filename?: string\n}\n\n/** 바운딩 박스 — PDF 포인트 단위 (72pt = 1인치) */\nexport interface BoundingBox {\n page: number\n x: number\n y: number\n width: number\n height: number\n}\n\n/** 인라인 텍스트 스타일 */\nexport interface InlineStyle {\n bold?: boolean\n italic?: boolean\n /** 취소선 — 법령 개정문 등의 삭제 표시. 판정은 취소선 모양 whitelist (비트만 믿으면 오탐) */\n strike?: boolean\n fontSize?: number\n fontName?: string\n}\n\nexport interface IRTable {\n rows: number\n cols: number\n cells: IRCell[][]\n /** 첫 행을 헤더로 렌더링할지 여부 (현재: rows > 1이면 true — 의미적 감지가 아닌 레이아웃 힌트) */\n hasHeader: boolean\n /** 표 캡션 (예: \"표 1. 부서별 예산\") — v3.0 */\n caption?: string\n}\n\nexport interface IRCell {\n text: string\n colSpan: number\n rowSpan: number\n /**\n * 셀 내부 블록 콘텐츠 — v3.0.\n * 중첩 표·이미지·다중 문단을 구조 그대로, 문서(원문) 순서대로 보존한다.\n * 표와 텍스트가 한 줄에 번갈아 놓인 셀도 배치 순서를 따른다 (v4.2.3, #49).\n * blocks가 있으면 text는 blocks의 평탄화 텍스트(하위 호환용)다.\n */\n blocks?: IRBlock[]\n /** 제목 셀 여부 (HWP5 width_ref bit2 / HWPX header 속성) — v3.0 */\n isHeader?: boolean\n}\n\n// ─── 메타데이터 ─────────────────────────────────────\n\n/** 문서 메타데이터 — 각 포맷에서 추출 가능한 필드만 채워짐 */\nexport interface DocumentMetadata {\n /** 문서 제목 */\n title?: string\n /** 작성자 */\n author?: string\n /** 작성 프로그램 (예: \"한글 2020\", \"Adobe Acrobat\") */\n creator?: string\n /** 생성일시 (ISO 8601) */\n createdAt?: string\n /** 수정일시 (ISO 8601) */\n modifiedAt?: string\n /** 페이지/섹션 수 */\n pageCount?: number\n /** 문서 포맷 버전 (예: HWP \"5.1.0.1\") */\n version?: string\n /** 설명 */\n description?: string\n /** 키워드 */\n keywords?: string[]\n}\n\n// ─── 파싱 옵션 ──────────────────────────────────────\n\n/** 파싱 옵션 — parse() 함수에 전달 */\nexport interface ParseOptions {\n /**\n * 파싱할 페이지/섹션 범위 (1-based).\n * - 배열: [1, 2, 3]\n * - 문자열: \"1-3\", \"1,3,5-7\"\n *\n * PDF: 정확한 페이지 단위. HWP/HWPX: 섹션 단위 근사치.\n */\n pages?: number[] | string\n /** 이미지 기반 PDF OCR (선택).\n * - `true`: 내장 엔진(PP-OCRv5 korean, ~18MB 자동 다운로드)으로 OCR 필요 판정\n * 페이지만 인식 (스캔 페이지·글꼴 매핑 깨진 페이지). 정상 페이지는 파싱 결과 유지.\n * - `\"force\"`: 전 페이지를 내장 엔진으로 강제 OCR.\n * - 함수: 사용자 제공 OcrProvider (Claude Vision·Tesseract 등) — 판정은 `true`와 동일. */\n ocr?: boolean | \"force\" | OcrProvider\n /** 진행률 콜백 — current: 현재 페이지/섹션, total: 전체 수 */\n onProgress?: (current: number, total: number) => void\n /** PDF 머리글/바닥글 자동 제거 */\n removeHeaderFooter?: boolean\n /** 표 오른쪽 끝의 빈 열(서식 문서의 입력란) 보존 (#47).\n * 기본 false: 마크다운 가독성을 위해 후행 빈 열을 트림.\n * 양식 인식 경로(parse_form·fill)는 내부적으로 항상 켠다. */\n keepTrailingEmptyCols?: boolean\n /** 원본 파일 경로 (DRM COM fallback에 필요, 내부 전용) */\n filePath?: string\n /**\n * PDF 수식 OCR 활성화 (기본 false).\n *\n * 활성화 시 각 PDF 페이지를 이미지로 렌더링 → YOLOv8 기반 수식 영역 검출 →\n * TrOCR 기반 LaTeX 인식. 감지된 수식은 `$...$` (inline) / `$$...$$` (display) 로\n * 블록 텍스트에 삽입된다.\n *\n * 필수 optional 의존성: `onnxruntime-node`, `@huggingface/transformers`,\n * `@hyzyla/pdfium`, `sharp`. 미설치 시 parse 에 실패하지 않고 **경고만** 남기고\n * 수식 인식은 skip 한다 (일반 텍스트 추출은 정상 동작).\n *\n * 모델(~155MB) 은 첫 사용 시 HuggingFace 에서 자동 다운로드 되어\n * `~/.cache/kordoc/models/pix2text/` 에 SHA-256 검증과 함께 저장된다.\n */\n formulaOcr?: boolean\n /**\n * 레이아웃 표 페이지 반복 헤더(러닝 헤더) 정리 휴리스틱 활성화 (기본 false).\n *\n * 구형 HWP5 문서가 페이지마다 재삽입한 짧은 번호매김 러닝 헤더\n * (\"2. 과제 구축 내용\")를 최초 1회만 남기고 이후 중복을 제거한다.\n * 다만 페이지 위치 정보가 없는 HWP5 특성상 이 휴리스틱은 정당하게 반복되는\n * 번호매김 문단(예: 붙임/별지별 재번호 \"1. 목적\")도 삭제할 수 있어 opt-in 으로\n * 둔다. 활성 시 제거가 발생하면 HIDDEN_TEXT_FILTERED 경고를 남긴다.\n */\n dedupeRunningHeaders?: boolean\n /**\n * 추출된 이미지를 마크다운에 base64 data URI 로 인라인 (기본 false).\n *\n * 활성화 시 `![image](image_001.bmp)` 참조를 `![image](data:image/png;base64,...)` 로\n * 치환한다. 임베드된 BMP 는 PNG 로 무손실 압축 후 인라인하여 용량을 크게 줄인다.\n * 별도 이미지 파일 없이 자체 완결형 마크다운이 되어 MCP/AI 에이전트 소비에 적합하다.\n * (현재 HWP5 경로 지원)\n */\n inlineImages?: boolean\n}\n\n// ─── 파싱 경고 ──────────────────────────────────────\n\n/** 파싱 중 스킵/실패한 요소 보고 */\nexport interface ParseWarning {\n /** 관련 페이지 번호 (알 수 있는 경우) */\n page?: number\n /** 경고 메시지 */\n message: string\n /** 구조화된 경고 코드 */\n code: WarningCode\n}\n\nexport type WarningCode =\n | \"SKIPPED_IMAGE\"\n | \"SKIPPED_OLE\"\n | \"TRUNCATED_TABLE\"\n | \"OCR_FALLBACK\"\n | \"UNSUPPORTED_ELEMENT\"\n | \"BROKEN_ZIP_RECOVERY\"\n | \"HIDDEN_TEXT_FILTERED\"\n | \"MALFORMED_XML\"\n | \"PARTIAL_PARSE\"\n | \"LENIENT_CFB_RECOVERY\"\n | \"NEEDS_OCR\"\n | \"OCR_FAILED\"\n | \"OCR_APPLIED\"\n | \"COM_EMPTY\"\n | \"DRM_COM_FALLBACK\"\n\n/** 문서 구조 (헤딩 트리) */\nexport interface OutlineItem {\n level: number\n text: string\n pageNumber?: number\n}\n\n// ─── 에러 코드 ──────────────────────────────────────\n\n/** 구조화된 에러 코드 — 프로그래밍적 에러 핸들링용 */\nexport type ErrorCode =\n | \"EMPTY_INPUT\"\n | \"UNSUPPORTED_FORMAT\"\n | \"ENCRYPTED\"\n | \"DRM_PROTECTED\"\n | \"CORRUPTED\"\n | \"DECOMPRESSION_BOMB\"\n | \"ZIP_BOMB\"\n | \"IMAGE_BASED_PDF\"\n | \"NO_SECTIONS\"\n | \"PARSE_ERROR\"\n | \"MISSING_DEPENDENCY\"\n\n// ─── 파싱 결과 (discriminated union) ────────────────\n\nexport type FileType = \"hwpx\" | \"hwp\" | \"hwp3\" | \"hwpml\" | \"pdf\" | \"xlsx\" | \"xls\" | \"docx\" | \"image\" | \"unknown\"\n\ninterface ParseResultBase {\n fileType: FileType\n /** 페이지/섹션 수 — PDF: 실제 페이지 수, HWP/HWPX: 섹션 수, XLSX: 시트 수 */\n pageCount?: number\n /** 이미지 기반 PDF 여부 (텍스트 추출 불가) */\n isImageBased?: boolean\n}\n\nexport interface ParseSuccess extends ParseResultBase {\n success: true\n /** 추출된 마크다운 텍스트 */\n markdown: string\n /**\n * 중간 표현 블록 (구조화된 데이터 접근용).\n * 블록은 문서(원문) 읽기 순서를 따른다 — 한 문단 안에 글자취급(treatAsChar)\n * 표와 텍스트가 섞여 있어도 배치 순서대로 방출된다 (v4.2.3, #50).\n */\n blocks: IRBlock[]\n /** 문서 메타데이터 */\n metadata?: DocumentMetadata\n /** 문서 구조 (헤딩 트리) — v2.0 */\n outline?: OutlineItem[]\n /** 파싱 중 발생한 경고 — v2.0 */\n warnings?: ParseWarning[]\n /** 추출된 이미지 목록 — 마크다운에서 파일명으로 참조됨 */\n images?: ExtractedImage[]\n /** 페이지별 텍스트 품질 신호 — PDF에서만 제공 */\n pageQuality?: PageQuality[]\n /** 문서 단위 품질 요약 — PDF에서만 제공 */\n qualitySummary?: DocumentQualitySummary\n}\n\n/** 페이지별 텍스트 품질 신호 (PDF 전용). 자세한 설명은 src/pdf/quality.ts */\nexport interface PageQuality {\n page: number\n textChars: number\n hangulRatio: number\n controlCharRatio: number\n replacementCharRatio: number\n puaRatio: number\n needsOcr: boolean\n ocrReason?: \"low_text\" | \"high_pua\" | \"high_control\" | \"high_replacement\" | \"garbled_hangul\"\n}\n\n/** 문서 단위 품질 요약 (PDF 전용). */\nexport interface DocumentQualitySummary {\n totalPages: number\n totalTextChars: number\n avgHangulRatio: number\n avgControlCharRatio: number\n avgReplacementCharRatio: number\n avgPuaRatio: number\n lowTextPageCount: number\n highPuaPageCount: number\n needsOcr: boolean\n ocrCandidatePages: number[]\n}\n\n/** 추출된 이미지 — ParseSuccess.images에 포함 */\nexport interface ExtractedImage {\n /** 마크다운에서 참조되는 파일명 (예: image_001.png) */\n filename: string\n /** 이미지 바이너리 */\n data: Uint8Array\n /** MIME 타입 */\n mimeType: string\n}\n\nexport interface ParseFailure extends ParseResultBase {\n success: false\n /** 오류 메시지 */\n error: string\n /** 구조화된 에러 코드 */\n code?: ErrorCode\n}\n\nexport type ParseResult = ParseSuccess | ParseFailure\n\n// ─── 문서 비교 (Diff) ───────────────────────────────\n\nexport type DiffChangeType = \"added\" | \"removed\" | \"modified\" | \"unchanged\"\n\nexport interface BlockDiff {\n type: DiffChangeType\n /** 원본 블록 (added이면 undefined) */\n before?: IRBlock\n /** 변경 후 블록 (removed이면 undefined) */\n after?: IRBlock\n /** modified 테이블의 셀 단위 diff */\n cellDiffs?: CellDiff[][]\n /** 유사도 (0-1) */\n similarity?: number\n}\n\nexport interface CellDiff {\n type: DiffChangeType\n before?: string\n after?: string\n}\n\nexport interface DiffResult {\n stats: { added: number; removed: number; modified: number; unchanged: number }\n diffs: BlockDiff[]\n}\n\n// ─── 라운드트립 패치 (v3.0) ─────────────────────────\n\n/** 패치 중 매핑 실패/미지원으로 건너뛴 항목 — silent 실패 금지 */\nexport interface PatchSkip {\n /** 건너뛴 사유 */\n reason: string\n /** 원본 쪽 내용 요약 (최대 80자) */\n before?: string\n /** 편집 쪽 내용 요약 (최대 80자) */\n after?: string\n /**\n * 부분 적용 표시 — 변경이 적용은 됐지만(applied 계상) 편집 원형 그대로는\n * 아님 (예: 셀 내 줄 추가를 마지막 문단에 병합). 완전 미적용 skip과 구분.\n */\n partial?: boolean\n}\n\n/** patchHwpx 옵션 */\nexport interface PatchOptions {\n /** 패치 후 재파싱 자동 검증 (기본 true) */\n verify?: boolean\n}\n\n/** patchHwpx / patchBlocks 결과 */\nexport interface PatchResult {\n success: boolean\n /** 패치된 HWPX (success=true) */\n data?: Uint8Array\n /** 적용된 변경 수 */\n applied: number\n /** 매핑 실패 항목 (이유 포함) */\n skipped: PatchSkip[]\n /**\n * 무손실 검증 (patchHwpx/patchHwp 전용): 패치본 재파싱 vs 편집 마크다운의\n * 잔차 diff — modified/added/removed가 0이어야 의도가 전부 반영된 것.\n * session.patchBlocks는 이 필드를 채우지 않는다 (changes 참조).\n */\n verification?: DiffResult\n /**\n * 변경 가시화 (session.patchBlocks 전용): 패치 전 → 후 문서 diff —\n * 적용된 편집 수만큼 modified가 나오는 것이 정상. verification과 의미가\n * 정반대이므로 혼용 금지.\n */\n changes?: DiffResult\n /** 실패 사유 (success=false) */\n error?: string\n}\n\n// ─── 양식 인식 ──────────────────────────────────────\n\nexport interface FormField {\n label: string\n value: string\n /** 0-based 소스 행 */\n row: number\n /** 0-based 소스 열 */\n col: number\n /** 매칭된 입력 키(정규화) — 모호 라벨 거부 가드(fillWithUniqueGuard)의 집계 기준 */\n key?: string\n}\n\nexport interface FormResult {\n fields: FormField[]\n /** 양식 확신도 (0-1) */\n confidence: number\n}\n\n// ─── OCR 프로바이더 ─────────────────────────────────\n\n/** 사용자 제공 OCR 함수 — 페이지 이미지를 받아 텍스트 반환 */\nexport type OcrProvider = (\n pageImage: Uint8Array,\n pageNumber: number,\n mimeType: \"image/png\"\n) => Promise<string>\n\n// ─── Watch 모드 ─────────────────────────────────────\n\nexport interface WatchOptions {\n dir: string\n outDir?: string\n webhook?: string\n format?: \"markdown\" | \"json\"\n pages?: string\n silent?: boolean\n}\n\n// ─── 헤딩 감지 공통 임계값 ──────────────────────────\n\n/** 폰트 크기 비율 → heading level (전 파서 공통) */\nexport const HEADING_RATIO_H1 = 1.5\nexport const HEADING_RATIO_H2 = 1.3\nexport const HEADING_RATIO_H3 = 1.15\n\n// ─── 내부 파서 반환 타입 ─────────────────────────────\n\n/** 내부 파서가 index.ts에 반환하는 공통 타입 (HWP5/HWPX/PDF/XLSX/DOCX) */\nexport interface InternalParseResult {\n markdown: string\n blocks: IRBlock[]\n metadata?: DocumentMetadata\n outline?: OutlineItem[]\n warnings?: ParseWarning[]\n images?: ExtractedImage[]\n /** PDF 전용: 이미지 기반 PDF 여부 */\n isImageBased?: boolean\n /** PDF 전용: 페이지별 품질 신호 */\n pageQuality?: PageQuality[]\n /** PDF 전용: 문서 단위 품질 요약 */\n qualitySummary?: DocumentQualitySummary\n}\n"]}
@@ -6,7 +6,7 @@ import {
6
6
  HEADING_RATIO_H1,
7
7
  HEADING_RATIO_H2,
8
8
  HEADING_RATIO_H3
9
- } from "./chunk-ZF7QL4IY.js";
9
+ } from "./chunk-GJO3ORFW.js";
10
10
  import {
11
11
  detectFormat,
12
12
  detectOle2Format,
@@ -27,7 +27,7 @@ import {
27
27
  paraTextPureT,
28
28
  patchZipEntries,
29
29
  scanSectionXml
30
- } from "./chunk-LUJN3VFB.js";
30
+ } from "./chunk-ZHRYLT3N.js";
31
31
  import {
32
32
  MAX_COLS,
33
33
  MAX_ROWS,
@@ -37,14 +37,14 @@ import {
37
37
  dedupeRunningHeaders,
38
38
  flattenLayoutTables,
39
39
  mapPuaText
40
- } from "./chunk-DSL6EVFJ.js";
40
+ } from "./chunk-I53FOXZR.js";
41
41
  import {
42
42
  SPACE_EM_FIXED,
43
43
  charWidthEm1000,
44
44
  fitRatioForFewerLines,
45
45
  measureTextWidth,
46
46
  simulateWrap
47
- } from "./chunk-GHMVNMUN.js";
47
+ } from "./chunk-LWNFAIYG.js";
48
48
  import {
49
49
  MAX_DECOMPRESS_SIZE,
50
50
  MAX_XML_DEPTH,
@@ -56,7 +56,7 @@ import {
56
56
  createXmlParser,
57
57
  extractTextFromNode,
58
58
  findChildByLocalName
59
- } from "./chunk-FHYLLKIP.js";
59
+ } from "./chunk-H6O65EPK.js";
60
60
  import {
61
61
  KordocError,
62
62
  classifyError,
@@ -68,7 +68,7 @@ import {
68
68
  sanitizeHref,
69
69
  stripDtd,
70
70
  toArrayBuffer
71
- } from "./chunk-2L7MIKOM.js";
71
+ } from "./chunk-E2K4SNMD.js";
72
72
 
73
73
  // src/index.ts
74
74
  import { readFile } from "fs/promises";
@@ -1576,7 +1576,7 @@ function walkSection(node, blocks, tableCtx, tableStack, ctx, depth = 0) {
1576
1576
  }
1577
1577
  break;
1578
1578
  case "p": {
1579
- const { text: rawText, href, footnote, style } = extractParagraphInfo(el, ctx.styleMap, ctx);
1579
+ const { text: rawText, href, footnote, style, segments } = extractParagraphInfo(el, ctx.styleMap, ctx);
1580
1580
  let text = rawText;
1581
1581
  let headingLevel;
1582
1582
  const ph = resolveParaHeading(el, ctx);
@@ -1584,6 +1584,35 @@ function walkSection(node, blocks, tableCtx, tableStack, ctx, depth = 0) {
1584
1584
  if (ph?.prefix) text = ph.prefix + " " + text;
1585
1585
  headingLevel = ph?.headingLevel;
1586
1586
  }
1587
+ if (segments) {
1588
+ const cell2 = tableCtx?.cell ?? null;
1589
+ const segs = [...segments];
1590
+ if (ph?.prefix) {
1591
+ const fi = segs.findIndex((s) => s);
1592
+ if (fi >= 0) segs[fi] = ph.prefix + " " + segs[fi];
1593
+ }
1594
+ let segIdx = 0;
1595
+ let first = true;
1596
+ const flush = () => {
1597
+ const s = segs[segIdx++];
1598
+ if (!s) return;
1599
+ const block = { type: "paragraph", text: s, pageNumber: ctx.sectionNum };
1600
+ if (first && !cell2) {
1601
+ first = false;
1602
+ if (style) block.style = style;
1603
+ if (href) block.href = href;
1604
+ if (footnote) block.footnoteText = footnote;
1605
+ }
1606
+ if (cell2) {
1607
+ cell2.text += (cell2.text ? "\n" : "") + s;
1608
+ (cell2.blocks ??= []).push(block);
1609
+ } else blocks.push(block);
1610
+ };
1611
+ tableCtx = walkParagraphChildren(el, blocks, tableCtx, tableStack, ctx, depth + 1, flush);
1612
+ while (segIdx < segs.length) flush();
1613
+ if (footnote && cell2) cell2.text += (cell2.text ? "\n" : "") + `(\uC8FC: ${footnote})`;
1614
+ break;
1615
+ }
1587
1616
  if (text) {
1588
1617
  if (tableCtx?.cell) {
1589
1618
  const cell2 = tableCtx.cell;
@@ -1802,7 +1831,7 @@ function findTopLevelTbls(el, out, depth = 0) {
1802
1831
  findTopLevelTbls(ch, out, depth + 1);
1803
1832
  }
1804
1833
  }
1805
- function walkParagraphChildren(node, blocks, tableCtx, tableStack, ctx, depth = 0) {
1834
+ function walkParagraphChildren(node, blocks, tableCtx, tableStack, ctx, depth = 0, onTbl) {
1806
1835
  if (depth > MAX_XML_DEPTH) return tableCtx;
1807
1836
  const children = node.childNodes;
1808
1837
  if (!children) return tableCtx;
@@ -1816,6 +1845,7 @@ function walkParagraphChildren(node, blocks, tableCtx, tableStack, ctx, depth =
1816
1845
  const tag = el.tagName || el.localName || "";
1817
1846
  const localTag = tag.replace(/^[^:]+:/, "");
1818
1847
  if (localTag === "tbl") {
1848
+ if (onTbl) onTbl();
1819
1849
  if (!tableCtx) {
1820
1850
  const chan = kordocTableChannel(el, ctx);
1821
1851
  if (chan) {
@@ -1862,6 +1892,9 @@ function walkParagraphChildren(node, blocks, tableCtx, tableStack, ctx, depth =
1862
1892
  walkChildren(node, depth);
1863
1893
  return tableCtx;
1864
1894
  }
1895
+ function isInlineTbl(tbl2) {
1896
+ return findChildByLocalName(tbl2, "pos")?.getAttribute("treatAsChar") === "1";
1897
+ }
1865
1898
  function findDescendant(node, targetTag, depth = 0) {
1866
1899
  if (depth > 5) return null;
1867
1900
  const children = node.childNodes;
@@ -2035,7 +2068,7 @@ function extractParagraphInfo(para2, styleMap, ctx) {
2035
2068
  ctx.warnings?.push({ page: ctx.sectionNum, message: "\uBCC0\uACBD\uCD94\uC801 \uC0AD\uC81C \uD14D\uC2A4\uD2B8 \uCD9C\uB825 \uC81C\uC678", code: "HIDDEN_TEXT_FILTERED" });
2036
2069
  }
2037
2070
  } else {
2038
- text += t;
2071
+ text += t.replace(/\x1E/g, "");
2039
2072
  }
2040
2073
  continue;
2041
2074
  }
@@ -2066,9 +2099,12 @@ function extractParagraphInfo(para2, styleMap, ctx) {
2066
2099
  case "hwSpace":
2067
2100
  text += " ";
2068
2101
  break;
2102
+ // 테이블 자체는 walkSection에서 처리 — 글자취급(inline) 표만 경계 마커를 남겨
2103
+ // 표 앞뒤 텍스트를 문서 순서대로 분할 방출할 수 있게 한다 (#49/#50).
2104
+ // float·페이지 앵커 표는 텍스트 흐름 불참(reflow 모델 정합) — 종전대로 텍스트 뒤 방출
2069
2105
  case "tbl":
2106
+ if (isInlineTbl(child)) text += "";
2070
2107
  break;
2071
- // 테이블은 walkSection에서 처리
2072
2108
  // 하이퍼링크
2073
2109
  case "hyperlink": {
2074
2110
  const url = child.getAttribute("url") || child.getAttribute("href") || "";
@@ -2163,7 +2199,7 @@ function extractParagraphInfo(para2, styleMap, ctx) {
2163
2199
  for (const r of closed) {
2164
2200
  if (applied.some(([s, e]) => r.start < e && r.end > s)) continue;
2165
2201
  const anchor = text.slice(r.start, r.end);
2166
- if (!anchor.trim() || /[\n\x1F\[\]]/.test(anchor)) continue;
2202
+ if (!anchor.trim() || /[\n\x1F\x1E\[\]]/.test(anchor)) continue;
2167
2203
  text = text.slice(0, r.start) + `[${anchor}](${r.url})` + text.slice(r.end);
2168
2204
  applied.push([r.start, r.end]);
2169
2205
  }
@@ -2171,10 +2207,18 @@ function extractParagraphInfo(para2, styleMap, ctx) {
2171
2207
  }
2172
2208
  const leaderIdx = text.indexOf("");
2173
2209
  if (leaderIdx >= 0) text = text.substring(0, leaderIdx);
2174
- let cleanText = text.replace(/[ \t]+/g, " ").trim();
2175
- if (/^그림입니다\.?\s*원본\s*그림의\s*(이름|크기)/.test(cleanText)) cleanText = "";
2176
- cleanText = cleanText.replace(/그림입니다\.?\s*원본\s*그림의\s*(이름|크기)[^\n]*(\n[^\n]*원본\s*그림의\s*(이름|크기)[^\n]*)*/g, "").trim();
2177
- cleanText = cleanText.replace(/^(?:모서리가 둥근 |둥근 )?(?:사각형|직사각형|정사각형|원|타원|삼각형|선|직선|곡선|화살표|오각형|육각형|팔각형|별|십자|구름|마름모|도넛|평행사변형|사다리꼴|개체|그리기\s?개체|묶음\s?개체|글상자|표|그림|OLE\s?개체)\s?입니다\.?$/gm, "").trim();
2210
+ const cleanParaText = (raw) => {
2211
+ let t = raw.replace(/[ \t]+/g, " ").trim();
2212
+ if (/^그림입니다\.?\s*원본\s*그림의\s*(이름|크기)/.test(t)) t = "";
2213
+ t = t.replace(/그림입니다\.?\s*원본\s*그림의\s*(이름|크기)[^\n]*(\n[^\n]*원본\s*그림의\s*(이름|크기)[^\n]*)*/g, "").trim();
2214
+ return t.replace(/^(?:모서리가 둥근 |둥근 )?(?:사각형|직사각형|정사각형|원|타원|삼각형|선|직선|곡선|화살표|오각형|육각형|팔각형|별|십자|구름|마름모|도넛|평행사변형|사다리꼴|개체|그리기\s?개체|묶음\s?개체|글상자|표|그림|OLE\s?개체)\s?입니다\.?$/gm, "").trim();
2215
+ };
2216
+ let segments;
2217
+ if (text.includes("")) {
2218
+ segments = text.split("").map(cleanParaText);
2219
+ text = text.replace(/\x1E/g, "");
2220
+ }
2221
+ const cleanText = cleanParaText(text);
2178
2222
  let style;
2179
2223
  if (styleMap && charPrId) {
2180
2224
  const charProp = styleMap.charProperties.get(charPrId);
@@ -2187,7 +2231,7 @@ function extractParagraphInfo(para2, styleMap, ctx) {
2187
2231
  if (!style.fontSize && !style.bold && !style.italic) style = void 0;
2188
2232
  }
2189
2233
  }
2190
- return { text: cleanText, href, footnote, style };
2234
+ return { text: cleanText, href, footnote, style, segments };
2191
2235
  }
2192
2236
  var KORDOC_CHAR_CODE = "4";
2193
2237
  var KORDOC_PARA_QUOTE = "6";
@@ -22437,6 +22481,18 @@ function htmlCellInnerToLines(inner) {
22437
22481
  const lines = work.split(/<br\s*\/?>/gi).map((s) => s.trim()).filter((s) => s.length > 0);
22438
22482
  return { lines, hadNonText, imgSrcs };
22439
22483
  }
22484
+ function splitCellByTopLevelTables(html) {
22485
+ const tables = extractTopLevelTables(html);
22486
+ const texts = [];
22487
+ let rest = html;
22488
+ for (const t of tables) {
22489
+ const i = rest.indexOf(t);
22490
+ texts.push(rest.slice(0, i));
22491
+ rest = rest.slice(i + t.length);
22492
+ }
22493
+ texts.push(rest);
22494
+ return { texts, tables };
22495
+ }
22440
22496
  function extractTopLevelTables(html) {
22441
22497
  const result = [];
22442
22498
  let depth = 0;
@@ -23115,17 +23171,18 @@ function generateHtmlTableXml(rawHtml, theme, totalWidth = 44e3, style = null, r
23115
23171
  const rowSpan = Math.min(cell2.rowSpan, rowCnt - cell2.r);
23116
23172
  const lines = cellLines[i];
23117
23173
  let nestedH = 0;
23118
- const nestedXmls = [];
23119
- for (const nested of extractTopLevelTables(cell2.inner)) {
23174
+ const { texts: segTexts, tables: nestedTables } = splitCellByTopLevelTables(cell2.inner);
23175
+ const nestedXmls = nestedTables.map((nested) => {
23120
23176
  const sw = spanW(cell2);
23121
23177
  const nestedW = Math.max(Math.min(Math.max(sw - 1020, 4e3), sw - 282), 500);
23122
23178
  const nestedXml = generateHtmlTableXml(nested, theme, nestedW, style ? { ...style, totalWidth: nestedW } : null);
23123
23179
  if (nestedXml) {
23124
- nestedXmls.push(nestedXml);
23125
23180
  const szH = nestedXml.match(/<hp:sz [^>]*height="(\d+)"/)?.[1];
23126
23181
  nestedH += (szH ? Number(szH) : (nested.match(/<tr[\s>]/gi) ?? []).length * cellH) + 300;
23127
23182
  }
23128
- }
23183
+ return nestedXml;
23184
+ });
23185
+ const segLines = segTexts.map((t) => htmlCellInnerToLines(t).lines);
23129
23186
  const usable = Math.max(spanW(cell2) - CELL_PAD, 1e3);
23130
23187
  let wrapLines = 0;
23131
23188
  for (const line of lines) wrapLines += Math.max(1, Math.ceil(measureTextWidth(unescapeHtml(line).trim(), measureH, 100) / usable));
@@ -23134,9 +23191,9 @@ function generateHtmlTableXml(rawHtml, theme, totalWidth = 44e3, style = null, r
23134
23191
  const cellHeight = Math.max(prof?.cellH.get(`${cell2.r},${cell2.c}`) ?? 0, contentH);
23135
23192
  const perRow = Math.ceil(cellHeight / rowSpan);
23136
23193
  for (let r = cell2.r; r < cell2.r + rowSpan; r++) tableRowHeights[r] = Math.max(tableRowHeights[r], perRow);
23137
- return { cell: cell2, rowSpan, lines, nestedXmls, imgSrcs: cellParsed[i].imgSrcs };
23194
+ return { cell: cell2, rowSpan, lines, nestedXmls, segLines, imgSrcs: cellParsed[i].imgSrcs };
23138
23195
  });
23139
- const tcXmls = meta.map(({ cell: cell2, rowSpan, lines, nestedXmls, imgSrcs }) => {
23196
+ const tcXmls = meta.map(({ cell: cell2, rowSpan, nestedXmls, segLines, imgSrcs }) => {
23140
23197
  const k = `${cell2.r},${cell2.c}`;
23141
23198
  const isHeader = cell2.isHeader;
23142
23199
  const baseCharPr = style ? style.charPr : CHAR_NORMAL;
@@ -23147,7 +23204,7 @@ function generateHtmlTableXml(rawHtml, theme, totalWidth = 44e3, style = null, r
23147
23204
  const paraPrId = style ? centered ? reg ? style.tblCenterParaPr ?? style.centerParaPr : style.centerParaPr : reg ? style.tblLeftParaPr ?? PARA_NORMAL : PARA_NORMAL : PARA_NORMAL;
23148
23205
  const picUrls = images ? [...imgSrcs] : [];
23149
23206
  const paras = [];
23150
- for (const line of lines) {
23207
+ const pushTextLine = (line) => {
23151
23208
  let text = unescapeHtml(line);
23152
23209
  if (images) {
23153
23210
  const { text: rest, urls } = splitImageRefs(text);
@@ -23159,7 +23216,14 @@ function generateHtmlTableXml(rawHtml, theme, totalWidth = 44e3, style = null, r
23159
23216
  if (!images || text.trim() || picUrls.length === 0) {
23160
23217
  paras.push(`<hp:p paraPrIDRef="${paraPrId}" styleIDRef="0"><hp:run charPrIDRef="${charPrId}"><hp:t>${escapeXml(text)}</hp:t></hp:run></hp:p>`);
23161
23218
  }
23162
- }
23219
+ };
23220
+ segLines.forEach((seg, si) => {
23221
+ for (const line of seg) pushTextLine(line);
23222
+ const nestedXml = nestedXmls[si];
23223
+ if (nestedXml) {
23224
+ paras.push(`<hp:p paraPrIDRef="0" styleIDRef="0"><hp:run charPrIDRef="0">${nestedXml}</hp:run></hp:p>`);
23225
+ }
23226
+ });
23163
23227
  if (images && picUrls.length > 0) {
23164
23228
  const pics = picUrls.map((u) => {
23165
23229
  const part = images.take(u);
@@ -23169,9 +23233,6 @@ function generateHtmlTableXml(rawHtml, theme, totalWidth = 44e3, style = null, r
23169
23233
  paras.push(`<hp:p paraPrIDRef="${paraPrId}" styleIDRef="0"><hp:run charPrIDRef="${charPrId}">${pics.join("")}</hp:run></hp:p>`);
23170
23234
  }
23171
23235
  }
23172
- for (const nestedXml of nestedXmls) {
23173
- paras.push(`<hp:p paraPrIDRef="0" styleIDRef="0"><hp:run charPrIDRef="0">${nestedXml}</hp:run></hp:p>`);
23174
- }
23175
23236
  if (paras.length === 0) {
23176
23237
  paras.push(`<hp:p paraPrIDRef="${paraPrId}" styleIDRef="0"><hp:run charPrIDRef="${charPrId}"><hp:t></hp:t></hp:run></hp:p>`);
23177
23238
  }
@@ -27547,7 +27608,7 @@ async function parse(input, options) {
27547
27608
  }
27548
27609
  async function parseImage(buffer, options) {
27549
27610
  try {
27550
- const { parseImageDocument } = await import("./image-ocr-S4REURLR.js");
27611
+ const { parseImageDocument } = await import("./image-ocr-HY42AVXC.js");
27551
27612
  const { blocks, warnings } = await parseImageDocument(buffer, options);
27552
27613
  return {
27553
27614
  success: true,
@@ -27605,7 +27666,7 @@ async function parseHwp(buffer, options) {
27605
27666
  async function parsePdf(buffer, options) {
27606
27667
  let parsePdfDocument;
27607
27668
  try {
27608
- const mod = await import("./parser-C3APVZGT.js");
27669
+ const mod = await import("./parser-SVZPCCRG.js");
27609
27670
  parsePdfDocument = mod.parsePdfDocument;
27610
27671
  } catch {
27611
27672
  return {
@@ -27739,4 +27800,4 @@ export {
27739
27800
  parseHwpml,
27740
27801
  fillForm
27741
27802
  };
27742
- //# sourceMappingURL=chunk-TXYQJXOV.js.map
27803
+ //# sourceMappingURL=chunk-CAA6DVEE.js.map