xml-tokenizer 0.0.18 → 0.0.19
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +5 -5
- package/dist/cjs/get-q-name.js +7 -1
- package/dist/cjs/index.js +73 -1
- package/dist/cjs/selector/TokenSelectState.js +106 -1
- package/dist/cjs/selector/TokenSelectStateMachine.js +150 -1
- package/dist/cjs/selector/TokenSelector.js +139 -1
- package/dist/cjs/selector/match-string.js +21 -1
- package/dist/cjs/selector/select.js +15 -1
- package/dist/cjs/token-to-xml.js +44 -1
- package/dist/cjs/tokenizer/XmlError.js +96 -1
- package/dist/cjs/tokenizer/XmlStream.js +443 -1
- package/dist/cjs/tokenizer/ascii-constants.js +69 -1
- package/dist/cjs/tokenizer/tokenize.js +388 -1
- package/dist/cjs/tokenizer/utils.js +47 -1
- package/dist/cjs/tokens-to-xml.js +13 -1
- package/dist/cjs/xml-to-object.js +69 -1
- package/dist/cjs/xml-to-simplified-object.js +86 -1
- package/dist/esm/get-q-name.js +5 -1
- package/dist/esm/index.js +13 -1
- package/dist/esm/selector/TokenSelectState.js +102 -1
- package/dist/esm/selector/TokenSelectStateMachine.js +148 -1
- package/dist/esm/selector/TokenSelector.js +137 -1
- package/dist/esm/selector/match-string.js +19 -1
- package/dist/esm/selector/select.js +13 -1
- package/dist/esm/token-to-xml.js +42 -1
- package/dist/esm/tokenizer/XmlError.js +94 -1
- package/dist/esm/tokenizer/XmlStream.js +441 -1
- package/dist/esm/tokenizer/ascii-constants.js +35 -1
- package/dist/esm/tokenizer/tokenize.js +385 -1
- package/dist/esm/tokenizer/utils.js +40 -1
- package/dist/esm/tokens-to-xml.js +11 -1
- package/dist/esm/xml-to-object.js +66 -1
- package/dist/esm/xml-to-simplified-object.js +83 -1
- package/dist/types/get-q-name.d.ts +1 -0
- package/dist/types/get-q-name.d.ts.map +1 -0
- package/dist/types/index.d.ts +1 -0
- package/dist/types/index.d.ts.map +1 -0
- package/dist/types/selector/TokenSelectState.d.ts +1 -0
- package/dist/types/selector/TokenSelectState.d.ts.map +1 -0
- package/dist/types/selector/TokenSelectStateMachine.d.ts +1 -0
- package/dist/types/selector/TokenSelectStateMachine.d.ts.map +1 -0
- package/dist/types/selector/TokenSelector.d.ts +1 -0
- package/dist/types/selector/TokenSelector.d.ts.map +1 -0
- package/dist/types/selector/index.d.ts +1 -0
- package/dist/types/selector/index.d.ts.map +1 -0
- package/dist/types/selector/match-string.d.ts +1 -0
- package/dist/types/selector/match-string.d.ts.map +1 -0
- package/dist/types/selector/select.d.ts +1 -0
- package/dist/types/selector/select.d.ts.map +1 -0
- package/dist/types/selector/types.d.ts +1 -0
- package/dist/types/selector/types.d.ts.map +1 -0
- package/dist/types/token-to-xml.d.ts +1 -0
- package/dist/types/token-to-xml.d.ts.map +1 -0
- package/dist/types/tokenizer/XmlError.d.ts +1 -0
- package/dist/types/tokenizer/XmlError.d.ts.map +1 -0
- package/dist/types/tokenizer/XmlStream.d.ts +1 -0
- package/dist/types/tokenizer/XmlStream.d.ts.map +1 -0
- package/dist/types/tokenizer/ascii-constants.d.ts +1 -0
- package/dist/types/tokenizer/ascii-constants.d.ts.map +1 -0
- package/dist/types/tokenizer/index.d.ts +1 -0
- package/dist/types/tokenizer/index.d.ts.map +1 -0
- package/dist/types/tokenizer/tokenize.d.ts +1 -0
- package/dist/types/tokenizer/tokenize.d.ts.map +1 -0
- package/dist/types/tokenizer/types.d.ts +1 -0
- package/dist/types/tokenizer/types.d.ts.map +1 -0
- package/dist/types/tokenizer/utils.d.ts +1 -0
- package/dist/types/tokenizer/utils.d.ts.map +1 -0
- package/dist/types/tokens-to-xml.d.ts +1 -0
- package/dist/types/tokens-to-xml.d.ts.map +1 -0
- package/dist/types/xml-to-object.d.ts +1 -0
- package/dist/types/xml-to-object.d.ts.map +1 -0
- package/dist/types/xml-to-simplified-object.d.ts +1 -0
- package/dist/types/xml-to-simplified-object.d.ts.map +1 -0
- package/package.json +4 -4
|
@@ -1 +1,385 @@
|
|
|
1
|
-
import{LESS_THAN
|
|
1
|
+
import { LESS_THAN, HYPHEN, QUESTION_MARK, GREATER_THAN, OPEN_SQUARE_BRACKET, PERCENT, DOUBLE_QUOTE, SINGLE_QUOTE, UPPERCASE_S, UPPERCASE_P, SLASH, EQUALS, EXCLAMATION_MARK, CLOSE_SQUARE_BRACKET } from './ascii-constants.js';
|
|
2
|
+
import { XmlError } from './XmlError.js';
|
|
3
|
+
import { XmlStream } from './XmlStream.js';
|
|
4
|
+
|
|
5
|
+
const BOM = "\uFEFF";
|
|
6
|
+
const XML_DECLARATION_START = "<?xml ";
|
|
7
|
+
const XML_DECLARATION_END = "?>";
|
|
8
|
+
const ENTITY_DECLARATION_START = "<!ENTITY";
|
|
9
|
+
const ELEMENT_DECLARATION_START = "<!ELEMENT";
|
|
10
|
+
const ATTLIST_DECLARATION_START = "<!ATTLIST";
|
|
11
|
+
const NOTATION_DECLARATION_START = "<!NOTATION";
|
|
12
|
+
const DOCTYPE_START = "<!DOCTYPE";
|
|
13
|
+
const PI_START = "<?";
|
|
14
|
+
const PI_END = "?>";
|
|
15
|
+
const COMMENT_START = "<!--";
|
|
16
|
+
const COMMENT_END = "-->";
|
|
17
|
+
const CDATA_START = "<![CDATA[";
|
|
18
|
+
const CDATA_END = "]]>";
|
|
19
|
+
const NDATA = "NDATA";
|
|
20
|
+
const PUBLIC = "PUBLIC";
|
|
21
|
+
const SYSTEM = "SYSTEM";
|
|
22
|
+
const VERSION = "version";
|
|
23
|
+
const ENCODING = "encoding";
|
|
24
|
+
const STANDALONE = "standalone";
|
|
25
|
+
function tokenize(xmlString, tokenCallback, options = {}) {
|
|
26
|
+
tokenizeXmlStream(new XmlStream(xmlString, options), tokenCallback);
|
|
27
|
+
}
|
|
28
|
+
function tokenizeXmlStream(s, tokenCallback) {
|
|
29
|
+
if (s.startsWith(BOM)) {
|
|
30
|
+
s.advance(1);
|
|
31
|
+
}
|
|
32
|
+
if (s.startsWith(XML_DECLARATION_START)) {
|
|
33
|
+
parseDeclaration(s);
|
|
34
|
+
}
|
|
35
|
+
parseMisc(s, tokenCallback);
|
|
36
|
+
s.skipSpaces();
|
|
37
|
+
if (s.startsWith(DOCTYPE_START)) {
|
|
38
|
+
if (!s.config.allowDtd) {
|
|
39
|
+
throw new XmlError({ type: "DtdDetected" });
|
|
40
|
+
}
|
|
41
|
+
parseDoctype(s, tokenCallback);
|
|
42
|
+
parseMisc(s, tokenCallback);
|
|
43
|
+
}
|
|
44
|
+
s.skipSpaces();
|
|
45
|
+
if (s.config.strict) {
|
|
46
|
+
if (!s.atEnd() && s.currCodeUnit() === LESS_THAN) {
|
|
47
|
+
parseElement(s, tokenCallback);
|
|
48
|
+
}
|
|
49
|
+
parseMisc(s, tokenCallback);
|
|
50
|
+
if (!s.atEnd()) {
|
|
51
|
+
throw new XmlError({ type: "UnknownToken", message: "Not at end" }, s.genTextPos());
|
|
52
|
+
}
|
|
53
|
+
} else {
|
|
54
|
+
while (!s.atEnd()) {
|
|
55
|
+
if (s.currCodeUnit() === LESS_THAN) {
|
|
56
|
+
parseElement(s, tokenCallback);
|
|
57
|
+
} else {
|
|
58
|
+
parseText(s, tokenCallback);
|
|
59
|
+
}
|
|
60
|
+
parseMisc(s, tokenCallback);
|
|
61
|
+
}
|
|
62
|
+
}
|
|
63
|
+
}
|
|
64
|
+
function parseMisc(s, tokenCallback) {
|
|
65
|
+
while (!s.atEnd()) {
|
|
66
|
+
s.skipSpaces();
|
|
67
|
+
if (s.startsWith(COMMENT_START)) {
|
|
68
|
+
parseComment(s, tokenCallback);
|
|
69
|
+
} else if (s.startsWith(PI_START)) {
|
|
70
|
+
parsePi(s, tokenCallback);
|
|
71
|
+
} else {
|
|
72
|
+
break;
|
|
73
|
+
}
|
|
74
|
+
}
|
|
75
|
+
}
|
|
76
|
+
function parseDeclaration(s) {
|
|
77
|
+
function consumeSpaces(_s) {
|
|
78
|
+
if (_s.startsWithSpace()) {
|
|
79
|
+
_s.skipSpaces();
|
|
80
|
+
} else if (!_s.startsWith(XML_DECLARATION_END) && !_s.atEnd()) {
|
|
81
|
+
throw new XmlError(
|
|
82
|
+
{ type: "InvalidChar", expected: "a whitespace", actual: _s.currCodeUnitUnchecked() },
|
|
83
|
+
_s.genTextPos()
|
|
84
|
+
);
|
|
85
|
+
}
|
|
86
|
+
}
|
|
87
|
+
s.advance(5);
|
|
88
|
+
consumeSpaces(s);
|
|
89
|
+
if (!s.startsWith(VERSION)) {
|
|
90
|
+
throw new XmlError({ type: "InvalidString", expected: "version" }, s.genTextPos());
|
|
91
|
+
}
|
|
92
|
+
parseAttribute(s);
|
|
93
|
+
consumeSpaces(s);
|
|
94
|
+
if (s.startsWith(ENCODING)) {
|
|
95
|
+
parseAttribute(s);
|
|
96
|
+
consumeSpaces(s);
|
|
97
|
+
}
|
|
98
|
+
if (s.startsWith(STANDALONE)) {
|
|
99
|
+
parseAttribute(s);
|
|
100
|
+
}
|
|
101
|
+
s.skipSpaces();
|
|
102
|
+
s.skipString(XML_DECLARATION_END);
|
|
103
|
+
}
|
|
104
|
+
function parseComment(s, tokenCallback) {
|
|
105
|
+
const start = s.getPos();
|
|
106
|
+
s.advance(4);
|
|
107
|
+
const text = s.consumeCodeUnitsWhile((c, _s) => !(c === HYPHEN && _s.startsWith(COMMENT_END)));
|
|
108
|
+
s.skipString(COMMENT_END);
|
|
109
|
+
if (text.includes("--") || text.endsWith("-")) {
|
|
110
|
+
throw new XmlError({ type: "InvalidComment" }, s.genTextPosFrom(start));
|
|
111
|
+
}
|
|
112
|
+
tokenCallback({ type: "Comment", text, range: s.rangeFrom(start) });
|
|
113
|
+
}
|
|
114
|
+
function parsePi(s, tokenCallback) {
|
|
115
|
+
if (s.startsWith(XML_DECLARATION_START)) {
|
|
116
|
+
throw new XmlError({ type: "UnexpectedDeclaration" }, s.genTextPos());
|
|
117
|
+
}
|
|
118
|
+
const start = s.getPos();
|
|
119
|
+
s.advance(2);
|
|
120
|
+
const target = s.consumeName();
|
|
121
|
+
s.skipSpaces();
|
|
122
|
+
const content = s.consumeCodeUnitsWhile(
|
|
123
|
+
(c, _s) => !(c === QUESTION_MARK && _s.startsWith(PI_END))
|
|
124
|
+
);
|
|
125
|
+
s.skipString(PI_END);
|
|
126
|
+
tokenCallback({
|
|
127
|
+
type: "ProcessingInstruction",
|
|
128
|
+
target,
|
|
129
|
+
content: content.length === 0 ? void 0 : content,
|
|
130
|
+
range: s.rangeFrom(start)
|
|
131
|
+
});
|
|
132
|
+
}
|
|
133
|
+
function parseDoctype(s, tokenCallback) {
|
|
134
|
+
const start = s.getPos();
|
|
135
|
+
parseDoctypeStart(s);
|
|
136
|
+
s.skipSpaces();
|
|
137
|
+
if (s.currCodeUnit() === GREATER_THAN) {
|
|
138
|
+
s.advance(1);
|
|
139
|
+
return;
|
|
140
|
+
}
|
|
141
|
+
s.advance(1);
|
|
142
|
+
while (!s.atEnd()) {
|
|
143
|
+
s.skipSpaces();
|
|
144
|
+
if (s.startsWith(ENTITY_DECLARATION_START)) {
|
|
145
|
+
parseEntityDecl(s, tokenCallback);
|
|
146
|
+
} else if (s.startsWith(COMMENT_START)) {
|
|
147
|
+
parseComment(s, tokenCallback);
|
|
148
|
+
} else if (s.startsWith(PI_START)) {
|
|
149
|
+
parsePi(s, tokenCallback);
|
|
150
|
+
} else if (s.startsWith("]")) {
|
|
151
|
+
s.advance(1);
|
|
152
|
+
s.skipSpaces();
|
|
153
|
+
if (s.currCodeUnit() === GREATER_THAN) {
|
|
154
|
+
s.advance(1);
|
|
155
|
+
break;
|
|
156
|
+
} else {
|
|
157
|
+
throw new XmlError(
|
|
158
|
+
{ type: "InvalidChar", expected: "'>'", actual: s.currCodeUnitUnchecked() },
|
|
159
|
+
s.genTextPos()
|
|
160
|
+
);
|
|
161
|
+
}
|
|
162
|
+
} else if (s.startsWith(ELEMENT_DECLARATION_START) || s.startsWith(ATTLIST_DECLARATION_START) || s.startsWith(NOTATION_DECLARATION_START)) {
|
|
163
|
+
try {
|
|
164
|
+
consumeDecl(s);
|
|
165
|
+
} catch (e) {
|
|
166
|
+
throw new XmlError(
|
|
167
|
+
{ type: "UnknownToken", message: "Failed to consume declaration" },
|
|
168
|
+
s.genTextPosFrom(start)
|
|
169
|
+
);
|
|
170
|
+
}
|
|
171
|
+
} else {
|
|
172
|
+
throw new XmlError(
|
|
173
|
+
{ type: "UnknownToken", message: "Failed to parse doctype" },
|
|
174
|
+
s.genTextPos()
|
|
175
|
+
);
|
|
176
|
+
}
|
|
177
|
+
}
|
|
178
|
+
}
|
|
179
|
+
function parseDoctypeStart(s) {
|
|
180
|
+
s.advance(9);
|
|
181
|
+
s.consumeSpaces();
|
|
182
|
+
s.skipName();
|
|
183
|
+
s.skipSpaces();
|
|
184
|
+
parseExternalId(s);
|
|
185
|
+
s.skipSpaces();
|
|
186
|
+
const currCodeUnit = s.currCodeUnit();
|
|
187
|
+
if (currCodeUnit !== OPEN_SQUARE_BRACKET && currCodeUnit !== GREATER_THAN) {
|
|
188
|
+
throw new XmlError(
|
|
189
|
+
{ type: "InvalidChar", expected: "'[' or '>'", actual: currCodeUnit },
|
|
190
|
+
s.genTextPos()
|
|
191
|
+
);
|
|
192
|
+
}
|
|
193
|
+
}
|
|
194
|
+
function parseExternalId(s) {
|
|
195
|
+
if (s.startsWith(SYSTEM) || s.startsWith(PUBLIC)) {
|
|
196
|
+
const start = s.getPos();
|
|
197
|
+
s.advance(6);
|
|
198
|
+
const id = s.sliceBack(start);
|
|
199
|
+
s.consumeSpaces();
|
|
200
|
+
const quote = s.consumeQuote();
|
|
201
|
+
s.consumeCodeUnitsWhile((c) => c !== quote);
|
|
202
|
+
s.consumeCodeUnit(quote);
|
|
203
|
+
if (id === PUBLIC) {
|
|
204
|
+
s.consumeSpaces();
|
|
205
|
+
const _quote = s.consumeQuote();
|
|
206
|
+
s.consumeCodeUnitsWhile((c) => c !== _quote);
|
|
207
|
+
s.consumeCodeUnit(_quote);
|
|
208
|
+
}
|
|
209
|
+
return true;
|
|
210
|
+
}
|
|
211
|
+
return false;
|
|
212
|
+
}
|
|
213
|
+
function parseEntityDecl(s, tokenCallback) {
|
|
214
|
+
s.advance(8);
|
|
215
|
+
s.consumeSpaces();
|
|
216
|
+
const isGe = !s.tryConsumeCodeUnit(PERCENT);
|
|
217
|
+
if (!isGe) {
|
|
218
|
+
s.consumeSpaces();
|
|
219
|
+
}
|
|
220
|
+
const name = s.consumeName();
|
|
221
|
+
s.consumeSpaces();
|
|
222
|
+
const definition = parseEntityDef(s, isGe);
|
|
223
|
+
if (definition !== null) {
|
|
224
|
+
tokenCallback({ type: "EntityDeclaration", name, definition });
|
|
225
|
+
}
|
|
226
|
+
s.skipSpaces();
|
|
227
|
+
s.consumeCodeUnit(GREATER_THAN);
|
|
228
|
+
}
|
|
229
|
+
function parseEntityDef(s, isGe) {
|
|
230
|
+
const currCodeUnit = s.currCodeUnit();
|
|
231
|
+
if (currCodeUnit === DOUBLE_QUOTE || currCodeUnit === SINGLE_QUOTE) {
|
|
232
|
+
const quote = s.consumeQuote();
|
|
233
|
+
const start = s.getPos();
|
|
234
|
+
s.skipCodeUnitsWhile((c) => c !== quote);
|
|
235
|
+
const value = s.sliceBack(start);
|
|
236
|
+
s.consumeCodeUnit(quote);
|
|
237
|
+
return value;
|
|
238
|
+
} else if (currCodeUnit === UPPERCASE_S || currCodeUnit === UPPERCASE_P) {
|
|
239
|
+
if (parseExternalId(s)) {
|
|
240
|
+
if (isGe) {
|
|
241
|
+
s.skipSpaces();
|
|
242
|
+
if (s.startsWith(NDATA)) {
|
|
243
|
+
s.advance(5);
|
|
244
|
+
s.consumeSpaces();
|
|
245
|
+
s.skipName();
|
|
246
|
+
}
|
|
247
|
+
}
|
|
248
|
+
return null;
|
|
249
|
+
}
|
|
250
|
+
throw new XmlError({ type: "InvalidExternalID" }, s.genTextPos());
|
|
251
|
+
} else {
|
|
252
|
+
throw new XmlError(
|
|
253
|
+
{ type: "InvalidChar", expected: "a quote, SYSTEM or PUBLIC", actual: currCodeUnit },
|
|
254
|
+
s.genTextPos()
|
|
255
|
+
);
|
|
256
|
+
}
|
|
257
|
+
}
|
|
258
|
+
function consumeDecl(s) {
|
|
259
|
+
s.skipCodeUnitsWhile((c) => c !== GREATER_THAN);
|
|
260
|
+
s.consumeCodeUnit(GREATER_THAN);
|
|
261
|
+
}
|
|
262
|
+
function parseElement(s, tokenCallback) {
|
|
263
|
+
const start = s.getPos();
|
|
264
|
+
s.advance(1);
|
|
265
|
+
const [prefix, local] = s.consumeQName();
|
|
266
|
+
tokenCallback({ type: "ElementStart", prefix, local, start });
|
|
267
|
+
let open = false;
|
|
268
|
+
while (!s.atEnd()) {
|
|
269
|
+
const hasSpace = s.startsWithSpace();
|
|
270
|
+
s.skipSpaces();
|
|
271
|
+
const _start = s.getPos();
|
|
272
|
+
const currCodeUnit = s.currCodeUnit();
|
|
273
|
+
if (currCodeUnit === SLASH) {
|
|
274
|
+
s.advance(1);
|
|
275
|
+
s.consumeCodeUnit(GREATER_THAN);
|
|
276
|
+
const range = s.rangeFrom(_start);
|
|
277
|
+
tokenCallback({ type: "ElementEnd", end: { type: "Empty" }, range });
|
|
278
|
+
break;
|
|
279
|
+
} else if (currCodeUnit === GREATER_THAN) {
|
|
280
|
+
s.advance(1);
|
|
281
|
+
const range = s.rangeFrom(_start);
|
|
282
|
+
tokenCallback({ type: "ElementEnd", end: { type: "Open" }, range });
|
|
283
|
+
open = true;
|
|
284
|
+
break;
|
|
285
|
+
} else {
|
|
286
|
+
if (!hasSpace) {
|
|
287
|
+
throw new XmlError(
|
|
288
|
+
{ type: "InvalidChar", expected: "a whitespace", actual: s.currCodeUnitUnchecked() },
|
|
289
|
+
s.genTextPos()
|
|
290
|
+
);
|
|
291
|
+
}
|
|
292
|
+
const [_prefix, _local, value] = parseAttribute(s);
|
|
293
|
+
const end = s.getPos();
|
|
294
|
+
tokenCallback({
|
|
295
|
+
type: "Attribute",
|
|
296
|
+
range: { start: _start, end },
|
|
297
|
+
prefix: _prefix,
|
|
298
|
+
local: _local,
|
|
299
|
+
value
|
|
300
|
+
});
|
|
301
|
+
}
|
|
302
|
+
}
|
|
303
|
+
if (open) {
|
|
304
|
+
parseContent(s, tokenCallback);
|
|
305
|
+
}
|
|
306
|
+
}
|
|
307
|
+
function parseAttribute(s) {
|
|
308
|
+
const [prefix, local] = s.consumeQName();
|
|
309
|
+
let value;
|
|
310
|
+
const start = s.getPos();
|
|
311
|
+
s.skipSpaces();
|
|
312
|
+
if (s.tryConsumeCodeUnit(EQUALS)) {
|
|
313
|
+
s.skipSpaces();
|
|
314
|
+
const quote = s.consumeQuote();
|
|
315
|
+
value = s.consumeCodeUnitsWhile((c) => c !== quote && c !== LESS_THAN);
|
|
316
|
+
s.consumeCodeUnit(quote);
|
|
317
|
+
} else if (s.config.strict) {
|
|
318
|
+
throw new XmlError(
|
|
319
|
+
{ type: "InvalidChar", expected: EQUALS, actual: s.currCodeUnit() },
|
|
320
|
+
s.genTextPos()
|
|
321
|
+
);
|
|
322
|
+
} else {
|
|
323
|
+
s.goTo(start);
|
|
324
|
+
value = "true";
|
|
325
|
+
}
|
|
326
|
+
return [prefix, local, value];
|
|
327
|
+
}
|
|
328
|
+
function parseContent(s, tokenCallback) {
|
|
329
|
+
while (!s.atEnd()) {
|
|
330
|
+
const currCodeUnit = s.currCodeUnit();
|
|
331
|
+
if (currCodeUnit === LESS_THAN) {
|
|
332
|
+
const nextCodeUnit = s.nextCodeUnit();
|
|
333
|
+
if (nextCodeUnit === EXCLAMATION_MARK) {
|
|
334
|
+
if (s.startsWith(COMMENT_START)) {
|
|
335
|
+
parseComment(s, tokenCallback);
|
|
336
|
+
} else if (s.startsWith(CDATA_START)) {
|
|
337
|
+
parseCdata(s, tokenCallback);
|
|
338
|
+
} else {
|
|
339
|
+
throw new XmlError(
|
|
340
|
+
{ type: "UnknownToken", message: "Failed to parse content" },
|
|
341
|
+
s.genTextPos()
|
|
342
|
+
);
|
|
343
|
+
}
|
|
344
|
+
} else if (nextCodeUnit === QUESTION_MARK) {
|
|
345
|
+
parsePi(s, tokenCallback);
|
|
346
|
+
} else if (nextCodeUnit === SLASH) {
|
|
347
|
+
parseCloseElement(s, tokenCallback);
|
|
348
|
+
break;
|
|
349
|
+
} else {
|
|
350
|
+
parseElement(s, tokenCallback);
|
|
351
|
+
}
|
|
352
|
+
} else {
|
|
353
|
+
parseText(s, tokenCallback);
|
|
354
|
+
}
|
|
355
|
+
}
|
|
356
|
+
}
|
|
357
|
+
function parseCdata(s, tokenCallback) {
|
|
358
|
+
const start = s.getPos();
|
|
359
|
+
s.advance(9);
|
|
360
|
+
const text = s.consumeCodeUnitsWhile(
|
|
361
|
+
(c, _s) => !(c === CLOSE_SQUARE_BRACKET && _s.startsWith(CDATA_END))
|
|
362
|
+
);
|
|
363
|
+
s.skipString(CDATA_END);
|
|
364
|
+
const range = s.rangeFrom(start);
|
|
365
|
+
tokenCallback({ type: "Cdata", text, range });
|
|
366
|
+
}
|
|
367
|
+
function parseCloseElement(s, tokenCallback) {
|
|
368
|
+
const start = s.getPos();
|
|
369
|
+
s.advance(2);
|
|
370
|
+
const [prefix, local] = s.consumeQName();
|
|
371
|
+
s.skipSpaces();
|
|
372
|
+
s.consumeCodeUnit(GREATER_THAN);
|
|
373
|
+
const range = s.rangeFrom(start);
|
|
374
|
+
tokenCallback({ type: "ElementEnd", end: { type: "Close", prefix, local }, range });
|
|
375
|
+
}
|
|
376
|
+
function parseText(s, tokenCallback) {
|
|
377
|
+
const start = s.getPos();
|
|
378
|
+
const text = s.consumeCodeUnitsWhile((c) => c !== LESS_THAN);
|
|
379
|
+
if (text.includes(CDATA_END)) {
|
|
380
|
+
throw new XmlError({ type: "InvalidCharacterData" }, s.genTextPos());
|
|
381
|
+
}
|
|
382
|
+
tokenCallback({ type: "Text", text, range: s.rangeFrom(start) });
|
|
383
|
+
}
|
|
384
|
+
|
|
385
|
+
export { tokenize, tokenizeXmlStream };
|
|
@@ -1 +1,40 @@
|
|
|
1
|
-
import{ZERO
|
|
1
|
+
import { ZERO, NINE, UPPERCASE_A, UPPERCASE_Z, LOWERCASE_A, LOWERCASE_Z, COLON, UNDERSCORE, SPACE, HORIZONTAL_TAB, LINE_FEED, CARRIAGE_RETURN, HYPHEN, PERIOD } from './ascii-constants.js';
|
|
2
|
+
|
|
3
|
+
function isAsciiDigit(byte) {
|
|
4
|
+
return byte >= ZERO && byte <= NINE;
|
|
5
|
+
}
|
|
6
|
+
function isXmlNameStart(codePoint) {
|
|
7
|
+
if (codePoint == null) {
|
|
8
|
+
return false;
|
|
9
|
+
}
|
|
10
|
+
if (codePoint <= 128) {
|
|
11
|
+
return codePoint >= UPPERCASE_A && codePoint <= UPPERCASE_Z || codePoint >= LOWERCASE_A && codePoint <= LOWERCASE_Z || codePoint === COLON || codePoint === UNDERSCORE;
|
|
12
|
+
}
|
|
13
|
+
return codePoint >= 192 && codePoint <= 214 || codePoint >= 216 && codePoint <= 246 || codePoint >= 248 && codePoint <= 767 || codePoint >= 880 && codePoint <= 893 || codePoint >= 895 && codePoint <= 8191 || codePoint >= 8204 && codePoint <= 8205 || codePoint >= 8304 && codePoint <= 8591 || codePoint >= 11264 && codePoint <= 12271 || codePoint >= 12289 && codePoint <= 55295 || codePoint >= 63744 && codePoint <= 64975 || codePoint >= 65008 && codePoint <= 65533 || codePoint >= 65536 && codePoint <= 983039;
|
|
14
|
+
}
|
|
15
|
+
function isXmlName(codePoint) {
|
|
16
|
+
if (codePoint == null) {
|
|
17
|
+
return false;
|
|
18
|
+
}
|
|
19
|
+
if (codePoint <= 128) {
|
|
20
|
+
return isXmlNameByte(codePoint);
|
|
21
|
+
}
|
|
22
|
+
return codePoint === 183 || codePoint >= 192 && codePoint <= 214 || codePoint >= 216 && codePoint <= 246 || codePoint >= 248 && codePoint <= 767 || codePoint >= 768 && codePoint <= 879 || codePoint >= 880 && codePoint <= 893 || codePoint >= 895 && codePoint <= 8191 || codePoint >= 8204 && codePoint <= 8205 || codePoint >= 8255 && codePoint <= 8256 || codePoint >= 8304 && codePoint <= 8591 || codePoint >= 11264 && codePoint <= 12271 || codePoint >= 12289 && codePoint <= 55295 || codePoint >= 63744 && codePoint <= 64975 || codePoint >= 65008 && codePoint <= 65533 || codePoint >= 65536 && codePoint <= 983039;
|
|
23
|
+
}
|
|
24
|
+
function isXmlChar(codePoint) {
|
|
25
|
+
if (codePoint == null) {
|
|
26
|
+
return false;
|
|
27
|
+
}
|
|
28
|
+
if (codePoint < 32) {
|
|
29
|
+
return isXmlSpaceByte(codePoint);
|
|
30
|
+
}
|
|
31
|
+
return codePoint !== 65535 && codePoint !== 65534;
|
|
32
|
+
}
|
|
33
|
+
function isXmlSpaceByte(byte) {
|
|
34
|
+
return byte === SPACE || byte === HORIZONTAL_TAB || byte === LINE_FEED || byte === CARRIAGE_RETURN;
|
|
35
|
+
}
|
|
36
|
+
function isXmlNameByte(byte) {
|
|
37
|
+
return byte >= ZERO && byte <= NINE || byte >= UPPERCASE_A && byte <= UPPERCASE_Z || byte >= LOWERCASE_A && byte <= LOWERCASE_Z || byte === COLON || byte === UNDERSCORE || byte === HYPHEN || byte === PERIOD;
|
|
38
|
+
}
|
|
39
|
+
|
|
40
|
+
export { isAsciiDigit, isXmlChar, isXmlName, isXmlNameByte, isXmlNameStart, isXmlSpaceByte };
|
|
@@ -1 +1,11 @@
|
|
|
1
|
-
import{tokenToXml
|
|
1
|
+
import { tokenToXml } from './token-to-xml.js';
|
|
2
|
+
|
|
3
|
+
function tokensToXml(tokens) {
|
|
4
|
+
let xmlString = "";
|
|
5
|
+
tokens.forEach((token) => {
|
|
6
|
+
xmlString += tokenToXml(token);
|
|
7
|
+
});
|
|
8
|
+
return xmlString;
|
|
9
|
+
}
|
|
10
|
+
|
|
11
|
+
export { tokensToXml };
|
|
@@ -1 +1,66 @@
|
|
|
1
|
-
import{tokenize
|
|
1
|
+
import { tokenize } from './tokenizer/tokenize.js';
|
|
2
|
+
|
|
3
|
+
function xmlToObject(xmlString, options = {}) {
|
|
4
|
+
const root = {
|
|
5
|
+
local: "root",
|
|
6
|
+
attributes: [],
|
|
7
|
+
content: []
|
|
8
|
+
};
|
|
9
|
+
const stack = [root];
|
|
10
|
+
tokenize(
|
|
11
|
+
xmlString,
|
|
12
|
+
(token) => {
|
|
13
|
+
processTokenForObject(token, stack);
|
|
14
|
+
},
|
|
15
|
+
options
|
|
16
|
+
);
|
|
17
|
+
return root.content[0];
|
|
18
|
+
}
|
|
19
|
+
function processTokenForObject(token, stack) {
|
|
20
|
+
switch (token.type) {
|
|
21
|
+
case "ElementStart": {
|
|
22
|
+
const newNode = {
|
|
23
|
+
local: token.local,
|
|
24
|
+
prefix: token.prefix.length > 0 ? token.prefix : void 0,
|
|
25
|
+
attributes: [],
|
|
26
|
+
content: []
|
|
27
|
+
};
|
|
28
|
+
const currentNode = stack[stack.length - 1];
|
|
29
|
+
if (currentNode != null) {
|
|
30
|
+
currentNode.content.push(newNode);
|
|
31
|
+
}
|
|
32
|
+
stack.push(newNode);
|
|
33
|
+
break;
|
|
34
|
+
}
|
|
35
|
+
case "ElementEnd": {
|
|
36
|
+
if (token.end.type === "Close" || token.end.type === "Empty") {
|
|
37
|
+
stack.pop();
|
|
38
|
+
}
|
|
39
|
+
break;
|
|
40
|
+
}
|
|
41
|
+
case "Attribute": {
|
|
42
|
+
const currentNode = stack[stack.length - 1];
|
|
43
|
+
if (currentNode != null) {
|
|
44
|
+
currentNode.attributes.push({
|
|
45
|
+
local: token.local,
|
|
46
|
+
prefix: token.prefix.length > 0 ? token.prefix : void 0,
|
|
47
|
+
value: token.value
|
|
48
|
+
});
|
|
49
|
+
}
|
|
50
|
+
break;
|
|
51
|
+
}
|
|
52
|
+
case "Text":
|
|
53
|
+
case "Cdata": {
|
|
54
|
+
const currentNode = stack[stack.length - 1];
|
|
55
|
+
if (currentNode != null) {
|
|
56
|
+
const trimmedText = token.text.trim();
|
|
57
|
+
if (trimmedText.length > 0) {
|
|
58
|
+
currentNode.content.push(token.text);
|
|
59
|
+
}
|
|
60
|
+
}
|
|
61
|
+
break;
|
|
62
|
+
}
|
|
63
|
+
}
|
|
64
|
+
}
|
|
65
|
+
|
|
66
|
+
export { processTokenForObject, xmlToObject };
|
|
@@ -1 +1,83 @@
|
|
|
1
|
-
import{getQName
|
|
1
|
+
import { getQName } from './get-q-name.js';
|
|
2
|
+
import { tokenize } from './tokenizer/tokenize.js';
|
|
3
|
+
|
|
4
|
+
function xmlToSimplifiedObject(xmlString, options = {}) {
|
|
5
|
+
const result = {};
|
|
6
|
+
const stack = [result];
|
|
7
|
+
tokenize(
|
|
8
|
+
xmlString,
|
|
9
|
+
(token) => {
|
|
10
|
+
processTokenForSimplifiedObject(token, stack);
|
|
11
|
+
},
|
|
12
|
+
options
|
|
13
|
+
);
|
|
14
|
+
return result;
|
|
15
|
+
}
|
|
16
|
+
function processTokenForSimplifiedObject(token, stack) {
|
|
17
|
+
switch (token.type) {
|
|
18
|
+
case "ElementStart": {
|
|
19
|
+
const tagName = getQName(token.local, token.prefix);
|
|
20
|
+
const tagNameWithPrefix = `_${tagName}`;
|
|
21
|
+
const newNode = {};
|
|
22
|
+
const currentNode = stack[stack.length - 1];
|
|
23
|
+
if (currentNode != null) {
|
|
24
|
+
if (currentNode.content != null) {
|
|
25
|
+
newNode.tag = tagName;
|
|
26
|
+
currentNode.content.push(newNode);
|
|
27
|
+
} else if (currentNode.text != null) {
|
|
28
|
+
newNode.tag = tagName;
|
|
29
|
+
currentNode.content = [currentNode.text, newNode];
|
|
30
|
+
delete currentNode.text;
|
|
31
|
+
} else if (currentNode[tagNameWithPrefix] == null) {
|
|
32
|
+
currentNode[tagNameWithPrefix] = [newNode];
|
|
33
|
+
} else if (Array.isArray(currentNode[tagNameWithPrefix])) {
|
|
34
|
+
currentNode[tagNameWithPrefix].push(newNode);
|
|
35
|
+
} else {
|
|
36
|
+
currentNode[tagNameWithPrefix] = [currentNode[tagNameWithPrefix], newNode];
|
|
37
|
+
}
|
|
38
|
+
}
|
|
39
|
+
stack.push(newNode);
|
|
40
|
+
break;
|
|
41
|
+
}
|
|
42
|
+
case "ElementEnd": {
|
|
43
|
+
if (token.end.type === "Close" || token.end.type === "Empty") {
|
|
44
|
+
stack.pop();
|
|
45
|
+
}
|
|
46
|
+
break;
|
|
47
|
+
}
|
|
48
|
+
case "Attribute": {
|
|
49
|
+
const currentNode = stack[stack.length - 1];
|
|
50
|
+
if (currentNode != null) {
|
|
51
|
+
const attrName = getQName(token.local, token.prefix);
|
|
52
|
+
if (currentNode.attributes != null) {
|
|
53
|
+
currentNode.attributes[attrName] = token.value;
|
|
54
|
+
} else {
|
|
55
|
+
currentNode.attributes = {
|
|
56
|
+
[attrName]: token.value
|
|
57
|
+
};
|
|
58
|
+
}
|
|
59
|
+
}
|
|
60
|
+
break;
|
|
61
|
+
}
|
|
62
|
+
case "Text":
|
|
63
|
+
case "Cdata": {
|
|
64
|
+
const currentNode = stack[stack.length - 1];
|
|
65
|
+
if (currentNode != null) {
|
|
66
|
+
const trimmedText = token.text.trim();
|
|
67
|
+
if (trimmedText.length > 0) {
|
|
68
|
+
if (currentNode.content != null) {
|
|
69
|
+
currentNode.content.push(trimmedText);
|
|
70
|
+
} else if (currentNode.text != null) {
|
|
71
|
+
currentNode.content = [currentNode.text, trimmedText];
|
|
72
|
+
delete currentNode.text;
|
|
73
|
+
} else {
|
|
74
|
+
currentNode.text = trimmedText;
|
|
75
|
+
}
|
|
76
|
+
}
|
|
77
|
+
}
|
|
78
|
+
break;
|
|
79
|
+
}
|
|
80
|
+
}
|
|
81
|
+
}
|
|
82
|
+
|
|
83
|
+
export { processTokenForSimplifiedObject, xmlToSimplifiedObject };
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"get-q-name.d.ts","sourceRoot":"","sources":["../../src/get-q-name.ts"],"names":[],"mappings":"AAAA;;;;GAIG;AACH,wBAAgB,QAAQ,CAAC,KAAK,EAAE,MAAM,EAAE,MAAM,GAAE,MAAM,GAAG,IAAW,GAAG,MAAM,CAE5E"}
|
package/dist/types/index.d.ts
CHANGED
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"index.d.ts","sourceRoot":"","sources":["../../src/index.ts"],"names":[],"mappings":"AAAA,cAAc,YAAY,CAAC;AAC3B,cAAc,gBAAgB,CAAC;AAC/B,cAAc,aAAa,CAAC;AAC5B,cAAc,iBAAiB,CAAC;AAChC,cAAc,iBAAiB,CAAC;AAChC,cAAc,4BAA4B,CAAC"}
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"TokenSelectState.d.ts","sourceRoot":"","sources":["../../../src/selector/TokenSelectState.ts"],"names":[],"mappings":"AACA,OAAO,EAAE,KAAK,gBAAgB,EAAE,MAAM,2BAA2B,CAAC;AAClE,OAAO,EAAE,KAAK,uBAAuB,EAAE,MAAM,SAAS,CAAC;AAEvD,qBAAa,gBAAgB;IAC5B,OAAO,CAAC,QAAQ,CAA0B;IAC1C,OAAO,CAAC,cAAc,CAAiD;IACvE,OAAO,CAAC,iBAAiB,CAA6C;IACtE,OAAO,CAAC,aAAa,CAAuB;gBAEhC,OAAO,EAAE,uBAAuB;IAK5C,IAAW,aAAa,IAAI,mBAAmB,CAE9C;IAED,IAAW,gBAAgB,IAAI,iBAAiB,CAE/C;IAED,IAAW,YAAY,IAAI,MAAM,GAAG,IAAI,CAEvC;IAED,OAAO,CAAC,WAAW;IAuBZ,WAAW,CAAC,KAAK,EAAE,MAAM,EAAE,MAAM,EAAE,MAAM,GAAG,OAAO;IASnD,iBAAiB,CAAC,UAAU,EAAE,gBAAgB,EAAE,GAAG,OAAO;IAgC1D,WAAW,CAAC,IAAI,EAAE,MAAM,GAAG,OAAO;IAIlC,YAAY,CAAC,KAAK,EAAE,MAAM,EAAE,WAAW,EAAE,MAAM,GAAG,OAAO;IASzD,KAAK,CAAC,KAAK,EAAE,MAAM,GAAG,IAAI;IAI1B,OAAO,IAAI,IAAI;CAGtB;AAED,0BAAkB,iBAAiB;IAClC,IAAI,IAAI,CAAE,aAAa;IACvB,IAAI,IAAS,CAAE,uCAAuC;IACtD,UAAU,IAAS,CAAE,+CAA+C;IACpE,IAAI,IAAS;CACb;AAED,0BAAkB,mBAAmB;IACpC,IAAI,IAAI,CAAE,aAAa;IACvB,IAAI,IAAS,CAAE,uCAAuC;IACtD,UAAU,IAAS,CAAE,+CAA+C;IACpE,IAAI,IAAS,CAAE,sDAAsD;IACrE,IAAI,IAAS;CACb"}
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"TokenSelectStateMachine.d.ts","sourceRoot":"","sources":["../../../src/selector/TokenSelectStateMachine.ts"],"names":[],"mappings":"AAAA,OAAO,EAAE,KAAK,SAAS,EAAE,MAAM,cAAc,CAAC;AAC9C,OAAO,EAA0C,gBAAgB,EAAE,MAAM,oBAAoB,CAAC;AAC9F,OAAO,EAAE,KAAK,gBAAgB,EAAE,MAAM,SAAS,CAAC;AAEhD,qBAAa,uBAAuB;IACnC,OAAO,CAAC,OAAO,CAAqB;IAGpC,OAAO,CAAC,aAAa,CAAuB;IAG5C,OAAO,CAAC,gBAAgB,CAKtB;IACF,OAAO,CAAC,aAAa,CAAmB;IACxC,OAAO,CAAC,eAAe,CAAmB;gBAE9B,eAAe,EAAE,gBAAgB;IAItC,YAAY,IAAI,gBAAgB,GAAG,IAAI;IAQvC,eAAe,IAAI,gBAAgB,GAAG,IAAI;IAO1C,MAAM,CAAC,KAAK,EAAE,SAAS,GAAG,IAAI;IAM9B,kBAAkB,IAAI,SAAS,EAAE,GAAG,IAAI;IASxC,qBAAqB,CAAC,KAAK,EAAE,MAAM,EAAE,MAAM,EAAE,MAAM,EAAE,KAAK,EAAE,MAAM,GAAG,OAAO;IA8B5E,2BAA2B,CACjC,KAAK,EAAE,MAAM,EACb,MAAM,EAAE,MAAM,EACd,KAAK,EAAE,MAAM,EACb,KAAK,EAAE,MAAM,GACX,OAAO;IA4BH,qBAAqB,CAAC,IAAI,EAAE,MAAM,EAAE,KAAK,EAAE,MAAM,GAAG,OAAO;IAwBlE,OAAO,CAAC,iBAAiB;IAmBlB,cAAc,CAAC,KAAK,EAAE,MAAM,GAAG,IAAI;IAgBnC,YAAY,IAAI,OAAO;IAIvB,gBAAgB,IAAI,MAAM;IAO1B,sBAAsB,IAAI,IAAI;CAOrC;AAED,MAAM,WAAW,gBAAgB;IAChC,MAAM,EAAE,MAAM,GAAG,IAAI,CAAC;IACtB,KAAK,EAAE,MAAM,GAAG,IAAI,CAAC;IACrB,UAAU,EAAE,gBAAgB,EAAE,GAAG,IAAI,CAAC;IACtC,IAAI,EAAE,MAAM,GAAG,IAAI,CAAC;CACpB;AAED,MAAM,WAAW,gBAAgB;IAChC,KAAK,EAAE,MAAM,CAAC;IACd,MAAM,CAAC,EAAE,MAAM,CAAC;IAChB,KAAK,CAAC,EAAE,MAAM,CAAC;CACf"}
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"TokenSelector.d.ts","sourceRoot":"","sources":["../../../src/selector/TokenSelector.ts"],"names":[],"mappings":"AAAA,OAAO,EAKN,KAAK,SAAS,EACd,MAAM,cAAc,CAAC;AAGtB,OAAO,EAAE,KAAK,iBAAiB,EAAE,KAAK,gBAAgB,EAAE,MAAM,SAAS,CAAC;AAExE,qBAAa,aAAa;IACzB,OAAO,CAAC,aAAa,CAAK;IAC1B,OAAO,CAAC,iBAAiB,CAA4B;IACrD,OAAO,CAAC,YAAY,CAAS;gBAEjB,gBAAgB,EAAE,gBAAgB,EAAE;IAMzC,SAAS,CAAC,KAAK,EAAE,SAAS,EAAE,QAAQ,EAAE,CAAC,KAAK,EAAE,iBAAiB,KAAK,IAAI,GAAG,IAAI;IA6CtF,OAAO,CAAC,kBAAkB;IA6B1B,OAAO,CAAC,eAAe;IA2BvB,OAAO,CAAC,UAAU;IAsBlB,OAAO,CAAC,gBAAgB;CAuBxB"}
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"index.d.ts","sourceRoot":"","sources":["../../../src/selector/index.ts"],"names":[],"mappings":"AAAA,cAAc,UAAU,CAAC;AACzB,cAAc,iBAAiB,CAAC;AAChC,cAAc,oBAAoB,CAAC;AACnC,cAAc,2BAA2B,CAAC;AAC1C,cAAc,SAAS,CAAC"}
|