urdu-text-utils 0.1.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
package/dist/index.js ADDED
@@ -0,0 +1,777 @@
1
+ // src/chars.ts
2
+ var DIACRITIC_RANGES = "\\u0610-\\u061A\\u064B-\\u065F\\u0670\\u06D6-\\u06ED";
3
+ var DIACRITICS_RE = new RegExp(`[${DIACRITIC_RANGES}]`, "gu");
4
+ var TATWEEL_RE = /ـ/gu;
5
+ var INVISIBLE_RE = /[​‍-‏‪-‮⁠-⁤⁦-⁩]/gu;
6
+ var ZWNJ_RE = /‌/gu;
7
+ var ARABIC_LETTER_RANGES = "\\u0620-\\u063F\\u0641-\\u064A\\u066E\\u066F\\u0671-\\u06D3\\u06D5\\u06EE\\u06EF\\u06FA-\\u06FF\\u0750-\\u077F\\u08A0-\\u08FF\\uFB50-\\uFDFF\\uFE70-\\uFEFC";
8
+ var ARABIC_LETTER_RE = new RegExp(`[${ARABIC_LETTER_RANGES}]`, "u");
9
+ var ANY_LETTER_RE_G = /\p{L}/gu;
10
+ var URDU_DIGITS = "\u06F0\u06F1\u06F2\u06F3\u06F4\u06F5\u06F6\u06F7\u06F8\u06F9";
11
+ var ARABIC_INDIC_DIGITS = "\u0660\u0661\u0662\u0663\u0664\u0665\u0666\u0667\u0668\u0669";
12
+ var ASCII_DIGITS = "0123456789";
13
+ var ANY_DIGIT_RE_G = new RegExp(`[${ASCII_DIGITS}${URDU_DIGITS}${ARABIC_INDIC_DIGITS}]`, "gu");
14
+ var SENTENCE_SPLIT_RE = /[۔؟?!.…]+/u;
15
+ var WORD_SPLIT_RE = /[\s،؛؟۔٫٬…!-\/:-@\[-`{-~‐-‧«»‘’“”]+/u;
16
+
17
+ // src/normalize.ts
18
+ var URDU_YEH = "\u06CC";
19
+ var URDU_KEHEH = "\u06A9";
20
+ var URDU_HEH_GOAL = "\u06C1";
21
+ var ALEF = "\u0627";
22
+ var WAW = "\u0648";
23
+ var LETTER_MAP = {
24
+ // yeh family -> ی. Note ے (U+06D2 bari ye) is a distinct letter and is preserved.
25
+ "\u064A": URDU_YEH,
26
+ // ي arabic yeh
27
+ "\u0649": URDU_YEH,
28
+ // ى alef maksura
29
+ "\u06CD": URDU_YEH,
30
+ // ۍ yeh with tail
31
+ "\u06D0": URDU_YEH,
32
+ // ې pashto e
33
+ "\u0620": URDU_YEH,
34
+ // ؠ kashmiri yeh
35
+ // kaf family -> ک
36
+ "\u0643": URDU_KEHEH,
37
+ // ك arabic kaf
38
+ "\u06AA": URDU_KEHEH,
39
+ // ڪ swash kaf
40
+ // heh family -> ہ. ھ (U+06BE do-chashmi heh) is a distinct letter and is preserved.
41
+ "\u0647": URDU_HEH_GOAL,
42
+ // ه arabic heh
43
+ "\u06C0": URDU_HEH_GOAL,
44
+ // ۀ heh with yeh above
45
+ "\u0629": URDU_HEH_GOAL,
46
+ // ة teh marbuta
47
+ "\u06C3": URDU_HEH_GOAL,
48
+ // ۃ teh marbuta goal
49
+ "\u06D5": URDU_HEH_GOAL,
50
+ // ە ae
51
+ // alef family -> ا. آ (U+0622 alef madda) is a real Urdu letter and is preserved.
52
+ "\u0623": ALEF,
53
+ // أ alef with hamza above
54
+ "\u0625": ALEF,
55
+ // إ alef with hamza below
56
+ "\u0671": ALEF,
57
+ // ٱ alef wasla
58
+ "\u0672": ALEF,
59
+ // ٲ alef with wavy hamza above
60
+ "\u0673": ALEF,
61
+ // ٳ alef with wavy hamza below
62
+ // waw family -> و. ؤ (U+0624) is preserved: it carries hamza meaningfully in Urdu.
63
+ "\u06CB": WAW,
64
+ // ۋ ve
65
+ "\u06C6": WAW,
66
+ // ۆ oe
67
+ "\u06C7": WAW
68
+ // ۇ u
69
+ };
70
+ var digitTargets = {
71
+ urdu: URDU_DIGITS,
72
+ english: ASCII_DIGITS,
73
+ arabic: ARABIC_INDIC_DIGITS
74
+ };
75
+ var PUNCTUATION_MAP = {
76
+ ",": "\u060C",
77
+ // ،
78
+ ";": "\u061B",
79
+ // ؛
80
+ "?": "\u061F"
81
+ // ؟
82
+ };
83
+ var DIGIT_LOOKUP = /* @__PURE__ */ new Map();
84
+ for (const set of [ASCII_DIGITS, URDU_DIGITS, ARABIC_INDIC_DIGITS]) {
85
+ for (let i = 0; i < 10; i++) DIGIT_LOOKUP.set(set[i], i);
86
+ }
87
+ function normalizeUrdu(input, options = {}) {
88
+ if (!input) return "";
89
+ const {
90
+ compatibility = true,
91
+ stripDiacritics = false,
92
+ stripTatweel = true,
93
+ stripZwnj = false,
94
+ collapseWhitespace = true,
95
+ digits = "preserve",
96
+ urduPunctuation = false
97
+ } = options;
98
+ let text = compatibility ? input.normalize("NFKC") : input.normalize("NFC");
99
+ text = text.replace(INVISIBLE_RE, "");
100
+ if (stripZwnj) text = text.replace(ZWNJ_RE, "");
101
+ if (stripTatweel) text = text.replace(TATWEEL_RE, "");
102
+ if (stripDiacritics) text = text.replace(DIACRITICS_RE, "");
103
+ const digitTarget = digits === "preserve" ? null : digitTargets[digits];
104
+ let out = "";
105
+ for (const ch of text) {
106
+ const mapped = LETTER_MAP[ch];
107
+ if (mapped !== void 0) {
108
+ out += mapped;
109
+ continue;
110
+ }
111
+ if (digitTarget) {
112
+ const value = DIGIT_LOOKUP.get(ch);
113
+ if (value !== void 0) {
114
+ out += digitTarget[value];
115
+ continue;
116
+ }
117
+ }
118
+ if (urduPunctuation) {
119
+ const punct = PUNCTUATION_MAP[ch];
120
+ if (punct !== void 0) {
121
+ out += punct;
122
+ continue;
123
+ }
124
+ }
125
+ out += ch;
126
+ }
127
+ if (collapseWhitespace) out = out.replace(/\s+/gu, " ").trim();
128
+ return out;
129
+ }
130
+ function removeDiacritics(input) {
131
+ if (!input) return "";
132
+ return input.normalize("NFC").replace(DIACRITICS_RE, "");
133
+ }
134
+ function foldUrdu(input) {
135
+ return normalizeUrdu(input, {
136
+ stripDiacritics: true,
137
+ stripZwnj: true,
138
+ collapseWhitespace: true
139
+ }).toLowerCase();
140
+ }
141
+
142
+ // src/numbers.ts
143
+ var SETS = {
144
+ urdu: URDU_DIGITS,
145
+ english: ASCII_DIGITS,
146
+ arabic: ARABIC_INDIC_DIGITS
147
+ };
148
+ var VALUE_OF = /* @__PURE__ */ new Map();
149
+ for (const set of Object.values(SETS)) {
150
+ for (let i = 0; i < 10; i++) VALUE_OF.set(set[i], i);
151
+ }
152
+ function convert(input, target) {
153
+ if (!input) return "";
154
+ const digits = SETS[target];
155
+ let out = "";
156
+ for (const ch of input) {
157
+ const value = VALUE_OF.get(ch);
158
+ out += value === void 0 ? ch : digits[value];
159
+ }
160
+ return out;
161
+ }
162
+ function toUrduDigits(input) {
163
+ return convert(input, "urdu");
164
+ }
165
+ function toEnglishDigits(input) {
166
+ return convert(input, "english");
167
+ }
168
+ function toArabicIndicDigits(input) {
169
+ return convert(input, "arabic");
170
+ }
171
+ function convertNumbers(input, to = "urdu") {
172
+ return convert(input, to);
173
+ }
174
+ function parseUrduNumber(input) {
175
+ if (!input) return NaN;
176
+ const ascii = toEnglishDigits(input).replace(/[٬,\s]/gu, "").replace(/٫/gu, ".");
177
+ if (!/^[+-]?(\d+(\.\d*)?|\.\d+)$/u.test(ascii)) return NaN;
178
+ return Number(ascii);
179
+ }
180
+ var ONES = ["", "\u0627\u06CC\u06A9", "\u062F\u0648", "\u062A\u06CC\u0646", "\u0686\u0627\u0631", "\u067E\u0627\u0646\u0686", "\u0686\u06BE", "\u0633\u0627\u062A", "\u0622\u0679\u06BE", "\u0646\u0648"];
181
+ var TEENS_AND_TENS = {
182
+ 10: "\u062F\u0633",
183
+ 11: "\u06AF\u06CC\u0627\u0631\u06C1",
184
+ 12: "\u0628\u0627\u0631\u06C1",
185
+ 13: "\u062A\u06CC\u0631\u06C1",
186
+ 14: "\u0686\u0648\u062F\u06C1",
187
+ 15: "\u067E\u0646\u062F\u0631\u06C1",
188
+ 16: "\u0633\u0648\u0644\u06C1",
189
+ 17: "\u0633\u062A\u0631\u06C1",
190
+ 18: "\u0627\u0679\u06BE\u0627\u0631\u06C1",
191
+ 19: "\u0627\u0646\u06CC\u0633",
192
+ 20: "\u0628\u06CC\u0633",
193
+ 30: "\u062A\u06CC\u0633",
194
+ 40: "\u0686\u0627\u0644\u06CC\u0633",
195
+ 50: "\u067E\u0686\u0627\u0633",
196
+ 60: "\u0633\u0627\u0679\u06BE",
197
+ 70: "\u0633\u062A\u0631",
198
+ 80: "\u0627\u0633\u06CC",
199
+ 90: "\u0646\u0648\u06D2",
200
+ 100: "\u0633\u0648"
201
+ };
202
+ function numberToUrduWords(value) {
203
+ if (!Number.isFinite(value)) return "";
204
+ if (!Number.isInteger(value)) throw new TypeError("numberToUrduWords expects an integer");
205
+ if (value < 0) return `\u0645\u0646\u0641\u06CC ${numberToUrduWords(-value)}`;
206
+ if (value === 0) return "\u0635\u0641\u0631";
207
+ const scales = [
208
+ [1e7, "\u06A9\u0631\u0648\u0691"],
209
+ [1e5, "\u0644\u0627\u06A9\u06BE"],
210
+ [1e3, "\u06C1\u0632\u0627\u0631"],
211
+ [100, "\u0633\u0648"]
212
+ ];
213
+ const parts = [];
214
+ let rest = value;
215
+ for (const [size, name] of scales) {
216
+ if (rest >= size) {
217
+ const count = Math.floor(rest / size);
218
+ rest %= size;
219
+ parts.push(`${numberToUrduWords(count)} ${name}`);
220
+ }
221
+ }
222
+ if (rest > 0) {
223
+ if (TEENS_AND_TENS[rest]) {
224
+ parts.push(TEENS_AND_TENS[rest]);
225
+ } else if (rest < 10) {
226
+ parts.push(ONES[rest]);
227
+ } else {
228
+ const tens = Math.floor(rest / 10) * 10;
229
+ parts.push(`${TEENS_AND_TENS[tens] ?? ""} ${ONES[rest % 10] ?? ""}`.trim());
230
+ }
231
+ }
232
+ return parts.join(" ").replace(/\s+/gu, " ").trim();
233
+ }
234
+
235
+ // src/detect.ts
236
+ function urduRatio(input) {
237
+ if (!input) return 0;
238
+ let letters = 0;
239
+ let urdu = 0;
240
+ for (const ch of input.match(ANY_LETTER_RE_G) ?? []) {
241
+ letters++;
242
+ if (ARABIC_LETTER_RE.test(ch)) urdu++;
243
+ }
244
+ return letters === 0 ? 0 : urdu / letters;
245
+ }
246
+ function isUrdu(input, options = {}) {
247
+ const { threshold = 0.5, minLetters = 1 } = options;
248
+ if (!input) return false;
249
+ let letters = 0;
250
+ let urdu = 0;
251
+ for (const ch of input.match(ANY_LETTER_RE_G) ?? []) {
252
+ letters++;
253
+ if (ARABIC_LETTER_RE.test(ch)) urdu++;
254
+ }
255
+ if (urdu < minLetters) return false;
256
+ return letters > 0 && urdu / letters >= threshold;
257
+ }
258
+ var URDU_ONLY = /* @__PURE__ */ new Set([
259
+ "\u0679",
260
+ // ٹ tteh
261
+ "\u0688",
262
+ // ڈ ddal
263
+ "\u0691",
264
+ // ڑ rreh
265
+ "\u06BA",
266
+ // ں noon ghunna
267
+ "\u06D2",
268
+ // ے bari ye
269
+ "\u06D3",
270
+ // ۓ bari ye with hamza
271
+ "\u06C1",
272
+ // ہ heh goal
273
+ "\u06BE",
274
+ // ھ do-chashmi heh
275
+ "\u06A9",
276
+ // ک keheh
277
+ "\u06AF",
278
+ // گ gaf
279
+ "\u0686",
280
+ // چ tcheh
281
+ "\u067E",
282
+ // پ peh
283
+ "\u0698",
284
+ // ژ jeh
285
+ "\u06CC"
286
+ // ی farsi yeh
287
+ ]);
288
+ function hasUrduSpecificLetters(input) {
289
+ for (const ch of input) if (URDU_ONLY.has(ch)) return true;
290
+ return false;
291
+ }
292
+
293
+ // src/stats.ts
294
+ function countWords(input) {
295
+ return splitWords(input).length;
296
+ }
297
+ function splitWords(input) {
298
+ if (!input) return [];
299
+ return input.split(WORD_SPLIT_RE).map((w) => w.trim()).filter((w) => w.length > 0);
300
+ }
301
+ function countSentences(input) {
302
+ return splitSentences(input).length;
303
+ }
304
+ function splitSentences(input) {
305
+ if (!input) return [];
306
+ return input.split(SENTENCE_SPLIT_RE).map((s) => s.trim()).filter((s) => s.length > 0);
307
+ }
308
+ function analyzeUrdu(input) {
309
+ const text = input ?? "";
310
+ const characters = [...text].length;
311
+ const charactersNoSpaces = [...text.replace(/\s/gu, "")].length;
312
+ const words = countWords(text);
313
+ const sentences = countSentences(text);
314
+ const paragraphs = text.split(/\n\s*\n/u).map((p) => p.trim()).filter((p) => p.length > 0).length;
315
+ return {
316
+ characters,
317
+ charactersNoSpaces,
318
+ words,
319
+ sentences,
320
+ paragraphs,
321
+ urduPercentage: Math.round(urduRatio(text) * 100),
322
+ diacritics: (text.match(DIACRITICS_RE) ?? []).length,
323
+ digits: (text.match(ANY_DIGIT_RE_G) ?? []).length,
324
+ averageWordsPerSentence: sentences === 0 ? 0 : Math.round(words / sentences * 10) / 10,
325
+ readingTimeMinutes: Math.round(words / 180 * 10) / 10
326
+ };
327
+ }
328
+
329
+ // src/collate.ts
330
+ var ALPHABET = [
331
+ "\u0627",
332
+ "\u0622",
333
+ "\u0628",
334
+ "\u067E",
335
+ "\u062A",
336
+ "\u0679",
337
+ "\u062B",
338
+ "\u062C",
339
+ "\u0686",
340
+ "\u062D",
341
+ "\u062E",
342
+ "\u062F",
343
+ "\u0688",
344
+ "\u0630",
345
+ "\u0631",
346
+ "\u0691",
347
+ "\u0632",
348
+ "\u0698",
349
+ "\u0633",
350
+ "\u0634",
351
+ "\u0635",
352
+ "\u0636",
353
+ "\u0637",
354
+ "\u0638",
355
+ "\u0639",
356
+ "\u063A",
357
+ "\u0641",
358
+ "\u0642",
359
+ "\u06A9",
360
+ "\u06AF",
361
+ "\u0644",
362
+ "\u0645",
363
+ "\u0646",
364
+ "\u06BA",
365
+ "\u0648",
366
+ "\u06C1",
367
+ "\u06BE",
368
+ "\u0621",
369
+ "\u06CC",
370
+ "\u06D2"
371
+ ];
372
+ var VARIANTS = {
373
+ "\u0624": ["\u0648", 1],
374
+ // ؤ waw with hamza
375
+ "\u0626": ["\u06CC", 1],
376
+ // ئ yeh with hamza
377
+ "\u06C2": ["\u06C1", 1],
378
+ // ۂ heh goal with hamza
379
+ "\u06D3": ["\u06D2", 1]
380
+ // ۓ bari ye with hamza
381
+ };
382
+ var WEIGHTS = /* @__PURE__ */ new Map();
383
+ ALPHABET.forEach((ch, index) => WEIGHTS.set(ch, [(index + 1) * 10, 0]));
384
+ for (const [ch, [base, secondary]] of Object.entries(VARIANTS)) {
385
+ const baseWeight = WEIGHTS.get(base);
386
+ if (baseWeight) WEIGHTS.set(ch, [baseWeight[0], secondary]);
387
+ }
388
+ var NON_LETTER_BASE = (ALPHABET.length + 1) * 10;
389
+ function weightsOf(text) {
390
+ const out = [];
391
+ for (const ch of text) {
392
+ const weight = WEIGHTS.get(ch);
393
+ if (weight) {
394
+ out.push(weight[0], weight[1]);
395
+ } else if (ch === " ") {
396
+ out.push(1, 0);
397
+ } else {
398
+ out.push(NON_LETTER_BASE + (ch.codePointAt(0) ?? 0), 0);
399
+ }
400
+ }
401
+ return out;
402
+ }
403
+ function compareUrdu(a, b) {
404
+ const left = weightsOf(foldUrdu(a));
405
+ const right = weightsOf(foldUrdu(b));
406
+ const length = Math.min(left.length, right.length);
407
+ for (let i = 0; i < length; i++) {
408
+ const diff = left[i] - right[i];
409
+ if (diff !== 0) return diff;
410
+ }
411
+ return left.length - right.length;
412
+ }
413
+ function sortUrdu(items, options = {}) {
414
+ const { descending = false, getText } = options;
415
+ const key = getText ?? ((item) => String(item));
416
+ const sorted = [...items].sort((a, b) => compareUrdu(key(a), key(b)));
417
+ return descending ? sorted.reverse() : sorted;
418
+ }
419
+
420
+ // src/search.ts
421
+ function editDistance(a, b, limit = Infinity) {
422
+ if (a === b) return 0;
423
+ if (Math.abs(a.length - b.length) > limit) return limit + 1;
424
+ let previous = Array.from({ length: b.length + 1 }, (_, i) => i);
425
+ let current = new Array(b.length + 1);
426
+ for (let i = 1; i <= a.length; i++) {
427
+ current[0] = i;
428
+ let rowMin = current[0];
429
+ for (let j = 1; j <= b.length; j++) {
430
+ const cost = a[i - 1] === b[j - 1] ? 0 : 1;
431
+ current[j] = Math.min(current[j - 1] + 1, previous[j] + 1, previous[j - 1] + cost);
432
+ rowMin = Math.min(rowMin, current[j]);
433
+ }
434
+ if (rowMin > limit) return limit + 1;
435
+ [previous, current] = [current, previous];
436
+ }
437
+ return previous[b.length];
438
+ }
439
+ function scoreOf(query, text, options) {
440
+ if (!query) return 0;
441
+ if (text === query) return 1;
442
+ if (text.startsWith(query)) return 0.9;
443
+ if (text.includes(query)) return 0.8;
444
+ if (!options.fuzzy) return 0;
445
+ const queryWords = splitWords(query);
446
+ const textWords = splitWords(text);
447
+ if (queryWords.length === 0 || textWords.length === 0) return 0;
448
+ let matched = 0;
449
+ for (const qw of queryWords) {
450
+ const limit = Math.min(options.maxDistance, Math.max(1, Math.floor(qw.length / 3)));
451
+ const hit = textWords.some(
452
+ (tw) => tw.includes(qw) || editDistance(qw, tw, limit) <= limit
453
+ );
454
+ if (hit) matched++;
455
+ }
456
+ if (matched === 0) return 0;
457
+ return matched / queryWords.length * 0.7;
458
+ }
459
+ function searchUrdu(query, items, options = {}) {
460
+ return searchUrduRanked(query, items, options).map((r) => r.item);
461
+ }
462
+ function searchUrduRanked(query, items, options = {}) {
463
+ const { getText, fuzzy = false, maxDistance = 1, limit, sortByScore = true } = options;
464
+ const read = getText ?? ((item) => String(item));
465
+ const folded = foldUrdu(query);
466
+ if (!folded) return [];
467
+ const results = [];
468
+ for (const item of items) {
469
+ const score = scoreOf(folded, foldUrdu(read(item)), { fuzzy, maxDistance });
470
+ if (score > 0) results.push({ item, score });
471
+ }
472
+ if (sortByScore) results.sort((a, b) => b.score - a.score);
473
+ return limit === void 0 ? results : results.slice(0, limit);
474
+ }
475
+ function highlightUrdu(text, query, wrap = (m) => `<mark>${m}</mark>`) {
476
+ const foldedQuery = foldUrdu(query);
477
+ if (!foldedQuery || !text) return text;
478
+ const sourceChars = [...text];
479
+ const foldedChars = [];
480
+ const sourceIndexOf = [];
481
+ sourceChars.forEach((ch, i) => {
482
+ const folded = normalizeUrdu(ch, {
483
+ stripDiacritics: true,
484
+ stripZwnj: true,
485
+ collapseWhitespace: false
486
+ }).toLowerCase();
487
+ for (const f of folded) {
488
+ foldedChars.push(f);
489
+ sourceIndexOf.push(i);
490
+ }
491
+ });
492
+ const haystack = foldedChars.join("");
493
+ let out = "";
494
+ let cursor = 0;
495
+ let from = 0;
496
+ for (; ; ) {
497
+ const hit = haystack.indexOf(foldedQuery, from);
498
+ if (hit === -1) break;
499
+ const startSource = sourceIndexOf[hit];
500
+ const endSource = (sourceIndexOf[hit + foldedQuery.length - 1] ?? startSource) + 1;
501
+ out += sourceChars.slice(cursor, startSource).join("");
502
+ out += wrap(sourceChars.slice(startSource, endSource).join(""));
503
+ cursor = endSource;
504
+ from = hit + foldedQuery.length;
505
+ }
506
+ out += sourceChars.slice(cursor).join("");
507
+ return out;
508
+ }
509
+
510
+ // src/transliterate.ts
511
+ var WORD_DICTIONARY = {
512
+ "\u0622\u067E": "aap",
513
+ "\u0622\u067E\u06A9\u0627": "aapka",
514
+ "\u0627\u0648\u0631": "aur",
515
+ "\u0627\u06CC\u06A9": "aik",
516
+ "\u0627\u062D\u0645\u062F": "ahmed",
517
+ "\u0627\u0686\u06BE\u0627": "acha",
518
+ "\u0628\u06C1\u062A": "bohat",
519
+ "\u067E\u0627\u06A9\u0633\u062A\u0627\u0646": "pakistan",
520
+ "\u067E\u0627\u0646\u06CC": "paani",
521
+ "\u067E\u0631": "par",
522
+ "\u067E\u06C1\u0644\u0627": "pehla",
523
+ "\u062A\u0645": "tum",
524
+ "\u062A\u06BE\u0627": "tha",
525
+ "\u062A\u06BE\u06CC": "thi",
526
+ "\u062D\u0627\u0644": "haal",
527
+ "\u062E\u0627\u0646": "khan",
528
+ "\u062E\u0648\u0628\u0635\u0648\u0631\u062A": "khoobsurat",
529
+ "\u062F\u0646": "din",
530
+ "\u0631\u0627\u062A": "raat",
531
+ "\u0632\u06CC\u062F": "zaid",
532
+ "\u0633\u06D2": "se",
533
+ "\u0634\u06C1\u0631": "shehar",
534
+ "\u0639\u0644\u06CC": "ali",
535
+ "\u06A9\u0627": "ka",
536
+ "\u06A9\u062A\u0627\u0628": "kitaab",
537
+ "\u06A9\u0631": "kar",
538
+ "\u06A9\u0631\u0646\u0627": "karna",
539
+ "\u06A9\u06D2": "ke",
540
+ "\u06A9\u06CC": "ki",
541
+ "\u06A9\u06CC\u0627": "kya",
542
+ "\u06A9\u06CC\u0633\u06D2": "kaisay",
543
+ "\u0644\u0691\u06A9\u0627": "larka",
544
+ "\u0644\u0691\u06A9\u06CC": "larki",
545
+ "\u0644\u06CC\u06D2": "liye",
546
+ "\u0645\u062D\u0645\u062F": "muhammad",
547
+ "\u0645\u0636\u0645\u0648\u0646": "mazmoon",
548
+ "\u0645\u0644\u06A9": "mulk",
549
+ "\u0645\u06CC\u06BA": "mein",
550
+ "\u0645\u06CC\u0631\u0627": "mera",
551
+ "\u0645\u06CC\u0631\u06CC": "meri",
552
+ "\u0646\u0627\u0645": "naam",
553
+ "\u0646\u06C1\u06CC\u06BA": "nahi",
554
+ "\u0648\u06C1": "woh",
555
+ "\u06C1\u06D2": "hai",
556
+ "\u06C1\u06CC\u06BA": "hain",
557
+ "\u06C1\u0648": "ho",
558
+ "\u06C1\u0648\u06BA": "hoon",
559
+ "\u06CC\u06C1": "yeh"
560
+ };
561
+ var DIGRAPHS = {
562
+ "\u0628\u06BE": "bh",
563
+ "\u067E\u06BE": "ph",
564
+ "\u062A\u06BE": "th",
565
+ "\u0679\u06BE": "th",
566
+ "\u062C\u06BE": "jh",
567
+ "\u0686\u06BE": "chh",
568
+ "\u062F\u06BE": "dh",
569
+ "\u0688\u06BE": "dh",
570
+ "\u0691\u06BE": "rh",
571
+ "\u06A9\u06BE": "kh",
572
+ "\u06AF\u06BE": "gh",
573
+ "\u0644\u06BE": "lh",
574
+ "\u0645\u06BE": "mh",
575
+ "\u0646\u06BE": "nh",
576
+ "\u0631\u06BE": "rh"
577
+ };
578
+ var LETTERS = {
579
+ "\u0627": "a",
580
+ "\u0622": "aa",
581
+ "\u0628": "b",
582
+ "\u067E": "p",
583
+ "\u062A": "t",
584
+ "\u0679": "t",
585
+ "\u062B": "s",
586
+ "\u062C": "j",
587
+ "\u0686": "ch",
588
+ "\u062D": "h",
589
+ "\u062E": "kh",
590
+ "\u062F": "d",
591
+ "\u0688": "d",
592
+ "\u0630": "z",
593
+ "\u0631": "r",
594
+ "\u0691": "r",
595
+ "\u0632": "z",
596
+ "\u0698": "zh",
597
+ "\u0633": "s",
598
+ "\u0634": "sh",
599
+ "\u0635": "s",
600
+ "\u0636": "z",
601
+ "\u0637": "t",
602
+ "\u0638": "z",
603
+ "\u0639": "a",
604
+ "\u063A": "gh",
605
+ "\u0641": "f",
606
+ "\u0642": "q",
607
+ "\u06A9": "k",
608
+ "\u06AF": "g",
609
+ "\u0644": "l",
610
+ "\u0645": "m",
611
+ "\u0646": "n",
612
+ "\u06BA": "n",
613
+ "\u0648": "o",
614
+ "\u06C1": "h",
615
+ "\u06BE": "h",
616
+ "\u0621": "",
617
+ "\u06CC": "i",
618
+ "\u0626": "i",
619
+ "\u06D2": "e",
620
+ "\u06D3": "e",
621
+ "\u0624": "o",
622
+ "\u06C2": "h"
623
+ };
624
+ function romanizeWord(word) {
625
+ const dictionary = WORD_DICTIONARY[word];
626
+ if (dictionary) return dictionary;
627
+ const chars = [...word];
628
+ let out = "";
629
+ for (let i = 0; i < chars.length; i++) {
630
+ const pair = chars[i] + (chars[i + 1] ?? "");
631
+ const digraph = DIGRAPHS[pair];
632
+ if (digraph) {
633
+ out += digraph;
634
+ i++;
635
+ continue;
636
+ }
637
+ const ch = chars[i];
638
+ if (i === 0 && ch === "\u0627") {
639
+ const next = chars[1];
640
+ if (next === "\u0648") {
641
+ out += "o";
642
+ i++;
643
+ continue;
644
+ }
645
+ if (next === "\u06CC") {
646
+ out += "i";
647
+ i++;
648
+ continue;
649
+ }
650
+ out += "a";
651
+ continue;
652
+ }
653
+ out += LETTERS[ch] ?? ch;
654
+ }
655
+ return out;
656
+ }
657
+ function romanize(input, options = {}) {
658
+ if (!input) return "";
659
+ const clean = removeDiacritics(normalizeUrdu(input));
660
+ const roman = clean.split(/(\s+)/u).map((chunk) => /^\s+$/u.test(chunk) ? chunk : romanizeWord(chunk)).join("");
661
+ if (!options.capitalize) return roman;
662
+ return roman.charAt(0).toUpperCase() + roman.slice(1);
663
+ }
664
+ var ROMAN_DICTIONARY = {};
665
+ for (const [urduWord, roman] of Object.entries(WORD_DICTIONARY)) {
666
+ ROMAN_DICTIONARY[roman] = urduWord;
667
+ }
668
+ Object.assign(ROMAN_DICTIONARY, {
669
+ hai: "\u06C1\u06D2",
670
+ hay: "\u06C1\u06D2",
671
+ he: "\u06C1\u06D2",
672
+ hein: "\u06C1\u06CC\u06BA",
673
+ hoon: "\u06C1\u0648\u06BA",
674
+ hun: "\u06C1\u0648\u06BA",
675
+ ap: "\u0622\u067E",
676
+ kaise: "\u06A9\u06CC\u0633\u06D2",
677
+ kaisa: "\u06A9\u06CC\u0633\u0627",
678
+ nam: "\u0646\u0627\u0645",
679
+ naam: "\u0646\u0627\u0645",
680
+ mai: "\u0645\u06CC\u06BA",
681
+ main: "\u0645\u06CC\u06BA",
682
+ nahin: "\u0646\u06C1\u06CC\u06BA",
683
+ kia: "\u06A9\u06CC\u0627",
684
+ bahut: "\u0628\u06C1\u062A",
685
+ bhot: "\u0628\u06C1\u062A",
686
+ acha: "\u0627\u0686\u06BE\u0627",
687
+ achha: "\u0627\u0686\u06BE\u0627",
688
+ shukriya: "\u0634\u06A9\u0631\u06CC\u06C1",
689
+ salam: "\u0633\u0644\u0627\u0645"
690
+ });
691
+ var ROMAN_RULES = [
692
+ [/^kh/u, "\u06A9\u06BE"],
693
+ [/^gh/u, "\u06AF\u06BE"],
694
+ [/^chh/u, "\u0686\u06BE"],
695
+ [/^ch/u, "\u0686"],
696
+ [/^sh/u, "\u0634"],
697
+ [/^th/u, "\u062A\u06BE"],
698
+ [/^ph/u, "\u067E\u06BE"],
699
+ [/^bh/u, "\u0628\u06BE"],
700
+ [/^aa/u, "\u0622"],
701
+ [/^oo/u, "\u0648"],
702
+ [/^ee/u, "\u06CC"],
703
+ [/^ai/u, "\u06CC"],
704
+ [/^b/u, "\u0628"],
705
+ [/^p/u, "\u067E"],
706
+ [/^t/u, "\u062A"],
707
+ [/^j/u, "\u062C"],
708
+ [/^d/u, "\u062F"],
709
+ [/^r/u, "\u0631"],
710
+ [/^z/u, "\u0632"],
711
+ [/^s/u, "\u0633"],
712
+ [/^f/u, "\u0641"],
713
+ [/^q/u, "\u0642"],
714
+ [/^k/u, "\u06A9"],
715
+ [/^g/u, "\u06AF"],
716
+ [/^l/u, "\u0644"],
717
+ [/^m/u, "\u0645"],
718
+ [/^n/u, "\u0646"],
719
+ [/^v|^w/u, "\u0648"],
720
+ [/^h/u, "\u06C1"],
721
+ [/^y/u, "\u06CC"],
722
+ [/^a/u, "\u0627"],
723
+ [/^e/u, "\u06CC"],
724
+ [/^i/u, "\u06CC"],
725
+ [/^o/u, "\u0648"],
726
+ [/^u/u, "\u0648"]
727
+ ];
728
+ function romanWordToUrdu(word) {
729
+ const lower = word.toLowerCase();
730
+ const dictionary = ROMAN_DICTIONARY[lower];
731
+ if (dictionary) return dictionary;
732
+ let rest = lower;
733
+ let out = "";
734
+ let position = 0;
735
+ while (rest.length > 0) {
736
+ let matched = false;
737
+ for (const [pattern, replacement] of ROMAN_RULES) {
738
+ const hit = pattern.exec(rest);
739
+ if (!hit) continue;
740
+ const isShortVowel = /^[aeiou]$/u.test(hit[0]);
741
+ const skip = isShortVowel && position > 0 && rest.length > 1;
742
+ if (!skip) out += replacement;
743
+ rest = rest.slice(hit[0].length);
744
+ position++;
745
+ matched = true;
746
+ break;
747
+ }
748
+ if (!matched) {
749
+ out += rest[0];
750
+ rest = rest.slice(1);
751
+ position++;
752
+ }
753
+ }
754
+ return out;
755
+ }
756
+ function romanToUrdu(input) {
757
+ if (!input) return "";
758
+ return input.split(/(\s+)/u).map((chunk) => /^\s+$/u.test(chunk) ? chunk : romanWordToUrdu(chunk)).join("");
759
+ }
760
+ function urduSlug(input, options = {}) {
761
+ const { separator = "-", maxLength, preserveUrdu = false } = options;
762
+ if (!input) return "";
763
+ const words = splitWords(removeDiacritics(normalizeUrdu(input)));
764
+ const parts = preserveUrdu ? words : words.map(romanizeWord);
765
+ const allowed = preserveUrdu ? /[^\p{L}\p{N}]+/gu : /[^a-z0-9]+/gu;
766
+ let slug = parts.map((part) => part.toLowerCase().replace(allowed, " ").trim()).flatMap((part) => part.split(/\s+/u)).filter((part) => part.length > 0).join(separator);
767
+ if (maxLength && slug.length > maxLength) {
768
+ slug = slug.slice(0, maxLength);
769
+ const lastSeparator = slug.lastIndexOf(separator);
770
+ if (lastSeparator > 0) slug = slug.slice(0, lastSeparator);
771
+ }
772
+ return slug;
773
+ }
774
+
775
+ export { analyzeUrdu, compareUrdu, convertNumbers, countSentences, countWords, editDistance, foldUrdu, hasUrduSpecificLetters, highlightUrdu, isUrdu, normalizeUrdu, numberToUrduWords, parseUrduNumber, removeDiacritics, romanToUrdu, romanize, searchUrdu, searchUrduRanked, sortUrdu, splitSentences, splitWords, toArabicIndicDigits, toEnglishDigits, toUrduDigits, urduRatio, urduSlug };
776
+ //# sourceMappingURL=index.js.map
777
+ //# sourceMappingURL=index.js.map