@stll/anonymize-wasm 1.0.8 → 1.1.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (78) hide show
  1. package/dist/address-boundaries.mjs +85 -0
  2. package/dist/address-boundaries.mjs.map +1 -0
  3. package/dist/address-prepositions.mjs +182 -0
  4. package/dist/address-prepositions.mjs.map +1 -0
  5. package/dist/address-street-types.mjs +162 -0
  6. package/dist/address-street-types.mjs.map +1 -0
  7. package/dist/allow-list.mjs +183 -0
  8. package/dist/allow-list.mjs.map +1 -0
  9. package/dist/amount-words.mjs +42 -0
  10. package/dist/amount-words.mjs.map +1 -0
  11. package/dist/coreference.cs.mjs +14 -0
  12. package/dist/coreference.cs.mjs.map +1 -0
  13. package/dist/coreference.de.mjs +14 -0
  14. package/dist/coreference.de.mjs.map +1 -0
  15. package/dist/coreference.en.mjs +14 -0
  16. package/dist/coreference.en.mjs.map +1 -0
  17. package/dist/coreference.sk.mjs +10 -0
  18. package/dist/coreference.sk.mjs.map +1 -0
  19. package/dist/currencies.mjs +231 -0
  20. package/dist/currencies.mjs.map +1 -0
  21. package/dist/date-months.mjs +618 -0
  22. package/dist/date-months.mjs.map +1 -0
  23. package/dist/generic-roles.mjs +65 -0
  24. package/dist/generic-roles.mjs.map +1 -0
  25. package/dist/hotword-rules.mjs +145 -0
  26. package/dist/hotword-rules.mjs.map +1 -0
  27. package/dist/legal-forms.mjs +2112 -0
  28. package/dist/legal-forms.mjs.map +1 -0
  29. package/dist/manifest.mjs +56 -0
  30. package/dist/manifest.mjs.map +1 -0
  31. package/dist/names-exclusions.mjs +191 -0
  32. package/dist/names-exclusions.mjs.map +1 -0
  33. package/dist/names-first.mjs +418 -0
  34. package/dist/names-first.mjs.map +1 -0
  35. package/dist/names-surnames.mjs +113 -0
  36. package/dist/names-surnames.mjs.map +1 -0
  37. package/dist/names-title-tokens.mjs +40 -0
  38. package/dist/names-title-tokens.mjs.map +1 -0
  39. package/dist/person-stopwords.mjs +69 -0
  40. package/dist/person-stopwords.mjs.map +1 -0
  41. package/dist/section-headings.mjs +52 -0
  42. package/dist/section-headings.mjs.map +1 -0
  43. package/dist/signing-clauses.mjs +78 -0
  44. package/dist/signing-clauses.mjs.map +1 -0
  45. package/dist/stopwords.mjs +9915 -0
  46. package/dist/stopwords.mjs.map +1 -0
  47. package/dist/triggers.cs.mjs +465 -0
  48. package/dist/triggers.cs.mjs.map +1 -0
  49. package/dist/triggers.de.mjs +139 -0
  50. package/dist/triggers.de.mjs.map +1 -0
  51. package/dist/triggers.en.mjs +72 -0
  52. package/dist/triggers.en.mjs.map +1 -0
  53. package/dist/triggers.es.mjs +57 -0
  54. package/dist/triggers.es.mjs.map +1 -0
  55. package/dist/triggers.fr.mjs +76 -0
  56. package/dist/triggers.fr.mjs.map +1 -0
  57. package/dist/triggers.global.mjs +34 -0
  58. package/dist/triggers.global.mjs.map +1 -0
  59. package/dist/triggers.hu.mjs +41 -0
  60. package/dist/triggers.hu.mjs.map +1 -0
  61. package/dist/triggers.it.mjs +52 -0
  62. package/dist/triggers.it.mjs.map +1 -0
  63. package/dist/triggers.pl.mjs +84 -0
  64. package/dist/triggers.pl.mjs.map +1 -0
  65. package/dist/triggers.ro.mjs +59 -0
  66. package/dist/triggers.ro.mjs.map +1 -0
  67. package/dist/triggers.sk.mjs +62 -0
  68. package/dist/triggers.sk.mjs.map +1 -0
  69. package/dist/triggers.sv.mjs +58 -0
  70. package/dist/triggers.sv.mjs.map +1 -0
  71. package/dist/vite.mjs +4 -2
  72. package/dist/vite.mjs.map +1 -1
  73. package/dist/wasm.d.mts +75 -11
  74. package/dist/wasm.mjs +635 -180
  75. package/dist/wasm.mjs.map +1 -1
  76. package/dist/year-words.mjs +62 -0
  77. package/dist/year-words.mjs.map +1 -0
  78. package/package.json +1 -5
@@ -0,0 +1,113 @@
1
+ //#region src/data/names-surnames.json
2
+ var _comment = "Common surnames for person detection. Czech, Slovak, German, Austrian sources.";
3
+ var names = [
4
+ "Bartoš",
5
+ "Bauer",
6
+ "Becker",
7
+ "Beneš",
8
+ "Berger",
9
+ "Blaha",
10
+ "Braun",
11
+ "Brunner",
12
+ "Čermák",
13
+ "Černá",
14
+ "Černý",
15
+ "Doležal",
16
+ "Duda",
17
+ "Dvořák",
18
+ "Dvořáková",
19
+ "Fiala",
20
+ "Fischer",
21
+ "Fuchs",
22
+ "Gruber",
23
+ "Hájek",
24
+ "Hartmann",
25
+ "Hermann",
26
+ "Hofer",
27
+ "Hoffmann",
28
+ "Holub",
29
+ "Horák",
30
+ "Horáková",
31
+ "Hruška",
32
+ "Huber",
33
+ "Jelínek",
34
+ "Kadlec",
35
+ "Kaiser",
36
+ "Koch",
37
+ "Köhler",
38
+ "Kolář",
39
+ "Koller",
40
+ "Konečný",
41
+ "Kopecký",
42
+ "Král",
43
+ "Kratochvíl",
44
+ "Krejčí",
45
+ "Kříž",
46
+ "Krüger",
47
+ "Kubík",
48
+ "Kučera",
49
+ "Kučerová",
50
+ "Lang",
51
+ "Lehmann",
52
+ "Maier",
53
+ "Malý",
54
+ "Mareš",
55
+ "Mašek",
56
+ "Mayer",
57
+ "Meyer",
58
+ "Moser",
59
+ "Müller",
60
+ "Musil",
61
+ "Navrátil",
62
+ "Němcová",
63
+ "Němec",
64
+ "Neumann",
65
+ "Nguyen",
66
+ "Novák",
67
+ "Nováková",
68
+ "Novotná",
69
+ "Novotný",
70
+ "Pavlík",
71
+ "Pichler",
72
+ "Pokorný",
73
+ "Polák",
74
+ "Pospíšil",
75
+ "Procházka",
76
+ "Procházková",
77
+ "Richter",
78
+ "Růžička",
79
+ "Schmid",
80
+ "Schmidt",
81
+ "Schmitt",
82
+ "Schneider",
83
+ "Schröder",
84
+ "Schulz",
85
+ "Schwarz",
86
+ "Sedláček",
87
+ "Šimek",
88
+ "Šťastný",
89
+ "Steiner",
90
+ "Svoboda",
91
+ "Svobodová",
92
+ "Tichý",
93
+ "Urban",
94
+ "Vaněk",
95
+ "Veselá",
96
+ "Veselý",
97
+ "Vlček",
98
+ "Wagner",
99
+ "Weber",
100
+ "Werner",
101
+ "Winkler",
102
+ "Wolf",
103
+ "Zeman",
104
+ "Zimmermann"
105
+ ];
106
+ var names_surnames_default = {
107
+ _comment,
108
+ names
109
+ };
110
+ //#endregion
111
+ export { _comment, names_surnames_default as default, names };
112
+
113
+ //# sourceMappingURL=names-surnames.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"names-surnames.mjs","names":[],"sources":["../../src/data/names-surnames.json"],"sourcesContent":[""],"mappings":""}
@@ -0,0 +1,40 @@
1
+ //#region src/data/names-title-tokens.json
2
+ var _comment = "Lowercase title tokens that signal a person name follows. Used for token classification in the name chain detector.";
3
+ var tokens = [
4
+ "bc",
5
+ "dame",
6
+ "doc",
7
+ "dr",
8
+ "frau",
9
+ "herr",
10
+ "ing",
11
+ "judge",
12
+ "judr",
13
+ "justice",
14
+ "lady",
15
+ "lord",
16
+ "maître",
17
+ "mgr",
18
+ "miss",
19
+ "mlle",
20
+ "mme",
21
+ "mr",
22
+ "mrs",
23
+ "ms",
24
+ "mudr",
25
+ "mvdr",
26
+ "paeddr",
27
+ "phdr",
28
+ "prof",
29
+ "rndr",
30
+ "sir",
31
+ "thdr"
32
+ ];
33
+ var names_title_tokens_default = {
34
+ _comment,
35
+ tokens
36
+ };
37
+ //#endregion
38
+ export { _comment, names_title_tokens_default as default, tokens };
39
+
40
+ //# sourceMappingURL=names-title-tokens.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"names-title-tokens.mjs","names":[],"sources":["../../src/data/names-title-tokens.json"],"sourcesContent":[""],"mappings":""}
@@ -0,0 +1,69 @@
1
+ //#region src/data/person-stopwords.json
2
+ var person_stopwords_default = {
3
+ _comment: "Words that are valid in other labels (address, org) but should never be classified as person. Checked only in person chain scoring.",
4
+ words: [
5
+ "april",
6
+ "august",
7
+ "austria",
8
+ "austrian",
9
+ "basic",
10
+ "belgian",
11
+ "british",
12
+ "bulgarian",
13
+ "california",
14
+ "center",
15
+ "croatian",
16
+ "cypriot",
17
+ "czech",
18
+ "danish",
19
+ "december",
20
+ "delaware",
21
+ "dry",
22
+ "dutch",
23
+ "english",
24
+ "estonian",
25
+ "european",
26
+ "february",
27
+ "finnish",
28
+ "french",
29
+ "german",
30
+ "germany",
31
+ "greek",
32
+ "hungarian",
33
+ "indiana",
34
+ "irish",
35
+ "israel",
36
+ "italian",
37
+ "january",
38
+ "july",
39
+ "june",
40
+ "latvian",
41
+ "lithuanian",
42
+ "louisiana",
43
+ "luxembourgish",
44
+ "maltese",
45
+ "march",
46
+ "maryland",
47
+ "missouri",
48
+ "nevada",
49
+ "november",
50
+ "october",
51
+ "ohio",
52
+ "opportunity",
53
+ "page",
54
+ "polish",
55
+ "portuguese",
56
+ "romanian",
57
+ "sale",
58
+ "september",
59
+ "slovak",
60
+ "slovenian",
61
+ "spanish",
62
+ "swedish",
63
+ "university"
64
+ ]
65
+ };
66
+ //#endregion
67
+ export { person_stopwords_default as default };
68
+
69
+ //# sourceMappingURL=person-stopwords.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"person-stopwords.mjs","names":[],"sources":["../../src/data/person-stopwords.json"],"sourcesContent":[""],"mappings":""}
@@ -0,0 +1,52 @@
1
+ //#region src/data/section-headings.json
2
+ var _comment = "Section heading patterns that mark the end of the header zone. Multilingual: Czech, English, German, French, Italian, Spanish, Slovak, Polish. All patterns require a trailing numeral or roman numeral to avoid false-positives on body text. Each entry specifies its own regex flags; keyword-based patterns use 'iu' for case-insensitive Unicode matching, while the roman-numeral pattern stays case-sensitive to avoid matching lowercase list markers (i., ii.).";
3
+ var patterns = [
4
+ {
5
+ "re": "^\\s*(?:I\\.|1\\.)\\s",
6
+ "flags": ""
7
+ },
8
+ {
9
+ "re": "^\\s*(?:Článek|Čl\\.)\\s*\\d",
10
+ "flags": "iu"
11
+ },
12
+ {
13
+ "re": "^\\s*(?:Article|Art\\.)\\s*\\d",
14
+ "flags": "iu"
15
+ },
16
+ {
17
+ "re": "^\\s*§\\s*\\d",
18
+ "flags": ""
19
+ },
20
+ {
21
+ "re": "^\\s*(?:Abschnitt|Kapitel)\\s*\\d",
22
+ "flags": "iu"
23
+ },
24
+ {
25
+ "re": "^\\s*(?:Chapitre|Section)\\s*\\d",
26
+ "flags": "iu"
27
+ },
28
+ {
29
+ "re": "^\\s*(?:Capitolo|Sezione)\\s*\\d",
30
+ "flags": "iu"
31
+ },
32
+ {
33
+ "re": "^\\s*(?:Artículo|Sección)\\s*\\d",
34
+ "flags": "iu"
35
+ },
36
+ {
37
+ "re": "^\\s*(?:Článok|Čl\\.)\\s*\\d",
38
+ "flags": "iu"
39
+ },
40
+ {
41
+ "re": "^\\s*(?:Rozdział|Artykuł)\\s*\\d",
42
+ "flags": "iu"
43
+ }
44
+ ];
45
+ var section_headings_default = {
46
+ _comment,
47
+ patterns
48
+ };
49
+ //#endregion
50
+ export { _comment, section_headings_default as default, patterns };
51
+
52
+ //# sourceMappingURL=section-headings.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"section-headings.mjs","names":[],"sources":["../../src/data/section-headings.json"],"sourcesContent":[""],"mappings":""}
@@ -0,0 +1,78 @@
1
+ //#region src/data/signing-clauses.json
2
+ var _comment = "Signing clause patterns. Captures the place name from contract signing locations. Each entry: prefix (before place), suffix (after place), prepositions (allowed inside multi-word place names).";
3
+ var patterns = [
4
+ {
5
+ "lang": "cs",
6
+ "prefix": "(?:V|Ve)\\s+",
7
+ "suffix": "\\s*,?\\s*dne",
8
+ "prepositions": [
9
+ "nad",
10
+ "pod",
11
+ "u",
12
+ "ve",
13
+ "na"
14
+ ]
15
+ },
16
+ {
17
+ "lang": "sk",
18
+ "prefix": "(?:V|Vo)\\s+",
19
+ "suffix": "\\s*,?\\s*dňa",
20
+ "prepositions": [
21
+ "nad",
22
+ "pod",
23
+ "pri"
24
+ ]
25
+ },
26
+ {
27
+ "lang": "de",
28
+ "prefix": "",
29
+ "suffix": "\\s*,\\s*den",
30
+ "prepositions": [
31
+ "am",
32
+ "an",
33
+ "im"
34
+ ]
35
+ },
36
+ {
37
+ "lang": "fr",
38
+ "prefix": "(?:Fait\\s+)?[Àà]\\s+",
39
+ "suffix": "\\s*,?\\s*le",
40
+ "prepositions": []
41
+ },
42
+ {
43
+ "lang": "en",
44
+ "prefix": "(?:Signed|Executed)\\s+in\\s+",
45
+ "suffix": "",
46
+ "prepositions": []
47
+ },
48
+ {
49
+ "lang": "pl",
50
+ "prefix": "(?:W|We)\\s+",
51
+ "suffix": "\\s*,?\\s*dnia",
52
+ "prepositions": [
53
+ "nad",
54
+ "pod",
55
+ "przy"
56
+ ]
57
+ },
58
+ {
59
+ "lang": "it",
60
+ "prefix": "(?:Fatto\\s+)?[Aa]\\s+",
61
+ "suffix": "\\s*,?\\s*(?:il|lì)",
62
+ "prepositions": []
63
+ },
64
+ {
65
+ "lang": "es",
66
+ "prefix": "(?:Firmado\\s+)?[Ee]n\\s+",
67
+ "suffix": "\\s*,?\\s*(?:a|el)",
68
+ "prepositions": ["de", "del"]
69
+ }
70
+ ];
71
+ var signing_clauses_default = {
72
+ _comment,
73
+ patterns
74
+ };
75
+ //#endregion
76
+ export { _comment, signing_clauses_default as default, patterns };
77
+
78
+ //# sourceMappingURL=signing-clauses.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"signing-clauses.mjs","names":[],"sources":["../../src/data/signing-clauses.json"],"sourcesContent":[""],"mappings":""}