@stll/anonymize-wasm 1.0.8 → 1.1.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/dist/address-boundaries.mjs +85 -0
- package/dist/address-boundaries.mjs.map +1 -0
- package/dist/address-prepositions.mjs +182 -0
- package/dist/address-prepositions.mjs.map +1 -0
- package/dist/address-street-types.mjs +162 -0
- package/dist/address-street-types.mjs.map +1 -0
- package/dist/allow-list.mjs +183 -0
- package/dist/allow-list.mjs.map +1 -0
- package/dist/amount-words.mjs +42 -0
- package/dist/amount-words.mjs.map +1 -0
- package/dist/coreference.cs.mjs +14 -0
- package/dist/coreference.cs.mjs.map +1 -0
- package/dist/coreference.de.mjs +14 -0
- package/dist/coreference.de.mjs.map +1 -0
- package/dist/coreference.en.mjs +14 -0
- package/dist/coreference.en.mjs.map +1 -0
- package/dist/coreference.sk.mjs +10 -0
- package/dist/coreference.sk.mjs.map +1 -0
- package/dist/currencies.mjs +231 -0
- package/dist/currencies.mjs.map +1 -0
- package/dist/date-months.mjs +618 -0
- package/dist/date-months.mjs.map +1 -0
- package/dist/generic-roles.mjs +65 -0
- package/dist/generic-roles.mjs.map +1 -0
- package/dist/hotword-rules.mjs +145 -0
- package/dist/hotword-rules.mjs.map +1 -0
- package/dist/legal-forms.mjs +2112 -0
- package/dist/legal-forms.mjs.map +1 -0
- package/dist/manifest.mjs +56 -0
- package/dist/manifest.mjs.map +1 -0
- package/dist/names-exclusions.mjs +191 -0
- package/dist/names-exclusions.mjs.map +1 -0
- package/dist/names-first.mjs +418 -0
- package/dist/names-first.mjs.map +1 -0
- package/dist/names-surnames.mjs +113 -0
- package/dist/names-surnames.mjs.map +1 -0
- package/dist/names-title-tokens.mjs +40 -0
- package/dist/names-title-tokens.mjs.map +1 -0
- package/dist/person-stopwords.mjs +69 -0
- package/dist/person-stopwords.mjs.map +1 -0
- package/dist/section-headings.mjs +52 -0
- package/dist/section-headings.mjs.map +1 -0
- package/dist/signing-clauses.mjs +78 -0
- package/dist/signing-clauses.mjs.map +1 -0
- package/dist/stopwords.mjs +9915 -0
- package/dist/stopwords.mjs.map +1 -0
- package/dist/triggers.cs.mjs +465 -0
- package/dist/triggers.cs.mjs.map +1 -0
- package/dist/triggers.de.mjs +139 -0
- package/dist/triggers.de.mjs.map +1 -0
- package/dist/triggers.en.mjs +72 -0
- package/dist/triggers.en.mjs.map +1 -0
- package/dist/triggers.es.mjs +57 -0
- package/dist/triggers.es.mjs.map +1 -0
- package/dist/triggers.fr.mjs +76 -0
- package/dist/triggers.fr.mjs.map +1 -0
- package/dist/triggers.global.mjs +34 -0
- package/dist/triggers.global.mjs.map +1 -0
- package/dist/triggers.hu.mjs +41 -0
- package/dist/triggers.hu.mjs.map +1 -0
- package/dist/triggers.it.mjs +52 -0
- package/dist/triggers.it.mjs.map +1 -0
- package/dist/triggers.pl.mjs +84 -0
- package/dist/triggers.pl.mjs.map +1 -0
- package/dist/triggers.ro.mjs +59 -0
- package/dist/triggers.ro.mjs.map +1 -0
- package/dist/triggers.sk.mjs +62 -0
- package/dist/triggers.sk.mjs.map +1 -0
- package/dist/triggers.sv.mjs +58 -0
- package/dist/triggers.sv.mjs.map +1 -0
- package/dist/vite.mjs +4 -2
- package/dist/vite.mjs.map +1 -1
- package/dist/wasm.d.mts +75 -11
- package/dist/wasm.mjs +635 -180
- package/dist/wasm.mjs.map +1 -1
- package/dist/year-words.mjs +62 -0
- package/dist/year-words.mjs.map +1 -0
- package/package.json +1 -5
|
@@ -0,0 +1,113 @@
|
|
|
1
|
+
//#region src/data/names-surnames.json
|
|
2
|
+
var _comment = "Common surnames for person detection. Czech, Slovak, German, Austrian sources.";
|
|
3
|
+
var names = [
|
|
4
|
+
"Bartoš",
|
|
5
|
+
"Bauer",
|
|
6
|
+
"Becker",
|
|
7
|
+
"Beneš",
|
|
8
|
+
"Berger",
|
|
9
|
+
"Blaha",
|
|
10
|
+
"Braun",
|
|
11
|
+
"Brunner",
|
|
12
|
+
"Čermák",
|
|
13
|
+
"Černá",
|
|
14
|
+
"Černý",
|
|
15
|
+
"Doležal",
|
|
16
|
+
"Duda",
|
|
17
|
+
"Dvořák",
|
|
18
|
+
"Dvořáková",
|
|
19
|
+
"Fiala",
|
|
20
|
+
"Fischer",
|
|
21
|
+
"Fuchs",
|
|
22
|
+
"Gruber",
|
|
23
|
+
"Hájek",
|
|
24
|
+
"Hartmann",
|
|
25
|
+
"Hermann",
|
|
26
|
+
"Hofer",
|
|
27
|
+
"Hoffmann",
|
|
28
|
+
"Holub",
|
|
29
|
+
"Horák",
|
|
30
|
+
"Horáková",
|
|
31
|
+
"Hruška",
|
|
32
|
+
"Huber",
|
|
33
|
+
"Jelínek",
|
|
34
|
+
"Kadlec",
|
|
35
|
+
"Kaiser",
|
|
36
|
+
"Koch",
|
|
37
|
+
"Köhler",
|
|
38
|
+
"Kolář",
|
|
39
|
+
"Koller",
|
|
40
|
+
"Konečný",
|
|
41
|
+
"Kopecký",
|
|
42
|
+
"Král",
|
|
43
|
+
"Kratochvíl",
|
|
44
|
+
"Krejčí",
|
|
45
|
+
"Kříž",
|
|
46
|
+
"Krüger",
|
|
47
|
+
"Kubík",
|
|
48
|
+
"Kučera",
|
|
49
|
+
"Kučerová",
|
|
50
|
+
"Lang",
|
|
51
|
+
"Lehmann",
|
|
52
|
+
"Maier",
|
|
53
|
+
"Malý",
|
|
54
|
+
"Mareš",
|
|
55
|
+
"Mašek",
|
|
56
|
+
"Mayer",
|
|
57
|
+
"Meyer",
|
|
58
|
+
"Moser",
|
|
59
|
+
"Müller",
|
|
60
|
+
"Musil",
|
|
61
|
+
"Navrátil",
|
|
62
|
+
"Němcová",
|
|
63
|
+
"Němec",
|
|
64
|
+
"Neumann",
|
|
65
|
+
"Nguyen",
|
|
66
|
+
"Novák",
|
|
67
|
+
"Nováková",
|
|
68
|
+
"Novotná",
|
|
69
|
+
"Novotný",
|
|
70
|
+
"Pavlík",
|
|
71
|
+
"Pichler",
|
|
72
|
+
"Pokorný",
|
|
73
|
+
"Polák",
|
|
74
|
+
"Pospíšil",
|
|
75
|
+
"Procházka",
|
|
76
|
+
"Procházková",
|
|
77
|
+
"Richter",
|
|
78
|
+
"Růžička",
|
|
79
|
+
"Schmid",
|
|
80
|
+
"Schmidt",
|
|
81
|
+
"Schmitt",
|
|
82
|
+
"Schneider",
|
|
83
|
+
"Schröder",
|
|
84
|
+
"Schulz",
|
|
85
|
+
"Schwarz",
|
|
86
|
+
"Sedláček",
|
|
87
|
+
"Šimek",
|
|
88
|
+
"Šťastný",
|
|
89
|
+
"Steiner",
|
|
90
|
+
"Svoboda",
|
|
91
|
+
"Svobodová",
|
|
92
|
+
"Tichý",
|
|
93
|
+
"Urban",
|
|
94
|
+
"Vaněk",
|
|
95
|
+
"Veselá",
|
|
96
|
+
"Veselý",
|
|
97
|
+
"Vlček",
|
|
98
|
+
"Wagner",
|
|
99
|
+
"Weber",
|
|
100
|
+
"Werner",
|
|
101
|
+
"Winkler",
|
|
102
|
+
"Wolf",
|
|
103
|
+
"Zeman",
|
|
104
|
+
"Zimmermann"
|
|
105
|
+
];
|
|
106
|
+
var names_surnames_default = {
|
|
107
|
+
_comment,
|
|
108
|
+
names
|
|
109
|
+
};
|
|
110
|
+
//#endregion
|
|
111
|
+
export { _comment, names_surnames_default as default, names };
|
|
112
|
+
|
|
113
|
+
//# sourceMappingURL=names-surnames.mjs.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"names-surnames.mjs","names":[],"sources":["../../src/data/names-surnames.json"],"sourcesContent":[""],"mappings":""}
|
|
@@ -0,0 +1,40 @@
|
|
|
1
|
+
//#region src/data/names-title-tokens.json
|
|
2
|
+
var _comment = "Lowercase title tokens that signal a person name follows. Used for token classification in the name chain detector.";
|
|
3
|
+
var tokens = [
|
|
4
|
+
"bc",
|
|
5
|
+
"dame",
|
|
6
|
+
"doc",
|
|
7
|
+
"dr",
|
|
8
|
+
"frau",
|
|
9
|
+
"herr",
|
|
10
|
+
"ing",
|
|
11
|
+
"judge",
|
|
12
|
+
"judr",
|
|
13
|
+
"justice",
|
|
14
|
+
"lady",
|
|
15
|
+
"lord",
|
|
16
|
+
"maître",
|
|
17
|
+
"mgr",
|
|
18
|
+
"miss",
|
|
19
|
+
"mlle",
|
|
20
|
+
"mme",
|
|
21
|
+
"mr",
|
|
22
|
+
"mrs",
|
|
23
|
+
"ms",
|
|
24
|
+
"mudr",
|
|
25
|
+
"mvdr",
|
|
26
|
+
"paeddr",
|
|
27
|
+
"phdr",
|
|
28
|
+
"prof",
|
|
29
|
+
"rndr",
|
|
30
|
+
"sir",
|
|
31
|
+
"thdr"
|
|
32
|
+
];
|
|
33
|
+
var names_title_tokens_default = {
|
|
34
|
+
_comment,
|
|
35
|
+
tokens
|
|
36
|
+
};
|
|
37
|
+
//#endregion
|
|
38
|
+
export { _comment, names_title_tokens_default as default, tokens };
|
|
39
|
+
|
|
40
|
+
//# sourceMappingURL=names-title-tokens.mjs.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"names-title-tokens.mjs","names":[],"sources":["../../src/data/names-title-tokens.json"],"sourcesContent":[""],"mappings":""}
|
|
@@ -0,0 +1,69 @@
|
|
|
1
|
+
//#region src/data/person-stopwords.json
|
|
2
|
+
var person_stopwords_default = {
|
|
3
|
+
_comment: "Words that are valid in other labels (address, org) but should never be classified as person. Checked only in person chain scoring.",
|
|
4
|
+
words: [
|
|
5
|
+
"april",
|
|
6
|
+
"august",
|
|
7
|
+
"austria",
|
|
8
|
+
"austrian",
|
|
9
|
+
"basic",
|
|
10
|
+
"belgian",
|
|
11
|
+
"british",
|
|
12
|
+
"bulgarian",
|
|
13
|
+
"california",
|
|
14
|
+
"center",
|
|
15
|
+
"croatian",
|
|
16
|
+
"cypriot",
|
|
17
|
+
"czech",
|
|
18
|
+
"danish",
|
|
19
|
+
"december",
|
|
20
|
+
"delaware",
|
|
21
|
+
"dry",
|
|
22
|
+
"dutch",
|
|
23
|
+
"english",
|
|
24
|
+
"estonian",
|
|
25
|
+
"european",
|
|
26
|
+
"february",
|
|
27
|
+
"finnish",
|
|
28
|
+
"french",
|
|
29
|
+
"german",
|
|
30
|
+
"germany",
|
|
31
|
+
"greek",
|
|
32
|
+
"hungarian",
|
|
33
|
+
"indiana",
|
|
34
|
+
"irish",
|
|
35
|
+
"israel",
|
|
36
|
+
"italian",
|
|
37
|
+
"january",
|
|
38
|
+
"july",
|
|
39
|
+
"june",
|
|
40
|
+
"latvian",
|
|
41
|
+
"lithuanian",
|
|
42
|
+
"louisiana",
|
|
43
|
+
"luxembourgish",
|
|
44
|
+
"maltese",
|
|
45
|
+
"march",
|
|
46
|
+
"maryland",
|
|
47
|
+
"missouri",
|
|
48
|
+
"nevada",
|
|
49
|
+
"november",
|
|
50
|
+
"october",
|
|
51
|
+
"ohio",
|
|
52
|
+
"opportunity",
|
|
53
|
+
"page",
|
|
54
|
+
"polish",
|
|
55
|
+
"portuguese",
|
|
56
|
+
"romanian",
|
|
57
|
+
"sale",
|
|
58
|
+
"september",
|
|
59
|
+
"slovak",
|
|
60
|
+
"slovenian",
|
|
61
|
+
"spanish",
|
|
62
|
+
"swedish",
|
|
63
|
+
"university"
|
|
64
|
+
]
|
|
65
|
+
};
|
|
66
|
+
//#endregion
|
|
67
|
+
export { person_stopwords_default as default };
|
|
68
|
+
|
|
69
|
+
//# sourceMappingURL=person-stopwords.mjs.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"person-stopwords.mjs","names":[],"sources":["../../src/data/person-stopwords.json"],"sourcesContent":[""],"mappings":""}
|
|
@@ -0,0 +1,52 @@
|
|
|
1
|
+
//#region src/data/section-headings.json
|
|
2
|
+
var _comment = "Section heading patterns that mark the end of the header zone. Multilingual: Czech, English, German, French, Italian, Spanish, Slovak, Polish. All patterns require a trailing numeral or roman numeral to avoid false-positives on body text. Each entry specifies its own regex flags; keyword-based patterns use 'iu' for case-insensitive Unicode matching, while the roman-numeral pattern stays case-sensitive to avoid matching lowercase list markers (i., ii.).";
|
|
3
|
+
var patterns = [
|
|
4
|
+
{
|
|
5
|
+
"re": "^\\s*(?:I\\.|1\\.)\\s",
|
|
6
|
+
"flags": ""
|
|
7
|
+
},
|
|
8
|
+
{
|
|
9
|
+
"re": "^\\s*(?:Článek|Čl\\.)\\s*\\d",
|
|
10
|
+
"flags": "iu"
|
|
11
|
+
},
|
|
12
|
+
{
|
|
13
|
+
"re": "^\\s*(?:Article|Art\\.)\\s*\\d",
|
|
14
|
+
"flags": "iu"
|
|
15
|
+
},
|
|
16
|
+
{
|
|
17
|
+
"re": "^\\s*§\\s*\\d",
|
|
18
|
+
"flags": ""
|
|
19
|
+
},
|
|
20
|
+
{
|
|
21
|
+
"re": "^\\s*(?:Abschnitt|Kapitel)\\s*\\d",
|
|
22
|
+
"flags": "iu"
|
|
23
|
+
},
|
|
24
|
+
{
|
|
25
|
+
"re": "^\\s*(?:Chapitre|Section)\\s*\\d",
|
|
26
|
+
"flags": "iu"
|
|
27
|
+
},
|
|
28
|
+
{
|
|
29
|
+
"re": "^\\s*(?:Capitolo|Sezione)\\s*\\d",
|
|
30
|
+
"flags": "iu"
|
|
31
|
+
},
|
|
32
|
+
{
|
|
33
|
+
"re": "^\\s*(?:Artículo|Sección)\\s*\\d",
|
|
34
|
+
"flags": "iu"
|
|
35
|
+
},
|
|
36
|
+
{
|
|
37
|
+
"re": "^\\s*(?:Článok|Čl\\.)\\s*\\d",
|
|
38
|
+
"flags": "iu"
|
|
39
|
+
},
|
|
40
|
+
{
|
|
41
|
+
"re": "^\\s*(?:Rozdział|Artykuł)\\s*\\d",
|
|
42
|
+
"flags": "iu"
|
|
43
|
+
}
|
|
44
|
+
];
|
|
45
|
+
var section_headings_default = {
|
|
46
|
+
_comment,
|
|
47
|
+
patterns
|
|
48
|
+
};
|
|
49
|
+
//#endregion
|
|
50
|
+
export { _comment, section_headings_default as default, patterns };
|
|
51
|
+
|
|
52
|
+
//# sourceMappingURL=section-headings.mjs.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"section-headings.mjs","names":[],"sources":["../../src/data/section-headings.json"],"sourcesContent":[""],"mappings":""}
|
|
@@ -0,0 +1,78 @@
|
|
|
1
|
+
//#region src/data/signing-clauses.json
|
|
2
|
+
var _comment = "Signing clause patterns. Captures the place name from contract signing locations. Each entry: prefix (before place), suffix (after place), prepositions (allowed inside multi-word place names).";
|
|
3
|
+
var patterns = [
|
|
4
|
+
{
|
|
5
|
+
"lang": "cs",
|
|
6
|
+
"prefix": "(?:V|Ve)\\s+",
|
|
7
|
+
"suffix": "\\s*,?\\s*dne",
|
|
8
|
+
"prepositions": [
|
|
9
|
+
"nad",
|
|
10
|
+
"pod",
|
|
11
|
+
"u",
|
|
12
|
+
"ve",
|
|
13
|
+
"na"
|
|
14
|
+
]
|
|
15
|
+
},
|
|
16
|
+
{
|
|
17
|
+
"lang": "sk",
|
|
18
|
+
"prefix": "(?:V|Vo)\\s+",
|
|
19
|
+
"suffix": "\\s*,?\\s*dňa",
|
|
20
|
+
"prepositions": [
|
|
21
|
+
"nad",
|
|
22
|
+
"pod",
|
|
23
|
+
"pri"
|
|
24
|
+
]
|
|
25
|
+
},
|
|
26
|
+
{
|
|
27
|
+
"lang": "de",
|
|
28
|
+
"prefix": "",
|
|
29
|
+
"suffix": "\\s*,\\s*den",
|
|
30
|
+
"prepositions": [
|
|
31
|
+
"am",
|
|
32
|
+
"an",
|
|
33
|
+
"im"
|
|
34
|
+
]
|
|
35
|
+
},
|
|
36
|
+
{
|
|
37
|
+
"lang": "fr",
|
|
38
|
+
"prefix": "(?:Fait\\s+)?[Àà]\\s+",
|
|
39
|
+
"suffix": "\\s*,?\\s*le",
|
|
40
|
+
"prepositions": []
|
|
41
|
+
},
|
|
42
|
+
{
|
|
43
|
+
"lang": "en",
|
|
44
|
+
"prefix": "(?:Signed|Executed)\\s+in\\s+",
|
|
45
|
+
"suffix": "",
|
|
46
|
+
"prepositions": []
|
|
47
|
+
},
|
|
48
|
+
{
|
|
49
|
+
"lang": "pl",
|
|
50
|
+
"prefix": "(?:W|We)\\s+",
|
|
51
|
+
"suffix": "\\s*,?\\s*dnia",
|
|
52
|
+
"prepositions": [
|
|
53
|
+
"nad",
|
|
54
|
+
"pod",
|
|
55
|
+
"przy"
|
|
56
|
+
]
|
|
57
|
+
},
|
|
58
|
+
{
|
|
59
|
+
"lang": "it",
|
|
60
|
+
"prefix": "(?:Fatto\\s+)?[Aa]\\s+",
|
|
61
|
+
"suffix": "\\s*,?\\s*(?:il|lì)",
|
|
62
|
+
"prepositions": []
|
|
63
|
+
},
|
|
64
|
+
{
|
|
65
|
+
"lang": "es",
|
|
66
|
+
"prefix": "(?:Firmado\\s+)?[Ee]n\\s+",
|
|
67
|
+
"suffix": "\\s*,?\\s*(?:a|el)",
|
|
68
|
+
"prepositions": ["de", "del"]
|
|
69
|
+
}
|
|
70
|
+
];
|
|
71
|
+
var signing_clauses_default = {
|
|
72
|
+
_comment,
|
|
73
|
+
patterns
|
|
74
|
+
};
|
|
75
|
+
//#endregion
|
|
76
|
+
export { _comment, signing_clauses_default as default, patterns };
|
|
77
|
+
|
|
78
|
+
//# sourceMappingURL=signing-clauses.mjs.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"signing-clauses.mjs","names":[],"sources":["../../src/data/signing-clauses.json"],"sourcesContent":[""],"mappings":""}
|