rigour 2.2.2__tar.gz → 2.2.3__tar.gz
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- {rigour-2.2.2 → rigour-2.2.3}/PKG-INFO +1 -1
- {rigour-2.2.2 → rigour-2.2.3}/pyproject.toml +1 -1
- {rigour-2.2.2 → rigour-2.2.3}/rigour/_core.pyi +2 -1
- {rigour-2.2.2 → rigour-2.2.3}/rigour/data/langs/iso639.py +451 -6
- {rigour-2.2.2 → rigour-2.2.3}/rigour/env.py +6 -2
- {rigour-2.2.2 → rigour-2.2.3}/rigour/langs/__init__.py +22 -8
- {rigour-2.2.2 → rigour-2.2.3}/rigour/langs/synonyms.py +4 -4
- {rigour-2.2.2 → rigour-2.2.3}/rust/Cargo.lock +1 -1
- {rigour-2.2.2 → rigour-2.2.3}/rust/Cargo.toml +1 -1
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/lib.rs +4 -8
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/compare.rs +24 -3
- rigour-2.2.3/rust/src/names/constants.rs +23 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/mod.rs +1 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/ordering.rs +18 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/pairing.rs +1 -5
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/part.rs +19 -6
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/pick.rs +6 -1
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/text/numbers.rs +3 -2
- {rigour-2.2.2 → rigour-2.2.3}/LICENSE +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/README.md +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/__init__.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/addresses/__init__.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/addresses/cleaning.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/addresses/format.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/addresses/normalize.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/boolean.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/data/__init__.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/data/addresses/__init__.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/data/addresses/data.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/data/addresses/formats.yml +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/data/langs/__init__.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/dates.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/ids/__init__.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/ids/common.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/ids/imo.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/ids/npi.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/ids/ogrn.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/ids/stdnum_.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/ids/strict.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/ids/uei.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/ids/wikidata.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/langs/text.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/langs/util.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/mime/__init__.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/mime/filename.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/mime/mappings.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/mime/mime.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/mime/parse.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/mime/types.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/__init__.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/analyze.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/check.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/compare.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/name.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/ordering.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/org_types.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/part.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/pick.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/prefix.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/split_phrases.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/symbol.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/tag.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/names/tokenize.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/py.typed +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/reset.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/territories/__init__.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/territories/lookup.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/territories/match.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/territories/territory.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/territories/util.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/text/__init__.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/text/checksum.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/text/cleaning.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/text/distance.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/text/normalize.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/text/phonetics.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/text/scripts.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/text/stopwords.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/text/translit.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/time.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/units.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/urls/__init__.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/urls/cleaning.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/urls/compare.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/urls/util.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rigour/util.py +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/build.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/data/names/compare.json +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/data/names/org_types.json +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/data/names/person_names.txt +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/data/names/stopwords.json +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/data/names/symbols.json +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/data/territories/data.jsonl +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/data/text/ordinals.json +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/data/text/stopwords.json +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/constants.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/generated/.gitkeep +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/alignment.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/analyze.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/matcher.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/name.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/org_types.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/person_names.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/prefix.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/stopwords.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/symbol.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/symbols.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/tag.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/names/tagger.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/territories.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/text/distance.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/text/mod.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/text/normalize.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/text/ordinals.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/text/phonetics.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/text/scripts.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/text/stopwords.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/text/tokenize.rs +0 -0
- {rigour-2.2.2 → rigour-2.2.3}/rust/src/text/translit.rs +0 -0
|
@@ -7,7 +7,6 @@ def should_ascii(text: str) -> bool: ...
|
|
|
7
7
|
def maybe_ascii(text: str, drop: bool = False) -> str: ...
|
|
8
8
|
def tokenize_name(text: str, token_min_length: int = 1) -> list[str]: ...
|
|
9
9
|
def _normalize(text: str, flags: int, cleanup: int) -> str | None: ...
|
|
10
|
-
def string_number(text: str) -> float | None: ...
|
|
11
10
|
def raw_levenshtein(a: str, b: str) -> int: ...
|
|
12
11
|
def raw_levenshtein_cutoff(a: str, b: str, cutoff: int) -> int: ...
|
|
13
12
|
def raw_jaro(a: str, b: str) -> float: ...
|
|
@@ -36,6 +35,8 @@ def generic_person_names_list() -> list[str]: ...
|
|
|
36
35
|
def ordinals_dict() -> dict[int, list[str]]: ...
|
|
37
36
|
def territories_jsonl() -> str: ...
|
|
38
37
|
|
|
38
|
+
MAX_NAME_LENGTH: int
|
|
39
|
+
|
|
39
40
|
|
|
40
41
|
class SymbolCategory:
|
|
41
42
|
"""Sealed enum of symbol categories. See
|
|
@@ -11974,7 +11974,7 @@ ISO3_MAP: Dict[str, str] = {
|
|
|
11974
11974
|
"ombamba": "mbm",
|
|
11975
11975
|
"macaguán": "mbn",
|
|
11976
11976
|
"mbo (cameroon)": "mbo",
|
|
11977
|
-
"malayo": "
|
|
11977
|
+
"malayo": "msa",
|
|
11978
11978
|
"maisin": "mbq",
|
|
11979
11979
|
"nukak makú": "mbr",
|
|
11980
11980
|
"sarangani manobo": "mbs",
|
|
@@ -12106,7 +12106,7 @@ ISO3_MAP: Dict[str, str] = {
|
|
|
12106
12106
|
"malila": "mgq",
|
|
12107
12107
|
"mambwe-lungu": "mgr",
|
|
12108
12108
|
"manda (tanzania)": "mgs",
|
|
12109
|
-
"mongol": "
|
|
12109
|
+
"mongol": "mon",
|
|
12110
12110
|
"mailu": "mgu",
|
|
12111
12111
|
"matengo": "mgv",
|
|
12112
12112
|
"matumbi": "mgw",
|
|
@@ -12925,7 +12925,7 @@ ISO3_MAP: Dict[str, str] = {
|
|
|
12925
12925
|
"nooksack": "nok",
|
|
12926
12926
|
"nomlaki": "nol",
|
|
12927
12927
|
"nocamán": "nom",
|
|
12928
|
-
"non": "
|
|
12928
|
+
"non": "non",
|
|
12929
12929
|
"old norse": "non",
|
|
12930
12930
|
"numanggang": "nop",
|
|
12931
12931
|
"ngongo": "noq",
|
|
@@ -16190,102 +16190,547 @@ ISO3_MAP: Dict[str, str] = {
|
|
|
16190
16190
|
"zza": "zza",
|
|
16191
16191
|
"zaza": "zza",
|
|
16192
16192
|
"zuojiang zhuang": "zzj",
|
|
16193
|
+
"африкаанс": "afr",
|
|
16194
|
+
"afrikáans": "afr",
|
|
16195
|
+
"الأفريقانية": "afr",
|
|
16196
|
+
"阿非利卡语": "afr",
|
|
16197
|
+
"አማርኛ": "amh",
|
|
16198
|
+
"амхарский язык": "amh",
|
|
16199
|
+
"amharique": "amh",
|
|
16200
|
+
"amhárico": "amh",
|
|
16201
|
+
"амхарська мова": "amh",
|
|
16202
|
+
"الأمهرية": "amh",
|
|
16203
|
+
"阿姆哈拉语": "amh",
|
|
16193
16204
|
"العربية": "ara",
|
|
16194
16205
|
"arb": "ara",
|
|
16195
16206
|
"arz": "ara",
|
|
16196
16207
|
"apc": "ara",
|
|
16197
16208
|
"acm": "ara",
|
|
16209
|
+
"арабский язык": "ara",
|
|
16210
|
+
"arabe": "ara",
|
|
16211
|
+
"árabe": "ara",
|
|
16212
|
+
"арабська мова": "ara",
|
|
16213
|
+
"阿拉伯语": "ara",
|
|
16198
16214
|
"azərbaycan": "aze",
|
|
16199
16215
|
"azeri": "aze",
|
|
16200
16216
|
"aze_cyrl": "aze",
|
|
16217
|
+
"азербайджанский язык": "aze",
|
|
16218
|
+
"azéri": "aze",
|
|
16219
|
+
"azerí": "aze",
|
|
16220
|
+
"азербайджанська мова": "aze",
|
|
16221
|
+
"الأذرية": "aze",
|
|
16222
|
+
"阿塞拜疆语": "aze",
|
|
16201
16223
|
"belarussian": "bel",
|
|
16224
|
+
"белорусский язык": "bel",
|
|
16225
|
+
"biélorusse": "bel",
|
|
16226
|
+
"bielorruso": "bel",
|
|
16227
|
+
"білоруська мова": "bel",
|
|
16228
|
+
"البيلاروسية": "bel",
|
|
16229
|
+
"白俄罗斯语": "bel",
|
|
16230
|
+
"byelorussian": "bel",
|
|
16231
|
+
"belorussian": "bel",
|
|
16202
16232
|
"বাংলা": "ben",
|
|
16233
|
+
"бенгальский язык": "ben",
|
|
16234
|
+
"bengalí": "ben",
|
|
16235
|
+
"бенгальська мова": "ben",
|
|
16236
|
+
"البنغالية": "ben",
|
|
16237
|
+
"孟加拉语": "ben",
|
|
16203
16238
|
"bosanski": "bos",
|
|
16239
|
+
"боснийский язык": "bos",
|
|
16240
|
+
"bosnien": "bos",
|
|
16241
|
+
"bosnio": "bos",
|
|
16242
|
+
"боснійська мова": "bos",
|
|
16243
|
+
"البوسنية": "bos",
|
|
16244
|
+
"波斯尼亚语": "bos",
|
|
16204
16245
|
"български": "bul",
|
|
16246
|
+
"болгарский язык": "bul",
|
|
16247
|
+
"bulgare": "bul",
|
|
16248
|
+
"búlgaro": "bul",
|
|
16249
|
+
"болгарська мова": "bul",
|
|
16250
|
+
"البلغارية": "bul",
|
|
16251
|
+
"保加利亞語": "bul",
|
|
16205
16252
|
"català": "cat",
|
|
16253
|
+
"каталанский язык": "cat",
|
|
16254
|
+
"catalán": "cat",
|
|
16255
|
+
"каталанська мова": "cat",
|
|
16256
|
+
"الكتالونية": "cat",
|
|
16257
|
+
"加泰罗尼亚语": "cat",
|
|
16206
16258
|
"čeština": "ces",
|
|
16259
|
+
"чешский язык": "ces",
|
|
16260
|
+
"tchèque": "ces",
|
|
16261
|
+
"checo": "ces",
|
|
16262
|
+
"чеська мова": "ces",
|
|
16263
|
+
"التشيكية": "ces",
|
|
16264
|
+
"捷克語": "ces",
|
|
16207
16265
|
"crnogorski": "cnr",
|
|
16266
|
+
"черногорский язык": "cnr",
|
|
16267
|
+
"monténégrin": "cnr",
|
|
16268
|
+
"montenegrino": "cnr",
|
|
16269
|
+
"чорногорська мова": "cnr",
|
|
16270
|
+
"المونتنغرية": "cnr",
|
|
16271
|
+
"蒙特內哥羅語": "cnr",
|
|
16208
16272
|
"dansk": "dan",
|
|
16273
|
+
"датский язык": "dan",
|
|
16274
|
+
"danois": "dan",
|
|
16275
|
+
"danés": "dan",
|
|
16276
|
+
"данська мова": "dan",
|
|
16277
|
+
"الدنماركية": "dan",
|
|
16278
|
+
"丹麦语": "dan",
|
|
16209
16279
|
"deutsch": "deu",
|
|
16280
|
+
"немецкий язык": "deu",
|
|
16281
|
+
"allemand": "deu",
|
|
16282
|
+
"alemán": "deu",
|
|
16283
|
+
"німецька мова": "deu",
|
|
16284
|
+
"الألمانية": "deu",
|
|
16285
|
+
"德语": "deu",
|
|
16210
16286
|
"greek": "ell",
|
|
16211
16287
|
"ελληνικά": "ell",
|
|
16288
|
+
"новогреческий язык": "ell",
|
|
16289
|
+
"grec moderne": "ell",
|
|
16290
|
+
"griego": "ell",
|
|
16291
|
+
"новогрецька мова": "ell",
|
|
16292
|
+
"اليونانية الحديثة": "ell",
|
|
16293
|
+
"现代希腊语": "ell",
|
|
16212
16294
|
"englisch": "eng",
|
|
16213
16295
|
"anglais": "eng",
|
|
16296
|
+
"английский язык": "eng",
|
|
16297
|
+
"inglés": "eng",
|
|
16298
|
+
"англійська мова": "eng",
|
|
16299
|
+
"الإنجليزية": "eng",
|
|
16300
|
+
"英語": "eng",
|
|
16301
|
+
"eesti": "est",
|
|
16302
|
+
"eesti keel": "est",
|
|
16303
|
+
"эстонский язык": "est",
|
|
16304
|
+
"estonien": "est",
|
|
16305
|
+
"estonio": "est",
|
|
16306
|
+
"естонська мова": "est",
|
|
16307
|
+
"الإستونية": "est",
|
|
16308
|
+
"愛沙尼亞語": "est",
|
|
16214
16309
|
"iranian": "fas",
|
|
16215
16310
|
"فارسی": "fas",
|
|
16216
16311
|
"farsi": "fas",
|
|
16312
|
+
"персидский язык": "fas",
|
|
16313
|
+
"persan": "fas",
|
|
16314
|
+
"persa": "fas",
|
|
16315
|
+
"перська мова": "fas",
|
|
16316
|
+
"الفارسية": "fas",
|
|
16317
|
+
"波斯語": "fas",
|
|
16217
16318
|
"suomi": "fin",
|
|
16319
|
+
"финский язык": "fin",
|
|
16320
|
+
"finnois": "fin",
|
|
16321
|
+
"finés": "fin",
|
|
16322
|
+
"фінська мова": "fin",
|
|
16323
|
+
"الفنلندية": "fin",
|
|
16324
|
+
"芬兰语": "fin",
|
|
16218
16325
|
"pilipino": "fil",
|
|
16326
|
+
"филиппинский язык": "fil",
|
|
16327
|
+
"philippin": "fil",
|
|
16328
|
+
"idioma filipino": "fil",
|
|
16329
|
+
"філіппінська": "fil",
|
|
16330
|
+
"الفلبينية": "fil",
|
|
16331
|
+
"菲律賓語": "fil",
|
|
16219
16332
|
"französisch": "fra",
|
|
16220
16333
|
"français": "fra",
|
|
16334
|
+
"французский язык": "fra",
|
|
16335
|
+
"francés": "fra",
|
|
16336
|
+
"французька мова": "fra",
|
|
16337
|
+
"الفرنسية": "fra",
|
|
16338
|
+
"法语": "fra",
|
|
16339
|
+
"gaeilge": "gle",
|
|
16340
|
+
"ирландский язык": "gle",
|
|
16341
|
+
"irlandais": "gle",
|
|
16342
|
+
"irlandés": "gle",
|
|
16343
|
+
"ірландська мова": "gle",
|
|
16344
|
+
"الأيرلندية": "gle",
|
|
16345
|
+
"爱尔兰语": "gle",
|
|
16221
16346
|
"ગુજરાતી": "guj",
|
|
16222
16347
|
"עברית": "heb",
|
|
16223
16348
|
"iw": "heb",
|
|
16349
|
+
"иврит": "heb",
|
|
16350
|
+
"hébreu": "heb",
|
|
16351
|
+
"hebreo": "heb",
|
|
16352
|
+
"іврит": "heb",
|
|
16353
|
+
"العبرية الحديثة": "heb",
|
|
16354
|
+
"現代希伯來語": "heb",
|
|
16224
16355
|
"हिंदी": "hin",
|
|
16356
|
+
"хинди": "hin",
|
|
16357
|
+
"гінді": "hin",
|
|
16358
|
+
"الهندية": "hin",
|
|
16359
|
+
"印地語": "hin",
|
|
16225
16360
|
"hrvatski": "hrv",
|
|
16226
16361
|
"cro": "hrv",
|
|
16227
16362
|
"scr": "hrv",
|
|
16363
|
+
"хорватский язык": "hrv",
|
|
16364
|
+
"croate": "hrv",
|
|
16365
|
+
"croata": "hrv",
|
|
16366
|
+
"хорватська мова": "hrv",
|
|
16367
|
+
"الكرواتية": "hrv",
|
|
16368
|
+
"克罗地亚语": "hrv",
|
|
16228
16369
|
"magyar": "hun",
|
|
16370
|
+
"венгерский язык": "hun",
|
|
16371
|
+
"hongrois": "hun",
|
|
16372
|
+
"húngaro": "hun",
|
|
16373
|
+
"угорська мова": "hun",
|
|
16374
|
+
"المجرية": "hun",
|
|
16375
|
+
"匈牙利語": "hun",
|
|
16229
16376
|
"հայերեն": "hye",
|
|
16377
|
+
"армянский язык": "hye",
|
|
16378
|
+
"arménien": "hye",
|
|
16379
|
+
"armenio": "hye",
|
|
16380
|
+
"вірменська мова": "hye",
|
|
16381
|
+
"الأرمنية": "hye",
|
|
16382
|
+
"亞美尼亞語": "hye",
|
|
16230
16383
|
"bahasa indonesia": "ind",
|
|
16231
16384
|
"in": "ind",
|
|
16385
|
+
"индонезийский язык": "ind",
|
|
16386
|
+
"indonésien": "ind",
|
|
16387
|
+
"indonesio": "ind",
|
|
16388
|
+
"індонезійська мова": "ind",
|
|
16389
|
+
"الإندونيسية": "ind",
|
|
16390
|
+
"印尼語": "ind",
|
|
16232
16391
|
"íslenska": "isl",
|
|
16392
|
+
"исландский язык": "isl",
|
|
16393
|
+
"islandais": "isl",
|
|
16394
|
+
"islandés": "isl",
|
|
16395
|
+
"ісландська мова": "isl",
|
|
16396
|
+
"الآيسلندية": "isl",
|
|
16397
|
+
"冰島語": "isl",
|
|
16233
16398
|
"italiano": "ita",
|
|
16399
|
+
"итальянский язык": "ita",
|
|
16400
|
+
"italien": "ita",
|
|
16401
|
+
"італійська мова": "ita",
|
|
16402
|
+
"الإيطالية": "ita",
|
|
16403
|
+
"意大利語": "ita",
|
|
16234
16404
|
"jawa": "jav",
|
|
16235
16405
|
"jw": "jav",
|
|
16236
16406
|
"jaw": "jav",
|
|
16237
16407
|
"日本語": "jpn",
|
|
16408
|
+
"японский язык": "jpn",
|
|
16409
|
+
"japonais": "jpn",
|
|
16410
|
+
"japonés": "jpn",
|
|
16411
|
+
"японська мова": "jpn",
|
|
16412
|
+
"اليابانية": "jpn",
|
|
16413
|
+
"日語": "jpn",
|
|
16414
|
+
"ಕನ್ನಡ": "kan",
|
|
16415
|
+
"каннада": "kan",
|
|
16416
|
+
"kannara": "kan",
|
|
16417
|
+
"canarés": "kan",
|
|
16418
|
+
"الكنادية": "kan",
|
|
16419
|
+
"卡纳达语": "kan",
|
|
16238
16420
|
"ქართული": "kat",
|
|
16421
|
+
"грузинский язык": "kat",
|
|
16422
|
+
"géorgien": "kat",
|
|
16423
|
+
"georgiano": "kat",
|
|
16424
|
+
"грузинська мова": "kat",
|
|
16425
|
+
"الجورجية": "kat",
|
|
16426
|
+
"格鲁吉亚语": "kat",
|
|
16239
16427
|
"қазақша": "kaz",
|
|
16240
16428
|
"qazaq": "kaz",
|
|
16429
|
+
"казахский язык": "kaz",
|
|
16430
|
+
"kazajo": "kaz",
|
|
16431
|
+
"казахська мова": "kaz",
|
|
16432
|
+
"القزاقية": "kaz",
|
|
16433
|
+
"哈薩克語": "kaz",
|
|
16434
|
+
"central khmer": "khm",
|
|
16241
16435
|
"ខ្មែរ": "khm",
|
|
16436
|
+
"кхмерский язык": "khm",
|
|
16437
|
+
"camboyano": "khm",
|
|
16438
|
+
"кхмерська мова": "khm",
|
|
16439
|
+
"الخميرية": "khm",
|
|
16440
|
+
"高棉语": "khm",
|
|
16441
|
+
"cambodian": "khm",
|
|
16242
16442
|
"kirghiz; kyrgyz": "kir",
|
|
16243
16443
|
"kyrgyz": "kir",
|
|
16444
|
+
"киргизский язык": "kir",
|
|
16445
|
+
"kirghize": "kir",
|
|
16446
|
+
"kirguís": "kir",
|
|
16447
|
+
"киргизька мова": "kir",
|
|
16448
|
+
"القرغيزية": "kir",
|
|
16449
|
+
"柯尔克孜语": "kir",
|
|
16244
16450
|
"한국어": "kor",
|
|
16451
|
+
"корейский язык": "kor",
|
|
16452
|
+
"coréen": "kor",
|
|
16453
|
+
"coreano": "kor",
|
|
16454
|
+
"корейська мова": "kor",
|
|
16455
|
+
"الكورية": "kor",
|
|
16456
|
+
"朝鮮語": "kor",
|
|
16245
16457
|
"ລາວ": "lao",
|
|
16458
|
+
"лаосский язык": "lao",
|
|
16459
|
+
"лаоська мова": "lao",
|
|
16460
|
+
"لاو": "lao",
|
|
16461
|
+
"老挝语": "lao",
|
|
16462
|
+
"latviešu": "lav",
|
|
16463
|
+
"latviešu valoda": "lav",
|
|
16464
|
+
"латышский язык": "lav",
|
|
16465
|
+
"letton": "lav",
|
|
16466
|
+
"letón": "lav",
|
|
16467
|
+
"латиська мова": "lav",
|
|
16468
|
+
"اللاتفية": "lav",
|
|
16469
|
+
"拉脫維亞語": "lav",
|
|
16470
|
+
"lietuvių": "lit",
|
|
16471
|
+
"lietuvių kalba": "lit",
|
|
16472
|
+
"литовский язык": "lit",
|
|
16473
|
+
"lituanien": "lit",
|
|
16474
|
+
"lituano": "lit",
|
|
16475
|
+
"литовська мова": "lit",
|
|
16476
|
+
"اللتوانية": "lit",
|
|
16477
|
+
"立陶宛語": "lit",
|
|
16478
|
+
"lëtzebuergesch": "ltz",
|
|
16479
|
+
"люксембургский язык": "ltz",
|
|
16480
|
+
"luxembourgeois": "ltz",
|
|
16481
|
+
"luxemburgués": "ltz",
|
|
16482
|
+
"люксембурзька мова": "ltz",
|
|
16483
|
+
"اللوكسمبورغية": "ltz",
|
|
16484
|
+
"卢森堡语": "ltz",
|
|
16246
16485
|
"മലയാളം": "mal",
|
|
16247
16486
|
"मराठी": "mar",
|
|
16248
16487
|
"македонски": "mkd",
|
|
16488
|
+
"македонский язык": "mkd",
|
|
16489
|
+
"macédonien": "mkd",
|
|
16490
|
+
"macedonio": "mkd",
|
|
16491
|
+
"македонська мова": "mkd",
|
|
16492
|
+
"المقدونية": "mkd",
|
|
16493
|
+
"马其顿语": "mkd",
|
|
16494
|
+
"malti": "mlt",
|
|
16495
|
+
"мальтийский язык": "mlt",
|
|
16496
|
+
"maltais": "mlt",
|
|
16497
|
+
"maltés": "mlt",
|
|
16498
|
+
"мальтійська мова": "mlt",
|
|
16499
|
+
"المالطية": "mlt",
|
|
16500
|
+
"马耳他语": "mlt",
|
|
16501
|
+
"монгол хэл": "mon",
|
|
16502
|
+
"монгольский язык": "mon",
|
|
16503
|
+
"монгольська мова": "mon",
|
|
16504
|
+
"المغولية": "mon",
|
|
16505
|
+
"蒙古语": "mon",
|
|
16249
16506
|
"malay": "msa",
|
|
16250
16507
|
"bahasa melayu": "msa",
|
|
16508
|
+
"малайский язык": "msa",
|
|
16509
|
+
"malais": "msa",
|
|
16510
|
+
"малайська мова": "msa",
|
|
16511
|
+
"الملايوية": "msa",
|
|
16512
|
+
"马来语": "msa",
|
|
16251
16513
|
"မြန်မာ": "mya",
|
|
16514
|
+
"бирманский язык": "mya",
|
|
16515
|
+
"birman": "mya",
|
|
16516
|
+
"idioma birmano": "mya",
|
|
16517
|
+
"бірманська мова": "mya",
|
|
16518
|
+
"البورمية": "mya",
|
|
16519
|
+
"缅甸语": "mya",
|
|
16520
|
+
"nepali": "nep",
|
|
16521
|
+
"nepalese": "nep",
|
|
16522
|
+
"नेपाली": "nep",
|
|
16523
|
+
"npi": "nep",
|
|
16524
|
+
"непальский язык": "nep",
|
|
16525
|
+
"népalais": "nep",
|
|
16526
|
+
"nepalí": "nep",
|
|
16527
|
+
"непальська мова": "nep",
|
|
16528
|
+
"النيبالية": "nep",
|
|
16529
|
+
"尼泊尔语": "nep",
|
|
16252
16530
|
"nederlands": "nld",
|
|
16531
|
+
"нидерландский язык": "nld",
|
|
16532
|
+
"néerlandais": "nld",
|
|
16533
|
+
"neerlandés": "nld",
|
|
16534
|
+
"нідерландська мова": "nld",
|
|
16535
|
+
"الهولندية": "nld",
|
|
16536
|
+
"荷蘭語": "nld",
|
|
16537
|
+
"flemish": "nld",
|
|
16253
16538
|
"norsk": "nor",
|
|
16254
|
-
"
|
|
16255
|
-
"
|
|
16256
|
-
"
|
|
16539
|
+
"норвежский язык": "nor",
|
|
16540
|
+
"norvégien": "nor",
|
|
16541
|
+
"noruego": "nor",
|
|
16542
|
+
"норвезька мова": "nor",
|
|
16543
|
+
"النرويجية": "nor",
|
|
16544
|
+
"挪威語": "nor",
|
|
16545
|
+
"bokmål": "nor",
|
|
16546
|
+
"bokmal": "nor",
|
|
16257
16547
|
"punjabi": "pan",
|
|
16258
16548
|
"ਪੰਜਾਬੀ": "pan",
|
|
16259
16549
|
"polski": "pol",
|
|
16550
|
+
"польский язык": "pol",
|
|
16551
|
+
"polonais": "pol",
|
|
16552
|
+
"polaco": "pol",
|
|
16553
|
+
"польська мова": "pol",
|
|
16554
|
+
"البولندية": "pol",
|
|
16555
|
+
"波蘭語": "pol",
|
|
16260
16556
|
"português": "por",
|
|
16557
|
+
"португальский язык": "por",
|
|
16558
|
+
"portugais": "por",
|
|
16559
|
+
"portugués": "por",
|
|
16560
|
+
"португальська мова": "por",
|
|
16561
|
+
"البرتغالية": "por",
|
|
16562
|
+
"葡萄牙语": "por",
|
|
16563
|
+
"pashto": "pus",
|
|
16564
|
+
"pashtu": "pus",
|
|
16565
|
+
"پښتو": "pus",
|
|
16566
|
+
"пушту": "pus",
|
|
16567
|
+
"pachto": "pus",
|
|
16568
|
+
"pastún": "pus",
|
|
16569
|
+
"البشتوية": "pus",
|
|
16570
|
+
"普什圖語": "pus",
|
|
16571
|
+
"pushtu": "pus",
|
|
16261
16572
|
"română": "ron",
|
|
16262
16573
|
"moldavian": "ron",
|
|
16263
16574
|
"moldovan": "ron",
|
|
16264
16575
|
"mo": "ron",
|
|
16265
16576
|
"mol": "ron",
|
|
16266
16577
|
"romanian; moldavian; moldovan": "ron",
|
|
16578
|
+
"румынский язык": "ron",
|
|
16579
|
+
"roumain": "ron",
|
|
16580
|
+
"rumano": "ron",
|
|
16581
|
+
"румунська мова": "ron",
|
|
16582
|
+
"الرومانية": "ron",
|
|
16583
|
+
"羅馬尼亞語": "ron",
|
|
16267
16584
|
"русский": "rus",
|
|
16585
|
+
"русский язык": "rus",
|
|
16586
|
+
"russe": "rus",
|
|
16587
|
+
"ruso": "rus",
|
|
16588
|
+
"російська мова": "rus",
|
|
16589
|
+
"الروسية": "rus",
|
|
16590
|
+
"俄語": "rus",
|
|
16268
16591
|
"සිංහල": "sin",
|
|
16592
|
+
"сингальский язык": "sin",
|
|
16593
|
+
"singhalais": "sin",
|
|
16594
|
+
"cingalés": "sin",
|
|
16595
|
+
"сингальська мова": "sin",
|
|
16596
|
+
"السنهالية": "sin",
|
|
16597
|
+
"僧伽罗语": "sin",
|
|
16269
16598
|
"slovenčina": "slk",
|
|
16599
|
+
"словацкий язык": "slk",
|
|
16600
|
+
"slovaque": "slk",
|
|
16601
|
+
"eslovaco": "slk",
|
|
16602
|
+
"словацька мова": "slk",
|
|
16603
|
+
"السلوفاكية": "slk",
|
|
16604
|
+
"斯洛伐克語": "slk",
|
|
16605
|
+
"slovene": "slv",
|
|
16606
|
+
"slovenščina": "slv",
|
|
16607
|
+
"словенский язык": "slv",
|
|
16608
|
+
"slovène": "slv",
|
|
16609
|
+
"esloveno": "slv",
|
|
16610
|
+
"словенська мова": "slv",
|
|
16611
|
+
"السلوفينية": "slv",
|
|
16612
|
+
"斯洛文尼亚语": "slv",
|
|
16270
16613
|
"español": "spa",
|
|
16614
|
+
"испанский язык": "spa",
|
|
16615
|
+
"espagnol": "spa",
|
|
16616
|
+
"іспанська мова": "spa",
|
|
16617
|
+
"الإسبانية": "spa",
|
|
16618
|
+
"西班牙語": "spa",
|
|
16619
|
+
"castilian": "spa",
|
|
16271
16620
|
"shqip": "sqi",
|
|
16621
|
+
"албанский язык": "sqi",
|
|
16622
|
+
"albanais": "sqi",
|
|
16623
|
+
"albanés": "sqi",
|
|
16624
|
+
"албанська мова": "sqi",
|
|
16625
|
+
"الألبانية": "sqi",
|
|
16626
|
+
"阿爾巴尼亞語": "sqi",
|
|
16272
16627
|
"српски": "srp",
|
|
16273
16628
|
"scc": "srp",
|
|
16629
|
+
"сербский язык": "srp",
|
|
16630
|
+
"serbe": "srp",
|
|
16631
|
+
"serbio": "srp",
|
|
16632
|
+
"сербська мова": "srp",
|
|
16633
|
+
"الصربية": "srp",
|
|
16634
|
+
"塞尔维亚语": "srp",
|
|
16274
16635
|
"kiswahili": "swa",
|
|
16275
16636
|
"swahili": "swa",
|
|
16637
|
+
"суахили": "swa",
|
|
16638
|
+
"suajili": "swa",
|
|
16639
|
+
"суахілі": "swa",
|
|
16640
|
+
"السواحلية": "swa",
|
|
16641
|
+
"斯瓦希里語": "swa",
|
|
16276
16642
|
"svenska": "swe",
|
|
16643
|
+
"шведский язык": "swe",
|
|
16644
|
+
"suédois": "swe",
|
|
16645
|
+
"sueco": "swe",
|
|
16646
|
+
"шведська мова": "swe",
|
|
16647
|
+
"السويدية": "swe",
|
|
16648
|
+
"瑞典語": "swe",
|
|
16277
16649
|
"தமிழ்": "tam",
|
|
16650
|
+
"тамильский язык": "tam",
|
|
16651
|
+
"tamoul": "tam",
|
|
16652
|
+
"тамільська мова": "tam",
|
|
16653
|
+
"التملية": "tam",
|
|
16654
|
+
"泰米爾語": "tam",
|
|
16278
16655
|
"తెలుగు": "tel",
|
|
16656
|
+
"телугу": "tel",
|
|
16657
|
+
"télougou": "tel",
|
|
16658
|
+
"télugu": "tel",
|
|
16659
|
+
"التيلوغوية": "tel",
|
|
16660
|
+
"泰卢固语": "tel",
|
|
16661
|
+
"tajiki": "tgk",
|
|
16662
|
+
"тоҷикӣ": "tgk",
|
|
16663
|
+
"стандартный таджикский язык": "tgk",
|
|
16664
|
+
"tadjik": "tgk",
|
|
16665
|
+
"tayiko": "tgk",
|
|
16666
|
+
"таджицька мова": "tgk",
|
|
16667
|
+
"الطاجيكية": "tgk",
|
|
16668
|
+
"塔吉克语": "tgk",
|
|
16669
|
+
"wikang tagalog": "tgl",
|
|
16670
|
+
"тагальский язык": "tgl",
|
|
16671
|
+
"tagalo": "tgl",
|
|
16672
|
+
"тагальська мова": "tgl",
|
|
16673
|
+
"التاغالوغية": "tgl",
|
|
16674
|
+
"他加祿語": "tgl",
|
|
16279
16675
|
"ภาษาไทย": "tha",
|
|
16676
|
+
"тайский язык": "tha",
|
|
16677
|
+
"thaï": "tha",
|
|
16678
|
+
"tailandés": "tha",
|
|
16679
|
+
"тайська мова": "tha",
|
|
16680
|
+
"التايلندية": "tha",
|
|
16681
|
+
"泰語": "tha",
|
|
16280
16682
|
"türkçe": "tur",
|
|
16683
|
+
"турецкий язык": "tur",
|
|
16684
|
+
"turc": "tur",
|
|
16685
|
+
"turco": "tur",
|
|
16686
|
+
"турецька мова": "tur",
|
|
16687
|
+
"التركية": "tur",
|
|
16688
|
+
"土耳其語": "tur",
|
|
16689
|
+
"türkmençe": "tuk",
|
|
16690
|
+
"туркменский язык": "tuk",
|
|
16691
|
+
"turkmène": "tuk",
|
|
16692
|
+
"turcomano": "tuk",
|
|
16693
|
+
"туркменська мова": "tuk",
|
|
16694
|
+
"التركمانية": "tuk",
|
|
16695
|
+
"土库曼语": "tuk",
|
|
16281
16696
|
"українська": "ukr",
|
|
16697
|
+
"украинский язык": "ukr",
|
|
16698
|
+
"ukrainien": "ukr",
|
|
16699
|
+
"ucraniano": "ukr",
|
|
16700
|
+
"українська мова": "ukr",
|
|
16701
|
+
"الأوكرانية": "ukr",
|
|
16702
|
+
"乌克兰语": "ukr",
|
|
16282
16703
|
"اردو": "urd",
|
|
16704
|
+
"урду": "urd",
|
|
16705
|
+
"ourdou": "urd",
|
|
16706
|
+
"الأردية": "urd",
|
|
16707
|
+
"乌尔都语": "urd",
|
|
16708
|
+
"oʻzbek": "uzb",
|
|
16709
|
+
"ўзбек тили": "uzb",
|
|
16710
|
+
"узбекский язык": "uzb",
|
|
16711
|
+
"ouzbek": "uzb",
|
|
16712
|
+
"uzbeko": "uzb",
|
|
16713
|
+
"узбецька мова": "uzb",
|
|
16714
|
+
"الأوزبكية": "uzb",
|
|
16715
|
+
"乌兹别克语": "uzb",
|
|
16283
16716
|
"tiếng việt": "vie",
|
|
16717
|
+
"вьетнамский язык": "vie",
|
|
16718
|
+
"vietnamien": "vie",
|
|
16719
|
+
"vietnamita": "vie",
|
|
16720
|
+
"в'єтнамська": "vie",
|
|
16721
|
+
"الفيتنامية": "vie",
|
|
16722
|
+
"越南语": "vie",
|
|
16284
16723
|
"ji": "yid",
|
|
16285
16724
|
"yorùbá": "yor",
|
|
16286
16725
|
"中文": "zho",
|
|
16287
16726
|
"chi_sim": "zho",
|
|
16288
16727
|
"chi_tra": "zho",
|
|
16728
|
+
"китайский язык": "zho",
|
|
16729
|
+
"chinois": "zho",
|
|
16730
|
+
"chino": "zho",
|
|
16731
|
+
"китайська мова": "zho",
|
|
16732
|
+
"الصينية": "zho",
|
|
16733
|
+
"mandarin": "zho",
|
|
16289
16734
|
"isizulu": "zul",
|
|
16290
16735
|
} # noqa
|
|
16291
16736
|
ISO2_MAP: Dict[str, str] = {
|
|
@@ -3,6 +3,8 @@ from typing import Optional
|
|
|
3
3
|
from zoneinfo import ZoneInfo
|
|
4
4
|
from normality import stringify, DEFAULT_ENCODING
|
|
5
5
|
|
|
6
|
+
from rigour._core import MAX_NAME_LENGTH as _CORE_MAX_NAME_LENGTH
|
|
7
|
+
|
|
6
8
|
TRUE_VALUES = {"true", "1", "yes", "y", "t", "on", "enable", "enabled"}
|
|
7
9
|
FALSE_VALUES = {"false", "0", "no", "n", "f", "off", "disable", "disabled"}
|
|
8
10
|
|
|
@@ -56,8 +58,10 @@ PREFERRED_LANG = env_str("RR_PREFERRED_LANG", "eng")
|
|
|
56
58
|
TZ_NAME = env_str("TZ", "UTC")
|
|
57
59
|
TZ = ZoneInfo(TZ_NAME)
|
|
58
60
|
|
|
59
|
-
# Person and company name length
|
|
60
|
-
|
|
61
|
+
# Person and company name length. Fixed by the Rust core so the char
|
|
62
|
+
# cap on the DP paths there stays in lockstep with what the Python
|
|
63
|
+
# distance wrappers truncate to — not env-tunable.
|
|
64
|
+
MAX_NAME_LENGTH = _CORE_MAX_NAME_LENGTH
|
|
61
65
|
|
|
62
66
|
# Levenshtein tolerance settings:
|
|
63
67
|
LEVENSHTEIN_MAX_EDITS = env_int("RR_LEVENSHTEIN_MAX_EDITS", 4)
|