ovos-lang-parser 0.0.0__py3-none-any.whl

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
@@ -0,0 +1,37 @@
1
+ import json
2
+ import os.path
3
+
4
+ from ovos_utils.parse import match_one, fuzzy_match, MatchStrategy
5
+ from ovos_utils.lang import standardize_lang_tag
6
+
7
+
8
+ def extract_langcode(text, lang):
9
+ lang = standardize_lang_tag(lang).split("-")[0]
10
+ resource_file = f"{os.path.dirname(__file__)}/{lang}/langs.json"
11
+ if not os.path.isfile(resource_file):
12
+ resource_file = f"{os.path.dirname(__file__)}/en/langs.json"
13
+ LANGUAGES = {}
14
+ with open(resource_file) as f:
15
+ for k, v in json.load(f).items():
16
+ if isinstance(v, str):
17
+ v = [v]
18
+ # list of spoken names for this language
19
+ # multiple valid spellings may exist
20
+ for l in v:
21
+ LANGUAGES[l] = k
22
+ return match_one(text, LANGUAGES, strategy=MatchStrategy.TOKEN_SET_RATIO)
23
+
24
+
25
+ def pronounce_lang(lang_code, lang):
26
+ lang = standardize_lang_tag(lang).split("-")[0]
27
+ resource_file = f"{os.path.dirname(__file__)}/{lang}/langs.json"
28
+ if not os.path.isfile(resource_file):
29
+ resource_file = f"{os.path.dirname(__file__)}/en/langs.json"
30
+ with open(resource_file) as f:
31
+ LANGUAGES = json.load(f)
32
+ lang_code = lang_code.lower()
33
+ lang2 = lang_code.split("-")[0]
34
+ spoken_lang = LANGUAGES.get(lang_code) or LANGUAGES.get(lang2) or lang_code
35
+ if isinstance(spoken_lang, list):
36
+ spoken_lang = spoken_lang[0]
37
+ return spoken_lang
@@ -0,0 +1,155 @@
1
+ {
2
+ "aa": "Àfar",
3
+ "ab": "Abkhaz",
4
+ "af": "Afrikaans",
5
+ "ak": "Àkan",
6
+ "am": "Amhàric",
7
+ "ar": "Àrab",
8
+ "as": "Assamès",
9
+ "ay": "Aimara",
10
+ "az": "Àzeri",
11
+ "ba": "Baixkir",
12
+ "be": "Bielorús",
13
+ "bg": "Búlgar",
14
+ "bh": "Bihari",
15
+ "bi": "Bislama",
16
+ "bn": "Bengalí",
17
+ "bo": "Tibetà",
18
+ "br": "Bretó",
19
+ "bs": "Serbocroat",
20
+ "ca": "Català",
21
+ "co": "Cors",
22
+ "cs": "Txec",
23
+ "cy": "Gal·Lès",
24
+ "da": "Danès",
25
+ "de": "Alemany",
26
+ "dv": "Divehi",
27
+ "dz": "Dzongka",
28
+ "ee": "Ewe",
29
+ "el": "Grec Modern",
30
+ "en": "Anglès",
31
+ "en-us": "Anglès americà",
32
+ "eo": "Esperanto",
33
+ "es": "Castellà",
34
+ "et": "Estonià",
35
+ "eu": "Basc",
36
+ "fa": "Persa",
37
+ "fi": "Finès",
38
+ "fj": "Fijià",
39
+ "fo": "Feroès",
40
+ "fr": "Francès",
41
+ "fy": "Frisó",
42
+ "ga": "Irlandès",
43
+ "gd": "Gaèlic escocès",
44
+ "gl": "Gallec",
45
+ "gn": "Guaraní",
46
+ "gu": "Gujarati",
47
+ "gv": "Manx",
48
+ "ha": "Haussa",
49
+ "hi": "Hindi",
50
+ "hr": "Serbocroat",
51
+ "ht": "Crioll haitià",
52
+ "hu": "Hongarès",
53
+ "hy": "Armeni",
54
+ "ia": "Interlingua",
55
+ "id": "Indonesi",
56
+ "ie": "Interllengua",
57
+ "ig": "Igbo",
58
+ "ik": "Inupiak",
59
+ "is": "Islandès",
60
+ "it": "Italià",
61
+ "iu": "Inuktitut",
62
+ "iw": "Hebreu",
63
+ "ja": "Japonès",
64
+ "jw": "Javanès",
65
+ "ka": "Georgià",
66
+ "kk": "Kazakh",
67
+ "kl": "Grenlandès",
68
+ "km": "Khmer",
69
+ "kn": "Kannada",
70
+ "ko": "Coreà",
71
+ "ks": "Caixmiri",
72
+ "ku": "Kurd",
73
+ "ky": "Kirguís",
74
+ "la": "Llatí",
75
+ "lb": "Luxemburguès",
76
+ "lg": "Ganda",
77
+ "ln": "Lingala",
78
+ "lo": "Laosià",
79
+ "lt": "Lituà",
80
+ "lv": "Letó",
81
+ "mg": "Malgaix",
82
+ "mi": "Maori",
83
+ "mk": "Macedònic",
84
+ "ml": "Malaialam",
85
+ "mn": "Mongol",
86
+ "mr": "Marathi",
87
+ "ms": "Malai",
88
+ "mt": "Maltès",
89
+ "my": "Birmà",
90
+ "na": "Nauruà",
91
+ "ne": "Nepalès",
92
+ "nl": "Neerlandès",
93
+ "nn": "Noruec Nynorsk",
94
+ "no": "Noruec",
95
+ "nr": "Ndebele Del Sud",
96
+ "ny": "Nyanja",
97
+ "oc": "Occità",
98
+ "om": "Oromo",
99
+ "or": "Oriya",
100
+ "os": "Osset",
101
+ "pa": "Panjabi",
102
+ "pl": "Polonès",
103
+ "ps": "Paixtu",
104
+ "pt": "Portuguès",
105
+ "pt-br": "Portuguès brasiler",
106
+ "qu": "Quítxua",
107
+ "rm": "Retoromànic",
108
+ "rn": "Rundi",
109
+ "ro": "Romanès",
110
+ "ru": "Rus",
111
+ "rw": "Ruanda",
112
+ "sa": "Sànscrit",
113
+ "sd": "Sindhi",
114
+ "sg": "Sango",
115
+ "si": "Singalès",
116
+ "sk": "Eslovac",
117
+ "sl": "Eslovè",
118
+ "sm": "Samoà",
119
+ "sn": "Shona",
120
+ "so": "Somali",
121
+ "sq": "Albanès",
122
+ "sr": "Serbi",
123
+ "ss": "Swazi",
124
+ "st": "Sotho Del Sud",
125
+ "su": "Sondanès",
126
+ "sv": "Suec",
127
+ "sw": "Suahili",
128
+ "ta": "Tàmil",
129
+ "te": "Telugu",
130
+ "tg": "Tadjik",
131
+ "th": "Tailandès",
132
+ "ti": "Tigrinya",
133
+ "tk": "Turcman",
134
+ "tl": "Tagàlog",
135
+ "tn": "Tswana",
136
+ "to": "Tongalès",
137
+ "tr": "Turc",
138
+ "ts": "Tsonga",
139
+ "tt": "Tàrtar",
140
+ "tw": "Twi",
141
+ "ug": "Uigur",
142
+ "uk": "Ucraïnès",
143
+ "ur": "Urdú",
144
+ "uz": "Uzbek",
145
+ "ve": "Venda",
146
+ "vi": "Vietnamita",
147
+ "vo": "Volapük",
148
+ "wo": "Wòlof",
149
+ "xh": "Xosa",
150
+ "yi": "Ídix",
151
+ "yo": "Ioruba",
152
+ "za": "Zhuang",
153
+ "zh": "Xinès",
154
+ "zu": "Zulu"
155
+ }
@@ -0,0 +1,155 @@
1
+ {
2
+ "aa": "afar",
3
+ "ab": "abkhasisk",
4
+ "af": "Afrikaans",
5
+ "ak": "akan",
6
+ "am": "amharisk",
7
+ "ar": "arabisk",
8
+ "as": "assamisk",
9
+ "ay": "Aymara",
10
+ "az": "aserbajdsjansk",
11
+ "ba": "basjkirsk",
12
+ "be": "hviderussisk",
13
+ "bg": "bulgarsk",
14
+ "bh": "bihari",
15
+ "bi": "Bislama",
16
+ "bn": "bengalsk",
17
+ "bo": "tibetansk",
18
+ "br": "bretonsk",
19
+ "bs": "bosnisk",
20
+ "ca": "catalansk",
21
+ "co": "korsikansk",
22
+ "cs": "tjekkisk",
23
+ "cy": "walisisk",
24
+ "da": "dansk",
25
+ "de": "tysk",
26
+ "dv": "maldivisk",
27
+ "dz": "Dzongkha",
28
+ "ee": "Moderfår",
29
+ "el": "græsk",
30
+ "en": "engelsk",
31
+ "en-us": "Amerikansk engelsk",
32
+ "eo": "Esperanto",
33
+ "es": "spansk",
34
+ "et": "estisk",
35
+ "eu": "baskisk",
36
+ "fa": "persisk",
37
+ "fi": "finsk",
38
+ "fj": "fijiansk",
39
+ "fo": "færøsk",
40
+ "fr": "fransk",
41
+ "fy": "frisisk",
42
+ "ga": "irsk",
43
+ "gd": "skotsk gælisk",
44
+ "gl": "galicisk",
45
+ "gn": "Guarani",
46
+ "gu": "Gujarati",
47
+ "gv": "Manx",
48
+ "ha": "Hausa",
49
+ "hi": "hindi",
50
+ "hr": "kroatisk",
51
+ "ht": "haitisk kreol",
52
+ "hu": "ungarsk",
53
+ "hy": "armensk",
54
+ "ia": "Interlingua",
55
+ "id": "indonesisk",
56
+ "ie": "Interlingue",
57
+ "ig": "Igbo",
58
+ "ik": "Inupiak",
59
+ "is": "islandsk",
60
+ "it": "italiensk",
61
+ "iu": "Inuktitut",
62
+ "iw": "hebraisk",
63
+ "ja": "japansk",
64
+ "jw": "javanesisk",
65
+ "ka": "georgisk",
66
+ "kk": "kasakhisk",
67
+ "kl": "grønlandsk",
68
+ "km": "Khmer",
69
+ "kn": "Kannada",
70
+ "ko": "koreansk",
71
+ "ks": "Kashmiri",
72
+ "ku": "kurdisk",
73
+ "ky": "kirgisisk",
74
+ "la": "latin",
75
+ "lb": "luxembourgsk",
76
+ "lg": "Ganda",
77
+ "ln": "Lingala",
78
+ "lo": "Laothian",
79
+ "lt": "litauisk",
80
+ "lv": "lettisk",
81
+ "mg": "madagaskisk",
82
+ "mi": "Maori",
83
+ "mk": "makedonsk",
84
+ "ml": "Malayalam",
85
+ "mn": "mongolsk",
86
+ "mr": "Marathi",
87
+ "ms": "malaysisk",
88
+ "mt": "maltesisk",
89
+ "my": "burmesisk",
90
+ "na": "Nauru",
91
+ "ne": "nepalesisk",
92
+ "nl": "hollandsk",
93
+ "nn": "nynorsk",
94
+ "no": "norsk",
95
+ "nr": "Ndebele",
96
+ "ny": "Nyanja",
97
+ "oc": "occitansk",
98
+ "om": "Oromo",
99
+ "or": "Oriya",
100
+ "os": "ossetisk",
101
+ "pa": "Punjabi",
102
+ "pl": "Polere",
103
+ "ps": "Pashto",
104
+ "pt": "portugisisk",
105
+ "pt-br": "brasiliansk portugisisk",
106
+ "qu": "Quechua",
107
+ "rm": "Rhaeto-romantik",
108
+ "rn": "Rundi",
109
+ "ro": "rumænsk",
110
+ "ru": "russisk",
111
+ "rw": "Kinyarwanda",
112
+ "sa": "Sanskrit",
113
+ "sd": "Sindhi",
114
+ "sg": "Sango",
115
+ "si": "singalesisk",
116
+ "sk": "slovakisk",
117
+ "sl": "slovensk",
118
+ "sm": "samoansk",
119
+ "sn": "Shona",
120
+ "so": "Somali",
121
+ "sq": "albansk",
122
+ "sr": "serbisk",
123
+ "ss": "Siswant",
124
+ "st": "Sesotho",
125
+ "su": "sundanesisk",
126
+ "sv": "svensk",
127
+ "sw": "Swahili",
128
+ "ta": "Tamil",
129
+ "te": "Telugu",
130
+ "tg": "tadsjikisk",
131
+ "th": "Thai",
132
+ "ti": "Tigrinya",
133
+ "tk": "turkmenske",
134
+ "tl": "Tagalog",
135
+ "tn": "Tswana",
136
+ "to": "Tonga",
137
+ "tr": "tyrkisk",
138
+ "ts": "Tsonga",
139
+ "tt": "tatarisk",
140
+ "tw": "Twi",
141
+ "ug": "Uighur",
142
+ "uk": "ukrainsk",
143
+ "ur": "Urdu",
144
+ "uz": "usbekisk",
145
+ "ve": "Venda",
146
+ "vi": "vietnamesisk",
147
+ "vo": "Volapuk",
148
+ "wo": "Wolof",
149
+ "xh": "Xhosa",
150
+ "yi": "Jiddisch",
151
+ "yo": "Yoruba",
152
+ "za": "Zhuang",
153
+ "zh": "kinesisk",
154
+ "zu": "Zulu"
155
+ }
@@ -0,0 +1,225 @@
1
+ {
2
+ "ab": "Abchasisch",
3
+ "aa": "Afar",
4
+ "af": "Afrikaans",
5
+ "ak": "Akan",
6
+ "sq": "Albanisch",
7
+ "am": "Amharisch",
8
+ "ar": "Arabisch",
9
+ "an": "Aragonesisch",
10
+ "hy": "Armenisch",
11
+ "as": "Assamesisch",
12
+ "av": "Avarisch",
13
+ "ae": "Avestisch",
14
+ "ay": "Aymara",
15
+ "az": "Aserbaidschanisch",
16
+ "bm": "Bambara",
17
+ "ba": "Baschkirisch",
18
+ "eu": "Baskisch",
19
+ "be": "Belarussisch",
20
+ "bn": "Bengalisch",
21
+ "bh": "Bihari",
22
+ "bi": "Bislama",
23
+ "bs": "Bosnisch",
24
+ "br": "Bretonisch",
25
+ "bg": "Bulgarisch",
26
+ "my": "Birmanisch",
27
+ "ca": [
28
+ "Katalanisch",
29
+ "Valencianisch"
30
+ ],
31
+ "ch": "Chamorro",
32
+ "ce": "Tschetschenisch",
33
+ "ny": "Chichewa",
34
+ "zh": "Chinesisch",
35
+ "cv": "Tschuwaschisch",
36
+ "kw": "Kornisch",
37
+ "co": "Korsisch",
38
+ "cr": "Cree",
39
+ "hr": "Kroatisch",
40
+ "cs": "Tschechisch",
41
+ "da": "Dänisch",
42
+ "dv": "Dhivehi",
43
+ "nl": [
44
+ "Niederländisch",
45
+ "Belgisches Niederländisch"
46
+ ],
47
+ "dz": "Dzongkha",
48
+ "en": "Englisch",
49
+ "eo": "Esperanto",
50
+ "et": "Estnisch",
51
+ "ee": "Ewe",
52
+ "fo": "Färöisch",
53
+ "fj": "Fidschi",
54
+ "fi": "Finnisch",
55
+ "fr": "Französisch",
56
+ "ff": "Fulfulde",
57
+ "gl": [
58
+ "Galicisch",
59
+ "Galegisch"
60
+ ],
61
+ "ka": "Georgisch",
62
+ "de": "Deutsch",
63
+ "el": "Griechisch",
64
+ "gn": "Guaraní",
65
+ "gu": "Gujarati",
66
+ "ht": "Haitianisch",
67
+ "ha": "Hausa",
68
+ "he": "Hebräisch",
69
+ "hz": "Otjiherero",
70
+ "hi": "Hindi",
71
+ "ho": "Hiri Motu",
72
+ "hu": "Ungarisch",
73
+ "ia": "Interlingua",
74
+ "id": "Indonesisch",
75
+ "ie": "Interlingue",
76
+ "ga": "Irisch",
77
+ "ig": "Igbo",
78
+ "ik": "Inupiaq",
79
+ "io": "Ido",
80
+ "is": "Isländisch",
81
+ "it": "Italienisch",
82
+ "iu": "Inuktitut",
83
+ "ja": "Japanisch",
84
+ "jv": "Javanisch",
85
+ "kl": [
86
+ "Grönländisch",
87
+ "Kalaallisut"
88
+ ],
89
+ "kn": "Kannada",
90
+ "kr": "Kanuri",
91
+ "ks": "Kashmiri",
92
+ "kk": "Kasachisch",
93
+ "km": "Khmer",
94
+ "ki": "Kikuyu",
95
+ "rw": [
96
+ "Kinyarwanda",
97
+ "Ruandisch"
98
+ ],
99
+ "ky": "Kirgisisch",
100
+ "kv": "Komi",
101
+ "kg": "Kikongo",
102
+ "ko": "Koreanisch",
103
+ "ku": "Kurdisch",
104
+ "kj": "Oshikwanyama",
105
+ "la": "Latein",
106
+ "lb": "Luxemburgisch",
107
+ "lg": "Luganda",
108
+ "li": [
109
+ "Limburgisch",
110
+ "Südniederfränkisch"
111
+ ],
112
+ "ln": "Lingála",
113
+ "lo": "Laotisch",
114
+ "lt": "Litauisch",
115
+ "lu": "Kiluba",
116
+ "lv": "Lettisch",
117
+ "gv": "Manx,Manx-Gälisch",
118
+ "mk": "Mazedonisch",
119
+ "mg": [
120
+ "Malagasy",
121
+ "Malagassi"
122
+ ],
123
+ "ms": "Malaiisch",
124
+ "ml": "Malayalam",
125
+ "mt": "Maltesisch",
126
+ "mi": "Maori",
127
+ "mr": "Marathi",
128
+ "mh": "Marshallesisch",
129
+ "mn": "Mongolisch",
130
+ "na": "Nauruisch",
131
+ "nv": "Navajo",
132
+ "nd": "Nord-Ndebele",
133
+ "ne": "Nepali",
134
+ "ng": "Ndonga",
135
+ "nb": "Bokmål",
136
+ "nn": "Nynorsk",
137
+ "no": "Norwegisch",
138
+ "ii": "Yi",
139
+ "nr": "Süd-Ndebele",
140
+ "oc": "Okzitanisch",
141
+ "oj": "Ojibwe",
142
+ "cu": [
143
+ "Kirchenslawisch",
144
+ "Altkirchenslawisch"
145
+ ],
146
+ "om": "Oromo",
147
+ "or": "Oriya",
148
+ "os": "Ossetisch",
149
+ "pa": [
150
+ "Panjabi",
151
+ "Pandschabi"
152
+ ],
153
+ "pi": "Pali",
154
+ "fa": "Persisch",
155
+ "pl": "Polnisch",
156
+ "ps": "Paschtunisch",
157
+ "pt": "Portugiesisch",
158
+ "qu": "Quechua",
159
+ "rm": [
160
+ "Bündnerromanisch",
161
+ "Romanisch"
162
+ ],
163
+ "rn": "Kirundi",
164
+ "ro": "Rumänisch",
165
+ "ru": "Russisch",
166
+ "sa": "Sanskrit",
167
+ "sc": "Sardisch",
168
+ "sd": "Sindhi",
169
+ "se": "Nordsamisch",
170
+ "sm": "Samoanisch",
171
+ "sg": "Sango",
172
+ "sr": "Serbisch",
173
+ "gd": "Schottisch-Gälisch",
174
+ "sn": "Shona",
175
+ "si": "Singhalesisch",
176
+ "sk": "Slowakisch",
177
+ "sl": "Slowenisch",
178
+ "so": "Somali",
179
+ "st": [
180
+ "Sesotho",
181
+ "Süd-Sotho"
182
+ ],
183
+ "es": [
184
+ "Spanisch",
185
+ "Kastilisch"
186
+ ],
187
+ "su": "Sundanesisch",
188
+ "sw": "Swahili",
189
+ "ss": "Siswati",
190
+ "sv": "Schwedisch",
191
+ "ta": "Tamil",
192
+ "te": "Telugu",
193
+ "tg": "Tadschikisch",
194
+ "th": "Thai",
195
+ "ti": "Tigrinya",
196
+ "bo": "Tibetisch",
197
+ "tk": "Turkmenisch",
198
+ "tl": "Tagalog",
199
+ "tn": "Setswana",
200
+ "to": "Tongaisch",
201
+ "tr": "Türkisch",
202
+ "ts": "Xitsonga",
203
+ "tt": "Tatarisch",
204
+ "tw": "Twi",
205
+ "ty": [
206
+ "Tahitianisch",
207
+ "Tahitisch"
208
+ ],
209
+ "ug": "Uigurisch",
210
+ "uk": "Ukrainisch",
211
+ "ur": "Urdu",
212
+ "uz": "Usbekisch",
213
+ "ve": "Tshivenda",
214
+ "vi": "Vietnamesisch",
215
+ "vo": "Volapük",
216
+ "wa": "Wallonisch",
217
+ "cy": "Walisisch",
218
+ "wo": "Wolof",
219
+ "fy": "Westfriesisch",
220
+ "xh": "Isixhosa",
221
+ "yi": "Jiddisch",
222
+ "yo": "Yoruba",
223
+ "za": "Zhuang",
224
+ "zu": "Isizulu"
225
+ }