scriptconv 0.0.3a20__tar.gz → 0.0.3a22__tar.gz
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/PKG-INFO +3 -1
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/pyproject.toml +4 -2
- scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/__init__.py +16 -0
- scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/kog2p/LICENSE.md +5 -0
- scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/kog2p/__init__.py +383 -0
- scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/kog2p/rulebook.txt +212 -0
- scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/LICENSE.md +15 -0
- scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/__init__.py +42 -0
- scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/buck/phonetise_buckwalter.py +459 -0
- scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/buck/symbols.py +64 -0
- scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/buck/tokenization.py +105 -0
- scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/num2words.py +51 -0
- scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/unicode_symbol2label.py +4173 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/ar.py +48 -29
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/ko.py +9 -9
- scriptconv-0.0.3a22/scriptconv/py.typed +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/version.py +1 -1
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv.egg-info/PKG-INFO +3 -1
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv.egg-info/SOURCES.txt +12 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv.egg-info/requires.txt +2 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_phonemizers_cjk_ar.py +26 -9
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/LICENSE +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/README.md +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/requirements.txt +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/__init__.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/__main__.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/cangjie.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/conventions.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/data/__init__.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/data/cangjie5_tc.tsv.gz +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/graph.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/notation.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/__init__.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/__init__.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/bw2ipa.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/hangul2ipa.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/aspiration.csv +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/assimilation.csv +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/double_coda.csv +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/hanja.tsv +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/ipa.csv +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/neutralization.csv +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/tensification.csv +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/yale.csv +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/__init__.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/codeswitch.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/diacritize.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/dialectal.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/english_g2p.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/espeak.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/frontend.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/levantine_g2p.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/normalize.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/phoneme_inventory.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/zh_num.py +0 -0
- /scriptconv-0.0.3a20/scriptconv/py.typed → /scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/buck/__init__.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/base.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/en.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/enums.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/eu.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/fa.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/gl.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/he.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/ja.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/mul.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/mwl.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/o2ipa.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/pt.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/registry.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/shami.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/vi.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/zh.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/readings.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/scripts.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/translit.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv.egg-info/dependency_links.txt +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv.egg-info/top_level.txt +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/setup.cfg +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_arpa_stress.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_cangjie.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_cli.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_conventions.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_errors_policy.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_examples.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_graph.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_notation.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_phonemizers_base.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_readings.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_readings_zh.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_scripts.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_scripts_stressonnx_compat.py +0 -0
- {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_translit.py +0 -0
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
Metadata-Version: 2.4
|
|
2
2
|
Name: scriptconv
|
|
3
|
-
Version: 0.0.
|
|
3
|
+
Version: 0.0.3a22
|
|
4
4
|
Summary: Zero-dependency script & phoneme-notation core — ISO-15924 detection & metadata, IPA↔ARPABET/X-SAMPA/Lexique/Kirshenbaum/Cotovía/RFE, Buckwalter↔Arabic, Hangul→jamo, kana
|
|
5
5
|
License: Apache-2.0
|
|
6
6
|
Project-URL: Homepage, https://github.com/TigreGotico/scriptconv
|
|
@@ -102,6 +102,7 @@ Requires-Dist: deep-phonemizer; extra == "en-phonemizers"
|
|
|
102
102
|
Provides-Extra: ar-phonemizers
|
|
103
103
|
Requires-Dist: scriptconv[phonemizers]; extra == "ar-phonemizers"
|
|
104
104
|
Requires-Dist: arbtok; extra == "ar-phonemizers"
|
|
105
|
+
Requires-Dist: ovos-number-parser; extra == "ar-phonemizers"
|
|
105
106
|
Provides-Extra: shami
|
|
106
107
|
Requires-Dist: scriptconv[phonemizers]; extra == "shami"
|
|
107
108
|
Requires-Dist: regex; extra == "shami"
|
|
@@ -113,6 +114,7 @@ Requires-Dist: pypinyin<1,>=0.50; extra == "test"
|
|
|
113
114
|
Requires-Dist: quebra-frases; extra == "test"
|
|
114
115
|
Requires-Dist: langcodes; extra == "test"
|
|
115
116
|
Requires-Dist: regex; extra == "test"
|
|
117
|
+
Requires-Dist: ovos-number-parser; extra == "test"
|
|
116
118
|
Dynamic: license-file
|
|
117
119
|
|
|
118
120
|
# scriptconv
|
|
@@ -57,9 +57,9 @@ ja-phonemizers = ["scriptconv[phonemizers]", "pyopenjtalk", "cutlet", "pykakasi>
|
|
|
57
57
|
ko = ["scriptconv[phonemizers]", "g2pk", "regex"]
|
|
58
58
|
zh-phonemizers = ["scriptconv[phonemizers]", "jieba", "pypinyin>=0.50,<1", "xpinyin", "g2pM", "pinyin_to_ipa"]
|
|
59
59
|
en-phonemizers = ["scriptconv[phonemizers]", "g2p_en", "openphonemizer", "deep-phonemizer"]
|
|
60
|
-
ar-phonemizers = ["scriptconv[phonemizers]", "arbtok"]
|
|
60
|
+
ar-phonemizers = ["scriptconv[phonemizers]", "arbtok", "ovos-number-parser"]
|
|
61
61
|
shami = ["scriptconv[phonemizers]", "regex"]
|
|
62
|
-
test = ["pytest", "pytest-timeout", "pykakasi>=2.3,<3", "pypinyin>=0.50,<1", "quebra-frases", "langcodes", "regex"]
|
|
62
|
+
test = ["pytest", "pytest-timeout", "pykakasi>=2.3,<3", "pypinyin>=0.50,<1", "quebra-frases", "langcodes", "regex", "ovos-number-parser"]
|
|
63
63
|
|
|
64
64
|
[project.urls]
|
|
65
65
|
Homepage = "https://github.com/TigreGotico/scriptconv"
|
|
@@ -72,6 +72,8 @@ include = ["scriptconv*"]
|
|
|
72
72
|
scriptconv = ["py.typed"]
|
|
73
73
|
"scriptconv.data" = ["*.tsv.gz"]
|
|
74
74
|
"scriptconv.phonemizers._thirdparty" = ["ko_tables/*.csv", "ko_tables/*.tsv"]
|
|
75
|
+
"scriptconv.phonemizers._vendored.kog2p" = ["rulebook.txt", "LICENSE.md"]
|
|
76
|
+
"scriptconv.phonemizers._vendored.mantoq" = ["LICENSE.md"]
|
|
75
77
|
|
|
76
78
|
[tool.pytest.ini_options]
|
|
77
79
|
testpaths = ["tests"]
|
|
@@ -0,0 +1,16 @@
|
|
|
1
|
+
"""QUARANTINED vendored code — NOT covered by scriptconv's Apache-2.0 license.
|
|
2
|
+
|
|
3
|
+
Each subpackage here is unpublished upstream code vendored for usability,
|
|
4
|
+
distributed under ITS OWN license, stated in its directory:
|
|
5
|
+
|
|
6
|
+
* ``mantoq/`` — Arabic G2P (github.com/mush42/mantoq). Its phonetisation core
|
|
7
|
+
(``buck/phonetise_buckwalter.py``) is **CC BY-NC 4.0** (Nawar Halabi's
|
|
8
|
+
Arabic-Phonetiser) — non-commercial use only. See ``mantoq/LICENSE.md``.
|
|
9
|
+
* ``kog2p/`` — Korean G2P (github.com/scarletcho/KoG2P), **GPL-3.0**.
|
|
10
|
+
See ``kog2p/LICENSE.md``.
|
|
11
|
+
|
|
12
|
+
Nothing in scriptconv imports these at package import time; they load only
|
|
13
|
+
when a caller explicitly requests the corresponding phonemizer, accepting the
|
|
14
|
+
subpackage's license by doing so. Unencumbered alternatives exist for both
|
|
15
|
+
(arbtok for Arabic, g2pk for Korean) and remain the defaults.
|
|
16
|
+
"""
|
|
@@ -0,0 +1,383 @@
|
|
|
1
|
+
# taken from https://github.com/scarletcho/KoG2P
|
|
2
|
+
'''
|
|
3
|
+
g2p.py
|
|
4
|
+
~~~~~~~~~~
|
|
5
|
+
|
|
6
|
+
This script converts Korean graphemes to romanized phones and then to pronunciation.
|
|
7
|
+
|
|
8
|
+
(1) graph2phone: convert Korean graphemes to romanized phones
|
|
9
|
+
(2) phone2prono: convert romanized phones to pronunciation
|
|
10
|
+
(3) graph2phone: convert Korean graphemes to pronunciation
|
|
11
|
+
|
|
12
|
+
Usage: $ python g2p.py '스물 여덟째 사람'
|
|
13
|
+
(NB. Please check 'rulebook_path' before usage.)
|
|
14
|
+
|
|
15
|
+
Yejin Cho (ycho@utexas.edu)
|
|
16
|
+
Jaegu Kang (jaekoo.jk@gmail.com)
|
|
17
|
+
Hyungwon Yang (hyung8758@gmail.com)
|
|
18
|
+
Yeonjung Hong (yvonne.yj.hong@gmail.com)
|
|
19
|
+
|
|
20
|
+
Created: 2016-08-11
|
|
21
|
+
Last updated: 2019-01-31 Yejin Cho
|
|
22
|
+
|
|
23
|
+
* Key updates made:
|
|
24
|
+
- Executable in both Python 2 and 3.
|
|
25
|
+
- G2P Performance test available ($ python g2p.py test)
|
|
26
|
+
- G2P verbosity control available
|
|
27
|
+
|
|
28
|
+
'''
|
|
29
|
+
|
|
30
|
+
import datetime as dt
|
|
31
|
+
import os.path
|
|
32
|
+
import re
|
|
33
|
+
import math
|
|
34
|
+
import sys
|
|
35
|
+
import optparse
|
|
36
|
+
|
|
37
|
+
# Option
|
|
38
|
+
# Import-time CLI parsing removed for library use (the upstream script
|
|
39
|
+
# parsed sys.argv on import, which breaks under any host process with its
|
|
40
|
+
# own arguments); verbose output is off in library context.
|
|
41
|
+
verbose = False
|
|
42
|
+
|
|
43
|
+
# Check Python version
|
|
44
|
+
ver_info = sys.version_info
|
|
45
|
+
|
|
46
|
+
if ver_info[0] == 2:
|
|
47
|
+
reload(sys)
|
|
48
|
+
sys.setdefaultencoding('utf-8')
|
|
49
|
+
|
|
50
|
+
|
|
51
|
+
def readfileUTF8(fname):
|
|
52
|
+
f = open(fname, 'r')
|
|
53
|
+
corpus = []
|
|
54
|
+
|
|
55
|
+
while True:
|
|
56
|
+
line = f.readline()
|
|
57
|
+
line = line.encode("utf-8")
|
|
58
|
+
line = re.sub(u'\n', u'', line)
|
|
59
|
+
if line != u'':
|
|
60
|
+
corpus.append(line)
|
|
61
|
+
if not line: break
|
|
62
|
+
|
|
63
|
+
f.close()
|
|
64
|
+
return corpus
|
|
65
|
+
|
|
66
|
+
|
|
67
|
+
def writefile(body, fname):
|
|
68
|
+
out = open(fname, 'w')
|
|
69
|
+
for line in body:
|
|
70
|
+
out.write('{}\n'.format(line))
|
|
71
|
+
out.close()
|
|
72
|
+
|
|
73
|
+
|
|
74
|
+
def readRules(pver, rule_book):
|
|
75
|
+
if pver == 2:
|
|
76
|
+
f = open(rule_book, 'r')
|
|
77
|
+
elif pver == 3:
|
|
78
|
+
f = open(rule_book, 'r', encoding="utf-8")
|
|
79
|
+
|
|
80
|
+
rule_in = []
|
|
81
|
+
rule_out = []
|
|
82
|
+
|
|
83
|
+
while True:
|
|
84
|
+
line = f.readline()
|
|
85
|
+
if pver == 2:
|
|
86
|
+
line = unicode(line.encode("utf-8"))
|
|
87
|
+
line = re.sub(u'\n', u'', line)
|
|
88
|
+
elif pver == 3:
|
|
89
|
+
line = re.sub('\n', '', line)
|
|
90
|
+
|
|
91
|
+
if line != u'':
|
|
92
|
+
if line[0] != u'#':
|
|
93
|
+
IOlist = line.split('\t')
|
|
94
|
+
rule_in.append(IOlist[0])
|
|
95
|
+
if IOlist[1]:
|
|
96
|
+
rule_out.append(IOlist[1])
|
|
97
|
+
else: # If output is empty (i.e. deletion rule)
|
|
98
|
+
rule_out.append(u'')
|
|
99
|
+
if not line: break
|
|
100
|
+
f.close()
|
|
101
|
+
|
|
102
|
+
return rule_in, rule_out
|
|
103
|
+
|
|
104
|
+
|
|
105
|
+
def isHangul(charint):
|
|
106
|
+
hangul_init = 44032
|
|
107
|
+
hangul_fin = 55203
|
|
108
|
+
return charint >= hangul_init and charint <= hangul_fin
|
|
109
|
+
|
|
110
|
+
|
|
111
|
+
def checkCharType(var_list):
|
|
112
|
+
# 1: whitespace
|
|
113
|
+
# 0: hangul
|
|
114
|
+
# -1: non-hangul
|
|
115
|
+
checked = []
|
|
116
|
+
for i in range(len(var_list)):
|
|
117
|
+
if var_list[i] == 32: # whitespace
|
|
118
|
+
checked.append(1)
|
|
119
|
+
elif isHangul(var_list[i]): # Hangul character
|
|
120
|
+
checked.append(0)
|
|
121
|
+
else: # Non-hangul character
|
|
122
|
+
checked.append(-1)
|
|
123
|
+
return checked
|
|
124
|
+
|
|
125
|
+
|
|
126
|
+
def graph2phone(graphs):
|
|
127
|
+
# Encode graphemes as utf8
|
|
128
|
+
try:
|
|
129
|
+
graphs = graphs.decode('utf8')
|
|
130
|
+
except AttributeError:
|
|
131
|
+
pass
|
|
132
|
+
|
|
133
|
+
integers = []
|
|
134
|
+
for i in range(len(graphs)):
|
|
135
|
+
integers.append(ord(graphs[i]))
|
|
136
|
+
|
|
137
|
+
# Romanization (according to Korean Spontaneous Speech corpus; 성인자유발화코퍼스)
|
|
138
|
+
phones = ''
|
|
139
|
+
ONS = ['k0', 'kk', 'nn', 't0', 'tt', 'rr', 'mm', 'p0', 'pp',
|
|
140
|
+
's0', 'ss', 'oh', 'c0', 'cc', 'ch', 'kh', 'th', 'ph', 'h0']
|
|
141
|
+
NUC = ['aa', 'qq', 'ya', 'yq', 'vv', 'ee', 'yv', 'ye', 'oo', 'wa',
|
|
142
|
+
'wq', 'wo', 'yo', 'uu', 'wv', 'we', 'wi', 'yu', 'xx', 'xi', 'ii']
|
|
143
|
+
COD = ['', 'kf', 'kk', 'ks', 'nf', 'nc', 'nh', 'tf',
|
|
144
|
+
'll', 'lk', 'lm', 'lb', 'ls', 'lt', 'lp', 'lh',
|
|
145
|
+
'mf', 'pf', 'ps', 's0', 'ss', 'oh', 'c0', 'ch',
|
|
146
|
+
'kh', 'th', 'ph', 'h0']
|
|
147
|
+
|
|
148
|
+
# Pronunciation
|
|
149
|
+
idx = checkCharType(integers)
|
|
150
|
+
iElement = 0
|
|
151
|
+
while iElement < len(integers):
|
|
152
|
+
if idx[iElement] == 0: # not space characters
|
|
153
|
+
base = 44032
|
|
154
|
+
df = int(integers[iElement]) - base
|
|
155
|
+
iONS = int(math.floor(df / 588)) + 1
|
|
156
|
+
iNUC = int(math.floor((df % 588) / 28)) + 1
|
|
157
|
+
iCOD = int((df % 588) % 28) + 1
|
|
158
|
+
|
|
159
|
+
s1 = '-' + ONS[iONS - 1] # onset
|
|
160
|
+
s2 = NUC[iNUC - 1] # nucleus
|
|
161
|
+
|
|
162
|
+
if COD[iCOD - 1]: # coda
|
|
163
|
+
s3 = COD[iCOD - 1]
|
|
164
|
+
else:
|
|
165
|
+
s3 = ''
|
|
166
|
+
tmp = s1 + s2 + s3
|
|
167
|
+
phones = phones + tmp
|
|
168
|
+
|
|
169
|
+
elif idx[iElement] == 1: # space character
|
|
170
|
+
tmp = '#'
|
|
171
|
+
phones = phones + tmp
|
|
172
|
+
|
|
173
|
+
phones = re.sub('-(oh)', '-', phones)
|
|
174
|
+
iElement += 1
|
|
175
|
+
tmp = ''
|
|
176
|
+
|
|
177
|
+
# 초성 이응 삭제
|
|
178
|
+
phones = re.sub('^oh', '', phones)
|
|
179
|
+
phones = re.sub('-(oh)', '', phones)
|
|
180
|
+
|
|
181
|
+
# 받침 이응 'ng'으로 처리 (Velar nasal in coda position)
|
|
182
|
+
phones = re.sub('oh-', 'ng-', phones)
|
|
183
|
+
phones = re.sub('oh([# ]|$)', 'ng', phones)
|
|
184
|
+
|
|
185
|
+
# Remove all characters except Hangul and syllable delimiter (hyphen; '-')
|
|
186
|
+
phones = re.sub(r'(\W+)\-', '\\1', phones)
|
|
187
|
+
phones = re.sub(r'\W+$', '', phones)
|
|
188
|
+
phones = re.sub(r'^\-', '', phones)
|
|
189
|
+
return phones
|
|
190
|
+
|
|
191
|
+
|
|
192
|
+
def phone2prono(phones, rule_in, rule_out):
|
|
193
|
+
# Apply g2p rules
|
|
194
|
+
for pattern, replacement in zip(rule_in, rule_out):
|
|
195
|
+
# print pattern
|
|
196
|
+
phones = re.sub(pattern, replacement, phones)
|
|
197
|
+
prono = phones
|
|
198
|
+
return prono
|
|
199
|
+
|
|
200
|
+
|
|
201
|
+
def addPhoneBoundary(phones):
|
|
202
|
+
# Add a comma (,) after every second alphabets to mark phone boundaries
|
|
203
|
+
ipos = 0
|
|
204
|
+
newphones = ''
|
|
205
|
+
while ipos + 2 <= len(phones):
|
|
206
|
+
if phones[ipos] == u'-':
|
|
207
|
+
newphones = newphones + phones[ipos]
|
|
208
|
+
ipos += 1
|
|
209
|
+
elif phones[ipos] == u' ':
|
|
210
|
+
ipos += 1
|
|
211
|
+
elif phones[ipos] == u'#':
|
|
212
|
+
newphones = newphones + phones[ipos]
|
|
213
|
+
ipos += 1
|
|
214
|
+
|
|
215
|
+
newphones = newphones + phones[ipos] + phones[ipos + 1] + u','
|
|
216
|
+
ipos += 2
|
|
217
|
+
|
|
218
|
+
return newphones
|
|
219
|
+
|
|
220
|
+
|
|
221
|
+
def addSpace(phones):
|
|
222
|
+
ipos = 0
|
|
223
|
+
newphones = ''
|
|
224
|
+
while ipos < len(phones):
|
|
225
|
+
if ipos == 0:
|
|
226
|
+
newphones = newphones + phones[ipos] + phones[ipos + 1]
|
|
227
|
+
else:
|
|
228
|
+
newphones = newphones + ' ' + phones[ipos] + phones[ipos + 1]
|
|
229
|
+
ipos += 2
|
|
230
|
+
|
|
231
|
+
return newphones
|
|
232
|
+
|
|
233
|
+
|
|
234
|
+
def graph2prono(graphs, rule_in, rule_out):
|
|
235
|
+
romanized = graph2phone(graphs)
|
|
236
|
+
romanized_bd = addPhoneBoundary(romanized)
|
|
237
|
+
prono = phone2prono(romanized_bd, rule_in, rule_out)
|
|
238
|
+
|
|
239
|
+
prono = re.sub(u',', u' ', prono)
|
|
240
|
+
prono = re.sub(u' $', u'', prono)
|
|
241
|
+
prono = re.sub(u'#', u'-', prono)
|
|
242
|
+
prono = re.sub(u'-+', u'-', prono)
|
|
243
|
+
|
|
244
|
+
prono_prev = prono
|
|
245
|
+
identical = False
|
|
246
|
+
loop_cnt = 1
|
|
247
|
+
|
|
248
|
+
if verbose == True:
|
|
249
|
+
print('=> Romanized: ' + romanized)
|
|
250
|
+
print('=> Romanized with boundaries: ' + romanized_bd)
|
|
251
|
+
print('=> Initial output: ' + prono)
|
|
252
|
+
|
|
253
|
+
while not identical:
|
|
254
|
+
prono_new = phone2prono(re.sub(u' ', u',', prono_prev + u','), rule_in, rule_out)
|
|
255
|
+
prono_new = re.sub(u',', u' ', prono_new)
|
|
256
|
+
prono_new = re.sub(u' $', u'', prono_new)
|
|
257
|
+
|
|
258
|
+
if re.sub(u'-', u'', prono_prev) == re.sub(u'-', u'', prono_new):
|
|
259
|
+
identical = True
|
|
260
|
+
prono_new = re.sub(u'-', u'', prono_new)
|
|
261
|
+
if verbose == True:
|
|
262
|
+
print('\n=> Exhaustive rule application completed!')
|
|
263
|
+
print('=> Total loop count: ' + str(loop_cnt))
|
|
264
|
+
print('=> Output: ' + prono_new)
|
|
265
|
+
else:
|
|
266
|
+
if verbose == True:
|
|
267
|
+
print('\n=> Rule applied for more than once')
|
|
268
|
+
print('cmp1: ' + re.sub(u'-', u'', prono_prev))
|
|
269
|
+
print('cmp2: ' + re.sub(u'-', u'', prono_new))
|
|
270
|
+
loop_cnt += 1
|
|
271
|
+
prono_prev = prono_new
|
|
272
|
+
|
|
273
|
+
return prono_new
|
|
274
|
+
|
|
275
|
+
|
|
276
|
+
def testG2P(rulebook, testset):
|
|
277
|
+
[testin, testout] = readRules(ver_info[0], testset)
|
|
278
|
+
cnt = 0
|
|
279
|
+
body = []
|
|
280
|
+
for idx in range(0, len(testin)):
|
|
281
|
+
print('Test item #: ' + str(idx + 1) + '/' + str(len(testin)))
|
|
282
|
+
item_in = testin[idx]
|
|
283
|
+
item_out = testout[idx]
|
|
284
|
+
ans = graph2phone(item_out)
|
|
285
|
+
ans = re.sub(u'-', u'', ans)
|
|
286
|
+
ans = addSpace(ans)
|
|
287
|
+
|
|
288
|
+
[rule_in, rule_out] = readRules(ver_info[0], rulebook)
|
|
289
|
+
pred = graph2prono(item_in, rule_in, rule_out)
|
|
290
|
+
|
|
291
|
+
if pred != ans:
|
|
292
|
+
print('G2P ERROR: [result] ' + pred + '\t\t\t[ans] ' + item_in + ' [' + item_out + '] ' + ans)
|
|
293
|
+
cnt += 1
|
|
294
|
+
else:
|
|
295
|
+
body.append('[result] ' + pred + '\t\t\t[ans] ' + item_in + ' [' + item_out + '] ' + ans)
|
|
296
|
+
|
|
297
|
+
print('Total error item #: ' + str(cnt))
|
|
298
|
+
writefile(body, 'good.txt')
|
|
299
|
+
|
|
300
|
+
|
|
301
|
+
kog2p_to_hangul = {
|
|
302
|
+
# Onset consonants
|
|
303
|
+
'p0': 'ㅂ',
|
|
304
|
+
'ph': 'ㅍ',
|
|
305
|
+
'pp': 'ㅃ',
|
|
306
|
+
't0': 'ㄷ',
|
|
307
|
+
'th': 'ㅌ',
|
|
308
|
+
'tt': 'ㄸ',
|
|
309
|
+
'k0': 'ㄱ',
|
|
310
|
+
'kh': 'ㅋ',
|
|
311
|
+
'kk': 'ㄲ',
|
|
312
|
+
's0': 'ㅅ',
|
|
313
|
+
'ss': 'ㅆ',
|
|
314
|
+
'h0': 'ㅎ',
|
|
315
|
+
'c0': 'ㅈ',
|
|
316
|
+
'ch': 'ㅊ',
|
|
317
|
+
'cc': 'ㅉ',
|
|
318
|
+
'mm': 'ㅁ',
|
|
319
|
+
'nn': 'ㄴ',
|
|
320
|
+
'rr': 'ㄹ',
|
|
321
|
+
|
|
322
|
+
# Coda consonants
|
|
323
|
+
'pf': 'ㅂ',
|
|
324
|
+
'tf': 'ㄷ',
|
|
325
|
+
'kf': 'ㄱ',
|
|
326
|
+
'mf': 'ㅁ',
|
|
327
|
+
'nf': 'ㄴ',
|
|
328
|
+
'ng': 'ㅇ',
|
|
329
|
+
'll': 'ㄹ',
|
|
330
|
+
'ks': 'ㄱㅅ',
|
|
331
|
+
'nc': 'ㄴㅈ',
|
|
332
|
+
'nh': 'ㄴㅎ',
|
|
333
|
+
'lk': 'ㄹㄱ',
|
|
334
|
+
'lm': 'ㄹㅁ',
|
|
335
|
+
'lb': 'ㄹㅂ',
|
|
336
|
+
'ls': 'ㄹㅅ',
|
|
337
|
+
'lt': 'ㄹㅌ',
|
|
338
|
+
'lp': 'ㄹㅍ',
|
|
339
|
+
'lh': 'ㄹㅎ',
|
|
340
|
+
'ps': 'ㅂㅅ',
|
|
341
|
+
|
|
342
|
+
# Monophthongs (vowels)
|
|
343
|
+
'ii': 'ㅣ',
|
|
344
|
+
'ee': 'ㅔ',
|
|
345
|
+
'qq': 'ㅐ',
|
|
346
|
+
'aa': 'ㅏ',
|
|
347
|
+
'xx': 'ㅡ',
|
|
348
|
+
'vv': 'ㅓ',
|
|
349
|
+
'uu': 'ㅜ',
|
|
350
|
+
'oo': 'ㅗ',
|
|
351
|
+
|
|
352
|
+
# Diphthongs (vowels)
|
|
353
|
+
'ye': 'ㅖ',
|
|
354
|
+
'yq': 'ㅒ',
|
|
355
|
+
'ya': 'ㅑ',
|
|
356
|
+
'yv': 'ㅕ',
|
|
357
|
+
'yu': 'ㅠ',
|
|
358
|
+
'yo': 'ㅛ',
|
|
359
|
+
'wi': 'ㅟ',
|
|
360
|
+
'wo': 'ㅚ',
|
|
361
|
+
'wq': 'ㅙ',
|
|
362
|
+
'we': 'ㅞ',
|
|
363
|
+
'wa': 'ㅘ',
|
|
364
|
+
'wv': 'ㅝ',
|
|
365
|
+
'xi': 'ㅢ',
|
|
366
|
+
}
|
|
367
|
+
|
|
368
|
+
|
|
369
|
+
def runKoG2P(graph, rulebook=None):
|
|
370
|
+
if not rulebook:
|
|
371
|
+
rulebook = f"{os.path.dirname(__file__)}/rulebook.txt"
|
|
372
|
+
[rule_in, rule_out] = readRules(ver_info[0], rulebook)
|
|
373
|
+
words = graph.split()
|
|
374
|
+
phonemized = []
|
|
375
|
+
for w in words:
|
|
376
|
+
phones = graph2prono(w, rule_in, rule_out).split()
|
|
377
|
+
hangul = "".join([kog2p_to_hangul[p] for p in phones])
|
|
378
|
+
phonemized.append(hangul)
|
|
379
|
+
return " ".join(phonemized)
|
|
380
|
+
|
|
381
|
+
|
|
382
|
+
|
|
383
|
+
|
|
@@ -0,0 +1,212 @@
|
|
|
1
|
+
### ----------------------------------------------------------------------------------------
|
|
2
|
+
### 한국어 발음규칙 (Korean G2P Rulebook)
|
|
3
|
+
### Last updated: 2019-01-31
|
|
4
|
+
### Yejin Cho (ycho@utexas.edu)
|
|
5
|
+
### 처리순서:
|
|
6
|
+
### 예외처리 - 유기음화(겹받침) - 겹받침관련규칙 - 경음화 - 겹받침단순화 - 비음화 - 리을 재음절화
|
|
7
|
+
### - 유음화 - 구개음화 - 유기음화(홑받침) - 연음 - 종성중화 - 리을 재음절화 [종료]
|
|
8
|
+
### ----------------------------------------------------------------------------------------
|
|
9
|
+
### 예외처리
|
|
10
|
+
ii,ll,[#-]y([aeoquv]), ii,ll,rr,y\1, # 일 연대, 삼십일여간
|
|
11
|
+
(h0,aa|t0,xx),ll,-ii,ll, \1,ll,rr,ii,ll, # 들일, 볼일, 할일
|
|
12
|
+
s0,vv,ll,-ii,kf, s0,vv,ll,rr,ii,kf, # 설익(다)
|
|
13
|
+
mm,uu,ll,-k0,oo,-k0,ii, mm,uu,ll,kk,oo,k0,ii, # 물고기
|
|
14
|
+
s0,ii,ll,-s0,ii,ll s0,ii,ll,s0,ii,ll # 실실
|
|
15
|
+
k0,ii,-s0,xx,lk, k0,ii,s0,xx,kf, # 기슭
|
|
16
|
+
c0,vv,ll,-ya,kf, c0,vv,rr,ya,kf, # 절약
|
|
17
|
+
k0,xx,mf,-yo,-ii,ll, k0,xx,-mm,yo,-ii,ll, # 금요일
|
|
18
|
+
lt,-ii, ll,-ch,ii, # 훑이
|
|
19
|
+
(?<=nn,vv,)lb,(?=-(c0,(uu|vv),kf|t0,(uu|vv),ng)) pf, # 넓죽/넓둥글다
|
|
20
|
+
(?<=s0,ii,)lh,-c0,(?=xx,ng) ll,cc, # 싫증
|
|
21
|
+
t0,aa,lk, t0,aa,kf, # 닭
|
|
22
|
+
(wq|we|oo),nf,-k0,aa,c0, \1,nf,k0,aa,tf, # 온갖
|
|
23
|
+
mm,aa,tf,-h0,yv,ng, mm,aa,th,yv,ng, # 맏형
|
|
24
|
+
k0,vv,th,-oo,s0, k0,vv,t0,oo,tf, # 겉옷
|
|
25
|
+
c0,uu,ll,-nn,vv,mf,-k0,ii, c0,uu,ll,rr,vv,mf,-kk,ii, # 줄넘기
|
|
26
|
+
h0,oo,th,-ii,-p0,uu,ll, h0,oo,nf,nn,ii,p0,uu,ll, # 홑이불
|
|
27
|
+
s0,aa,ks,-ii,ll, s0,aa,ng,nn,ii,ll, # 삯일
|
|
28
|
+
mm,qq,nf,-ii,pf, mm,qq,nf,nn,ii,pf, # 맨입
|
|
29
|
+
kk,oo,ch,-ii,ph, kk,oo,nf,nn,ii,pf, # 꽃잎
|
|
30
|
+
nn,qq,-p0,oo,kf,-ya,kf, nn,qq,p0,oo,ng,nn,ya,kf, # 내복약
|
|
31
|
+
h0,aa,nf,-yv,-rr,xx,mf, h0,aa,nf,nn,yv,rr,xx,mf, # 한여름
|
|
32
|
+
nn,aa,mf,-c0,oo,nf,-yv,-p0,ii, nn,aa,mf,c0,oo,nf,nn,yv,p0,ii, # 남존여비
|
|
33
|
+
s0,ii,nf,-yv,-s0,vv,ng, s0,ii,nf,nn,yv,s0,vv,ng, # 신여성
|
|
34
|
+
s0,qq,kf,-yv,nf,-ph,ii,ll, s0,qq,ng,nn,yv,nf,ph,ii,ll, # 색연필
|
|
35
|
+
t0,aa,mf,-yo, t0,aa,mf,nn,yo, # 담요
|
|
36
|
+
nn,uu,nf,-yo,-k0,ii, nn,uu,nf,nn,yo,k0,ii, # 눈요기
|
|
37
|
+
vv,pf,-yo,ng, vv,mf,nn,yo,ng, # (영)업용
|
|
38
|
+
s0,ii,kf,-yo,ng,-yu, s0,ii,k0,yo,ng,nn,yu, # 식용유
|
|
39
|
+
nf,-yu,nf,-rr,ii, nf,nn,yu,ll,rr,ii, # (국민)윤리
|
|
40
|
+
(c0|s0),(aa|oo|uu),ll,-ii,(ph|p0|pf), \1,\2,ll,rr,ii,pf, # 잘입다, 솔잎, 술잎
|
|
41
|
+
(?=(^|#))h0,aa,nf,-ii,ll, h0,aa,nf,nn,ii,ll, # 한일
|
|
42
|
+
(?=(^|#))mm,aa,kf,-ii,ll, mm,aa,ng,nn,ii,ll, # 막일
|
|
43
|
+
mm,oo,ll,-s0,aa,ng,-s0,ii,kf, mm,oo,ll,ss,aa,ng,s0,ii,kf, # 몰상식
|
|
44
|
+
oo,s0,#ii,pf, oo,nf,nn,ii,pf, # 옷입(다)
|
|
45
|
+
(nf|ll),-yv,-s0,vv,-s0, \1,nn,yv,s0,vv,tf, # (스물/서른)여섯
|
|
46
|
+
(ng|mf|nf),-y([aeoquv]), \1,nn,y\2, # 밤윷, 직행열차, 콩엿, 볶은엿
|
|
47
|
+
(wv|ii),ll,-y([aeoquv]), \1,rr,y\2, # 일/월요일
|
|
48
|
+
ll,-y([aeoquv]), ll,rr,y\1, # 불여우, 물약, 서울역, 물엿, 물옆, 굴옆, 휘발유, 유들유들
|
|
49
|
+
ii,ll,-c0,vv,ll, ii,ll,cc,vv,ll, # 일절
|
|
50
|
+
(th|tf|s0),-y([aeoquv]), nf,-nn,y\2, # 쑥갓요
|
|
51
|
+
(<=^|#)mm,aa,kf,-ii,ll mm,aa,ng,nn,ii,ll # 막일
|
|
52
|
+
k0,uu,-k0,xx,nf,-rr,yu, k0,uu,k0,xx,nf,nn,yu, # 구근류
|
|
53
|
+
k0,aa,ll,-([ct])0,xx,ng, k0,aa,ll,\1\1,xx,ng, # 갈등/갈증
|
|
54
|
+
p0,aa,ll,-t0,oo,ng, p0,aa,ll,tt,oo,ng, # 발동
|
|
55
|
+
c0,vv,ll,-t0,oo, c0,vv,ll,tt,oo, # 절도
|
|
56
|
+
mm,aa,ll,-s0,aa,ll, mm,aa,ll,ss,aa,ll, # 말살
|
|
57
|
+
p0,uu,ll,-s0, p0,uu,ll,ss, # 불소/불세출
|
|
58
|
+
ii,ll,-s0,ii, ii,ll,ss,ii, # 일시
|
|
59
|
+
p0,aa,ll,-c0,vv,nf, p0,aa,ll,cc,vv,nf, # 발전
|
|
60
|
+
(?<=(s0,ii,nf,|s0,aa,mf,)-)(c|k|t)0, \2\2, # 신고, 신다, 신자, 삼고, 삼다, 삼자
|
|
61
|
+
(?<=k0,ii,mf,-)p0, pp, # 김밥
|
|
62
|
+
(?<=t0,vv,-t0,xx,mf,-)c0, cc, # 더듬지
|
|
63
|
+
c0,aa,mf,-c0,aa,-rr,ii, c0,aa,mf,cc,aa,rr,ii, # 잠자리
|
|
64
|
+
(?<=(ng|ll),-)c0,(?=uu,ll,-k0,ii) cc, # 물줄기, 강줄기
|
|
65
|
+
(?<=(nf|ll),-)p0,vv,pf, pp,vv,pf, # 문법, 불법
|
|
66
|
+
(?<=(nf|tf),-)p0,(?=aa,-rr,aa,mf) pp, # 신바람, 늦바람
|
|
67
|
+
p0,aa,-rr,aa,mf,-k0,yv,ll, p0,aa,rr,aa,mf,kk,yv,ll, # 바람결
|
|
68
|
+
(?<=(mf|kf),-)p0,(?=aa,pf,) pp, # 아침밥, 점심밥, 저녁밥
|
|
69
|
+
(?<=nn,uu,nf,-)t0, tt, # 눈동자, 눈대중
|
|
70
|
+
mm,aa,kf,-yv,mf, mm,aa,ng,nn,yv,mf, # 늑막염, 결막염
|
|
71
|
+
p0,aa,lb,-(t|k)0, p0,aa,pf,\1\1, # 밟다, 밟고
|
|
72
|
+
p0,aa,lb,-nn, p0,aa,mf,nn, # 밟는
|
|
73
|
+
nn,vv,lb,-(t|k)0, nn,vv,ll,\1\1, # 넓다, 넓고
|
|
74
|
+
mm,(aa|vv),s0,-ii,ss,-t0,aa, mm,\1,t0,ii,tf,tt,aa, # 맛있다
|
|
75
|
+
mm,(aa|vv),s0,-vv,ps,-t0,aa, mm,\1,t0,vv,pf,tt,aa, # 맛없다
|
|
76
|
+
c0,vv,c0,-vv,-mm,ii, c0,vv,t0,vv,mm,ii, # 젖어미
|
|
77
|
+
h0,vv,s0,-uu,s0,-xx,mf, h0,vv,t0,uu,s0,xx,mf, # 헛웃음
|
|
78
|
+
k0,aa,ps,-vv,-ch,ii, k0,aa,p0,vv,ch,ii, # 값어치
|
|
79
|
+
k0,aa,ps,-ii,ss,-nn,xx,nf, k0,aa,p0,ii,nf,nn,xx,nf, # 값있는
|
|
80
|
+
c0,vv,lm,-c0,ii, c0,vv,mf,cc,ii, # 젊지
|
|
81
|
+
oo,lm,-k0,(?=[iy]) oo,mf,k0, # 옮기(다)
|
|
82
|
+
k0,uu,lm,-k0,ii,-t0,aa, k0,uu,mf,k0,ii,t0,aa, # 굶기다
|
|
83
|
+
(nn|k0|h0),aa,ll,-(p|s|c|k|t)0, \1,aa,ll,\2\2, # 갈바, 할바, 만날것
|
|
84
|
+
ch,vv,s0,-ii,nf, ch,vv,t0,ii,nf, # 첫인(상)
|
|
85
|
+
(?<=(mf|nf),-)ii,-p0,uu,ll, nn,ii,p0,uu,ll, # 솜이불
|
|
86
|
+
(?<=(nf|ll),-)k0,oo,-rr,ii, kk,oo,rr,ii, # 문고리
|
|
87
|
+
(?<=(nf|ll),-)s0,qq, ss,qq, # 산새, 들새
|
|
88
|
+
(?<=(nf|ll),-)c0,qq,-c0,uu, cc,qq,c0,uu, # 손재주, 글재주
|
|
89
|
+
k0,ii,ll,-k0,aa, k0,ii,ll,kk,aa, # 길가
|
|
90
|
+
mm,uu,ll,-t0,oo,ng,-ii, mm,uu,ll,tt,oo,ng,ii, # 물동이
|
|
91
|
+
mm,uu,ll,-c0, mm,uu,ll,-cc, # 물증
|
|
92
|
+
(?<=(nf|ll),-)p0,aa,-t0,aa,kf, pp,aa,t0,aa,kf, # 발바닥, 손바닥
|
|
93
|
+
(?<=(nf|ll),-)s0,oo,kf, ss,oo,kf, # 굴속, 물속
|
|
94
|
+
(?<=s0,uu,ll,-)(c|p|t)0, \1\1, # 술잔, 술독, 술병, 술자리
|
|
95
|
+
k0,aa,ng,-k0,aa, k0,aa,ng,kk,aa, # 강가
|
|
96
|
+
(?<=(ng|mf),-)t0,aa,ll, tt,aa,ll, # 초승달
|
|
97
|
+
t0,xx,ng,-p0,uu,ll, t0,xx,ng,pp,uu,ll, # 등불
|
|
98
|
+
ch,aa,ng,-s0,aa,ll, ch,aa,ng,ss,aa,ll, # 창살
|
|
99
|
+
(?<=(ll|ng),-)c0,uu,ll,-k0,ii, k0,aa,ng,cc,uu,ll,k0,ii, # 강줄기, 물줄기
|
|
100
|
+
aa,nf,-k0,oo, aa,nf,kk,oo, # 안고
|
|
101
|
+
(?<=kk,yv,-aa,nf,-)(t|c)0, \1\1, # 껴안지, 껴안다
|
|
102
|
+
ii,-c0,uu,kf,-ii,-c0,uu,kf, ii,c0,uu,ng,nn,ii,c0,uu,kf, # 이죽이죽
|
|
103
|
+
ya,-k0,xx,mf,-ya,-k0,xx,mf, ya,k0,xx,mf,nn,ya,k0,xx,mf, # 야금야금
|
|
104
|
+
p0,ee,-k0,qq,s0,-ii,s0, p0,ee,k0,qq,nf,nn,ii,tf, # 베갯잇
|
|
105
|
+
kk,qq,s0,-ii,ph, kk,qq,nf,nn,ii,pf, # 깻잎
|
|
106
|
+
nn,aa,-mm,uu,s0,-ii,ph, nn,aa,mm,uu,nf,nn,ii,pf, # 나뭇잎
|
|
107
|
+
qq,s0,-yv,ll, qq,nf,nn,yv,ll, # 도리깻열
|
|
108
|
+
t0,wi,s0,-(?=[aeqiouyvwx]) t0,wi,nf,-nn, # 뒷윷, 뒷얘기
|
|
109
|
+
nn,xx,c0,-yv,-rr,xx,mf, nn,xx,tf,nn,yv,rr,xx,mf, # 늦여름
|
|
110
|
+
t0,ii,-k0,xx,tf,-(ii|xx|ee), t0,ii,k0,xx,s0,\1, # 디귿에, 디귿이
|
|
111
|
+
(c0|ch|th|h0),ii,-xx,(c0|ch|th|h0),-(ii|xx|ee), \1,ii,xx,s0,\3, # 치읓이, 지읒에
|
|
112
|
+
ph,ii,-xx,ph,-(ii|xx|ee), ph,ii,xx,p0,\1, # 피읖에
|
|
113
|
+
kh,ii,-xx,kh,-(ii|xx|ee), kh,ii,xx,k0,\1, # 키읔이
|
|
114
|
+
### 유기음화 (겹받침)
|
|
115
|
+
l(b|p),-h0, ll,-ph,
|
|
116
|
+
nh,-(c|k|t)0, nf,-\1h,
|
|
117
|
+
lh,-(c|k|t)0, ll,-\1h,
|
|
118
|
+
lk,-h0, ll,-kh,
|
|
119
|
+
nc,-h0, nf,-ch,
|
|
120
|
+
### 겹받침 규칙 (ㄹㅎ)
|
|
121
|
+
(k0,aa,|k0,uu,|k0,vv,|oo,|p0,aa,|nn,aa,|nn,xx,|p0,uu,|^ii,|-,ii,mm,aa,|mm,uu,|(^|-,)vv,)lk,-(t0|c0|s0), \1kf,-\3,
|
|
122
|
+
(k0,aa,|k0,uu,|k0,vv,|vv,|oo,|mm,aa,|p0,aa,|nn,aa,|nn,xx,|mm,uu,|p0,uu,|^ii,|-,ii,)lk,-k0, \1ll,-kk,
|
|
123
|
+
### 겹받침 규칙 (ㄴㅎ)
|
|
124
|
+
nh,-(k|t|c)0, nf,-\1h,
|
|
125
|
+
nh,-s0, nf,-ss,
|
|
126
|
+
nh,-nn, nf,-nn,
|
|
127
|
+
nh,-(?=[aeqiouyvwx]) -nn,
|
|
128
|
+
### 겹받침 규칙 (ㄹㅎ)
|
|
129
|
+
lh,-nn, ll,-rr,
|
|
130
|
+
lh,-(k|t|c)0, ll,-\1h,
|
|
131
|
+
lh,-s0, ll,-ss,
|
|
132
|
+
lh,-(?=[aeqiouyvwx]) -rr,
|
|
133
|
+
### 겹받침 규칙 (ㄴㅈ)
|
|
134
|
+
nc,-([ktsc])0, nf,-\1\1,
|
|
135
|
+
### 겹받침 규칙 (ㄹㅁ)
|
|
136
|
+
(c0,vv,|c0,ii,|k0,uu,|t0,aa,|(^|-,)oo,|k0,oo,)lm,-([ktsc])0, \1mf,-\3\3,
|
|
137
|
+
### 겹받침 규칙 (ㄹㅂ)
|
|
138
|
+
(p0,aa,|tt,vv,|(^|-,)yv,|nn,vv,|(^|-,)ya,|cc,aa,)lb,-([ktsc])0, \1ll,-\4\4,
|
|
139
|
+
### 겹받침 규칙 (ㄹㅌ)
|
|
140
|
+
h0,(aa|uu),lt,-nn, h0,\1,ll,-ll,
|
|
141
|
+
h0,(aa|uu),lt,-([ktsc])0, h0,\1,ll,-\2\2,
|
|
142
|
+
### 경음화
|
|
143
|
+
lk,-(c|k|p|s|t)0, kf,-\1\1,
|
|
144
|
+
l(b|p),-p0, pf,-pp,
|
|
145
|
+
s0,-p0, tf,-pp,
|
|
146
|
+
l(b|t),-(c|k|s|t|p)0, ll,-\2\2,
|
|
147
|
+
lp,-(c|k|s|t)0, pf,-\1\1,
|
|
148
|
+
(c[h0]|s[s0]|t[fh]),-(c|k|s|t)0, tf,-\2\2,
|
|
149
|
+
k[fhks],-(c|k|p|s|t)0, kf,-\1\1,
|
|
150
|
+
p[sfh],-(c|k|p|s|t)0, pf,-\1\1,
|
|
151
|
+
(?<=(kf|kh|ks|ss|c0|ch|tf|th),-)p0, pp,
|
|
152
|
+
h0,-s0, -ss,
|
|
153
|
+
nh,-s0, nf,-ss,
|
|
154
|
+
lh,-s0, ll,-ss,
|
|
155
|
+
### 겹받침 단순화: 어말 또는 자음 앞
|
|
156
|
+
(ks|lk),(?=(#|$|-[ptkshcmnr])) kf,
|
|
157
|
+
n[ch],(?=(#|$|-[ptkshcmnr])) nf,
|
|
158
|
+
l[bsth],(?=(#|$|-[ptkshcmnr])) ll,
|
|
159
|
+
lm,(?=(#|$|-[ptkshcmnr])) mf,
|
|
160
|
+
(ps|lp),(?=(#|$|-[ptkshcmnr])) pf,
|
|
161
|
+
### 겹받침 단순화: 모음 앞
|
|
162
|
+
([kp])s,-(?=[aeqiouyvwx]) \1f,-ss,
|
|
163
|
+
ls,-(?=[aeqiouyvwx]) ll,-ss,
|
|
164
|
+
nc,-(?=[aeqiouyvwx]) nf,-c0,
|
|
165
|
+
lk,-(?=[aeqiouyvwx]) ll,-k0,
|
|
166
|
+
lm,-(?=[aeqiouyvwx]) ll,-mm,
|
|
167
|
+
lb,-(?=[aeqiouyvwx]) ll,-p0,
|
|
168
|
+
l([tp]),-(?=[aeqiouyvwx]) ll,-\1h,
|
|
169
|
+
### 비음화
|
|
170
|
+
(?<=[pk])0,-rr, f,-nn,
|
|
171
|
+
(c0|ch|s0|ss|tf|nh|h0),-nn, nf,-nn,
|
|
172
|
+
nc,-(p|t|k)0, nf,-\1\1,
|
|
173
|
+
nc,(?=-[ptkshcmnr]) nf,
|
|
174
|
+
lm,-k0, mf,-kk,
|
|
175
|
+
lm,(?=-[ptkshcmnr]) mf,
|
|
176
|
+
k[fhks],(?=-(nn|mm),) ng,
|
|
177
|
+
lk,(?=-(nn|mm),) ng,
|
|
178
|
+
p[sfh],(?=-(nn|mm),) mf,
|
|
179
|
+
l[bp],(?=-(nn|mm),) mf,
|
|
180
|
+
(?<=(mf|ng|pf|kf),-)rr, nn,
|
|
181
|
+
(c0|ch|s0|ss|tf|nh|h0),(?=-mm,) nf,
|
|
182
|
+
### 리을 재음절화
|
|
183
|
+
ll,-(?=y) -rr,
|
|
184
|
+
### 유음화
|
|
185
|
+
(nf|ll),-rr, ll,-rr,
|
|
186
|
+
l[lht],-nn, ll,-rr,
|
|
187
|
+
### 구개음화
|
|
188
|
+
tf,-(?=[iy]) -c0,
|
|
189
|
+
th,-(?=[iy]) -ch,
|
|
190
|
+
tf,-h0,(?=[iy]) -ch,
|
|
191
|
+
### 유기음화 (홑받침)
|
|
192
|
+
(p|k)f,-h0, -\1h,
|
|
193
|
+
h0,-(c|k|t)0, -\1h,
|
|
194
|
+
(tf|th|s0),(-|#)h0, -th,
|
|
195
|
+
### 연음규칙
|
|
196
|
+
(s0|ss|kk|p0|ph|pp|t0|th|tt|c0|ch|kh|kk|k0|mm|nn),-(?=[aeqiouyvwx]) -\1,
|
|
197
|
+
nh,-(?=[aeqiouyvwx]) -nn,
|
|
198
|
+
(s0|ss|c0|ch|th),(?=-[ptkshcmnr]) tf,
|
|
199
|
+
h0,-(?=[aeqiouyvwx]) -
|
|
200
|
+
lh,-?(?=[aeqiouyvwx]) -rr,
|
|
201
|
+
(p|t|k)f,-?(?=[aeqiouyvwx]) -\g<1>0,
|
|
202
|
+
(m|n)f,-?(?=[aeqiouyvwx]) -\1\1,
|
|
203
|
+
### 종성규칙
|
|
204
|
+
(s0|ss|c0|ch|th),(?=-|#|$) tf,
|
|
205
|
+
(kh|kk|ks|lk),(?=-|#|$|[ptkshcmnr]) kf, # (ks|lk),(?=-[ptkshcmnr]) kf,
|
|
206
|
+
(ph|lp|ps),(?=-|#|$|[ptkshcmnr]) pf,
|
|
207
|
+
(?<=[ptkshcmnr].),-(?=[aeqiouyvwx]) ,
|
|
208
|
+
l[bhstp],(?=-|#|$|[ptkshcmnr]) ll, # l[bt],(?=-[ptkshcmnr]) ll,
|
|
209
|
+
nh,(?=-|#|$|[ptkshcmnr]) nf,-
|
|
210
|
+
### 리을 재음절화
|
|
211
|
+
(?<=[aeqiouyvwx].,)ll,-(?=[aeqiouyvwx]) -rr,
|
|
212
|
+
ll,-ll, ll,-rr,
|
|
@@ -0,0 +1,15 @@
|
|
|
1
|
+
# Third-party license notice — mantoq
|
|
2
|
+
|
|
3
|
+
This directory vendors the mantoq Arabic G2P pipeline. Its phonetisation core
|
|
4
|
+
(`buck/phonetise_buckwalter.py`) is adapted from Nawar Halabi's
|
|
5
|
+
Arabic-Phonetiser and is licensed under the
|
|
6
|
+
**Creative Commons Attribution-NonCommercial 4.0 International License**
|
|
7
|
+
(https://creativecommons.org/licenses/by-nc/4.0/) — NOT the Apache-2.0 license
|
|
8
|
+
of the rest of this repository.
|
|
9
|
+
|
|
10
|
+
It is kept solely for compatibility with published models trained on mantoq
|
|
11
|
+
phoneme sequences, is never selected automatically, and is only constructed
|
|
12
|
+
when a voice or caller explicitly requests `PhonemeType.MANTOQ`. The Arabic
|
|
13
|
+
default is arbtok. Arabic ↔ Buckwalter transliteration itself is NOT part of
|
|
14
|
+
this notice: it is delegated to `scriptconv.notation`, an independent
|
|
15
|
+
Apache-2.0 implementation of Buckwalter's published mapping.
|