scriptconv 0.0.3a20__tar.gz → 0.0.3a22__tar.gz

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (92) hide show
  1. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/PKG-INFO +3 -1
  2. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/pyproject.toml +4 -2
  3. scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/__init__.py +16 -0
  4. scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/kog2p/LICENSE.md +5 -0
  5. scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/kog2p/__init__.py +383 -0
  6. scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/kog2p/rulebook.txt +212 -0
  7. scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/LICENSE.md +15 -0
  8. scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/__init__.py +42 -0
  9. scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/buck/phonetise_buckwalter.py +459 -0
  10. scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/buck/symbols.py +64 -0
  11. scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/buck/tokenization.py +105 -0
  12. scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/num2words.py +51 -0
  13. scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/unicode_symbol2label.py +4173 -0
  14. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/ar.py +48 -29
  15. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/ko.py +9 -9
  16. scriptconv-0.0.3a22/scriptconv/py.typed +0 -0
  17. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/version.py +1 -1
  18. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv.egg-info/PKG-INFO +3 -1
  19. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv.egg-info/SOURCES.txt +12 -0
  20. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv.egg-info/requires.txt +2 -0
  21. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_phonemizers_cjk_ar.py +26 -9
  22. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/LICENSE +0 -0
  23. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/README.md +0 -0
  24. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/requirements.txt +0 -0
  25. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/__init__.py +0 -0
  26. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/__main__.py +0 -0
  27. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/cangjie.py +0 -0
  28. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/conventions.py +0 -0
  29. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/data/__init__.py +0 -0
  30. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/data/cangjie5_tc.tsv.gz +0 -0
  31. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/graph.py +0 -0
  32. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/notation.py +0 -0
  33. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/__init__.py +0 -0
  34. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/__init__.py +0 -0
  35. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/bw2ipa.py +0 -0
  36. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/hangul2ipa.py +0 -0
  37. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/aspiration.csv +0 -0
  38. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/assimilation.csv +0 -0
  39. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/double_coda.csv +0 -0
  40. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/hanja.tsv +0 -0
  41. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/ipa.csv +0 -0
  42. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/neutralization.csv +0 -0
  43. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/tensification.csv +0 -0
  44. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/ko_tables/yale.csv +0 -0
  45. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/__init__.py +0 -0
  46. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/codeswitch.py +0 -0
  47. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/diacritize.py +0 -0
  48. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/dialectal.py +0 -0
  49. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/english_g2p.py +0 -0
  50. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/espeak.py +0 -0
  51. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/frontend.py +0 -0
  52. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/levantine_g2p.py +0 -0
  53. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/normalize.py +0 -0
  54. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/shami/phoneme_inventory.py +0 -0
  55. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/_thirdparty/zh_num.py +0 -0
  56. /scriptconv-0.0.3a20/scriptconv/py.typed → /scriptconv-0.0.3a22/scriptconv/phonemizers/_vendored/mantoq/buck/__init__.py +0 -0
  57. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/base.py +0 -0
  58. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/en.py +0 -0
  59. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/enums.py +0 -0
  60. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/eu.py +0 -0
  61. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/fa.py +0 -0
  62. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/gl.py +0 -0
  63. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/he.py +0 -0
  64. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/ja.py +0 -0
  65. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/mul.py +0 -0
  66. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/mwl.py +0 -0
  67. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/o2ipa.py +0 -0
  68. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/pt.py +0 -0
  69. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/registry.py +0 -0
  70. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/shami.py +0 -0
  71. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/vi.py +0 -0
  72. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/phonemizers/zh.py +0 -0
  73. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/readings.py +0 -0
  74. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/scripts.py +0 -0
  75. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv/translit.py +0 -0
  76. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv.egg-info/dependency_links.txt +0 -0
  77. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/scriptconv.egg-info/top_level.txt +0 -0
  78. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/setup.cfg +0 -0
  79. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_arpa_stress.py +0 -0
  80. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_cangjie.py +0 -0
  81. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_cli.py +0 -0
  82. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_conventions.py +0 -0
  83. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_errors_policy.py +0 -0
  84. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_examples.py +0 -0
  85. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_graph.py +0 -0
  86. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_notation.py +0 -0
  87. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_phonemizers_base.py +0 -0
  88. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_readings.py +0 -0
  89. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_readings_zh.py +0 -0
  90. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_scripts.py +0 -0
  91. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_scripts_stressonnx_compat.py +0 -0
  92. {scriptconv-0.0.3a20 → scriptconv-0.0.3a22}/tests/test_translit.py +0 -0
@@ -1,6 +1,6 @@
1
1
  Metadata-Version: 2.4
2
2
  Name: scriptconv
3
- Version: 0.0.3a20
3
+ Version: 0.0.3a22
4
4
  Summary: Zero-dependency script & phoneme-notation core — ISO-15924 detection & metadata, IPA↔ARPABET/X-SAMPA/Lexique/Kirshenbaum/Cotovía/RFE, Buckwalter↔Arabic, Hangul→jamo, kana
5
5
  License: Apache-2.0
6
6
  Project-URL: Homepage, https://github.com/TigreGotico/scriptconv
@@ -102,6 +102,7 @@ Requires-Dist: deep-phonemizer; extra == "en-phonemizers"
102
102
  Provides-Extra: ar-phonemizers
103
103
  Requires-Dist: scriptconv[phonemizers]; extra == "ar-phonemizers"
104
104
  Requires-Dist: arbtok; extra == "ar-phonemizers"
105
+ Requires-Dist: ovos-number-parser; extra == "ar-phonemizers"
105
106
  Provides-Extra: shami
106
107
  Requires-Dist: scriptconv[phonemizers]; extra == "shami"
107
108
  Requires-Dist: regex; extra == "shami"
@@ -113,6 +114,7 @@ Requires-Dist: pypinyin<1,>=0.50; extra == "test"
113
114
  Requires-Dist: quebra-frases; extra == "test"
114
115
  Requires-Dist: langcodes; extra == "test"
115
116
  Requires-Dist: regex; extra == "test"
117
+ Requires-Dist: ovos-number-parser; extra == "test"
116
118
  Dynamic: license-file
117
119
 
118
120
  # scriptconv
@@ -57,9 +57,9 @@ ja-phonemizers = ["scriptconv[phonemizers]", "pyopenjtalk", "cutlet", "pykakasi>
57
57
  ko = ["scriptconv[phonemizers]", "g2pk", "regex"]
58
58
  zh-phonemizers = ["scriptconv[phonemizers]", "jieba", "pypinyin>=0.50,<1", "xpinyin", "g2pM", "pinyin_to_ipa"]
59
59
  en-phonemizers = ["scriptconv[phonemizers]", "g2p_en", "openphonemizer", "deep-phonemizer"]
60
- ar-phonemizers = ["scriptconv[phonemizers]", "arbtok"]
60
+ ar-phonemizers = ["scriptconv[phonemizers]", "arbtok", "ovos-number-parser"]
61
61
  shami = ["scriptconv[phonemizers]", "regex"]
62
- test = ["pytest", "pytest-timeout", "pykakasi>=2.3,<3", "pypinyin>=0.50,<1", "quebra-frases", "langcodes", "regex"]
62
+ test = ["pytest", "pytest-timeout", "pykakasi>=2.3,<3", "pypinyin>=0.50,<1", "quebra-frases", "langcodes", "regex", "ovos-number-parser"]
63
63
 
64
64
  [project.urls]
65
65
  Homepage = "https://github.com/TigreGotico/scriptconv"
@@ -72,6 +72,8 @@ include = ["scriptconv*"]
72
72
  scriptconv = ["py.typed"]
73
73
  "scriptconv.data" = ["*.tsv.gz"]
74
74
  "scriptconv.phonemizers._thirdparty" = ["ko_tables/*.csv", "ko_tables/*.tsv"]
75
+ "scriptconv.phonemizers._vendored.kog2p" = ["rulebook.txt", "LICENSE.md"]
76
+ "scriptconv.phonemizers._vendored.mantoq" = ["LICENSE.md"]
75
77
 
76
78
  [tool.pytest.ini_options]
77
79
  testpaths = ["tests"]
@@ -0,0 +1,16 @@
1
+ """QUARANTINED vendored code — NOT covered by scriptconv's Apache-2.0 license.
2
+
3
+ Each subpackage here is unpublished upstream code vendored for usability,
4
+ distributed under ITS OWN license, stated in its directory:
5
+
6
+ * ``mantoq/`` — Arabic G2P (github.com/mush42/mantoq). Its phonetisation core
7
+ (``buck/phonetise_buckwalter.py``) is **CC BY-NC 4.0** (Nawar Halabi's
8
+ Arabic-Phonetiser) — non-commercial use only. See ``mantoq/LICENSE.md``.
9
+ * ``kog2p/`` — Korean G2P (github.com/scarletcho/KoG2P), **GPL-3.0**.
10
+ See ``kog2p/LICENSE.md``.
11
+
12
+ Nothing in scriptconv imports these at package import time; they load only
13
+ when a caller explicitly requests the corresponding phonemizer, accepting the
14
+ subpackage's license by doing so. Unencumbered alternatives exist for both
15
+ (arbtok for Arabic, g2pk for Korean) and remain the defaults.
16
+ """
@@ -0,0 +1,5 @@
1
+ # Third-party license notice — KoG2P
2
+
3
+ Vendored from https://github.com/scarletcho/KoG2P, licensed **GPL-3.0** —
4
+ NOT the Apache-2.0 license of the rest of this repository. Loaded only on an
5
+ explicit `Phonemizer.KOG2PK` request; the Korean default is g2pk.
@@ -0,0 +1,383 @@
1
+ # taken from https://github.com/scarletcho/KoG2P
2
+ '''
3
+ g2p.py
4
+ ~~~~~~~~~~
5
+
6
+ This script converts Korean graphemes to romanized phones and then to pronunciation.
7
+
8
+ (1) graph2phone: convert Korean graphemes to romanized phones
9
+ (2) phone2prono: convert romanized phones to pronunciation
10
+ (3) graph2phone: convert Korean graphemes to pronunciation
11
+
12
+ Usage: $ python g2p.py '스물 여덟째 사람'
13
+ (NB. Please check 'rulebook_path' before usage.)
14
+
15
+ Yejin Cho (ycho@utexas.edu)
16
+ Jaegu Kang (jaekoo.jk@gmail.com)
17
+ Hyungwon Yang (hyung8758@gmail.com)
18
+ Yeonjung Hong (yvonne.yj.hong@gmail.com)
19
+
20
+ Created: 2016-08-11
21
+ Last updated: 2019-01-31 Yejin Cho
22
+
23
+ * Key updates made:
24
+ - Executable in both Python 2 and 3.
25
+ - G2P Performance test available ($ python g2p.py test)
26
+ - G2P verbosity control available
27
+
28
+ '''
29
+
30
+ import datetime as dt
31
+ import os.path
32
+ import re
33
+ import math
34
+ import sys
35
+ import optparse
36
+
37
+ # Option
38
+ # Import-time CLI parsing removed for library use (the upstream script
39
+ # parsed sys.argv on import, which breaks under any host process with its
40
+ # own arguments); verbose output is off in library context.
41
+ verbose = False
42
+
43
+ # Check Python version
44
+ ver_info = sys.version_info
45
+
46
+ if ver_info[0] == 2:
47
+ reload(sys)
48
+ sys.setdefaultencoding('utf-8')
49
+
50
+
51
+ def readfileUTF8(fname):
52
+ f = open(fname, 'r')
53
+ corpus = []
54
+
55
+ while True:
56
+ line = f.readline()
57
+ line = line.encode("utf-8")
58
+ line = re.sub(u'\n', u'', line)
59
+ if line != u'':
60
+ corpus.append(line)
61
+ if not line: break
62
+
63
+ f.close()
64
+ return corpus
65
+
66
+
67
+ def writefile(body, fname):
68
+ out = open(fname, 'w')
69
+ for line in body:
70
+ out.write('{}\n'.format(line))
71
+ out.close()
72
+
73
+
74
+ def readRules(pver, rule_book):
75
+ if pver == 2:
76
+ f = open(rule_book, 'r')
77
+ elif pver == 3:
78
+ f = open(rule_book, 'r', encoding="utf-8")
79
+
80
+ rule_in = []
81
+ rule_out = []
82
+
83
+ while True:
84
+ line = f.readline()
85
+ if pver == 2:
86
+ line = unicode(line.encode("utf-8"))
87
+ line = re.sub(u'\n', u'', line)
88
+ elif pver == 3:
89
+ line = re.sub('\n', '', line)
90
+
91
+ if line != u'':
92
+ if line[0] != u'#':
93
+ IOlist = line.split('\t')
94
+ rule_in.append(IOlist[0])
95
+ if IOlist[1]:
96
+ rule_out.append(IOlist[1])
97
+ else: # If output is empty (i.e. deletion rule)
98
+ rule_out.append(u'')
99
+ if not line: break
100
+ f.close()
101
+
102
+ return rule_in, rule_out
103
+
104
+
105
+ def isHangul(charint):
106
+ hangul_init = 44032
107
+ hangul_fin = 55203
108
+ return charint >= hangul_init and charint <= hangul_fin
109
+
110
+
111
+ def checkCharType(var_list):
112
+ # 1: whitespace
113
+ # 0: hangul
114
+ # -1: non-hangul
115
+ checked = []
116
+ for i in range(len(var_list)):
117
+ if var_list[i] == 32: # whitespace
118
+ checked.append(1)
119
+ elif isHangul(var_list[i]): # Hangul character
120
+ checked.append(0)
121
+ else: # Non-hangul character
122
+ checked.append(-1)
123
+ return checked
124
+
125
+
126
+ def graph2phone(graphs):
127
+ # Encode graphemes as utf8
128
+ try:
129
+ graphs = graphs.decode('utf8')
130
+ except AttributeError:
131
+ pass
132
+
133
+ integers = []
134
+ for i in range(len(graphs)):
135
+ integers.append(ord(graphs[i]))
136
+
137
+ # Romanization (according to Korean Spontaneous Speech corpus; 성인자유발화코퍼스)
138
+ phones = ''
139
+ ONS = ['k0', 'kk', 'nn', 't0', 'tt', 'rr', 'mm', 'p0', 'pp',
140
+ 's0', 'ss', 'oh', 'c0', 'cc', 'ch', 'kh', 'th', 'ph', 'h0']
141
+ NUC = ['aa', 'qq', 'ya', 'yq', 'vv', 'ee', 'yv', 'ye', 'oo', 'wa',
142
+ 'wq', 'wo', 'yo', 'uu', 'wv', 'we', 'wi', 'yu', 'xx', 'xi', 'ii']
143
+ COD = ['', 'kf', 'kk', 'ks', 'nf', 'nc', 'nh', 'tf',
144
+ 'll', 'lk', 'lm', 'lb', 'ls', 'lt', 'lp', 'lh',
145
+ 'mf', 'pf', 'ps', 's0', 'ss', 'oh', 'c0', 'ch',
146
+ 'kh', 'th', 'ph', 'h0']
147
+
148
+ # Pronunciation
149
+ idx = checkCharType(integers)
150
+ iElement = 0
151
+ while iElement < len(integers):
152
+ if idx[iElement] == 0: # not space characters
153
+ base = 44032
154
+ df = int(integers[iElement]) - base
155
+ iONS = int(math.floor(df / 588)) + 1
156
+ iNUC = int(math.floor((df % 588) / 28)) + 1
157
+ iCOD = int((df % 588) % 28) + 1
158
+
159
+ s1 = '-' + ONS[iONS - 1] # onset
160
+ s2 = NUC[iNUC - 1] # nucleus
161
+
162
+ if COD[iCOD - 1]: # coda
163
+ s3 = COD[iCOD - 1]
164
+ else:
165
+ s3 = ''
166
+ tmp = s1 + s2 + s3
167
+ phones = phones + tmp
168
+
169
+ elif idx[iElement] == 1: # space character
170
+ tmp = '#'
171
+ phones = phones + tmp
172
+
173
+ phones = re.sub('-(oh)', '-', phones)
174
+ iElement += 1
175
+ tmp = ''
176
+
177
+ # 초성 이응 삭제
178
+ phones = re.sub('^oh', '', phones)
179
+ phones = re.sub('-(oh)', '', phones)
180
+
181
+ # 받침 이응 'ng'으로 처리 (Velar nasal in coda position)
182
+ phones = re.sub('oh-', 'ng-', phones)
183
+ phones = re.sub('oh([# ]|$)', 'ng', phones)
184
+
185
+ # Remove all characters except Hangul and syllable delimiter (hyphen; '-')
186
+ phones = re.sub(r'(\W+)\-', '\\1', phones)
187
+ phones = re.sub(r'\W+$', '', phones)
188
+ phones = re.sub(r'^\-', '', phones)
189
+ return phones
190
+
191
+
192
+ def phone2prono(phones, rule_in, rule_out):
193
+ # Apply g2p rules
194
+ for pattern, replacement in zip(rule_in, rule_out):
195
+ # print pattern
196
+ phones = re.sub(pattern, replacement, phones)
197
+ prono = phones
198
+ return prono
199
+
200
+
201
+ def addPhoneBoundary(phones):
202
+ # Add a comma (,) after every second alphabets to mark phone boundaries
203
+ ipos = 0
204
+ newphones = ''
205
+ while ipos + 2 <= len(phones):
206
+ if phones[ipos] == u'-':
207
+ newphones = newphones + phones[ipos]
208
+ ipos += 1
209
+ elif phones[ipos] == u' ':
210
+ ipos += 1
211
+ elif phones[ipos] == u'#':
212
+ newphones = newphones + phones[ipos]
213
+ ipos += 1
214
+
215
+ newphones = newphones + phones[ipos] + phones[ipos + 1] + u','
216
+ ipos += 2
217
+
218
+ return newphones
219
+
220
+
221
+ def addSpace(phones):
222
+ ipos = 0
223
+ newphones = ''
224
+ while ipos < len(phones):
225
+ if ipos == 0:
226
+ newphones = newphones + phones[ipos] + phones[ipos + 1]
227
+ else:
228
+ newphones = newphones + ' ' + phones[ipos] + phones[ipos + 1]
229
+ ipos += 2
230
+
231
+ return newphones
232
+
233
+
234
+ def graph2prono(graphs, rule_in, rule_out):
235
+ romanized = graph2phone(graphs)
236
+ romanized_bd = addPhoneBoundary(romanized)
237
+ prono = phone2prono(romanized_bd, rule_in, rule_out)
238
+
239
+ prono = re.sub(u',', u' ', prono)
240
+ prono = re.sub(u' $', u'', prono)
241
+ prono = re.sub(u'#', u'-', prono)
242
+ prono = re.sub(u'-+', u'-', prono)
243
+
244
+ prono_prev = prono
245
+ identical = False
246
+ loop_cnt = 1
247
+
248
+ if verbose == True:
249
+ print('=> Romanized: ' + romanized)
250
+ print('=> Romanized with boundaries: ' + romanized_bd)
251
+ print('=> Initial output: ' + prono)
252
+
253
+ while not identical:
254
+ prono_new = phone2prono(re.sub(u' ', u',', prono_prev + u','), rule_in, rule_out)
255
+ prono_new = re.sub(u',', u' ', prono_new)
256
+ prono_new = re.sub(u' $', u'', prono_new)
257
+
258
+ if re.sub(u'-', u'', prono_prev) == re.sub(u'-', u'', prono_new):
259
+ identical = True
260
+ prono_new = re.sub(u'-', u'', prono_new)
261
+ if verbose == True:
262
+ print('\n=> Exhaustive rule application completed!')
263
+ print('=> Total loop count: ' + str(loop_cnt))
264
+ print('=> Output: ' + prono_new)
265
+ else:
266
+ if verbose == True:
267
+ print('\n=> Rule applied for more than once')
268
+ print('cmp1: ' + re.sub(u'-', u'', prono_prev))
269
+ print('cmp2: ' + re.sub(u'-', u'', prono_new))
270
+ loop_cnt += 1
271
+ prono_prev = prono_new
272
+
273
+ return prono_new
274
+
275
+
276
+ def testG2P(rulebook, testset):
277
+ [testin, testout] = readRules(ver_info[0], testset)
278
+ cnt = 0
279
+ body = []
280
+ for idx in range(0, len(testin)):
281
+ print('Test item #: ' + str(idx + 1) + '/' + str(len(testin)))
282
+ item_in = testin[idx]
283
+ item_out = testout[idx]
284
+ ans = graph2phone(item_out)
285
+ ans = re.sub(u'-', u'', ans)
286
+ ans = addSpace(ans)
287
+
288
+ [rule_in, rule_out] = readRules(ver_info[0], rulebook)
289
+ pred = graph2prono(item_in, rule_in, rule_out)
290
+
291
+ if pred != ans:
292
+ print('G2P ERROR: [result] ' + pred + '\t\t\t[ans] ' + item_in + ' [' + item_out + '] ' + ans)
293
+ cnt += 1
294
+ else:
295
+ body.append('[result] ' + pred + '\t\t\t[ans] ' + item_in + ' [' + item_out + '] ' + ans)
296
+
297
+ print('Total error item #: ' + str(cnt))
298
+ writefile(body, 'good.txt')
299
+
300
+
301
+ kog2p_to_hangul = {
302
+ # Onset consonants
303
+ 'p0': 'ㅂ',
304
+ 'ph': 'ㅍ',
305
+ 'pp': 'ㅃ',
306
+ 't0': 'ㄷ',
307
+ 'th': 'ㅌ',
308
+ 'tt': 'ㄸ',
309
+ 'k0': 'ㄱ',
310
+ 'kh': 'ㅋ',
311
+ 'kk': 'ㄲ',
312
+ 's0': 'ㅅ',
313
+ 'ss': 'ㅆ',
314
+ 'h0': 'ㅎ',
315
+ 'c0': 'ㅈ',
316
+ 'ch': 'ㅊ',
317
+ 'cc': 'ㅉ',
318
+ 'mm': 'ㅁ',
319
+ 'nn': 'ㄴ',
320
+ 'rr': 'ㄹ',
321
+
322
+ # Coda consonants
323
+ 'pf': 'ㅂ',
324
+ 'tf': 'ㄷ',
325
+ 'kf': 'ㄱ',
326
+ 'mf': 'ㅁ',
327
+ 'nf': 'ㄴ',
328
+ 'ng': 'ㅇ',
329
+ 'll': 'ㄹ',
330
+ 'ks': 'ㄱㅅ',
331
+ 'nc': 'ㄴㅈ',
332
+ 'nh': 'ㄴㅎ',
333
+ 'lk': 'ㄹㄱ',
334
+ 'lm': 'ㄹㅁ',
335
+ 'lb': 'ㄹㅂ',
336
+ 'ls': 'ㄹㅅ',
337
+ 'lt': 'ㄹㅌ',
338
+ 'lp': 'ㄹㅍ',
339
+ 'lh': 'ㄹㅎ',
340
+ 'ps': 'ㅂㅅ',
341
+
342
+ # Monophthongs (vowels)
343
+ 'ii': 'ㅣ',
344
+ 'ee': 'ㅔ',
345
+ 'qq': 'ㅐ',
346
+ 'aa': 'ㅏ',
347
+ 'xx': 'ㅡ',
348
+ 'vv': 'ㅓ',
349
+ 'uu': 'ㅜ',
350
+ 'oo': 'ㅗ',
351
+
352
+ # Diphthongs (vowels)
353
+ 'ye': 'ㅖ',
354
+ 'yq': 'ㅒ',
355
+ 'ya': 'ㅑ',
356
+ 'yv': 'ㅕ',
357
+ 'yu': 'ㅠ',
358
+ 'yo': 'ㅛ',
359
+ 'wi': 'ㅟ',
360
+ 'wo': 'ㅚ',
361
+ 'wq': 'ㅙ',
362
+ 'we': 'ㅞ',
363
+ 'wa': 'ㅘ',
364
+ 'wv': 'ㅝ',
365
+ 'xi': 'ㅢ',
366
+ }
367
+
368
+
369
+ def runKoG2P(graph, rulebook=None):
370
+ if not rulebook:
371
+ rulebook = f"{os.path.dirname(__file__)}/rulebook.txt"
372
+ [rule_in, rule_out] = readRules(ver_info[0], rulebook)
373
+ words = graph.split()
374
+ phonemized = []
375
+ for w in words:
376
+ phones = graph2prono(w, rule_in, rule_out).split()
377
+ hangul = "".join([kog2p_to_hangul[p] for p in phones])
378
+ phonemized.append(hangul)
379
+ return " ".join(phonemized)
380
+
381
+
382
+
383
+
@@ -0,0 +1,212 @@
1
+ ### ----------------------------------------------------------------------------------------
2
+ ### 한국어 발음규칙 (Korean G2P Rulebook)
3
+ ### Last updated: 2019-01-31
4
+ ### Yejin Cho (ycho@utexas.edu)
5
+ ### 처리순서:
6
+ ### 예외처리 - 유기음화(겹받침) - 겹받침관련규칙 - 경음화 - 겹받침단순화 - 비음화 - 리을 재음절화
7
+ ### - 유음화 - 구개음화 - 유기음화(홑받침) - 연음 - 종성중화 - 리을 재음절화 [종료]
8
+ ### ----------------------------------------------------------------------------------------
9
+ ### 예외처리
10
+ ii,ll,[#-]y([aeoquv]), ii,ll,rr,y\1, # 일 연대, 삼십일여간
11
+ (h0,aa|t0,xx),ll,-ii,ll, \1,ll,rr,ii,ll, # 들일, 볼일, 할일
12
+ s0,vv,ll,-ii,kf, s0,vv,ll,rr,ii,kf, # 설익(다)
13
+ mm,uu,ll,-k0,oo,-k0,ii, mm,uu,ll,kk,oo,k0,ii, # 물고기
14
+ s0,ii,ll,-s0,ii,ll s0,ii,ll,s0,ii,ll # 실실
15
+ k0,ii,-s0,xx,lk, k0,ii,s0,xx,kf, # 기슭
16
+ c0,vv,ll,-ya,kf, c0,vv,rr,ya,kf, # 절약
17
+ k0,xx,mf,-yo,-ii,ll, k0,xx,-mm,yo,-ii,ll, # 금요일
18
+ lt,-ii, ll,-ch,ii, # 훑이
19
+ (?<=nn,vv,)lb,(?=-(c0,(uu|vv),kf|t0,(uu|vv),ng)) pf, # 넓죽/넓둥글다
20
+ (?<=s0,ii,)lh,-c0,(?=xx,ng) ll,cc, # 싫증
21
+ t0,aa,lk, t0,aa,kf, # 닭
22
+ (wq|we|oo),nf,-k0,aa,c0, \1,nf,k0,aa,tf, # 온갖
23
+ mm,aa,tf,-h0,yv,ng, mm,aa,th,yv,ng, # 맏형
24
+ k0,vv,th,-oo,s0, k0,vv,t0,oo,tf, # 겉옷
25
+ c0,uu,ll,-nn,vv,mf,-k0,ii, c0,uu,ll,rr,vv,mf,-kk,ii, # 줄넘기
26
+ h0,oo,th,-ii,-p0,uu,ll, h0,oo,nf,nn,ii,p0,uu,ll, # 홑이불
27
+ s0,aa,ks,-ii,ll, s0,aa,ng,nn,ii,ll, # 삯일
28
+ mm,qq,nf,-ii,pf, mm,qq,nf,nn,ii,pf, # 맨입
29
+ kk,oo,ch,-ii,ph, kk,oo,nf,nn,ii,pf, # 꽃잎
30
+ nn,qq,-p0,oo,kf,-ya,kf, nn,qq,p0,oo,ng,nn,ya,kf, # 내복약
31
+ h0,aa,nf,-yv,-rr,xx,mf, h0,aa,nf,nn,yv,rr,xx,mf, # 한여름
32
+ nn,aa,mf,-c0,oo,nf,-yv,-p0,ii, nn,aa,mf,c0,oo,nf,nn,yv,p0,ii, # 남존여비
33
+ s0,ii,nf,-yv,-s0,vv,ng, s0,ii,nf,nn,yv,s0,vv,ng, # 신여성
34
+ s0,qq,kf,-yv,nf,-ph,ii,ll, s0,qq,ng,nn,yv,nf,ph,ii,ll, # 색연필
35
+ t0,aa,mf,-yo, t0,aa,mf,nn,yo, # 담요
36
+ nn,uu,nf,-yo,-k0,ii, nn,uu,nf,nn,yo,k0,ii, # 눈요기
37
+ vv,pf,-yo,ng, vv,mf,nn,yo,ng, # (영)업용
38
+ s0,ii,kf,-yo,ng,-yu, s0,ii,k0,yo,ng,nn,yu, # 식용유
39
+ nf,-yu,nf,-rr,ii, nf,nn,yu,ll,rr,ii, # (국민)윤리
40
+ (c0|s0),(aa|oo|uu),ll,-ii,(ph|p0|pf), \1,\2,ll,rr,ii,pf, # 잘입다, 솔잎, 술잎
41
+ (?=(^|#))h0,aa,nf,-ii,ll, h0,aa,nf,nn,ii,ll, # 한일
42
+ (?=(^|#))mm,aa,kf,-ii,ll, mm,aa,ng,nn,ii,ll, # 막일
43
+ mm,oo,ll,-s0,aa,ng,-s0,ii,kf, mm,oo,ll,ss,aa,ng,s0,ii,kf, # 몰상식
44
+ oo,s0,#ii,pf, oo,nf,nn,ii,pf, # 옷입(다)
45
+ (nf|ll),-yv,-s0,vv,-s0, \1,nn,yv,s0,vv,tf, # (스물/서른)여섯
46
+ (ng|mf|nf),-y([aeoquv]), \1,nn,y\2, # 밤윷, 직행열차, 콩엿, 볶은엿
47
+ (wv|ii),ll,-y([aeoquv]), \1,rr,y\2, # 일/월요일
48
+ ll,-y([aeoquv]), ll,rr,y\1, # 불여우, 물약, 서울역, 물엿, 물옆, 굴옆, 휘발유, 유들유들
49
+ ii,ll,-c0,vv,ll, ii,ll,cc,vv,ll, # 일절
50
+ (th|tf|s0),-y([aeoquv]), nf,-nn,y\2, # 쑥갓요
51
+ (<=^|#)mm,aa,kf,-ii,ll mm,aa,ng,nn,ii,ll # 막일
52
+ k0,uu,-k0,xx,nf,-rr,yu, k0,uu,k0,xx,nf,nn,yu, # 구근류
53
+ k0,aa,ll,-([ct])0,xx,ng, k0,aa,ll,\1\1,xx,ng, # 갈등/갈증
54
+ p0,aa,ll,-t0,oo,ng, p0,aa,ll,tt,oo,ng, # 발동
55
+ c0,vv,ll,-t0,oo, c0,vv,ll,tt,oo, # 절도
56
+ mm,aa,ll,-s0,aa,ll, mm,aa,ll,ss,aa,ll, # 말살
57
+ p0,uu,ll,-s0, p0,uu,ll,ss, # 불소/불세출
58
+ ii,ll,-s0,ii, ii,ll,ss,ii, # 일시
59
+ p0,aa,ll,-c0,vv,nf, p0,aa,ll,cc,vv,nf, # 발전
60
+ (?<=(s0,ii,nf,|s0,aa,mf,)-)(c|k|t)0, \2\2, # 신고, 신다, 신자, 삼고, 삼다, 삼자
61
+ (?<=k0,ii,mf,-)p0, pp, # 김밥
62
+ (?<=t0,vv,-t0,xx,mf,-)c0, cc, # 더듬지
63
+ c0,aa,mf,-c0,aa,-rr,ii, c0,aa,mf,cc,aa,rr,ii, # 잠자리
64
+ (?<=(ng|ll),-)c0,(?=uu,ll,-k0,ii) cc, # 물줄기, 강줄기
65
+ (?<=(nf|ll),-)p0,vv,pf, pp,vv,pf, # 문법, 불법
66
+ (?<=(nf|tf),-)p0,(?=aa,-rr,aa,mf) pp, # 신바람, 늦바람
67
+ p0,aa,-rr,aa,mf,-k0,yv,ll, p0,aa,rr,aa,mf,kk,yv,ll, # 바람결
68
+ (?<=(mf|kf),-)p0,(?=aa,pf,) pp, # 아침밥, 점심밥, 저녁밥
69
+ (?<=nn,uu,nf,-)t0, tt, # 눈동자, 눈대중
70
+ mm,aa,kf,-yv,mf, mm,aa,ng,nn,yv,mf, # 늑막염, 결막염
71
+ p0,aa,lb,-(t|k)0, p0,aa,pf,\1\1, # 밟다, 밟고
72
+ p0,aa,lb,-nn, p0,aa,mf,nn, # 밟는
73
+ nn,vv,lb,-(t|k)0, nn,vv,ll,\1\1, # 넓다, 넓고
74
+ mm,(aa|vv),s0,-ii,ss,-t0,aa, mm,\1,t0,ii,tf,tt,aa, # 맛있다
75
+ mm,(aa|vv),s0,-vv,ps,-t0,aa, mm,\1,t0,vv,pf,tt,aa, # 맛없다
76
+ c0,vv,c0,-vv,-mm,ii, c0,vv,t0,vv,mm,ii, # 젖어미
77
+ h0,vv,s0,-uu,s0,-xx,mf, h0,vv,t0,uu,s0,xx,mf, # 헛웃음
78
+ k0,aa,ps,-vv,-ch,ii, k0,aa,p0,vv,ch,ii, # 값어치
79
+ k0,aa,ps,-ii,ss,-nn,xx,nf, k0,aa,p0,ii,nf,nn,xx,nf, # 값있는
80
+ c0,vv,lm,-c0,ii, c0,vv,mf,cc,ii, # 젊지
81
+ oo,lm,-k0,(?=[iy]) oo,mf,k0, # 옮기(다)
82
+ k0,uu,lm,-k0,ii,-t0,aa, k0,uu,mf,k0,ii,t0,aa, # 굶기다
83
+ (nn|k0|h0),aa,ll,-(p|s|c|k|t)0, \1,aa,ll,\2\2, # 갈바, 할바, 만날것
84
+ ch,vv,s0,-ii,nf, ch,vv,t0,ii,nf, # 첫인(상)
85
+ (?<=(mf|nf),-)ii,-p0,uu,ll, nn,ii,p0,uu,ll, # 솜이불
86
+ (?<=(nf|ll),-)k0,oo,-rr,ii, kk,oo,rr,ii, # 문고리
87
+ (?<=(nf|ll),-)s0,qq, ss,qq, # 산새, 들새
88
+ (?<=(nf|ll),-)c0,qq,-c0,uu, cc,qq,c0,uu, # 손재주, 글재주
89
+ k0,ii,ll,-k0,aa, k0,ii,ll,kk,aa, # 길가
90
+ mm,uu,ll,-t0,oo,ng,-ii, mm,uu,ll,tt,oo,ng,ii, # 물동이
91
+ mm,uu,ll,-c0, mm,uu,ll,-cc, # 물증
92
+ (?<=(nf|ll),-)p0,aa,-t0,aa,kf, pp,aa,t0,aa,kf, # 발바닥, 손바닥
93
+ (?<=(nf|ll),-)s0,oo,kf, ss,oo,kf, # 굴속, 물속
94
+ (?<=s0,uu,ll,-)(c|p|t)0, \1\1, # 술잔, 술독, 술병, 술자리
95
+ k0,aa,ng,-k0,aa, k0,aa,ng,kk,aa, # 강가
96
+ (?<=(ng|mf),-)t0,aa,ll, tt,aa,ll, # 초승달
97
+ t0,xx,ng,-p0,uu,ll, t0,xx,ng,pp,uu,ll, # 등불
98
+ ch,aa,ng,-s0,aa,ll, ch,aa,ng,ss,aa,ll, # 창살
99
+ (?<=(ll|ng),-)c0,uu,ll,-k0,ii, k0,aa,ng,cc,uu,ll,k0,ii, # 강줄기, 물줄기
100
+ aa,nf,-k0,oo, aa,nf,kk,oo, # 안고
101
+ (?<=kk,yv,-aa,nf,-)(t|c)0, \1\1, # 껴안지, 껴안다
102
+ ii,-c0,uu,kf,-ii,-c0,uu,kf, ii,c0,uu,ng,nn,ii,c0,uu,kf, # 이죽이죽
103
+ ya,-k0,xx,mf,-ya,-k0,xx,mf, ya,k0,xx,mf,nn,ya,k0,xx,mf, # 야금야금
104
+ p0,ee,-k0,qq,s0,-ii,s0, p0,ee,k0,qq,nf,nn,ii,tf, # 베갯잇
105
+ kk,qq,s0,-ii,ph, kk,qq,nf,nn,ii,pf, # 깻잎
106
+ nn,aa,-mm,uu,s0,-ii,ph, nn,aa,mm,uu,nf,nn,ii,pf, # 나뭇잎
107
+ qq,s0,-yv,ll, qq,nf,nn,yv,ll, # 도리깻열
108
+ t0,wi,s0,-(?=[aeqiouyvwx]) t0,wi,nf,-nn, # 뒷윷, 뒷얘기
109
+ nn,xx,c0,-yv,-rr,xx,mf, nn,xx,tf,nn,yv,rr,xx,mf, # 늦여름
110
+ t0,ii,-k0,xx,tf,-(ii|xx|ee), t0,ii,k0,xx,s0,\1, # 디귿에, 디귿이
111
+ (c0|ch|th|h0),ii,-xx,(c0|ch|th|h0),-(ii|xx|ee), \1,ii,xx,s0,\3, # 치읓이, 지읒에
112
+ ph,ii,-xx,ph,-(ii|xx|ee), ph,ii,xx,p0,\1, # 피읖에
113
+ kh,ii,-xx,kh,-(ii|xx|ee), kh,ii,xx,k0,\1, # 키읔이
114
+ ### 유기음화 (겹받침)
115
+ l(b|p),-h0, ll,-ph,
116
+ nh,-(c|k|t)0, nf,-\1h,
117
+ lh,-(c|k|t)0, ll,-\1h,
118
+ lk,-h0, ll,-kh,
119
+ nc,-h0, nf,-ch,
120
+ ### 겹받침 규칙 (ㄹㅎ)
121
+ (k0,aa,|k0,uu,|k0,vv,|oo,|p0,aa,|nn,aa,|nn,xx,|p0,uu,|^ii,|-,ii,mm,aa,|mm,uu,|(^|-,)vv,)lk,-(t0|c0|s0), \1kf,-\3,
122
+ (k0,aa,|k0,uu,|k0,vv,|vv,|oo,|mm,aa,|p0,aa,|nn,aa,|nn,xx,|mm,uu,|p0,uu,|^ii,|-,ii,)lk,-k0, \1ll,-kk,
123
+ ### 겹받침 규칙 (ㄴㅎ)
124
+ nh,-(k|t|c)0, nf,-\1h,
125
+ nh,-s0, nf,-ss,
126
+ nh,-nn, nf,-nn,
127
+ nh,-(?=[aeqiouyvwx]) -nn,
128
+ ### 겹받침 규칙 (ㄹㅎ)
129
+ lh,-nn, ll,-rr,
130
+ lh,-(k|t|c)0, ll,-\1h,
131
+ lh,-s0, ll,-ss,
132
+ lh,-(?=[aeqiouyvwx]) -rr,
133
+ ### 겹받침 규칙 (ㄴㅈ)
134
+ nc,-([ktsc])0, nf,-\1\1,
135
+ ### 겹받침 규칙 (ㄹㅁ)
136
+ (c0,vv,|c0,ii,|k0,uu,|t0,aa,|(^|-,)oo,|k0,oo,)lm,-([ktsc])0, \1mf,-\3\3,
137
+ ### 겹받침 규칙 (ㄹㅂ)
138
+ (p0,aa,|tt,vv,|(^|-,)yv,|nn,vv,|(^|-,)ya,|cc,aa,)lb,-([ktsc])0, \1ll,-\4\4,
139
+ ### 겹받침 규칙 (ㄹㅌ)
140
+ h0,(aa|uu),lt,-nn, h0,\1,ll,-ll,
141
+ h0,(aa|uu),lt,-([ktsc])0, h0,\1,ll,-\2\2,
142
+ ### 경음화
143
+ lk,-(c|k|p|s|t)0, kf,-\1\1,
144
+ l(b|p),-p0, pf,-pp,
145
+ s0,-p0, tf,-pp,
146
+ l(b|t),-(c|k|s|t|p)0, ll,-\2\2,
147
+ lp,-(c|k|s|t)0, pf,-\1\1,
148
+ (c[h0]|s[s0]|t[fh]),-(c|k|s|t)0, tf,-\2\2,
149
+ k[fhks],-(c|k|p|s|t)0, kf,-\1\1,
150
+ p[sfh],-(c|k|p|s|t)0, pf,-\1\1,
151
+ (?<=(kf|kh|ks|ss|c0|ch|tf|th),-)p0, pp,
152
+ h0,-s0, -ss,
153
+ nh,-s0, nf,-ss,
154
+ lh,-s0, ll,-ss,
155
+ ### 겹받침 단순화: 어말 또는 자음 앞
156
+ (ks|lk),(?=(#|$|-[ptkshcmnr])) kf,
157
+ n[ch],(?=(#|$|-[ptkshcmnr])) nf,
158
+ l[bsth],(?=(#|$|-[ptkshcmnr])) ll,
159
+ lm,(?=(#|$|-[ptkshcmnr])) mf,
160
+ (ps|lp),(?=(#|$|-[ptkshcmnr])) pf,
161
+ ### 겹받침 단순화: 모음 앞
162
+ ([kp])s,-(?=[aeqiouyvwx]) \1f,-ss,
163
+ ls,-(?=[aeqiouyvwx]) ll,-ss,
164
+ nc,-(?=[aeqiouyvwx]) nf,-c0,
165
+ lk,-(?=[aeqiouyvwx]) ll,-k0,
166
+ lm,-(?=[aeqiouyvwx]) ll,-mm,
167
+ lb,-(?=[aeqiouyvwx]) ll,-p0,
168
+ l([tp]),-(?=[aeqiouyvwx]) ll,-\1h,
169
+ ### 비음화
170
+ (?<=[pk])0,-rr, f,-nn,
171
+ (c0|ch|s0|ss|tf|nh|h0),-nn, nf,-nn,
172
+ nc,-(p|t|k)0, nf,-\1\1,
173
+ nc,(?=-[ptkshcmnr]) nf,
174
+ lm,-k0, mf,-kk,
175
+ lm,(?=-[ptkshcmnr]) mf,
176
+ k[fhks],(?=-(nn|mm),) ng,
177
+ lk,(?=-(nn|mm),) ng,
178
+ p[sfh],(?=-(nn|mm),) mf,
179
+ l[bp],(?=-(nn|mm),) mf,
180
+ (?<=(mf|ng|pf|kf),-)rr, nn,
181
+ (c0|ch|s0|ss|tf|nh|h0),(?=-mm,) nf,
182
+ ### 리을 재음절화
183
+ ll,-(?=y) -rr,
184
+ ### 유음화
185
+ (nf|ll),-rr, ll,-rr,
186
+ l[lht],-nn, ll,-rr,
187
+ ### 구개음화
188
+ tf,-(?=[iy]) -c0,
189
+ th,-(?=[iy]) -ch,
190
+ tf,-h0,(?=[iy]) -ch,
191
+ ### 유기음화 (홑받침)
192
+ (p|k)f,-h0, -\1h,
193
+ h0,-(c|k|t)0, -\1h,
194
+ (tf|th|s0),(-|#)h0, -th,
195
+ ### 연음규칙
196
+ (s0|ss|kk|p0|ph|pp|t0|th|tt|c0|ch|kh|kk|k0|mm|nn),-(?=[aeqiouyvwx]) -\1,
197
+ nh,-(?=[aeqiouyvwx]) -nn,
198
+ (s0|ss|c0|ch|th),(?=-[ptkshcmnr]) tf,
199
+ h0,-(?=[aeqiouyvwx]) -
200
+ lh,-?(?=[aeqiouyvwx]) -rr,
201
+ (p|t|k)f,-?(?=[aeqiouyvwx]) -\g<1>0,
202
+ (m|n)f,-?(?=[aeqiouyvwx]) -\1\1,
203
+ ### 종성규칙
204
+ (s0|ss|c0|ch|th),(?=-|#|$) tf,
205
+ (kh|kk|ks|lk),(?=-|#|$|[ptkshcmnr]) kf, # (ks|lk),(?=-[ptkshcmnr]) kf,
206
+ (ph|lp|ps),(?=-|#|$|[ptkshcmnr]) pf,
207
+ (?<=[ptkshcmnr].),-(?=[aeqiouyvwx]) ,
208
+ l[bhstp],(?=-|#|$|[ptkshcmnr]) ll, # l[bt],(?=-[ptkshcmnr]) ll,
209
+ nh,(?=-|#|$|[ptkshcmnr]) nf,-
210
+ ### 리을 재음절화
211
+ (?<=[aeqiouyvwx].,)ll,-(?=[aeqiouyvwx]) -rr,
212
+ ll,-ll, ll,-rr,
@@ -0,0 +1,15 @@
1
+ # Third-party license notice — mantoq
2
+
3
+ This directory vendors the mantoq Arabic G2P pipeline. Its phonetisation core
4
+ (`buck/phonetise_buckwalter.py`) is adapted from Nawar Halabi's
5
+ Arabic-Phonetiser and is licensed under the
6
+ **Creative Commons Attribution-NonCommercial 4.0 International License**
7
+ (https://creativecommons.org/licenses/by-nc/4.0/) — NOT the Apache-2.0 license
8
+ of the rest of this repository.
9
+
10
+ It is kept solely for compatibility with published models trained on mantoq
11
+ phoneme sequences, is never selected automatically, and is only constructed
12
+ when a voice or caller explicitly requests `PhonemeType.MANTOQ`. The Arabic
13
+ default is arbtok. Arabic ↔ Buckwalter transliteration itself is NOT part of
14
+ this notice: it is delegated to `scriptconv.notation`, an independent
15
+ Apache-2.0 implementation of Buckwalter's published mapping.