whisper-windows-mcp 2.2.0 → 2.2.2
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/LICENSE +20 -1
- package/LICENSE-COMMERCIAL.md +58 -0
- package/PRIVACY.es.md +135 -0
- package/PRIVACY.id.md +135 -0
- package/PRIVACY.ja.md +135 -0
- package/PRIVACY.ko.md +135 -0
- package/PRIVACY.md +135 -0
- package/PRIVACY.pl.md +135 -0
- package/PRIVACY.pt-BR.md +135 -0
- package/PRIVACY.ro.md +135 -0
- package/PRIVACY.uk.md +135 -0
- package/PRIVACY.vi.md +135 -0
- package/README.es.md +393 -0
- package/README.id.md +393 -0
- package/README.ja.md +402 -397
- package/README.ko.md +393 -0
- package/README.md +393 -388
- package/README.pl.md +393 -0
- package/README.pt-BR.md +393 -0
- package/README.ro.md +393 -0
- package/README.uk.md +393 -0
- package/README.vi.md +393 -0
- package/ROADMAP.es.md +200 -0
- package/ROADMAP.id.md +289 -0
- package/ROADMAP.ja.md +301 -268
- package/ROADMAP.ko.md +286 -0
- package/ROADMAP.pl.md +198 -0
- package/ROADMAP.pt-BR.md +286 -0
- package/ROADMAP.ro.md +200 -0
- package/ROADMAP.uk.md +290 -0
- package/ROADMAP.vi.md +286 -0
- package/SECURITY.es.md +47 -0
- package/SECURITY.id.md +47 -0
- package/SECURITY.ja.md +47 -0
- package/SECURITY.ko.md +47 -0
- package/SECURITY.md +14 -2
- package/SECURITY.pl.md +47 -0
- package/SECURITY.pt-BR.md +47 -0
- package/SECURITY.ro.md +47 -0
- package/SECURITY.uk.md +47 -0
- package/SECURITY.vi.md +47 -0
- package/TROUBLESHOOTING.es.md +323 -0
- package/TROUBLESHOOTING.id.md +323 -0
- package/TROUBLESHOOTING.ko.md +323 -0
- package/TROUBLESHOOTING.pl.md +323 -0
- package/TROUBLESHOOTING.pt-BR.md +323 -0
- package/TROUBLESHOOTING.ro.md +323 -0
- package/TROUBLESHOOTING.uk.md +323 -0
- package/TROUBLESHOOTING.vi.md +323 -0
- package/glama.json +6 -0
- package/package.json +10 -3
- package/patch_roadmaps.py +72 -0
package/README.vi.md
ADDED
|
@@ -0,0 +1,393 @@
|
|
|
1
|
+
# whisper-windows-mcp
|
|
2
|
+
|
|
3
|
+
Máy chủ MCP (Model Context Protocol) dành riêng cho Windows. Sử dụng [whisper.cpp](https://github.com/ggml-org/whisper.cpp) để phiên âm tệp âm thanh và video cục bộ trong Claude Desktop — hỗ trợ tăng tốc GPU, đa ngôn ngữ và xử lý hàng loạt. Toàn bộ quá trình phiên âm chạy cục bộ — không có tệp âm thanh, video hay đường dẫn tệp nào được gửi ra ngoài.
|
|
4
|
+
|
|
5
|
+
> **Tại sao có gói này?**
|
|
6
|
+
> Gói `whisper-mcp` phổ biến được xây dựng cho macOS và yêu cầu môi trường Unix. Gói đó không hoạt động trên Windows. Gói này được viết dành riêng cho người dùng Windows muốn phiên âm AI cục bộ tích hợp với Claude Desktop.
|
|
7
|
+
|
|
8
|
+
---
|
|
9
|
+
|
|
10
|
+
## Bạn có thể làm gì
|
|
11
|
+
|
|
12
|
+
Sau khi cài đặt, bạn có thể nói trực tiếp trong Claude Desktop:
|
|
13
|
+
|
|
14
|
+
- *"Phiên âm C:\Users\Me\Downloads\meeting.mp3"*
|
|
15
|
+
- *"Phiên âm tất cả bản ghi trong thư mục này và lưu mỗi file thành văn bản"*
|
|
16
|
+
- *"Tạo phụ đề tiếng Việt và tiếng Anh cho video này"*
|
|
17
|
+
- *"Bắt đầu phiên âm hàng loạt tất cả file trong thư mục này"*
|
|
18
|
+
- *"Phiên âm những file này sẽ mất bao lâu?"*
|
|
19
|
+
- *"Kiểm tra xem tăng tốc GPU có đang hoạt động không"*
|
|
20
|
+
|
|
21
|
+
---
|
|
22
|
+
|
|
23
|
+
## Yêu cầu
|
|
24
|
+
|
|
25
|
+
1. **Node.js 18 trở lên** — [nodejs.org](https://nodejs.org)
|
|
26
|
+
2. **Tệp nhị phân whisper.cpp hỗ trợ Vulkan GPU** — xem Bước 1
|
|
27
|
+
3. **Tệp mô hình Whisper** — xem Bước 2
|
|
28
|
+
4. **FFmpeg** — cần thiết cho tệp video và định dạng âm thanh không phải WAV/MP3
|
|
29
|
+
|
|
30
|
+
---
|
|
31
|
+
|
|
32
|
+
## Bước 1 — Cài đặt tệp nhị phân whisper.cpp
|
|
33
|
+
|
|
34
|
+
### Tùy chọn A — Bản phát hành Vulkan đã được biên dịch sẵn (khuyến nghị)
|
|
35
|
+
|
|
36
|
+
Tải xuống `whisper-vulkan-win-x64.zip` từ [trang phát hành](https://github.com/eviscerations/whisper-windows-mcp/releases/tag/v1.4.0).
|
|
37
|
+
|
|
38
|
+
Đây là bản build tùy chỉnh với **tăng tốc Vulkan GPU** được bật. Hoạt động với GPU AMD, NVIDIA và Intel — không cần SDK riêng của từng nhà sản xuất.
|
|
39
|
+
|
|
40
|
+
Giải nén vào `C:\whisper\Release\`. Bạn sẽ có các tệp sau:
|
|
41
|
+
|
|
42
|
+
```
|
|
43
|
+
C:\whisper\Release\whisper-cli.exe
|
|
44
|
+
C:\whisper\Release\ggml-vulkan.dll
|
|
45
|
+
C:\whisper\Release\ggml.dll
|
|
46
|
+
C:\whisper\Release\ggml-base.dll
|
|
47
|
+
C:\whisper\Release\ggml-cpu.dll
|
|
48
|
+
C:\whisper\Release\whisper.dll
|
|
49
|
+
```
|
|
50
|
+
|
|
51
|
+
Tăng tốc GPU được kích hoạt tự động — không cần cấu hình thêm.
|
|
52
|
+
|
|
53
|
+
### Tùy chọn B — Biên dịch từ mã nguồn
|
|
54
|
+
|
|
55
|
+
Yêu cầu: Git, CMake, Visual Studio Build Tools 2022+ với "Desktop development with C++", Vulkan SDK từ [lunarg.com](https://vulkan.lunarg.com/sdk/home#windows).
|
|
56
|
+
|
|
57
|
+
```
|
|
58
|
+
git clone https://github.com/ggml-org/whisper.cpp
|
|
59
|
+
cd whisper.cpp
|
|
60
|
+
cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release
|
|
61
|
+
cmake --build build --config Release --target whisper-cli
|
|
62
|
+
```
|
|
63
|
+
|
|
64
|
+
Sao chép các tệp nhị phân từ `build\bin\Release\` vào `C:\whisper\Release\`.
|
|
65
|
+
|
|
66
|
+
> **Lưu ý:** Bản phát hành Windows chính thức của whisper.cpp trên GitHub không bao gồm bản Vulkan. Bạn phải sử dụng bản phát hành đã biên dịch sẵn ở trên hoặc tự biên dịch từ mã nguồn với `-DGGML_VULKAN=ON`.
|
|
67
|
+
|
|
68
|
+
---
|
|
69
|
+
|
|
70
|
+
## Bước 2 — Tải xuống mô hình Whisper
|
|
71
|
+
|
|
72
|
+
| Mô hình | Kích thước | Tốc độ | Độ chính xác | Phù hợp nhất |
|
|
73
|
+
|---|---|---|---|---|
|
|
74
|
+
| `ggml-tiny.en.bin` | 75 MB | Rất nhanh | Cơ bản | Kiểm tra nhanh |
|
|
75
|
+
| `ggml-base.en.bin` | 142 MB | Nhanh | Tốt | Tiếng Anh hàng ngày |
|
|
76
|
+
| `ggml-small.en.bin` | 466 MB | Vừa | Tốt hơn | Bản ghi quan trọng |
|
|
77
|
+
| `ggml-medium.en.bin` | 1.5 GB | Nhanh trên GPU | Rất tốt | Tiếng Anh chất lượng cao nhất |
|
|
78
|
+
| `ggml-large-v3-turbo.bin` | 1.6 GB | Nhanh trên GPU | Xuất sắc | **Khuyến nghị cho xử lý hàng loạt GPU tiếng Anh — nhanh hơn large-v3 khoảng 6 lần với độ giảm chính xác tối thiểu** |
|
|
79
|
+
| `ggml-large-v3.bin` | 2.9 GB | Nhanh trên GPU | Xuất sắc | Đa ngôn ngữ, độ chính xác tối đa |
|
|
80
|
+
| `ggml-medium.en-q5_0.bin` | 514 MB | Nhanh | Rất tốt | **Lựa chọn tốt nhất chỉ dùng CPU tiếng Anh — độ chính xác cao với bộ nhớ thấp** |
|
|
81
|
+
| `ggml-large-v3-turbo-q5_0.bin` | 547 MB | Nhanh | Xuất sắc | **Lựa chọn tốt nhất chỉ dùng CPU đa ngôn ngữ** |
|
|
82
|
+
| `ggml-large-v3-q5_0.bin` | 1.1 GB | Vừa trên CPU | Xuất sắc | Đa ngôn ngữ, thân thiện với CPU |
|
|
83
|
+
|
|
84
|
+
Sử dụng `download_model` trong Claude Desktop để cài đặt trực tiếp. Cho **tiếng Anh**: `large-v3-turbo` (GPU) hoặc `medium.en-q5_0` (CPU) là lựa chọn tốt nhất. Cho **đa ngôn ngữ**: `large-v3-turbo` hoặc `large-v3-turbo-q5_0` (CPU). Mô hình chỉ tiếng Anh (`*.en.bin`) xuất ra `[FOREIGN]` với âm thanh không phải tiếng Anh và không thể dùng cho ngôn ngữ khác.
|
|
85
|
+
|
|
86
|
+
---
|
|
87
|
+
|
|
88
|
+
## Bước 3 — Cài đặt FFmpeg
|
|
89
|
+
|
|
90
|
+
FFmpeg cần thiết cho tệp video và định dạng âm thanh không phải gốc.
|
|
91
|
+
|
|
92
|
+
Cài đặt qua winget:
|
|
93
|
+
```
|
|
94
|
+
winget install ffmpeg
|
|
95
|
+
```
|
|
96
|
+
|
|
97
|
+
Hoặc tải xuống từ [ffmpeg.org](https://ffmpeg.org/download.html) và thêm vào PATH.
|
|
98
|
+
|
|
99
|
+
Xác nhận:
|
|
100
|
+
```
|
|
101
|
+
ffmpeg -version
|
|
102
|
+
```
|
|
103
|
+
|
|
104
|
+
---
|
|
105
|
+
|
|
106
|
+
## Bước 4 — Cài đặt máy chủ MCP
|
|
107
|
+
|
|
108
|
+
```
|
|
109
|
+
npm install -g whisper-windows-mcp
|
|
110
|
+
```
|
|
111
|
+
|
|
112
|
+
---
|
|
113
|
+
|
|
114
|
+
## Bước 5 — Cấu hình Claude Desktop
|
|
115
|
+
|
|
116
|
+
Mở Claude Desktop → Cài đặt → Nhà phát triển → Chỉnh sửa cấu hình.
|
|
117
|
+
|
|
118
|
+
Thêm mục `whisper`:
|
|
119
|
+
|
|
120
|
+
```json
|
|
121
|
+
{
|
|
122
|
+
"mcpServers": {
|
|
123
|
+
"whisper": {
|
|
124
|
+
"command": "npx",
|
|
125
|
+
"args": ["-y", "whisper-windows-mcp"],
|
|
126
|
+
"env": {
|
|
127
|
+
"WHISPER_CLI_PATH": "C:\\whisper\\Release\\whisper-cli.exe",
|
|
128
|
+
"WHISPER_MODEL": "C:\\whisper\\models\\ggml-medium.en.bin"
|
|
129
|
+
}
|
|
130
|
+
}
|
|
131
|
+
}
|
|
132
|
+
}
|
|
133
|
+
```
|
|
134
|
+
|
|
135
|
+
Vị trí tệp cấu hình: `C:\Users\TênNgườiDùng\AppData\Roaming\Claude\claude_desktop_config.json`
|
|
136
|
+
|
|
137
|
+
> Sử dụng **dấu gạch chéo ngược kép** trong tất cả đường dẫn.
|
|
138
|
+
|
|
139
|
+
Lưu và **khởi động lại hoàn toàn** Claude Desktop. Bạn sẽ thấy **whisper** được liệt kê với huy hiệu đang chạy màu xanh trong Cài đặt → Nhà phát triển.
|
|
140
|
+
|
|
141
|
+
---
|
|
142
|
+
|
|
143
|
+
## Bước 6 — Xác nhận cài đặt
|
|
144
|
+
|
|
145
|
+
Trong Claude Desktop, hỏi:
|
|
146
|
+
|
|
147
|
+
> *"Kiểm tra cấu hình whisper"*
|
|
148
|
+
|
|
149
|
+
Sau đó:
|
|
150
|
+
|
|
151
|
+
> *"Kiểm tra phần cứng hệ thống"*
|
|
152
|
+
|
|
153
|
+
Điều này xác nhận GPU của bạn được phát hiện và tăng tốc Vulkan đang hoạt động.
|
|
154
|
+
|
|
155
|
+
---
|
|
156
|
+
|
|
157
|
+
## Công cụ có sẵn
|
|
158
|
+
|
|
159
|
+
### `transcribe_audio`
|
|
160
|
+
Phiên âm một tệp. Hỗ trợ chế độ chặn (mặc định) hoặc nền cho tệp dài.
|
|
161
|
+
|
|
162
|
+
| Tham số | Mô tả |
|
|
163
|
+
|---|---|
|
|
164
|
+
| `file_path` | Đường dẫn tuyệt đối đến tệp (bắt buộc) |
|
|
165
|
+
| `language` | Mã ngôn ngữ (`vi`, `en`, `ja`, v.v.) hoặc `auto` để tự phát hiện. Mặc định: `en` |
|
|
166
|
+
| `output_format` | `text` (mặc định), `timestamps`, `json`, hoặc `srt` |
|
|
167
|
+
| `save_to_file` | Lưu bản phiên âm dưới dạng .txt bên cạnh tệp nguồn |
|
|
168
|
+
| `background` | Chạy như tác vụ nền — trả về ID tác vụ ngay lập tức. Dùng `check_progress` để theo dõi. Khuyến nghị cho tệp trên 10 phút. |
|
|
169
|
+
| `threads` | Ghi đè số luồng CPU |
|
|
170
|
+
| `temperature` | Nhiệt độ lấy mẫu 0.0–1.0. Mặc định 0.0 (xác định). Giá trị cao hơn giảm ảo giác trên âm thanh nhiều tạp âm. |
|
|
171
|
+
| `prompt` | Chuỗi ngữ cảnh trước — cải thiện độ chính xác cho từ vựng chuyên ngành hoặc tên người nói. Ví dụ: `"Tên: Keemstar, DramaAlert."` |
|
|
172
|
+
| `condition_on_prev_text` | Bật lại điều kiện hóa ngữ cảnh giữa các đoạn. Mặc định false. |
|
|
173
|
+
| `beam_size` | Độ rộng tìm kiếm chùm. Cao hơn = chính xác hơn, chậm hơn. Mặc định 5. |
|
|
174
|
+
| `best_of` | Số chuỗi ứng viên được đánh giá. Mặc định 5. |
|
|
175
|
+
| `gpu_device` | Chỉ số thiết bị GPU cho hệ thống đa GPU. Mặc định 0. |
|
|
176
|
+
| `processors` | Số bộ xử lý song song. Mặc định 1. |
|
|
177
|
+
| `word_timestamps` | Một từ mỗi đoạn có dấu thời gian. Hữu ích cho căn chỉnh clip. |
|
|
178
|
+
| `max_segment_length` | Độ dài đoạn tối đa tính bằng ký tự. |
|
|
179
|
+
| `diarize` | Phân tách người nói stereo — yêu cầu âm thanh stereo với người nói trên các kênh riêng biệt. |
|
|
180
|
+
| `vad_model` | Đường dẫn đến tệp .bin mô hình Silero VAD. Loại bỏ im lặng trước khi phiên âm — giảm ảo giác trên tệp nhiều tạp âm. |
|
|
181
|
+
| `offset_t` | Độ lệch bắt đầu tính bằng mili giây. |
|
|
182
|
+
| `duration` | Thời lượng xử lý tính bằng mili giây từ độ lệch. |
|
|
183
|
+
|
|
184
|
+
---
|
|
185
|
+
|
|
186
|
+
### `check_progress`
|
|
187
|
+
Theo dõi tác vụ phiên âm nền được bắt đầu bằng `transcribe_audio` (background=true).
|
|
188
|
+
|
|
189
|
+
Trả về thời gian đã trôi qua, dấu thời gian xử lý cuối cùng, phần trăm và bản phiên âm đầy đủ khi hoàn thành.
|
|
190
|
+
|
|
191
|
+
| Tham số | Mô tả |
|
|
192
|
+
|---|---|
|
|
193
|
+
| `job_id` | ID tác vụ được trả về bởi `transcribe_audio` |
|
|
194
|
+
|
|
195
|
+
---
|
|
196
|
+
|
|
197
|
+
### `start_batch`
|
|
198
|
+
Tự động phiên âm tuần tự tất cả tệp chưa phiên âm trong thư mục. Sắp xếp theo thời lượng (ngắn trước), xử lý từng tệp như tác vụ nền và xác nhận mỗi đầu ra.
|
|
199
|
+
|
|
200
|
+
| Tham số | Mô tả |
|
|
201
|
+
|---|---|
|
|
202
|
+
| `folder_path` | Đường dẫn đến thư mục (bắt buộc) |
|
|
203
|
+
| `language` | Mã ngôn ngữ. Mặc định: `en` |
|
|
204
|
+
| `threads` | Ghi đè số luồng CPU |
|
|
205
|
+
|
|
206
|
+
---
|
|
207
|
+
|
|
208
|
+
### `check_batch_progress`
|
|
209
|
+
Theo dõi một đợt đang chạy. Tự động chuyển sang tệp tiếp theo khi tệp hiện tại hoàn thành. Trả về tiến trình tổng thể, tệp hiện tại với dấu thời gian, ETA và các tệp thất bại.
|
|
210
|
+
|
|
211
|
+
| Tham số | Mô tả |
|
|
212
|
+
|---|---|
|
|
213
|
+
| `batch_id` | ID đợt được trả về bởi `start_batch` |
|
|
214
|
+
|
|
215
|
+
---
|
|
216
|
+
|
|
217
|
+
### `transcribe_batch` (tương tác)
|
|
218
|
+
Xử lý từng tệp một với xem trước và xác nhận trước mỗi tệp. Hữu ích khi bạn muốn xem xét trong quá trình thực hiện.
|
|
219
|
+
|
|
220
|
+
| Tham số | Mô tả |
|
|
221
|
+
|---|---|
|
|
222
|
+
| `folder_path` | Đường dẫn đến thư mục (bắt buộc) |
|
|
223
|
+
| `file_index` | Tệp cần xử lý (bắt đầu từ 1). Bỏ qua để liệt kê tệp trước. |
|
|
224
|
+
| `language` | Mã ngôn ngữ. Mặc định: `en` |
|
|
225
|
+
| `recursive` | Bao gồm các thư mục con |
|
|
226
|
+
|
|
227
|
+
---
|
|
228
|
+
|
|
229
|
+
### `generate_subtitles`
|
|
230
|
+
Tạo tệp phụ đề SRT. Hỗ trợ tự động phát hiện ngôn ngữ và đầu ra dịch sang tiếng Anh.
|
|
231
|
+
|
|
232
|
+
| Tham số | Mô tả |
|
|
233
|
+
|---|---|
|
|
234
|
+
| `file_path` | Đường dẫn đến tệp (bắt buộc) |
|
|
235
|
+
| `language` | Mã ngôn ngữ hoặc `auto` để tự phát hiện. Mặc định: `en` |
|
|
236
|
+
| `translate_to_english` | Cũng tạo `.en.srt` dịch sang tiếng Anh. Chỉ áp dụng khi nguồn không phải tiếng Anh. |
|
|
237
|
+
| `threads` | Ghi đè số luồng CPU |
|
|
238
|
+
|
|
239
|
+
Khi cả hai được yêu cầu, hai tệp được lưu bên cạnh nguồn:
|
|
240
|
+
- `tenfile.vi.srt` — ngôn ngữ gốc
|
|
241
|
+
- `tenfile.en.srt` — bản dịch tiếng Anh
|
|
242
|
+
|
|
243
|
+
> Bản dịch tích hợp của Whisper chỉ dịch **sang tiếng Anh**. Để dịch sang ngôn ngữ khác, hãy xử lý nội dung tệp .srt riêng biệt.
|
|
244
|
+
|
|
245
|
+
---
|
|
246
|
+
|
|
247
|
+
### `analyze_media`
|
|
248
|
+
Phân tích tệp trước khi phiên âm. Trả về thời lượng, kích thước, codec và thời gian phiên âm ước tính trên CPU và GPU. Với thư mục, hiển thị tất cả tệp trong bảng có thể sắp xếp kèm trạng thái phiên âm.
|
|
249
|
+
|
|
250
|
+
| Tham số | Mô tả |
|
|
251
|
+
|---|---|
|
|
252
|
+
| `path` | Đường dẫn đến tệp đơn hoặc thư mục (bắt buộc) |
|
|
253
|
+
| `sort_by` | Với thư mục: `duration` (mặc định), `name`, hoặc `size` |
|
|
254
|
+
|
|
255
|
+
---
|
|
256
|
+
|
|
257
|
+
### `check_config`
|
|
258
|
+
Xác nhận whisper-cli.exe, tệp mô hình và FFmpeg đều có thể truy cập. Chạy lệnh này trước nếu có bất kỳ sự cố nào.
|
|
259
|
+
|
|
260
|
+
---
|
|
261
|
+
|
|
262
|
+
### `list_models`
|
|
263
|
+
Liệt kê tất cả tệp mô hình Whisper đã cài đặt trong thư mục mô hình của bạn. Hiển thị tên tệp, kích thước, có đang hoạt động không, trạng thái lượng tử hóa và trường hợp sử dụng được khuyến nghị. Không gọi mạng — chỉ đọc hệ thống tệp cục bộ.
|
|
264
|
+
|
|
265
|
+
---
|
|
266
|
+
|
|
267
|
+
### `download_model`
|
|
268
|
+
Tải xuống mô hình Whisper trực tiếp từ Hugging Face vào thư mục mô hình của bạn. Nhận tên mô hình (ví dụ: `large-v3-turbo`, `medium.en-q5_0`) và tự động xử lý việc tải xuống. Chỉ tải xuống từ các namespace Hugging Face đáng tin cậy. Sau khi tải xuống, sử dụng `switch_model` để kích hoạt.
|
|
269
|
+
|
|
270
|
+
| Tham số | Mô tả |
|
|
271
|
+
|---|---|
|
|
272
|
+
| `model_name` | Tên mô hình cần tải xuống, ví dụ: `large-v3-turbo`, `large-v3-turbo-q5_0`, `medium.en-q5_0` |
|
|
273
|
+
|
|
274
|
+
---
|
|
275
|
+
|
|
276
|
+
### `switch_model`
|
|
277
|
+
Chuyển mô hình Whisper đang hoạt động cho phiên hiện tại mà không cần khởi động lại Claude Desktop. Thay đổi chỉ có hiệu lực trong phiên — không lưu sau khi khởi động lại. Để thay đổi vĩnh viễn, cập nhật `WHISPER_MODEL` trong cấu hình của bạn.
|
|
278
|
+
|
|
279
|
+
| Tham số | Mô tả |
|
|
280
|
+
|---|---|
|
|
281
|
+
| `model_name` | Tên tệp mô hình (ví dụ: `ggml-large-v3-turbo.bin`) hoặc đường dẫn đầy đủ. Phải là tệp `.bin` trong thư mục mô hình đã cấu hình. |
|
|
282
|
+
|
|
283
|
+
---
|
|
284
|
+
|
|
285
|
+
### `check_system`
|
|
286
|
+
Phát hiện phần cứng GPU và xác nhận tăng tốc Vulkan có sẵn. Báo cáo tên GPU, VRAM, có `ggml-vulkan.dll` không và đề xuất kích thước mô hình tốt nhất cho phần cứng của bạn.
|
|
287
|
+
|
|
288
|
+
---
|
|
289
|
+
|
|
290
|
+
## Định dạng được hỗ trợ
|
|
291
|
+
|
|
292
|
+
| Loại | Định dạng |
|
|
293
|
+
|---|---|
|
|
294
|
+
| Gốc (không cần chuyển đổi) | `mp3`, `wav` |
|
|
295
|
+
| Video (tự động chuyển đổi qua FFmpeg) | `mp4`, `mkv`, `avi`, `mov`, `webm`, `flv`, `wmv`, `m4v`, `ts`, `3gp` |
|
|
296
|
+
| Âm thanh (tự động chuyển đổi qua FFmpeg) | `m4a`, `ogg`, `flac` |
|
|
297
|
+
|
|
298
|
+
---
|
|
299
|
+
|
|
300
|
+
## Tăng tốc GPU
|
|
301
|
+
|
|
302
|
+
Bản phát hành Vulkan đã biên dịch sẵn bật tăng tốc GPU tự động. Đã thử nghiệm trên AMD Radeon RX Vega 56 (GCN thế hệ 5). Bất kỳ GPU nào hỗ trợ Vulkan 1.0+ đều sẽ hoạt động, bao gồm NVIDIA và Intel Arc.
|
|
303
|
+
|
|
304
|
+
**So sánh hiệu suất (mô hình medium.en, tệp âm thanh ~5 phút):**
|
|
305
|
+
|
|
306
|
+
| Phần cứng | Thời gian |
|
|
307
|
+
|---|---|
|
|
308
|
+
| Chỉ CPU (Ryzen 7 2700x, 8 luồng) | 8–12 phút |
|
|
309
|
+
| GPU (Vega 56 qua Vulkan) | 20–40 giây |
|
|
310
|
+
|
|
311
|
+
Mức sử dụng GPU trong quá trình phiên âm thường là 15–20%, giảm về trạng thái nhàn rỗi giữa các tệp. CPU duy trì khoảng 15%.
|
|
312
|
+
|
|
313
|
+
---
|
|
314
|
+
|
|
315
|
+
## Hỗ trợ đa ngôn ngữ
|
|
316
|
+
|
|
317
|
+
Whisper có thể tự động phát hiện ngôn ngữ được nói và phiên âm bằng ngôn ngữ đó. Mô hình dịch tích hợp chỉ dịch **sang tiếng Anh**.
|
|
318
|
+
|
|
319
|
+
Để có độ chính xác đa ngôn ngữ tốt nhất, hãy sử dụng mô hình `large-v3`. Mô hình chỉ tiếng Anh (`*.en.bin`) không thể phát hiện hoặc phiên âm các ngôn ngữ khác.
|
|
320
|
+
|
|
321
|
+
**Ví dụ — video nước ngoài có phụ đề:**
|
|
322
|
+
1. Yêu cầu Claude tạo phụ đề với `language=auto` và `translate_to_english=true`
|
|
323
|
+
2. Whisper phát hiện ngôn ngữ và tạo SRT ngôn ngữ gốc
|
|
324
|
+
3. Lần xử lý thứ hai tạo SRT dịch sang tiếng Anh
|
|
325
|
+
4. Tải tệp trong VLC qua Phụ đề → Thêm tệp phụ đề
|
|
326
|
+
|
|
327
|
+
---
|
|
328
|
+
|
|
329
|
+
## Thiết kế cho người dùng gói miễn phí
|
|
330
|
+
|
|
331
|
+
Công cụ này được xây dựng để giảm thiểu các tương tác với Claude API. Toàn bộ quy trình phiên âm — quét, phân tích, xếp hàng, chạy, xác nhận — được thiết kế để yêu cầu ít tương tác Claude nhất có thể. Công việc nặng được thực hiện cục bộ trên máy của bạn.
|
|
332
|
+
|
|
333
|
+
---
|
|
334
|
+
|
|
335
|
+
## Biến môi trường tùy chọn
|
|
336
|
+
|
|
337
|
+
| Biến | Mô tả |
|
|
338
|
+
|---|---|
|
|
339
|
+
| `WHISPER_CLI_PATH` | Đường dẫn đến whisper-cli.exe (bắt buộc) |
|
|
340
|
+
| `WHISPER_MODEL` | Đường dẫn đến tệp mô hình .bin (bắt buộc) |
|
|
341
|
+
| `WHISPER_THREADS` | Ghi đè số luồng CPU |
|
|
342
|
+
| `FFMPEG_PATH` | Đường dẫn đến ffmpeg nếu không có trong PATH hệ thống |
|
|
343
|
+
| `WHISPER_PRIVACY_MODE` | **Đang lên kế hoạch.** Khi đặt thành `true`, phản hồi công cụ chỉ trả về siêu dữ liệu — không có văn bản phiên âm nào được trả về cho Claude. Dành cho nội dung được quản lý hoặc bí mật. Xem [PRIVACY.md](PRIVACY.md). |
|
|
344
|
+
|
|
345
|
+
---
|
|
346
|
+
|
|
347
|
+
## Khắc phục sự cố
|
|
348
|
+
|
|
349
|
+
Xem [TROUBLESHOOTING.md](TROUBLESHOOTING.md) để biết giải pháp chi tiết. Xem [PRIVACY.md](PRIVACY.md) nếu bạn xử lý nội dung được quản lý.
|
|
350
|
+
|
|
351
|
+
Danh sách kiểm tra nhanh:
|
|
352
|
+
- Đường dẫn trong cấu hình dùng **dấu gạch chéo ngược kép** (`C:\\whisper\\...`)
|
|
353
|
+
- `whisper-cli.exe` tồn tại tại đường dẫn đã cấu hình
|
|
354
|
+
- Tệp mô hình `.bin` tồn tại tại đường dẫn đã cấu hình
|
|
355
|
+
- FFmpeg đã cài đặt và có trong PATH (`ffmpeg -version` hoạt động)
|
|
356
|
+
- Claude Desktop đã được **khởi động lại hoàn toàn** sau khi chỉnh sửa cấu hình
|
|
357
|
+
- Whisper hiển thị **đang chạy** (huy hiệu màu xanh) trong Cài đặt → Nhà phát triển
|
|
358
|
+
|
|
359
|
+
---
|
|
360
|
+
|
|
361
|
+
## Bảo mật và quyền riêng tư
|
|
362
|
+
|
|
363
|
+
whisper-windows-mcp được thiết kế với bảo mật là nguyên tắc cốt lõi.
|
|
364
|
+
|
|
365
|
+
**Âm thanh không bao giờ rời khỏi máy của bạn.** Không có tệp âm thanh hoặc video, đường dẫn tệp, hay dữ liệu đo lường nào được truyền đến bất kỳ máy chủ nào. Không cần API đám mây cho chức năng cốt lõi.
|
|
366
|
+
|
|
367
|
+
**Văn bản phiên âm và ranh giới API.** Khi phản hồi công cụ bao gồm văn bản phiên âm, văn bản đó được xử lý bởi API của Claude — nó rời khỏi máy cục bộ của bạn. Đối với hầu hết người dùng (nội dung công khai, podcast, bản ghi phát trực tuyến) đây là hành vi bình thường. Nếu bạn xử lý bản ghi y tế, pháp lý, tài chính hoặc được quản lý khác, hãy xem [PRIVACY.md](PRIVACY.md) để biết hướng dẫn tuân thủ và các tùy chọn cấu hình.
|
|
368
|
+
|
|
369
|
+
Biến môi trường `WHISPER_PRIVACY_MODE` đang được lên kế hoạch, sẽ giới hạn tất cả phản hồi công cụ chỉ có siêu dữ liệu (tên tệp, thời lượng, số từ) — không có văn bản phiên âm nào được trả về cho Claude. Đây là cấu hình chính xác cho nội dung được quản lý hoặc bí mật.
|
|
370
|
+
|
|
371
|
+
**Xác thực đầu vào.** Tất cả đường dẫn tệp được xác thực trước khi sử dụng — đường dẫn UNC (`\\server\share`) và chuỗi duyệt thư mục (`..`) bị từ chối. Tệp trên 10 GB bị từ chối để ngăn cạn kiệt tài nguyên.
|
|
372
|
+
|
|
373
|
+
**Nhận thức về tiêm nhiễm phiên âm.** Tệp âm thanh có thể chứa nội dung khi phiên âm trông giống như hướng dẫn. Các biện pháp phòng thủ tích hợp của Claude xử lý điều này, nhưng biết rằng nội dung phiên âm được coi là dữ liệu — không bao giờ là hướng dẫn — bởi chính máy chủ MCP cũng rất hữu ích.
|
|
374
|
+
|
|
375
|
+
**Tải xuống mô hình bị hạn chế.** Công cụ `download_model` chỉ tải xuống từ hai namespace Hugging Face đáng tin cậy (`ggerganov/whisper.cpp` và `ggml-org`). URL tùy ý bị từ chối. Chuyển hướng được xác thực dựa trên danh sách cho phép trước khi tuân theo.
|
|
376
|
+
|
|
377
|
+
**Chuyển đổi mô hình được sandbox hóa.** `switch_model` chỉ chấp nhận tệp `.bin` trong thư mục mô hình đã cấu hình. Đường dẫn ngoài thư mục đó bị từ chối.
|
|
378
|
+
|
|
379
|
+
**Không có phụ thuộc mạng mới.** Tải xuống mô hình sử dụng `https` tích hợp sẵn của Node.js — không có thư viện HTTP bên ngoài nào được thêm vào gói.
|
|
380
|
+
|
|
381
|
+
---
|
|
382
|
+
|
|
383
|
+
## Giấy phép
|
|
384
|
+
|
|
385
|
+
**Sử dụng phi thương mại:** MIT — miễn phí cho mục đích cá nhân, giáo dục và phi thương mại. Xem [LICENSE](LICENSE).
|
|
386
|
+
|
|
387
|
+
**Sử dụng thương mại:** Cần có thỏa thuận giấy phép thương mại riêng cho bất kỳ mục đích kinh doanh, chuyên nghiệp hoặc tạo doanh thu nào. Xem [LICENSE-COMMERCIAL.md](LICENSE-COMMERCIAL.md) để biết điều khoản và thông tin liên hệ.
|
|
388
|
+
|
|
389
|
+
## Đóng góp
|
|
390
|
+
|
|
391
|
+
Chào mừng pull request. Xem [ROADMAP.md](ROADMAP.md) để biết các tính năng đã lên kế hoạch.
|
|
392
|
+
|
|
393
|
+
Nếu bạn đã thử nghiệm tăng tốc GPU trên phần cứng không được liệt kê ở trên, vui lòng mở issue với kết quả của bạn — mô hình GPU, VRAM, kích thước mô hình và thông lượng quan sát được.
|
package/ROADMAP.es.md
ADDED
|
@@ -0,0 +1,200 @@
|
|
|
1
|
+
# whisper-windows-mcp — Hoja de Ruta
|
|
2
|
+
|
|
3
|
+
Versión actual: **v2.2.0**
|
|
4
|
+
|
|
5
|
+
---
|
|
6
|
+
|
|
7
|
+
## Principios de diseño
|
|
8
|
+
|
|
9
|
+
Estos principios rigen cada decisión en este proyecto y tienen prioridad sobre la velocidad de adición de funcionalidades.
|
|
10
|
+
|
|
11
|
+
**Minimizar el uso de la API de Claude.** Todo el flujo de trabajo de transcripción — escaneo, análisis, cola, ejecución, validación, cambio de modelos — debe ser ejecutable con el menor número posible de interacciones con Claude. Esta herramienta debe funcionar completamente para usuarios de Claude en el plan gratuito que no pagan por suscripciones Pro o Max. Cada llamada a herramienta consume presupuesto de uso. Diseña en consecuencia.
|
|
12
|
+
|
|
13
|
+
**Siempre una única instancia de whisper.** Nunca crees un segundo proceso whisper-cli.exe mientras uno esté en ejecución. El bloqueo de proceso es obligatorio e innegociable.
|
|
14
|
+
|
|
15
|
+
**Local primero, privado por defecto.** El audio nunca sale de la máquina. No se necesita ninguna API de nube para la funcionalidad principal. Las integraciones opcionales (ej.: descargas de modelos de Hugging Face) deben estar claramente documentadas como opcionales.
|
|
16
|
+
|
|
17
|
+
**Control explícito del usuario.** Sin operaciones masivas silenciosas. Las acciones destructivas o irreversibles requieren confirmación. El usuario debe saber siempre qué va a ocurrir antes de que ocurra.
|
|
18
|
+
|
|
19
|
+
**Rutas seguras para Unicode.** Toda E/S de archivo debe manejar correctamente nombres de archivo no-ASCII, incluyendo español, japonés, chino, emoji, corchetes y otros caracteres especiales.
|
|
20
|
+
|
|
21
|
+
**Modular y combinable.** Las herramientas son independientes. Los usuarios usan lo que necesitan. Ninguna funcionalidad debe requerir otra, a menos que sea inevitable.
|
|
22
|
+
|
|
23
|
+
**Optimización antes que funcionalidades.** Cuando haya dudas entre agregar una funcionalidad y reducir la carga del sistema o el número de llamadas a la API, reduce la carga. Las sesiones de optimización grandes son costosas. Diseña la arquitectura correctamente desde el principio.
|
|
24
|
+
|
|
25
|
+
---
|
|
26
|
+
|
|
27
|
+
## Completado
|
|
28
|
+
|
|
29
|
+
### ✅ v1.3.1 — Bloqueo de proceso
|
|
30
|
+
Añadida verificación `isWhisperRunning()` usando `tasklist /FI` antes de crear cualquier proceso de transcripción. Devuelve un error claro con instrucciones del Administrador de Tareas en lugar de crear un proceso concurrente.
|
|
31
|
+
|
|
32
|
+
### ✅ v1.4.0 — Aceleración GPU Vulkan
|
|
33
|
+
Compilado whisper.cpp desde el código fuente con `-DGGML_VULKAN=ON` usando VS Build Tools 2022 y Vulkan SDK. Binarios Vulkan precompilados distribuidos como `whisper-vulkan-win-x64.zip`.
|
|
34
|
+
|
|
35
|
+
**Resultados en AMD Radeon RX Vega 56:** Utilización media de GPU ~16%. Archivo de 58 minutos completado en ~4,5 minutos en GPU vs. ~88 minutos solo en CPU.
|
|
36
|
+
|
|
37
|
+
### ✅ v1.5.0 — Diagnóstico del sistema
|
|
38
|
+
Herramienta `check_system`: detección de GPU via `wmic`, verificación de DLL Vulkan, reporte de VRAM, recomendación de tamaño de modelo.
|
|
39
|
+
|
|
40
|
+
### ✅ v1.6.0 — Pre-análisis de archivo
|
|
41
|
+
Herramienta `analyze_media` via FFprobe: duración, tamaño, códec, estado de transcripción, estimaciones de tiempo de CPU y GPU. Escaneo de archivo único o carpeta con opciones de ordenación.
|
|
42
|
+
|
|
43
|
+
### ✅ v1.7.0 — Transcripción en segundo plano + Visibilidad del progreso
|
|
44
|
+
Arquitectura de proceso desconectado: `transcribe_audio` con `background=true` crea whisper como proceso desconectado y devuelve inmediatamente un ID de tarea. `check_progress` analiza las marcas de tiempo de segmento del stderr de whisper para porcentaje y ETA en tiempo real.
|
|
45
|
+
|
|
46
|
+
### ✅ v1.8.0 — Lote secuencial con validación
|
|
47
|
+
`start_batch` y `check_batch_progress`: procesamiento secuencial automático, validación de transcripción (detección de salida vacía/corta), avance automático de cola, marcas de tiempo de progreso por archivo.
|
|
48
|
+
|
|
49
|
+
### ✅ v1.9.0 — Soporte multilingüe y traducción
|
|
50
|
+
`generate_subtitles` con detección `language=auto` y salida SRT doble `translate_to_english=true`. Añadido soporte para formatos `.3gp` y `.ts`. `language=auto` también disponible en `transcribe_audio`.
|
|
51
|
+
|
|
52
|
+
**Limitación conocida:** La traducción integrada de Whisper solo apunta al inglés. Requiere modelo `large-v3` para idiomas que no sean inglés — los modelos solo inglés (`*.en.bin`) generan `[FOREIGN]` en audio que no sea inglés.
|
|
53
|
+
|
|
54
|
+
### ✅ v2.0.0 — Rutas seguras para Unicode + SRT en segundo plano
|
|
55
|
+
**Nombres de archivo Unicode:** Los archivos con caracteres no-ASCII en los nombres causaban fallos silenciosos en la transcripción en segundo plano. Corregido enrutando toda la salida a través de una ruta temporal saneada basada en ID de tarea, luego moviendo el resultado al destino correcto tras completarse.
|
|
56
|
+
|
|
57
|
+
**SRT en modo en segundo plano:** `spawnDetached` anteriormente codificaba de forma rígida `-otxt` independientemente del formato solicitado, y `generate_subtitles` bloqueaba de forma síncrona y alcanzaba el timeout de MCP de 4 minutos en archivos más largos. Corregido añadiendo parámetro `outputFormat` a `spawnDetached`, soportando salida `text` y `srt` en modo en segundo plano.
|
|
58
|
+
|
|
59
|
+
### ✅ v2.0.1 — Correcciones de bugs (incluido en v2.2.0)
|
|
60
|
+
- `--max-context 0` fijo en `buildArgs` y `spawnDetached` — previene bucles de alucinación en audio largo.
|
|
61
|
+
- `--no-speech-thold 0.6` fijo en ambas funciones — segmentos por debajo del umbral de confianza son tratados como silencio.
|
|
62
|
+
- Validación de ruta (`validateInputPath`) — rechaza rutas UNC y traversales `..`.
|
|
63
|
+
- Guarda de tamaño de archivo `MAX_FILE_SIZE_MB = 10240`.
|
|
64
|
+
- Comentario de seguridad de inyección de transcripción en `transcribeSingle`.
|
|
65
|
+
- Comando CLI de lote corregido en TROUBLESHOOTING.md.
|
|
66
|
+
|
|
67
|
+
### ✅ v2.1.0 — Suite de gestión de modelos (incluido en v2.2.0)
|
|
68
|
+
- `WHISPER_MODEL` cambiado de `const` a `let` (mutable dentro de la sesión).
|
|
69
|
+
- `MODEL_REGISTRY` — 16 modelos, variantes de precisión total y cuantizadas, URLs de descarga de Hugging Face.
|
|
70
|
+
- `ALLOWED_HF_PREFIXES` — lista de permitidos de URL que limita las descargas a los espacios de nombres `ggerganov/whisper.cpp` y `ggml-org`.
|
|
71
|
+
- Herramienta `list_models` — escanea el directorio de modelos, muestra el modelo activo, tamaños, casos de uso, descargas disponibles.
|
|
72
|
+
- Herramienta `download_model` — descarga de Hugging Face via `https` integrado de Node.js, renombrado atómico.
|
|
73
|
+
- Herramienta `switch_model` — valida extensión `.bin`, restricción de directorio, verificación de bloqueo de proceso.
|
|
74
|
+
- `recommendedModel()` actualizado para recomendar `large-v3-turbo` para VRAM de 6GB+.
|
|
75
|
+
|
|
76
|
+
### ✅ v2.2.0 — Expansión de calidad, parámetros y hardware (actual)
|
|
77
|
+
- Interfaz `WhisperOptions` reemplazando argumentos posicionales en `buildArgs`.
|
|
78
|
+
- Nuevos parámetros en `transcribe_audio`: `temperature`, `prompt`, `condition_on_prev_text`, `no_speech_thold`, `beam_size`, `best_of`, `gpu_device`, `processors`, `word_timestamps`, `max_segment_length`, `split_on_word`, `diarize`, `vad_model`, `offset_t`, `duration`.
|
|
79
|
+
- Nuevos parámetros en `generate_subtitles`: `temperature`, `prompt`, `beam_size`, `best_of`, `diarize`, `vad_model`.
|
|
80
|
+
- `spawnDetached` refactorizado — todos los flags de calidad ahora se aplican en modo en segundo plano/lote.
|
|
81
|
+
- Salida de lote corregida — `readBatchProgress` ahora mueve la salida temporal al destino final antes de validar.
|
|
82
|
+
|
|
83
|
+
---
|
|
84
|
+
|
|
85
|
+
## Bug crítico — Avance automático del lote (confirmado, pendiente de corrección)
|
|
86
|
+
|
|
87
|
+
### El lote no avanza sin polling activo
|
|
88
|
+
|
|
89
|
+
`start_batch` no avanza la cola de forma autónoma entre archivos. El lote solo avanza cuando se llama a `check_batch_progress`. Sin polling, el lote se detiene indefinidamente tras cada archivo.
|
|
90
|
+
|
|
91
|
+
**Corrección planificada — Opción B (callback de salida):** Adjuntar un handler `on('exit')` al proceso hijo whisper-cli creado. Cuando el proceso salga, llamar inmediatamente a la lógica de avance para validar la salida y crear la siguiente tarea.
|
|
92
|
+
|
|
93
|
+
**Solución alternativa (actual):** Llama a `check_batch_progress` repetidamente hasta que el lote se complete.
|
|
94
|
+
|
|
95
|
+
---
|
|
96
|
+
|
|
97
|
+
## Planificado — Arquitectura de Privacidad (antes de la migración a Bun)
|
|
98
|
+
|
|
99
|
+
### Variable de entorno `WHISPER_PRIVACY_MODE`
|
|
100
|
+
Añadir `WHISPER_PRIVACY_MODE` como variable de entorno en `claude_desktop_config.json`. Cuando esté activado, todas las respuestas de herramientas solo devuelven metadatos — ningún texto de transcripción incluido en ninguna respuesta.
|
|
101
|
+
|
|
102
|
+
### Gateway de consentimiento para contenido de transcripción
|
|
103
|
+
Cuando `WHISPER_PRIVACY_MODE` no está activado (predeterminado), cualquier respuesta de herramienta que incluya texto de transcripción debe estar precedida de una divulgación en el primer uso por sesión.
|
|
104
|
+
|
|
105
|
+
### Documentación `PRIVACY.md`
|
|
106
|
+
Crear `PRIVACY.md` en la raíz del repositorio con orientación completa de privacidad y marcos de cumplimiento.
|
|
107
|
+
|
|
108
|
+
### Limpieza automática del directorio temporal
|
|
109
|
+
Añadir limpieza automática de archivos de tareas completadas tras un período de retención configurable (predeterminado: 7 días).
|
|
110
|
+
|
|
111
|
+
---
|
|
112
|
+
|
|
113
|
+
## Planificado — Migración a Bun
|
|
114
|
+
|
|
115
|
+
Migrar el runtime de Node.js a [Bun](https://bun.sh) tras la conclusión de la arquitectura de privacidad y antes de las adiciones de funcionalidades del v2.3.0. El Bun ejecuta TypeScript nativamente sin paso de compilación, inicia significativamente más rápido que Node y tiene E/S más rápida.
|
|
116
|
+
|
|
117
|
+
---
|
|
118
|
+
|
|
119
|
+
## Licenciamiento
|
|
120
|
+
|
|
121
|
+
whisper-windows-mcp usa licencia dual.
|
|
122
|
+
|
|
123
|
+
**Uso no comercial:** MIT — gratuito para uso personal, educativo y no comercial. Ver [LICENSE](LICENSE).
|
|
124
|
+
|
|
125
|
+
**Uso comercial:** Se requiere un acuerdo de licencia comercial separado. Ver [LICENSE-COMMERCIAL.md](LICENSE-COMMERCIAL.md).
|
|
126
|
+
|
|
127
|
+
`WHISPER_PRIVACY_MODE` para implementaciones en sectores regulados está en desarrollo y planificado para una versión futura. Ver [PRIVACY.md](PRIVACY.md) para orientación actual.
|
|
128
|
+
|
|
129
|
+
## Planificado — v2.3.0: Expansión de formatos de salida
|
|
130
|
+
|
|
131
|
+
### Formato de subtítulos VTT
|
|
132
|
+
Salida WebVTT (`.vtt`) junto con SRT. Estándar web usado por YouTube, HTML5 `<video>` y la mayoría de los reproductores modernos.
|
|
133
|
+
|
|
134
|
+
### Formato LRC
|
|
135
|
+
Salida en formato LRC (`.lrc`) de letras/karaoke via `-olrc`.
|
|
136
|
+
|
|
137
|
+
### Formato CSV
|
|
138
|
+
Salida CSV (`.csv`) via `-ocsv`. Datos tabulares estructurados con timing de segmentos.
|
|
139
|
+
|
|
140
|
+
---
|
|
141
|
+
|
|
142
|
+
## Planificado — Releases futuros
|
|
143
|
+
|
|
144
|
+
### TinyDiarize
|
|
145
|
+
Soporte al flag `--tinydiarize` con variantes de modelo que soportan `tdrz`. Funciona en grabaciones mono a diferencia del flag `--diarize` estéreo.
|
|
146
|
+
|
|
147
|
+
### Transcripción de URL de YouTube
|
|
148
|
+
Transcripción directa desde URLs de YouTube via yt-dlp. Requiere yt-dlp instalado y en el PATH.
|
|
149
|
+
|
|
150
|
+
### Herramientas de flujo de trabajo de proyecto de video
|
|
151
|
+
Para usuarios que gestionan proyectos grandes de edición de video con directorios de clips fuente y editados. Los archivos fuente nunca son renombrados ni modificados sin confirmación explícita del usuario.
|
|
152
|
+
|
|
153
|
+
### Diarización de hablantes (pyannote-audio)
|
|
154
|
+
Diarización de hablantes mono completa con etiquetas de ID de hablante. Requiere pyannote-audio — biblioteca basada en Python con requisito de token de acceso a modelos de Hugging Face.
|
|
155
|
+
|
|
156
|
+
### Traducción a idiomas que no sean inglés
|
|
157
|
+
El flag `--translate` de Whisper solo apunta al inglés. Soportar idiomas de destino arbitrarios requiere una API de traducción externa o modelo de traducción local.
|
|
158
|
+
|
|
159
|
+
### Limpieza y formateo de transcripciones
|
|
160
|
+
Pipeline de post-procesamiento: eliminación de muletillas, saltos de párrafo en límites de temas naturales, formateo con conciencia de hablante, exportación a PDF o DOCX.
|
|
161
|
+
|
|
162
|
+
---
|
|
163
|
+
|
|
164
|
+
## Distribución
|
|
165
|
+
|
|
166
|
+
Disponible en [npm](https://www.npmjs.com/package/whisper-windows-mcp), [mcpservers.org](https://mcpservers.org) y [Glama](https://glama.ai).
|
|
167
|
+
|
|
168
|
+
---
|
|
169
|
+
|
|
170
|
+
## Documentación multilingüe
|
|
171
|
+
|
|
172
|
+
La documentación en japonés, coreano, vietnamita, indonesio, ucraniano, portugués brasileño y español se mantiene en paralelo con el inglés. Los siguientes archivos deben ser actualizados para coincidir con los documentos en inglés tras cada release:
|
|
173
|
+
|
|
174
|
+
**Japonés (`*.ja.md`)** — `README.ja.md` / `TROUBLESHOOTING.ja.md` / `ROADMAP.ja.md` / `PRIVACY.ja.md` / `SECURITY.ja.md`
|
|
175
|
+
|
|
176
|
+
**Coreano (`*.ko.md`)** — `README.ko.md` / `TROUBLESHOOTING.ko.md` / `ROADMAP.ko.md` / `PRIVACY.ko.md` / `SECURITY.ko.md`
|
|
177
|
+
|
|
178
|
+
**Vietnamita (`*.vi.md`)** — `README.vi.md` / `TROUBLESHOOTING.vi.md` / `ROADMAP.vi.md` / `PRIVACY.vi.md` / `SECURITY.vi.md`
|
|
179
|
+
|
|
180
|
+
**Indonesio (`*.id.md`)** — `README.id.md` / `TROUBLESHOOTING.id.md` / `ROADMAP.id.md` / `PRIVACY.id.md` / `SECURITY.id.md`
|
|
181
|
+
|
|
182
|
+
**Ucraniano (`*.uk.md`)** — `README.uk.md` / `TROUBLESHOOTING.uk.md` / `ROADMAP.uk.md` / `PRIVACY.uk.md` / `SECURITY.uk.md`
|
|
183
|
+
|
|
184
|
+
**Portugués Brasileño (`*.pt-BR.md`)** — `README.pt-BR.md` / `TROUBLESHOOTING.pt-BR.md` / `ROADMAP.pt-BR.md` / `PRIVACY.pt-BR.md` / `SECURITY.pt-BR.md`
|
|
185
|
+
|
|
186
|
+
**Español (`*.es.md`)** — `README.es.md` / `TROUBLESHOOTING.es.md` / `ROADMAP.es.md` / `PRIVACY.es.md` / `SECURITY.es.md`
|
|
187
|
+
|
|
188
|
+
**Polish (`*.pl.md`)** — `README.pl.md` / `TROUBLESHOOTING.pl.md` / `ROADMAP.pl.md` / `PRIVACY.pl.md` / `SECURITY.pl.md`
|
|
189
|
+
|
|
190
|
+
**Romanian (`*.ro.md`)** — `README.ro.md` / `TROUBLESHOOTING.ro.md` / `ROADMAP.ro.md` / `PRIVACY.ro.md` / `SECURITY.ro.md`
|
|
191
|
+
|
|
192
|
+
Las contribuciones de la comunidad para otros idiomas son bienvenidas.
|
|
193
|
+
|
|
194
|
+
---
|
|
195
|
+
|
|
196
|
+
## Contribuciones
|
|
197
|
+
|
|
198
|
+
Los pull requests son bienvenidos. Revisa las issues existentes antes de comenzar a trabajar.
|
|
199
|
+
|
|
200
|
+
Si has probado la aceleración por GPU en hardware no listado arriba, abre una issue con el modelo de GPU, VRAM, tamaño de modelo y throughput observado.
|