@tryhamster/gerbil 1.11.0 → 1.11.2
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/dist/cli.mjs +7 -7
- package/dist/cli.mjs.map +1 -1
- package/dist/{defaults-C_bJK9zs.mjs → defaults-DfGx4d1m.mjs} +22 -2
- package/dist/{defaults-C_bJK9zs.mjs.map → defaults-DfGx4d1m.mjs.map} +1 -1
- package/dist/frameworks/express.mjs +1 -1
- package/dist/frameworks/fastify.mjs +1 -1
- package/dist/frameworks/hono.mjs +1 -1
- package/dist/frameworks/next.d.mts +2 -2
- package/dist/frameworks/next.mjs +1 -1
- package/dist/frameworks/trpc.mjs +1 -1
- package/dist/{gerbil-BpYemKEH.mjs → gerbil-CfNSSpgW.mjs} +2 -2
- package/dist/{gerbil-BpYemKEH.mjs.map → gerbil-CfNSSpgW.mjs.map} +1 -1
- package/dist/gerbil-Cq20PKtz.mjs +4 -0
- package/dist/{gerbil-6E0XH_8s.d.mts → gerbil-Cs8L0iVm.d.mts} +2 -2
- package/dist/{gerbil-6E0XH_8s.d.mts.map → gerbil-Cs8L0iVm.d.mts.map} +1 -1
- package/dist/gpu/hooks.d.mts +1 -1
- package/dist/gpu/hooks.mjs +1 -1
- package/dist/gpu/index.d.mts +2 -2
- package/dist/gpu/index.mjs +4 -4
- package/dist/{gpu-CzgbyVeq.mjs → gpu-BQ8I-VDx.mjs} +58 -18
- package/dist/{gpu-CzgbyVeq.mjs.map → gpu-BQ8I-VDx.mjs.map} +1 -1
- package/dist/{index-DyqcKFfQ.d.mts → index-t_hY-XWW.d.mts} +72 -7
- package/dist/index-t_hY-XWW.d.mts.map +1 -0
- package/dist/index.d.mts +2 -2
- package/dist/index.mjs +5 -5
- package/dist/integrations/ai-sdk.mjs +1 -1
- package/dist/integrations/langchain.mjs +1 -1
- package/dist/integrations/llamaindex.mjs +1 -1
- package/dist/integrations/mcp.d.mts +2 -2
- package/dist/integrations/mcp.mjs +4 -4
- package/dist/{mcp-DSpjqWZC.mjs → mcp-BITYRhF6.mjs} +3 -3
- package/dist/{mcp-DSpjqWZC.mjs.map → mcp-BITYRhF6.mjs.map} +1 -1
- package/dist/{moonshine-stt-CgDXoLFd.mjs → moonshine-stt-BI-5UmD_.mjs} +640 -550
- package/dist/moonshine-stt-BI-5UmD_.mjs.map +1 -0
- package/dist/moonshine-stt-CZ00EdnB.mjs +4 -0
- package/dist/{one-liner-BgNDxJSJ.mjs → one-liner-BLz8g6Gz.mjs} +2 -2
- package/dist/{one-liner-BgNDxJSJ.mjs.map → one-liner-BLz8g6Gz.mjs.map} +1 -1
- package/dist/{repl-DSK2hDzu.mjs → repl-CXCSbfES.mjs} +3 -3
- package/dist/skills/index.d.mts +4 -4
- package/dist/skills/index.mjs +3 -3
- package/dist/{skills-Cd75ZGew.mjs → skills-BPQb-p5b.mjs} +2 -2
- package/dist/{skills-Cd75ZGew.mjs.map → skills-BPQb-p5b.mjs.map} +1 -1
- package/dist/tune/index.d.mts.map +1 -1
- package/dist/tune/index.mjs +1 -1
- package/package.json +1 -1
- package/dist/gerbil-BY5EW-Jk.mjs +0 -4
- package/dist/index-DyqcKFfQ.d.mts.map +0 -1
- package/dist/moonshine-stt-CcVt4Vdd.mjs +0 -4
- package/dist/moonshine-stt-CgDXoLFd.mjs.map +0 -1
package/dist/gpu/index.d.mts
CHANGED
|
@@ -1,3 +1,3 @@
|
|
|
1
1
|
import { a as OuteSpeakerWord, c as buildOutePromptString, i as OuteSpeaker, l as loadOuteSpeaker, n as OuteSpeakOptions, o as OuteTTS, r as OuteSpeakResult, s as OuteTTSOptions, t as OuteDType } from "../outetts-CAL3_K3j.mjs";
|
|
2
|
-
import { $ as
|
|
3
|
-
export { AdapterConfig, AdapterSource, AgentStep, AgentTool, ChatMessage, DEFAULT_MODELS, EmbedOptions, EncodeImageResult, Executor, GEMMA4_IMAGE_PROCESSOR, GPUDiagnosticResult, Gemma4VisionGraphInfo, Gemma4VisionGridConfig, Gemma4VisionPositionTensors, GenerateObjectOptions, GenerateObjectResult, GenerateOptions, GenerateResult, GraphDType, ImageProcessorConfig, IntegrityCheckEntry, IntegrityCheckResult, KVDType, KaniDType, KaniTTS, KaniTTSOptions, KvMode, LoRADelta, LoadedKaniTTS, LoadedMoonshine, MOONSHINE_REMAINING_WORK, ModelArchConfig, ModelCapabilities, MoonshineEncoderExecutor, MoonshineSTT, MoonshineSTTOptions, OUTETTS_ASSETS, OUTETTS_PRESET_VOICES, ObjectSchema, ObjectValidator, OuteDType, OuteSpeakOptions, OuteSpeakResult, OuteSpeaker, OuteSpeakerWord, OuteTTS, OuteTTSOptions, ParlerSpeakOptions, ParlerSpeakResult, ParlerTTS, ParlerTTSOptions, PreprocessedImage, QWEN3_5_IMAGE_PROCESSOR, SamplingParams, SpeakOptions, SpeakResult, Tokenizer, TranscribeOptions, TranscribeResult, VisionExecutor, VisionGridConfig, VisionInputs, VisionPositionTensors, WebGPUEngine, WebGPUEngineOptions, applyLoRAToStore, audioTokensToCodes, audioTokensToDacCodes, buildGemma4PoolMatrix, buildGemma4PosEmbeds, buildGemma4RotaryCosSin, buildGemma4VisionPositionTensors, buildLoRADeltas, buildMRoPECosSin, buildMRoPEPositionIds, buildOutePromptString, buildPosEmbeds, buildPositionIds, buildRotaryCosSin, buildVisionPositionTensors, createDefaultHFKeyMapper, dacOutputLength, dequantizeGemma4VisionProjection, dequantizeMLXProjection, fetchAdapter, generateDacSpeechDecoderGraph, generateGemma4VisionGraph, generateKaniTtsGraph, generateMoonshineDecoderGraph, generateMoonshineEncoderGraph, generateNanoCodecDecoderGraph, generateOuteTtsBackboneGraph, generateQwen3_5VisionGraph, initGPU, loadKaniTTS, loadModel, loadMoonshine, loadOuteSpeaker, moonshineEncoderFrames, mropeFreqDims, parseKaniConfig, parseMoonshineConfig, parseOuteTtsConfig, patchGemma4VisionClips, preprocessImage, preprocessImageGemma4, quantizeKaniBackbone, resolveDefaultRepo, resolveGemma4VisionInfo, smartResize };
|
|
2
|
+
import { $ as GEMMA4_IMAGE_PROCESSOR, A as generateDacSpeechDecoderGraph, At as AdapterConfig, B as generateNanoCodecDecoderGraph, Bt as SpeakOptions, C as TranscribeOptions, Ct as LoadedMoonshine, D as generateQwen3_5VisionGraph, Dt as quantizeKaniBackbone, E as Executor, Et as loadMoonshine, F as generateMoonshineEncoderGraph, Ft as fetchAdapter, G as generateGemma4VisionGraph, Gt as KVDType, H as Gemma4VisionGraphInfo, Ht as GPUDiagnosticResult, I as moonshineEncoderFrames, It as splitFusedQGateDelta, J as DEFAULT_MODELS, Jt as ModelCapabilities, K as patchGemma4VisionClips, Kt as KvMode, L as parseMoonshineConfig, Lt as KaniDType, M as parseOuteTtsConfig, Mt as LoRADelta, N as MOONSHINE_REMAINING_WORK, Nt as applyLoRAToStore, O as audioTokensToDacCodes, Ot as ChatMessage, P as generateMoonshineDecoderGraph, Pt as buildLoRADeltas, Q as resolveDefaultRepo, R as audioTokensToCodes, Rt as KaniTTS, S as MoonshineSTTOptions, St as LoadedKaniTTS, T as MoonshineEncoderExecutor, Tt as loadModel, U as dequantizeGemma4VisionProjection, Ut as initGPU, V as parseKaniConfig, Vt as SpeakResult, W as dequantizeMLXProjection, Wt as GraphDType, X as OUTETTS_PRESET_VOICES, Y as OUTETTS_ASSETS, Yt as createDefaultHFKeyMapper, Z as isTTSRepo, _ as ParlerSpeakOptions, _t as mropeFreqDims, a as GenerateObjectOptions, at as VisionGridConfig, b as ParlerTTSOptions, bt as smartResize, c as GenerateResult, ct as buildGemma4PosEmbeds, d as ObjectSchema, dt as buildMRoPECosSin, et as Gemma4VisionGridConfig, f as ObjectValidator, ft as buildMRoPEPositionIds, g as VisionInputs, gt as buildVisionPositionTensors, h as VisionExecutor, ht as buildRotaryCosSin, i as EncodeImageResult, it as QWEN3_5_IMAGE_PROCESSOR, j as generateOuteTtsBackboneGraph, jt as AdapterSource, k as dacOutputLength, kt as Tokenizer, l as IntegrityCheckEntry, lt as buildGemma4RotaryCosSin, m as WebGPUEngineOptions, mt as buildPositionIds, n as AgentTool, nt as ImageProcessorConfig, o as GenerateObjectResult, ot as VisionPositionTensors, p as WebGPUEngine, pt as buildPosEmbeds, q as resolveGemma4VisionInfo, qt as ModelArchConfig, r as EmbedOptions, rt as PreprocessedImage, s as GenerateOptions, st as buildGemma4PoolMatrix, t as AgentStep, tt as Gemma4VisionPositionTensors, u as IntegrityCheckResult, ut as buildGemma4VisionPositionTensors, v as ParlerSpeakResult, vt as preprocessImage, w as TranscribeResult, wt as loadKaniTTS, x as MoonshineSTT, xt as SamplingParams, y as ParlerTTS, yt as preprocessImageGemma4, z as generateKaniTtsGraph, zt as KaniTTSOptions } from "../index-t_hY-XWW.mjs";
|
|
3
|
+
export { AdapterConfig, AdapterSource, AgentStep, AgentTool, ChatMessage, DEFAULT_MODELS, EmbedOptions, EncodeImageResult, Executor, GEMMA4_IMAGE_PROCESSOR, GPUDiagnosticResult, Gemma4VisionGraphInfo, Gemma4VisionGridConfig, Gemma4VisionPositionTensors, GenerateObjectOptions, GenerateObjectResult, GenerateOptions, GenerateResult, GraphDType, ImageProcessorConfig, IntegrityCheckEntry, IntegrityCheckResult, KVDType, KaniDType, KaniTTS, KaniTTSOptions, KvMode, LoRADelta, LoadedKaniTTS, LoadedMoonshine, MOONSHINE_REMAINING_WORK, ModelArchConfig, ModelCapabilities, MoonshineEncoderExecutor, MoonshineSTT, MoonshineSTTOptions, OUTETTS_ASSETS, OUTETTS_PRESET_VOICES, ObjectSchema, ObjectValidator, OuteDType, OuteSpeakOptions, OuteSpeakResult, OuteSpeaker, OuteSpeakerWord, OuteTTS, OuteTTSOptions, ParlerSpeakOptions, ParlerSpeakResult, ParlerTTS, ParlerTTSOptions, PreprocessedImage, QWEN3_5_IMAGE_PROCESSOR, SamplingParams, SpeakOptions, SpeakResult, Tokenizer, TranscribeOptions, TranscribeResult, VisionExecutor, VisionGridConfig, VisionInputs, VisionPositionTensors, WebGPUEngine, WebGPUEngineOptions, applyLoRAToStore, audioTokensToCodes, audioTokensToDacCodes, buildGemma4PoolMatrix, buildGemma4PosEmbeds, buildGemma4RotaryCosSin, buildGemma4VisionPositionTensors, buildLoRADeltas, buildMRoPECosSin, buildMRoPEPositionIds, buildOutePromptString, buildPosEmbeds, buildPositionIds, buildRotaryCosSin, buildVisionPositionTensors, createDefaultHFKeyMapper, dacOutputLength, dequantizeGemma4VisionProjection, dequantizeMLXProjection, fetchAdapter, generateDacSpeechDecoderGraph, generateGemma4VisionGraph, generateKaniTtsGraph, generateMoonshineDecoderGraph, generateMoonshineEncoderGraph, generateNanoCodecDecoderGraph, generateOuteTtsBackboneGraph, generateQwen3_5VisionGraph, initGPU, isTTSRepo, loadKaniTTS, loadModel, loadMoonshine, loadOuteSpeaker, moonshineEncoderFrames, mropeFreqDims, parseKaniConfig, parseMoonshineConfig, parseOuteTtsConfig, patchGemma4VisionClips, preprocessImage, preprocessImageGemma4, quantizeKaniBackbone, resolveDefaultRepo, resolveGemma4VisionInfo, smartResize, splitFusedQGateDelta };
|
package/dist/gpu/index.mjs
CHANGED
|
@@ -1,6 +1,6 @@
|
|
|
1
|
-
import {
|
|
1
|
+
import { a as resolveDefaultRepo, i as isTTSRepo, n as OUTETTS_ASSETS, r as OUTETTS_PRESET_VOICES, t as DEFAULT_MODELS } from "../defaults-DfGx4d1m.mjs";
|
|
2
2
|
import { E as generateNanoCodecDecoderGraph, M as parseKaniConfig, R as createDefaultHFKeyMapper, T as generateKaniTtsGraph, _ as moonshineEncoderFrames, g as generateMoonshineEncoderGraph, h as generateMoonshineDecoderGraph, m as MOONSHINE_REMAINING_WORK, v as parseMoonshineConfig, x as audioTokensToCodes } from "../architectures-DmZMEFsA.mjs";
|
|
3
|
-
import { A as dequantizeGemma4VisionProjection, C as audioTokensToDacCodes, D as parseOuteTtsConfig, E as generateOuteTtsBackboneGraph, M as generateGemma4VisionGraph, N as patchGemma4VisionClips, O as KaniTTS, P as resolveGemma4VisionInfo, S as loadOuteSpeaker, T as generateDacSpeechDecoderGraph, _ as smartResize, a as buildGemma4PosEmbeds, b as OuteTTS, c as buildMRoPECosSin, d as buildPositionIds, f as buildRotaryCosSin, g as preprocessImageGemma4, h as preprocessImage, i as buildGemma4PoolMatrix, j as dequantizeMLXProjection, k as generateQwen3_5VisionGraph, l as buildMRoPEPositionIds, m as mropeFreqDims, n as GEMMA4_IMAGE_PROCESSOR, o as buildGemma4RotaryCosSin, p as buildVisionPositionTensors, r as QWEN3_5_IMAGE_PROCESSOR, s as buildGemma4VisionPositionTensors, t as WebGPUEngine, u as buildPosEmbeds, v as VisionExecutor, w as dacOutputLength, x as buildOutePromptString, y as ParlerTTS } from "../gpu-
|
|
4
|
-
import {
|
|
3
|
+
import { A as dequantizeGemma4VisionProjection, C as audioTokensToDacCodes, D as parseOuteTtsConfig, E as generateOuteTtsBackboneGraph, M as generateGemma4VisionGraph, N as patchGemma4VisionClips, O as KaniTTS, P as resolveGemma4VisionInfo, S as loadOuteSpeaker, T as generateDacSpeechDecoderGraph, _ as smartResize, a as buildGemma4PosEmbeds, b as OuteTTS, c as buildMRoPECosSin, d as buildPositionIds, f as buildRotaryCosSin, g as preprocessImageGemma4, h as preprocessImage, i as buildGemma4PoolMatrix, j as dequantizeMLXProjection, k as generateQwen3_5VisionGraph, l as buildMRoPEPositionIds, m as mropeFreqDims, n as GEMMA4_IMAGE_PROCESSOR, o as buildGemma4RotaryCosSin, p as buildVisionPositionTensors, r as QWEN3_5_IMAGE_PROCESSOR, s as buildGemma4VisionPositionTensors, t as WebGPUEngine, u as buildPosEmbeds, v as VisionExecutor, w as dacOutputLength, x as buildOutePromptString, y as ParlerTTS } from "../gpu-BQ8I-VDx.mjs";
|
|
4
|
+
import { E as initGPU, _ as splitFusedQGateDelta, a as loadModel, f as Tokenizer, g as fetchAdapter, h as buildLoRADeltas, i as loadKaniTTS, m as applyLoRAToStore, n as MoonshineEncoderExecutor, o as loadMoonshine, p as Executor, t as MoonshineSTT, u as quantizeKaniBackbone } from "../moonshine-stt-BI-5UmD_.mjs";
|
|
5
5
|
|
|
6
|
-
export { DEFAULT_MODELS, Executor, GEMMA4_IMAGE_PROCESSOR, KaniTTS, MOONSHINE_REMAINING_WORK, MoonshineEncoderExecutor, MoonshineSTT, OUTETTS_ASSETS, OUTETTS_PRESET_VOICES, OuteTTS, ParlerTTS, QWEN3_5_IMAGE_PROCESSOR, Tokenizer, VisionExecutor, WebGPUEngine, applyLoRAToStore, audioTokensToCodes, audioTokensToDacCodes, buildGemma4PoolMatrix, buildGemma4PosEmbeds, buildGemma4RotaryCosSin, buildGemma4VisionPositionTensors, buildLoRADeltas, buildMRoPECosSin, buildMRoPEPositionIds, buildOutePromptString, buildPosEmbeds, buildPositionIds, buildRotaryCosSin, buildVisionPositionTensors, createDefaultHFKeyMapper, dacOutputLength, dequantizeGemma4VisionProjection, dequantizeMLXProjection, fetchAdapter, generateDacSpeechDecoderGraph, generateGemma4VisionGraph, generateKaniTtsGraph, generateMoonshineDecoderGraph, generateMoonshineEncoderGraph, generateNanoCodecDecoderGraph, generateOuteTtsBackboneGraph, generateQwen3_5VisionGraph, initGPU, loadKaniTTS, loadModel, loadMoonshine, loadOuteSpeaker, moonshineEncoderFrames, mropeFreqDims, parseKaniConfig, parseMoonshineConfig, parseOuteTtsConfig, patchGemma4VisionClips, preprocessImage, preprocessImageGemma4, quantizeKaniBackbone, resolveDefaultRepo, resolveGemma4VisionInfo, smartResize };
|
|
6
|
+
export { DEFAULT_MODELS, Executor, GEMMA4_IMAGE_PROCESSOR, KaniTTS, MOONSHINE_REMAINING_WORK, MoonshineEncoderExecutor, MoonshineSTT, OUTETTS_ASSETS, OUTETTS_PRESET_VOICES, OuteTTS, ParlerTTS, QWEN3_5_IMAGE_PROCESSOR, Tokenizer, VisionExecutor, WebGPUEngine, applyLoRAToStore, audioTokensToCodes, audioTokensToDacCodes, buildGemma4PoolMatrix, buildGemma4PosEmbeds, buildGemma4RotaryCosSin, buildGemma4VisionPositionTensors, buildLoRADeltas, buildMRoPECosSin, buildMRoPEPositionIds, buildOutePromptString, buildPosEmbeds, buildPositionIds, buildRotaryCosSin, buildVisionPositionTensors, createDefaultHFKeyMapper, dacOutputLength, dequantizeGemma4VisionProjection, dequantizeMLXProjection, fetchAdapter, generateDacSpeechDecoderGraph, generateGemma4VisionGraph, generateKaniTtsGraph, generateMoonshineDecoderGraph, generateMoonshineEncoderGraph, generateNanoCodecDecoderGraph, generateOuteTtsBackboneGraph, generateQwen3_5VisionGraph, initGPU, isTTSRepo, loadKaniTTS, loadModel, loadMoonshine, loadOuteSpeaker, moonshineEncoderFrames, mropeFreqDims, parseKaniConfig, parseMoonshineConfig, parseOuteTtsConfig, patchGemma4VisionClips, preprocessImage, preprocessImageGemma4, quantizeKaniBackbone, resolveDefaultRepo, resolveGemma4VisionInfo, smartResize, splitFusedQGateDelta };
|
|
@@ -1,6 +1,6 @@
|
|
|
1
|
-
import {
|
|
1
|
+
import { a as resolveDefaultRepo, i as isTTSRepo, n as OUTETTS_ASSETS, r as OUTETTS_PRESET_VOICES, t as DEFAULT_MODELS } from "./defaults-DfGx4d1m.mjs";
|
|
2
2
|
import { A as kaniSinTensor, C as computeKaniPositions, D as kaniAttentionLayerIndices, E as generateNanoCodecDecoderGraph, F as CANONICAL_KEYS, I as DTYPE_BYTES, L as GEMMA4_VIS_KEYS, M as parseKaniConfig, N as DEFAULT_GROUP_SIZE, O as kaniCosTensor, S as buildKaniLayerCosSin, T as generateKaniTtsGraph, a as PARLER_DAC_LATENT_DIM, b as KANI_START_OF_HUMAN, c as PARLER_SAMPLE_RATE, d as generateParlerEncoderGraph, f as parseParlerConfig, i as PARLER_DAC_DECODER_DIM, k as kaniLayerAlpha, l as buildT5RelativeBias, o as PARLER_DECODER_RATES, p as revertDelayPattern, r as PARLER_BOS_TOKEN_ID, s as PARLER_EOS_TOKEN_ID, u as generateParlerDecoderGraph, x as audioTokensToCodes, y as KANI_END_OF_HUMAN } from "./architectures-DmZMEFsA.mjs";
|
|
3
|
-
import { C as
|
|
3
|
+
import { C as createUniformBuffer, D as verifyGPU, E as initGPU, S as createStorageBuffer, T as getOrCreatePipeline, a as loadModel, b as clearPipelineCache, c as loadParlerTTS, d as remapPrunedToken, g as fetchAdapter, h as buildLoRADeltas, i as loadKaniTTS, l as quantizeBackboneInt4, p as Executor, r as createKeyMapperForArch, s as loadOuteTTS, u as quantizeKaniBackbone, v as KERNEL_REGISTRY, w as destroyBuffers, x as createBindGroup, y as MATMUL_BIAS_F16C_SPEC } from "./moonshine-stt-BI-5UmD_.mjs";
|
|
4
4
|
|
|
5
5
|
//#region src/gpu/architectures/gemma4_vision.ts
|
|
6
6
|
/**
|
|
@@ -5101,9 +5101,22 @@ function parseAgentToolCall(text) {
|
|
|
5101
5101
|
return null;
|
|
5102
5102
|
}
|
|
5103
5103
|
var WebGPUEngine = class WebGPUEngine {
|
|
5104
|
-
|
|
5105
|
-
|
|
5106
|
-
|
|
5104
|
+
_ctx;
|
|
5105
|
+
_executor;
|
|
5106
|
+
_tokenizer;
|
|
5107
|
+
get ctx() {
|
|
5108
|
+
if (!this._ctx) throw new Error(WebGPUEngine.TTS_LITE_ERROR);
|
|
5109
|
+
return this._ctx;
|
|
5110
|
+
}
|
|
5111
|
+
get executor() {
|
|
5112
|
+
if (!this._executor) throw new Error(WebGPUEngine.TTS_LITE_ERROR);
|
|
5113
|
+
return this._executor;
|
|
5114
|
+
}
|
|
5115
|
+
get tokenizer() {
|
|
5116
|
+
if (!this._tokenizer) throw new Error(WebGPUEngine.TTS_LITE_ERROR);
|
|
5117
|
+
return this._tokenizer;
|
|
5118
|
+
}
|
|
5119
|
+
static TTS_LITE_ERROR = "This engine was created for a TTS checkpoint; base-model ops (generate/embed/describeImage) are unavailable. Use speak() / encodeSpeaker().";
|
|
5107
5120
|
_destroyed = false;
|
|
5108
5121
|
_isEmbedding;
|
|
5109
5122
|
/** HF architecture string (e.g. "Gemma3TextModel", "Qwen3ForCausalLM"). */
|
|
@@ -5155,16 +5168,25 @@ var WebGPUEngine = class WebGPUEngine {
|
|
|
5155
5168
|
_genQueueTail = Promise.resolve();
|
|
5156
5169
|
/** Model capabilities (text, vision, moe). */
|
|
5157
5170
|
capabilities;
|
|
5158
|
-
/** Model architecture config. */
|
|
5159
|
-
|
|
5171
|
+
/** Model architecture config (null on a TTS-only lite engine). */
|
|
5172
|
+
_config;
|
|
5173
|
+
/** Model architecture config. Throws on a TTS-only lite engine. */
|
|
5174
|
+
get config() {
|
|
5175
|
+
if (!this._config) throw new Error(WebGPUEngine.TTS_LITE_ERROR);
|
|
5176
|
+
return this._config;
|
|
5177
|
+
}
|
|
5160
5178
|
constructor(ctx, executor, tokenizer, graph, opts, vision) {
|
|
5161
|
-
this.
|
|
5162
|
-
this.
|
|
5163
|
-
this.
|
|
5164
|
-
this.capabilities = graph
|
|
5165
|
-
|
|
5166
|
-
|
|
5167
|
-
|
|
5179
|
+
this._ctx = ctx;
|
|
5180
|
+
this._executor = executor;
|
|
5181
|
+
this._tokenizer = tokenizer;
|
|
5182
|
+
this.capabilities = graph?.capabilities ?? {
|
|
5183
|
+
text: true,
|
|
5184
|
+
vision: false,
|
|
5185
|
+
moe: false
|
|
5186
|
+
};
|
|
5187
|
+
this._config = graph?.config ?? null;
|
|
5188
|
+
this._isEmbedding = graph?.outputs.includes("embedding") ?? false;
|
|
5189
|
+
this._architecture = graph?.architecture ?? "";
|
|
5168
5190
|
this.visionExecutor = vision?.executor ?? null;
|
|
5169
5191
|
this.visionConfig = vision?.config ?? null;
|
|
5170
5192
|
this.visionPosEmbedTable = vision?.posEmbedTable ?? null;
|
|
@@ -5281,6 +5303,7 @@ var WebGPUEngine = class WebGPUEngine {
|
|
|
5281
5303
|
...options,
|
|
5282
5304
|
repo: resolveDefaultRepo(options)
|
|
5283
5305
|
};
|
|
5306
|
+
if (isTTSRepo(options.repo)) return WebGPUEngine._buildTTSLite(options);
|
|
5284
5307
|
const ctx = await initGPU();
|
|
5285
5308
|
try {
|
|
5286
5309
|
return await WebGPUEngine._buildFromContext(ctx, options);
|
|
@@ -5291,6 +5314,21 @@ var WebGPUEngine = class WebGPUEngine {
|
|
|
5291
5314
|
throw err;
|
|
5292
5315
|
}
|
|
5293
5316
|
}
|
|
5317
|
+
/**
|
|
5318
|
+
* Build a lightweight TTS-only engine: no GPU device is initialized and no base
|
|
5319
|
+
* text graph is loaded. It stores the create() options; the first `speak()`
|
|
5320
|
+
* (or `encodeSpeaker()`) lazily builds the dedicated native TTS engine —
|
|
5321
|
+
* {@link KaniTTS}, {@link OuteTTS}, or {@link ParlerTTS} — which brings its own
|
|
5322
|
+
* GPU device and weights. Base-model ops throw {@link WebGPUEngine.TTS_LITE_ERROR}.
|
|
5323
|
+
*/
|
|
5324
|
+
static _buildTTSLite(options) {
|
|
5325
|
+
return new WebGPUEngine(null, null, null, null, {
|
|
5326
|
+
multimodalGraph: false,
|
|
5327
|
+
rawConfig: {},
|
|
5328
|
+
maxSeqLen: options.maxSeqLen ?? 2048,
|
|
5329
|
+
createOptions: options
|
|
5330
|
+
}, null);
|
|
5331
|
+
}
|
|
5294
5332
|
static async _buildFromContext(ctx, options) {
|
|
5295
5333
|
const isBrowser = typeof navigator !== "undefined" && typeof location !== "undefined";
|
|
5296
5334
|
const isSafari = isBrowser && /Safari/.test(navigator.userAgent) && !/Chrome/.test(navigator.userAgent);
|
|
@@ -6685,13 +6723,15 @@ var WebGPUEngine = class WebGPUEngine {
|
|
|
6685
6723
|
destroy() {
|
|
6686
6724
|
if (this._destroyed) return;
|
|
6687
6725
|
this._destroyed = true;
|
|
6688
|
-
this.
|
|
6726
|
+
this._executor?.destroy();
|
|
6689
6727
|
this._kaniTTS?.destroy();
|
|
6690
6728
|
this._outeTTS?.destroy();
|
|
6691
6729
|
this._parlerTTS?.destroy();
|
|
6692
6730
|
this.visionExecutor?.destroy();
|
|
6693
|
-
|
|
6694
|
-
|
|
6731
|
+
if (this._ctx) {
|
|
6732
|
+
clearPipelineCache(this._ctx.device);
|
|
6733
|
+
this._ctx.device.destroy();
|
|
6734
|
+
}
|
|
6695
6735
|
}
|
|
6696
6736
|
checkDestroyed() {
|
|
6697
6737
|
if (this._destroyed) throw new Error("WebGPUEngine has been destroyed");
|
|
@@ -6722,4 +6762,4 @@ var WebGPUEngine = class WebGPUEngine {
|
|
|
6722
6762
|
|
|
6723
6763
|
//#endregion
|
|
6724
6764
|
export { dequantizeGemma4VisionProjection as A, audioTokensToDacCodes as C, parseOuteTtsConfig as D, generateOuteTtsBackboneGraph as E, generateGemma4VisionGraph as M, patchGemma4VisionClips as N, KaniTTS as O, resolveGemma4VisionInfo as P, loadOuteSpeaker as S, generateDacSpeechDecoderGraph as T, smartResize as _, buildGemma4PosEmbeds as a, OuteTTS as b, buildMRoPECosSin as c, buildPositionIds as d, buildRotaryCosSin as f, preprocessImageGemma4 as g, preprocessImage as h, buildGemma4PoolMatrix as i, dequantizeMLXProjection as j, generateQwen3_5VisionGraph as k, buildMRoPEPositionIds as l, mropeFreqDims as m, GEMMA4_IMAGE_PROCESSOR as n, buildGemma4RotaryCosSin as o, buildVisionPositionTensors as p, QWEN3_5_IMAGE_PROCESSOR as r, buildGemma4VisionPositionTensors as s, WebGPUEngine as t, buildPosEmbeds as u, VisionExecutor as v, dacOutputLength as w, buildOutePromptString as x, ParlerTTS as y };
|
|
6725
|
-
//# sourceMappingURL=gpu-
|
|
6765
|
+
//# sourceMappingURL=gpu-BQ8I-VDx.mjs.map
|