@latimer-woods-tech/llm 0.2.0 → 0.3.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +76 -11
- package/README.md +59 -2
- package/dist/index.d.mts +143 -24
- package/dist/index.mjs +520 -172
- package/dist/index.mjs.map +1 -1
- package/package.json +8 -3
package/dist/index.mjs
CHANGED
|
@@ -1,235 +1,583 @@
|
|
|
1
1
|
// src/index.ts
|
|
2
2
|
import {
|
|
3
|
-
ErrorCodes,
|
|
4
3
|
InternalError,
|
|
5
4
|
RateLimitError,
|
|
6
|
-
ValidationError
|
|
5
|
+
ValidationError,
|
|
6
|
+
toErrorResponse
|
|
7
7
|
} from "@latimer-woods-tech/errors";
|
|
8
|
+
var MODELS = {
|
|
9
|
+
anthropic: {
|
|
10
|
+
fast: "claude-haiku-4-20250514",
|
|
11
|
+
balanced: "claude-sonnet-4-6",
|
|
12
|
+
smart: "claude-opus-4-7"
|
|
13
|
+
},
|
|
14
|
+
gemini: {
|
|
15
|
+
smart: "gemini-2.5-pro"
|
|
16
|
+
},
|
|
17
|
+
groq: {
|
|
18
|
+
verifier: "llama-3.3-70b-versatile"
|
|
19
|
+
},
|
|
20
|
+
grok: {
|
|
21
|
+
/** Opt-in only via `{ model: 'grok-*' }`. Not in default tier routing. */
|
|
22
|
+
fast: "grok-4-fast",
|
|
23
|
+
mini: "grok-3-mini-latest"
|
|
24
|
+
}
|
|
25
|
+
};
|
|
8
26
|
var DEFAULT_MAX_TOKENS = 1024;
|
|
9
27
|
var DEFAULT_TEMPERATURE = 0.7;
|
|
10
|
-
var
|
|
11
|
-
var
|
|
12
|
-
var
|
|
13
|
-
|
|
14
|
-
|
|
28
|
+
var DEFAULT_LONG_CONTEXT_THRESHOLD = 15e4;
|
|
29
|
+
var BACKOFF_BASE_MS = 500;
|
|
30
|
+
var BACKOFF_CAP_MS = 8e3;
|
|
31
|
+
var BACKOFF_JITTER_MAX_MS = 250;
|
|
32
|
+
var PER_PROVIDER_MAX_ATTEMPTS = 3;
|
|
33
|
+
var providerCooldownUntil = /* @__PURE__ */ new Map();
|
|
34
|
+
var PROVIDER_COOLDOWN_MS = 3e4;
|
|
35
|
+
function isProviderCoolingDown(provider, now = Date.now) {
|
|
36
|
+
const until = providerCooldownUntil.get(provider);
|
|
37
|
+
if (until === void 0) return false;
|
|
38
|
+
return now() < until;
|
|
39
|
+
}
|
|
40
|
+
function markProviderCoolingDown(provider, now = Date.now) {
|
|
41
|
+
providerCooldownUntil.set(provider, now() + PROVIDER_COOLDOWN_MS);
|
|
42
|
+
}
|
|
43
|
+
function clearProviderCooldown(provider) {
|
|
44
|
+
providerCooldownUntil.delete(provider);
|
|
45
|
+
}
|
|
46
|
+
var BASE_BACKOFF_MS = 250;
|
|
47
|
+
function isRetryableForBackoff(status) {
|
|
48
|
+
return status === 429 || status >= 500 && status < 600;
|
|
49
|
+
}
|
|
50
|
+
function estimateTokens(messages, system) {
|
|
51
|
+
let chars = system?.length ?? 0;
|
|
52
|
+
for (const m of messages) chars += m.content.length;
|
|
53
|
+
return Math.ceil(chars / 4);
|
|
54
|
+
}
|
|
55
|
+
function sleep(ms, signal) {
|
|
56
|
+
return new Promise((resolve, reject) => {
|
|
57
|
+
const t = setTimeout(resolve, ms);
|
|
58
|
+
if (signal) {
|
|
59
|
+
const onAbort = () => {
|
|
60
|
+
clearTimeout(t);
|
|
61
|
+
reject(new DOMException("Aborted", "AbortError"));
|
|
62
|
+
};
|
|
63
|
+
if (signal.aborted) onAbort();
|
|
64
|
+
else signal.addEventListener("abort", onAbort, { once: true });
|
|
65
|
+
}
|
|
66
|
+
});
|
|
15
67
|
}
|
|
16
|
-
function
|
|
68
|
+
function computeBackoffMs(attempt) {
|
|
69
|
+
const jitter = Math.floor(Math.random() * BACKOFF_JITTER_MAX_MS);
|
|
70
|
+
return Math.min(BACKOFF_BASE_MS * Math.pow(2, attempt) + jitter, BACKOFF_CAP_MS);
|
|
71
|
+
}
|
|
72
|
+
function buildAnthropicRequest(model, messages, opts, env, streaming = false) {
|
|
73
|
+
const sys = opts.system ?? messages.find((m) => m.role === "system")?.content;
|
|
17
74
|
const filtered = messages.filter((m) => m.role !== "system");
|
|
18
|
-
const sys = system ?? messages.find((m) => m.role === "system")?.content;
|
|
19
75
|
const body = {
|
|
20
|
-
model
|
|
76
|
+
model,
|
|
21
77
|
max_tokens: opts.maxTokens ?? DEFAULT_MAX_TOKENS,
|
|
22
78
|
temperature: opts.temperature ?? DEFAULT_TEMPERATURE,
|
|
23
79
|
messages: filtered.map((m) => ({ role: m.role, content: m.content }))
|
|
24
80
|
};
|
|
81
|
+
if (streaming) {
|
|
82
|
+
body.stream = true;
|
|
83
|
+
}
|
|
25
84
|
if (sys) {
|
|
26
|
-
|
|
85
|
+
const cache = opts.promptCache ?? sys.length >= 4096;
|
|
86
|
+
body.system = cache ? [{ type: "text", text: sys, cache_control: { type: "ephemeral" } }] : sys;
|
|
27
87
|
}
|
|
28
|
-
return
|
|
88
|
+
return {
|
|
89
|
+
url: `${env.AI_GATEWAY_BASE_URL}/anthropic/v1/messages`,
|
|
90
|
+
headers: {
|
|
91
|
+
"content-type": "application/json",
|
|
92
|
+
"x-api-key": env.ANTHROPIC_API_KEY,
|
|
93
|
+
"anthropic-version": "2023-06-01",
|
|
94
|
+
"anthropic-beta": "prompt-caching-2024-07-31"
|
|
95
|
+
},
|
|
96
|
+
body: JSON.stringify(body)
|
|
97
|
+
};
|
|
29
98
|
}
|
|
30
|
-
function
|
|
31
|
-
const sys = system ?? messages.find((m) => m.role === "system")?.content;
|
|
32
|
-
const
|
|
99
|
+
function buildGeminiRequest(model, messages, opts, env) {
|
|
100
|
+
const sys = opts.system ?? messages.find((m) => m.role === "system")?.content;
|
|
101
|
+
const contents = messages.filter((m) => m.role !== "system").map((m) => ({
|
|
102
|
+
role: m.role === "assistant" ? "model" : "user",
|
|
103
|
+
parts: [{ text: m.content }]
|
|
104
|
+
}));
|
|
105
|
+
const body = {
|
|
106
|
+
contents,
|
|
107
|
+
generationConfig: {
|
|
108
|
+
maxOutputTokens: opts.maxTokens ?? DEFAULT_MAX_TOKENS,
|
|
109
|
+
temperature: opts.temperature ?? DEFAULT_TEMPERATURE
|
|
110
|
+
}
|
|
111
|
+
};
|
|
33
112
|
if (sys) {
|
|
34
|
-
|
|
113
|
+
body.systemInstruction = { parts: [{ text: sys }] };
|
|
35
114
|
}
|
|
36
|
-
|
|
37
|
-
|
|
38
|
-
|
|
39
|
-
|
|
115
|
+
const path = `v1/projects/${env.VERTEX_PROJECT}/locations/${env.VERTEX_LOCATION}/publishers/google/models/${model}:generateContent`;
|
|
116
|
+
return {
|
|
117
|
+
url: `${env.AI_GATEWAY_BASE_URL}/google-vertex-ai/${path}`,
|
|
118
|
+
headers: {
|
|
119
|
+
"content-type": "application/json",
|
|
120
|
+
authorization: `Bearer ${env.VERTEX_ACCESS_TOKEN}`
|
|
121
|
+
},
|
|
122
|
+
body: JSON.stringify(body)
|
|
123
|
+
};
|
|
124
|
+
}
|
|
125
|
+
function buildGroqRequest(model, messages, opts, env) {
|
|
126
|
+
const sys = opts.system ?? messages.find((m) => m.role === "system")?.content;
|
|
127
|
+
const merged = [];
|
|
128
|
+
if (sys) merged.push({ role: "system", content: sys });
|
|
129
|
+
for (const m of messages) if (m.role !== "system") merged.push(m);
|
|
130
|
+
return {
|
|
131
|
+
url: `${env.AI_GATEWAY_BASE_URL}/groq/openai/v1/chat/completions`,
|
|
132
|
+
headers: {
|
|
133
|
+
"content-type": "application/json",
|
|
134
|
+
authorization: `Bearer ${env.GROQ_API_KEY}`
|
|
135
|
+
},
|
|
136
|
+
body: JSON.stringify({
|
|
137
|
+
model,
|
|
138
|
+
max_tokens: opts.maxTokens ?? DEFAULT_MAX_TOKENS,
|
|
139
|
+
temperature: opts.temperature ?? DEFAULT_TEMPERATURE,
|
|
140
|
+
messages: merged
|
|
141
|
+
})
|
|
142
|
+
};
|
|
143
|
+
}
|
|
144
|
+
function buildGrokRequest(model, messages, opts, env) {
|
|
145
|
+
if (!env.GROK_API_KEY) {
|
|
146
|
+
throw new ValidationError("GROK_API_KEY required for grok-* model override");
|
|
40
147
|
}
|
|
41
|
-
|
|
42
|
-
|
|
43
|
-
|
|
44
|
-
|
|
45
|
-
|
|
46
|
-
|
|
148
|
+
const sys = opts.system ?? messages.find((m) => m.role === "system")?.content;
|
|
149
|
+
const merged = [];
|
|
150
|
+
if (sys) merged.push({ role: "system", content: sys });
|
|
151
|
+
for (const m of messages) if (m.role !== "system") merged.push(m);
|
|
152
|
+
return {
|
|
153
|
+
url: `${env.AI_GATEWAY_BASE_URL}/grok/v1/chat/completions`,
|
|
154
|
+
headers: {
|
|
155
|
+
"content-type": "application/json",
|
|
156
|
+
authorization: `Bearer ${env.GROK_API_KEY}`
|
|
157
|
+
},
|
|
158
|
+
body: JSON.stringify({
|
|
159
|
+
model,
|
|
160
|
+
max_tokens: opts.maxTokens ?? DEFAULT_MAX_TOKENS,
|
|
161
|
+
temperature: opts.temperature ?? DEFAULT_TEMPERATURE,
|
|
162
|
+
messages: merged
|
|
163
|
+
})
|
|
164
|
+
};
|
|
47
165
|
}
|
|
48
166
|
function parseAnthropic(json) {
|
|
49
167
|
const r = json;
|
|
50
|
-
const text = r.content?.find((c) => c.type === "text")?.text ?? "";
|
|
51
168
|
return {
|
|
52
|
-
content: text,
|
|
169
|
+
content: r.content?.find((c) => c.type === "text")?.text ?? "",
|
|
53
170
|
input: r.usage?.input_tokens ?? 0,
|
|
54
|
-
output: r.usage?.output_tokens ?? 0
|
|
171
|
+
output: r.usage?.output_tokens ?? 0,
|
|
172
|
+
cacheRead: r.usage?.cache_read_input_tokens ?? 0,
|
|
173
|
+
cacheWrite: r.usage?.cache_creation_input_tokens ?? 0,
|
|
174
|
+
model: r.model
|
|
55
175
|
};
|
|
56
176
|
}
|
|
57
|
-
function
|
|
177
|
+
function parseGemini(json) {
|
|
58
178
|
const r = json;
|
|
59
|
-
const text = r.
|
|
179
|
+
const text = r.candidates?.[0]?.content?.parts?.map((p) => p.text ?? "").join("") ?? "";
|
|
60
180
|
return {
|
|
61
181
|
content: text,
|
|
182
|
+
input: r.usageMetadata?.promptTokenCount ?? 0,
|
|
183
|
+
output: r.usageMetadata?.candidatesTokenCount ?? 0
|
|
184
|
+
};
|
|
185
|
+
}
|
|
186
|
+
function parseGroq(json) {
|
|
187
|
+
const r = json;
|
|
188
|
+
return {
|
|
189
|
+
content: r.choices?.[0]?.message?.content ?? "",
|
|
62
190
|
input: r.usage?.prompt_tokens ?? 0,
|
|
63
|
-
output: r.usage?.completion_tokens ?? 0
|
|
191
|
+
output: r.usage?.completion_tokens ?? 0,
|
|
192
|
+
model: r.model
|
|
64
193
|
};
|
|
65
194
|
}
|
|
66
|
-
async function
|
|
67
|
-
|
|
68
|
-
|
|
69
|
-
headers: request.headers,
|
|
70
|
-
body: request.body
|
|
71
|
-
});
|
|
72
|
-
if (!response.ok) {
|
|
73
|
-
const text = await response.text().catch(() => "");
|
|
74
|
-
const err = {
|
|
75
|
-
status: response.status,
|
|
76
|
-
message: `${provider} request failed (${String(response.status)}): ${text.slice(0, 200)}`
|
|
77
|
-
};
|
|
195
|
+
async function callWithBackoff(provider, request, fetchImpl, signal, logger, nowFn) {
|
|
196
|
+
function exhaustAndThrow(err) {
|
|
197
|
+
markProviderCoolingDown(provider, nowFn ?? Date.now);
|
|
78
198
|
throw err;
|
|
79
199
|
}
|
|
80
|
-
|
|
200
|
+
let lastErr;
|
|
201
|
+
for (let attempt = 1; attempt <= PER_PROVIDER_MAX_ATTEMPTS; attempt++) {
|
|
202
|
+
try {
|
|
203
|
+
const response = await fetchImpl(request.url, {
|
|
204
|
+
method: "POST",
|
|
205
|
+
headers: request.headers,
|
|
206
|
+
body: request.body,
|
|
207
|
+
signal
|
|
208
|
+
});
|
|
209
|
+
if (!response.ok) {
|
|
210
|
+
const text = await response.text().catch(() => "");
|
|
211
|
+
const retryable = isRetryableForBackoff(response.status);
|
|
212
|
+
const err = {
|
|
213
|
+
provider,
|
|
214
|
+
status: response.status,
|
|
215
|
+
retryable,
|
|
216
|
+
message: `${provider} ${String(response.status)}: ${text.slice(0, 300)}`
|
|
217
|
+
};
|
|
218
|
+
logger?.warn?.("llm.provider.error", { provider, status: response.status, attempt });
|
|
219
|
+
if (!err.retryable || attempt === PER_PROVIDER_MAX_ATTEMPTS) {
|
|
220
|
+
if (err.retryable) exhaustAndThrow(err);
|
|
221
|
+
throw err;
|
|
222
|
+
}
|
|
223
|
+
lastErr = err;
|
|
224
|
+
} else {
|
|
225
|
+
const gatewayRequestId = response.headers.get("cf-aig-request-id") ?? void 0;
|
|
226
|
+
clearProviderCooldown(provider);
|
|
227
|
+
return { json: await response.json(), gatewayRequestId, attempts: attempt };
|
|
228
|
+
}
|
|
229
|
+
} catch (e) {
|
|
230
|
+
if (e instanceof DOMException && e.name === "AbortError") throw e;
|
|
231
|
+
if (typeof e === "object" && e !== null && "retryable" in e) {
|
|
232
|
+
const err = e;
|
|
233
|
+
if (!err.retryable || attempt === PER_PROVIDER_MAX_ATTEMPTS) {
|
|
234
|
+
if (err.retryable) exhaustAndThrow(err);
|
|
235
|
+
throw err;
|
|
236
|
+
}
|
|
237
|
+
lastErr = err;
|
|
238
|
+
} else {
|
|
239
|
+
const err = {
|
|
240
|
+
provider,
|
|
241
|
+
status: 0,
|
|
242
|
+
retryable: true,
|
|
243
|
+
message: e instanceof Error ? e.message : String(e)
|
|
244
|
+
};
|
|
245
|
+
if (attempt === PER_PROVIDER_MAX_ATTEMPTS) exhaustAndThrow(err);
|
|
246
|
+
lastErr = err;
|
|
247
|
+
}
|
|
248
|
+
}
|
|
249
|
+
const backoffMs = computeBackoffMs(attempt - 1);
|
|
250
|
+
await sleep(backoffMs, signal);
|
|
251
|
+
}
|
|
252
|
+
markProviderCoolingDown(provider, nowFn ?? Date.now);
|
|
253
|
+
throw lastErr ?? { provider, status: 0, retryable: false, message: "exhausted" };
|
|
81
254
|
}
|
|
82
255
|
function isProviderError(err) {
|
|
83
|
-
return typeof err === "object" && err !== null && typeof err.status === "number" && typeof err.message === "string";
|
|
256
|
+
return typeof err === "object" && err !== null && typeof err.status === "number" && typeof err.message === "string" && typeof err.provider === "string";
|
|
257
|
+
}
|
|
258
|
+
function plan(tier, opts, tokenEstimate) {
|
|
259
|
+
if (opts.model) {
|
|
260
|
+
const m = opts.model;
|
|
261
|
+
if (m.startsWith("claude")) return { primary: { provider: "anthropic", model: m } };
|
|
262
|
+
if (m.startsWith("gemini")) return { primary: { provider: "gemini", model: m } };
|
|
263
|
+
if (m.startsWith("grok")) return { primary: { provider: "grok", model: m } };
|
|
264
|
+
return { primary: { provider: "groq", model: m } };
|
|
265
|
+
}
|
|
266
|
+
const longContext = tokenEstimate >= (opts.longContextThreshold ?? DEFAULT_LONG_CONTEXT_THRESHOLD);
|
|
267
|
+
switch (tier) {
|
|
268
|
+
case "verifier":
|
|
269
|
+
return { primary: { provider: "groq", model: MODELS.groq.verifier } };
|
|
270
|
+
case "smart":
|
|
271
|
+
return longContext ? {
|
|
272
|
+
primary: { provider: "gemini", model: MODELS.gemini.smart },
|
|
273
|
+
fallback: { provider: "anthropic", model: MODELS.anthropic.smart }
|
|
274
|
+
} : {
|
|
275
|
+
primary: { provider: "anthropic", model: MODELS.anthropic.smart },
|
|
276
|
+
fallback: { provider: "gemini", model: MODELS.gemini.smart }
|
|
277
|
+
};
|
|
278
|
+
case "fast":
|
|
279
|
+
return { primary: { provider: "anthropic", model: MODELS.anthropic.fast } };
|
|
280
|
+
case "balanced":
|
|
281
|
+
default:
|
|
282
|
+
return longContext ? {
|
|
283
|
+
primary: { provider: "gemini", model: MODELS.gemini.smart },
|
|
284
|
+
fallback: { provider: "anthropic", model: MODELS.anthropic.balanced }
|
|
285
|
+
} : {
|
|
286
|
+
primary: { provider: "anthropic", model: MODELS.anthropic.balanced },
|
|
287
|
+
fallback: { provider: "gemini", model: MODELS.gemini.smart }
|
|
288
|
+
};
|
|
289
|
+
}
|
|
290
|
+
}
|
|
291
|
+
async function callOne(leg, messages, opts, env, fetchImpl, logger, nowFn) {
|
|
292
|
+
let req;
|
|
293
|
+
switch (leg.provider) {
|
|
294
|
+
case "anthropic":
|
|
295
|
+
req = buildAnthropicRequest(leg.model, messages, opts, env);
|
|
296
|
+
break;
|
|
297
|
+
case "gemini":
|
|
298
|
+
req = buildGeminiRequest(leg.model, messages, opts, env);
|
|
299
|
+
break;
|
|
300
|
+
case "groq":
|
|
301
|
+
req = buildGroqRequest(leg.model, messages, opts, env);
|
|
302
|
+
break;
|
|
303
|
+
case "grok":
|
|
304
|
+
req = buildGrokRequest(leg.model, messages, opts, env);
|
|
305
|
+
break;
|
|
306
|
+
}
|
|
307
|
+
const { json, gatewayRequestId, attempts } = await callWithBackoff(
|
|
308
|
+
leg.provider,
|
|
309
|
+
req,
|
|
310
|
+
fetchImpl,
|
|
311
|
+
opts.signal,
|
|
312
|
+
logger,
|
|
313
|
+
nowFn
|
|
314
|
+
);
|
|
315
|
+
switch (leg.provider) {
|
|
316
|
+
case "anthropic":
|
|
317
|
+
return { parsed: parseAnthropic(json), gatewayRequestId, attempts };
|
|
318
|
+
case "gemini":
|
|
319
|
+
return { parsed: parseGemini(json), gatewayRequestId, attempts };
|
|
320
|
+
case "groq":
|
|
321
|
+
return { parsed: parseGroq(json), gatewayRequestId, attempts };
|
|
322
|
+
case "grok":
|
|
323
|
+
return { parsed: parseGroq(json), gatewayRequestId, attempts };
|
|
324
|
+
}
|
|
84
325
|
}
|
|
85
326
|
async function complete(messages, env, opts = {}, deps = {}) {
|
|
86
327
|
if (messages.length === 0) {
|
|
87
328
|
throw new ValidationError("messages must not be empty");
|
|
88
329
|
}
|
|
330
|
+
if (!env.AI_GATEWAY_BASE_URL) {
|
|
331
|
+
throw new ValidationError("AI_GATEWAY_BASE_URL is required in 0.3.0");
|
|
332
|
+
}
|
|
89
333
|
const fetchImpl = deps.fetch ?? fetch;
|
|
90
334
|
const now = deps.now ?? (() => Date.now());
|
|
91
335
|
const logger = deps.logger;
|
|
92
336
|
const startedAt = now();
|
|
93
|
-
const
|
|
94
|
-
|
|
95
|
-
|
|
96
|
-
|
|
97
|
-
|
|
98
|
-
|
|
99
|
-
|
|
100
|
-
|
|
101
|
-
|
|
102
|
-
|
|
337
|
+
const tier = opts.tier ?? "balanced";
|
|
338
|
+
const system = opts.system ?? messages.find((m) => m.role === "system")?.content;
|
|
339
|
+
const tokenEstimate = estimateTokens(messages, system);
|
|
340
|
+
const route = plan(tier, opts, tokenEstimate);
|
|
341
|
+
const attemptLog = [];
|
|
342
|
+
for (const leg of [route.primary, route.fallback].filter(Boolean)) {
|
|
343
|
+
if (isProviderCoolingDown(leg.provider, now)) {
|
|
344
|
+
logger?.warn?.("llm.provider.coolingDown", { provider: leg.provider });
|
|
345
|
+
attemptLog.push({ provider: leg.provider, message: "skipped: cooling down" });
|
|
346
|
+
continue;
|
|
347
|
+
}
|
|
348
|
+
try {
|
|
349
|
+
const result = await callOne(leg, messages, opts, env, fetchImpl, logger, now);
|
|
350
|
+
if (!result.parsed.content) {
|
|
351
|
+
throw { provider: leg.provider, status: 200, retryable: false, message: "empty content" };
|
|
352
|
+
}
|
|
353
|
+
logger?.info?.("llm.complete", {
|
|
354
|
+
provider: leg.provider,
|
|
355
|
+
model: leg.model,
|
|
356
|
+
tier,
|
|
357
|
+
tokenEstimate,
|
|
358
|
+
attempts: result.attempts,
|
|
359
|
+
runId: opts.runId,
|
|
360
|
+
project: opts.project,
|
|
361
|
+
actor: opts.actor
|
|
362
|
+
});
|
|
363
|
+
return {
|
|
364
|
+
data: {
|
|
365
|
+
content: result.parsed.content,
|
|
366
|
+
provider: leg.provider,
|
|
367
|
+
model: result.parsed.model ?? leg.model,
|
|
368
|
+
tier,
|
|
369
|
+
tokens: {
|
|
370
|
+
input: result.parsed.input,
|
|
371
|
+
output: result.parsed.output,
|
|
372
|
+
cacheRead: result.parsed.cacheRead,
|
|
373
|
+
cacheWrite: result.parsed.cacheWrite
|
|
374
|
+
},
|
|
375
|
+
latency: now() - startedAt,
|
|
376
|
+
attempts: result.attempts,
|
|
377
|
+
gatewayRequestId: result.gatewayRequestId
|
|
103
378
|
},
|
|
104
|
-
|
|
105
|
-
}
|
|
106
|
-
|
|
107
|
-
|
|
108
|
-
|
|
109
|
-
|
|
110
|
-
|
|
111
|
-
|
|
112
|
-
|
|
113
|
-
|
|
114
|
-
|
|
115
|
-
|
|
116
|
-
|
|
117
|
-
|
|
118
|
-
|
|
119
|
-
|
|
120
|
-
|
|
121
|
-
|
|
122
|
-
|
|
123
|
-
return providerErrorResponse(attempts, status === 429);
|
|
379
|
+
error: null
|
|
380
|
+
};
|
|
381
|
+
} catch (e) {
|
|
382
|
+
if (e instanceof DOMException && e.name === "AbortError") {
|
|
383
|
+
return toErrorResponse(
|
|
384
|
+
new InternalError("llm call aborted", { provider: leg.provider, model: leg.model })
|
|
385
|
+
);
|
|
386
|
+
}
|
|
387
|
+
if (isProviderError(e)) {
|
|
388
|
+
attemptLog.push({ provider: e.provider, status: e.status, message: e.message });
|
|
389
|
+
if (e.status === 429 && !route.fallback) {
|
|
390
|
+
return toErrorResponse(
|
|
391
|
+
new RateLimitError(`llm rate limited on ${e.provider}`, { attempts: attemptLog })
|
|
392
|
+
);
|
|
393
|
+
}
|
|
394
|
+
logger?.warn?.("llm.leg.failed", { provider: leg.provider, status: e.status });
|
|
395
|
+
continue;
|
|
396
|
+
}
|
|
397
|
+
attemptLog.push({ provider: leg.provider, message: e instanceof Error ? e.message : String(e) });
|
|
124
398
|
}
|
|
125
|
-
logger?.warn("llm.failover", { from: "anthropic", to: "grok", status, message });
|
|
126
399
|
}
|
|
400
|
+
return toErrorResponse(
|
|
401
|
+
new InternalError("LLM_ALL_PROVIDERS_FAILED", { attempts: attemptLog, tier, tokenEstimate })
|
|
402
|
+
);
|
|
403
|
+
}
|
|
404
|
+
async function* completionStream(messages, env, opts = {}) {
|
|
405
|
+
if (messages.length === 0) {
|
|
406
|
+
throw new ValidationError("messages must not be empty");
|
|
407
|
+
}
|
|
408
|
+
if (!env.AI_GATEWAY_BASE_URL) {
|
|
409
|
+
throw new ValidationError("AI_GATEWAY_BASE_URL is required in 0.3.0");
|
|
410
|
+
}
|
|
411
|
+
const deps = opts.deps ?? {};
|
|
412
|
+
const fetchImpl = deps.fetch ?? fetch;
|
|
413
|
+
const now = deps.now ?? (() => Date.now());
|
|
414
|
+
const logger = deps.logger;
|
|
415
|
+
const startedAt = now();
|
|
416
|
+
const tier = opts.tier ?? "balanced";
|
|
417
|
+
const system = opts.system ?? messages.find((m) => m.role === "system")?.content;
|
|
418
|
+
const tokenEstimate = estimateTokens(messages, system);
|
|
419
|
+
const route = plan(tier, opts, tokenEstimate);
|
|
420
|
+
if (route.primary.provider !== "anthropic") {
|
|
421
|
+
const result = await complete(messages, env, opts, deps);
|
|
422
|
+
if (result.error !== null || result.data === null) {
|
|
423
|
+
throw new InternalError("LLM_ALL_PROVIDERS_FAILED", { error: result.error });
|
|
424
|
+
}
|
|
425
|
+
yield result.data.content;
|
|
426
|
+
return result.data;
|
|
427
|
+
}
|
|
428
|
+
if (isProviderCoolingDown(route.primary.provider, now)) {
|
|
429
|
+
logger?.warn?.("llm.provider.coolingDown", { provider: route.primary.provider });
|
|
430
|
+
const result = await complete(messages, env, opts, deps);
|
|
431
|
+
if (result.error !== null || result.data === null) {
|
|
432
|
+
throw new InternalError("LLM_ALL_PROVIDERS_FAILED", { error: result.error });
|
|
433
|
+
}
|
|
434
|
+
yield result.data.content;
|
|
435
|
+
return result.data;
|
|
436
|
+
}
|
|
437
|
+
const req = buildAnthropicRequest(route.primary.model, messages, opts, env, true);
|
|
438
|
+
let response;
|
|
127
439
|
try {
|
|
128
|
-
|
|
129
|
-
"
|
|
130
|
-
|
|
131
|
-
|
|
132
|
-
|
|
133
|
-
|
|
134
|
-
|
|
135
|
-
|
|
136
|
-
|
|
137
|
-
|
|
138
|
-
|
|
139
|
-
|
|
140
|
-
|
|
141
|
-
|
|
142
|
-
|
|
143
|
-
|
|
144
|
-
|
|
145
|
-
|
|
146
|
-
latency: now() - startedAt
|
|
147
|
-
},
|
|
148
|
-
error: null
|
|
149
|
-
};
|
|
150
|
-
} catch (err) {
|
|
151
|
-
const status = isProviderError(err) ? err.status : 0;
|
|
152
|
-
const message = isProviderError(err) ? err.message : err.message;
|
|
153
|
-
attempts.push({ provider: "grok", status, message });
|
|
154
|
-
logger?.warn("llm.failover", { from: "grok", to: "groq", status, message });
|
|
440
|
+
response = await fetchImpl(req.url, {
|
|
441
|
+
method: "POST",
|
|
442
|
+
headers: req.headers,
|
|
443
|
+
body: req.body,
|
|
444
|
+
// Fall back to a 60 s default when the caller provides no signal — prevents
|
|
445
|
+
// a hung provider connection from consuming the Worker's wall-clock budget.
|
|
446
|
+
signal: opts.signal ?? AbortSignal.timeout(6e4)
|
|
447
|
+
});
|
|
448
|
+
} catch (e) {
|
|
449
|
+
if (e instanceof DOMException && e.name === "AbortError") {
|
|
450
|
+
throw new InternalError("llm call aborted", {
|
|
451
|
+
provider: route.primary.provider,
|
|
452
|
+
model: route.primary.model
|
|
453
|
+
});
|
|
454
|
+
}
|
|
455
|
+
throw new InternalError("llm stream fetch failed", {
|
|
456
|
+
message: e instanceof Error ? e.message : String(e)
|
|
457
|
+
});
|
|
155
458
|
}
|
|
459
|
+
if (!response.ok) {
|
|
460
|
+
const text = await response.text().catch(() => "");
|
|
461
|
+
const retryable = isRetryableForBackoff(response.status);
|
|
462
|
+
if (retryable && response.status === 429) {
|
|
463
|
+
markProviderCoolingDown(route.primary.provider, now);
|
|
464
|
+
}
|
|
465
|
+
const result = await complete(messages, env, opts, deps);
|
|
466
|
+
if (result.error !== null || result.data === null) {
|
|
467
|
+
throw new InternalError("LLM_ALL_PROVIDERS_FAILED", {
|
|
468
|
+
streamError: `${route.primary.provider} ${String(response.status)}: ${text.slice(0, 300)}`,
|
|
469
|
+
error: result.error
|
|
470
|
+
});
|
|
471
|
+
}
|
|
472
|
+
yield result.data.content;
|
|
473
|
+
return result.data;
|
|
474
|
+
}
|
|
475
|
+
if (!response.body) {
|
|
476
|
+
throw new InternalError("llm stream response body is null", {
|
|
477
|
+
provider: route.primary.provider
|
|
478
|
+
});
|
|
479
|
+
}
|
|
480
|
+
const decoder = new TextDecoder();
|
|
481
|
+
let accumulatedText = "";
|
|
482
|
+
let inputTokens = 0;
|
|
483
|
+
let outputTokens = 0;
|
|
484
|
+
let cacheRead = 0;
|
|
485
|
+
let cacheWrite = 0;
|
|
486
|
+
let modelName;
|
|
487
|
+
const gatewayRequestId = response.headers.get("cf-aig-request-id") ?? void 0;
|
|
488
|
+
const reader = response.body.getReader();
|
|
489
|
+
let buffer = "";
|
|
156
490
|
try {
|
|
157
|
-
|
|
158
|
-
|
|
159
|
-
|
|
160
|
-
|
|
161
|
-
|
|
162
|
-
|
|
163
|
-
|
|
164
|
-
|
|
165
|
-
|
|
166
|
-
|
|
167
|
-
|
|
168
|
-
|
|
169
|
-
|
|
170
|
-
|
|
171
|
-
|
|
172
|
-
|
|
173
|
-
|
|
174
|
-
|
|
175
|
-
|
|
176
|
-
|
|
177
|
-
|
|
178
|
-
|
|
179
|
-
|
|
180
|
-
|
|
181
|
-
|
|
182
|
-
|
|
183
|
-
|
|
184
|
-
|
|
185
|
-
|
|
186
|
-
|
|
187
|
-
|
|
188
|
-
|
|
189
|
-
|
|
190
|
-
|
|
491
|
+
while (true) {
|
|
492
|
+
const { done, value } = await reader.read();
|
|
493
|
+
if (done) break;
|
|
494
|
+
buffer += decoder.decode(value, { stream: true });
|
|
495
|
+
const lines = buffer.split("\n");
|
|
496
|
+
buffer = lines.pop() ?? "";
|
|
497
|
+
for (const line of lines) {
|
|
498
|
+
if (!line.startsWith("data: ")) continue;
|
|
499
|
+
const data = line.slice(6).trim();
|
|
500
|
+
if (data === "[DONE]") break;
|
|
501
|
+
let event;
|
|
502
|
+
try {
|
|
503
|
+
event = JSON.parse(data);
|
|
504
|
+
} catch {
|
|
505
|
+
continue;
|
|
506
|
+
}
|
|
507
|
+
switch (event.type) {
|
|
508
|
+
case "message_start":
|
|
509
|
+
inputTokens = event.message?.usage?.input_tokens ?? 0;
|
|
510
|
+
cacheRead = event.message?.usage?.cache_read_input_tokens ?? 0;
|
|
511
|
+
cacheWrite = event.message?.usage?.cache_creation_input_tokens ?? 0;
|
|
512
|
+
modelName = event.message?.model;
|
|
513
|
+
break;
|
|
514
|
+
case "content_block_delta":
|
|
515
|
+
if (event.delta?.type === "text_delta" && typeof event.delta.text === "string") {
|
|
516
|
+
accumulatedText += event.delta.text;
|
|
517
|
+
yield event.delta.text;
|
|
518
|
+
}
|
|
519
|
+
break;
|
|
520
|
+
case "message_delta":
|
|
521
|
+
outputTokens = event.usage?.output_tokens ?? outputTokens;
|
|
522
|
+
break;
|
|
523
|
+
default:
|
|
524
|
+
break;
|
|
525
|
+
}
|
|
526
|
+
}
|
|
527
|
+
}
|
|
528
|
+
} finally {
|
|
529
|
+
reader.releaseLock();
|
|
530
|
+
}
|
|
531
|
+
clearProviderCooldown(route.primary.provider);
|
|
532
|
+
logger?.info?.("llm.completionStream", {
|
|
533
|
+
provider: route.primary.provider,
|
|
534
|
+
model: route.primary.model,
|
|
535
|
+
tier,
|
|
536
|
+
tokenEstimate,
|
|
537
|
+
runId: opts.runId,
|
|
538
|
+
project: opts.project,
|
|
539
|
+
actor: opts.actor
|
|
191
540
|
});
|
|
192
541
|
return {
|
|
193
|
-
|
|
194
|
-
|
|
195
|
-
|
|
196
|
-
|
|
197
|
-
|
|
198
|
-
|
|
199
|
-
|
|
200
|
-
|
|
542
|
+
content: accumulatedText,
|
|
543
|
+
provider: route.primary.provider,
|
|
544
|
+
model: modelName ?? route.primary.model,
|
|
545
|
+
tier,
|
|
546
|
+
tokens: { input: inputTokens, output: outputTokens, cacheRead, cacheWrite },
|
|
547
|
+
latency: now() - startedAt,
|
|
548
|
+
attempts: 1,
|
|
549
|
+
gatewayRequestId
|
|
201
550
|
};
|
|
202
551
|
}
|
|
203
|
-
|
|
204
|
-
if (
|
|
205
|
-
|
|
552
|
+
function assertGrounding(response, sources) {
|
|
553
|
+
if (sources.length === 0) return true;
|
|
554
|
+
const WINDOW = 5;
|
|
555
|
+
const responseTokens = response.split(/\s+/).filter((t) => t.length > 0);
|
|
556
|
+
if (responseTokens.length < WINDOW) return false;
|
|
557
|
+
const sourceNgrams = /* @__PURE__ */ new Set();
|
|
558
|
+
for (const source of sources) {
|
|
559
|
+
const tokens = source.split(/\s+/).filter((t) => t.length > 0);
|
|
560
|
+
for (let i = 0; i <= tokens.length - WINDOW; i++) {
|
|
561
|
+
const ngram = tokens.slice(i, i + WINDOW).join(" ");
|
|
562
|
+
sourceNgrams.add(ngram);
|
|
563
|
+
}
|
|
206
564
|
}
|
|
207
|
-
|
|
208
|
-
|
|
209
|
-
|
|
210
|
-
|
|
211
|
-
method: "POST",
|
|
212
|
-
headers: {
|
|
213
|
-
"content-type": "application/json",
|
|
214
|
-
"x-api-key": env.ANTHROPIC_API_KEY,
|
|
215
|
-
"anthropic-version": "2023-06-01"
|
|
216
|
-
},
|
|
217
|
-
body: JSON.stringify(body)
|
|
218
|
-
});
|
|
219
|
-
if (!response.ok || !response.body) {
|
|
220
|
-
throw new InternalError("Anthropic stream failed", {
|
|
221
|
-
code: ErrorCodes.LLM_ALL_PROVIDERS_FAILED,
|
|
222
|
-
status: response.status
|
|
223
|
-
});
|
|
565
|
+
if (sourceNgrams.size === 0) return false;
|
|
566
|
+
for (let i = 0; i <= responseTokens.length - WINDOW; i++) {
|
|
567
|
+
const ngram = responseTokens.slice(i, i + WINDOW).join(" ");
|
|
568
|
+
if (sourceNgrams.has(ngram)) return true;
|
|
224
569
|
}
|
|
225
|
-
return
|
|
226
|
-
}
|
|
227
|
-
function withSystem(system) {
|
|
228
|
-
return (messages, env, opts = {}, deps = {}) => complete(messages, env, { ...opts, system }, deps);
|
|
570
|
+
return false;
|
|
229
571
|
}
|
|
230
572
|
export {
|
|
573
|
+
BASE_BACKOFF_MS,
|
|
574
|
+
MODELS,
|
|
575
|
+
PROVIDER_COOLDOWN_MS,
|
|
576
|
+
assertGrounding,
|
|
577
|
+
clearProviderCooldown,
|
|
231
578
|
complete,
|
|
232
|
-
|
|
233
|
-
|
|
579
|
+
completionStream,
|
|
580
|
+
isProviderCoolingDown,
|
|
581
|
+
markProviderCoolingDown
|
|
234
582
|
};
|
|
235
583
|
//# sourceMappingURL=index.mjs.map
|