@latimer-woods-tech/llm 0.2.0 → 0.3.1

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
package/dist/index.mjs CHANGED
@@ -1,235 +1,583 @@
1
1
  // src/index.ts
2
2
  import {
3
- ErrorCodes,
4
3
  InternalError,
5
4
  RateLimitError,
6
- ValidationError
5
+ ValidationError,
6
+ toErrorResponse
7
7
  } from "@latimer-woods-tech/errors";
8
+ var MODELS = {
9
+ anthropic: {
10
+ fast: "claude-haiku-4-20250514",
11
+ balanced: "claude-sonnet-4-6",
12
+ smart: "claude-opus-4-7"
13
+ },
14
+ gemini: {
15
+ smart: "gemini-2.5-pro"
16
+ },
17
+ groq: {
18
+ verifier: "llama-3.3-70b-versatile"
19
+ },
20
+ grok: {
21
+ /** Opt-in only via `{ model: 'grok-*' }`. Not in default tier routing. */
22
+ fast: "grok-4-fast",
23
+ mini: "grok-3-mini-latest"
24
+ }
25
+ };
8
26
  var DEFAULT_MAX_TOKENS = 1024;
9
27
  var DEFAULT_TEMPERATURE = 0.7;
10
- var DEFAULT_ANTHROPIC_MODEL = "claude-sonnet-4-20250514";
11
- var DEFAULT_GROK_MODEL = "grok-3-fast";
12
- var DEFAULT_GROQ_MODEL = "llama-3.3-70b-versatile";
13
- function isFailover(status) {
14
- return status === 429 || status >= 500;
28
+ var DEFAULT_LONG_CONTEXT_THRESHOLD = 15e4;
29
+ var BACKOFF_BASE_MS = 500;
30
+ var BACKOFF_CAP_MS = 8e3;
31
+ var BACKOFF_JITTER_MAX_MS = 250;
32
+ var PER_PROVIDER_MAX_ATTEMPTS = 3;
33
+ var providerCooldownUntil = /* @__PURE__ */ new Map();
34
+ var PROVIDER_COOLDOWN_MS = 3e4;
35
+ function isProviderCoolingDown(provider, now = Date.now) {
36
+ const until = providerCooldownUntil.get(provider);
37
+ if (until === void 0) return false;
38
+ return now() < until;
39
+ }
40
+ function markProviderCoolingDown(provider, now = Date.now) {
41
+ providerCooldownUntil.set(provider, now() + PROVIDER_COOLDOWN_MS);
42
+ }
43
+ function clearProviderCooldown(provider) {
44
+ providerCooldownUntil.delete(provider);
45
+ }
46
+ var BASE_BACKOFF_MS = 250;
47
+ function isRetryableForBackoff(status) {
48
+ return status === 429 || status >= 500 && status < 600;
49
+ }
50
+ function estimateTokens(messages, system) {
51
+ let chars = system?.length ?? 0;
52
+ for (const m of messages) chars += m.content.length;
53
+ return Math.ceil(chars / 4);
54
+ }
55
+ function sleep(ms, signal) {
56
+ return new Promise((resolve, reject) => {
57
+ const t = setTimeout(resolve, ms);
58
+ if (signal) {
59
+ const onAbort = () => {
60
+ clearTimeout(t);
61
+ reject(new DOMException("Aborted", "AbortError"));
62
+ };
63
+ if (signal.aborted) onAbort();
64
+ else signal.addEventListener("abort", onAbort, { once: true });
65
+ }
66
+ });
15
67
  }
16
- function buildAnthropicBody(messages, opts, system) {
68
+ function computeBackoffMs(attempt) {
69
+ const jitter = Math.floor(Math.random() * BACKOFF_JITTER_MAX_MS);
70
+ return Math.min(BACKOFF_BASE_MS * Math.pow(2, attempt) + jitter, BACKOFF_CAP_MS);
71
+ }
72
+ function buildAnthropicRequest(model, messages, opts, env, streaming = false) {
73
+ const sys = opts.system ?? messages.find((m) => m.role === "system")?.content;
17
74
  const filtered = messages.filter((m) => m.role !== "system");
18
- const sys = system ?? messages.find((m) => m.role === "system")?.content;
19
75
  const body = {
20
- model: opts.model ?? DEFAULT_ANTHROPIC_MODEL,
76
+ model,
21
77
  max_tokens: opts.maxTokens ?? DEFAULT_MAX_TOKENS,
22
78
  temperature: opts.temperature ?? DEFAULT_TEMPERATURE,
23
79
  messages: filtered.map((m) => ({ role: m.role, content: m.content }))
24
80
  };
81
+ if (streaming) {
82
+ body.stream = true;
83
+ }
25
84
  if (sys) {
26
- body.system = sys;
85
+ const cache = opts.promptCache ?? sys.length >= 4096;
86
+ body.system = cache ? [{ type: "text", text: sys, cache_control: { type: "ephemeral" } }] : sys;
27
87
  }
28
- return JSON.stringify(body);
88
+ return {
89
+ url: `${env.AI_GATEWAY_BASE_URL}/anthropic/v1/messages`,
90
+ headers: {
91
+ "content-type": "application/json",
92
+ "x-api-key": env.ANTHROPIC_API_KEY,
93
+ "anthropic-version": "2023-06-01",
94
+ "anthropic-beta": "prompt-caching-2024-07-31"
95
+ },
96
+ body: JSON.stringify(body)
97
+ };
29
98
  }
30
- function buildOpenAIBody(model, messages, opts, system) {
31
- const sys = system ?? messages.find((m) => m.role === "system")?.content;
32
- const merged = [];
99
+ function buildGeminiRequest(model, messages, opts, env) {
100
+ const sys = opts.system ?? messages.find((m) => m.role === "system")?.content;
101
+ const contents = messages.filter((m) => m.role !== "system").map((m) => ({
102
+ role: m.role === "assistant" ? "model" : "user",
103
+ parts: [{ text: m.content }]
104
+ }));
105
+ const body = {
106
+ contents,
107
+ generationConfig: {
108
+ maxOutputTokens: opts.maxTokens ?? DEFAULT_MAX_TOKENS,
109
+ temperature: opts.temperature ?? DEFAULT_TEMPERATURE
110
+ }
111
+ };
33
112
  if (sys) {
34
- merged.push({ role: "system", content: sys });
113
+ body.systemInstruction = { parts: [{ text: sys }] };
35
114
  }
36
- for (const m of messages) {
37
- if (m.role !== "system") {
38
- merged.push(m);
39
- }
115
+ const path = `v1/projects/${env.VERTEX_PROJECT}/locations/${env.VERTEX_LOCATION}/publishers/google/models/${model}:generateContent`;
116
+ return {
117
+ url: `${env.AI_GATEWAY_BASE_URL}/google-vertex-ai/${path}`,
118
+ headers: {
119
+ "content-type": "application/json",
120
+ authorization: `Bearer ${env.VERTEX_ACCESS_TOKEN}`
121
+ },
122
+ body: JSON.stringify(body)
123
+ };
124
+ }
125
+ function buildGroqRequest(model, messages, opts, env) {
126
+ const sys = opts.system ?? messages.find((m) => m.role === "system")?.content;
127
+ const merged = [];
128
+ if (sys) merged.push({ role: "system", content: sys });
129
+ for (const m of messages) if (m.role !== "system") merged.push(m);
130
+ return {
131
+ url: `${env.AI_GATEWAY_BASE_URL}/groq/openai/v1/chat/completions`,
132
+ headers: {
133
+ "content-type": "application/json",
134
+ authorization: `Bearer ${env.GROQ_API_KEY}`
135
+ },
136
+ body: JSON.stringify({
137
+ model,
138
+ max_tokens: opts.maxTokens ?? DEFAULT_MAX_TOKENS,
139
+ temperature: opts.temperature ?? DEFAULT_TEMPERATURE,
140
+ messages: merged
141
+ })
142
+ };
143
+ }
144
+ function buildGrokRequest(model, messages, opts, env) {
145
+ if (!env.GROK_API_KEY) {
146
+ throw new ValidationError("GROK_API_KEY required for grok-* model override");
40
147
  }
41
- return JSON.stringify({
42
- model,
43
- max_tokens: opts.maxTokens ?? DEFAULT_MAX_TOKENS,
44
- temperature: opts.temperature ?? DEFAULT_TEMPERATURE,
45
- messages: merged
46
- });
148
+ const sys = opts.system ?? messages.find((m) => m.role === "system")?.content;
149
+ const merged = [];
150
+ if (sys) merged.push({ role: "system", content: sys });
151
+ for (const m of messages) if (m.role !== "system") merged.push(m);
152
+ return {
153
+ url: `${env.AI_GATEWAY_BASE_URL}/grok/v1/chat/completions`,
154
+ headers: {
155
+ "content-type": "application/json",
156
+ authorization: `Bearer ${env.GROK_API_KEY}`
157
+ },
158
+ body: JSON.stringify({
159
+ model,
160
+ max_tokens: opts.maxTokens ?? DEFAULT_MAX_TOKENS,
161
+ temperature: opts.temperature ?? DEFAULT_TEMPERATURE,
162
+ messages: merged
163
+ })
164
+ };
47
165
  }
48
166
  function parseAnthropic(json) {
49
167
  const r = json;
50
- const text = r.content?.find((c) => c.type === "text")?.text ?? "";
51
168
  return {
52
- content: text,
169
+ content: r.content?.find((c) => c.type === "text")?.text ?? "",
53
170
  input: r.usage?.input_tokens ?? 0,
54
- output: r.usage?.output_tokens ?? 0
171
+ output: r.usage?.output_tokens ?? 0,
172
+ cacheRead: r.usage?.cache_read_input_tokens ?? 0,
173
+ cacheWrite: r.usage?.cache_creation_input_tokens ?? 0,
174
+ model: r.model
55
175
  };
56
176
  }
57
- function parseOpenAI(json) {
177
+ function parseGemini(json) {
58
178
  const r = json;
59
- const text = r.choices?.[0]?.message?.content ?? "";
179
+ const text = r.candidates?.[0]?.content?.parts?.map((p) => p.text ?? "").join("") ?? "";
60
180
  return {
61
181
  content: text,
182
+ input: r.usageMetadata?.promptTokenCount ?? 0,
183
+ output: r.usageMetadata?.candidatesTokenCount ?? 0
184
+ };
185
+ }
186
+ function parseGroq(json) {
187
+ const r = json;
188
+ return {
189
+ content: r.choices?.[0]?.message?.content ?? "",
62
190
  input: r.usage?.prompt_tokens ?? 0,
63
- output: r.usage?.completion_tokens ?? 0
191
+ output: r.usage?.completion_tokens ?? 0,
192
+ model: r.model
64
193
  };
65
194
  }
66
- async function callProvider(provider, request, fetchImpl) {
67
- const response = await fetchImpl(request.url, {
68
- method: "POST",
69
- headers: request.headers,
70
- body: request.body
71
- });
72
- if (!response.ok) {
73
- const text = await response.text().catch(() => "");
74
- const err = {
75
- status: response.status,
76
- message: `${provider} request failed (${String(response.status)}): ${text.slice(0, 200)}`
77
- };
195
+ async function callWithBackoff(provider, request, fetchImpl, signal, logger, nowFn) {
196
+ function exhaustAndThrow(err) {
197
+ markProviderCoolingDown(provider, nowFn ?? Date.now);
78
198
  throw err;
79
199
  }
80
- return await response.json();
200
+ let lastErr;
201
+ for (let attempt = 1; attempt <= PER_PROVIDER_MAX_ATTEMPTS; attempt++) {
202
+ try {
203
+ const response = await fetchImpl(request.url, {
204
+ method: "POST",
205
+ headers: request.headers,
206
+ body: request.body,
207
+ signal
208
+ });
209
+ if (!response.ok) {
210
+ const text = await response.text().catch(() => "");
211
+ const retryable = isRetryableForBackoff(response.status);
212
+ const err = {
213
+ provider,
214
+ status: response.status,
215
+ retryable,
216
+ message: `${provider} ${String(response.status)}: ${text.slice(0, 300)}`
217
+ };
218
+ logger?.warn?.("llm.provider.error", { provider, status: response.status, attempt });
219
+ if (!err.retryable || attempt === PER_PROVIDER_MAX_ATTEMPTS) {
220
+ if (err.retryable) exhaustAndThrow(err);
221
+ throw err;
222
+ }
223
+ lastErr = err;
224
+ } else {
225
+ const gatewayRequestId = response.headers.get("cf-aig-request-id") ?? void 0;
226
+ clearProviderCooldown(provider);
227
+ return { json: await response.json(), gatewayRequestId, attempts: attempt };
228
+ }
229
+ } catch (e) {
230
+ if (e instanceof DOMException && e.name === "AbortError") throw e;
231
+ if (typeof e === "object" && e !== null && "retryable" in e) {
232
+ const err = e;
233
+ if (!err.retryable || attempt === PER_PROVIDER_MAX_ATTEMPTS) {
234
+ if (err.retryable) exhaustAndThrow(err);
235
+ throw err;
236
+ }
237
+ lastErr = err;
238
+ } else {
239
+ const err = {
240
+ provider,
241
+ status: 0,
242
+ retryable: true,
243
+ message: e instanceof Error ? e.message : String(e)
244
+ };
245
+ if (attempt === PER_PROVIDER_MAX_ATTEMPTS) exhaustAndThrow(err);
246
+ lastErr = err;
247
+ }
248
+ }
249
+ const backoffMs = computeBackoffMs(attempt - 1);
250
+ await sleep(backoffMs, signal);
251
+ }
252
+ markProviderCoolingDown(provider, nowFn ?? Date.now);
253
+ throw lastErr ?? { provider, status: 0, retryable: false, message: "exhausted" };
81
254
  }
82
255
  function isProviderError(err) {
83
- return typeof err === "object" && err !== null && typeof err.status === "number" && typeof err.message === "string";
256
+ return typeof err === "object" && err !== null && typeof err.status === "number" && typeof err.message === "string" && typeof err.provider === "string";
257
+ }
258
+ function plan(tier, opts, tokenEstimate) {
259
+ if (opts.model) {
260
+ const m = opts.model;
261
+ if (m.startsWith("claude")) return { primary: { provider: "anthropic", model: m } };
262
+ if (m.startsWith("gemini")) return { primary: { provider: "gemini", model: m } };
263
+ if (m.startsWith("grok")) return { primary: { provider: "grok", model: m } };
264
+ return { primary: { provider: "groq", model: m } };
265
+ }
266
+ const longContext = tokenEstimate >= (opts.longContextThreshold ?? DEFAULT_LONG_CONTEXT_THRESHOLD);
267
+ switch (tier) {
268
+ case "verifier":
269
+ return { primary: { provider: "groq", model: MODELS.groq.verifier } };
270
+ case "smart":
271
+ return longContext ? {
272
+ primary: { provider: "gemini", model: MODELS.gemini.smart },
273
+ fallback: { provider: "anthropic", model: MODELS.anthropic.smart }
274
+ } : {
275
+ primary: { provider: "anthropic", model: MODELS.anthropic.smart },
276
+ fallback: { provider: "gemini", model: MODELS.gemini.smart }
277
+ };
278
+ case "fast":
279
+ return { primary: { provider: "anthropic", model: MODELS.anthropic.fast } };
280
+ case "balanced":
281
+ default:
282
+ return longContext ? {
283
+ primary: { provider: "gemini", model: MODELS.gemini.smart },
284
+ fallback: { provider: "anthropic", model: MODELS.anthropic.balanced }
285
+ } : {
286
+ primary: { provider: "anthropic", model: MODELS.anthropic.balanced },
287
+ fallback: { provider: "gemini", model: MODELS.gemini.smart }
288
+ };
289
+ }
290
+ }
291
+ async function callOne(leg, messages, opts, env, fetchImpl, logger, nowFn) {
292
+ let req;
293
+ switch (leg.provider) {
294
+ case "anthropic":
295
+ req = buildAnthropicRequest(leg.model, messages, opts, env);
296
+ break;
297
+ case "gemini":
298
+ req = buildGeminiRequest(leg.model, messages, opts, env);
299
+ break;
300
+ case "groq":
301
+ req = buildGroqRequest(leg.model, messages, opts, env);
302
+ break;
303
+ case "grok":
304
+ req = buildGrokRequest(leg.model, messages, opts, env);
305
+ break;
306
+ }
307
+ const { json, gatewayRequestId, attempts } = await callWithBackoff(
308
+ leg.provider,
309
+ req,
310
+ fetchImpl,
311
+ opts.signal,
312
+ logger,
313
+ nowFn
314
+ );
315
+ switch (leg.provider) {
316
+ case "anthropic":
317
+ return { parsed: parseAnthropic(json), gatewayRequestId, attempts };
318
+ case "gemini":
319
+ return { parsed: parseGemini(json), gatewayRequestId, attempts };
320
+ case "groq":
321
+ return { parsed: parseGroq(json), gatewayRequestId, attempts };
322
+ case "grok":
323
+ return { parsed: parseGroq(json), gatewayRequestId, attempts };
324
+ }
84
325
  }
85
326
  async function complete(messages, env, opts = {}, deps = {}) {
86
327
  if (messages.length === 0) {
87
328
  throw new ValidationError("messages must not be empty");
88
329
  }
330
+ if (!env.AI_GATEWAY_BASE_URL) {
331
+ throw new ValidationError("AI_GATEWAY_BASE_URL is required in 0.3.0");
332
+ }
89
333
  const fetchImpl = deps.fetch ?? fetch;
90
334
  const now = deps.now ?? (() => Date.now());
91
335
  const logger = deps.logger;
92
336
  const startedAt = now();
93
- const attempts = [];
94
- try {
95
- const json = await callProvider(
96
- "anthropic",
97
- {
98
- url: "https://api.anthropic.com/v1/messages",
99
- headers: {
100
- "content-type": "application/json",
101
- "x-api-key": env.ANTHROPIC_API_KEY,
102
- "anthropic-version": "2023-06-01"
337
+ const tier = opts.tier ?? "balanced";
338
+ const system = opts.system ?? messages.find((m) => m.role === "system")?.content;
339
+ const tokenEstimate = estimateTokens(messages, system);
340
+ const route = plan(tier, opts, tokenEstimate);
341
+ const attemptLog = [];
342
+ for (const leg of [route.primary, route.fallback].filter(Boolean)) {
343
+ if (isProviderCoolingDown(leg.provider, now)) {
344
+ logger?.warn?.("llm.provider.coolingDown", { provider: leg.provider });
345
+ attemptLog.push({ provider: leg.provider, message: "skipped: cooling down" });
346
+ continue;
347
+ }
348
+ try {
349
+ const result = await callOne(leg, messages, opts, env, fetchImpl, logger, now);
350
+ if (!result.parsed.content) {
351
+ throw { provider: leg.provider, status: 200, retryable: false, message: "empty content" };
352
+ }
353
+ logger?.info?.("llm.complete", {
354
+ provider: leg.provider,
355
+ model: leg.model,
356
+ tier,
357
+ tokenEstimate,
358
+ attempts: result.attempts,
359
+ runId: opts.runId,
360
+ project: opts.project,
361
+ actor: opts.actor
362
+ });
363
+ return {
364
+ data: {
365
+ content: result.parsed.content,
366
+ provider: leg.provider,
367
+ model: result.parsed.model ?? leg.model,
368
+ tier,
369
+ tokens: {
370
+ input: result.parsed.input,
371
+ output: result.parsed.output,
372
+ cacheRead: result.parsed.cacheRead,
373
+ cacheWrite: result.parsed.cacheWrite
374
+ },
375
+ latency: now() - startedAt,
376
+ attempts: result.attempts,
377
+ gatewayRequestId: result.gatewayRequestId
103
378
  },
104
- body: buildAnthropicBody(messages, opts, opts.system)
105
- },
106
- fetchImpl
107
- );
108
- const parsed = parseAnthropic(json);
109
- return {
110
- data: {
111
- content: parsed.content,
112
- provider: "anthropic",
113
- tokens: { input: parsed.input, output: parsed.output },
114
- latency: now() - startedAt
115
- },
116
- error: null
117
- };
118
- } catch (err) {
119
- const status = isProviderError(err) ? err.status : 0;
120
- const message = isProviderError(err) ? err.message : err.message;
121
- attempts.push({ provider: "anthropic", status, message });
122
- if (status !== 0 && !isFailover(status)) {
123
- return providerErrorResponse(attempts, status === 429);
379
+ error: null
380
+ };
381
+ } catch (e) {
382
+ if (e instanceof DOMException && e.name === "AbortError") {
383
+ return toErrorResponse(
384
+ new InternalError("llm call aborted", { provider: leg.provider, model: leg.model })
385
+ );
386
+ }
387
+ if (isProviderError(e)) {
388
+ attemptLog.push({ provider: e.provider, status: e.status, message: e.message });
389
+ if (e.status === 429 && !route.fallback) {
390
+ return toErrorResponse(
391
+ new RateLimitError(`llm rate limited on ${e.provider}`, { attempts: attemptLog })
392
+ );
393
+ }
394
+ logger?.warn?.("llm.leg.failed", { provider: leg.provider, status: e.status });
395
+ continue;
396
+ }
397
+ attemptLog.push({ provider: leg.provider, message: e instanceof Error ? e.message : String(e) });
124
398
  }
125
- logger?.warn("llm.failover", { from: "anthropic", to: "grok", status, message });
126
399
  }
400
+ return toErrorResponse(
401
+ new InternalError("LLM_ALL_PROVIDERS_FAILED", { attempts: attemptLog, tier, tokenEstimate })
402
+ );
403
+ }
404
+ async function* completionStream(messages, env, opts = {}) {
405
+ if (messages.length === 0) {
406
+ throw new ValidationError("messages must not be empty");
407
+ }
408
+ if (!env.AI_GATEWAY_BASE_URL) {
409
+ throw new ValidationError("AI_GATEWAY_BASE_URL is required in 0.3.0");
410
+ }
411
+ const deps = opts.deps ?? {};
412
+ const fetchImpl = deps.fetch ?? fetch;
413
+ const now = deps.now ?? (() => Date.now());
414
+ const logger = deps.logger;
415
+ const startedAt = now();
416
+ const tier = opts.tier ?? "balanced";
417
+ const system = opts.system ?? messages.find((m) => m.role === "system")?.content;
418
+ const tokenEstimate = estimateTokens(messages, system);
419
+ const route = plan(tier, opts, tokenEstimate);
420
+ if (route.primary.provider !== "anthropic") {
421
+ const result = await complete(messages, env, opts, deps);
422
+ if (result.error !== null || result.data === null) {
423
+ throw new InternalError("LLM_ALL_PROVIDERS_FAILED", { error: result.error });
424
+ }
425
+ yield result.data.content;
426
+ return result.data;
427
+ }
428
+ if (isProviderCoolingDown(route.primary.provider, now)) {
429
+ logger?.warn?.("llm.provider.coolingDown", { provider: route.primary.provider });
430
+ const result = await complete(messages, env, opts, deps);
431
+ if (result.error !== null || result.data === null) {
432
+ throw new InternalError("LLM_ALL_PROVIDERS_FAILED", { error: result.error });
433
+ }
434
+ yield result.data.content;
435
+ return result.data;
436
+ }
437
+ const req = buildAnthropicRequest(route.primary.model, messages, opts, env, true);
438
+ let response;
127
439
  try {
128
- const json = await callProvider(
129
- "grok",
130
- {
131
- url: "https://api.x.ai/v1/chat/completions",
132
- headers: {
133
- "content-type": "application/json",
134
- authorization: `Bearer ${env.GROK_API_KEY}`
135
- },
136
- body: buildOpenAIBody(opts.model ?? DEFAULT_GROK_MODEL, messages, opts, opts.system)
137
- },
138
- fetchImpl
139
- );
140
- const parsed = parseOpenAI(json);
141
- return {
142
- data: {
143
- content: parsed.content,
144
- provider: "grok",
145
- tokens: { input: parsed.input, output: parsed.output },
146
- latency: now() - startedAt
147
- },
148
- error: null
149
- };
150
- } catch (err) {
151
- const status = isProviderError(err) ? err.status : 0;
152
- const message = isProviderError(err) ? err.message : err.message;
153
- attempts.push({ provider: "grok", status, message });
154
- logger?.warn("llm.failover", { from: "grok", to: "groq", status, message });
440
+ response = await fetchImpl(req.url, {
441
+ method: "POST",
442
+ headers: req.headers,
443
+ body: req.body,
444
+ // Fall back to a 60 s default when the caller provides no signal — prevents
445
+ // a hung provider connection from consuming the Worker's wall-clock budget.
446
+ signal: opts.signal ?? AbortSignal.timeout(6e4)
447
+ });
448
+ } catch (e) {
449
+ if (e instanceof DOMException && e.name === "AbortError") {
450
+ throw new InternalError("llm call aborted", {
451
+ provider: route.primary.provider,
452
+ model: route.primary.model
453
+ });
454
+ }
455
+ throw new InternalError("llm stream fetch failed", {
456
+ message: e instanceof Error ? e.message : String(e)
457
+ });
155
458
  }
459
+ if (!response.ok) {
460
+ const text = await response.text().catch(() => "");
461
+ const retryable = isRetryableForBackoff(response.status);
462
+ if (retryable && response.status === 429) {
463
+ markProviderCoolingDown(route.primary.provider, now);
464
+ }
465
+ const result = await complete(messages, env, opts, deps);
466
+ if (result.error !== null || result.data === null) {
467
+ throw new InternalError("LLM_ALL_PROVIDERS_FAILED", {
468
+ streamError: `${route.primary.provider} ${String(response.status)}: ${text.slice(0, 300)}`,
469
+ error: result.error
470
+ });
471
+ }
472
+ yield result.data.content;
473
+ return result.data;
474
+ }
475
+ if (!response.body) {
476
+ throw new InternalError("llm stream response body is null", {
477
+ provider: route.primary.provider
478
+ });
479
+ }
480
+ const decoder = new TextDecoder();
481
+ let accumulatedText = "";
482
+ let inputTokens = 0;
483
+ let outputTokens = 0;
484
+ let cacheRead = 0;
485
+ let cacheWrite = 0;
486
+ let modelName;
487
+ const gatewayRequestId = response.headers.get("cf-aig-request-id") ?? void 0;
488
+ const reader = response.body.getReader();
489
+ let buffer = "";
156
490
  try {
157
- const json = await callProvider(
158
- "groq",
159
- {
160
- url: "https://api.groq.com/openai/v1/chat/completions",
161
- headers: {
162
- "content-type": "application/json",
163
- authorization: `Bearer ${env.GROQ_API_KEY}`
164
- },
165
- body: buildOpenAIBody(opts.model ?? DEFAULT_GROQ_MODEL, messages, opts, opts.system)
166
- },
167
- fetchImpl
168
- );
169
- const parsed = parseOpenAI(json);
170
- return {
171
- data: {
172
- content: parsed.content,
173
- provider: "groq",
174
- tokens: { input: parsed.input, output: parsed.output },
175
- latency: now() - startedAt
176
- },
177
- error: null
178
- };
179
- } catch (err) {
180
- const status = isProviderError(err) ? err.status : 0;
181
- const message = isProviderError(err) ? err.message : err.message;
182
- attempts.push({ provider: "groq", status, message });
183
- logger?.error("llm.all_providers_failed", void 0, { attempts });
184
- }
185
- return providerErrorResponse(attempts, false);
186
- }
187
- function providerErrorResponse(attempts, rateLimited) {
188
- const base = rateLimited ? new RateLimitError("LLM provider rate limited", { code: ErrorCodes.LLM_RATE_LIMITED, attempts }) : new InternalError("All LLM providers failed", {
189
- code: ErrorCodes.LLM_ALL_PROVIDERS_FAILED,
190
- attempts
491
+ while (true) {
492
+ const { done, value } = await reader.read();
493
+ if (done) break;
494
+ buffer += decoder.decode(value, { stream: true });
495
+ const lines = buffer.split("\n");
496
+ buffer = lines.pop() ?? "";
497
+ for (const line of lines) {
498
+ if (!line.startsWith("data: ")) continue;
499
+ const data = line.slice(6).trim();
500
+ if (data === "[DONE]") break;
501
+ let event;
502
+ try {
503
+ event = JSON.parse(data);
504
+ } catch {
505
+ continue;
506
+ }
507
+ switch (event.type) {
508
+ case "message_start":
509
+ inputTokens = event.message?.usage?.input_tokens ?? 0;
510
+ cacheRead = event.message?.usage?.cache_read_input_tokens ?? 0;
511
+ cacheWrite = event.message?.usage?.cache_creation_input_tokens ?? 0;
512
+ modelName = event.message?.model;
513
+ break;
514
+ case "content_block_delta":
515
+ if (event.delta?.type === "text_delta" && typeof event.delta.text === "string") {
516
+ accumulatedText += event.delta.text;
517
+ yield event.delta.text;
518
+ }
519
+ break;
520
+ case "message_delta":
521
+ outputTokens = event.usage?.output_tokens ?? outputTokens;
522
+ break;
523
+ default:
524
+ break;
525
+ }
526
+ }
527
+ }
528
+ } finally {
529
+ reader.releaseLock();
530
+ }
531
+ clearProviderCooldown(route.primary.provider);
532
+ logger?.info?.("llm.completionStream", {
533
+ provider: route.primary.provider,
534
+ model: route.primary.model,
535
+ tier,
536
+ tokenEstimate,
537
+ runId: opts.runId,
538
+ project: opts.project,
539
+ actor: opts.actor
191
540
  });
192
541
  return {
193
- data: null,
194
- error: {
195
- code: rateLimited ? ErrorCodes.LLM_RATE_LIMITED : ErrorCodes.LLM_ALL_PROVIDERS_FAILED,
196
- message: base.message,
197
- status: base.status,
198
- retryable: base.retryable,
199
- context: base.context
200
- }
542
+ content: accumulatedText,
543
+ provider: route.primary.provider,
544
+ model: modelName ?? route.primary.model,
545
+ tier,
546
+ tokens: { input: inputTokens, output: outputTokens, cacheRead, cacheWrite },
547
+ latency: now() - startedAt,
548
+ attempts: 1,
549
+ gatewayRequestId
201
550
  };
202
551
  }
203
- async function stream(messages, env, opts = {}, deps = {}) {
204
- if (messages.length === 0) {
205
- throw new ValidationError("messages must not be empty");
552
+ function assertGrounding(response, sources) {
553
+ if (sources.length === 0) return true;
554
+ const WINDOW = 5;
555
+ const responseTokens = response.split(/\s+/).filter((t) => t.length > 0);
556
+ if (responseTokens.length < WINDOW) return false;
557
+ const sourceNgrams = /* @__PURE__ */ new Set();
558
+ for (const source of sources) {
559
+ const tokens = source.split(/\s+/).filter((t) => t.length > 0);
560
+ for (let i = 0; i <= tokens.length - WINDOW; i++) {
561
+ const ngram = tokens.slice(i, i + WINDOW).join(" ");
562
+ sourceNgrams.add(ngram);
563
+ }
206
564
  }
207
- const fetchImpl = deps.fetch ?? fetch;
208
- const body = JSON.parse(buildAnthropicBody(messages, opts, opts.system));
209
- body.stream = true;
210
- const response = await fetchImpl("https://api.anthropic.com/v1/messages", {
211
- method: "POST",
212
- headers: {
213
- "content-type": "application/json",
214
- "x-api-key": env.ANTHROPIC_API_KEY,
215
- "anthropic-version": "2023-06-01"
216
- },
217
- body: JSON.stringify(body)
218
- });
219
- if (!response.ok || !response.body) {
220
- throw new InternalError("Anthropic stream failed", {
221
- code: ErrorCodes.LLM_ALL_PROVIDERS_FAILED,
222
- status: response.status
223
- });
565
+ if (sourceNgrams.size === 0) return false;
566
+ for (let i = 0; i <= responseTokens.length - WINDOW; i++) {
567
+ const ngram = responseTokens.slice(i, i + WINDOW).join(" ");
568
+ if (sourceNgrams.has(ngram)) return true;
224
569
  }
225
- return response.body;
226
- }
227
- function withSystem(system) {
228
- return (messages, env, opts = {}, deps = {}) => complete(messages, env, { ...opts, system }, deps);
570
+ return false;
229
571
  }
230
572
  export {
573
+ BASE_BACKOFF_MS,
574
+ MODELS,
575
+ PROVIDER_COOLDOWN_MS,
576
+ assertGrounding,
577
+ clearProviderCooldown,
231
578
  complete,
232
- stream,
233
- withSystem
579
+ completionStream,
580
+ isProviderCoolingDown,
581
+ markProviderCoolingDown
234
582
  };
235
583
  //# sourceMappingURL=index.mjs.map