@memstack/core 0.2.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/LICENSE +21 -0
- package/README.md +774 -0
- package/dist/index.cjs +1991 -0
- package/dist/index.cjs.map +1 -0
- package/dist/index.d.cts +536 -0
- package/dist/index.d.ts +536 -0
- package/dist/index.js +1974 -0
- package/dist/index.js.map +1 -0
- package/package.json +63 -0
- package/src/adapters/embedding/cohere.ts +77 -0
- package/src/adapters/embedding/openai.ts +65 -0
- package/src/adapters/llm/anthropic.ts +69 -0
- package/src/adapters/llm/groq.ts +185 -0
- package/src/adapters/llm/ollama.ts +85 -0
- package/src/adapters/llm/openai.ts +178 -0
- package/src/adapters/storage/disk.ts +334 -0
- package/src/adapters/storage/memory.ts +147 -0
- package/src/adapters/storage/postgres.ts +310 -0
- package/src/adapters/storage/redis.ts +274 -0
- package/src/client.ts +236 -0
- package/src/errors.ts +47 -0
- package/src/index.ts +52 -0
- package/src/interfaces.ts +154 -0
- package/src/memory/ContextCompiler.ts +158 -0
- package/src/memory/MemoryStore.ts +266 -0
- package/src/memory/Pruner.ts +66 -0
- package/src/memory/Summarizer.ts +46 -0
- package/src/types.ts +50 -0
|
@@ -0,0 +1,69 @@
|
|
|
1
|
+
import type { LLMProvider } from "../../interfaces.js";
|
|
2
|
+
import { MemStackError } from "../../errors.js";
|
|
3
|
+
|
|
4
|
+
export interface AnthropicLLMConfig {
|
|
5
|
+
apiKey: string;
|
|
6
|
+
baseURL?: string;
|
|
7
|
+
defaultModel?: string;
|
|
8
|
+
defaultMaxTokens?: number;
|
|
9
|
+
}
|
|
10
|
+
|
|
11
|
+
export class AnthropicLLMAdapter implements LLMProvider {
|
|
12
|
+
private apiKey: string;
|
|
13
|
+
private baseURL: string;
|
|
14
|
+
private defaultModel: string;
|
|
15
|
+
private defaultMaxTokens: number;
|
|
16
|
+
// eslint-disable-next-line @typescript-eslint/no-explicit-any
|
|
17
|
+
private sdk: any;
|
|
18
|
+
|
|
19
|
+
constructor(config: AnthropicLLMConfig) {
|
|
20
|
+
this.apiKey = config.apiKey;
|
|
21
|
+
this.baseURL = config.baseURL ?? "https://api.anthropic.com";
|
|
22
|
+
this.defaultModel = config.defaultModel ?? "claude-sonnet-4-5-20250929";
|
|
23
|
+
this.defaultMaxTokens = config.defaultMaxTokens ?? 1024;
|
|
24
|
+
}
|
|
25
|
+
|
|
26
|
+
async complete(request: {
|
|
27
|
+
system: string;
|
|
28
|
+
user: string;
|
|
29
|
+
model?: string;
|
|
30
|
+
temperature?: number;
|
|
31
|
+
maxTokens?: number;
|
|
32
|
+
}): Promise<{ text: string; tokens: { prompt: number; completion: number; total: number } }> {
|
|
33
|
+
const model = request.model ?? this.defaultModel;
|
|
34
|
+
const maxTokens = request.maxTokens ?? this.defaultMaxTokens;
|
|
35
|
+
|
|
36
|
+
try {
|
|
37
|
+
if (!this.sdk) {
|
|
38
|
+
const { default: Anthropic } = await import("@anthropic-ai/sdk");
|
|
39
|
+
this.sdk = new Anthropic({ apiKey: this.apiKey, baseURL: this.baseURL });
|
|
40
|
+
}
|
|
41
|
+
|
|
42
|
+
const response = await this.sdk.messages.create({
|
|
43
|
+
model,
|
|
44
|
+
system: request.system,
|
|
45
|
+
messages: [{ role: "user", content: request.user }],
|
|
46
|
+
max_tokens: maxTokens,
|
|
47
|
+
...(request.temperature !== undefined ? { temperature: request.temperature } : {}),
|
|
48
|
+
});
|
|
49
|
+
|
|
50
|
+
const text = response.content.length > 0 && "text" in response.content[0]
|
|
51
|
+
? (response.content[0] as { text: string }).text
|
|
52
|
+
: "";
|
|
53
|
+
|
|
54
|
+
return {
|
|
55
|
+
text,
|
|
56
|
+
tokens: {
|
|
57
|
+
prompt: response.usage?.input_tokens ?? 0,
|
|
58
|
+
completion: response.usage?.output_tokens ?? 0,
|
|
59
|
+
total: (response.usage?.input_tokens ?? 0) + (response.usage?.output_tokens ?? 0),
|
|
60
|
+
},
|
|
61
|
+
};
|
|
62
|
+
} catch (err) {
|
|
63
|
+
if (err instanceof MemStackError) throw err;
|
|
64
|
+
throw new MemStackError("LLM_ERROR", `Anthropic request failed: ${err instanceof Error ? err.message : String(err)}`, {
|
|
65
|
+
retryable: true,
|
|
66
|
+
});
|
|
67
|
+
}
|
|
68
|
+
}
|
|
69
|
+
}
|
|
@@ -0,0 +1,185 @@
|
|
|
1
|
+
import type { LLMProvider } from "../../interfaces.js";
|
|
2
|
+
import { MemStackError } from "../../errors.js";
|
|
3
|
+
|
|
4
|
+
export interface GroqLLMConfig {
|
|
5
|
+
/** Groq API key */
|
|
6
|
+
apiKey: string;
|
|
7
|
+
/** Base URL. Default: "https://api.groq.com/openai/v1" */
|
|
8
|
+
baseURL?: string;
|
|
9
|
+
/** Default model. Default: "llama-3.3-70b-versatile" */
|
|
10
|
+
defaultModel?: string;
|
|
11
|
+
/** Default temperature. Default: 0.7 */
|
|
12
|
+
defaultTemperature?: number;
|
|
13
|
+
/** Default max tokens. Default: 1024 */
|
|
14
|
+
defaultMaxTokens?: number;
|
|
15
|
+
}
|
|
16
|
+
|
|
17
|
+
export class GroqLLMAdapter implements LLMProvider {
|
|
18
|
+
private apiKey: string;
|
|
19
|
+
private baseURL: string;
|
|
20
|
+
private defaultModel: string;
|
|
21
|
+
private defaultTemperature: number;
|
|
22
|
+
private defaultMaxTokens: number;
|
|
23
|
+
|
|
24
|
+
constructor(config: GroqLLMConfig) {
|
|
25
|
+
this.apiKey = config.apiKey;
|
|
26
|
+
this.baseURL = config.baseURL ?? "https://api.groq.com/openai/v1";
|
|
27
|
+
this.defaultModel = config.defaultModel ?? "llama-3.3-70b-versatile";
|
|
28
|
+
this.defaultTemperature = config.defaultTemperature ?? 0.7;
|
|
29
|
+
this.defaultMaxTokens = config.defaultMaxTokens ?? 1024;
|
|
30
|
+
}
|
|
31
|
+
|
|
32
|
+
async complete(request: {
|
|
33
|
+
system: string;
|
|
34
|
+
user: string;
|
|
35
|
+
model?: string;
|
|
36
|
+
temperature?: number;
|
|
37
|
+
maxTokens?: number;
|
|
38
|
+
}): Promise<{ text: string; tokens: { prompt: number; completion: number; total: number } }> {
|
|
39
|
+
const model = request.model ?? this.defaultModel;
|
|
40
|
+
const temperature = request.temperature ?? this.defaultTemperature;
|
|
41
|
+
const maxTokens = request.maxTokens ?? this.defaultMaxTokens;
|
|
42
|
+
|
|
43
|
+
try {
|
|
44
|
+
const response = await fetch(`${this.baseURL}/chat/completions`, {
|
|
45
|
+
method: "POST",
|
|
46
|
+
headers: {
|
|
47
|
+
"Content-Type": "application/json",
|
|
48
|
+
Authorization: `Bearer ${this.apiKey}`,
|
|
49
|
+
},
|
|
50
|
+
body: JSON.stringify({
|
|
51
|
+
model,
|
|
52
|
+
messages: [
|
|
53
|
+
{ role: "system", content: request.system },
|
|
54
|
+
{ role: "user", content: request.user },
|
|
55
|
+
],
|
|
56
|
+
temperature,
|
|
57
|
+
max_tokens: maxTokens,
|
|
58
|
+
}),
|
|
59
|
+
});
|
|
60
|
+
|
|
61
|
+
if (!response.ok) {
|
|
62
|
+
const err = await response.text();
|
|
63
|
+
throw new MemStackError("LLM_ERROR", `Groq API error: ${response.status} ${err}`, {
|
|
64
|
+
retryable: response.status >= 500,
|
|
65
|
+
});
|
|
66
|
+
}
|
|
67
|
+
|
|
68
|
+
const data = (await response.json()) as {
|
|
69
|
+
choices: { message: { content: string } }[];
|
|
70
|
+
usage?: { prompt_tokens: number; completion_tokens: number; total_tokens: number };
|
|
71
|
+
};
|
|
72
|
+
|
|
73
|
+
return {
|
|
74
|
+
text: data.choices[0]?.message?.content ?? "",
|
|
75
|
+
tokens: {
|
|
76
|
+
prompt: data.usage?.prompt_tokens ?? 0,
|
|
77
|
+
completion: data.usage?.completion_tokens ?? 0,
|
|
78
|
+
total: data.usage?.total_tokens ?? 0,
|
|
79
|
+
},
|
|
80
|
+
};
|
|
81
|
+
} catch (err) {
|
|
82
|
+
if (err instanceof MemStackError) throw err;
|
|
83
|
+
throw new MemStackError("LLM_ERROR", `Groq request failed: ${err instanceof Error ? err.message : String(err)}`, {
|
|
84
|
+
retryable: true,
|
|
85
|
+
});
|
|
86
|
+
}
|
|
87
|
+
}
|
|
88
|
+
|
|
89
|
+
async *completeStream(request: {
|
|
90
|
+
system: string;
|
|
91
|
+
user: string;
|
|
92
|
+
model?: string;
|
|
93
|
+
temperature?: number;
|
|
94
|
+
maxTokens?: number;
|
|
95
|
+
}): AsyncIterable<{ text: string; tokens: { prompt: number; completion: number; total: number } }> {
|
|
96
|
+
const model = request.model ?? this.defaultModel;
|
|
97
|
+
const temperature = request.temperature ?? this.defaultTemperature;
|
|
98
|
+
const maxTokens = request.maxTokens ?? this.defaultMaxTokens;
|
|
99
|
+
|
|
100
|
+
let response: Response;
|
|
101
|
+
try {
|
|
102
|
+
response = await fetch(`${this.baseURL}/chat/completions`, {
|
|
103
|
+
method: "POST",
|
|
104
|
+
headers: {
|
|
105
|
+
"Content-Type": "application/json",
|
|
106
|
+
Authorization: `Bearer ${this.apiKey}`,
|
|
107
|
+
},
|
|
108
|
+
body: JSON.stringify({
|
|
109
|
+
model,
|
|
110
|
+
messages: [
|
|
111
|
+
{ role: "system", content: request.system },
|
|
112
|
+
{ role: "user", content: request.user },
|
|
113
|
+
],
|
|
114
|
+
temperature,
|
|
115
|
+
max_tokens: maxTokens,
|
|
116
|
+
stream: true,
|
|
117
|
+
stream_options: { include_usage: true },
|
|
118
|
+
}),
|
|
119
|
+
});
|
|
120
|
+
} catch (err) {
|
|
121
|
+
throw new MemStackError("LLM_ERROR", `Groq streaming request failed: ${err instanceof Error ? err.message : String(err)}`, {
|
|
122
|
+
retryable: true,
|
|
123
|
+
});
|
|
124
|
+
}
|
|
125
|
+
|
|
126
|
+
if (!response.ok) {
|
|
127
|
+
const err = await response.text();
|
|
128
|
+
throw new MemStackError("LLM_ERROR", `Groq streaming error: ${response.status} ${err}`, {
|
|
129
|
+
retryable: response.status >= 500,
|
|
130
|
+
});
|
|
131
|
+
}
|
|
132
|
+
|
|
133
|
+
const reader = response.body?.getReader();
|
|
134
|
+
if (!reader) throw new MemStackError("LLM_ERROR", "No response body for streaming");
|
|
135
|
+
|
|
136
|
+
const decoder = new TextDecoder();
|
|
137
|
+
let buffer = "";
|
|
138
|
+
let promptTokens = 0;
|
|
139
|
+
let completionTokens = 0;
|
|
140
|
+
|
|
141
|
+
try {
|
|
142
|
+
while (true) {
|
|
143
|
+
const { done, value } = await reader.read();
|
|
144
|
+
if (done) break;
|
|
145
|
+
|
|
146
|
+
buffer += decoder.decode(value, { stream: true });
|
|
147
|
+
const lines = buffer.split("\n");
|
|
148
|
+
buffer = lines.pop() ?? "";
|
|
149
|
+
|
|
150
|
+
for (const line of lines) {
|
|
151
|
+
const trimmed = line.trim();
|
|
152
|
+
if (!trimmed || !trimmed.startsWith("data: ")) continue;
|
|
153
|
+
const data = trimmed.slice(6);
|
|
154
|
+
if (data === "[DONE]") continue;
|
|
155
|
+
|
|
156
|
+
try {
|
|
157
|
+
const parsed = JSON.parse(data) as {
|
|
158
|
+
choices?: { delta?: { content?: string } }[];
|
|
159
|
+
usage?: { prompt_tokens: number; completion_tokens: number; total_tokens: number };
|
|
160
|
+
x_groq?: { usage?: { prompt_tokens: number; completion_tokens: number; total_tokens: number } };
|
|
161
|
+
};
|
|
162
|
+
|
|
163
|
+
const content = parsed.choices?.[0]?.delta?.content ?? "";
|
|
164
|
+
const usage = parsed.usage ?? parsed.x_groq?.usage;
|
|
165
|
+
if (usage) {
|
|
166
|
+
promptTokens = usage.prompt_tokens;
|
|
167
|
+
completionTokens = usage.completion_tokens;
|
|
168
|
+
}
|
|
169
|
+
|
|
170
|
+
if (content) {
|
|
171
|
+
yield {
|
|
172
|
+
text: content,
|
|
173
|
+
tokens: { prompt: promptTokens, completion: completionTokens, total: promptTokens + completionTokens },
|
|
174
|
+
};
|
|
175
|
+
}
|
|
176
|
+
} catch {
|
|
177
|
+
// Skip unparseable chunks
|
|
178
|
+
}
|
|
179
|
+
}
|
|
180
|
+
}
|
|
181
|
+
} finally {
|
|
182
|
+
reader.releaseLock();
|
|
183
|
+
}
|
|
184
|
+
}
|
|
185
|
+
}
|
|
@@ -0,0 +1,85 @@
|
|
|
1
|
+
import type { LLMProvider } from "../../interfaces.js";
|
|
2
|
+
import { MemStackError } from "../../errors.js";
|
|
3
|
+
|
|
4
|
+
export interface OllamaLLMConfig {
|
|
5
|
+
/** Ollama server URL. Default: "http://localhost:11434" */
|
|
6
|
+
baseURL?: string;
|
|
7
|
+
/** Default model name. Default: "llama3.2" */
|
|
8
|
+
defaultModel?: string;
|
|
9
|
+
/** Default temperature. Default: 0.7 */
|
|
10
|
+
defaultTemperature?: number;
|
|
11
|
+
/** Default max tokens. Default: 1024 */
|
|
12
|
+
defaultMaxTokens?: number;
|
|
13
|
+
}
|
|
14
|
+
|
|
15
|
+
export class OllamaLLMAdapter implements LLMProvider {
|
|
16
|
+
private baseURL: string;
|
|
17
|
+
private defaultModel: string;
|
|
18
|
+
private defaultTemperature: number;
|
|
19
|
+
private defaultMaxTokens: number;
|
|
20
|
+
|
|
21
|
+
constructor(config: OllamaLLMConfig = {}) {
|
|
22
|
+
this.baseURL = config.baseURL ?? "http://localhost:11434";
|
|
23
|
+
this.defaultModel = config.defaultModel ?? "llama3.2";
|
|
24
|
+
this.defaultTemperature = config.defaultTemperature ?? 0.7;
|
|
25
|
+
this.defaultMaxTokens = config.defaultMaxTokens ?? 1024;
|
|
26
|
+
}
|
|
27
|
+
|
|
28
|
+
async complete(request: {
|
|
29
|
+
system: string;
|
|
30
|
+
user: string;
|
|
31
|
+
model?: string;
|
|
32
|
+
temperature?: number;
|
|
33
|
+
maxTokens?: number;
|
|
34
|
+
}): Promise<{ text: string; tokens: { prompt: number; completion: number; total: number } }> {
|
|
35
|
+
const model = request.model ?? this.defaultModel;
|
|
36
|
+
const temperature = request.temperature ?? this.defaultTemperature;
|
|
37
|
+
const maxTokens = request.maxTokens ?? this.defaultMaxTokens;
|
|
38
|
+
|
|
39
|
+
try {
|
|
40
|
+
const response = await fetch(`${this.baseURL}/api/chat`, {
|
|
41
|
+
method: "POST",
|
|
42
|
+
headers: { "Content-Type": "application/json" },
|
|
43
|
+
body: JSON.stringify({
|
|
44
|
+
model,
|
|
45
|
+
messages: [
|
|
46
|
+
{ role: "system", content: request.system },
|
|
47
|
+
{ role: "user", content: request.user },
|
|
48
|
+
],
|
|
49
|
+
options: { temperature, num_predict: maxTokens },
|
|
50
|
+
stream: false,
|
|
51
|
+
}),
|
|
52
|
+
});
|
|
53
|
+
|
|
54
|
+
if (!response.ok) {
|
|
55
|
+
const err = await response.text();
|
|
56
|
+
throw new MemStackError("LLM_ERROR", `Ollama API error: ${response.status} ${err}`, {
|
|
57
|
+
retryable: response.status >= 500,
|
|
58
|
+
});
|
|
59
|
+
}
|
|
60
|
+
|
|
61
|
+
const data = (await response.json()) as {
|
|
62
|
+
message?: { content: string };
|
|
63
|
+
prompt_eval_count?: number;
|
|
64
|
+
eval_count?: number;
|
|
65
|
+
};
|
|
66
|
+
|
|
67
|
+
const promptTokens = data.prompt_eval_count ?? 0;
|
|
68
|
+
const completionTokens = data.eval_count ?? 0;
|
|
69
|
+
|
|
70
|
+
return {
|
|
71
|
+
text: data.message?.content ?? "",
|
|
72
|
+
tokens: {
|
|
73
|
+
prompt: promptTokens,
|
|
74
|
+
completion: completionTokens,
|
|
75
|
+
total: promptTokens + completionTokens,
|
|
76
|
+
},
|
|
77
|
+
};
|
|
78
|
+
} catch (err) {
|
|
79
|
+
if (err instanceof MemStackError) throw err;
|
|
80
|
+
throw new MemStackError("LLM_ERROR", `Ollama request failed: ${err instanceof Error ? err.message : String(err)}`, {
|
|
81
|
+
retryable: true,
|
|
82
|
+
});
|
|
83
|
+
}
|
|
84
|
+
}
|
|
85
|
+
}
|
|
@@ -0,0 +1,178 @@
|
|
|
1
|
+
import type { LLMProvider } from "../../interfaces.js";
|
|
2
|
+
import { MemStackError } from "../../errors.js";
|
|
3
|
+
|
|
4
|
+
export interface OpenAILLMConfig {
|
|
5
|
+
apiKey: string;
|
|
6
|
+
baseURL?: string;
|
|
7
|
+
defaultModel?: string;
|
|
8
|
+
defaultTemperature?: number;
|
|
9
|
+
defaultMaxTokens?: number;
|
|
10
|
+
}
|
|
11
|
+
|
|
12
|
+
export class OpenAILLMAdapter implements LLMProvider {
|
|
13
|
+
private apiKey: string;
|
|
14
|
+
private baseURL: string;
|
|
15
|
+
private defaultModel: string;
|
|
16
|
+
private defaultTemperature: number;
|
|
17
|
+
private defaultMaxTokens: number;
|
|
18
|
+
|
|
19
|
+
constructor(config: OpenAILLMConfig) {
|
|
20
|
+
this.apiKey = config.apiKey;
|
|
21
|
+
this.baseURL = config.baseURL ?? "https://api.openai.com/v1";
|
|
22
|
+
this.defaultModel = config.defaultModel ?? "gpt-4o-mini";
|
|
23
|
+
this.defaultTemperature = config.defaultTemperature ?? 0.7;
|
|
24
|
+
this.defaultMaxTokens = config.defaultMaxTokens ?? 1024;
|
|
25
|
+
}
|
|
26
|
+
|
|
27
|
+
async complete(request: {
|
|
28
|
+
system: string;
|
|
29
|
+
user: string;
|
|
30
|
+
model?: string;
|
|
31
|
+
temperature?: number;
|
|
32
|
+
maxTokens?: number;
|
|
33
|
+
}): Promise<{ text: string; tokens: { prompt: number; completion: number; total: number } }> {
|
|
34
|
+
const model = request.model ?? this.defaultModel;
|
|
35
|
+
const temperature = request.temperature ?? this.defaultTemperature;
|
|
36
|
+
const maxTokens = request.maxTokens ?? this.defaultMaxTokens;
|
|
37
|
+
|
|
38
|
+
try {
|
|
39
|
+
const response = await fetch(`${this.baseURL}/chat/completions`, {
|
|
40
|
+
method: "POST",
|
|
41
|
+
headers: {
|
|
42
|
+
"Content-Type": "application/json",
|
|
43
|
+
Authorization: `Bearer ${this.apiKey}`,
|
|
44
|
+
},
|
|
45
|
+
body: JSON.stringify({
|
|
46
|
+
model,
|
|
47
|
+
messages: [
|
|
48
|
+
{ role: "system", content: request.system },
|
|
49
|
+
{ role: "user", content: request.user },
|
|
50
|
+
],
|
|
51
|
+
temperature,
|
|
52
|
+
max_tokens: maxTokens,
|
|
53
|
+
}),
|
|
54
|
+
});
|
|
55
|
+
|
|
56
|
+
if (!response.ok) {
|
|
57
|
+
const err = await response.text();
|
|
58
|
+
throw new MemStackError("LLM_ERROR", `OpenAI API error: ${response.status} ${err}`, {
|
|
59
|
+
retryable: response.status >= 500,
|
|
60
|
+
});
|
|
61
|
+
}
|
|
62
|
+
|
|
63
|
+
const data = (await response.json()) as {
|
|
64
|
+
choices: { message: { content: string } }[];
|
|
65
|
+
usage?: { prompt_tokens: number; completion_tokens: number; total_tokens: number };
|
|
66
|
+
};
|
|
67
|
+
|
|
68
|
+
return {
|
|
69
|
+
text: data.choices[0]?.message?.content ?? "",
|
|
70
|
+
tokens: {
|
|
71
|
+
prompt: data.usage?.prompt_tokens ?? 0,
|
|
72
|
+
completion: data.usage?.completion_tokens ?? 0,
|
|
73
|
+
total: data.usage?.total_tokens ?? 0,
|
|
74
|
+
},
|
|
75
|
+
};
|
|
76
|
+
} catch (err) {
|
|
77
|
+
if (err instanceof MemStackError) throw err;
|
|
78
|
+
throw new MemStackError("LLM_ERROR", `LLM request failed: ${err instanceof Error ? err.message : String(err)}`, {
|
|
79
|
+
retryable: true,
|
|
80
|
+
});
|
|
81
|
+
}
|
|
82
|
+
}
|
|
83
|
+
|
|
84
|
+
async *completeStream(request: {
|
|
85
|
+
system: string;
|
|
86
|
+
user: string;
|
|
87
|
+
model?: string;
|
|
88
|
+
temperature?: number;
|
|
89
|
+
maxTokens?: number;
|
|
90
|
+
}): AsyncIterable<{ text: string; tokens: { prompt: number; completion: number; total: number } }> {
|
|
91
|
+
const model = request.model ?? this.defaultModel;
|
|
92
|
+
const temperature = request.temperature ?? this.defaultTemperature;
|
|
93
|
+
const maxTokens = request.maxTokens ?? this.defaultMaxTokens;
|
|
94
|
+
|
|
95
|
+
let response: Response;
|
|
96
|
+
try {
|
|
97
|
+
response = await fetch(`${this.baseURL}/chat/completions`, {
|
|
98
|
+
method: "POST",
|
|
99
|
+
headers: {
|
|
100
|
+
"Content-Type": "application/json",
|
|
101
|
+
Authorization: `Bearer ${this.apiKey}`,
|
|
102
|
+
},
|
|
103
|
+
body: JSON.stringify({
|
|
104
|
+
model,
|
|
105
|
+
messages: [
|
|
106
|
+
{ role: "system", content: request.system },
|
|
107
|
+
{ role: "user", content: request.user },
|
|
108
|
+
],
|
|
109
|
+
temperature,
|
|
110
|
+
max_tokens: maxTokens,
|
|
111
|
+
stream: true,
|
|
112
|
+
stream_options: { include_usage: true },
|
|
113
|
+
}),
|
|
114
|
+
});
|
|
115
|
+
} catch (err) {
|
|
116
|
+
throw new MemStackError("LLM_ERROR", `OpenAI streaming request failed: ${err instanceof Error ? err.message : String(err)}`, {
|
|
117
|
+
retryable: true,
|
|
118
|
+
});
|
|
119
|
+
}
|
|
120
|
+
|
|
121
|
+
if (!response.ok) {
|
|
122
|
+
const err = await response.text();
|
|
123
|
+
throw new MemStackError("LLM_ERROR", `OpenAI streaming error: ${response.status} ${err}`, {
|
|
124
|
+
retryable: response.status >= 500,
|
|
125
|
+
});
|
|
126
|
+
}
|
|
127
|
+
|
|
128
|
+
const reader = response.body?.getReader();
|
|
129
|
+
if (!reader) throw new MemStackError("LLM_ERROR", "No response body for streaming");
|
|
130
|
+
|
|
131
|
+
const decoder = new TextDecoder();
|
|
132
|
+
let buffer = "";
|
|
133
|
+
let promptTokens = 0;
|
|
134
|
+
let completionTokens = 0;
|
|
135
|
+
|
|
136
|
+
try {
|
|
137
|
+
while (true) {
|
|
138
|
+
const { done, value } = await reader.read();
|
|
139
|
+
if (done) break;
|
|
140
|
+
|
|
141
|
+
buffer += decoder.decode(value, { stream: true });
|
|
142
|
+
const lines = buffer.split("\n");
|
|
143
|
+
buffer = lines.pop() ?? "";
|
|
144
|
+
|
|
145
|
+
for (const line of lines) {
|
|
146
|
+
const trimmed = line.trim();
|
|
147
|
+
if (!trimmed || !trimmed.startsWith("data: ")) continue;
|
|
148
|
+
const data = trimmed.slice(6);
|
|
149
|
+
if (data === "[DONE]") continue;
|
|
150
|
+
|
|
151
|
+
try {
|
|
152
|
+
const parsed = JSON.parse(data) as {
|
|
153
|
+
choices?: { delta?: { content?: string } }[];
|
|
154
|
+
usage?: { prompt_tokens: number; completion_tokens: number; total_tokens: number };
|
|
155
|
+
};
|
|
156
|
+
|
|
157
|
+
const content = parsed.choices?.[0]?.delta?.content ?? "";
|
|
158
|
+
if (parsed.usage) {
|
|
159
|
+
promptTokens = parsed.usage.prompt_tokens;
|
|
160
|
+
completionTokens = parsed.usage.completion_tokens;
|
|
161
|
+
}
|
|
162
|
+
|
|
163
|
+
if (content) {
|
|
164
|
+
yield {
|
|
165
|
+
text: content,
|
|
166
|
+
tokens: { prompt: promptTokens, completion: completionTokens, total: promptTokens + completionTokens },
|
|
167
|
+
};
|
|
168
|
+
}
|
|
169
|
+
} catch {
|
|
170
|
+
// Skip unparseable chunks
|
|
171
|
+
}
|
|
172
|
+
}
|
|
173
|
+
}
|
|
174
|
+
} finally {
|
|
175
|
+
reader.releaseLock();
|
|
176
|
+
}
|
|
177
|
+
}
|
|
178
|
+
}
|