npm - @livekit/agents - Versions diffs - 1.0.5 → 1.1.0 - Mend

@livekit/agents 1.0.5 → 1.1.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.

Files changed (97) hide show

package/dist/index.cjs +3 -0
package/dist/index.cjs.map +1 -1
package/dist/index.d.cts +2 -1
package/dist/index.d.ts +2 -1
package/dist/index.d.ts.map +1 -1
package/dist/index.js +2 -0
package/dist/index.js.map +1 -1
package/dist/inference/api_protos.cjs +104 -0
package/dist/inference/api_protos.cjs.map +1 -0
package/dist/inference/api_protos.d.cts +222 -0
package/dist/inference/api_protos.d.ts +222 -0
package/dist/inference/api_protos.d.ts.map +1 -0
package/dist/inference/api_protos.js +70 -0
package/dist/inference/api_protos.js.map +1 -0
package/dist/inference/index.cjs +56 -0
package/dist/inference/index.cjs.map +1 -0
package/dist/inference/index.d.cts +9 -0
package/dist/inference/index.d.ts +9 -0
package/dist/inference/index.d.ts.map +1 -0
package/dist/inference/index.js +16 -0
package/dist/inference/index.js.map +1 -0
package/dist/inference/llm.cjs +315 -0
package/dist/inference/llm.cjs.map +1 -0
package/dist/inference/llm.d.cts +92 -0
package/dist/inference/llm.d.ts +92 -0
package/dist/inference/llm.d.ts.map +1 -0
package/dist/inference/llm.js +286 -0
package/dist/inference/llm.js.map +1 -0
package/dist/inference/stt.cjs +305 -0
package/dist/inference/stt.cjs.map +1 -0
package/dist/inference/stt.d.cts +79 -0
package/dist/inference/stt.d.ts +79 -0
package/dist/inference/stt.d.ts.map +1 -0
package/dist/inference/stt.js +284 -0
package/dist/inference/stt.js.map +1 -0
package/dist/inference/tts.cjs +317 -0
package/dist/inference/tts.cjs.map +1 -0
package/dist/inference/tts.d.cts +75 -0
package/dist/inference/tts.d.ts +75 -0
package/dist/inference/tts.d.ts.map +1 -0
package/dist/inference/tts.js +299 -0
package/dist/inference/tts.js.map +1 -0
package/dist/inference/utils.cjs +76 -0
package/dist/inference/utils.cjs.map +1 -0
package/dist/inference/utils.d.cts +5 -0
package/dist/inference/utils.d.ts +5 -0
package/dist/inference/utils.d.ts.map +1 -0
package/dist/inference/utils.js +51 -0
package/dist/inference/utils.js.map +1 -0
package/dist/tts/tts.cjs +1 -1
package/dist/tts/tts.cjs.map +1 -1
package/dist/tts/tts.js +1 -1
package/dist/tts/tts.js.map +1 -1
package/dist/utils.cjs +11 -0
package/dist/utils.cjs.map +1 -1
package/dist/utils.d.cts +1 -0
package/dist/utils.d.ts +1 -0
package/dist/utils.d.ts.map +1 -1
package/dist/utils.js +10 -0
package/dist/utils.js.map +1 -1
package/dist/voice/agent.cjs +16 -3
package/dist/voice/agent.cjs.map +1 -1
package/dist/voice/agent.d.cts +4 -3
package/dist/voice/agent.d.ts +4 -3
package/dist/voice/agent.d.ts.map +1 -1
package/dist/voice/agent.js +20 -3
package/dist/voice/agent.js.map +1 -1
package/dist/voice/agent_session.cjs +16 -3
package/dist/voice/agent_session.cjs.map +1 -1
package/dist/voice/agent_session.d.cts +4 -3
package/dist/voice/agent_session.d.ts +4 -3
package/dist/voice/agent_session.d.ts.map +1 -1
package/dist/voice/agent_session.js +20 -3
package/dist/voice/agent_session.js.map +1 -1
package/dist/voice/room_io/_input.cjs +9 -0
package/dist/voice/room_io/_input.cjs.map +1 -1
package/dist/voice/room_io/_input.d.ts.map +1 -1
package/dist/voice/room_io/_input.js +10 -0
package/dist/voice/room_io/_input.js.map +1 -1
package/dist/worker.cjs.map +1 -1
package/dist/worker.d.ts.map +1 -1
package/dist/worker.js +1 -1
package/dist/worker.js.map +1 -1
package/package.json +3 -2
package/src/index.ts +2 -1
package/src/inference/api_protos.ts +82 -0
package/src/inference/index.ts +12 -0
package/src/inference/llm.ts +485 -0
package/src/inference/stt.ts +414 -0
package/src/inference/tts.ts +421 -0
package/src/inference/utils.ts +66 -0
package/src/tts/tts.ts +1 -1
package/src/utils.ts +11 -0
package/src/voice/agent.ts +30 -6
package/src/voice/agent_session.ts +29 -6
package/src/voice/room_io/_input.ts +12 -1
package/src/worker.ts +2 -7

package/src/inference/stt.ts ADDED Viewed

@@ -0,0 +1,414 @@
+// SPDX-FileCopyrightText: 2025 LiveKit, Inc.
+//
+// SPDX-License-Identifier: Apache-2.0
+import { type AudioFrame } from '@livekit/rtc-node';
+import { type RawData, WebSocket } from 'ws';
+import { APIError, APIStatusError } from '../_exceptions.js';
+import { AudioByteStream } from '../audio.js';
+import { log } from '../log.js';
+import {
+  STT as BaseSTT,
+  SpeechStream as BaseSpeechStream,
+  type SpeechData,
+  type SpeechEvent,
+  SpeechEventType,
+} from '../stt/index.js';
+import { type APIConnectOptions, DEFAULT_API_CONNECT_OPTIONS } from '../types.js';
+import { type AudioBuffer, Event, Task, cancelAndWait, shortuuid, waitForAbort } from '../utils.js';
+import { type AnyModels, connectWs, createAccessToken } from './utils.js';
+export type DeepgramModels =
+  | 'deepgram'
+  | 'deepgram/nova-3'
+  | 'deepgram/nova-3-general'
+  | 'deepgram/nova-3-medical'
+  | 'deepgram/nova-2'
+  | 'deepgram/nova-2-general'
+  | 'deepgram/nova-2-medical'
+  | 'deepgram/nova-2-phonecall';
+export type CartesiaModels = 'cartesia' | 'cartesia/ink-whisper';
+export type AssemblyaiModels = 'assemblyai' | 'assemblyai/universal-streaming';
+export interface CartesiaOptions {
+  min_volume?: number; // default: not specified
+  max_silence_duration_secs?: number; // default: not specified
+}
+export interface DeepgramOptions {
+  filler_words?: boolean; // default: true
+  interim_results?: boolean; // default: true
+  endpointing?: number; // default: 25 (ms)
+  punctuate?: boolean; // default: false
+  smart_format?: boolean;
+  keywords?: Array<[string, number]>;
+  keyterms?: string[];
+  profanity_filter?: boolean;
+  numerals?: boolean;
+  mip_opt_out?: boolean;
+}
+export interface AssemblyaiOptions {
+  format_turns?: boolean; // default: false
+  end_of_turn_confidence_threshold?: number; // default: 0.01
+  min_end_of_turn_silence_when_confident?: number; // default: 0
+  max_turn_silence?: number; // default: not specified
+  keyterms_prompt?: string[]; // default: not specified
+}
+export type STTModels = DeepgramModels | CartesiaModels | AssemblyaiModels | AnyModels;
+export type STTOptions<TModel extends STTModels> = TModel extends DeepgramModels
+  ? DeepgramOptions
+  : TModel extends CartesiaModels
+    ? CartesiaOptions
+    : TModel extends AssemblyaiModels
+      ? AssemblyaiOptions
+      : Record<string, unknown>;
+export type STTLanguages = 'en' | 'de' | 'es' | 'fr' | 'ja' | 'pt' | 'zh';
+export type STTEncoding = 'pcm_s16le';
+const DEFAULT_ENCODING: STTEncoding = 'pcm_s16le';
+const DEFAULT_SAMPLE_RATE = 16000;
+const DEFAULT_BASE_URL = 'wss://agent-gateway.livekit.cloud/v1';
+const DEFAULT_CANCEL_TIMEOUT = 5000;
+export interface InferenceSTTOptions<TModel extends STTModels> {
+  model: TModel;
+  language?: STTLanguages | string;
+  encoding: STTEncoding;
+  sampleRate: number;
+  baseURL: string;
+  apiKey: string;
+  apiSecret: string;
+  extraKwargs: STTOptions<TModel>;
+}
+export class STT<TModel extends STTModels> extends BaseSTT {
+  private opts: InferenceSTTOptions<TModel>;
+  private streams: Set<SpeechStream<TModel>> = new Set();
+  constructor(opts: {
+    model: TModel;
+    language?: STTLanguages | string;
+    baseURL?: string;
+    encoding?: STTEncoding;
+    sampleRate?: number;
+    apiKey?: string;
+    apiSecret?: string;
+    extraKwargs?: STTOptions<TModel>;
+  }) {
+    super({ streaming: true, interimResults: true });
+    const {
+      model,
+      language,
+      baseURL,
+      encoding = DEFAULT_ENCODING,
+      sampleRate = DEFAULT_SAMPLE_RATE,
+      apiKey,
+      apiSecret,
+      extraKwargs = {} as STTOptions<TModel>,
+    } = opts || {};
+    const lkBaseURL = baseURL || process.env.LIVEKIT_INFERENCE_URL || DEFAULT_BASE_URL;
+    const lkApiKey = apiKey || process.env.LIVEKIT_INFERENCE_API_KEY || process.env.LIVEKIT_API_KEY;
+    if (!lkApiKey) {
+      throw new Error('apiKey is required: pass apiKey or set LIVEKIT_API_KEY');
+    }
+    const lkApiSecret =
+      apiSecret || process.env.LIVEKIT_INFERENCE_API_SECRET || process.env.LIVEKIT_API_SECRET;
+    if (!lkApiSecret) {
+      throw new Error('apiSecret is required: pass apiSecret or set LIVEKIT_API_SECRET');
+    }
+    this.opts = {
+      model,
+      language,
+      encoding,
+      sampleRate,
+      baseURL: lkBaseURL,
+      apiKey: lkApiKey,
+      apiSecret: lkApiSecret,
+      extraKwargs,
+    };
+  }
+  get label(): string {
+    return 'inference.STT';
+  }
+  protected async _recognize(_: AudioBuffer): Promise<SpeechEvent> {
+    throw new Error('LiveKit STT does not support batch recognition, use stream() instead');
+  }
+  updateOptions(opts: Partial<Pick<InferenceSTTOptions<TModel>, 'model' | 'language'>>): void {
+    this.opts = { ...this.opts, ...opts };
+    for (const stream of this.streams) {
+      stream.updateOptions(opts);
+    }
+  }
+  stream(options?: {
+    language?: STTLanguages | string;
+    connOptions?: APIConnectOptions;
+  }): SpeechStream<TModel> {
+    const { language, connOptions = DEFAULT_API_CONNECT_OPTIONS } = options || {};
+    const streamOpts = {
+      ...this.opts,
+      language: language ?? this.opts.language,
+    } as InferenceSTTOptions<TModel>;
+    const stream = new SpeechStream(this, streamOpts, connOptions);
+    this.streams.add(stream);
+    return stream;
+  }
+}
+export class SpeechStream<TModel extends STTModels> extends BaseSpeechStream {
+  private opts: InferenceSTTOptions<TModel>;
+  private requestId = shortuuid('stt_request_');
+  private speaking = false;
+  private speechDuration = 0;
+  private reconnectEvent = new Event();
+  #logger = log();
+  constructor(
+    sttImpl: STT<TModel>,
+    opts: InferenceSTTOptions<TModel>,
+    connOptions: APIConnectOptions,
+  ) {
+    super(sttImpl, opts.sampleRate, connOptions);
+    this.opts = opts;
+  }
+  get label(): string {
+    return 'inference.SpeechStream';
+  }
+  updateOptions(opts: Partial<Pick<InferenceSTTOptions<TModel>, 'model' | 'language'>>): void {
+    this.opts = { ...this.opts, ...opts };
+  }
+  protected async run(): Promise<void> {
+    let ws: WebSocket | null = null;
+    let closingWs = false;
+    this.reconnectEvent.set();
+    const connect = async () => {
+      const params = {
+        settings: {
+          sample_rate: String(this.opts.sampleRate),
+          encoding: this.opts.encoding,
+          extra: this.opts.extraKwargs,
+        },
+      } as Record<string, unknown>;
+      if (this.opts.model) {
+        params.model = this.opts.model;
+      }
+      if (this.opts.language) {
+        (params.settings as Record<string, unknown>).language = this.opts.language;
+      }
+      let baseURL = this.opts.baseURL;
+      if (baseURL.startsWith('http://') || baseURL.startsWith('https://')) {
+        baseURL = baseURL.replace('http', 'ws');
+      }
+      const token = await createAccessToken(this.opts.apiKey, this.opts.apiSecret);
+      const url = `${baseURL}/stt`;
+      const headers = { Authorization: `Bearer ${token}` } as Record<string, string>;
+      const socket = await connectWs(url, headers, 10000);
+      const msg = { ...params, type: 'session.create' };
+      socket.send(JSON.stringify(msg));
+      return socket;
+    };
+    const send = async (socket: WebSocket, signal: AbortSignal) => {
+      const audioStream = new AudioByteStream(
+        this.opts.sampleRate,
+        1,
+        Math.floor(this.opts.sampleRate / 20), // 50ms
+      );
+      for await (const ev of this.input) {
+        if (signal.aborted) break;
+        let frames: AudioFrame[];
+        if (ev === SpeechStream.FLUSH_SENTINEL) {
+          frames = audioStream.flush();
+        } else {
+          const frame = ev as AudioFrame;
+          frames = audioStream.write(new Int16Array(frame.data).buffer);
+        }
+        for (const frame of frames) {
+          this.speechDuration += frame.samplesPerChannel / frame.sampleRate;
+          const base64 = Buffer.from(frame.data.buffer).toString('base64');
+          const msg = { type: 'input_audio', audio: base64 };
+          socket.send(JSON.stringify(msg));
+        }
+      }
+      closingWs = true;
+      socket.send(JSON.stringify({ type: 'session.finalize' }));
+    };
+    const recv = async (socket: WebSocket, signal: AbortSignal) => {
+      while (!this.closed && !signal.aborted) {
+        const dataPromise = new Promise<string>((resolve, reject) => {
+          const messageHandler = (d: RawData) => {
+            resolve(d.toString());
+            removeListeners();
+          };
+          const errorHandler = (e: Error) => {
+            reject(e);
+            removeListeners();
+          };
+          const closeHandler = (code: number) => {
+            if (closingWs) {
+              resolve('');
+            } else {
+              reject(
+                new APIStatusError({
+                  message: 'LiveKit STT connection closed unexpectedly',
+                  options: { statusCode: code },
+                }),
+              );
+            }
+            removeListeners();
+          };
+          const removeListeners = () => {
+            socket.removeListener('message', messageHandler);
+            socket.removeListener('error', errorHandler);
+            socket.removeListener('close', closeHandler);
+          };
+          socket.once('message', messageHandler);
+          socket.once('error', errorHandler);
+          socket.once('close', closeHandler);
+        });
+        const data = await Promise.race([dataPromise, waitForAbort(signal)]);
+        if (!data || signal.aborted) return;
+        const json = JSON.parse(data);
+        const type = json.type as string | undefined;
+        switch (type) {
+          case 'session.created':
+          case 'session.finalized':
+          case 'session.closed':
+            break;
+          case 'interim_transcript':
+            this.processTranscript(json, false);
+            break;
+          case 'final_transcript':
+            this.processTranscript(json, true);
+            break;
+          case 'error':
+            this.#logger.error('received error from LiveKit STT: %o', json);
+            throw new APIError(`LiveKit STT returned error: ${JSON.stringify(json)}`);
+          default:
+            this.#logger.warn('received unexpected message from LiveKit STT: %o', json);
+            break;
+        }
+      }
+    };
+    while (true) {
+      try {
+        ws = await connect();
+        const sendTask = Task.from(async ({ signal }) => {
+          await send(ws!, signal);
+        });
+        const recvTask = Task.from(async ({ signal }) => {
+          await recv(ws!, signal);
+        });
+        const tasks = [sendTask, recvTask];
+        const waitReconnectTask = Task.from(async ({ signal }) => {
+          await Promise.race([this.reconnectEvent.wait(), waitForAbort(signal)]);
+        });
+        try {
+          await Promise.race([
+            Promise.all(tasks.map((task) => task.result)),
+            waitReconnectTask.result,
+          ]);
+          if (!waitReconnectTask.done) break;
+          this.reconnectEvent.clear();
+        } finally {
+          await cancelAndWait([sendTask, recvTask, waitReconnectTask], DEFAULT_CANCEL_TIMEOUT);
+        }
+      } finally {
+        try {
+          if (ws) ws.close();
+        } catch {}
+      }
+    }
+  }
+  private processTranscript(data: Record<string, any>, isFinal: boolean) {
+    const requestId = data.request_id ?? this.requestId;
+    const text = data.transcript ?? '';
+    const language = data.language ?? this.opts.language ?? 'en';
+    if (!text && !isFinal) return;
+    // We'll have a more accurate way of detecting when speech started when we have VAD
+    if (!this.speaking) {
+      this.speaking = true;
+      this.queue.put({ type: SpeechEventType.START_OF_SPEECH });
+    }
+    const speechData: SpeechData = {
+      language,
+      startTime: data.start ?? 0,
+      endTime: data.duration ?? 0,
+      confidence: data.confidence ?? 1.0,
+      text,
+    };
+    if (isFinal) {
+      if (this.speechDuration > 0) {
+        this.queue.put({
+          type: SpeechEventType.RECOGNITION_USAGE,
+          requestId,
+          recognitionUsage: { audioDuration: this.speechDuration },
+        });
+        this.speechDuration = 0;
+      }
+      this.queue.put({
+        type: SpeechEventType.FINAL_TRANSCRIPT,
+        requestId,
+        alternatives: [speechData],
+      });
+      if (this.speaking) {
+        this.speaking = false;
+        this.queue.put({ type: SpeechEventType.END_OF_SPEECH });
+      }
+    } else {
+      this.queue.put({
+        type: SpeechEventType.INTERIM_TRANSCRIPT,
+        requestId,
+        alternatives: [speechData],
+      });
+    }
+  }
+}