Produkt 03

Sprache
zu Ihren Bedingungen.

speech ist ein kompakter Sprachdienst: Text-to-Speech und Speech-to-Text hinter einer OpenAI-kompatiblen API. Der Browser spricht mit Ihrem Server — und nur mit Ihrem Server. Schlüssel gelangen nie zum Client.

OpenAI-kompatible APIStreaming während der ErzeugungSchlüssel bleiben auf Ihrem Server

Direkt einsetzbarer Endpunkt

POST /v1/audio/speech — direkt einsetzbar für alles, was bereits die OpenAI-Audio-API anspricht. Richten Sie die Basis-URL auf Ihre Instanz, und Sie sind fertig.

Streamt während der Erzeugung

Audio mit 24 kHz beginnt schon während der Erzeugung zu spielen — ohne auf die fertige Datei zu warten. Eine reguläre WAV-Datei wird parallel für Wiedergabe und Download gespeichert.

Individuelle Stimmen

Individuelle Stimmen mit Sprach- und Stilanweisungen — warm und ruhig für den Besprechungsraum, zügig für Benachrichtigungen, von Ihnen definiert.

Transkription inbegriffen

Whisper Speech-to-Text mit fortlaufend gestreamten Zwischenergebnissen — eine Datei hochladen, hineinziehen oder direkt im Browser aufnehmen.

Ein schlanker, ehrlicher Proxy

Der Dienst selbst benötigt keine GPU: Modelle laufen auf Ihrem vLLM- oder GPUStack-Endpunkt, speech bleibt eine kleine, prüfbare Anwendung davor.

Schlüssel bleiben bei Ihnen

Der Browser spricht ausschliesslich mit der Anwendung. Anbieterschlüssel liegen in der serverseitigen Konfiguration und werden nie in HTML oder JavaScript ausgeliefert.