Produkt 03
Sprache
zu Ihren Bedingungen.
speech ist ein kompakter Sprachdienst: Text-to-Speech und Speech-to-Text hinter einer OpenAI-kompatiblen API. Der Browser spricht mit Ihrem Server — und nur mit Ihrem Server. Schlüssel gelangen nie zum Client.
Direkt einsetzbarer Endpunkt
POST /v1/audio/speech — direkt einsetzbar für alles, was bereits die OpenAI-Audio-API anspricht. Richten Sie die Basis-URL auf Ihre Instanz, und Sie sind fertig.
Streamt während der Erzeugung
Audio mit 24 kHz beginnt schon während der Erzeugung zu spielen — ohne auf die fertige Datei zu warten. Eine reguläre WAV-Datei wird parallel für Wiedergabe und Download gespeichert.
Individuelle Stimmen
Individuelle Stimmen mit Sprach- und Stilanweisungen — warm und ruhig für den Besprechungsraum, zügig für Benachrichtigungen, von Ihnen definiert.
Transkription inbegriffen
Whisper Speech-to-Text mit fortlaufend gestreamten Zwischenergebnissen — eine Datei hochladen, hineinziehen oder direkt im Browser aufnehmen.
Ein schlanker, ehrlicher Proxy
Der Dienst selbst benötigt keine GPU: Modelle laufen auf Ihrem vLLM- oder GPUStack-Endpunkt, speech bleibt eine kleine, prüfbare Anwendung davor.
Schlüssel bleiben bei Ihnen
Der Browser spricht ausschliesslich mit der Anwendung. Anbieterschlüssel liegen in der serverseitigen Konfiguration und werden nie in HTML oder JavaScript ausgeliefert.