Sprachausgabe in echtem Schweizerdeutsch
Sie schreiben auf Hochdeutsch und hören Züritüütsch, Bärndütsch, Baaseldütsch oder Lozärnerdütsch – mit Wortwahl, Grammatik und Aussprache des Dialekts. Streamen Sie die Sprachausgabe live für Voicebots oder erzeugen Sie sie in Studioqualität für vorproduzierte Audiodateien.
Echtzeit CHF 6.85 pro Stunde Audio, Batch CHF 4.60 pro Stunde. Sekundengenau abgerechnet.
Zwei Modelle, ein Stimmenkatalog
studio Batch
Höchste Klangtreue und die natürlichste Sprechweise. Das Modell der Wahl für Ansagen, Begrüssungen, Durchsagen und Vertonungen.
swift Echtzeit und Batch
Streamt Audio, während der Text noch geschrieben wird – das erste Audio kommt in unter einer Sekunde. Gemacht für Voicebots und Live-Gespräche.
Echter Dialekt
Hochdeutscher Text wird in den gewählten Dialekt übertragen. Schweizer Hochdeutsch und andere Varianten behalten die Wörter genau so, wie sie geschrieben sind.
Zahlen und Datum auf Schweizer Art
Telefonnummern im Muster 3-3-2-2 gruppiert und im Dialekt gelesen. Datum, Uhrzeit und CHF-Beträge in ihrer gesprochenen Form.
Markup, das wirklich funktioniert
Pausen, Betonung, Tempo, Tonhöhe, buchstabierte Codes und Sprachwechsel innerhalb eines Textes. Nicht unterstütztes Markup wird abgelehnt, nie ignoriert.
Stil in einfachen Worten
Beschreiben Sie die Sprechweise, etwa «ruhig und geduldig, kurze Pausen nach jedem Satz». Die Wörter selbst werden immer so gelesen, wie sie geschrieben sind.
Alle Formate, die Sie brauchen
MP3, WAV, Opus, rohes PCM16 sowie G.711 µ-law oder A-law mit 8 kHz für Telefonleitungen.
Lange Texte als Jobs
Reichen Sie ein Kapitel ein und holen Sie das Audio ab, sobald es bereit ist – auf Wunsch mit signiertem Callback.
Einen Satz auf Berndeutsch sprechen lassen
curl -X POST https://api.suisse-speech.ch/v1/tts \
-H "X-API-Key: $SUISSE_SPEECH_KEY" \
-H "Content-Type: application/json" \
-d '{"text": "Ihr Termin am Dienstag um zehn Uhr ist bestätigt.",
"model": "studio", "voice": "lea",
"language": "de-CH", "dialect": "bern", "format": "mp3"}' \
--output termin.mp3Eine Antwort streamen, während Ihr Bot sie noch schreibt
import WebSocket from 'ws';
const ws = new WebSocket('wss://api.suisse-speech.ch/v1/tts/stream', {
headers: { 'X-API-Key': process.env.SUISSE_SPEECH_KEY },
});
ws.on('open', async () => {
ws.send(JSON.stringify({
type: 'session.start', model: 'swift', voice: 'anna',
language: 'de-CH', dialect: 'zurich',
format: 'pcm16', sample_rate_hz: 24000, transport: 'binary',
}));
for await (const chunk of llmReply) { // text as your LLM writes it
ws.send(JSON.stringify({ type: 'text.append', text: chunk }));
}
ws.send(JSON.stringify({ type: 'session.end' }));
});
ws.on('message', (data, isBinary) => {
if (isBinary) return player.write(data); // audio, in order
const frame = JSON.parse(data.toString()); // control frames
if (frame.type === 'session.complete') ws.close();
});Zwölf Stimmen
Jede Stimme spricht alle unterstützten Sprachen und Dialekte. So kann eine einzige Persona ein ganzes Gespräch führen.
Weiblich
annawarm und ausgewogen, die Standardstimme für den Kundenserviceverahell und energiegeladen, für kurze Menüs und Ansagenleaweich und ruhig, für lange Erklärungen und Voicemailnoraklare Artikulation, gemacht für schmalbandige Telefonleitungenmiasanft und einfühlsam, für das Gesundheitswesen und sensible Themenelinneutral und gleichmässig, für lange Dokumente
Männlich
stefanneutral und professionell, das männliche Pendant zu annaretotief und ruhig, für Durchsagen und Hinweiselukaszügig und direkt, für ausgehende Bestätigungsanrufejonasvolltönend und souverän, für Corporate Audioandrinwarm und geduldig, für Beratung, Verkauf und Onboardingfelixausdrucksstark und dynamisch, setzt Stilvorgaben genau um
Häufige Fragen
Muss ich den Text im Dialekt schreiben?
Nein. Schreiben Sie auf Hochdeutsch. Bei schweizerdeutschen Dialekten überträgt die API Ihren Text in den Dialekt, samt eigenem Wortschatz und eigener Grammatik.
Wie schnell ist die Sprachsynthese in Echtzeit?
Das erste Audio einer Antwort trifft typischerweise nach rund einer halben Sekunde ein, bei schweizerdeutschem Dialekt in unter einer Sekunde. Der Rest wird gestreamt, während er entsteht.
Kann ich meine eigene Stimme verwenden oder eine Stimme klonen?
Im Moment nicht. Die zwölf Katalogstimmen sind stabil: Eine Stimme wird nie ohne Vorankündigung verändert oder entfernt. So klingt ein laufendes IVR-System weiterhin gleich.
Kann ich innerhalb eines Textes die Sprache wechseln?
Ja, mit einem Sprach-Element im Markup, zum Beispiel um einen englischen Produktnamen in einem berndeutschen Satz auszusprechen.
Testen Sie es mit Ihren eigenen Aufnahmen
Holen Sie sich 60 Gratisminuten für Speech-to-Text und Text-to-Speech. Keine Kreditkarte nötig.