Text-to-Speech

Sprachausgabe in echtem Schweizerdeutsch

Sie schreiben auf Hochdeutsch und hören Züritüütsch, Bärndütsch, Baaseldütsch oder Lozärnerdütsch – mit Wortwahl, Grammatik und Aussprache des Dialekts. Streamen Sie die Sprachausgabe live für Voicebots oder erzeugen Sie sie in Studioqualität für vorproduzierte Audiodateien.

Echtzeit CHF 6.85 pro Stunde Audio, Batch CHF 4.60 pro Stunde. Sekundengenau abgerechnet.

Zwei Modelle, ein Stimmenkatalog

studio Batch

Höchste Klangtreue und die natürlichste Sprechweise. Das Modell der Wahl für Ansagen, Begrüssungen, Durchsagen und Vertonungen.

swift Echtzeit und Batch

Streamt Audio, während der Text noch geschrieben wird – das erste Audio kommt in unter einer Sekunde. Gemacht für Voicebots und Live-Gespräche.

Echter Dialekt

Hochdeutscher Text wird in den gewählten Dialekt übertragen. Schweizer Hochdeutsch und andere Varianten behalten die Wörter genau so, wie sie geschrieben sind.

Zahlen und Datum auf Schweizer Art

Telefonnummern im Muster 3-3-2-2 gruppiert und im Dialekt gelesen. Datum, Uhrzeit und CHF-Beträge in ihrer gesprochenen Form.

Markup, das wirklich funktioniert

Pausen, Betonung, Tempo, Tonhöhe, buchstabierte Codes und Sprachwechsel innerhalb eines Textes. Nicht unterstütztes Markup wird abgelehnt, nie ignoriert.

Stil in einfachen Worten

Beschreiben Sie die Sprechweise, etwa «ruhig und geduldig, kurze Pausen nach jedem Satz». Die Wörter selbst werden immer so gelesen, wie sie geschrieben sind.

Alle Formate, die Sie brauchen

MP3, WAV, Opus, rohes PCM16 sowie G.711 µ-law oder A-law mit 8 kHz für Telefonleitungen.

Lange Texte als Jobs

Reichen Sie ein Kapitel ein und holen Sie das Audio ab, sobald es bereit ist – auf Wunsch mit signiertem Callback.

Einen Satz auf Berndeutsch sprechen lassen

POST /v1/tts
curl -X POST https://api.suisse-speech.ch/v1/tts \
  -H "X-API-Key: $SUISSE_SPEECH_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text": "Ihr Termin am Dienstag um zehn Uhr ist bestätigt.",
       "model": "studio", "voice": "lea",
       "language": "de-CH", "dialect": "bern", "format": "mp3"}' \
  --output termin.mp3

Eine Antwort streamen, während Ihr Bot sie noch schreibt

wss://api.suisse-speech.ch/v1/tts/stream
import WebSocket from 'ws';

const ws = new WebSocket('wss://api.suisse-speech.ch/v1/tts/stream', {
  headers: { 'X-API-Key': process.env.SUISSE_SPEECH_KEY },
});

ws.on('open', async () => {
  ws.send(JSON.stringify({
    type: 'session.start', model: 'swift', voice: 'anna',
    language: 'de-CH', dialect: 'zurich',
    format: 'pcm16', sample_rate_hz: 24000, transport: 'binary',
  }));
  for await (const chunk of llmReply) {      // text as your LLM writes it
    ws.send(JSON.stringify({ type: 'text.append', text: chunk }));
  }
  ws.send(JSON.stringify({ type: 'session.end' }));
});

ws.on('message', (data, isBinary) => {
  if (isBinary) return player.write(data);   // audio, in order
  const frame = JSON.parse(data.toString());  // control frames
  if (frame.type === 'session.complete') ws.close();
});

Zwölf Stimmen

Jede Stimme spricht alle unterstützten Sprachen und Dialekte. So kann eine einzige Persona ein ganzes Gespräch führen.

Weiblich

  • anna warm und ausgewogen, die Standardstimme für den Kundenservice
  • vera hell und energiegeladen, für kurze Menüs und Ansagen
  • lea weich und ruhig, für lange Erklärungen und Voicemail
  • nora klare Artikulation, gemacht für schmalbandige Telefonleitungen
  • mia sanft und einfühlsam, für das Gesundheitswesen und sensible Themen
  • elin neutral und gleichmässig, für lange Dokumente

Männlich

  • stefan neutral und professionell, das männliche Pendant zu anna
  • reto tief und ruhig, für Durchsagen und Hinweise
  • lukas zügig und direkt, für ausgehende Bestätigungsanrufe
  • jonas volltönend und souverän, für Corporate Audio
  • andrin warm und geduldig, für Beratung, Verkauf und Onboarding
  • felix ausdrucksstark und dynamisch, setzt Stilvorgaben genau um

Häufige Fragen

Muss ich den Text im Dialekt schreiben?

Nein. Schreiben Sie auf Hochdeutsch. Bei schweizerdeutschen Dialekten überträgt die API Ihren Text in den Dialekt, samt eigenem Wortschatz und eigener Grammatik.

Wie schnell ist die Sprachsynthese in Echtzeit?

Das erste Audio einer Antwort trifft typischerweise nach rund einer halben Sekunde ein, bei schweizerdeutschem Dialekt in unter einer Sekunde. Der Rest wird gestreamt, während er entsteht.

Kann ich meine eigene Stimme verwenden oder eine Stimme klonen?

Im Moment nicht. Die zwölf Katalogstimmen sind stabil: Eine Stimme wird nie ohne Vorankündigung verändert oder entfernt. So klingt ein laufendes IVR-System weiterhin gleich.

Kann ich innerhalb eines Textes die Sprache wechseln?

Ja, mit einem Sprach-Element im Markup, zum Beispiel um einen englischen Produktnamen in einem berndeutschen Satz auszusprechen.

Testen Sie es mit Ihren eigenen Aufnahmen

Holen Sie sich 60 Gratisminuten für Speech-to-Text und Text-to-Speech. Keine Kreditkarte nötig.