ElevenLabs-Alternative für Schweizerdeutsch

ElevenLabs ist die breitere Plattform: mehr Sprachen, Voice Cloning, ein gehostetes Agenten-Produkt und tiefere Listenpreise für die Spracherkennung. Suisse Speech ist für die Schweiz gebaut, schreibt Schweizerdeutsch als hochdeutschen Text und spricht hochdeutsch geschriebene Antworten in echtem Zürich-, Bern-, Basel- oder Luzernerdeutsch statt mit Akzent. Sprechen Ihre Anrufenden Mundart und sollen sie auch Mundart hören, entscheidet meist dieser Unterschied; sonst passt ElevenLabs womöglich besser.

Die Angaben zu ElevenLabs geben Dokumentation und API-Preise vom 21. September 2026 wieder, jeweils mit Link zur Quelle. Genauigkeitswerte nennen wir für keinen der beiden Dienste: Testen Sie beide mit Ihren eigenen Aufnahmen.

Suisse Speech und ElevenLabs im Überblick

ElevenLabs Suisse Speech
Spracherkennung Schweizerdeutsch Deutsch gelistet, Schweizerdeutsch nicht separat Alle Regionen, geschrieben als Hochdeutsch
Sprachausgabe Schweizerdeutsch Deutsch unterstützt; der Akzent kommt von der gewählten Stimme Hochdeutscher Text wird in Dialekt umgesetzt
Dialektausgabe Nicht dokumentiert Zürich, Bern, Basel, Luzern und überregional von Hand abgestimmt; 14 Regionen auf Best-Effort-Basis
Telefon-Audio Ausgabe µ-law und A-law 8 kHz; Echtzeit-Erkennung nimmt µ-law an Ausgabe G.711 µ-law und A-law 8 kHz; Echtzeit-Erkennung erwartet 16 kHz PCM16
Sprachen Über 70 für die Sprachausgabe, über 90 für die Erkennung Schweizerdeutsch, Französisch und Italienisch zuerst; rund 90 Sprachvarianten
Gespeicherte Inhalte Standardmässig aufbewahrt; Zero Retention Mode für Enterprise Nicht gespeichert; Batch-Resultate höchstens 48 h
Preis Spracherkennung USD 0.22 pro Stunde; Echtzeit USD 0.39 CHF 1.35 pro Stunde; Echtzeit CHF 2.20
Preis Sprachausgabe USD 0.05 oder 0.10 pro 1000 Zeichen CHF 4.60 pro Stunde; Echtzeit CHF 6.85

Spracherkennung für Schweizerdeutsch

ElevenLabs bietet Scribe v2 für Dateien, Scribe v2 Realtime für Streaming und Scribe v2 Medical an (Modelle). Die Dokumentation listet über 90 Sprachen, darunter Deutsch, aber nicht Schweizerdeutsch als eigene Sprache (Speech-to-Text-Dokumentation); die Seite von ElevenLabs zur deutschen Spracherkennung nennt Schweizerdeutsch als einen der Akzente des Deutschen (German speech to text). Wie Mundart im Transkript geschrieben wird, ist nicht dokumentiert. Der Echtzeit-Endpunkt nimmt Telefonaudio in 8 kHz µ-law direkt an (Realtime-API).

Suisse Speech schreibt Schweizerdeutsch aus allen Regionen als Hochdeutsch: Mundart hat keine feste Rechtschreibung, und mit einheitlichem Text arbeiten Suche, Auswertungen und Sprachmodelle am besten. Gemeldet wird die Sprache (de-CH), nicht der Dialekt; bis zu 200 eigene Begriffe lassen sich mitgeben. Der Echtzeit-Stream erwartet 16 kHz mono PCM16; Telefonaudio rechnen Sie also vorher um (Speech-to-Text).

Text-to-Speech auf Schweizerdeutsch: Dialekt oder Akzent

Hier liegt der grösste Unterschied. ElevenLabs führt für Eleven v3 (über 70 Sprachen), Multilingual v2 (29) und Flash v2.5 (32) Deutsch auf, nicht Schweizerdeutsch (Modelle). Laut Hilfe-Center bestimmt der Text die Sprache; Akzent und Aussprache kommen von der Stimme (Hilfe-Center). Ein Schweizer Klang hängt also an der Stimmenwahl: Die Voice Library umfasst über 10’000 Community-Stimmen, filterbar nach Sprache und Akzent, und Stimmen lassen sich klonen oder per Beschreibung entwerfen (Voices, Voice Library). Eine Umsetzung von hochdeutschem Text in Wortschatz und Grammatik eines Schweizer Dialekts ist nicht dokumentiert.

Genau das macht Suisse Speech. Sie schreiben hochdeutsch, wählen einen Dialekt und hören ihn mit eigenen Wörtern, eigener Grammatik und eigener Aussprache:

curl -X POST https://api.suisse-speech.ch/v1/tts \
  -H "X-API-Key: $SUISSE_SPEECH_KEY" -H 'Content-Type: application/json' \
  -d '{"text":"Ihr Termin am Dienstag um zehn Uhr ist bestätigt.","voice":"lea","language":"de-CH","dialect":"bern","format":"mp3"}' \
  --output termin.mp3

Fünf schweizerdeutsche Varietäten sind von Hand abgestimmt, 14 weitere Regionen auf Best-Effort-Basis verfügbar (Schweizerdeutsch). Als Telefonnummer ausgezeichnet, wird +41 31 533 22 02 auf Berndeutsch zu «null drüü eis, füf drüü drüü, zwöi zwöi, null zwöi». Beide Dienste liefern µ-law und A-law mit 8 kHz (Formate ElevenLabs, unsere).

Echtzeit, Latenz und Voicebots

Beide Dienste streamen in beide Richtungen über WebSocket (Echtzeit-Sprachausgabe ElevenLabs). ElevenLabs nennt Modell-Latenzen von rund 75 ms für Flash v2.5, 280 ms für Eleven v3 Conversational und 150 ms für Scribe v2 Realtime, jeweils ohne Anwendungs- und Netzwerklatenz (Modelle). Wir veröffentlichen die in Produktion gemessene Zeit bis zum ersten Audio: rund 0,5 Sekunden, unter 1 Sekunde im Dialekt; Zwischenresultate der Erkennung kommen alle 250 ms. Die Werte sind unterschiedlich gemessen; auf dem Papier sind die schnellsten Modelle von ElevenLabs schneller.

ElevenLabs deckt zudem mehr vom Bot ab: Speech Engine ergänzt Ihr eigenes Sprachmodell um Sprecherwechsel und den Umgang mit Unterbrechungen, für USD 0.08 pro Minute (Speech Engine, API-Preise), und ElevenAgents ist eine gehostete Agenten-Plattform mit Anbindung an Telefonie und SIP-Trunks (Integrationen). Suisse Speech ist eine Sprach-API; die Gesprächslogik bleibt bei Ihnen.

Datenbearbeitung und Standort

ElevenLabs bewahrt Anfragedaten standardmässig gemäss seiner Datenschutzerklärung auf; Enterprise-Kunden können den Zero Retention Mode mit enable_logging=false einschalten (Zero Retention Mode). Kundendaten werden standardmässig in den USA gespeichert. Enterprise-Kunden können isolierte Umgebungen in der EU, in Indien oder in Singapur nutzen; EU-Residenz mit Zero Retention Mode hält die Bearbeitung in der EU, abgesehen von gewissen optionalen Integrationen (Data Residency). ElevenLabs nutzt gewisse Kundendaten zur Verbesserung seiner Modelle, ausser man widerspricht (Opt-out); Daten von Enterprise-Kunden standardmässig nicht (Hilfe-Center).

Suisse Speech speichert keine Audiodaten, Texte oder Transkripte, und zwar für alle Kundinnen und Kunden; Batch-Resultate warten höchstens 48 Stunden auf die Abholung. Unsere API-Server stehen in der Schweiz, die Spracherkennung läuft in der EU. Teile der Sprachsynthese bearbeiten Partner ausserhalb der Schweiz und der EU, auch in den USA; unser Auftragsbearbeitungsvertrag führt sie auf. Ihre Inhalte werden nicht zum Training von Modellen verwendet (Sicherheit).

Preise

ElevenLabs Suisse Speech
Spracherkennung, Dateien USD 0.22 pro Stunde (Scribe v2) CHF 1.35 pro Stunde (Batch)
Spracherkennung, Streaming USD 0.39 pro Stunde (Scribe v2 Realtime) CHF 2.20 pro Stunde (Echtzeit)
Sprachausgabe, schnell USD 0.05 pro 1000 Zeichen (Flash, v3 Conversational), rund USD 2.70 pro Stunde CHF 6.85 pro Stunde (Echtzeit)
Sprachausgabe, höchste Qualität USD 0.10 pro 1000 Zeichen (v3, Multilingual v2), rund USD 5.40 pro Stunde CHF 4.60 pro Stunde (Batch, Modell studio)

Die Preise von ElevenLabs stammen von der API-Preisseite, exklusive Steuern; Keyterm Prompting kostet USD 0.05 und Entity Detection USD 0.07 pro Stunde zusätzlich. Die Stundenwerte für die Sprachausgabe von ElevenLabs sind unsere Umrechnung mit rund 54’000 Zeichen pro Stunde gesprochener Sprache; die Tabelle von ElevenLabs selbst rechnet mit etwa einer Minute pro 1000 Zeichen, was USD 3.00 und 6.00 ergäbe. Währungen rechnen wir nicht um; unsere Preise verstehen sich exklusive MWST (Preise).

Nach Listenpreis ist ElevenLabs bei der Spracherkennung klar günstiger, und seine schnellen Stimmen kosten pro Stunde weniger als unsere Echtzeit-Stimme. ElevenLabs rechnet pro Zeichen oder nach Audiodauer in US-Dollar ab; wir sekundengenau in Franken, ohne Mindestbetrag pro Anfrage, bezahlbar mit TWINT, Karte oder auf Rechnung. ElevenLabs hat einen Gratisplan; neue Konten bei uns erhalten 60 Gratisminuten.

Wo ElevenLabs die bessere Wahl ist

  • Preis der Transkription: ein Bruchteil unseres Stundenpreises.
  • Sprachen: über 70 für die Sprachausgabe, über 90 für die Erkennung.
  • Eigene Stimmen: Instant und Professional Voice Cloning, Voice Design und eine grosse Voice Library; wir bieten zwölf feste Stimmen.
  • Auswertung von Transkripten: Sprechertrennung für bis zu 32 Personen, Erkennung und Schwärzung von Entitäten, Mehrkanal-Audio (Speech-to-Text-Dokumentation, API-Referenz).
  • Kompletter Agenten-Stack: Speech Engine und ElevenAgents, mit Telefonie.
  • Enterprise-Programm: SOC 2, HIPAA-BAAs, Datenresidenz in der EU, in Indien oder in Singapur, private Deployments in der eigenen Cloud (Data Residency, Private Deployments).

Wann Suisse Speech die bessere ElevenLabs-Alternative ist

  • Ihre Anrufenden sprechen Schweizerdeutsch und Sie brauchen einheitliche hochdeutsche Transkripte.
  • Ihr Bot soll in Mundart antworten, nicht in Hochdeutsch mit Akzent.
  • Schweizer Details zählen: Telefonnummern im jeweiligen Dialekt nach Schweizer Art gelesen, Daten und Frankenbeträge in gesprochener Form.
  • Keine gespeicherten Inhalte, auch ohne Enterprise-Vertrag.
  • Ein Schweizer Vertragspartner: Suisse IT GmbH, Abrechnung in Franken pro Sekunde, kostenlose Sandbox-Keys.

Testen Sie beide mit Ihrem eigenen Audio: 60 Gratisminuten anfordern.

FAQ

Kann ElevenLabs Schweizerdeutsch?

ElevenLabs führt Deutsch als Sprache, nicht Schweizerdeutsch. Die Seite zur deutschen Spracherkennung nennt Schweizerdeutsch als einen der Akzente des Deutschen, und bei der Sprachausgabe kommt der Akzent von der gewählten Stimme. Eine Umsetzung von Text in Schweizer Mundart ist nicht dokumentiert.

Ist ElevenLabs günstiger als Suisse Speech?

Bei der Spracherkennung ja: USD 0.22 pro Stunde gegenüber unseren CHF 1.35 im Batch. Bei der Sprachausgabe hängt es vom Modell ab: rund USD 2.70 bis 5.40 pro Stunde nach unserer Umrechnung, gegenüber CHF 4.60 bis 6.85.

Kann ich beide Dienste kombinieren?

Ja. Erkennung und Synthese sind getrennte API-Aufrufe; Sie können mit dem einen Dienst transkribieren und mit dem anderen sprechen.

Wo bearbeitet Suisse Speech meine Daten?

Unsere API-Server stehen in der Schweiz, die Erkennung läuft in der EU; Teile der Synthese bearbeiten Partner ausserhalb der Schweiz und der EU, auch in den USA. Audio, Text und Transkripte werden nicht gespeichert.

Testen Sie es mit Ihren eigenen Aufnahmen

Holen Sie sich 60 Gratisminuten für Speech-to-Text und Text-to-Speech. Keine Kreditkarte nötig.