Schweizerdeutsch-Spracherkennung: Warum Dialekt schwierig ist
Schweizerdeutsch ist für die Spracherkennung schwierig, weil es keine Einheitssprache ist, sondern eine Familie gesprochener Dialekte ohne feste Rechtschreibung, mit eigenem Wortschatz, eigener Grammatik und vielen Wörtern aus dem Französischen, Italienischen und Englischen. Brauchbare Transkripte erhalten Sie, wenn das Gesagte auf Hochdeutsch geschrieben wird, das Audio sauber und im richtigen Format ankommt, die Erkennung Ihre Sprachen und Begriffe kennt und Sie mit eigenen Aufnahmen testen, statt einer einzelnen Genauigkeitszahl zu vertrauen.
Warum Schweizerdeutsch die Spracherkennung fordert
Spracherkennung hat zwei Aufgaben: Wörter hören und aufschreiben. Schweizerdeutsch macht beides schwieriger als Hochdeutsch.
Es gibt keine feste Rechtschreibung
Mundart wird viel mehr gesprochen als geschrieben, und wer sie schreibt, schreibt sie auf seine Art. Zwei Personen aus Bern schreiben denselben Satz unterschiedlich, und eine Nachricht aus Zürich sieht wieder anders aus. Derselbe Satz in drei Regionen:
| Region | Eine mögliche Schreibweise | Auf Hochdeutsch |
|---|---|---|
| Zürich | Mir händ morn e Sitzig. | Wir haben morgen eine Sitzung. |
| Bern | Mir hei morn e Sitzig. | Wir haben morgen eine Sitzung. |
| Basel | Mir hän morn e Sitzig. | Wir haben morgen eine Sitzung. |
Für die Spracherkennung gibt es damit kein einzig richtiges Mundart-Transkript. Und Ihnen würde später eine einheitliche Schreibweise fehlen, nach der Sie suchen könnten.
Andere Wörter, andere Grammatik, nicht nur ein Akzent
Schweizerdeutsch ist kein Hochdeutsch mit Schweizer Akzent. Alltagswörter unterscheiden sich: luege heisst schauen, poschte heisst einkaufen, Anke ist Butter. Manche Wörter klingen vertraut und bedeuten etwas anderes: schmöcke heisst riechen, nicht schmecken. Auch die Grammatik weicht ab. Das Schweizerdeutsche kennt praktisch kein Präteritum: Wo im Hochdeutschen ich war steht, sagt man ich bi gsi. Ein brauchbares Transkript muss all das ins Hochdeutsche übertragen, statt nur Laute zu buchstabieren.
Mehrere Sprachen in einem Gespräch
Die Schweiz hat vier Landessprachen, und die Alltagssprache wechselt zwischen ihnen. Wer aus Zürich anruft, sagt merci und exgüsi, eine Kundin in Biel wechselt mitten im Gespräch zwischen Deutsch und Französisch, und englische Produktnamen tauchen überall auf. Eine Erkennung, die auf eine einzige Sprache festgelegt ist, kann solche Wörter ins Deutsche verbiegen.
Telefonaudio
Ein grosser Teil des Schweizerdeutschen, das Unternehmen transkribieren müssen, kommt übers Telefon: schmalbandiges 8-kHz-Audio, komprimiert, oft mit Strassenlärm oder Ladengeräuschen im Hintergrund. Es enthält weniger Details als eine Studioaufnahme, und Lärm nimmt noch mehr davon weg.
Lokale Namen und eigene Begriffe
Ortsnamen wie Wädenswil oder Rümlang, Familiennamen, Produktnamen und interne Abkürzungen gehören für jede Spracherkennung zu den schwierigsten Wörtern. Gleichzeitig sind es die Wörter, auf die es in einem Transkript am meisten ankommt.
Mundart-Transkript oder hochdeutsches Transkript?
Gesprochenes Schweizerdeutsch lässt sich auf zwei Arten verschriftlichen: in einer Mundart-Schreibweise oder auf Hochdeutsch. Für fast jeden geschäftlichen Einsatz ist Hochdeutsch die bessere Wahl.
| Mundart-Schreibweise | Hochdeutsch | |
|---|---|---|
| Schreibweise | Je nach Person und Region verschieden | Eine Standardschreibweise |
| Suche | Dasselbe Wort in vielen Formen | Eine Form pro Wort |
| Auswertungen und Sprachmodelle | Brauchen zuerst eine Normalisierung | Arbeiten direkt damit |
| Mundart-Färbung | Bleibt erhalten | Geht verloren; der Dialekt wird nicht gemeldet |
Suisse Speech schreibt Schweizerdeutsch aus allen Regionen deshalb auf Hochdeutsch und meldet die Sprache, zum Beispiel de-CH, nicht aber den Dialekt. Das ist ein ehrlicher Kompromiss: Brauchen Sie ein wortgetreues Mundart-Transkript, etwa für die Dialektforschung oder für Mundart-Untertitel, ist hochdeutscher Text nicht das Richtige. Für Kundendienst, Gesprächsauswertung, Suche und alles, was in ein Sprachmodell fliesst, schon.
Antwortet Ihre Anwendung den Anrufenden, entscheiden Sie selbst über den Dialekt der Antwort, pro Einsatz, Telefonlinie oder Region. Die Sprachausgabe setzt eine hochdeutsch geschriebene Antwort dann in Zürich-, Bern-, Basel- oder Luzernerdeutsch um (Schweizerdeutsch, Text-to-Speech).
Sieben Schritte zu brauchbaren Transkripten
1. Echtzeit oder Batch je nach Aufgabe
Live-Gespräche brauchen Streaming: Über eine WebSocket-Verbindung erhalten Sie alle 250 ms ein Zwischenresultat, solange die Person spricht, und den finalen Text etwa 0,1 Sekunden, nachdem sie aufgehört hat. Aufnahmen verarbeiten Sie einfacher als Batch: bis 25 MB in einer einzelnen Anfrage, bis 200 MB als Job, lange Aufnahmen in rund einem Drittel ihrer Dauer.
2. Sauberes Audio im richtigen Format
Für den Echtzeit-Stream senden Sie 16 kHz mono PCM16; 8-kHz-Telefonaudio rechnen Sie vorher um. Für Dateien funktioniert jedes gängige Format: WAV, MP3, Ogg/Opus, FLAC, AAC oder rohes PCM16. Vermeiden Sie mehrfaches Neukodieren derselben Aufnahme und prüfen Sie die Pegel: Übersteuertes Audio bleibt übersteuert.
3. Erwartete Sprachen angeben
Geben Sie eine Sprache an (de-CH), bis zu acht Kandidaten (de-CH,fr-CH,en) oder auto für Deutsch, Französisch, Italienisch und Englisch. Jedes Resultat meldet die gesprochene Sprache, im Stream sogar jedes Zwischenresultat, sodass ein Wechsel von Deutsch zu Französisch sofort sichtbar wird. Nennen Sie nur Sprachen, die Sie wirklich erwarten: Weniger Kandidaten ergeben bei kurzen Äusserungen stabilere Resultate.
4. Eigenes Vokabular mitgeben
Pro Anfrage können Sie bis zu 200 Namen, Produkte und Ortsnamen mitgeben. Nutzen Sie das für die Wörter, auf die es ankommt: Kunden- und Strassennamen, Produktbegriffe, interne Abkürzungen.
5. Zeitmarken und Konfidenz nutzen
Jedes Wort kommt mit Anfang, Ende und Konfidenz. Damit springen Sie von einem Suchtreffer an die richtige Sekunde eines Gesprächs, erstellen Untertitel und leiten unsichere Passagen zur Kontrolle an eine Person weiter.
6. Mit eigenem Audio testen
Keine einzelne Genauigkeitszahl für Schweizerdeutsch sagt Ihnen, wie gut Ihre Aufnahmen erkannt werden. Mikrofon, Leitungsqualität, Hintergrundgeräusche, Vokabular und die Mischung der Dialekte spielen alle mit; deshalb veröffentlichen wir keine solche Zahl. Stellen Sie stattdessen ein kleines Testset zusammen:
- 30 bis 60 Minuten Aufnahmen, die Ihren echten Verkehr abbilden, über Regionen und Leitungsarten hinweg
- zu jeder Aufnahme ein hochdeutsches Referenztranskript, geschrieben von einer Person mit Schweizerdeutsch als Muttersprache
- eine Auswertung, die Fehler nach ihrer Wirkung gewichtet: Ein falscher Name, eine falsche Zahl oder eine verlorene Verneinung wiegt schwerer als ein fehlendes Füllwort
Die Wortfehlerrate ist ein guter Anfang. Weil ein hochdeutsches Transkript Mundartwörter aber übersetzt, können zwei korrekte Transkripte unterschiedlich formuliert sein. Lesen Sie die Unterschiede, statt sie nur zu zählen.
7. Datenbearbeitung von Anfang an klären
Gesprächsaufnahmen enthalten Personendaten. Suisse Speech bearbeitet Audio, Text und Transkripte im Arbeitsspeicher und speichert sie nicht; Resultate von Batch-Jobs warten, bis Sie sie abholen, höchstens 48 Stunden. Die Spracherkennung läuft in der EU. Details finden Sie auf der Seite Sicherheit.
Die erste Anfrage
So transkribieren Sie eine Aufnahme mit einigen eigenen Begriffen:
curl -X POST https://api.suisse-speech.ch/v1/stt \
-H "X-API-Key: $SUISSE_SPEECH_KEY" \
-F audio=@anruf.wav \
-F lang=de-CH,fr-CH,en \
-F 'vocabulary=["Wädenswil","Halbtax"]'
Die Antwort enthält hochdeutschen Text, die erkannte Sprache sowie Zeitmarken und Konfidenz für jedes Wort:
{"text":"…","lang":"de-CH","words":[{"w":"Grüezi","start":0.12,"end":0.58,"conf":0.98}],"duration_s":3.4}
Lange Aufnahmen senden Sie als Job an https://api.suisse-speech.ch/v1/jobs mit kind=stt und holen das Transkript ab, sobald es bereit ist, oder Sie geben dem Job eine Callback-URL mit. Für Live-Audio öffnen Sie wss://api.suisse-speech.ch/v1/stt/stream. Beides beschreiben der Quickstart und die Speech-to-Text-Dokumentation, beide auf Englisch.
Wo sich Transkription von Schweizerdeutsch lohnt
- Contact-Center und Voicebots: Die Mundart der Anrufenden wird zu Text, mit dem ein Bot arbeiten kann, noch während sie sprechen.
- Gesprächsauswertung: Aufgezeichnete Anrufe werden zu durchsuchbarem hochdeutschem Text mit Zeitmarken.
- Medien, E-Learning und Barrierefreiheit: Transkripte von gesprochenem Schweizerdeutsch für Untertitel und Archive.
Die Spracherkennung für Schweizerdeutsch kostet CHF 1.35 pro Stunde Audio im Batch und CHF 2.20 pro Stunde in Echtzeit, sekundengenau abgerechnet (Preise). Prüfen Sie auch ElevenLabs? Unser Vergleich von Suisse Speech und ElevenLabs zeigt mit Quellen, was beide für Schweizerdeutsch dokumentieren.
FAQ
Kann eine Spracherkennung Schweizerdeutsch transkribieren?
Ja. Suisse Speech transkribiert Schweizerdeutsch aus allen Regionen und schreibt es auf Hochdeutsch. Die Erkennung versteht auch Schweizer Hochdeutsch, Französisch, Italienisch und Englisch und erkennt, welche dieser Sprachen gesprochen wird.
Warum ist das Transkript auf Hochdeutsch und nicht in Mundart?
Schweizerdeutsch hat keine feste Rechtschreibung; ein Mundart-Transkript würde dasselbe Wort von Anruf zu Anruf anders schreiben. Hochdeutsch hält Transkripte einheitlich und durchsuchbar, und damit arbeiten Auswertungen und Sprachmodelle am besten.
Erkennt Suisse Speech, welcher Dialekt gesprochen wurde?
Nein. Die Erkennung meldet die Sprache, zum Beispiel de-CH, nicht den regionalen Dialekt. Wenn Sie in Mundart antworten möchten, legen Sie den Dialekt pro Einsatz, Linie oder Region fest.
Wie genau ist die Spracherkennung für Schweizerdeutsch?
Das hängt von Ihrem Audio ab: Mikrofon, Leitungsqualität, Hintergrundgeräusche und Vokabular. Wir veröffentlichen keine einzelne Genauigkeitszahl. Testen Sie mit Ihren eigenen Aufnahmen und den 60 Gratisminuten.
Was kostet es, Schweizerdeutsch zu transkribieren?
CHF 1.35 pro Stunde im Batch und CHF 2.20 pro Stunde in Echtzeit, exklusive MWST, sekundengenau abgerechnet und ohne Mindestbetrag pro Anfrage. Neue Konten starten mit 60 Gratisminuten.
Werden meine Aufnahmen gespeichert?
Nein. Audio, Text und Transkripte werden im Arbeitsspeicher bearbeitet und nicht gespeichert. Resultate von Batch-Jobs bleiben nur bis zur Abholung erhalten, höchstens 48 Stunden.