Speech-to-Text

Spracherkennung für Schweizerdeutsch

Schweizerdeutsch rein, sauberer hochdeutscher Text raus – mit Zeitstempeln und Konfidenzwerten pro Wort. Streamen Sie Audio live für Voicebots oder senden Sie Aufnahmen beliebiger Länge als Batch-Jobs.

Echtzeit CHF 2.20 pro Stunde, Batch CHF 1.35 pro Stunde. Sekundengenau abgerechnet.

Echtzeit über WebSocket

Vorläufige Transkripte alle 250 ms, solange gesprochen wird, und der endgültige Text rund 0.1 s nach dem letzten Wort.

Batch-Verarbeitung und lange Aufnahmen

Bis 25 MB in einer einzelnen Anfrage, bis 200 MB als Job. Lange Aufnahmen werden in rund einem Drittel der Aufnahmedauer transkribiert.

Automatische Erkennung der Sprache

Geben Sie bis zu acht infrage kommende Sprachen an oder «auto» für Deutsch, Französisch, Italienisch und Englisch. Jedes Ergebnis nennt die gesprochene Sprache.

Eigenes Vokabular

Bis zu 200 Namen, Produkte und Ortsnamen pro Anfrage, damit Ihre Begriffe auf Anhieb richtig im Transkript stehen.

Zeitstempel und Konfidenz pro Wort

Jedes Wort mit Anfang, Ende und Konfidenzwert, bereit für Untertitel, Suche und Qualitätskontrollen.

Telefonaudio

Funktioniert mit schmalbandigem Telefonaudio (8 kHz) ebenso wie mit Studioaufnahmen. Alle gängigen Audio-Containerformate werden akzeptiert.

Eine Datei transkribieren

POST /v1/stt
curl -X POST https://api.suisse-speech.ch/v1/stt \
  -H "X-API-Key: $SUISSE_SPEECH_KEY" \
  -F audio=@call.wav \
  -F lang=de-CH \
  -F 'vocabulary=["Rüegg", "Bircher", "Glasfaser"]'

Was zurückkommt

200 OK
{
  "text": "Grüezi Herr Meier, wie kann ich Ihnen helfen?",
  "lang": "de-CH",
  "duration_s": 3.82,
  "words": [
    { "w": "Grüezi", "start": 0.12, "end": 0.65, "conf": 0.98 },
    { "w": "Herr",   "start": 0.70, "end": 0.95, "conf": 0.99 },
    { "w": "Meier",  "start": 0.98, "end": 1.40, "conf": 0.97 }
  ]
}

Live-Audio streamen

wss://api.suisse-speech.ch/v1/stt/stream
import WebSocket from 'ws';

const ws = new WebSocket('wss://api.suisse-speech.ch/v1/stt/stream', {
  headers: { 'X-API-Key': process.env.SUISSE_SPEECH_KEY },
});

ws.on('open', () => {
  // Candidates: the spoken language is detected and reported per result.
  ws.send(JSON.stringify({ type: 'config', lang: 'de-CH,fr-CH,en' }));
  // Then send 16 kHz mono PCM16 as binary frames, at real-time pace,
  // and finish with {"type": "audio.end"}.
});

ws.on('message', (data, isBinary) => {
  if (isBinary) return;
  const msg = JSON.parse(data.toString());
  if (msg.type === 'transcript.partial') showLive(msg.text);
  if (msg.type === 'transcript.final') answer(msg.lang, msg.text);
});

Wie aus Mundart Text wird

Schweizerdeutsch hat keine einheitliche Rechtschreibung. Zwei Personen aus Bern würden denselben Satz auf zwei verschiedene Arten schreiben. Die API schreibt das Gesagte deshalb auf Hochdeutsch. So bleiben Transkripte durchsuchbar und einheitlich, und genau das erwarten nachgelagerte Sprachmodelle und Analysen. Der Dialekt selbst wird nicht ausgewiesen: In welcher Variante Sie antworten, entscheiden Sie.

Schweizerdeutsch →

Häufige Fragen

Welche Audioformate kann ich senden?

Alle gängigen Containerformate: WAV, MP3, Ogg/Opus, FLAC, AAC und rohes PCM16. Für den Echtzeit-Stream senden Sie PCM16 mit 16 kHz, mono.

Wie genau ist die Erkennung bei Schweizerdeutsch?

Das hängt von Ihrem Audio ab: Mikrofon, Leitungsqualität, Hintergrundgeräusche, Wortschatz. Wir veröffentlichen keinen pauschalen Genauigkeitswert. Testen Sie es mit den 60 Gratisminuten an Ihren eigenen Aufnahmen.

Unterscheidet die Erkennung Zürichdeutsch von Berndeutsch?

Nein. Die Erkennung meldet die Sprache (zum Beispiel de-CH), nicht den regionalen Dialekt. Wenn Sie im Dialekt antworten möchten, legen Sie ihn pro Anwendung, Leitung oder Region fest.

Kann die Sprache innerhalb eines Gesprächs wechseln?

Ja. Bei mehreren infrage kommenden Sprachen trägt jedes vorläufige und endgültige Ergebnis die Sprache des jeweiligen Abschnitts. So ist ein Wechsel sichtbar, sobald er passiert.

Testen Sie es mit Ihren eigenen Aufnahmen

Holen Sie sich 60 Gratisminuten für Speech-to-Text und Text-to-Speech. Keine Kreditkarte nötig.