Text-to-Speech

Text-to-speech in vero svizzero tedesco

Scriva in tedesco standard e ascolti Züritüütsch, Bärndütsch, Baaseldütsch o Lozärnerdütsch, con lessico, grammatica e pronuncia del dialetto. In streaming dal vivo per i voicebot, oppure generato in qualità da studio per audio preparati in anticipo.

Tempo reale CHF 6.85 per ora di audio, batch CHF 4.60 all'ora. Fatturazione al secondo.

Due modelli, un solo catalogo di voci

studio Batch

La massima fedeltà e l'intonazione più naturale. Il modello da usare per messaggi vocali, saluti, annunci e voci fuori campo.

swift Tempo reale e batch

Trasmette l'audio mentre il testo è ancora in fase di scrittura, con il primo audio in meno di un secondo. Pensato per voicebot e conversazioni dal vivo.

Vero dialetto

Il testo in tedesco standard viene reso nel dialetto scelto. L'alto tedesco svizzero e le altre varietà mantengono le parole esattamente come sono scritte.

Numeri e date all'uso svizzero

Numeri di telefono raggruppati 3-3-2-2 e letti in dialetto. Date, orari e importi in CHF nella loro forma parlata.

Un markup che funziona davvero

Pause, enfasi, velocità, altezza, codici compitati e cambi di lingua all'interno di un testo. Il markup non supportato viene rifiutato, mai ignorato.

Lo stile descritto a parole

Descriva l'interpretazione, per esempio «calmo e paziente, brevi pause dopo ogni frase». Le parole stesse vengono sempre lette così come sono scritte.

Tutti i formati necessari

MP3, WAV, Opus, PCM16 grezzo e G.711 µ-law o A-law a 8 kHz per le linee telefoniche.

Testi lunghi come job

Invii un capitolo e ritiri l'audio quando è pronto, se lo desidera con un callback firmato.

Pronunciare una frase in bernese

POST /v1/tts
curl -X POST https://api.suisse-speech.ch/v1/tts \
  -H "X-API-Key: $SUISSE_SPEECH_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text": "Ihr Termin am Dienstag um zehn Uhr ist bestätigt.",
       "model": "studio", "voice": "lea",
       "language": "de-CH", "dialect": "bern", "format": "mp3"}' \
  --output termin.mp3

Una risposta in streaming mentre il Suo bot la sta ancora scrivendo

wss://api.suisse-speech.ch/v1/tts/stream
import WebSocket from 'ws';

const ws = new WebSocket('wss://api.suisse-speech.ch/v1/tts/stream', {
  headers: { 'X-API-Key': process.env.SUISSE_SPEECH_KEY },
});

ws.on('open', async () => {
  ws.send(JSON.stringify({
    type: 'session.start', model: 'swift', voice: 'anna',
    language: 'de-CH', dialect: 'zurich',
    format: 'pcm16', sample_rate_hz: 24000, transport: 'binary',
  }));
  for await (const chunk of llmReply) {      // text as your LLM writes it
    ws.send(JSON.stringify({ type: 'text.append', text: chunk }));
  }
  ws.send(JSON.stringify({ type: 'session.end' }));
});

ws.on('message', (data, isBinary) => {
  if (isBinary) return player.write(data);   // audio, in order
  const frame = JSON.parse(data.toString());  // control frames
  if (frame.type === 'session.complete') ws.close();
});

Dodici voci

Ogni voce parla tutte le lingue e tutti i dialetti supportati, così un'unica identità vocale può accompagnare un'intera conversazione.

Femminile

  • anna calda ed equilibrata, la voce predefinita per il servizio clienti
  • vera luminosa ed energica, per brevi menu e messaggi
  • lea morbida e calma, per spiegazioni lunghe e segreteria telefonica
  • nora articolazione chiara, pensata per le linee telefoniche a banda stretta
  • mia dolce ed empatica, per la sanità e i temi sensibili
  • elin neutra e regolare, per documenti lunghi

Maschile

  • stefan neutro e professionale, il corrispettivo maschile di anna
  • reto profondo e calmo, per annunci e comunicazioni
  • lukas rapido e diretto, per le conferme nelle chiamate in uscita
  • jonas corposo e fermo, per l'audio aziendale
  • andrin caldo e paziente, per consulenza, vendita e onboarding
  • felix espressivo e dinamico, segue fedelmente le indicazioni di stile

Domande frequenti

Devo scrivere il testo in dialetto?

No. Scriva in tedesco standard. Per i dialetti svizzero tedeschi, l'API rende il Suo testo nel dialetto, con il suo lessico e la sua grammatica.

Quanto è veloce la sintesi in tempo reale?

Il primo audio di una risposta arriva di norma in circa mezzo secondo, e in meno di un secondo per il dialetto svizzero tedesco. Il resto viene trasmesso man mano che viene generato.

Posso usare la mia voce o clonare una voce?

Al momento no. Le dodici voci del catalogo sono stabili: una voce non viene mai modificata o rimossa senza preavviso, così un IVR in funzione continua a suonare sempre allo stesso modo.

Posso cambiare lingua all'interno di un testo?

Sì, con un elemento di lingua nel markup, per esempio per pronunciare il nome inglese di un prodotto all'interno di una frase in bernese.

Lo provi con il Suo audio

Ottenga 60 minuti gratuiti di speech-to-text e text-to-speech. Nessuna carta di credito richiesta.