Text-to-speech in vero svizzero tedesco
Scriva in tedesco standard e ascolti Züritüütsch, Bärndütsch, Baaseldütsch o Lozärnerdütsch, con lessico, grammatica e pronuncia del dialetto. In streaming dal vivo per i voicebot, oppure generato in qualità da studio per audio preparati in anticipo.
Tempo reale CHF 6.85 per ora di audio, batch CHF 4.60 all'ora. Fatturazione al secondo.
Due modelli, un solo catalogo di voci
studio Batch
La massima fedeltà e l'intonazione più naturale. Il modello da usare per messaggi vocali, saluti, annunci e voci fuori campo.
swift Tempo reale e batch
Trasmette l'audio mentre il testo è ancora in fase di scrittura, con il primo audio in meno di un secondo. Pensato per voicebot e conversazioni dal vivo.
Vero dialetto
Il testo in tedesco standard viene reso nel dialetto scelto. L'alto tedesco svizzero e le altre varietà mantengono le parole esattamente come sono scritte.
Numeri e date all'uso svizzero
Numeri di telefono raggruppati 3-3-2-2 e letti in dialetto. Date, orari e importi in CHF nella loro forma parlata.
Un markup che funziona davvero
Pause, enfasi, velocità, altezza, codici compitati e cambi di lingua all'interno di un testo. Il markup non supportato viene rifiutato, mai ignorato.
Lo stile descritto a parole
Descriva l'interpretazione, per esempio «calmo e paziente, brevi pause dopo ogni frase». Le parole stesse vengono sempre lette così come sono scritte.
Tutti i formati necessari
MP3, WAV, Opus, PCM16 grezzo e G.711 µ-law o A-law a 8 kHz per le linee telefoniche.
Testi lunghi come job
Invii un capitolo e ritiri l'audio quando è pronto, se lo desidera con un callback firmato.
Pronunciare una frase in bernese
curl -X POST https://api.suisse-speech.ch/v1/tts \
-H "X-API-Key: $SUISSE_SPEECH_KEY" \
-H "Content-Type: application/json" \
-d '{"text": "Ihr Termin am Dienstag um zehn Uhr ist bestätigt.",
"model": "studio", "voice": "lea",
"language": "de-CH", "dialect": "bern", "format": "mp3"}' \
--output termin.mp3Una risposta in streaming mentre il Suo bot la sta ancora scrivendo
import WebSocket from 'ws';
const ws = new WebSocket('wss://api.suisse-speech.ch/v1/tts/stream', {
headers: { 'X-API-Key': process.env.SUISSE_SPEECH_KEY },
});
ws.on('open', async () => {
ws.send(JSON.stringify({
type: 'session.start', model: 'swift', voice: 'anna',
language: 'de-CH', dialect: 'zurich',
format: 'pcm16', sample_rate_hz: 24000, transport: 'binary',
}));
for await (const chunk of llmReply) { // text as your LLM writes it
ws.send(JSON.stringify({ type: 'text.append', text: chunk }));
}
ws.send(JSON.stringify({ type: 'session.end' }));
});
ws.on('message', (data, isBinary) => {
if (isBinary) return player.write(data); // audio, in order
const frame = JSON.parse(data.toString()); // control frames
if (frame.type === 'session.complete') ws.close();
});Dodici voci
Ogni voce parla tutte le lingue e tutti i dialetti supportati, così un'unica identità vocale può accompagnare un'intera conversazione.
Femminile
annacalda ed equilibrata, la voce predefinita per il servizio clientiveraluminosa ed energica, per brevi menu e messaggileamorbida e calma, per spiegazioni lunghe e segreteria telefonicanoraarticolazione chiara, pensata per le linee telefoniche a banda strettamiadolce ed empatica, per la sanità e i temi sensibilielinneutra e regolare, per documenti lunghi
Maschile
stefanneutro e professionale, il corrispettivo maschile di annaretoprofondo e calmo, per annunci e comunicazionilukasrapido e diretto, per le conferme nelle chiamate in uscitajonascorposo e fermo, per l'audio aziendaleandrincaldo e paziente, per consulenza, vendita e onboardingfelixespressivo e dinamico, segue fedelmente le indicazioni di stile
Domande frequenti
Devo scrivere il testo in dialetto?
No. Scriva in tedesco standard. Per i dialetti svizzero tedeschi, l'API rende il Suo testo nel dialetto, con il suo lessico e la sua grammatica.
Quanto è veloce la sintesi in tempo reale?
Il primo audio di una risposta arriva di norma in circa mezzo secondo, e in meno di un secondo per il dialetto svizzero tedesco. Il resto viene trasmesso man mano che viene generato.
Posso usare la mia voce o clonare una voce?
Al momento no. Le dodici voci del catalogo sono stabili: una voce non viene mai modificata o rimossa senza preavviso, così un IVR in funzione continua a suonare sempre allo stesso modo.
Posso cambiare lingua all'interno di un testo?
Sì, con un elemento di lingua nel markup, per esempio per pronunciare il nome inglese di un prodotto all'interno di una frase in bernese.
Lo provi con il Suo audio
Ottenga 60 minuti gratuiti di speech-to-text e text-to-speech. Nessuna carta di credito richiesta.