La synthèse vocale en vrai suisse allemand
Écrivez en allemand standard, écoutez du Züritüütsch, du Bärndütsch, du Baaseldütsch ou du Lozärnerdütsch, avec le vocabulaire, la grammaire et la prononciation du dialecte. Diffusez l’audio en direct pour vos voicebots, ou produisez-le en qualité studio pour vos contenus préparés à l’avance.
Temps réel CHF 6.85 par heure d’audio, batch CHF 4.60 par heure. Facturation à la seconde.
Deux modèles, un seul catalogue de voix
studio Batch
La plus haute fidélité et la diction la plus naturelle. Le modèle à privilégier pour les messages vocaux et d’accueil, les annonces et les voix off.
swift Temps réel et batch
Diffuse l’audio pendant que le texte est encore en cours d’écriture, avec un premier son en moins d’une seconde. Conçu pour les voicebots et les conversations en direct.
Un vrai dialecte
Le texte en allemand standard est transposé dans le dialecte de votre choix. Le haut allemand suisse et les autres variantes conservent les mots exactement tels qu’ils sont écrits.
Nombres et dates à la suisse
Numéros de téléphone groupés en 3-3-2-2 et lus en dialecte. Dates, heures et montants en CHF sous leur forme orale.
Un balisage qui fonctionne vraiment
Pauses, accentuation, débit, hauteur de voix, codes épelés et changements de langue dans un même texte. Un balisage non pris en charge est refusé, jamais ignoré.
Le style en langage naturel
Décrivez la diction, par exemple «calme et patient, courtes pauses après chaque phrase». Les mots eux-mêmes sont toujours lus tels qu’ils sont écrits.
Tous les formats dont vous avez besoin
MP3, WAV, Opus, PCM16 brut, et G.711 µ-law ou A-law à 8 kHz pour les lignes téléphoniques.
Textes longs sous forme de tâches
Soumettez un chapitre et récupérez l’audio quand il est prêt, avec un callback signé si vous le souhaitez.
Prononcer une phrase en bernois
curl -X POST https://api.suisse-speech.ch/v1/tts \
-H "X-API-Key: $SUISSE_SPEECH_KEY" \
-H "Content-Type: application/json" \
-d '{"text": "Ihr Termin am Dienstag um zehn Uhr ist bestätigt.",
"model": "studio", "voice": "lea",
"language": "de-CH", "dialect": "bern", "format": "mp3"}' \
--output termin.mp3Diffuser une réponse pendant que votre bot l’écrit encore
import WebSocket from 'ws';
const ws = new WebSocket('wss://api.suisse-speech.ch/v1/tts/stream', {
headers: { 'X-API-Key': process.env.SUISSE_SPEECH_KEY },
});
ws.on('open', async () => {
ws.send(JSON.stringify({
type: 'session.start', model: 'swift', voice: 'anna',
language: 'de-CH', dialect: 'zurich',
format: 'pcm16', sample_rate_hz: 24000, transport: 'binary',
}));
for await (const chunk of llmReply) { // text as your LLM writes it
ws.send(JSON.stringify({ type: 'text.append', text: chunk }));
}
ws.send(JSON.stringify({ type: 'session.end' }));
});
ws.on('message', (data, isBinary) => {
if (isBinary) return player.write(data); // audio, in order
const frame = JSON.parse(data.toString()); // control frames
if (frame.type === 'session.complete') ws.close();
});Douze voix
Chaque voix parle toutes les langues et tous les dialectes pris en charge: une même persona peut ainsi mener toute une conversation.
Féminine
annachaleureuse et équilibrée, le choix par défaut pour le service clientveralumineuse et énergique, pour les menus courts et les messages vocauxleadouce et calme, pour les longues explications et la messagerie vocalenoraarticulation nette, conçue pour les lignes téléphoniques à bande étroitemiabienveillante et empathique, pour la santé et les sujets délicatselinneutre et régulière, pour les longs documents
Masculine
stefanneutre et professionnel, le pendant masculin d’annaretograve et posé, pour les annonces et les avislukasvif et direct, pour les appels de confirmation sortantsjonasample et assuré, pour les contenus audio institutionnelsandrinchaleureux et patient, pour le conseil, la vente et l’onboardingfelixexpressif et dynamique, suit fidèlement les consignes de style
Questions fréquentes
Dois-je écrire le texte en dialecte?
Non. Écrivez en allemand standard. Pour les dialectes suisses allemands, l’API transpose votre texte dans le dialecte, avec son vocabulaire et sa grammaire propres.
Quelle est la rapidité de la synthèse en temps réel?
Le premier son d’une réponse arrive généralement en une demi-seconde environ, et en moins d’une seconde pour le dialecte suisse allemand. La suite est diffusée au fur et à mesure de sa production.
Puis-je utiliser ma propre voix ou cloner une voix?
Pas pour le moment. Les douze voix du catalogue sont stables: une voix n’est jamais modifiée ni retirée sans préavis, si bien qu’un serveur vocal déployé garde toujours le même son.
Puis-je changer de langue au sein d’un même texte?
Oui, avec un élément de langue dans le balisage, par exemple pour prononcer un nom de produit anglais dans une phrase en bernois.
Faites l’essai avec vos propres enregistrements
Obtenez 60 minutes gratuites de reconnaissance et de synthèse vocales. Aucune carte de crédit requise.