Text-to-speech

La synthèse vocale en vrai suisse allemand

Écrivez en allemand standard, écoutez du Züritüütsch, du Bärndütsch, du Baaseldütsch ou du Lozärnerdütsch, avec le vocabulaire, la grammaire et la prononciation du dialecte. Diffusez l’audio en direct pour vos voicebots, ou produisez-le en qualité studio pour vos contenus préparés à l’avance.

Temps réel CHF 6.85 par heure d’audio, batch CHF 4.60 par heure. Facturation à la seconde.

Deux modèles, un seul catalogue de voix

studio Batch

La plus haute fidélité et la diction la plus naturelle. Le modèle à privilégier pour les messages vocaux et d’accueil, les annonces et les voix off.

swift Temps réel et batch

Diffuse l’audio pendant que le texte est encore en cours d’écriture, avec un premier son en moins d’une seconde. Conçu pour les voicebots et les conversations en direct.

Un vrai dialecte

Le texte en allemand standard est transposé dans le dialecte de votre choix. Le haut allemand suisse et les autres variantes conservent les mots exactement tels qu’ils sont écrits.

Nombres et dates à la suisse

Numéros de téléphone groupés en 3-3-2-2 et lus en dialecte. Dates, heures et montants en CHF sous leur forme orale.

Un balisage qui fonctionne vraiment

Pauses, accentuation, débit, hauteur de voix, codes épelés et changements de langue dans un même texte. Un balisage non pris en charge est refusé, jamais ignoré.

Le style en langage naturel

Décrivez la diction, par exemple «calme et patient, courtes pauses après chaque phrase». Les mots eux-mêmes sont toujours lus tels qu’ils sont écrits.

Tous les formats dont vous avez besoin

MP3, WAV, Opus, PCM16 brut, et G.711 µ-law ou A-law à 8 kHz pour les lignes téléphoniques.

Textes longs sous forme de tâches

Soumettez un chapitre et récupérez l’audio quand il est prêt, avec un callback signé si vous le souhaitez.

Prononcer une phrase en bernois

POST /v1/tts
curl -X POST https://api.suisse-speech.ch/v1/tts \
  -H "X-API-Key: $SUISSE_SPEECH_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text": "Ihr Termin am Dienstag um zehn Uhr ist bestätigt.",
       "model": "studio", "voice": "lea",
       "language": "de-CH", "dialect": "bern", "format": "mp3"}' \
  --output termin.mp3

Diffuser une réponse pendant que votre bot l’écrit encore

wss://api.suisse-speech.ch/v1/tts/stream
import WebSocket from 'ws';

const ws = new WebSocket('wss://api.suisse-speech.ch/v1/tts/stream', {
  headers: { 'X-API-Key': process.env.SUISSE_SPEECH_KEY },
});

ws.on('open', async () => {
  ws.send(JSON.stringify({
    type: 'session.start', model: 'swift', voice: 'anna',
    language: 'de-CH', dialect: 'zurich',
    format: 'pcm16', sample_rate_hz: 24000, transport: 'binary',
  }));
  for await (const chunk of llmReply) {      // text as your LLM writes it
    ws.send(JSON.stringify({ type: 'text.append', text: chunk }));
  }
  ws.send(JSON.stringify({ type: 'session.end' }));
});

ws.on('message', (data, isBinary) => {
  if (isBinary) return player.write(data);   // audio, in order
  const frame = JSON.parse(data.toString());  // control frames
  if (frame.type === 'session.complete') ws.close();
});

Douze voix

Chaque voix parle toutes les langues et tous les dialectes pris en charge: une même persona peut ainsi mener toute une conversation.

Féminine

  • anna chaleureuse et équilibrée, le choix par défaut pour le service client
  • vera lumineuse et énergique, pour les menus courts et les messages vocaux
  • lea douce et calme, pour les longues explications et la messagerie vocale
  • nora articulation nette, conçue pour les lignes téléphoniques à bande étroite
  • mia bienveillante et empathique, pour la santé et les sujets délicats
  • elin neutre et régulière, pour les longs documents

Masculine

  • stefan neutre et professionnel, le pendant masculin d’anna
  • reto grave et posé, pour les annonces et les avis
  • lukas vif et direct, pour les appels de confirmation sortants
  • jonas ample et assuré, pour les contenus audio institutionnels
  • andrin chaleureux et patient, pour le conseil, la vente et l’onboarding
  • felix expressif et dynamique, suit fidèlement les consignes de style

Questions fréquentes

Dois-je écrire le texte en dialecte?

Non. Écrivez en allemand standard. Pour les dialectes suisses allemands, l’API transpose votre texte dans le dialecte, avec son vocabulaire et sa grammaire propres.

Quelle est la rapidité de la synthèse en temps réel?

Le premier son d’une réponse arrive généralement en une demi-seconde environ, et en moins d’une seconde pour le dialecte suisse allemand. La suite est diffusée au fur et à mesure de sa production.

Puis-je utiliser ma propre voix ou cloner une voix?

Pas pour le moment. Les douze voix du catalogue sont stables: une voix n’est jamais modifiée ni retirée sans préavis, si bien qu’un serveur vocal déployé garde toujours le même son.

Puis-je changer de langue au sein d’un même texte?

Oui, avec un élément de langue dans le balisage, par exemple pour prononcer un nom de produit anglais dans une phrase en bernois.

Faites l’essai avec vos propres enregistrements

Obtenez 60 minutes gratuites de reconnaissance et de synthèse vocales. Aucune carte de crédit requise.