La synthèse vocale dans OpenClaw
Messages vocaux natifs, la matrice des fournisseurs, et pourquoi les réponses restent du texte par défaut
OpenClaw convertit les réponses sortantes en messages vocaux natifs sur Feishu, Matrix, Telegram et WhatsApp, et en pièce jointe audio sur tout autre canal ; la téléphonie et la conversation vocale reçoivent des flux audio bruts à la place. C’est la moitié sortie vocale du mode parole vers texte et texte vers parole de la conversation vocale, et elle est inactive tant qu’on ne la demande pas : la discussion ordinaire reste du texte jusqu’à ce qu’un utilisateur demande de l’audio, utilise la commande vocale, ou active la parole automatique. Voici le démarrage rapide, la matrice des fournisseurs, les personas et directives qui façonnent une voix, et la réserve sur la seule voix hébergée gratuite.
La synthèse vocale automatique est désactivée par défaut.
Démarrage rapide
- Choisissez un fournisseur : OpenAI et ElevenLabs sont les options hébergées les plus fiables, Microsoft et un moteur local en ligne de commande fonctionnent sans aucune clé.
- Exportez la clé du fournisseur, puis réglez la parole automatique sur toujours et nommez le fournisseur dans le bloc vocal de la configuration.
- Testez depuis la discussion : la commande d’état montre l’état courant, et la commande audio envoie une réponse parlée ponctuelle.
Les fournisseurs
Seize : Azure Speech, DeepInfra avec Kokoro par défaut, ElevenLabs avec clonage, voix multilingues et diffusion pour la lecture Discord, Fish Audio, Google Gemini en mode lot et sensible aux personas, Gradium, Inworld avec diffusion et notes Opus natives, une commande locale, les voix neuronales Edge de Microsoft, MiniMax, OpenAI qui gère aussi le résumé automatique et les instructions de persona, OpenRouter avec Kokoro, Volcengine, Vydra, xAI sans Opus natif, et Xiaomi. Avec plusieurs fournisseurs configurés, celui qui est sélectionné est utilisé en premier et les autres servent de repli, et le résumé automatique tourne sur son propre modèle, qui doit lui aussi être authentifié.
Comment cela se comporte
- Des notes vocales natives sur les quatre canaux qui les prennent en charge, des pièces jointes audio ailleurs, et des règles de transcodage par canal sur la page de sortie.
- Les personas : une identité parlée stable avec des liaisons de fournisseurs et une politique de repli, et des surcharges de voix par agent pour que deux assistants ne partagent pas une voix.
- Des directives dans une réponse, des commandes slash pour de l’audio ponctuel et des préférences par utilisateur, et un mode automatique qui peut résumer une longue réponse avant de la dire.
Les appels vocaux OpenClaw est le versant téléphonie, où la même synthèse devient un appel, et OpenClaw sur Telegram le canal où la plupart des gens l’entendent en premier.
La réserve Microsoft
Le fournisseur Microsoft embarqué utilise les voix neuronales en ligne d’Edge via une bibliothèque : un service web public sans SLA ni quota publiés, que la documentation dit de traiter comme du meilleur effort. L’ancien identifiant de fournisseur se normalise vers le nouveau et le docteur réécrit la configuration enregistrée. Le fichier de configuration d’OpenClaw est l’endroit où vit le bloc vocal.
Sur Diali
Sur Diali, les réglages vivent dans le tableau de bord plutôt que dans un fichier de configuration, et chaque assistant parle et transcrit les messages vocaux dès le départ, sans clé : les voix Edge pour la synthèse et un modèle Whisper exécuté sur l’instance pour la transcription, et une clé de fournisseur à vous le bascule sur ce fournisseur. OpenClaw hébergé sur Diali est l’assistant et Les tarifs de Diali liste ce que chaque offre inclut.
- Désactivée par défaut ; une intention explicite ou le mode automatique l’active.
- Seize fournisseurs, le gratuit au meilleur effort.
- Les personas gardent une voix par assistant.
Arrêtez de lire, construisez le vôtre
Configurez un agent, choisissez un canal, et faites-le travailler dans l’application que vous gardez déjà ouverte.
