OpenClaw dans les salons vocaux Discord
La liste de configuration, rejoindre, l’adhésion automatique et les listes de résidence, les trois modes vocaux, GPT-Live face aux tours contrôlés par l’hôte, les mots d’éveil, l’interruption, et les connexions par locuteur
Un salon vocal est un tout autre animal qu’un chat : de l’audio continu, plusieurs locuteurs, des interruptions, et une lecture qui ne doit pas se parler par-dessus elle-même. L’extension Discord d’OpenClaw prend en charge les salons vocaux en temps réel ainsi que le format séparé des pièces jointes de messages vocaux. La page de documentation des salons vocaux est longue et dense ; voici la liste de configuration et les commandes, la configuration, les trois modes de conversation et la route GPT-Live, la correspondance entre locuteurs et sessions, les mots d’éveil et l’interruption, et les règles d’occupation et de résidence.
Configuration, commandes, réglages
- Six étapes : activer l’intention de contenu des messages, activer l’intention des membres du serveur quand des listes de rôles ou d’utilisateurs sont utilisées, inviter le bot avec les portées de bot et de commandes d’application, accorder connexion, parole, envoi de messages et lecture de l’historique dans le salon vocal cible, activer les commandes natives, et configurer le bloc vocal. Les commandes pour rejoindre, consulter l’état et quitter sont des commandes slash tapées dans Discord, utilisent l’agent par défaut du compte et suivent les mêmes règles de liste et de politique de groupe que les autres commandes, et une vérification des capacités sur la cible du canal montre les permissions effectives du bot avant de rejoindre.
- La voix est facultative pour les configurations en texte seul : l’activer met en route les commandes, l’environnement vocal et l’intention des états vocaux. La configuration porte un indicateur d’activation, un modèle facultatif qui surcharge le cerveau de l’agent pour les réponses vocales, des entrées d’adhésion automatique avec une guilde, un canal et un indicateur d’occupation, une liste de résidence des canaux autorisés, le chiffrement DAVE et la tolérance aux échecs de déchiffrement transmis à la bibliothèque vocale, des délais de connexion et de reconnexion, et un bloc temps réel avec un fournisseur, un modèle et une voix de locuteur.
- Discord peut utiliser le même modèle et la même voix GPT-Live que les autres surfaces vocales, en partageant la résolution du fournisseur, la délégation native et la politique d’interruption tout en gardant son propre transport ; les configurations non épinglées gardent le défaut du fournisseur, donc GPT-Live se choisit explicitement, avec la route Codex après une connexion au fournisseur et la route de l’API publique avec ses propres voix prises en charge, et le modèle et la voix doivent appartenir à la même route. GPT-Live possède le rythme des réponses et l’interruption, joue l’audio en continu sans attendre un événement de réponse terminée, garde le micro admis pendant la lecture pour entendre lui-même les interruptions, et rejette au démarrage le filtrage par mot d’éveil imposé par l’hôte ou une consultation forcée avant chaque réponse.
- L’adhésion automatique avec l’occupation activée garde le bot dans un salon seulement tant qu’au moins un humain est présent, en rejoignant à la première arrivée et en quittant après le dernier départ, les bots n’étant pas comptés et le démarrage se réconciliant depuis la liste des états vocaux de Discord ; la gestion de l’occupation ne possède que les sessions qu’elle a rejointes, donc les adhésions manuelles, les sessions de transcription seule et les sessions de suivi sont laissées tranquilles. La liste des canaux autorisés restreint les adhésions, les adhésions automatiques et les déplacements aux entrées listées, une liste vide refuse toute adhésion, et un bot déplacé hors de la liste quitte et rejoint sa cible configurée.
Discord a deux surfaces vocales distinctes : les salons vocaux en temps réel (conversations continues) et les pièces jointes de messages vocaux (le format d’aperçu en forme d’onde).
Modes, locuteurs, sessions
Trois modes : mandataire d’agent, le défaut, où une façade vocale temps réel gère le rythme des tours, l’interruption et la lecture et délègue le travail de fond à l’agent OpenClaw routé par un outil de consultation, en traitant le résultat comme un prompt tapé par ce locuteur ; STT-TTS, l’ancien flux de transcription par lot plus synthèse vocale ; et bidirectionnel, où le modèle temps réel converse directement tout en exposant l’outil de consultation pour le cerveau OpenClaw. L’audio de chaque locuteur a sa propre connexion au fournisseur pour que les transcriptions différées et les appels d’outils gardent l’identité Discord de ce locuteur, tout le monde partage une conversation d’agent routée et une file de lecture par salon, le salon retient au plus huit connexions de locuteurs et récupère les inactives, et une connexion de locuteur échouée laisse les autres connectées. Une cible de session d’agent peut faire d’un salon vocal le micro et le haut-parleur d’une session de canal texte existante, comme un canal des mainteneurs, si bien que les tours vocaux utilisent la session et l’agent routés de ce canal. Le mode mandataire cache l’outil TTS propre à l’agent parce que Discord possède la lecture, donne par défaut aux locuteurs propriétaires un accès aux outils équivalent à celui du propriétaire, et avec des tours contrôlés par l’hôte préfère fortement consulter l’agent avant les réponses de fond, en mettant en file les réponses exactes ultérieures jusqu’à ce que la lecture soit inactive plutôt que de couper une phrase.
Mots d’éveil, interruption, profils
- Dans le mode mandataire OpenAI, le filtrage par mot d’éveil s’adapte au salon : un humain parle naturellement, deux ou plus doivent commencer ou finir un tour par un mot d’éveil, les bots ne comptent pas, un réglage explicite l’impose toujours ou jamais, les noms configurés doivent faire un ou deux mots et valent par défaut le nom de l’agent plus OpenClaw, et un filtre actif désactive la réponse automatique du fournisseur, route les tours acceptés par le chemin de consultation et prononce un court accusé quand un mot d’éveil exact en tête est reconnu depuis une transcription partielle, tandis que la correspondance floue attend la transcription finale.
- Pour les modèles à réponses, un réglage d’interruption décide si une entrée audible du micro interrompt la lecture, les paquets silencieux et les notifications de prise de parole seuls ne le font jamais, une durée minimale de lecture de 250 millisecondes avant troncature protège contre l’écho et peut être relevée pour les salons à fort écho ou mise à zéro pour une interruption immédiate, et GPT-Live ignore les deux parce qu’il possède l’interruption. L’audio temps réel est mis en tampon quand la lecture Discord prend du retard, chaque réponse du fournisseur garde son propre audio y compris les continuations d’outils natifs, et les interruptions tronquent l’audio retenu à la quantité consommée par Discord.
- Les modes temps réel injectent par défaut les petits fichiers de profil d’identité, d’utilisateur et d’âme dans les instructions du fournisseur pour que les tours directs rapides gardent le même personnage, configurable à un sous-ensemble ou à rien, le fichier des agents restant dans le contexte normal de l’agent et l’outil de consultation possédant toujours le travail sur l’espace de travail, les faits, la mémoire et les actions d’outils. Rejoindre envoie à la session routée un événement de liste silencieux, les arrivées et départs ultérieurs la mettent à jour sans réponse parlée, les noms d’affichage sont des étiquettes non fiables, les tours vocaux et les commandes prennent le statut de propriétaire des propriétaires de commandes Discord, et le codec Opus WebAssembly intégré gère la réception et la lecture sans modules natifs.
OpenClaw sur Discord est le canal auquel cette surface vocale appartient, et Transcriptions vocales Discord et notes de réunion la capture séparée en écoute seule qui peut partager la même connexion.
Choisir un mode
Le mode mandataire est le défaut parce qu’il garde l’agent OpenClaw comme cerveau et le modèle temps réel comme bouche ; le bidirectionnel échange cela contre la vitesse avec l’outil de consultation en réserve ; STT-TTS est le repli pour les fournisseurs sans temps réel. Suivre des utilisateurs dans la voix Discord couvre le mode où le bot suit des utilisateurs choisis au lieu de rester dans un salon fixe, et Modèles et fournisseurs d’OpenClaw les fournisseurs derrière le cerveau et la façade temps réel.
Sur Diali
Sur Diali, le bot Discord se connecte depuis le tableau de bord ; la surface vocale temps réel a besoin du bloc vocal et d’un fournisseur temps réel, ce qui n’est pas un interrupteur du tableau de bord aujourd’hui, donc considérez-la comme une fonction autogérée en attendant. OpenClaw hébergé sur Diali est l’assistant et La sécurité chez Diali décrit la frontière dans laquelle la façade vocale se placerait.
- Six étapes, trois commandes, trois modes.
- Une connexion au fournisseur par locuteur, une file de lecture par salon.
- Les mots d’éveil s’adaptent au nombre de têtes ; GPT-Live possède l’interruption.
Arrêtez de lire, construisez le vôtre
Configurez un agent, choisissez un canal, et faites-le travailler dans l’application que vous gardez déjà ouverte.
