Aller au contenu
Guides

Suivre des utilisateurs dans la voix Discord avec OpenClaw

Une résidence qui suit des personnes choisies, les trois modes d’adhésion, la chaîne STT-TTS, les sessions et cibles du mode mandataire, le contrôle d’exécution en direct par la voix, et le réglage de l’interruption dans les salons à fort écho

6 min de lecture

Pour une configuration personnelle ou d’opérateur, le comportement vocal naturel est que le bot soit là où vous êtes. Le mode de suivi d’OpenClaw fait suivre par le bot vocal Discord les utilisateurs choisis quand ils changent de salon vocal, en rejoignant quand un utilisateur suivi rejoint un canal autorisé, en se déplaçant quand il se déplace, et en quittant quand il se déconnecte. Voici la configuration et ses règles, la comparaison avec les autres modes d’adhésion, la chaîne audio, la correspondance entre sessions vocales et sessions d’agent et cibles, ce qu’une exécution déléguée comprend quand vous lui parlez, et le réglage pour les salons qui entendent leur propre lecture.

Règles de suivi

  • La liste des utilisateurs suivis accepte des identifiants Discord bruts ou préfixés et normalise les deux ; l’indicateur d’activation vaut vrai par défaut quand la liste est configurée et peut être mis à faux pour garder la liste sans suivi automatique ; et la liste ne contrôle que la résidence vocale, sans accorder d’accès de locuteur ni d’autorité de propriétaire, qui viennent des propriétaires de commandes et des utilisateurs et rôles de guilde ou de canal.
  • Si plusieurs utilisateurs suivis sont dans une même guilde et que l’actif s’en va, le bot se déplace vers le canal d’un autre utilisateur suivi avant de quitter la guilde, et quand plusieurs se déplacent en même temps, le dernier événement d’état vocal observé l’emporte ; la liste des canaux autorisés s’applique toujours, donc un utilisateur suivi dans un canal non autorisé est ignoré et la session passe à un autre ou quitte.
  • Les événements d’état vocal manqués sont réconciliés au démarrage et à intervalle borné, en échantillonnant les guildes configurées et en plafonnant les consultations REST par passe, si bien que de très grandes listes peuvent mettre plus d’un intervalle à converger ; un bot déplacé par Discord ou un administrateur reconstruit sa session et garde la propriété du suivi quand la destination est autorisée, et une récupération de chiffrement qui quitte et rejoint le même canal la garde aussi.
  • Trois modes d’adhésion : le suivi pour les configurations personnelles ou d’opérateur où le bot doit être en voix quand vous l’êtes, l’adhésion automatique pour les salons fixes avec l’indicateur d’occupation quand le bot ne doit être présent que tant que des humains le sont, et la commande manuelle pour les salons ponctuels où une présence automatique surprendrait.
followUsers ne contrôle que la présence vocale. Il n’accorde ni accès de locuteur ni autorité de propriétaire ; configurez commands.ownerAllowFrom et les utilisateurs et rôles de guilde ou de canal séparément.

Chaîne et sessions

La réception vocale décode avec le codec Opus WebAssembly intégré, la lecture temps réel encode du PCM stéréo brut à 48 kilohertz en Opus avec le même paquet, et la lecture de fichiers ou de flux de fournisseurs transcode d’abord par ffmpeg. Dans la chaîne STT-TTS, le PCM capturé devient un fichier WAV temporaire, le réglage audio des médias gère la transcription, la capture par lot respecte la plus grande limite d’entrée audio applicable et arrête les captures trop volumineuses avec un avertissement plutôt que de transcrire un audio partiel, la transcription passe par l’entrée et le routage Discord tandis que le modèle de réponse tourne sous une politique de sortie vocale qui cache l’outil TTS de l’agent et demande du texte, le modèle vocal ne surcharge que ce modèle de réponse, et le bloc TTS vocal est fusionné par-dessus le bloc global, les fournisseurs en flux alimentant directement le lecteur. Sans bloc de session d’agent, chaque salon vocal reçoit sa propre session routée, le modèle temps réel n’est que la façade, les requêtes de fond vont à l’agent configuré, et une transcription finale produite sans l’outil de consultation force la consultation en repli. Une cible d’identifiant de canal ou l’identifiant nu route la voix par la session de ce canal texte, et une forme de message privé ou d’utilisateur par cette session de message privé, l’agent superviseur restant libre d’utiliser ses outils de message, y compris envoyer un message Discord séparé quand c’est la bonne action.

Contrôle d’exécution et écho

  • Tant qu’une exécution déléguée est active, les transcriptions vocales autorisées aux commandes sont traitées comme contrôle d’exécution en direct avant de démarrer un autre tour : des phrases comme état, annule ça, utilise le correctif plus petit, ou quand tu as fini vérifie aussi les tests sont classées comme état, annulation, pilotage ou suite, et l’issue est répétée à voix haute pour que l’appelant sache si elle a été traitée ; une consultation annulée enregistre une annulation plutôt qu’un échec, les appels d’outils tardifs du fournisseur reçoivent la même annulation terminale, et la session reste disponible pour la requête suivante.
  • Pour un modèle qui entend sa propre lecture par un micro ouvert, l’exemple à fort écho empêche le fournisseur de s’interrompre automatiquement sur l’audio brut en entrée tandis que l’interruption laisse les événements de prise de parole Discord et l’audio de locuteur actif annuler les réponses, et un seuil minimal de fin d’audio, cinq cents millisecondes dans l’exemple, traite les signaux très précoces comme un écho probable pour que le modèle ne soit pas coupé à la première image de lecture.
  • La documentation liste les lignes de journal attendues : l’adhésion avec la voix, le superviseur, le mode de session et les modèles ; le pont temps réel qui démarre avec ses indicateurs de réponse automatique, d’interruption et de coupure ; les tours de locuteurs qui s’ouvrent et se ferment avec les comptes d’octets ; la parole périmée sautée avec sa raison ; la lecture qui se termine, se met en tampon et s’arrête ; les consultations demandées et répondues ; la parole exacte mise en file et retirée quand le lecteur est inactif ; la coupure détectée et demandée ; et les interruptions du modèle demandées, tronquées, confirmées ou ignorées comme écho.

OpenClaw dans les salons vocaux Discord est la surface vocale complète dans laquelle ces modes vivent, et OpenClaw sur Discord le canal et les intentions dont il a besoin.

La voix comme surface de contrôle

L’intérêt du mode de suivi n’est pas le suivi mais ce qu’il permet : un agent qui est dans le salon quand vous y êtes, que vous pouvez piloter, annuler ou interroger en cours d’exécution en parlant, et dont les réponses reviennent dans le même salon. Piloter une exécution OpenClaw en cours est l’équivalent texte de ces phrases de contrôle d’exécution parlées, et Les sessions d’OpenClaw explique les sessions routées qu’une forme de cible sélectionne.

Sur Diali

Sur Diali, le mode de suivi fait partie du même bloc vocal autogéré que le reste de la voix Discord, tandis que le bot Discord lui-même se connecte depuis le tableau de bord ; les règles de résidence s’appliqueraient telles quelles une fois la voix activée. OpenClaw hébergé sur Diali est l’assistant et La sécurité chez Diali décrit la frontière qui l’entoure.

  • Suivi, adhésion automatique ou manuelle : trois façons d’entrer dans un salon.
  • La résidence n’accorde rien ; les propriétaires et les rôles décident toujours.
  • État, annulation, pilotage et suite, tout à la voix.
Commencer

Arrêtez de lire, construisez le vôtre

Configurez un agent, choisissez un canal, et faites-le travailler dans l’application que vous gardez déjà ouverte.