Transcriptions vocales Discord et notes de réunion dans OpenClaw
La capture explicite, ce que l’enregistrement accorde et n’accorde pas, la chaîne par lot et ses limites, et le bot de prise de notes piloté par l’occupation
La présence et l’enregistrement sont deux décisions dans la prise en charge vocale Discord d’OpenClaw. L’adhésion automatique contrôle où se trouve le bot et s’il converse ; elle ne démarre pas d’enregistrement durable. La capture démarre explicitement, avec l’outil d’agent de transcriptions ou une source à démarrage automatique configurée, et la documentation est précise sur ce qu’un enregistrement accorde et n’accorde pas. Voici comment la capture s’attache, la frontière des permissions, la chaîne par lot et son repli, les limites, la sémantique des adhésions et des arrêts, et la recette de notes de réunion.
Démarrer la capture
- Un agent autorisé démarre la capture par une action de démarrage nommant le fournisseur, le compte, la guilde et le canal ; la capture s’abonne à cette cible exacte jusqu’à l’arrêt, s’attache à une connexion vocale correspondante existante sans changer la propriété de la conversation ni de l’occupation, attend pendant les salons vides quand la cible est une adhésion automatique gérée par l’occupation, suit la récupération de connexion du même canal, et ne déplace jamais une connexion vers un autre canal.
- L’enregistrement enregistre les participants indépendamment de l’accès aux commandes : les utilisateurs et rôles de guilde et de canal, les propriétaires de commandes et les filtres par mot d’éveil contrôlent toujours la conversation, les outils et les contrôles d’exécution active, et l’enregistrement n’en accorde aucun. La parole pendant une lecture protégée est enregistrée sans interrompre la lecture ni déclencher de réponse, et quelqu’un qui parle déjà quand l’abonnement démarre est enregistré sans entrée conversationnelle jusqu’à ce qu’un nouveau flux de réception commence.
- Une couverture complète exige la compréhension audio par lot : un flux audio par locuteur et une transcription par lot avec l’identifiant d’utilisateur du récepteur, une étiquette d’affichage résolue indépendamment et l’heure d’entrée de l’audio ; les locuteurs autorisés peuvent aussi alimenter la conversation temps réel depuis le même audio décodé, l’enregistrement continue quand les connexions temps réel sont occupées, et la parole continue est découpée en envois bornés qui sont des segments d’une même session, pas des réunions séparées.
- Les configurations en temps réel seul peuvent enregistrer le texte final de leurs connexions actives par locuteur quand la transcription par lot est désactivée, mais cette route limitée ne couvre que les locuteurs admis à la conversation et ne peut pas produire de texte de repli pour une entrée mixte, un audio échoué ou trop volumineux ou des réinitialisations de continuité, si bien que la commande d’état montre un avertissement de couverture et renvoie les opérateurs vers la configuration de la transcription audio ; démarrer la capture avec la compréhension audio désactivée exige une conversation temps réel active.
Prévenez les participants que le bot capture et stocke des transcriptions avant de l’activer.
Limites, adhésions, arrêts
L’autorisation de conversation et les réponses tournent séparément de l’enregistrement : chaque connexion vocale permet huit requêtes vocales inachevées avec au plus un mébioctet d’audio décodé en attente d’admission par requête, les requêtes par lot gardent au plus un mébioctet de texte de transcription et mille segments, atteindre une limite abandonne cette requête vocale tandis que l’enregistrement continue, et le travail d’enregistrement en attente est plafonné à l’échelle du processus de la passerelle à 128 morceaux et 64 mébioctets d’audio, un budget qui survit aux reconnexions. Si la transcription ou l’enregistrement des notes ne suit pas, le flux de réception concerné s’arrête tandis que la capture reste enregistrée ; une transcription échouée ou omise, un morceau qui a perdu l’accès aux commandes ou un fragment abandonné sous la durée minimale laisse les notes réussies enregistrées mais ne déclenche pas de réponse, et une transcription terminée sans texte est admise. Sans cible d’adhésion automatique ni conversation active dans cette guilde, une capture manuelle rejoint en silence en mode transcription seule et une commande de rejoindre ultérieure active la conversation sur cette connexion ; une capture pour un autre canal reste enregistrée sans prendre le dessus. L’arrêt utilise l’action d’arrêt de l’outil avec l’identifiant de session renvoyé, fonctionne hors connexion, ne déconnecte jamais une connexion possédée par la conversation, révoque la publication en attente pour que l’ancien audio ne puisse pas entrer dans une nouvelle capture, et démarrer une nouvelle capture pour la même source transfère l’abonnement sans reconnexion. La capture continue peut couvrir plusieurs occupations du salon jusqu’à l’arrêt, et les résumés ne sont jamais publiés automatiquement sur Discord.
Notes de réunion
- La recette garde un bot de prise de notes dans un salon vocal seulement tant que des humains sont présents : activez la voix Discord, configurez un fournisseur de reconnaissance vocale authentifié sous les modèles de médias avec l’audio activé, et ajoutez une source à démarrage automatique pilotée par l’occupation nommant le fournisseur, la guilde et le canal ; le bot a besoin de la permission de connexion et de l’intention des états vocaux, le canal doit se trouver dans toute liste de canaux autorisés, et la recette utilise le démarrage automatique des transcriptions, pas l’adhésion automatique conversationnelle.
- Avec plusieurs comptes, un identifiant de compte choisit le bot vocal, et au plus une entrée pilotée par l’occupation par compte et par guilde est honorée, puisque le bot ne peut pas capturer deux canaux dans une même guilde. Le bot rejoint à l’arrivée d’un humain, y compris un salon déjà occupé au démarrage, attend trente secondes après le départ du dernier humain avant de quitter et de générer les notes, et une session arrêtée depuis moins de dix minutes peut rouvrir pour la même source après un redémarrage ou une courte coupure en préservant son identifiant, son heure de début et ses interventions.
- Les notes comprennent les participants, un aperçu, les décisions, les actions et les risques, générées avec le modèle utilitaire de l’agent, en repli sur son modèle principal puis sur des notes heuristiques déterministes ; les notes stockées se lisent avec l’outil de transcriptions, la CLI ou la page des réunions de l’interface de contrôle, et une action de résumé les régénère à partir de la transcription stockée.
OpenClaw dans les salons vocaux Discord couvre le côté conversationnel auquel ces captures peuvent s’attacher, et OpenClaw sur Discord le canal et ses intentions.
Pourquoi la séparation
Garder l’enregistrement à part de l’autorisation de conversation signifie qu’un salon peut être transcrit fidèlement même quand seuls certains locuteurs peuvent parler à l’agent, et qu’un enregistrement ne devient jamais une porte dérobée vers les outils ou les exécutions actives. La mémoire d’OpenClaw expliquée est là où les connaissances durables issues des réunions peuvent ensuite être promues, et Modèles et fournisseurs d’OpenClaw les modèles utilitaire et principal sur lesquels les notes se replient.
Sur Diali
Sur Diali, les notes de réunion atterriraient dans le magasin de transcriptions de l’assistant sur son volume, et le même point de consentement s’applique : prévenez le salon avant que le bot écoute. OpenClaw hébergé sur Diali est l’assistant et La sécurité chez Diali décrit la frontière autour de ce magasin.
- La capture est explicite ; l’adhésion automatique n’est que la présence.
- L’enregistrement n’accorde rien ; la conversation reste autorisée à part.
- Trente secondes de grâce, puis les notes.
Arrêtez de lire, construisez le vôtre
Configurez un agent, choisissez un canal, et faites-le travailler dans l’application que vous gardez déjà ouverte.
