Aller au contenu
Guides

Lire ce qui arrive

Comment OpenClaw transforme images, notes vocales et vidéos entrantes en texte court avant la chaîne de réponse, vers quels fournisseurs et quels outils locaux en ligne de commande il bascule, et où les limites de taille se font sentir

7 min de lecture

Une photo, une note vocale et un extrait de trente secondes arrivent tous à un assistant sous forme d’octets, et les octets se prêtent mal au routage. OpenClaw peut résumer les médias entrants avant que la chaîne de réponse ne démarre, afin que l’analyse des commandes et le routage travaillent sur un court texte. Le média d’origine parvient tout de même au modèle comme d’habitude, ce qui rend cette étape facultative de façon utile. Voici comment fonctionnent la sélection, les replis et les limites.

Ce que produit la compréhension

  • Pour chaque capacité activée, la chaîne collecte les faits ordonnés des médias entrants, sélectionne les pièces jointes selon la politique de pièces jointes, retient la première entrée de modèle éligible par taille, capacité et authentification disponible, et passe à la suivante dès qu’une entrée échoue ou dépasse son délai.
  • En cas de succès, le corps du message devient un bloc image, audio ou vidéo, l’audio pose en plus une valeur de transcription, et toute légende est conservée dans le bloc, l’analyse des commandes préférant le texte de la légende avant de se rabattre sur la transcription.
  • Les limites livrées sont de dix mégaoctets pour l’image, vingt pour l’audio et cinquante pour la vidéo, avec un plafond de cinq cents caractères sur les résumés d’image et de vidéo, soixante secondes de délai pour l’image et l’audio, cent vingt secondes pour la vidéo, et deux exécutions de capacité en parallèle.
  • Par défaut, seule la première pièce jointe correspondante est traitée, et choisir de toutes les traiter numérote les sorties pour que le modèle les distingue.
Le média d’origine est toujours remis au modèle comme d’habitude ; si la compréhension échoue ou est désactivée, le flux de réponse se poursuit sans changement.

Comment un modèle est choisi

Sans configuration, OpenClaw parcourt un ordre fixe et s’arrête à la première option qui fonctionne. Pour l’image, il commence par le modèle d’image configuré, sauf si le modèle de réponse actif gère déjà nativement la vision, auquel cas le bloc de résumé est sauté et l’image d’origine part directement au modèle. Vient ensuite le modèle de réponse actif lui-même, lorsque son fournisseur prend en charge la capacité concernée. Pour l’audio, les fournisseurs configurés passent avant tout binaire local, dans un ordre de priorité documenté qui commence par Groq et OpenAI, puis xAI, Deepgram, OpenRouter, Google et SenseAudio, Deepinfra et ElevenLabs, et enfin Mistral. Les outils locaux en ligne de commande n’interviennent qu’ensuite, et leur ordre dépend de ce que le processus a réellement observé plutôt que de ce qu’une compilation annonce, si bien qu’une version accélérée de whisper ne passe en tête qu’après avoir vu Metal ou CUDA lors d’une véritable invocation. La solution par défaut sur processeur occupe le milieu, Apple Silicon a son entrée propre, et la commande whisper en Python ferme la marche, avec le modèle turbo par défaut et un téléchargement automatique. L’image et la vidéo ont leurs propres listes de priorité, avec Anthropic et OpenAI en tête pour l’image et Google en tête pour la vidéo. Les égalités se départagent par ordre alphabétique d’identifiant de fournisseur, ce qui rend le comportement prévisible plutôt qu’accidentel.

Comportements à connaître

  • Les fichiers audio de moins de mille vingt-quatre octets sont considérés comme vides ou corrompus et écartés avant transcription, et l’agent reçoit une transcription de remplacement déterministe au lieu d’un échec.
  • Les appels de fournisseur pour l’audio et la vidéo respectent les variables d’environnement de proxy sortant, les formes en minuscules l’emportent sur les majuscules, et une valeur mal formée produit un avertissement et une requête directe plutôt qu’une panne, tandis que la compréhension d’image n’emprunte pas ce chemin.
  • Cinq marqueurs d’omission au maximum sont rendus par message, après quoi les pièces jointes ignorées se regroupent en un seul résumé neutre, de sorte qu’un tas de pièces jointes inutiles ne peut pas faire enfler l’invite sans fin.

La compréhension n’est qu’une étape parmi celles qui touchent aux fichiers entrants, et le tableau plus large des images, de l’audio et de la caméra sur un appareil est traité dans Images et médias. Les identifiants suivent la même résolution que les appels de modèle ordinaires, donc profils, variables d’environnement et clés de fournisseur configurées s’appliquent, et c’est Outils et fournisseurs personnalisés qui le consigne.

Pourquoi résumer

Résumer avant la chaîne de réponse relève davantage du routage que de la compréhension. L’analyse des commandes et le routage sont bien plus simples face à un court texte qu’à des octets bruts, et la pièce jointe d’origine est ensuite remise au modèle, si bien que rien n’est perdu. L’étape est volontairement au mieux, et les erreurs ne bloquent jamais une réponse, ce qui fait qu’un service de transcription capricieux dégrade l’expérience au lieu de faire tomber l’assistant. La même prudence se retrouve dans le budget d’invite, où le texte extrait des fichiers est encadré comme contenu externe non fiable, avec des marqueurs de frontière et une ligne de source, et où la longue bannière de sécurité est écartée exprès pour garder l’invite courte, un arbitrage qui se lit mieux à côté du reste de la pile média (Comment les outils média s’articulent). Chaque pièce jointe candidate se termine aussi par une disposition enregistrée, qu’elle ait été traitée, confiée à la vision native, écartée au-delà de la limite, désactivée, privée de modèle, refusée par la portée ou simplement en échec, sans zone d’ombre. Faire passer un grand modèle multimodal sur chaque extrait entrant n’est pas gratuit non plus, ce qui explique en partie des plafonds d’octets et de caractères prudents et une politique de pièces jointes limitée à un seul fichier (Les offres Diali). On obtient une étape que l’on élargit délibérément plutôt qu’une étape à laquelle il faut se fier à l’aveugle.

Sur Diali

Diali héberge OpenClaw hébergé sur Diali de sorte que chaque client dispose de son propre assistant, avec un état conservé sur un volume persistant ; des instantanés quotidiens et une restauration en un clic sont disponibles grâce à l’option Sauvegardes (incluse avec Max). Si vous cherchez à savoir ce que représenterait la compréhension des médias sur tous vos canaux, Les tarifs Diali est l’endroit à consulter.

  • Les résumés servent au routage ; le média d’origine atteint bien le modèle.
  • La détection essaie les modèles configurés, les fournisseurs, puis les binaires.
  • Plafonds livrés : dix, vingt et cinquante mégaoctets selon le type de média.
Commencer

Arrêtez de lire, construisez le vôtre

Configurez un agent, choisissez un canal, et faites-le travailler dans l’application que vous gardez déjà ouverte.