La récupération web d’OpenClaw
Ce que l’outil renvoie, la chaîne d’extraction et de cache, le repli Firecrawl, et la garde du réseau privé
Quand un agent OpenClaw lit une page, il passe en général par l’outil de récupération web : un simple GET HTTP suivi d’une extraction du contenu lisible en markdown ou en texte. La documentation pose la frontière dès le premier paragraphe : il n’exécute pas de JavaScript, et les pages riches en JS ou protégées par connexion relèvent de l’outil navigateur. Il est actif par défaut sans configuration. Voici ce qu’il prend et renvoie, la chaîne, la configuration et les limites, le fournisseur de repli, et les règles de sûreté.
Paramètres et résultat
- Trois paramètres : l’URL, en http ou https seulement ; le mode d’extraction, markdown par défaut ou texte ; et un plafond de caractères borné par le plafond dur configuré, vingt mille par défaut.
- Le résultat est une structure fermée : des métadonnées de requête comme l’URL, l’URL finale après redirections, l’état et l’extracteur ; le type de contenu, le titre et un avertissement facultatifs ; et le contenu enveloppé avec sa longueur, sa longueur brute, l’heure de récupération, la durée, l’indicateur de troncature et le texte.
- Un accès au cache est marqué ; un contenu tronqué peut être déversé dans un fichier temporaire privé dont le chemin revient dans le résultat. Les titres et avertissements gardent au plus 256 caractères chacun et partagent une petite allocation avec le corps, et une URL de redirection de plus de 2 048 caractères retombe sur l’URL demandée.
- La chaîne : récupérer avec un agent utilisateur de type Chrome et un en-tête de langue, en bloquant les noms d’hôte privés et internes et en revérifiant les redirections ; lancer Readability sur le HTML ; si cela échoue et qu’un fournisseur est disponible, réessayer par lui ; mettre le résultat en cache quinze minutes.
Il n’exécute pas de JavaScript.
Configuration et limites
Le bloc de configuration fixe le fournisseur, les nombres de caractères par défaut et maximal, le plafond d’octets de réponse de 750 000 par défaut dans une plage fixe, un délai de trente secondes, la durée de vie du cache, trois redirections au plus, l’exécution ou non de Readability, un agent utilisateur de remplacement, des en-têtes personnalisés, et une politique SSRF. Cette politique bloque les cibles privées et internes, offre une liste d’autorisation d’hôtes exacts pour des noms internes de confiance, une liste d’hôtes bloqués avec sous-domaines génériques appliquée avant le DNS et sur les redirections, une large option d’ouverture au réseau privé que la documentation dit de laisser fermée sauf si les URL choisies par le modèle sont de confiance, et deux options étroites pour les piles de proxy à fausses IP. Mettre la durée de vie du cache à zéro contourne le cache en lecture et en écriture. Une ligne de progression n’apparaît que quand une récupération est encore en attente après cinq secondes, et l’annulation est transmise aux fournisseurs, les résultats tardifs étant rejetés.
Le repli Firecrawl
- Si Readability échoue, l’outil peut se replier sur Firecrawl pour le contournement des protections anti-robots et une meilleure extraction ; le fournisseur est choisi explicitement ou détecté automatiquement depuis les identifiants configurés, et l’extension Firecrawl officielle est le repli qui existe aujourd’hui.
- La clé d’API est facultative, l’accès de démarrage sans clé fonctionne, et elle accepte des références de secrets ; mais une référence non résolue sans repli d’environnement fait échouer rapidement le démarrage de la passerelle, et l’URL de base est verrouillée, trafic hébergé vers le point d’accès officiel et remplacements auto-hébergés seulement vers des points d’accès privés ou internes.
- Les appels de récupération en bac à sable autorisent les fournisseurs intégrés plus ceux installés à provenance officielle vérifiée ; si Readability est désactivé, l’outil passe directement au fournisseur, et sans fournisseur disponible il échoue de façon fermée.
La recherche web d’OpenClaw est l’outil jumeau qui trouve la page, et L’outil navigateur d’OpenClaw celui vers lequel la documentation vous envoie quand la récupération ne suffit pas.
En-têtes et proxy de confiance
Les en-têtes personnalisés existent pour les déploiements qui ont besoin de métadonnées de routage ou d’injection de service sur les récupérations sortantes ; chaque valeur est traitée comme sensible et expurgée, envoyée seulement sur la requête directe et jamais à un fournisseur de repli, validée à la construction de la requête pour qu’une mauvaise entrée soit abandonnée et journalisée tandis que les autres s’appliquent, les noms propres au contrat de récupération, les noms de cadrage et les jetons invalides étant toujours abandonnés et une liste d’autorisation sûre appliquée quand une redirection change d’origine. Le mode proxy d’environnement de confiance garde les vérifications de nom d’hôte mais laisse un proxy contrôlé par l’opérateur résoudre le DNS. Les secrets dans OpenClaw explique la syntaxe de référence que la clé du fournisseur accepte.
Sur Diali
Sur Diali, les deux outils sont livrés activés, la récupération pour les pages qui se lisent comme des documents et le navigateur pour le reste, et le blocage du réseau privé reste à sa valeur par défaut. OpenClaw hébergé sur Diali est l’assistant.
- Un GET, Readability, un fournisseur facultatif, un cache de quinze minutes.
- Vingt mille caractères par défaut ; le plafond dur l’emporte.
- Les hôtes privés sont bloqués, et l’option d’ouverture reste fermée.
Arrêtez de lire, construisez le vôtre
Configurez un agent, choisissez un canal, et faites-le travailler dans l’application que vous gardez déjà ouverte.
