Ibou.io operates a crawler named IbouBot. It discovers publicly accessible pages and indexes them for our search engine, so that readers can find them and so that the people who published them get real visitors back. Every answer we produce cites its sources and links to them. We build the whole chain ourselves — crawling, indexing, ranking — and we do not train AI models with the data.
Ibou.io exploite un crawler nommé IbouBot. Il découvre les pages publiquement accessibles et les indexe pour notre moteur de recherche, afin que les lecteurs les trouvent et que celles et ceux qui les ont publiées reçoivent en retour une audience réelle. Chaque réponse que nous produisons cite ses sources et renvoie vers elles. Nous maîtrisons toute la chaîne — crawl, indexation, classement — et nous n'entraînons aucun modèle d'IA avec ces données.
How we crawl is not an afterthought: it is one of the commitments of our manifesto. Crawl with respect for infrastructures, follow robots.txt, keep our rate low enough that we never harm a server, and listen when a site wants to be crawled differently. A search engine that gives nothing back to the people who feed it dries up its own source. The rest of this page is how we hold ourselves to that.
Notre façon d'explorer le web n'est pas un détail réglé après coup : c'est l'un des engagements de notre manifeste. Explorer dans le respect des infrastructures, suivre robots.txt, garder un rythme assez bas pour ne jamais nuire à un serveur, et être à l'écoute d'un site qui souhaite être exploré différemment. Un moteur qui ne rend rien à ceux qui l'alimentent tarit sa propre source. Le reste de cette page décrit comment nous nous y tenons.
IbouBot crawls URLs found on public pages, and may therefore visit any page that has been publicly cited somewhere.
IbouBot explore les URL trouvées sur des pages publiques, et peut donc visiter n'importe quelle page citée publiquement quelque part.
Yes, we keep trying to crawl those pages just to be sure that a missing page doesn't reflect a temporary state or a faulty web server.
Oui. Nous continuons à les explorer pour nous assurer qu'une page absente ne reflète pas un état temporaire ou un serveur défaillant.
Google introduced nofollow links to let a site indicate that some pages must not be taken into account when computing web metrics. But the attribute does not prevent a bot from crawling those pages.
Google a introduit l'attribut nofollow pour qu'un site puisse indiquer que certaines pages ne doivent pas être prises en compte dans le calcul de métriques. Mais cet attribut n'empêche pas un bot d'explorer ces pages.
Yes. We respect the robots.txt file and its disallow directives. If you believe we are not respecting your directives, please contact us.
Oui. Nous respectons le fichier robots.txt et ses directives disallow. Si vous pensez que nous ne respectons pas vos directives, écrivez-nous.
We have a politeness policy of 5 seconds between two queries on the same host, and 2.5 seconds between two queries on the same IP of the same domain. In practice, this caps IbouBot at roughly 0.4 request per second — about 24 requests per minute — for a given domain. You can extend the crawl delay using the robots.txt file:
Nous appliquons une politique de politesse de 5 secondes entre deux requêtes sur un même hôte, et de 2,5 secondes entre deux requêtes sur une même IP d'un même domaine. En pratique, cela plafonne IbouBot à environ 0,4 requête par seconde — soit environ 24 requêtes par minute — pour un domaine donné. Vous pouvez allonger ce délai via le fichier robots.txt :
Note that the crawl delay only applies to a given host. If the same web server is hosting websites with different domains, the rules above will apply.
Notez que le crawl-delay ne s'applique qu'à un hôte donné. Si un même serveur héberge des sites sur des domaines différents, ce sont les règles ci-dessus qui s'appliquent.
The robots.txt file allows you to prevent IbouBot from crawling part or all of your website, using the disallow directive. For example, to prevent the WordPress admin section from being accessed by IbouBot:
Le fichier robots.txt vous permet d'empêcher IbouBot d'explorer tout ou partie de votre site, via la directive disallow. Par exemple, pour lui interdire l'administration WordPress :
Anyone can put our user agent in their requests. The reliable way to tell a genuine IbouBot request from an impostor is a forward-confirmed reverse DNS lookup on the source IP address — the same method Google and Bing document for their own crawlers.
N'importe qui peut afficher notre user-agent dans ses requêtes. Le moyen fiable de distinguer une vraie requête IbouBot d'une usurpation est une vérification reverse DNS confirmée dans les deux sens sur l'IP source — la méthode que Google et Bing documentent pour leurs propres crawlers.
First, resolve the IP address you found in your logs:
D'abord, résolvez l'adresse IP relevée dans vos logs :
The hostname must end with ibou.io. Then resolve that hostname back, and check that you get the address you started from:
Le nom d'hôte obtenu doit se terminer par ibou.io. Résolvez ensuite ce nom d'hôte en sens inverse, et vérifiez que vous retombez sur l'adresse de départ :
If both checks pass, the request genuinely comes from IbouBot. If the hostname does not end with ibou.io, or if the forward lookup returns a different address, the request is not ours: someone is impersonating our user agent, and you can block it safely.
Si les deux vérifications passent, la requête vient bien d'IbouBot. Si le nom d'hôte ne se termine pas par ibou.io, ou si la résolution directe renvoie une autre adresse, la requête n'est pas la nôtre : quelqu'un usurpe notre user-agent, et vous pouvez la bloquer sans risque.
You can also whitelist our IP ranges directly, using the JSON file linked below. That list may change over time, so fetch it periodically rather than copying it once.
Vous pouvez aussi autoriser directement nos plages d'IP, à partir du fichier JSON lié plus bas. Cette liste peut évoluer : récupérez-la périodiquement plutôt que de la recopier une fois pour toutes.
In most cases, nothing. IbouBot is a Cloudflare Verified Bot, classified under the Search behavior: crawling to build a search index. It is not classified under Training, the behavior that covers crawling to train or fine-tune AI models — so if you have enabled Cloudflare's controls against AI training crawlers, they do not target IbouBot.
Dans la plupart des cas, rien. IbouBot est un Verified Bot Cloudflare, classé dans le comportement Search : explorer pour construire un index de recherche. Il n'est pas classé dans Training, le comportement qui couvre l'exploration destinée à entraîner ou affiner des modèles d'IA — donc si vous avez activé les protections Cloudflare contre les crawlers d'entraînement IA, elles ne visent pas IbouBot.
Cloudflare grants Verified status to bots that identify themselves honestly — stable user agent, published IP list, forward-confirmed reverse DNS — and that behave reasonably, respecting robots.txt and crawl directives and keeping their request rate low. Everything documented on this page is what earns IbouBot that status.
Cloudflare accorde ce statut aux bots qui s'identifient honnêtement — user-agent stable, liste d'IP publiée, reverse DNS confirmé dans les deux sens — et dont le comportement reste raisonnable : respect de robots.txt et des directives de crawl, débit de requêtes contenu. Tout ce qui est documenté sur cette page est précisément ce qui vaut ce statut à IbouBot.
In practice, this means your Cloudflare configuration can recognise IbouBot without you having to maintain a list of IP addresses. Cloudflare offers a managed preset for Search bots on every plan, and if you would rather allow IbouBot specifically, this WAF custom rule expression is enough:
Concrètement, votre configuration Cloudflare peut reconnaître IbouBot sans que vous ayez à maintenir la moindre liste d'adresses IP. Cloudflare propose un preset managé pour les bots Search sur toutes les offres, et si vous préférez autoriser IbouBot en particulier, cette expression de règle WAF suffit :
Even if IbouBot crawls web pages with a reasonable delay (2.5 to 5 seconds between queries), it is sometimes mistaken for a DDoS or a brute force attack. If we find a URL containing session parameters, it could also be considered as a login attempt. For these reasons, IbouBot may be temporarily blacklisted. In that case, you can try to whitelist IbouBot directly in your security plugin, or contact us if you can't.
Même si IbouBot explore les pages à un rythme raisonnable (2,5 à 5 secondes entre deux requêtes), il est parfois pris pour une attaque DDoS ou une attaque par force brute. Si nous rencontrons une URL contenant des paramètres de session, cela peut aussi passer pour une tentative de connexion. Pour ces raisons, IbouBot se retrouve parfois temporairement blacklisté. Dans ce cas, essayez de l'autoriser directement dans votre plugin de sécurité, ou écrivez-nous si vous n'y arrivez pas.
Write to bot@ibou.io. A human reads that address, and we answer within two business days.
Écrivez à bot@ibou.io. Un humain lit cette adresse, et nous répondons sous deux jours ouvrés.
To let us act on the first reply, tell us the domain concerned, the source IP addresses you saw, and a few log lines showing the requests. If you want IbouBot to slow down, to stay out of part of your site, or to stop crawling you altogether, just say so — we will apply it, and you do not owe us a justification.
Pour qu'on puisse agir dès la première réponse, indiquez-nous le domaine concerné, les adresses IP source constatées et quelques lignes de log montrant les requêtes. Si vous voulez qu'IbouBot ralentisse, qu'il reste en dehors d'une partie de votre site, ou qu'il cesse complètement de vous explorer, dites-le simplement : nous l'appliquons, et vous n'avez pas à vous justifier.