Au cœur de l’univers numérique de la connaissance libre, Wikimedia se trouve aujourd’hui à affronter l’un des défis les plus complexes de son histoire récente : la vague croissante de bot automatiques AI qui pillent systématiquement ses contenus.
En particulier, au cours des derniers mois, il y a eu une augmentation de 50 % du trafic généré par les soi-disant crawler AI, ce qui met à rude épreuve à la fois la capacité technique et la durabilité économique de la plateforme.
Summary
L’impact de l’intelligence artificielle (IA) sur les infrastructures numériques augmente : le cas Wikimedia
À partir de janvier 2024, une croissance vertigineuse a été enregistrée dans le volume de données téléchargées à partir de plateformes comme Wikipedia et les autres projets Wikimedia.
Cette augmentation n’est pas attribuable à une participation accrue des utilisateurs humains, mais plutôt à une utilisation systématique et souvent peu réglementée de bots automatiques employés par des entreprises qui développent des modèles d’intelligence artificielle.
Ces outils, conçus pour collecter et analyser de grandes quantités de texte, d’images et d’autres contenus, utilisent Wikimedia comme une source principale de données pour l’entraînement de leurs algorithmes.
Une opération qui, d’une part, témoigne de la centralité de la plateforme dans l’écosystème de la connaissance numérique, d’autre part, exerce une pression insoutenable sur ses infrastructures informatiques.
Le problème ne réside pas seulement dans la quantité de données transférées. Le véritable point critique est représenté par la manière dont ces bots accèdent aux contenus.
Dans la plupart des cas, en effet, les demandes sont adressées à des pages rares ou peu visitées, c’est-à-dire celles qui ne font pas partie des systèmes de caching. C’est-à-dire des mécanismes qui permettent de conserver temporairement des copies des pages les plus consultées pour en accélérer le chargement.
Lorsque cela se produit, les demandes doivent être gérées directement par les serveurs centraux, entraînant une augmentation significative de la charge de travail et, surtout, des coûts.
Ce scénario devient particulièrement critique lors d’événements à forte résonance médiatique, pendant lesquels le trafic “humain” atteint déjà des niveaux élevés.
Bot hors de contrôle : ignorent les règles, contournent les blocages
Une autre dimension alarmante du phénomène est représentée par le comportement de plus en plus sophistiqué et, parfois, incorrect des crawlers. Beaucoup de ces bots, en effet, ignorent les conventions établies, contournent les systèmes de blocage automatique et se déguisent pour sembler des utilisateurs légitimes.
Ce type de conduite ne viole pas seulement les normes de bon usage du réseau, mais oblige les équipes techniques de Wikimedia à une surveillance continue et à un emploi constant de ressources pour protéger l’infrastructure.
Ressources qui pourraient être plutôt destinées à renforcer la plateforme ou à enrichir ses contenus.
En réponse à cette situation, la Fondation Wikimedia cherche à ne pas se limiter à une réaction technique ou défensive. La solution proposée va au-delà du simple confinement du problème et vise à une gestion collaborative et durable du savoir libre.
C’est ainsi que naît WE5, une nouvelle initiative stratégique qui a pour objectif de promouvoir des approches plus équitables et responsables dans l’acquisition et l’utilisation des données hébergées par la plateforme.
Le projet se présente comme une invitation aux entreprises tech et aux développeurs d’intelligence artificielle.
En particulier, une invitation à respecter les règles, à contribuer aux coûts de gestion du réseau et à garantir la survie de l’infrastructure sur laquelle repose l’une des principales sources d’information libre du monde.
L’ensemble de l’affaire soulève une question cruciale pour l’avenir de l’accès libre à la connaissance : à une époque où les données sont devenues la sève vitale de l’intelligence artificielle, qui paie pour la conservation et la distribution de ces données ?
Wikimedia, depuis toujours animée par le principe de la gratuité et du partage, se trouve maintenant à la croisée des chemins entre ouverture et durabilité.
Sans un changement de cap de la part des big tech et des acteurs qui utilisent massivement les contenus de la fondation, le projet pourrait être contraint à réduire l’accessibilité ou à introduire des limites plus strictes pour sauvegarder sa propre infrastructure.
Un appel au respect du bien public numérique
Le message que Wikimedia lance au monde est clair. À savoir que la connaissance libre est un bien commun et, en tant que telle, elle doit être traitée avec respect et responsabilité.
L’utilisation à des fins commerciales de l’énorme patrimoine informatif mis à disposition par la fondation doit se faire de manière transparente, conforme aux règles et. De plus, si nécessaire, accompagnée de formes de contribution équitable.
Dans un paysage numérique de plus en plus dominé par les algorithmes et l’automatisation, il est essentiel de garantir que l’accès au savoir ne soit pas compromis par les intérêts économiques de quelques-uns.
Seulement à travers un dialogue ouvert entre communautés, institutions et entreprises, il sera possible de maintenir vivant le rêve d’une encyclopédie globale libre, accessible et durable.

