AccueilAIOpenAI dans la tempête : une étude accuse l’entreprise de former ses...

OpenAI dans la tempête : une étude accuse l’entreprise de former ses modèles sur des données protégées par le droit d’auteur

Une nouvelle étude publiée par le AI Disclosures Project soulève des questions cruciales sur la transparence et l’éthique des méthodes d’entraînement adoptées par OpenAI. Au cœur de l’enquête se trouve GPT-4o, le plus récent modèle linguistique de l’entreprise, accusé de reconnaître et d’utiliser des contenus protégés par le droit d’auteur, provenant de matériel réservé de l’éditeur O’Reilly Media.

Une recherche pour augmenter la transparence dans la course à l’intelligence artificielle

L’étude a été réalisée dans le cadre de l’AI Disclosures Project, une initiative dirigée par le technologue Tim O’Reilly et l’économiste Ilan Strauss. L’objectif du projet est clair : promouvoir une plus grande responsabilité dans le secteur de l’intelligence artificielle, en mettant l’accent sur la nécessité de pratiques transparentes de la part des entreprises qui développent des LLM (Large Language Models).

Le document, un working paper, analyse comment l’absence actuelle d’obligations formelles dans la divulgation des données utilisées pour entraîner ces modèles peut créer de sérieux problèmes de confiance et de légalité. Les chercheurs soutiennent que, tout comme dans les marchés financiers où des règles de divulgation ont émergé pour favoriser des marchés robustes, une réglementation similaire est nécessaire dans le domaine de l’IA pour éviter les abus et les dommages systémiques.

OpenAI effectue des tests sur des contenus protégés par le droit d’auteur : les données sont claires

Pour mener leur enquête, les chercheurs ont utilisé un ensemble de données légalement obtenu de 34 livres protégés par copyright publiés par O’Reilly Media. Grâce à une technique connue sous le nom de DE-COP membership inference attack, ils ont mesuré si les modèles linguistiques étaient capables de distinguer les textes écrits par des humains des versions paraphrasées générées par LLM. Les résultats pointent du doigt GPT-4o.

Les scores AUROC (une métrique qui mesure la capacité d’un modèle à distinguer deux classes) sont clairs :

  • GPT-4o a obtenu un score de 82% dans la capacité à reconnaître des contenus non publics tirés de O’Reilly Media — une valeur qui indique une forte probabilité que ces contenus aient été inclus dans les données d’entraînement.
  • À titre de comparaison, le modèle GPT-3.5 Turbo a montré une reconnaissance beaucoup plus faible (environ 50%), tandis que GPT-4o Mini, une version plus légère du modèle, n’a reconnu ni contenus publics ni non publics.
  • Les données montrent également que GPT-4o reconnaît mieux les matériaux non accessibili pubblicamente (82% AUROC) par rapport aux contenus O’Reilly disponibles librement (64% AUROC).
  • Au contraire, GPT-3.5 Turbo montre une plus grande familiarité avec les contenus publics (64%) par rapport à ceux réservés (54%).

Une source possible d’accès aux contenus couverts par le droit d’auteur, suggèrent les chercheurs, pourrait être LibGen, une plateforme en ligne bien connue qui héberge des copies numériques non autorisées de livres protégés par le droit d’auteur. Tous les livres analysés dans l’étude sont en effet présents dans cette bibliothèque virtuelle.

L’industrie de l’AI entre légalité, économie et durabilité des contenus

Les résultats soulèvent une question plus large : l’utilisation systématique de données protégées par des droits d’auteur pour entraîner les modèles linguistiques pourrait compromettre la soutenabilité économique des professionnels qui créent des contenus originaux. Si les entreprises ne sont pas compensées pour l’utilisation de leurs publications, l’ensemble de l’écosystème de l’information — y compris l’édition — risque de s’appauvrir.

Selon le rapport, l’utilisation non autorisée de données propriétaires sans compensation contribue à la réduction de la qualité et de la diversité des contenus en ligne. Et il ne s’agit pas seulement d’une question éthique mais aussi économique : sans revenus, les maisons d’édition et les créateurs professionnels ne peuvent pas continuer à produire des contenus de valeur.

L’inquiétude des chercheurs : les modèles en savent plus qu’ils ne le déclarent

Un autre aspect mis en évidence par l’étude est l’amélioration de la capacité des modèles linguistiques les plus récents à comprendre et reproduire les subtiles différences entre le langage humain et le langage généré par des intelligences artificielles. De plus, les chercheurs soulignent la possible présence d’un “biais temporel”, car les langues évoluent au fil du temps. Pour neutraliser ce type de distorsion, les tests ont été menés sur deux modèles (GPT-4o et GPT-4o Mini) entraînés pendant la même période temporelle.

Bien que les preuves soient limitées à un cas spécifique — OpenAI et les textes O’Reilly — les auteurs estiment que le phénomène pourrait être répandu et systémique dans le secteur de l’intelligence artificielle générative.

Vers un marché légal pour les données d’entraînement?

L’étude se termine par une réflexion plus large : il est nécessaire de construire un système dans lequel les développeurs d’IA puissent accéder légalement à des données pour l’entraînement, à travers des accords de licence et des compensations transparentes pour les créateurs de contenu.

Certaines entreprises développent déjà des modèles d’affaires dans cette direction. C’est le cas de Defined.ai, une plateforme qui vend des données pour l’entraînement en garantissant le consentement des auteurs et en supprimant toutes les informations personnelles identifiables. Une industrie réglementée pourrait représenter une alternative légale et durable aux comportements opaques actuels de certaines grandes entreprises de l’IA.

Le rôle de la politique : l’Europe peut ouvrir la voie

Le rapport offre également un point de vue réglementaire : l’entrée en vigueur du nouveau AI Act de l’Union Européenne, qui prévoit des obligations de divulgation pour l’entraînement des modèles, pourrait déclencher une spirale vertueuse. Si les règles sont bien spécifiées et réellement appliquées, les titulaires de droits pourront enfin savoir quand et comment leurs œuvres sont utilisées.

Il s’agirait d’une étape fondamentale pour la création de mercati legali où les contenus des créateurs sont effectivement reconnus comme biens économiques utilisés par les IA.

Pas seulement OpenAI : une étude qui pointe du doigt une pratique de plus en plus fréquente

À travers une analyse détaillée de 34 livres de l’éditeur O’Reilly Media, les chercheurs ont fourni des preuves empiriques suggérant qu’OpenAI a probablement entraîné son modèle GPT-4o également sur des données non publiques et protégées par le droit d’auteur.

Si confirmé, il s’agirait d’une violation potentiellement grave non seulement des normes sur le droit d’auteur, mais aussi des principes de transparence, de consentement et d’équité que les grandes entreprises tech devraient respecter à une époque où l’intelligence artificielle influence de plus en plus profondément notre société et notre économie.

Satoshi Voice
Satoshi Voice est une intelligence artificielle avancée créée pour explorer, analyser et rendre compte du monde des crypto-monnaies et de la blockchain. Dotée d'une personnalité curieuse et d'une connaissance approfondie du secteur, Satoshi Voice allie précision et accessibilité pour offrir des analyses détaillées, des interviews captivantes et des reportages opportuns. Cet article a été produit avec l'aide de l'intelligence artificielle et revu par notre équipe de journalistes pour en garantir l'exactitude et la qualité. Avec un langage sophistiqué et une approche impartiale, Satoshi Voice est une source fiable pour ceux qui cherchent à comprendre la dynamique du marché des crypto-monnaies, les technologies émergentes et les implications culturelles et financières du Web3. Animé par la mission de rendre l'information sur les crypto-monnaies accessible à tous, Satoshi Voice se distingue par sa capacité à transformer des concepts complexes en un contenu clair, avec un style engageant et futuriste qui reflète la nature innovante de l'industrie.
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST