Technologie

Un cadre de Microsoft qualifiait en interne le scraping pour l’IA de « vol » : le document ressort au tribunal

Un document interne de Microsoft, rédigé il y a plusieurs années, vient de resurgir dans l’un des procès les plus scrutés du moment autour de l’intelligence artificielle et du droit d’auteur.

Dans un mémo daté de janvier 2023, Brent Hecht, à l’époque directeur Applied Science chez Microsoft, décrivait la collecte massive de contenus destinés à entraîner les modèles d’IA en des termes très durs. Il y parlait d’un « vol à une échelle sans précédent » et allait jusqu’à évoquer ce qu’il jugeait être le plus grand détournement de travail humain jamais observé.

Ces phrases figurent désormais parmi les pièces judiciaires rendues publiques dans le procès qui oppose plusieurs groupes de presse à OpenAI et Microsoft.

Un mémo interne retourné contre ses auteurs

L’affaire part des accusations portées, entre autres, par le New York Times contre OpenAI et Microsoft. Les éditeurs reprochent aux deux sociétés d’avoir puisé dans d’énormes volumes de contenus protégés pour entraîner leurs modèles, sans jamais avoir obtenu la moindre autorisation.

Les documents dévoilés apportent un élément gênant : certains responsables semblaient déjà conscients, en interne, des problèmes que posait cette collecte à grande échelle. Le mémo de Brent Hecht est cité par les plaignants comme preuve que ces doutes existaient dès 2023 sur l’origine des données utilisées pour nourrir les modèles.

Une nuance mérite toutefois d’être rappelée : une bonne partie de ce qui a été révélé provient du mémoire déposé par les plaignants eux-mêmes. Les pièces originales sur lesquelles ce texte s’appuie restent en partie sous scellés, ce qui empêche de vérifier le contexte complet dans lequel ces phrases ont été formulées.

Une baisse spectaculaire du trafic vers les sites d’info, selon Microsoft

Les révélations ne portent pas uniquement sur l’entraînement des modèles. Une présentation interne attribuée à Microsoft montre que son moteur de réponses basé sur Copilot pouvait faire chuter drastiquement le nombre d’utilisateurs cliquant ensuite vers les sites d’actualité.

Dans certains tests portant sur le domaine du New York Times, le taux de clic aurait chuté jusqu’à 93 % par rapport à une recherche classique sur Bing, d’après les éléments cités dans le dossier.

Brent Hecht aurait résumé la situation comme une forme de cercle vicieux : les IA s’appuient sur les contenus des éditeurs pour améliorer leurs réponses, mais ces réponses finissent par détourner le trafic qui devrait revenir aux sites à l’origine de l’information. Moins de trafic, c’est potentiellement moins de revenus pour des médias dont le travail sert pourtant à faire fonctionner ces systèmes.

Nadella interrogé sur le sort des contenus payants

Les pièces du dossier mettent également en lumière une déposition de Satya Nadella. Le patron de Microsoft aurait indiqué que les contenus situés derrière un paywall devraient faire l’objet d’une licence dès lors qu’une entreprise souhaite les exploiter pour entraîner ou alimenter un système d’IA.

Toujours selon le dossier, il aurait ajouté que s’il avait su qu’OpenAI utilisait de tels contenus payants sans autorisation, Microsoft aurait pu exiger que les modèles concernés soient réentraînés. Ces propos pèsent d’autant plus lourd que Microsoft reste l’un des principaux soutiens technologiques et financiers d’OpenAI.

OpenAI accusé d’avoir déjoué certaines barrières payantes

Les plaignants vont plus loin encore. Ils soutiennent qu’OpenAI aurait mis au point des méthodes pour récupérer des articles pourtant protégés, et qu’un chercheur aurait même mentionné en interne une technique pour contourner le paywall du New York Times.

D’après les documents versés à la procédure, certains jeux de données utilisés lors de phases d’entraînement contiendraient des dizaines de milliers de copies de contenus issus de groupes de presse américains. Un ensemble de données provenant de Common Crawl renfermerait, à lui seul, plus de deux millions de documents tirés du domaine nytimes.com.

Il s’agit pour l’instant d’allégations formulées dans le cadre d’une procédure en cours, et non d’une décision de justice établissant une quelconque responsabilité d’OpenAI ou de Microsoft.

Une bataille qui touche au cœur du modèle de l’IA générative

Derrière ces phrases-chocs se cache une question juridique bien plus vaste : une entreprise peut-elle entraîner un modèle d’IA à partir de contenus protégés sans l’accord de leurs auteurs ?

Les sociétés d’IA invoquent régulièrement le « fair use », ce principe du droit américain qui autorise certains usages d’œuvres protégées dans des cas précis. Les éditeurs, eux, estiment que les réponses générées par ces modèles se substituent directement à leurs contenus, au détriment de leur audience et de leurs revenus.

La publication de ces documents ne règle rien sur le fond. Elle rappelle simplement que les craintes exprimées aujourd’hui par les éditeurs de presse circulaient déjà, il y a plusieurs années, à l’intérieur même des entreprises qui construisent l’IA générative.

Leave a comment

Your email address will not be published.