IA culturelles

Mis à jour 20 mai 2026

defisdatagouvfrdefisdatagouvfr-saison-saison-4

Ce défi est proposé par le ministère de la Culture, partenaire de l’Open Data University.

Contexte du projet

Description rapide des utilisateurs, de la problématique, de l'état de l'art et des besoins.

Les intelligences artificielles génératives connaissent un essor rapide et suscitent un intérêt croissant dans les milieux éducatifs, culturels et technologiques. Dans sa stratégie d’action sur l’Intelligence Artificielle (IA) “Agir pour des IA culturelles et responsables” publiée en juillet 2025, le ministère de la Culture cherche à dépasser l’opposition entre IA et culture, technologie et création, innovation et droit d’auteur. Le ministère veut favoriser, dans un cadre économique respectueux des créateurs, l’émergence d’IA culturelles et responsables, représentant la richesse linguistique et l’héritage culturel de la France et promouvant des usages raisonnés et frugaux de ces technologies à fort impact environnemental.

Cette stratégie s’inscrit dans le contexte actuel du marché des outils d’IA génératives dominé par des entreprises américaines et chinoises créant un biais linguistique et culturel. Ces IA génératives sont entraînées sur des corpus massifs de données constitués en partie d'œuvres protégées par le droit d'auteur, sans garantir une juste reconnaissance ni rémunération adéquate de leurs créateurs. Pour autant, des initiatives existent et sont à développer pour construire des corpus ouverts de données spécialisées, de qualité et libres de droit pour nourrir des IA responsables, éthiques, adaptées aux usages culturels de leurs auteurs et respectueux de la pluralité des expressions culturelles.

L’essor des IA génératives pose aussi des questions culturelles. Quelle place pour les contenus et l'offre culturelle française dans les réponses des IA conversationnelles ? Pour garantir la diversité culturelle, la mise à disposition de jeux de données culturels ouverts de qualité, non protégés par le droit d'auteur, pourra aider à alimenter l'entraînement de modèles respectueux de la pluralité des expressions culturelles.

Afin de soutenir l'entraînement de modèles respectueux de la diversité culturelle, artistique et linguistique, le ministère de la Culture et la Direction interministérielle du numérique (DINUM) a lancé en octobre 2024 la plateforme comparia.beta.gouv.fr. Cet outil permet aux utilisateurs de comparer les réponses de différents modèles d’IA conversationnels et de découvrir ainsi la diversité de ces modèles ainsi que leur empreinte environnementale. L’objectif est de développer l’usage de la plateforme, à des fins éducatives et de sensibilisation. Les données de préférence collectées par la plateforme, sont mises à disposition en open data pour les chercheurs et développeurs pour améliorer les futurs modèles d'IA sur le français.

Ce défi s’inscrit dans les actions menées par le ministère de la Culture en matière de circulation et d’ouverture des données culturelles. Il propose aux étudiantes et étudiants d’explorer les usages de l’IA appliqués aux données culturelles ouvertes. L’objectif est à la fois de favoriser la littératie numérique, de développer une pensée critique sur les IA et de contribuer à la valorisation des données francophones ouvertes dans un cadre pédagogique. L’année 2026 marquera les 10 ans de la loi pour une République numérique, un jalon important dans l’ouverture et la circulation des données publiques, auquel ce défi fait écho.

La problématique

Ce projet vous propose de répondre aux questions suivantes :
Comment mobiliser les IA culturelles – en particulier via compar:IA – pour :

  • mieux comprendre les usages des IA génératives conversationnelles ;
  • explorer les biais, styles, impacts et performances des modèles en français et sur des contenus culturels ;
  • proposer des outils, analyses ou visualisations permettant d’alimenter la réflexion sur l’ouverture et l’exploitation des données culturelles par l’IA.

Objectifs du projet

L'objectif général du projet et les impacts recherchés.

Les travaux réalisés dans le cadre de ce projet permettront :

  • aux étudiants d’explorer concrètement les usages des données culturelles ouvertes et les comportements des modèles d’IA, particulièrement sur les questions culturelles, linguistiques ou artistiques ;
  • aux enseignants de proposer une approche pédagogique innovante croisant science des données, intelligence artificielle et culture ;
  • aux acteurs publics, académiques et industriels de bénéficier de retours et d’analyses sur l’usage d’IA appliquée à la donnée culturelle.

Réalisations possibles et exemples

Les types de production qui peuvent être attendus des élèves.

Vous êtes libres de choisir les livrables que vous jugerez les plus pertinents pour répondre à la problématique proposée. Voilà quelques exemples de livrables possibles pour vous aider dans votre démarche. Les types de productions attendues pourront varier selon le niveau :

Niveau débutant

  • Analyse descriptive de l’usage de compar:IA et des préférences des utilisateurs (catégories les plus présentes, modèles les plus comparés, langues utilisées, etc.)
  • Exploration et catégorisation des prompts (par mots-clés, par type de demande)

Niveau intermédiaire

  • Analyse de la relation entre performance et consommation énergétique des modèles
  • Datavisualisation des résultats pour comparer les comportements des IA
  • Etude comparative des réponses IA à des prompts “culturels” (exemple : ayant trait au patrimoine, spectacle vivant, musées) ou en différentes langues
  • Croisement des réponses IA avec des données ouvertes culturelles (exemples : bases sur les monuments historiques, collections muséales, festivals, labels, etc.) afin d’évaluer la pertinence ou les écarts de représentation entre IA et données institutionnelles.

Niveau avancé

  • Création d’un détecteur de biais et de différences entre modèles (par exemple à l’aide d’un petit LLM fine-tuné)
  • Modélisation de la “créativité” d’un modèle d’IA sur des contenus culturels (diversité lexicale, originalité contextuelle)
  • Analyse du style conversationnel des modèles (ton, usage d’emojis, niveau de formalité) et constitution d’“empreintes stylistiques”
  • Elaboration d’un comparatif des modèles, centré sur des données et contextes culturels, pour évaluer la performance et les biais des modèles
  • Proposition de visualisations ou outils interactifs permettant d’explorer les liens entre IA, données ouvertes et diversité culturelle

Les travaux déjà réalisés par d'autres étudiantes et étudiants

Vous pouvez retrouver les réalisations d'autres étudiantes et étudiants en fin de page. N'hésitez pas à vous en inspirer !

Valorisation du projet

La mise en avant des réalisations

Pour valoriser vos travaux, nous vous invitons à les partager avec l’ensemble de la communauté en publiant une réutilisation sur data.gouv.fr. Cela vous permettra notamment de :

  • Profiter d’une visibilité accrue
  • Obtenir des retours constructifs
  • Engager un dialogue avec les producteurs de données
  • Inspirer les autres

La marche à suivre est détaillée dans ce guide. Nous avons hâte de voir vos réalisations !

Les productions pourront être valorisées dans le cadre du Mois de l'Open Data, sur la plateforme des données ouvertes de la culture ainsi que dans la communication du ministère. Elles contribueront à alimenter les réflexions ministérielles sur l’articulation entre ouverture des données et intelligence artificielle.

Aspects techniques

Les contraintes techniques du projet : environnement matériel et logiciel, outils de développement, méthodologies, ressources de calcul, etc.

De nombreuses données ouvertes sont mises à votre disposition pour vous aider à répondre au projet proposé. La liste ci-dessous constitue une première base à exploiter dans le cadre du projet, elle est non exhaustive et nous vous encourageons à explorer davantage de données ouvertes.

Pour en savoir plus

Pour vous inspirer, vous pouvez consulter les initiatives suivantes :

Référents du projet

Le projet IA culturelles est coordonné par le Département des politiques numériques culturelles (DPNC) au sein du Service du Numérique.

  • Eudes Peyre – chargé de mission circulation et ouverture des données : pilotage et coordination du défi pour Open Data University
  • Lucie Termignon – cheffe de produit compar:IA

5 jeux de données associés