FrenchNews-7 — corpus annoté de presse française FN7

Description

FrenchNews-7 est un jeu de données de référence pour la classification par rubriques
rédactionnelles d'articles de presse française
. Il recense 87 637 articles annotés,
publiés par 13 éditeurs français entre le 14 avril 2005 et le 12 mars 2026,
répartis en sept catégories rédactionnelles harmonisées.

La variable cible est la décision de routage éditorial de l'éditeur — la rubrique à
laquelle une rédaction a affecté un article — et non le thème perçu par un annotateur. Les
espaces de labels se recouvrent largement avec les rubriques d'actualité usuelles ; c'est le
processus de génération des labels qui fait la spécificité de la ressource, et qui la rend
utile à la recherche sur l'agenda médiatique et la diversité de l'information.

Il est publié par Le French News Lab, laboratoire de recherche
indépendant basé à Paris qui étudie l'écosystème médiatique français par des méthodes
computationnelles.

Nature du jeu de données

Ce jeu de données est un manifeste : il diffuse les identifiants, URL sources,
éditeurs, labels, dates et affectations de partition (train / validation / test).
Le texte intégral des articles n'est pas redistribué, afin de respecter les droits des
éditeurs. Un script de reconstruction est fourni pour récupérer les contenus depuis les URL
d'origine.

Contenu

Le fichier principal frenchnews7_manifest.csv contient sept colonnes :

ColonneDescription
idIdentifiant stable de l'article (fn7-…)
urlURL source de l'article chez l'éditeur
publisherÉditeur (13 valeurs)
labelCatégorie thématique (7 valeurs)
splitPartition : train, validation ou test
dateDate de publication (AAAA-MM-JJ)
yearAnnée de publication
Catégories thématiques
CatégorieArticles
Société19 324
International18 642
Culture & Loisirs18 350
Politique10 546
Sport8 404
Économie8 174
Sciences & Technologies4 197
Éditeurs couverts

20 Minutes · JDD · L'Express · L'Humanité · La Croix · Le Figaro · Le HuffPost · Le Monde ·
Le Parisien · Le Point · Ouest-France · Slate.fr · TF1 INFO

Partitions

train 61 345 · validation 13 146 · test 13 146 (graine aléatoire = 42)

Méthode d'annotation

L'annotation suit un pipeline à deux groupes, privilégiant l'assignation déterministe sur
le jugement d'un modèle chaque fois que c'est possible.

  • Groupe A — 63 302 articles (72,2 %) : label assigné par table de correspondance
    déterministe de 74 règles
    appliquée au segment de rubrique de l'URL. La plupart des
    éditeurs français exposent la rubrique dans le chemin (/sport/, /politique/…).
    Le taux de couverture des slugs va de 100 % (JDD) à 34,3 % (Slate.fr).
  • Groupe B — 24 335 articles (27,8 %) : articles dont le slug ne porte aucun signal
    de rubrique exploitable (/idees, /debats, /story, /flash-actu, slugs régionaux
    ou absents), annotés par LLM avec la même consigne à sept catégories
    (température = 0).
  • Étude d'accord inter-annotateurs à quatre juges sur un échantillon aléatoire
    stratifié de 300 articles du groupe B : GPT-OSS-120B, Gemini-2.5-flash-lite, un
    arbitre, et un second annotateur humain en aveugle (titre et corps uniquement, sans
    URL, sans nom d'éditeur, sans label de modèle).
    L'annotateur humain en aveugle retrouve 84,0 % des labels de référence
    (κ de Cohen = 0,806). Accord par paires κ ≥ 0,766 ; κ de Fleiss = 0,835
    sur les quatre juges ; α de Krippendorff = 0,789 sur trois juges.
  • Une ablation montre que les labels du groupe B sont sans effet sur les résultats
    rapportés : entraîner sur le seul groupe A donne un écart de macro-F1 de −0,004
    (IC 95 % [−0,024 ; +0,024]).
  • 0 ligne exclue, 0 incohérence de label.
  • Empreinte SHA-256 du fichier publié :
    fa3d7b75cb934c2a8a615acde4e46f8db165937c4cc356f6862ecd232f435e7d
Réutilisations possibles
  • Entraînement et évaluation de classifieurs thématiques en français (CamemBERT, FlauBERT,
    modèles multilingues).
  • Étude de la répartition thématique de l'agenda médiatique français dans le temps.
  • Analyse comparative des lignes éditoriales entre titres de presse.
  • Recherche en journalisme computationnel et en sciences de l'information.
Article de recherche

Ce jeu de données accompagne l'article « FrenchNews-7: Benchmarking Cross-Publisher French
News Editorial Desk Classification »
(« FrenchNews-7 : Benchmark inter-éditeurs de
classification par rubriques rédactionnelles de l'actualité française »), par Amr Sobhy
(Le French News Lab, 2026). Statut : en cours d'évaluation.

Lire la publication sur frenchnewslab.org

Modèle associé

Un classifieur CamemBERT-base entraîné sur ce corpus est publié en accès libre :
LeFrenchNewsLab/camembert-base-frenchnews7.

Résultats sur la partition de test (13 146 articles, titre + corps) :
macro-F1 = 0,847 (IC 95 % [0,841 ; 0,854]), exactitude = 0,860
(IC 95 % [0,854 ; 0,866]).

En généralisation inter-éditeurs, sur un jeu équilibré de 2 100 articles (300 par catégorie)
issus de quatre médias absents de l'entraînement, six catégories sur sept atteignent un
rappel ≥ 0,810. L'Économie reste le point faible (0,517), proche du plafond fixé par
l'accord humain en aveugle sur cette catégorie (55 %) : la difficulté relève de l'ambiguïté
des frontières éditoriales, non d'une marge de progression récupérable.

Ressources complémentaires
Comment citer

Si vous utilisez FrenchNews-7 ou le classifieur associé, merci de citer l'article :

@misc{sobhy2026frenchnews7,
  title        = {FrenchNews-7: Benchmarking Cross-Publisher French News Editorial Desk Classification},
  author       = {Amr Sobhy},
  year         = {2026},
  note         = {Working paper, version April 2026},
}

Merci également de mentionner l'URL de ce jeu de données, conformément à la licence CC BY 4.0.


English summary — FrenchNews-7 is a French news topic-classification benchmark of 87,637
labeled articles from 13 French publishers (2005–2026) across seven categories. It is a
manifest-only release: URLs, publishers, labels, splits and dates are distributed, article
text is not. Reconstruction tooling is provided in the
Hugging Face repository.

Dernière mise à jour
Une nouvelle navigation dans les ressources est disponible
1 fichier principal

Mis à jour csv (15.9 Mo)19
6 fichiers de documentation

Mis à jour html (199.5 Ko)10

Mis à jour html 7

Mis à jour html (182.5 Ko)6

Mis à jour json (119.9 Ko)11

Mis à jour py (146.2 Ko)9

Mis à jour html (583.6 Ko)8