FrIdéo est une échelle continue de positionnement idéologique pour 30 médias
d'information nationaux français. Chaque média reçoit une position, un intervalle de
confiance, et l'ensemble des données d'entrée ayant servi à la calculer.
Le score fusionne neuf familles de sources indépendantes — propriété capitalistique,
position dans le réseau de liens, enquêtes d'audience, chartes éditoriales, profilage
encyclopédique, invitations sur les plateaux, deux panels de notation, et une mesure
lexicale sensible à la distanciation — avec un rétrécissement bayésien empirique vers un
a priori structurel fondé sur la tradition de fondation du titre.
Publié par Le French News Lab, laboratoire de recherche
indépendant basé à Paris qui étudie l'écosystème médiatique français par des méthodes
computationnelles.
| Fichier | Usage |
|---|---|
frideo_scores.csv | tableur, R, pandas |
frideo_scores.json | code — mêmes lignes, plus les métadonnées d'échelle (bornes, sens, seuils, liste des familles) |
DATA_DICTIONARY.md | définition des colonnes et limites de l'échelle |
Les deux fichiers de scores contiennent des lignes identiques : 30 médias, triés de
gauche à droite. Négatif = gauche, positif = droite.
| Colonne | Type | Signification |
|---|---|---|
outlet | texte | Nom du média tel qu'utilisé dans l'article |
score | décimal | Score idéologique latent. Négatif = gauche, positif = droite |
sigma | décimal | Erreur type analytique de score |
ci_low_95, ci_high_95 | décimal | Intervalle de confiance à 95 % analytique (score ± 1,96 × sigma) |
ci_spans_zero | booléen | Vrai si l'intervalle contient 0 — 15 médias sur 30 |
label | texte | Bande d'interprétation en sept classes, à usage de lisibilité uniquement |
n_direct_families | entier | Nombre de familles de preuves directes disponibles (max 9) |
sparse | booléen | Vrai lorsque n_direct_families ≤ 4 — 5 médias |
structural_prior_z | décimal | A priori structurel vers lequel le score est rétréci |
bootstrap_mean, bootstrap_std | décimal | Distribution bootstrap du score (graine 42) |
D0_z … D8_z | décimal ou vide | Scores z par famille. Vide signifie non applicable, pas zéro |
| ID | Source |
|---|---|
D0 | Idéologie de l'actionnariat |
D1 | Biais idéologique des invités sur les plateaux |
D2 | Idéologie perçue en enquête d'audience |
D3 | Position dans le réseau de liens et d'abonnements |
D4 | Notation Media Bias Fact Check |
D6a | Orientation éditoriale déclarée |
D6b | Profilage encyclopédique par un tiers |
D7 | Score lexical sensible à la distanciation |
D8 | Notation Ad Fontes Media |
Une seule des neuf familles est bornée dans le temps. La famille D7 (score lexical
sensible à la distanciation) est calculée sur un corpus toutes rubriques agrégé sur
2024-2025 : 568 906 articles échantillonnés, plafonnés à 1 000 par média et par mois.
C'est la seule famille intra-période, et donc la seule structurellement orthogonale au socle
de preuves historiques.
Les huit autres familles — propriété capitalistique, invitations sur les plateaux, enquêtes
d'audience, réseau de liens, notations de tiers, chartes éditoriales, profilage
encyclopédique — ne sont pas datées : elles décrivent des états ou des jugements sans borne
de période. La couverture déclarée dans les métadonnées reflète donc D7 uniquement.
Le classifieur de distanciation a été validé sur un étalon de 506 occurrences
(κ = 0,93, 96,6 % d'accord), tiré d'un échantillon distinct du corpus de scoring.
Trois limites à respecter avant toute réutilisation.
+1,0 signifie « un écart-type àlabel n'est pas la mesure. Les sept bandes existent pour la lisibilité desscore continu. Un média proche d'unsparse les signale.ci_spans_zero est vrai pour 15 des 30 médias, tous proches du centre : traiter le centre
de la distribution comme un ordonnancement, non comme des différences résolues.
Deux incertitudes distinctes, à ne pas confondre. sigma et les colonnes ci_* sont
analytiques : elles propagent les paramètres de cohérence par source et une pénalité de
parcimonie, et répondent à « quelle quantité de preuves soutient cette position ».
bootstrap_std est une quantité de stabilité : la dispersion du score sous 10 000
perturbations conjointes des constantes de réglage. Citer l'intervalle analytique lorsque
vous rapportez un score.
Ces scores accompagnent l'article « FrIdéo: French News Outlet Ideology Scoring via
Multi-Source Evidence Fusion and Distancing-Aware Lexical Scoring », par Amr Sobhy
(Le French News Lab), accepté à ICNLSP 2026 (9ᵉ International Conference on Natural
Language and Speech Processing, Trente, Italie) — communication orale.
➜ Lire la publication sur frenchnewslab.org
@inproceedings{sobhy2026frideo,
title = {{FrIdéo}: French News Outlet Ideology Scoring via Multi-Source
Evidence Fusion and Distancing-Aware Lexical Scoring},
author = {Sobhy, Amr},
booktitle = {Proceedings of ICNLSP 2026},
year = {2026}
}
Attribution : Amr Sobhy, Le French News Lab, « FrIdéo » (ICNLSP 2026), conformément à la
licence CC BY 4.0. Merci de mentionner également l'URL de ce jeu de données.
English summary — FrIdéo is a continuous, ecosystem-wide ideology scale for 30 French
national news outlets, fusing nine independent evidence families with empirical-Bayes
shrinkage toward a structural prior. Each outlet carries a position, a confidence interval,
and every input published. The scale is zero-mean and unit-variance by construction across
this panel, so it measures position within the French national news ecosystem rather than
absolute ideology. Companion resource for the ICNLSP 2026 paper.
Project page.
Couverture temporelle non renseignée