Description de la base de données :
Objectifs et finalités initiales de la base de données :
Ce jeu de données met à disposition une extraction synthétique du SNDS, construite avec un objectif de cohérence structurelle, métier et statistique.
Contexte de création :
Cette base synthétique a été générée de manière algorithmique, en s’appuyant notamment sur le schéma des tables du SNDS pour l’année 2023.
Elle a été conçue afin de faciliter l’exploration et la compréhension du SNDS, ainsi que le développement d’algorithmes, d’outils et de traitements autour de cette base.
La version actuelle comprend 6 tables du DCIR, ainsi que les tables IR_BEN_R et IR_IMB_R. Le périmètre couvert et le niveau de cohérence intégré ont vocation à évoluer progressivement au fil des versions.
À ce jour, elle intègre 362 éléments de cohérence structurelle et métier, ainsi que 14 éléments de cohérence statistique. Ces éléments sont détaillés dans les sections suivantes.
Public cible :
Ces données synthétiques s’adressent à l’écosystème de la donnée de santé, notamment aux équipes souhaitant travailler sur la structure du SNDS, préparer des traitements, développer des algorithmes, tester des outils ou disposer d’un support pédagogique et technique sans recourir à des données individuelles réelles.
Résultats associés à la création de la base :
Ce jeu de données a été généré avec la version 0.1.0 de ParaBios, un moteur de génération de données synthétiques basé sur des connaissances métier, développé par la Plateforme des Données de Santé.
Le code source de ParaBios a vocation à être ouvert prochainement.
Méthodologie de collecte :
Méthodologie de collecte et critères d’inclusion :
La base générée s’appuie sur plusieurs familles d’éléments de cohérence.
Le premier socle correspond au schéma SNDS 2023. À ce stade, le périmètre généré couvre une partie du DCIR et deux tables bénéficiaires. Ce périmètre est destiné à être étendu progressivement.
La génération repose également sur un ensemble de contraintes structurelles et de règles de gestion métier. Ces règles sont au nombre de 362 et couvrent notamment :
En complément, 14 éléments statistiques agrégés depuis l’extraction Persephone ont été intégrés afin de renforcer la cohérence des distributions générées.
Ces éléments statistiques portent notamment sur :
Pour les variables très diffuses, comme certains organismes ou codes de gestion, la méthode combine généralement un traitement spécifique des modalités les plus fréquentes et un échantillonnage contrôlé des autres modalités. Cette approche permet de représenter à la fois les modalités dominantes, les modalités intermédiaires et les modalités rares, sans détailler individuellement l’ensemble des valeurs possibles.
Les contraintes statistiques multivariées actuellement intégrées concernent notamment la cohérence entre IR_BEN_R.BEN_RES_COM et IR_BEN_R.BEN_RES_DPT, ainsi que la cohérence entre IR_BEN_R.BEN_SEX_COD et ER_PRS_F.BEN_AMA_COD.
Pour les enfants âgés de 0 à 24 mois, l’âge est encodé en nombre de mois, de 1000 à 1024, conformément aux conventions utilisées dans le schéma.
La table ER_PRS_F intègre également des distributions d’écarts en jours entre certaines dates, notamment entre FLX_DIS_DTD et EXE_SOI_DTD, ainsi qu’entre EXE_SOI_DTD et EXE_SOI_DTF.
Choix des variables :
Le jeu de données pour ce lot correspond au schéma de l’année 2023.
Les tables incluses sont les suivantes :
Pour chacune de ces tables, l’ensemble des variables présentes dans le schéma 2023 a été généré.
Structure de la base et rationnel des fichiers (si la base est volumineuse et scindée en fichiers) :
La base est fournie sous la forme d’une archive .tar.gz d’environ 1,5 Go. L’archive doit être désarchivée avant utilisation.
Une fois décompressé, le dossier contient un répertoire datasets/, qui regroupe les fichiers de données, ainsi que plusieurs fichiers produits automatiquement lors de l’exécution de ParaBios.
L’arborescence est organisée de la manière suivante :
├── datasets/
│ ├── ER_PRS_F_2023.parquet
│ ├── ER_PHA_F_2023.parquet
│ ├── ER_TIP_F_2023.parquet
│ ├── ER_ETE_F_2023.parquet
│ ├── ER_UCD_D_2023.parquet
│ ├── ER_CAM_F_2023.parquet
│ ├── IR_BEN_R_2023.parquet
│ └── IR_IMB_R_2023.parquet
├── config_resolved.yaml
├── manifest.json
├── report.json
├── coverage_report.json
└── logs.jsonl
Le dossier datasets/ contient un fichier Parquet par table générée. Par exemple, le fichier ER_PRS_F_2023.parquet correspond à la table ER_PRS_F.
Les fichiers complémentaires sont générés automatiquement par ParaBios à l’issue du run :
Limite de la base de données :
Ce jeu de données correspond à une première version. Il couvre actuellement une extraction réduite du DCIR, complétée par les tables IR_BEN_R et IR_IMB_R.
Le périmètre a vocation à évoluer progressivement, avec l’ajout prévu d’autres composantes du SNDS (PMSI, CépiDc, etc.)
Les éléments de cohérence intégrés sont également amenés à être enrichis. Ils ne couvrent pas l’ensemble des situations possibles et ne doivent pas être considérés comme exhaustifs.
Les principales limites connues sont les suivantes :
Instructions/pré-requis d’utilisation de la base :
Les fichiers de données sont fournis au format Parquet.
Il est recommandé de disposer de suffisamment de mémoire vive pour charger les données. L’empreinte mémoire dépend du moteur utilisé et de la stratégie de chargement.
À titre indicatif, le chargement complet représente environ :
Support : Un support peut être apporté en sollicitant la PDS aux adresses de messagerie suivantes:
Vues
0
Téléchargements
0