# Bienvenue

Ces guides sont conçus par l'équipe de Datasud.fr pour vous accompagner dans votre démarche d'ouverture et de réutilisation de données sur le portail régional.

***

## Utilisation de datasud.fr

<table data-card-size="large" data-column-title-hidden data-view="cards" data-full-width="false"><thead><tr><th></th><th></th><th data-type="files"></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Compte</strong></td><td>Comment et pourquoi créer un compte</td><td></td><td><a href="/pages/afmZxuxcO5ixDDcdJ4uw">/pages/afmZxuxcO5ixDDcdJ4uw</a></td></tr><tr><td><strong>Organisation</strong></td><td>Créer et gérer son organisation</td><td></td><td><a href="/pages/zr6B9gKZzJhRYmk86itx">/pages/zr6B9gKZzJhRYmk86itx</a></td></tr><tr><td><strong>Jeux de données</strong></td><td>Publier et gérer ses jeux de données</td><td></td><td><a href="/pages/av0ZpD8xAlR1iNY92h7F">/pages/av0ZpD8xAlR1iNY92h7F</a></td></tr><tr><td><strong>Réutilisation</strong></td><td>Publier et gérer ses réutilisations</td><td></td><td><a href="/pages/H3jh2wFNz1BIXLAuhEHm">/pages/H3jh2wFNz1BIXLAuhEHm</a></td></tr><tr><td><strong>Statistiques</strong></td><td>Suivre l'activité sur ses données</td><td></td><td><a href="/pages/yTlwJoppWvcHsjxRxHf0">/pages/yTlwJoppWvcHsjxRxHf0</a></td></tr><tr><td><strong>Maps</strong></td><td>Applications cartographiques</td><td></td><td><a href="/pages/kskXdS0EkiwFY0vTaAuT">/pages/kskXdS0EkiwFY0vTaAuT</a></td></tr></tbody></table>

***

## Réutiliser des données

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>API Base Adresse Nationale</strong></td><td>Comment utiliser l'API BAN</td><td><a href="/pages/YQypTxoNv36LobJK1gPw">/pages/YQypTxoNv36LobJK1gPw</a></td></tr><tr><td><strong>API découpage administratif</strong></td><td>Comment à utiliser l'API découpage administratif</td><td><a href="/pages/qU9SAnuyw4qujBwqVCmQ">/pages/qU9SAnuyw4qujBwqVCmQ</a></td></tr><tr><td><strong>Tuiles vectorielles</strong></td><td>Comment utiliser les tuiles vectorielles</td><td><a href="/pages/UTGpuiGNTr1bLoK2G2yG">/pages/UTGpuiGNTr1bLoK2G2yG</a></td></tr><tr><td><strong>Données du cadastre</strong></td><td>Comment utiliser les données cadastrales</td><td><a href="/pages/0oi2wYtyk5oDBX9Q103t">/pages/0oi2wYtyk5oDBX9Q103t</a></td></tr><tr><td><strong>API Adresse</strong></td><td>Prendre en main l'API Adresse de l'IGN</td><td><a href="/pages/NUzKnGNi9oEQFbKMpPHY">/pages/NUzKnGNi9oEQFbKMpPHY</a></td></tr></tbody></table>

***

## Documentation technique

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Moissonnage</strong></td><td>Comprendre et mettre en place un moissonneur</td><td><a href="/pages/KY90t1jv60StWCunzpsm">/pages/KY90t1jv60StWCunzpsm</a></td></tr><tr><td><strong>API de data.gouv.fr</strong></td><td>Comment utiliser l'API de data.gouv.fr</td><td><a href="/pages/uPvsA14HWTNvTSP5Yfwi">/pages/uPvsA14HWTNvTSP5Yfwi</a></td></tr></tbody></table>

***

## Guides

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th></th><th data-hidden></th><th data-hidden data-card-target data-type="content-ref"></th><th data-hidden data-type="rating" data-max="5"></th><th data-hidden data-card-cover data-type="files"></th></tr></thead><tbody><tr><td><strong>Guide qualité</strong></td><td>Comment améliorer la qualité de ses données ?</td><td></td><td><a href="/pages/vXPyxT5ZMXUlBeBCfBdO">/pages/vXPyxT5ZMXUlBeBCfBdO</a></td><td>null</td><td></td></tr><tr><td><strong>Guide juridique</strong></td><td>Quelles données doivent être publiées en open data ?</td><td></td><td><a href="/pages/WvU6n2qMEifrfw9ScCHB">/pages/WvU6n2qMEifrfw9ScCHB</a></td><td>null</td><td></td></tr></tbody></table>

{% hint style="info" %}
Vous ne trouvez pas ce que vous cherchez ?

Jeter un œil sur notre [**foire aux questions**](/foire-aux-questions)**.**
{% endhint %}


# Foire aux questions

Des questions auxquelles nous ne sommes pas à même de répondre nous sont souvent adressées. Pour essayer de vous aider néanmoins nous listons ici les questions plus fréquentes.

<details>

<summary>Questions sur le changement de portail DataSud</summary>

* **Je n'arrive plus à me connecter sur DataSud avec mes anciens identifiants et je reçois un message comme quoi mon compte n’existe pas et aucun compte trouvé pour cette adresse e-mail ?** Les anciens comptes n'ont pas été transférés sur le nouveau portail et vos anciens identifiants ne fonctionnent plus; il faut vous réinscrire sur DataSud.fr en créant un nouveau profil utilisateur <https://www.datasud.fr/login/fr/signin/>
* **Je crée un nouveau compte en respectant les critères de création du mot de passe**.   8 caractères et même plus; Au moins une minuscule ; Au moins une majuscule et au moins un chiffre. Pourtant je vois un message d'erreur me disant que je ne respecte pas les critères du mot de passe: Si le problème de création de compte persiste, contactez l'équipe [en utilisant le formulaire](https://www.datasud.fr/portal/contact)&#x20;

</details>

<details>

<summary>Question sur les données qui étaient publiées sur l'ancien portail DataSud</summary>

* **Que sont devenues mes publications de données qui étaient sur l'ancien portail ?** Les jeux existants au catalogue de votre organisation ont été rapatriés sur le nouveau DataSud et seront associés automatiquement à votre nouveau compte utilisateur en tant qu’administrateur délégué de votre organisation.
* **Depuis la migration de mes jeux de données sur le nouveau portail, je les retrouve scindés en plusieurs jeux de données avec l'annotation supplémentaires 1/2 ou 2/2 ?** \
  Quand il s'agit de 2 ressources différentes, DataSud permet de publier 1 jeu de données  avec 1 ressource principale et des fichiers annexes.\
  En revanche il est désormais possible d'associer plusieurs jeux de données à un jeu de données "parent". Voici le mode d'emploi <br>

</details>

{% embed url="<https://www.youtube.com/watch?v=7gXbh3AOwrI>" %}

<details>

<summary>Questions sur la recherche des données</summary>

* Sur la page d'accueil de DataSud.fr, le moteur de recherche permet de rechercher les données par mots clés, si les premiers résultats ne sont pas adaptés à vos besoins, vous pouvez associer des filtres sur la partie gauche de l'écran de la page d'[Explorer](https://www.datasud.fr/explorer/fr/recherche) pour filtrer les recherches par Univers; Thématiques; Organisations; Mots clefs; Types; Territoire; Licences; Services ( WFS, WMS, WS); Formats; Date de publication et Fréquence de mise à jour.
* J’aimerai savoir où se trouve une donnée que je cherche, et savoir si une organisation la publie, et si d’autres collectivité du territoire publie le même type de donnée:&#x20;
  * soit vous utilisez la recherche par mot clé
  * soit vous vous laissez guider par la proposition de jeux de données similaires à ceux que vous aviez consultés<br>

</details>

<details>

<summary>Questions sur le choix du portail où publier mes données</summary>

* Pourquoi publier sur le portail de données DataSud.fr plutôt que sur le portail national ? En faisant le choix de publier vos données sur DataSud.fr vous contribuez à la co-construction d'un hub de données régionales enrichies; vous pouvez compter sur une équipe dédiée pour vous accompagner dans vos publications y compris sur les questions de traitements de données à caractères géographiques.
* Le modules MAPS proposé sur DataSud apporte une valeur ajoutée à vos données géo

</details>

<details>

<summary>Question sur les organisations contributrices au catalogue de DataSud </summary>

Notre équipe n'est pas en charge de la production des données publiées sur DataSud par des organisations autres que la Région Sud; \
Ainsi pour prendre contact avec une organisation productrice de données, veuillez soit écrire un mail au Contact associé aux jeux de données, soit écrire aux administrateurs de DataSud par le formulaire et nous veillerons à relayer votre demande auprès des producteurs de données que vous recherchez

</details>

<details>

<summary>Les données du jeu de données ne s'affichent pas</summary>

Si vous êtes producteur de ces données, Il y a plusieurs raisons qui peuvent expliquer qu'une donnée ne s'affiche pas sur Explorer

* soit le jeu de données est masqué, c'est à dire qu'il est présent dans votre répertoire de données mais il a le statut de données privées. Pour changer ce mode publication, il faut changer le niveau de permission par défaut de votre jeu de données ( voir Publier un [jeu de données](https://maregionsud.gitbook.io/guides-datasud/guide-datasud.fr/jeux-de-donnees/publier-un-jeu-de-donnees) )
* soit le jeu de donnée qui a été migré de l'ancien catalogue  n'a pas été correctement republié dans le nouveau DataSud.fr, auquel cas le producteur devra veiller à mettre à jour manuellement les métadonnées et le fichier de données. Il suffit simplement d'enregistrer votre publication pour corriger les problèmes d'affichages des données.

</details>

<details>

<summary>Question sur la marque blanche de DataSud</summary>

L'utilisation de la marque blanche permet de rendre consultable les données que vous publiez dans DataSud  sur votre propre site internet ; le service est décrit sur cette [page](https://www.datasud.fr/portal/services/marque-blanche).<br>

* **Le service de Marque Blanche est-il opérationnel ?** le service est déployé sur le nouveau DataSud; même si le paramétrage n'a pas été possible dès l'ouverture du site en mars 2024, il est dorénavant fonctionnel

</details>

<details>

<summary>Question <strong>sur le</strong> service MAJIC ( Mise A Jour des Informations Cadastrales )</summary>

Le service MAJIC permet aux utilisateurs de télécharger les données littérales du cadastre de son territoire de compétence. Ces données MAJIC sont disponibles au téléchargement pour les partenaires de la Région Provence-Alpes-Côte d’Azur sous réserve d’être ayants droit de la Direction générale des Finances publiques.\
Pour en savoir plus sur le service MAJIC <https://www.datasud.fr/portal/services/majic>

</details>

<details>

<summary>Question relative à des données personnelles</summary>

L'organisme en mesure de vous aider est [la Commission nationale de l'informatique et des libertés (CNIL)](https://www.cnil.fr/).

</details>


# Documentation de datasud.fr

Cette documentation est destinée à vous accompagner dans l'utilisation du portail Datasud.fr

{% hint style="info" %}
**Qu'est-ce que datasud.fr ?**\
**DataSud est l’infrastructure mutualisée de données ouvertes et géographiques en Provence Alpes Côte d’Azur.** Elle est un des outils majeurs de la démarche de [Plateforme connaissance du territoire régional](https://connaissance-territoire.maregionsud.fr/la-plateforme/la-plateforme-presentation-generale/quest-ce-que-la-plateforme) pour favoriser la **connaissance du territoire régional.**&#x20;

**Guichet centralisé et sécurisé,** faisant le lien avec de nombreux portails locaux comme nationaux, Datasud.fr met à disposition de nombreuses données **publiques comme privées**. Elle vise à favoriser la transparence et l’efficacité de l’action publique tout en facilitant la création de nouveaux services.\
\
Le catalogue de données et de service Datasud.fr s’adresse :

* À ceux qui produisent des données (producteurs de données) et qui souhaitent ouvrir leurs données ;
* À ceux qui exploitent des données (réutilisateurs de données) et qui veulent télécharger des données et partager leurs réalisations ;
* À tout citoyen qui souhaite découvrir des données ou trouver une information.

Tout les acteurs du territoire régional ont la possibilité de publier sur datasud.fr !
{% endhint %}

<div><figure><img src="https://gitlab.datasud.fr/projets_publics/guide_datasud/-/blob/fb5d4df5ab6f2531de9609ea0189ae7527734667/Ressources_ill/DataSud_OGS.png" alt=""><figcaption></figcaption></figure> <figure><img src="https://gitlab.datasud.fr/projets_publics/guide_datasud/-/blob/main/Ressources_ill/DataSud_OGS.png" alt=""><figcaption></figcaption></figure> <figure><img src="https://gitlab.datasud.fr/projets_publics/guide_datasud/-/blob/fb5d4df5ab6f2531de9609ea0189ae7527734667/Ressources_ill/DataSud_OGS.png" alt=""><figcaption></figcaption></figure></div>


# Créer un compte utilisateur, un groupe et rejoindre une organisation

{% hint style="info" %}
**Pourquoi créer un compte utilisateur ?**

Le téléchargement de jeux de données ne requiert pas d’inscription sur datasud.fr mais le fait de s'enregistrer avec un compte utilisateur permet notamment de :

* publier des données ;
* référencer des réutilisations de données ;
* suivre les publications d’un autre utilisateur ( à venir ) ;
* créer, rejoindre une organisation.
  {% endhint %}

## Créer un compte utilisateur <a href="#comment-sinscrire" id="comment-sinscrire"></a>

<details>

<summary>Comment créer un compte utilisateur</summary>

1. Rendez-vous sur : <https://www.datasud.fr/login/fr/signin/> ;
2. Saisissez vos **Prénom**, **Nom** et **Adresse e-mail** ;\
   *Le nom d'utilisateur est généré automatiquement à partir de la première lettre de votre prénom et de votre nom. Il n'est pas modifiable.*

<img src="/files/ep7gSlLjYLOKyqqD7P7n" alt="" data-size="original">

3. Saisissez votre **Mot de passe** et confirmez-le ;\
   *Le mot de passe doit comporter au moins 8 caractères, dont 1 majuscule, 1 minuscule et 1 chiffre.* \
   *Vous pouvez utiliser les caractères spéciaux suivants : $ & + , : ; = ? # | ' < > . ^ \* ( ) % ! -.*

<img src="/files/CT8jW9KcamQcbV0RmwNY" alt="" data-size="original">

4. Sélectionnez votre organisation dans la liste des organisations déjà inscrite dans Datasud.fr. **Si votre organisation n'apparait pas dans la liste, vous pouvez indiquer une nouvelle organisation.** ( voir le chapitre Créer ou rejoindre une organisation)
5. Acceptez les [conditions générales d’utilisation du service](https://www.datasud.fr/portal/conditions-generales-utilisation) ;
6. Cliquez sur le bouton **"Valider"** ;\
   Un message va alors apparaître à l’écran, vous demandant de confirmer votre adresse e-mail.

<img src="/files/NIIuifV3m7GLoiHZFDkf" alt="" data-size="original">

Une fois le formulaire d’inscription validé, rendez-vous dans la boîte de réception associée à l’adresse e-mail que vous avez saisie.

7. Afin de finaliser votre inscription, ouvrez l’e-mail qui vous a été envoyé par `no-reply@datasud.fr` puis cliquez sur le lien hypertexte ou recopiez le dans votre navigateur
8. Ce lien hypertexte vous redirige vers le site[ datasud.fr](https://www.datasud.fr/) pour de nouveau confirmer votre inscription en cliquant sur le bouton Cliquez ici ( joindre l image Confirmer\_inscription.JPG)
9. Vous avez désormais accès à votre compte utilisateur et vous pouvez contribuer à publier des données ou accéder à certains services cartographiques ( joindre l image menu modules.JPG)

</details>

## Créer ou rejoindre un groupe

OneGeo Suite utilise le concept de groupes pour autoriser l'accès à certaines données en accès restreins :

* un utilisateur peut appartenir à un ou plusieurs groupes (ou à aucun)
* au sein d’un groupe, chaque utilisateur a un **rôle**

#### Comment créer un groupe

Dans l'espace de gestion des comptes <https://www.datasud.fr/publish/fr/accounts>

1. Cliquer sur nouveau groupe d'utilisateurs
2. Choisissez un Nom du groupe
3. Rédiger une description du groupe d'utilisateurs
4. Enregistrer et continuer

## Rejoindre une organisation <a href="#creer-un-compte-utilisateur" id="creer-un-compte-utilisateur"></a>

{% hint style="info" %}
**Pourquoi rejoindre une organisation ?**

Si vous pensez que vous devriez figurer dans la liste des personnes pouvant éditer des données pour une organisation existante sur DataSud, vous pouvez demander à la rejoindre afin de :

* publier des jeux de données pour le compte d’une organisation publique ou privée (administration, collectivité, association, entreprise, etc. ) ;
* permettre à des éditeurs dans un groupe d'organisation de publier et modifier des jeux de données rattachés à son groupe / organisation.
  {% endhint %}

La marche à suivre est explicitée ci-dessous :&#x20;

{% embed url="<https://www.youtube.com/watch?v=ykZX4W1piAs>" %}

<details>

<summary>Comment rejoindre une organisation</summary>

1. Créer un compte utilisateurs sur <https://www.datasud.fr/login/fr/signup/>
2. Sélectionnez votre organisation dans la liste des organisations existantes
3. Cliquez sur Valider

L’administrateur délégué de l’organisation devra ensuite accepter votre demande.

</details>

Si votre organisation n'existe pas, il est possible de la créer. La procédure est explicitée [ici](/guide-datasud.fr/organisation).


# Organisation

{% hint style="info" %}
**Qu'est-ce qu'une organisation sur datasud.fr ?**

Une organisation est une personne morale (autorité administrative, association, entreprise) ou un groupe informel (groupes de travail, pôles métier, filières) au travers desquels plusieurs utilisateurs peuvent collaborer. Les jeux de données publiés au nom de l’organisation peuvent être édités par les éditeurs ou administrateurs délégués de l’organisation.\
Elle peut contenir plusieurs utilisateurs et un même utilisateur peut appartenir à plusieurs organisations.
{% endhint %}

**Dans cette section, vous apprendrez à :**

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th data-hidden></th><th data-hidden></th><th data-hidden data-type="content-ref"></th><th data-hidden></th><th data-hidden data-type="content-ref"></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Créer une organisation</strong></td><td></td><td></td><td><a href="/pages/eFVdLz8tB3Q6qWWdhhhe">/pages/eFVdLz8tB3Q6qWWdhhhe</a></td><td></td><td><a href="/pages/eFVdLz8tB3Q6qWWdhhhe">/pages/eFVdLz8tB3Q6qWWdhhhe</a></td><td><a href="/pages/eFVdLz8tB3Q6qWWdhhhe">/pages/eFVdLz8tB3Q6qWWdhhhe</a></td></tr><tr><td><strong>Suivre l'activité et modifier votre organisation</strong></td><td></td><td></td><td><a href="/pages/JGCa5kTvgRX8JMPbutY8">/pages/JGCa5kTvgRX8JMPbutY8</a></td><td></td><td><a href="/pages/JGCa5kTvgRX8JMPbutY8">/pages/JGCa5kTvgRX8JMPbutY8</a></td><td><a href="/pages/JGCa5kTvgRX8JMPbutY8">/pages/JGCa5kTvgRX8JMPbutY8</a></td></tr><tr><td><strong>Gérer les membres de votre organisation</strong></td><td></td><td></td><td><a href="/pages/1YTbOXJZDCpE212QdPJd">/pages/1YTbOXJZDCpE212QdPJd</a></td><td></td><td><a href="/pages/1YTbOXJZDCpE212QdPJd">/pages/1YTbOXJZDCpE212QdPJd</a></td><td><a href="/pages/1YTbOXJZDCpE212QdPJd">/pages/1YTbOXJZDCpE212QdPJd</a></td></tr><tr><td><strong>Supprimer une organisation</strong></td><td></td><td></td><td><a href="/pages/hfgV6JmYpv7KTqXohufL">/pages/hfgV6JmYpv7KTqXohufL</a></td><td></td><td><a href="/pages/hfgV6JmYpv7KTqXohufL">/pages/hfgV6JmYpv7KTqXohufL</a></td><td><a href="/pages/hfgV6JmYpv7KTqXohufL">/pages/hfgV6JmYpv7KTqXohufL</a></td></tr></tbody></table>


# Créer une organisation

{% hint style="info" %}
**Pourquoi créer une organisation ?**

Nous vous conseillons de créer une organisation ou de rejoindre une organisation existante si vous souhaitez :

1. publier des jeux de données pour le compte d’une organisation publique ou privé (administration, collectivité, association, entreprise, etc. );
2. permettre à des utilisateurs différents de publier et modifier des jeux de données sous le même nom, la même bannière.
   {% endhint %}

La marche à suivre est détaillée ci-dessous :

<details>

<summary>Comment créer une organisation</summary>

1. Rendez-vous sur : <https://www.datasud.fr/login/fr/signup> ;
2. Recherchez si votre organisation existe dans la liste des organisations déjà inscrites dans DataSud ; si cette liste ne propose qu'une partie des organisations présentes au catalogue, elle se mettra à jour au fur et à mesure de votre saisie.
3. Si votre organisation n'est pas dans la liste, vous pouvez créer une nouvelle organisation. en cliquant sur "indiquer une nouvelle organisation".&#x20;
4. Le formulaire ouvre ainsi de nouveau champ pour créer une nouvelle organisation

Les champs à renseigner obligatoirement sont :\
**Nom** **de l'organisation** ( Inscrivez le nom public de votre organisation en toutes lettres)\
**Type d'organisation** ( à choisir dans la liste : Organisme privé, Etablissement de recherche et Enseignement, Secteur associatif, Etablissement public, Collectivité territoriale, Service de l'État ou autre.

Les champs facultatifs sont : \
**Sigle** : le sigle de votre organisation, s’il existe. Par exemple : DGFIP pour la Direction générale des Finances publiques. Le sigle est facultatif.\
**Numéro SIRET :** identifiant de 14 chiffres attribué à chaque entreprise ou établissement.\
**Logo de l'organisation :** Pour importer un logo, cliquez sur le bouton "+Ajouter un logo" depuis votre ordinateur. Les formats d’image acceptés sont png ; jpg/jpeg (taille maximale : 2 Mo).\
**Site internet :**  si votre organisation possède un site web, renseignez son URL.\
**Numéro de téléphone**\
**Adresse postale**\
**Description de l'organisation** : indiquez ce que fait votre organisation et quelle mission elle remplit.\
**Ajouter cette organisation à des groupe d'organisations :** L'ajout de cette organisation à un groupe d'organisation donnera accès aux données et collections de données associées à ce groupe d'organisation.

5. Cliquez sur Valider pour terminer la création de votre organisation

</details>


# Suivre l'activité et modifier son organisation

Les activités de votre organisation pourront être consultées à partir d’un tableau de bord qui centralisera plusieurs informations **( fonctionnalités à venir )**  :

* la description de l’organisation et la liste de ses utilisateurs ( enregistrés, éditeurs ou administrateurs délégué) ;
* les métriques rattachées à chaque jeu de données, ressource ou réutilisation publiés ;
* les anomalies constatées à propos des jeux de données publiés ;

La procédure pour suivre l'activité de son organisation est détaillée ci-dessous :

<details>

<summary>Comment suivre l'activité de son organisation</summary>

1. Rendez-vous sur : [datasud.fr/publish/fr/accounts](https://www.datasud.fr/publish/fr/accounts)
2. Choisissez votre organisation dans la gestion des comptes ;

</details>

<details>

<summary>Comment télécharger et explorer le catalogue de données d'une organisation ( à venir)</summary>

1. Rendez-vous sur la page de l'organisation correspondante ;
2. Cliquez sur le bouton "Télécharger la liste au format CSV" ;

</details>


# Gérer les membres de son organisation

## Comprendre les droits des membres d'une organisation

Une organisation se compose d’administrateurs délégués, d’éditeurs et d'utilisateurs enregistrés qui ont des rôles différents. Leur rôle définit les actions que l’utilisateur peut effectuer.&#x20;

Un utilisateur peut avoir différents rôles dans différents groupes. \
\
Les droits associés aux rôles sont détaillés ci-dessous :

1. `Utilisateur enregistré` : l’utilisateur peut consulter et télécharger les données protégées associées à son groupe
2. `Editeur` : l’utilisateur peut publier de nouveaux jeux de données au nom de son groupe et éditer les jeux de données de son groupe
3. `Administrateur délégué` : l’utilisateur est l’administrateur de son groupe. Il peut créer de nouveaux utilisateurs dans son groupe. Il peut modifier les rôles des utilisateurs de son groupe. Il peut éditer les informations de son groupe.

Les rôles sont hiérarchiques et basés sur l’héritage. Ainsi le rôle **Administrateur** dispose également de tous les droits du rôle **Éditeur**, qui dispose lui-même des droits du rôle **Utilisateur enregistré**.

## Ajouter un utilisateur à une organisation <a href="#ajouter-un-utilisateur-a-une-organisation" id="ajouter-un-utilisateur-a-une-organisation"></a>

<details>

<summary>Comment ajouter un membre à son organisation ?</summary>

**Les groupes et les utilisateurs peuvent être gérés via le module Publish, dans la rubrique “Gestion des comptes”.** \
Un utilisateur rattaché à un groupe / une organisation peut accéder à la page d’édition de ce groupe / cette organisation mais ne peut pas le / la modifier, sauf s’il dispose du rôle “Administrateur délégué ” pour ce groupe / cette organisation.

Seuls les administrateurs délégués peuvent ajouter un utilisateur à une organisation :&#x20;

1. [Connectez-vous à votre compte](https://www.datasud.fr/login/fr/signin/) ;
2. Cliquer sur **"Publier des données"** en haut à droite de votre prénom ;
3. Rendez-vous sur l'espace [Publish de gestion des comptes](https://www.datasud.fr/publish/fr/accounts) ;

Soit la création d’un utilisateur est le fait d'un administrateur, et dans ce cas un mail de confirmation de la création de son compte est envoyé à l’adresse mail renseignée. Dans ce mail, il est expliqué à l’utilisateur qu’il doit effectuer une demande de mot de passe oublié à sa première connexion.

Soit l'utilisateur a déjà réalisé une demande de création de compte sur DataSud, et il revient à l'administrateur délégué de l'organisation de valider la nouvelle demande de rattachement

Lorsqu'un nouvel inscrit sur DataSud demande à être rattaché à une organisation, l'administrateur délégué de cette organisation, sera informé par mail et pourra valider ou refuser le rattachement du nouvel inscrit.

Pour ce faire : Allez sur la page de suivi de votre organisation à laquelle vous souhaitez ajouter un utilisateur :

1. Dans le bloc **"Utilisateur"**, cliquez sur Ajouter de nouveaux utilisateurs  ;
2. Saisissez le prénom et le nom de l’utilisateur à ajouter, puis sélectionnez-le quand vous le voyez apparaître dans la liste ;
3. Définissez le rôle que vous souhaitez lui accorder, en le faisant **"Utilisateur enregistré", "Editeur"** ou **"Administrateur délégué"** ;
4. Cliquez sur le bouton **Valider** pour valider l’ajout du membre.

</details>

## Retirer un membre d’une organisation <a href="#retirer-un-utilisateur-dune-organisation" id="retirer-un-utilisateur-dune-organisation"></a>

{% hint style="danger" %}
Retirer un utilisateur d’une organisation ne supprime pas le compte de l’utilisateur en question.
{% endhint %}

<details>

<summary>Comment retirer un membre d'une organisation ?<br>Seuls les administrateurs délégués d'une organisation peuvent retirer un membre</summary>

1. [Connectez-vous à votre compte](https://www.datasud.fr/login/fr/signin/) ;
2. Cliquer sur **"Publier des données"** en haut à droite de votre prénom ;
3. Rendez-vous sur l'espace [Publish de gestion des comptes](https://www.datasud.fr/publish/fr/accounts) ;
4. Dans le bloc **"Utilisateur"**, cliquez sur Voir les utilisateurs
5. Dans le bloc "**Organisation"** cliquez sur la corbeille pour supprimer cet utilisateur de la liste des personnes autorisées. Il est également possible de lui changer son rôle sans nécessairement le supprimer des utilisateurs.&#x20;

</details>


# Groupes d’organisations

Les organisations peuvent être rassemblées au sein d’un même groupe d'organisations.

Un groupe d'organisation permet de donner des droits d'accès spécifique à une donnée.&#x20;

Afin de faciliter cette opération lorsque de nombreux groupes de type “organisation” sont concernés par la même permission, il est possible de créer des groupes d’organisations.&#x20;

On rassemble ainsi plusieurs organisations au sein d’un même groupe, sur lequel on peut directement appliquer une permission, qui profitera directement à toutes les organisations de ce groupe.

**Attention, cette possibilité ne concerne que les organisations, pas les simples groupes.**


# Configuration de permissions particulières des jeux de données

Lorsqu'un contributeur publie un jeu de donnée sur DataSud, il peut configurer les droits pour déterminer qui a accès à la fiche de métadonnées, qui accède aux ressources et dans quelles conditions.

Pour attribuer des permissions particulières, DataSud fonctionne au niveau du groupe / de l’organisation. C’est-à-dire qu’il est possible de définir un niveau d’accès différent pour chaque groupe / organisation enregistré(e) dans la plateforme.&#x20;

Pour cela, il faut :

1. Cliquer sur le bouton « Accès à la donnée » du formulaire d’édition de la fiche
2. Consulter le niveau d’accès attribué par défaut à tout utilisateur qui n’a pas de droit spécifique
3. Sélectionner un(e) ou plusieurs organisations/groupes d’utilisateurs dans le tableau des filtres
4. Consulter le niveau d’accès particulier à ce(s) groupes(s)/organisation(s)
5. Configurer une permission particulière à ce(s) groupes(s)/organisation(s)
6. Configurer une permission d’accès en masse via le groupe d’organisation

<figure><img src="/files/vRHSwOxK54Od1S596ZC3" alt=""><figcaption></figcaption></figure>

### 1.    Accès à la page de gestion des permissions

Pour configurer les niveaux d’accès particuliers, il faut :

* Être éditeur de la donnée et se rendre sur la fiche de donnée a éditer dans Publish.
* Cliquer sur le bouton "Accès à la donnée" pour définir le système de permission pour cette donnée

<figure><img src="/files/HiYPbsWL2oSaGTfEi2ta" alt=""><figcaption></figcaption></figure>

### 2.  Consulter le niveau d’accès attribué par défaut au jeu de données

* Le nom de la donnée s’affiche ensuite sur le tableau de gestion des permissions particulières des jeux de données. Les modifications de permissions s’appliqueront à cette donnée uniquement.
* L’accès au jeu de donnée par défaut est affiché. **En vert, il s’agit de l’accès par défaut sélectionné**

<figure><img src="/files/TUdExebhh720utDV6wFy" alt=""><figcaption></figcaption></figure>

### 3.  Sélectionner un(e) ou plusieurs organisations/groupes d’utilisateurs dans le tableau

Une barre de recherche permet de rechercher une organisation, un groupe d’utilisateurs, ou un groupe d’organisations dans la liste, par son nom. Le filtre ne s’applique que sur le nom du groupe

<figure><img src="/files/akBEiJG6kuulerxnRTlt" alt=""><figcaption></figcaption></figure>

L’éditeur de la donnée peut aussi filtrer les organisations/groupes d’utilisateurs via ce tableau des filtres.

<figure><img src="/files/BuAShFBZAsCWLvztYRun" alt=""><figcaption></figcaption></figure>

Le tableau des filtres permet de filtrer :

* Par type de groupe (tous les groupes, seulement les organisations, seulement les groupes d’utilisateurs, ou seulement les groupes d’organisations)
* Par types d’organisations (service de l’état, collectivité territoriale, établissement public, secteur associatif, établissement de recherche, organisme privé, autre). Cette information est renseignée lors de la création d’une organisation.
* Par niveau d’accès. Si des permissions particulières ont été définies par organisation, les organisations peuvent être filtrées en fonction de leur niveau d’accès respectifs vis-à-vis de la donnée.

### 4.  Configurer une permission particulière à de(s) groupes(s)/organisation(s)

Une fois les filtres appliqués, l’utilisateur peut sélectionner le ou les groupes pour le(s)quel(s) il souhaite attribuer une permission particulière.

> ***Attention : les niveaux de permissions particuliers ne peuvent pas être inférieurs au niveau de permission par défaut de la donnée. Par exemple, l’éditeur ne peut pas créer un jeu de donnée avec comme permission par défaut « Téléchargement », et attribuer à une organisation la permission particulière « Consultation** ».*

Dans le tableau des groupes, l’éditeur de la donnée peut sélectionner en masse, ou un par un, les groupes auxquels il souhaite attribuer des permissions particulières.

<figure><img src="/files/7p7zE66JnvwXq87G5BEy" alt=""><figcaption></figcaption></figure>

### 5. Configurer une permission d'accès en masse via le groupe d’organisation

Après avoir sélectionné les groupes pour lesquels créer des niveaux d’accès particulier, le champ « choisir une action » permet d’opérer 4 actions sur les permissions particulières de ces groupes.

* Si la permission par défaut du jeu de donnée est « privée » :
  * et qu’un groupe a des permissions supérieures ! il est possible de supprimer ces permissions avec l’action « **supprimer les droits d’accès** » puis « **envoyer** ».
  * et que l’éditeur de la donnée souhaite accorder les droits de recherche à un groupe, il peut le faire avec l’action « **accorder les droits de recherche** » puis « **envoyer** ».
* Si la permission par défaut du jeu de donnée est « donnée privée » ou « recherche », et que l’éditeur souhaite accorder les droits de consultation à un groupe, il peut le faire avec l’action « **accorder les droits de consultation** », puis « **envoyer** ».
* Si la permission par défaut est « donnée privée », « recherche », ou « consultation », et que l’éditeur souhaite accorder les droits de téléchargement à un groupe, il peut lui donner avec l’action « **accorder les droits de téléchargement** », puis « **envoyer** ».

<figure><img src="/files/1nuxwUlATg05jijh7gKW" alt=""><figcaption></figcaption></figure>

<figure><img src="/files/s3ETgB22hNUM4XQ2sNeV" alt=""><figcaption></figcaption></figure>


# Supprimer une organisation

{% hint style="warning" %}
Lorsqu'une organisation est supprimée, les contenus publiés en son nom *restent en ligne*, aux mêmes URL, mais sous forme anonyme, c’est-à-dire sans être rattachés à un producteur de données.\
\
Si vous souhaitez *aussi* supprimer les données publiées par l’organisation que vous êtes sur le point de clôturer, commencez par supprimer les jeux de données *avant* de supprimer l’organisation.
{% endhint %}

La marche à suivre est illustrée ci-dessous :

<details>

<summary>Comment supprimer une organisation ?</summary>

1. [Connectez-vous à votre compte](https://www.datasud.fr/login/fr/signin/) (rappel : seuls les administrateurs peuvent supprimer une organisation) ;
2. Cliquer sur **"Publier des données"** en haut à droite de votre prénom ;
3. Rendez-vous sur l'espace [Publish de gestion des comptes](https://www.datasud.fr/publish/fr/accounts) ;
4. Dans le bloc **"organisation",** allez sur la ligne de votre organisation et cliquer sur la corbeille rouge pour supprimer votre organisation

</details>


# Jeux de données

{% hint style="info" %}
**Qu'est-ce qu'un jeu de données sur Datasud ?**

C'est un ensemble de ressources ou d’informations (fichiers de données, fichiers d’explications, API etc.) et de métadonnées (description, producteur, date de publication, mots-clefs, couverture géographique temporelle etc.) sur un thème spécifique.
{% endhint %}

Dans cette section, vous apprendrez à :

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th></th><th></th><th data-type="content-ref"></th><th data-hidden></th><th data-hidden></th><th data-hidden data-card-target data-type="content-ref"></th><th data-hidden></th></tr></thead><tbody><tr><td><strong>Publier un jeu de données</strong></td><td></td><td></td><td></td><td></td><td></td><td><a href="/pages/lsSvuXwaG0O3WtPYmgMh">/pages/lsSvuXwaG0O3WtPYmgMh</a></td><td></td></tr><tr><td><strong>Utiliser différents modes de publication de vos ressources</strong></td><td></td><td></td><td></td><td></td><td></td><td><a href="/pages/8V83G6avHYjQe9FoG7QN">/pages/8V83G6avHYjQe9FoG7QN</a></td><td></td></tr><tr><td><strong>Gérer un jeu de données</strong></td><td></td><td></td><td></td><td></td><td></td><td><a href="/pages/NUfJ9nPU2RMnaDrDh0JS">/pages/NUfJ9nPU2RMnaDrDh0JS</a></td><td></td></tr><tr><td><strong>Indexer un catalogue de données</strong></td><td></td><td></td><td></td><td></td><td></td><td><a href="/pages/moRKIgKkOQHdgPnueEkT">/pages/moRKIgKkOQHdgPnueEkT</a></td><td></td></tr><tr><td><strong>Paramétrer le jeu de donnée</strong>  </td><td></td><td></td><td></td><td></td><td></td><td></td><td></td></tr></tbody></table>


# Publier un jeu de données

Le module  Publish permet de créer des fiches de métadonnées, de publier des ressources, et de gérer les droits d'accès à ces fiches et aux ressources publiées.

{% hint style="info" %}
En amont de la publication de données sur datasud.fr, il est important de bien préparer le jeu de données. \
Pour ce faire, nous vous invitons à consulter [guide qualité](/guides-open-data/guide-qualite) rédigé par les équipes de Data.gouv.fr
{% endhint %}

Le module de publication des données est accessible aux utilisateurs authentifiés sur Datasud.fr. Cette capacité d'édition n'est utile qu'aux utilisateurs ayant au moins un rôle d'éditeur au sein d'un groupe/ une organisation, leur permettant de publier des fiches de métadonnées et des ressources pour ce groupe/ cette organisation. <br>

L'éditeur d'un groupe / d'une organisation, peut éditer tous les jeux de données rattachés à son groupe / organisation.

La création d'un nouveau jeu de données se fait soit en cliquant sur le bouton **Nouveau jeu de données** situé sur la page d'accueil de publish, ou bien situé au-dessus du tableau général des jeux de données de votre organisation.

<div><figure><img src="/files/4Nr3yf5LPg3OpG0Cnjol" alt=""><figcaption></figcaption></figure> <figure><img src="/files/JhjQTOMkCM47k6ve6D91" alt=""><figcaption></figcaption></figure></div>

Une fois le formulaire de création d'un Nouveau jeu de données ouvert, on distingue la publication de la fiche de données, qui concerne toutes les informations attributaires sur la donnée, et la ressource ajoutée.

La saisie des informations se fait en plusieurs grandes étapes :

* **Décrire les métadonnées du jeu de données** c'est à dire de toutes les informations utiles à la description du jeu de données : le titre, la description, les mots-clés, la fréquence de mise à jour, la licence applicable, etc.
* **la publication de la ressource principale**, qui peut être sous forme d'un fichier, d'une table de base de données, d'un flux cartographique, etc.
* **le chargement de ressources annexes** qui viennent compléter le jeu de données : un fichier de licence, une documentation, une carte, etc.

{% tabs %}
{% tab title="Décrire le jeu de données" %}
*\*Les champs identifiés par un astérisque sont obligatoires.*

L'étape de description est cruciale pour que vos jeux de données soient bien valorisés<br>

<table><thead><tr><th width="288">Information</th><th>Description de l'information</th></tr></thead><tbody><tr><td>Nom du jeu de données*</td><td>Le titre de votre jeu de données doit être précis et spécifique. Il s'agit du titre de la fiche, qui sera mis en avant dans les résultats de recherche. Lors de la création de la fiche, un code identifiant va être créé à partir de ce titre. <br>Par exemple, pour une fiche dont le nom saisi est "Suivi de la déforestation en 2023", le code créé sera "suivi-de-la-deforestation-en-2023"<br>Cet identifiant unique apparaitra dans l'URL de la fiche de consultation et il ne changera plus jamais, même si le titre de la fiche est modifié ultérieurement. Il est donc important de choisir dès le départ un titre cohérent avec la fiche, au risque d'avoir ensuite une URL sans rapport à la fiche consultée.</td></tr><tr><td>Description*</td><td>La description de votre jeu de données permet aux personnes qui le consultent d’obtenir des informations sur le contenu et la structure des ressources publiées. Ce champ libre permet d'indiquer une description longue du jeu de données. La syntaxe markdown est supportée. Il existe de nombreux guides sur l'usage du markdown, par exemple sur <a href="https://www.markdownguide.org/cheat-sheet/">https://www.markdownguide.org/cheat-sheet/</a></td></tr><tr><td>Mots clés*</td><td>Les mots clés caractérisent votre jeu de données. Ils apparaissent sur la page de présentation et apportent un meilleur référencement du jeu de données lors d’une recherche utilisateur. Lors de la saisie d'un mot-clé, un système d'autocomplétion propose de sélectionner un mot-clé existant, déjà saisi dans une autre fiche. La suppression d'un mot-clé saisi se fait en cliquant sur la croix à droite du libellé du mot-clé.</td></tr><tr><td>Catégories OneGeo Suite</td><td>Ces catégories sont utilisées dans une facette de recherche du module de consultation des fiches de données (Explorer). <br>Choisir la(les) catégorie(s) dans laquelle(lesquelles) apparaitront les données dans les univers de DataSud <a href="https://www.datasud.fr/portal/univers">https://www.datasud.fr/portal/univers</a></td></tr><tr><td>Thématiques*</td><td>En complément des Catégories ci dessus, il s'agit d'une liste de 16 thématiques fréquemment utilisées dans les standards et/ou les catalogues de données. Un système de relations entre ces thématiques et celles utilisées par les catalogues amenés à être indexées, afin d'associer aux mieux des fiches provenant de catalogues externes avec les thématiques de DataSud.<br>Choisir la(les) thématique(s) dans laquelle(lesquelles) apparaitront les données.</td></tr><tr><td>Type de données*</td><td>Le type de données est un élément supplémentaire de qualification de la donnée décrite.<br>Choisir le(les) type(s) de données parmi 2 proposition Données géographiques ou autre</td></tr><tr><td>Préconisation d'usage</td><td>Texte libre permettant d'indiquer d'éventuelles préconisations à l'usage de la donnée</td></tr><tr><td>Limite d'utilisation</td><td>Texte libre avec une proposition d'options prédéfinies pour faciliter la saisie</td></tr><tr><td>Nom de l'organisation ou du groupe d'utilisateurs*</td><td><p>Cette section permet de sélectionner l'organisation ou le groupe d'utilisateurs auquel sont rattachés la fiche et la donnée publiée. Elle n'est présente que lors de la création de la fiche. <br>Rechercher un(e) organisation/groupe d'utilisateurs dans la barre de recherche. </p><ul><li>le choix est <strong>définitif</strong>, une fois la fiche créée, il n'est plus possible de modifier le groupe de rattachement que l'on peut voir dans la colonne de droite.</li></ul><p>En mode édition, le nom du groupe est uniquement visible en lecture seule dans la colonne de droite.</p></td></tr><tr><td>Contacts</td><td>Il est possible de créer un nouveau contact ou de sélectionner un contact existant pour permettre aux utilisateurs de vos données de joindre directement le producteur. Un contact se compose à minima d'un nom et d'un email. Il est obligatoirement associé à une organisation. Il peut être complété par un numéro de téléphone et le nom d'un service. Lorsqu'un contact est sélectionné ou créé dans la fiche, il faut lui associer un rôle pour la fiche, parmi la liste de rôles prédéfinie. Par défaut, le rôle utilisé est "Point de contact".</td></tr><tr><td>Licence</td><td>Les licences définissent les règles de réutilisation des jeux de données publiés. En choisissant une licence de réutilisation, vous vous assurez que le jeu de données publié sera réutilisé selon les conditions d’usage que vous avez définies. Afin d’éviter la multiplication des licences, la<a href="https://www.legifrance.gouv.fr/affichTexteArticle.do?cidTexte=JORFTEXT000033202746&#x26;idArticle=JORFARTI000033203004&#x26;categorieLien=cid"> loi pour une République numérique</a> a prévu la création d’une liste de licences qui peuvent être utilisées par les administrations. Vous pouvez choisir la licence parmi une liste prédéfinie.</td></tr><tr><td>Copyright</td><td></td></tr><tr><td>Granularité de la couverture géographique</td><td><p>Vous pouvez choisir la granularité de la couverture géographique parmi une liste prédéfinie sur le niveau de détail géographique le plus fin que peut couvrir vos données. La granularité correspond au niveau administratif minimum auquel est défini les enregistrements composant la donnée. <br>Par exemple pour des données INSEE, il peut s'agir le plus souvent de l'IRIS ou de la commune.<br></p><p>Liste des granularités possibles</p><pre><code>Commune
Département
Intercommunalité (EPCI)
Indéfinie
IRIS (quartiers INSEE)
Parcelle cadastrale
Point d'intérêt (POI)
Région
</code></pre></td></tr><tr><td>Couverture géographique</td><td><p>Le choix de la couverture géographique parmi 3 options aura un impact sur le calcul de l'emprise de la donnée :</p><ul><li><p>le <code>calcul automatique de</code> l'emprise à partir des données : ne fonctionne qu'avec des données géographiques, il s'agit de l'emprise effective des données publiées. Il y a essentiellement 2 limites à cette option :</p><ul><li>les données non géographiques, mais qui concerne un territoire particulier</li><li>les données ayant une occurrence non homogène sur un territoire. <br>Par exemple, l'emprise d'un jeu de données sur les établissements sur une région se réduira généralement à quelques points alors que le jeu de données couvre toute la région.</li></ul></li><li>le <code>territoire de compétence</code> de l'organisation qui publie. Ce choix permet de forcer l'emprise sur celle du territoire sur lequel compétente l'organisation, quelle que soient les données publiées.</li><li>la <code>région</code> : pour les jeux de données couvrant l'ensemble de la zone concernée par la plateforme.</li></ul></td></tr><tr><td>Dates de création et de dernière révision</td><td>Il s'agit de dates systèmes, non éditables par le contributeur. La date de création correspond à la création de la fiche et celle de dernière révision correspond au dernier enregistrement de cette fiche.</td></tr><tr><td>Date de publication et de dernière mise à jour*</td><td>Il s'agit de dates saisies manuellement par le contributeur, qui peuvent être mises à jour à chaque édition.</td></tr><tr><td>Fréquence de mise à jour*</td><td><p>La fréquence de mise à jour correspond à la fréquence à laquelle vous prévoyez de mettre à jour les données publiées. Cette fréquence de mise permet d'informer l'utilisateur sur l'éventuelle prochaine mise à jour de la donnée.<br></p><p>Liste des fréquences de mise à jour</p><pre><code>Continue
Quotidienne
Hebdomadaire
Bi-mensuelle
Mensuelle
Trimestrielle
Semestrielle
Annuelle
Lorsque nécessaire
Irrégulière
Non planifiée
Inconnue
</code></pre></td></tr><tr><td>Millésime</td><td>Le millésime désigne l'année couverte par le jeu de donnée</td></tr><tr><td>Mode de constitution</td><td>Ce champ permet de renseigner le contexte de production des données, tel que le service ou les différentes organisations qui ont contribué à la création de ces données.</td></tr><tr><td><em><strong>Autres informations</strong></em></td><td><p></p><p>Le formulaire permet, depuis la colonne de droite de renseigner 2 informations supplémentaires :</p><ul><li>une vignette de prévisualisation, qui sera affichée dans la liste de résultats</li><li>la possibilité d'associer la fiche à un jeu de données <strong>parent</strong> parmi tous les autres jeu de données déjà publiés pour l'organisation</li></ul></td></tr></tbody></table>
{% endtab %}

{% tab title="Publier  la ressource principale" %}

#### Publier vos ressources principales et documentation associées (annexes)  <a href="#mise-a-disposition-par-api" id="mise-a-disposition-par-api"></a>

{% hint style="info" %}
Un jeu de données peut contenir plusieurs types de ressources (Fichier principal, documentation, code source, API, lien, Table en BDD, etc.).\
Lorsque les champs concernant  les métadonnée ont été renseignés, vous pouvez publier vos ressources depuis le même formulaire. \
Soit vous enregistrez la fiche de métadonnée une première fois et vous publiez la ressource plus tard, soit vous publiez la donnée directement avant le premier enregistrement.
{% endhint %}

Vous avez la possibilité d’importer vos fichiers sur datasud.fr selon différents modes de mise à disposition.

La publication d'une donnée peut être effectuée depuis 4 différents types de sources :

1/ depuis un fichier plat (Shape, GeoJSON, Excel, CSV, PDF, image, etc.) téléversé depuis votre ordinateur vers le serveur de DataSud,

2/ depuis une URL du fichier à téléverser dans l'entrepôt des données de DataSud

3 / depuis un entrepôt sFTP connecté à DataSud (pour les fichiers volumineux, difficilement téléversables)

4 / depuis une URL, vous pouvez créer un lien vers une ressource distante existante (référencement d'un site web ou d'une ressource en ligne) : Les informations contenues dans le fichier resteront hébergées sur le serveur distant fléché.

*La description complète des différents mode de publication avec des captures écran sera disponible prochainement*
{% endtab %}

{% tab title="Publier une annexe" %}

#### Publier vos ressources associées (annexes) <a href="#mise-a-disposition-par-api" id="mise-a-disposition-par-api"></a>

{% hint style="info" %}
L'édition des annexes s'effectuent de la même façon que les fichiers principaux mais leur previsualisation n'est jamais possible.\
DataSud ne permet que le téléchargement des annexes, et non leur prévisualisation!
{% endhint %}
{% endtab %}
{% endtabs %}

Lorsque la fiche de données a été enregistrée, le message suivant s’affiche : « Succès publish-dataset ».  Lorsque la ressource a été ajoutée (cela peut prendre quelques minutes), le message suivant s’affiche : « Succès geospatial-creation-scenario » :

<figure><img src="/files/3tCMAI8TXAUIGtUrvQTV" alt=""><figcaption></figcaption></figure>

Une fois le jeu de données créé, il sera automatiquement accessible dans le module Explorer.&#x20;

Toutes les informations ( métadonnées, fichier principaux et annexes) pourront ensuite être modifiées à tout moment, voire supprimées.

Pour gérer l'affichage de votre jeu de données, [consulter la documentation dédiée](/guide-datasud.fr/jeux-de-donnees/gerer-un-jeu-de-donnees)


# Utiliser différents modes de publication de vos ressources

Une fois que les rubriques concernant les métadonnées ont été renseignées, il est possible de publier la donnée elle-même (nommée ressource) depuis le même formulaire.

Le portail DataSud permet la publication d'une donnée avec 4 modes de publication différents :

1. **Depuis un fichier plat** (Shape, GeoJSON, Excel, CSV,etc.) qu'on téléverse du poste local,
2. **Depuis un lien de téléchargement d’une ressource,**
3. **Depuis un entrepot connecté à DataSud \_ Dépôt sFTP**
4. **Référencer une ressource via URL distante**

{% hint style="info" %}
En fonction du mode de publication et du format de votre fichier, divers scénarios sont automatiquement déroulés par DataSud.

Il est également possible d'indexer un catalogue distant. Ce mode de référencement des données nécessite de vous rapprocher des administrateurs de DataSud.fr pour ce faire. [( voir la page dédiée)](/guide-datasud.fr/jeux-de-donnees/indexer-un-catalogue-de-donnees-existant)
{% endhint %}

<figure><img src="/files/T5q15mO7kjPTVucG9ou4" alt=""><figcaption></figcaption></figure>

### 1 / Publication d**epuis un fichier plat**  <a href="#mise-a-disposition-directe-sur-data-gouv-fr" id="mise-a-disposition-directe-sur-data-gouv-fr"></a>

#### Les formats pris en charge

Il faut indiquer le format du fichier et sélectionner localement (depuis son poste) le fichier à téléverser. Les formats actuellement pris en charge sont les suivants :

* Fichiers structurés géographiques : GeoJSON, ShapeZIP et CSV (avec colonne X et Y), Shapefile, GEOTIFF, XML
* Fichiers structurés non géographiques : CSV, Excel, JSON
* Services OGC : WMS, WFS et WMTS
* Autres fichiers : ZIP, PDF, JPEG, PNG, autre

&#x20;**Informations à remplir au sujet de la ressource**

Lors de la publication de la ressource, l’éditeur de la donnée va renseigner les informations suivantes

* Son format (obligatoire) : Cette information va permettre, lors de la recherche des données via le catalogue, de trier les données par format,
* Nom (obligatoire)
* Description (facultatif)
* Type de ressource (facultatif)
* Date de dernière mise à jour de la ressource (facultatif)

### 2/ Publication d’un lien de téléchargement d’une ressource

#### Informations à remplir au sujet de la ressource

Lors de la publication de la ressource, l’éditeur de la donnée va renseigner les informations suivantes :

* Le format de la donnée disponible via le lien de téléchargement (obligatoire). Cette information va permettre, lors de la recherche des données via le catalogue, de trier les données par format.
* L’URL du fichier à référencer (obligatoire)
* Le nom de la ressource (obligatoire)
* Une description (facultatif)
* Un type (facultatif)
* Une date de dernière mise à jour (facultatif)

### 3/ Publication depuis un entrepôt, via sFTP

Dans le cas où l'on souhaiterait verser un ou plusieurs fichiers distants très volumineux (par exemple un fichier raster au format ECW), il peut être compliqué de le téléverser depuis son poste local. Il est alors possible d'accéder directement à un entrepôt de fichier situé sur DataSud. Cet entrepôt est accessible en sFTP aux contributeurs afin qu'ils puissent au préalable y déposer leurs fichiers volumineux. \
Le transfert de ces fichiers volumineux se fait alors via le protocole sFTP adapté à ce type de transfert, afin d’automatiser les publications depuis vos serveurs et non plus avec une solution HTTP(s) comme pour un téléversement depuis un fichier local.

Ce type de publication est également utile comme alternative au téléchargement d'un fichier depuis une URL, dans le cas où ce fichier ne serait pas disponible sur une URL publique.

**Pour déposer un fichier sur l’entrepôt sFTP DataSud, vous devez préalablement demander un accès à la plateforme sFTP à un administrateur de DataSud (**[**Datasud@maregionsud.fr**](mailto:undefined)**).**\
Une fois connecté, vous pouvez déposer des fichiers sur votre compte sFTP (compte unique pour l’organisation).

{% hint style="info" %}
Le dépôt sFTP passe par un logiciel SSH. Pour vous connecter à votre dépôt sFTP et y déposer un fichier, vous pouvez utiliser l'un de ces logiciels :

* Filezilla (The free FTP solution <https://filezilla-project.org/>)
* Putty ( 0.75 pour Windows - Télécharger sur <https://putty.fr.uptodown.com/windows>
* mobaXterm (MobaXterm free Xserver and tabbed SSH client for Windows sur <https://mobaxterm.mobatek.net/>)
  {% endhint %}

#### Informations à saisir au sujet de la ressource

Lors de la publication de la ressource, l’éditeur de la donnée va renseigner les informations suivantes :

* Son format (obligatoire). Cette information va permettre, lors de la recherche des données via le catalogue, de trier les données par format.
* Sélectionner la ressource à verser (obligatoire), une liste des fichiers disponible sur l’entrepôt de données de votre organisation s’affichera en menu déroulant. Si nous souhaitez lier un nouvel entrepôt de données à la plateforme DataSud, merci de contacter un administrateur de la plateforme.
* Le nom de la ressource (obligatoire)
* Une description (facultatif)
* Un type de ressource (facultatif) : n’apparait pas dans explorer.
* Une date de dernière mise à jour (facultatif)

### 4 / Référencement de l'URL d'une ressource disponible sur un site internet

Il est possible de déclarer comme donnée l'adresse URL d'un site Internet. Dans ce cas, il n'y a pas vraiment de données publiées, il s'agit plutôt d'un référencement.

#### Informations à saisir au sujet de la ressource

Lors de la publication de la ressource, l’éditeur de la donnée va renseigner les informations suivantes :

* Le format de la donnée disponible via le site internet (obligatoire)
* L’URL du site (obligatoire)
* Le nom de la ressource disponible ou du site (obligatoire)
* Une description (facultatif)
* Un type (facultatif)
* Une date de dernière mise à jour (facultatif)

***

### Scénarios de publication par type de fichier

<details>

<summary>La publication d'un fichier structuré géographique</summary>

* La publication donne lieu à la création d'une couche dans GeoServer et des services WMS et WFS associés;
* Dans Explorer, les données peuvent être prévisualisées en mode tableau et en mode carte.

</details>

<details>

<summary>La publication d'un fichier structuré non géographique</summary>

* La publication ne donne pas lieu à la création d’un flux GeoServer
* La publication donne lieu à la création d'un service WS, permettant de télécharger la donnée en JSON et CSV, ODS, XLSX
* Dans Explorer, les données peuvent être prévisualisées en mode tableau, mais pas en mode carte

</details>

<details>

<summary><strong>La publication des autres formats (fichiers ou URL)</strong></summary>

* Le fichier source est stocké pour pouvoir être retéléchargé depuis le catalogue
* La publication ne donne pas lieu à la création d’un flux géographique
* Dans Explorer, les données ne peuvent pas être prévisualisées
* Dans Explorer, le lien de téléchargement sera affiché dans l’onglet « télécharger »

</details>


# Gérer un jeu de données

Une fois un jeu de données publié, vous pouvez réaliser différentes actions&#x20;

## [Paramétrer le jeu de donnée](/guide-datasud.fr/jeux-de-donnees/gerer-un-jeu-de-donnees/parametrer-le-jeu-de-donnee)

## Mettre à jour ou modifier un jeu de données ou une ressource

Les données publiées sur datasud.fr peuvent être mises à jour après leur publication, que la modification porte sur un jeu de données (sa description, ses mots clés, etc.) ou sur l’une des ressources qu’il contient.

{% hint style="info" %}
**Un jeu de données publié au nom d’une organisation ne peut être pas transféré vers une autre autre organisation.**
{% endhint %}

<details>

<summary>Comment modifier la fiche descriptive du jeu de données ?</summary>

Pour modifier un jeu de données publié au nom d’une organisation à laquelle vous appartenez :

1. [Connectez vous à votre compte](https://www.datasud.fr/login/signin) ;
2. Allez sur la [page de suivi de vos données](https://www.datasud.fr/publish/fr/data/), en cliquant sur votre prénom, en haut à droite de votre navigateur ;
3. Sélectionner le bouton **Voir les jeux de données** ;&#x20;
4. Cliquez ensuite sur le titre de la fiche descriptive du jeu de données que vous souhaitez modifier ;
5. Modifiez les champs que vous souhaitez mettre à jour ;
6. Pour sauvegarder vos modifications, cliquez sur le bouton **Enregistrer la fiche** qui se trouve dans la partie droite de votre écran.

</details>

<details>

<summary>Comment modifier une ressource ?</summary>

Pour modifier une ressource publiée au nom d’une organisation à laquelle vous appartenez :

1. [Connectez vous à votre compte](https://www.datasud.fr/login/signin) ;
2. Allez sur la [page de suivi de vos données](https://www.datasud.fr/publish/fr/data/), en cliquant sur votre prénom, en haut à droite de votre navigateur ;
3. Sélectionner le bouton **Voir les jeux de données** ;
4. Cliquez ensuite sur le titre de la fiche descriptive du jeu de données qui contient la ressource à modifier ;
5. Naviguez jusqu’à la section **Données** ou **Annexes** situées en bas de page ;
6. Cliquez sur le bouton **Mettre à jour** ou **Télécharger** de la ressource à modifier ;
7. Une fenêtre s’affiche alors en superposition pour la **Mise à jour du fichier** dans laquelle vous sélectionnez tout d'abord un format dans la liste proposée;\
   Puis vous sélectionnez un fichier à partir de votre disque dur
8. Lorsque le nouveau fichier est chargé dans DataSud, vous cliquer sur **Confirmer** ou **Annuler** si besoin;
9. Modifiez le titre du fichier que vous souhaitez mettre à jour ;
10. Actualiser la date de dernière mise à jour en cliquant sur le petit calendrier à droite de la date;
11. Pour sauvegarder vos modifications, cliquez sur le bouton **Enregistrer la fiche** qui se trouve en haut à droite de la fenêtre.

</details>

<details>

<summary>Comment modifier la fréquence de mise à jour d'une ressource</summary>

Lors de l’ajout d’une donnée de type URL et sFTP, l’utilisateur peut choisir une fréquence de mise à jour. Cela définie la fréquence à laquelle le portail DataSud va mettre à jour la donnée publiée par rapport au fichier source présent dans l’URL de partage, ou l’entrepôt de donnée sFTP.

<img src="/files/AuPTxkYkr8NhMQxMkvRm" alt="" data-size="original">

Les fréquences de mise à jour peuvent être les suivantes :

* A 04 :00 (Europe/Paris)
* A 05 :00 (Europe/Paris)
* À 12:00, le 1 du mois, uniquement en January (Europe/Paris)
* À 12:00, le 1 du mois, uniquement en January, April, July, et October (Europe/Paris)
* chaque jour
* chaque 7 jours ( les lundis)
* chaque 30 jours ( le 1 du mois)
* chaque heure
* chaque 5 minutes

Pour les ressources publiées manuellement, l’éditeur de la donnée peut actualiser sa donnée en retournant sur la fiche créée, et en modifiant l’ancienne ressource par le téléversement de la nouvelle ressource mise à jour.

<img src="/files/JTsPkQh5MrlEw57PDdhs" alt="" data-size="original">

**NOTE : le champ fréquence de mise à jour dans l’onglet donnée ne remplace par le champ fréquence de mise à jour dans l’onglet Dates et mises à jour.** \
Dans l’onglet donnée, ce champ va permettre de mettre à jour la donnée par rapport à la donnée source; tandis que dans l’onglet Dates et mises à jour, l’information saisie apparaitra dans Explorer pour informer l’utilisateur.

</details>

<details>

<summary>Comment dupliquer un jeu de données ?</summary>

Dupliquer un jeu de données déjà publié permet de gagner du temps pour publier un nouveau jeu de données sans avoir à récrire tous les champs préalablement renseigné

1. [Connectez vous à votre compte ](https://www.datasud.fr/login/signin);
2. Allez sur la [page de suivi de vos données](https://www.datasud.fr/publish/fr/data/), en cliquant sur votre prénom, en haut à droite de votre navigateur ;
3. Sélectionner le bouton **Voir les jeux de données** ;&#x20;
4. Sur la ligne du jeu de données que vous souhaitez dupliquer, cliquer sur l'avant dernière illustration **Dupliquer** ;&#x20;
5. Une nouvelle fiche descriptive du jeu de données dupliqué s'ouvre contenant les mêmes champs et le même titre ;
6. Modifier le titre à votre convenance  en veillant à enlever le mot (copie) du titre ;
7. Vous pouvez ainsi mettre à jour les différents champs pour les adapter à votre nouvelle publication ;

</details>

## Supprimer un jeu de données ou une ressource

Vous pouvez supprimer un jeu de données, ou l’une des ressources qui le compose, si vous êtes l’auteur du jeu de données en question, ou si vous appartenez à l’organisation qui en est à l’origine.

{% hint style="danger" %}
**La suppression d’un jeu de données ou d’une ressource est irréversible**
{% endhint %}

{% hint style="warning" %}
**Conservation des anciennes ressources**

Il est conseillé de supprimer le moins de ressources possibles de la plateforme datasud.fr. Même si vos données ne sont plus mises à jour, il est possible que des utilisateurs utilisent tout de même ces données. De plus, la suppression de certaines ressources peut entraîner la maintenance de nombreux services ou produits qui reposent sur l’exploitation des données publiées.
{% endhint %}

<details>

<summary>Comment supprimer un jeu de données ou une ressource</summary>

1. Connectez vous sur votre compte
2. Choisissez le jeu de données à supprimer dans votre liste de données
3. Cliquer sur l'illustration en rouge **Supprimer** ;
4. Une fenêtre apparait pour vous permettre de confirmer de

   \- **Tout supprimer** ( jeu de données  et les ressources associées ) \
   \- **Supprimer uniquement le dataset** \
   \- **Annuler** la suppression

</details>


# Paramétrer le jeu de donnée

La publication d’une donnée comporte 3 étapes : renseigner les métadonnées, ajouter une ressource et/ou des annexes, et enfin **paramétrer la donnée**.

4 éléments centraux permettent ce paramétrage :

1. L'organisation/groupe auquel appartient l’utilisateur qui a publié la donnée
2. Le choix de publier ou non le jeu de donnée dans le catalogue [Datasud](https://www.datasud.fr/explorer/fr/recherche)[.fr](https://www.datasud.fr/explorer/fr/recherche)
3. Le niveau de permission par défaut choisi pour donner accès aux ressources/ jeux de données
4. Le type de fiche sélectionné

<figure><img src="/files/LuzRXzQqXoimuVUNnHtp" alt=""><figcaption></figcaption></figure>

### 1. Nom de l'organisation ou du groupe d'utilisateurs

Le nom de l'organisation ou du groupe d'utilisateurs est inscrit automatiquement dans les paramétrages de la donnée, en fonction du groupe d’appartenance de l’éditeur de la donnée.

Le groupe d'utilisateur va déterminer, en fonction des niveaux d’accès définies, qui aura accès à la donnée.

> Par exemple, si l’éditeur appartient au groupe Pastorando, et que la donnée est en niveau de permission « **donnée privée** », seuls les membres du groupe Pastorando auront accès à la donnée.
>
> Si l’éditeur appartient au groupe Pastorando, et que la donnée est en niveau de permission « **consultation** », tous les utilisateurs enregistrés pourront consulter les métadonnées du jeu de donnée, mais seuls les membres du groupe Pastorando pourront la télécharger.

### 2. Publication de la donnée dans le catalogue

<figure><img src="/files/OArIo9niAzKlPkBY1fFb" alt=""><figcaption></figcaption></figure>

Cette fonctionnalité permet à l’éditeur d’un jeu de donnée de choisir de le rendre visible depuis le catalogue[ Explorer](https://www.datasud.fr/explorer/fr/recherche).

* Si l’éditeur active le mode **Publié dans le catalogue**, les utilisateurs pourront accéder au jeu de donnée depuis le catalogue du portail Datasud.fr.
* Si l’éditeur choisi le mode **Publication désactivée**, la donnée n’est plus visible depuis le catalogue de Datasud.fr, y compris pour lui-même qui ne verra plus les métadonnées de son jeu de données dépublié.

Dans le module Publish, l'éditeur peut distinguer dans la liste de ses jeux de données, le curseur vert qui s’affiche pour les données publiées et le curseur blanc qui s’affiche pour les données dépubliées.

<figure><img src="/files/WhGrqzmCnNaTnlkenN2e" alt=""><figcaption></figcaption></figure>

> Remarque : Le même principe s'applique aux ressources, lorsque le bouton « Masquer la ressource » est coché, l'éditeur masque cette ressource et empêche son téléchargement alors que l'ensemble du jeu de données est publié (métadonnées et d'autres ressources associées) et reste accessible via le catalogue.
>
> <img src="/files/wvspkBZ17jFt94iEBAlC" alt="" data-size="original">

### 3. **Niveau de permission et de droits d'accès aux ressources du jeu de données**

Vos données peuvent être rendus publiques ou uniquement réservées à la consultation des groupes d'utilisateurs autorisés à les consulter / les télécharger

<details>

<summary><strong>Définition des niveaux d'accès :</strong><br>Il existe 4 niveaux d'accès différents à un jeu de données, représentés par 4 pictogrammes qui permettent de voir rapidement le niveau configuré : </summary>

* **`Donnée privée (représentée par le cadenas)`** : seuls les membres de l’organisation pour laquelle le jeu de données a été publié peuvent voir ce jeu de données dans le catalogue Explorer;&#x20;
* **`Recherche (représentée par la loupe)`** : ce niveau d’accès permet de trouver le jeu de données dans le catalogue Explorer et d'en consulter les métadonnées uniquement  ( onglet "Informations" du jeu de données );
* **`Consultation`** **`(représentée par l'œil)`**: ce niveau d’accès permet de consulter les données au sein du catalogue Explorer à travers l'aperçu de sa ressource principale sous forme de tableaux et de carte si cette ressource est correctement structurée (onglet "Données" du jeu de données);
* **`Téléchargement (représentée par le` nuage avec la flèche vers le bas)** : ce niveau d’accès autorise le téléchargement des données (onglets "Téléchargement" et "API" du jeu de données) dans le catalogue.&#x20;

  C'est le mode de publication le plus couramment utilisé pour un jeu de données en Opendata.

</details>

**Niveau d’accès par défaut**[​](https://www.onegeosuite.fr/docs/documentation/module-publish/publication-donnees/gestion_privileges#niveau-daccès-par-défaut)

Le niveau de permission par défaut désigne l’accès à ce jeu de données par défaut, pour tous les utilisateurs de la plateforme (connecté ou non connecté).

Par exemple, pour publier un jeu de données et ses ressources en OpenData, l'éditeur peut sélectionner le niveau de permission « Téléchargement » dans le formulaire du jeu de données pour que tous les utilisateurs de la plateforme puissent télécharger cette donnée.

Si l’utilisateur souhaite partager une donnée seulement avec les membres de son organisation, l’utilisateur va sélectionner la permission par défaut « données privées ».

> Note : les permissions peuvent être configurées de manière plus fine au niveau du groupe / de l’organisation (voir la page configuration de permissions particulières); C’est-à-dire qu’il est possible de définir un niveau d’accès différent pour chaque groupe / organisation.

### 4. Type de fiche

Renseigner l'information du type de fiche à 2 objectifs : mieux qualifier la fiche (cf. norme INSPIRE) ; organiser la présentation des résultats dans Explorer (ex : les "cartes" seront présentées dans un onglet à part).

Pour chaque fiche publiée, l’éditeur peut paramétrer le type de fiche parmi les suivants :

* **Carte :** image PDF représentant une carte
* **Jeu de données géographique :** fichier avec des coordonnées géographiques (csv, GEOJSON, shapefile par exemple)
* **Jeu de données non-géographique** : fichier sans coordonnées géographiques (Excel, csv par exemple)
* **Série :** fichier faisant partie d'une série de données (ex : la population à Marseille en 2015, 2020, 2025)
* **Service :**&#x20;

###


# Consulter les statistiques de vos jeux de données

Afin de suivre la vie de votre jeu de données sur Datasud.fr, il est possible de consulter le nombre de vue des métadonnées et le nombre de téléchargement des fichiers principaux et ressources publiés en annexes.

Des consultations des statistiques d’utilisation depuis votre compte administrateur sont progressivement mise en place.<br>

Les administrateurs de DataSud utilise l'outil d'analyse Metabase qui intègre dans un tableau de bord les informations relatives aux jeux de données des producteurs sur DataSud.fr<br>

*Une méthodologie de suivi des usages d'un jeu de données sera explicité prochainement.*


# Explorer un jeu de donnée

Sur les jeux de données au format tabulaires vous pouvez utiliser notre explorateur de données pour avoir un aperçu des données, d’en savoir plus sur les différentes colonnes, mais aussi par exemple de réaliser des filtres et des tris.

Les principales fonctionnalités de l'outil Explorer seront présentées prochainement


# Indexer un catalogue de données existant

**Qu’est-ce que l'indexation ?**

L’indexation permet d'inclure automatiquement des métadonnées à partir d'un catalogue distant pour les stocker sur une autre plateforme de données ouvertes afin d'en augmenter leur visibilité.

Le service d'indexation permet de référencer sur datasud.fr les jeux de données déjà publiés sur d’autres catalogues de données en ligne. De cette manière, vous pouvez automatiser la consultation sur le portail DataSud.fr des jeux de données que vous avez déjà publié sur votre propre plateforme, en élargissant vos points d'accès aux données.

**Quand utiliser le service d'indexation ?**

{% hint style="info" %}
**Si vous mettez en ligne des données publiques sur un portail de données ouvertes au niveau infra régional, dans un format dont les métadonnées correspondent à la syntaxe ODS, CKAN, ou DCAT vous pouvez les référencer automatiquement sur DataSud.fr**&#x20;
{% endhint %}

**Pour mettre en place l'indexation de votre catalogue, veuillez vous rapprocher des administrateurs de DataSud.**\
\
Pour utiliser le service d'indexation, il est possible d’importer l’ensemble des données ou de ne sélectionner que certains jeux de données au moyen de filtres.

Le principe du moissonnage sur DataSud.fr  se décompose en plusieurs étapes :

1. Vous créez votre compte utilisateur sur DataSud
2. Vous [créez votre organisation sur DataSud](/guide-datasud.fr/organisation/creer-une-organisation)
3. Vous publiez des données sur votre plateforme open data ;
4. Vous demandez la validation de votre indexation par les administrateurs de DataSud à l'aide du formulaire de contact : <https://www.datasud.fr/portal/contact>
5. Une fois validé, DataSud.fr vient automatiquement récupérer les données de votre portail de données.
6. Vos données sont référencées et visibles sur la page de votre organisation de DataSud.fr


# Réutilisations

{% hint style="info" %}
**Qu'est-ce qu'une réutilisation** **?**

Il n’existe pas de définition stricte du concept.

Une définition large veut qu’une réutilisation désigne l’utilisation des données publiques par des tiers à d’autres fins que celle de la mission de service public pour laquelle les données ont été produites ou reçues.

Cependant, il existe des approches plus restrictives. Certains considèrent par exemple que seuls les usages pérennes de la donnée sont des réutilisations tandis que d’autres considèrent tout usage de la donnée comme une réutilisation.

Une réutilisation désigne communément l’exploitation de données ouvertes. Elle peut prendre la forme d’une visualisation, d’une application, d’un article de presse, d’un papier de recherche, etc.
{% endhint %}

La qualité des jeux de données est fondamentale pour qu’ils soient réutilisés. Pour cela chaque producteurs de données doit veiller à ce que leurs données soient à jour et bien respecter les critères de qualité de données.

Dans cette section, vous apprendrez à :

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th data-hidden></th><th data-hidden></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Publier une réutilisation</strong></td><td></td><td></td><td><a href="/pages/b0O1oSvA5sQdINIYbM2o">/pages/b0O1oSvA5sQdINIYbM2o</a></td></tr></tbody></table>


# Publier une réutilisation

La procédure pour publier de façon autonome une réutilisation sur la page du jeu de données de  datasud.fr n'est pas encore opérationnelle; Cette fonctionnalité est en cours de développement

Les données mises à disposition sur datasud.fr peuvent être réutilisées [selon les termes définis dans la licence qui leur est associée](/guides-open-data/guide-juridique/reutilisateurs-de-donnees/respecter-les-conditions-de-reutilisation).

Si vous êtes à l’origine d’une réutilisation, vous pouvez d'ore et déjà la déclarer *via* [le formulaire de contact](https://www.datasud.fr/portal/contact/). Les administrateurs de DataSud pourront ainsi renseigner la rubrique dédiée sur [DataSud](https://www.datasud.fr/portal/news). <br>

Il sera prochainement possible d'associer une réutilisation de votre jeu de données de façon autonome.&#x20;

La qualité de votre jeu de données est fondamentale pour qu’il soit réutilisé par le plus d’utilisateurs possible. Assurez vous notamment que vos données soient à jour et de respecter les critères de qualité des métadonnées. \
Nous vous invitons aussi à améliorer le score de qualité des métadonnées en suivant les recommandation détaillée par les équipes de Data.gouv.fr en suivant [ce lien](/guides-open-data/guide-qualite/ameliorer-la-qualite-dun-jeu-de-donnees-en-continu/ameliorer-le-score-de-qualite-des-metadonnees).

{% hint style="info" %}
**Pourquoi référencer une réutilisation ?**

Référencer une réutilisation sur la page d’un jeu de données permet notamment de :

* **Donner de la visibilité à la réutilisation** et démontrer son savoir-faire ;
* **Apporter de l’information au public** ;
* **Donner du sens aux données publiées par les producteurs** qui découvriront les usages qui sont fait à partir des leurs jeux de données.
* **Montrer comment le jeu de données peut être réutilisé** et inspirer d’autres réutilisations potentielles ;
* **Faire avancer l’open data** en participant à affirmer l’importance de l’ouverture des données publiques.
  {% endhint %}

Voici les informations utiles à communiquer aux administrateurs pour déclarer une réutilisation

<table><thead><tr><th width="144">Information</th><th>Description de l'information</th></tr></thead><tbody><tr><td>Titre</td><td>Préférez un titre qui permet de comprendre l’usage qui est fait des données plutôt que le nom du site ou de l’application (« Moteur de recherche des accords d’entreprises » plutôt que « Accords-entreprise.fr » par exemple).</td></tr><tr><td>URL</td><td>Saisissez le lien de la page sur laquelle la réutilisation est visible.<br>Pointer plutôt vers la réutilisation en elle même que sur une page d'accueil. Assurez-vous que le lien soit stable dans le temps.</td></tr><tr><td>Type</td><td>Indiquez le type dans lequel ranger la réutilisation (API, application, article de presse, visualisation, etc.).</td></tr><tr><td>Description</td><td>Vous pouvez renseigner notamment la méthode de création de la réutilisation, ce que la réutilisation permet de faire ou de montrer ou encore en dire plus sur vous et sur le contexte de cette réutilisation.<br>Il est préférable de garder un ton neutre : si la réutilisation ressemble trop à un message promotionnel il est possible que nous la supprimions.</td></tr><tr><td>Logo</td><td>joindre le logo de votre organisation</td></tr><tr><td>Date de création</td><td>indiquer la date de création de votre solution réutilisatrice des données</td></tr><tr><td>Les jeux de données utilisés</td><td>Signaler les Titres et URL des jeux de données utilisés par votre solution. En associant les jeux de données utilisés, cela permet de comprendre les croisements qui ont été nécessaires et cela améliore la visibilité de votre réutilisation</td></tr></tbody></table>

### **Joindre une image** <a href="#inserer-une-image" id="inserer-une-image"></a>

Si votre réutilisation prend la forme d’une représentation graphique, vous pouvez en donner un aperçu aux autres utilisateurs au moyen d’une image ou d’une capture d’écran. Cette image figurera dans la partie ***Réutilisations*** de [DataSud.fr](https://www.datasud.fr/portal/news/)<br>

<figure><img src="/files/n7R3eE0qiI8gYu10Fdg1" alt=""><figcaption></figcaption></figure>

Lorsque c’est pertinent, les captures d’écrans permettent de mieux rendre compte de ce qu’est la réutilisation.

### Faire connaitre sa réutilisation

Une fois votre réutilisation publiée, nous vous conseillons de la partager sur les réseaux sociaux et de taguer #datasud.\
\
Le tutoriel suivant vous guide dans la publication d'une réutilisation sur datasud.fr ( à venir)

<details>

<summary>Comment publier une réutilisation ? </summary>

( Documentation à venir)

</details>


# Moissonnage

{% hint style="info" %}
**Qu'est-ce que le moissonnage des données publiées depuis DataSud vers data.gouv.fr ?**\
Le moissonnage est un mécanisme permettant de collecter les métadonnées sur un catalogue distant et de les stocker sur une autre plateforme afin de proposer un second point d’accès aux données.<br>

Seules les **métadonnées** sont synchronisées sur Data.gouv.fr. Les données restent sur DataSud (ou ailleurs en fonction de vos choix en matière d’indexation de ressources).
{% endhint %}

Le service de moissonnage permet de référencer sur data.gouv.fr les jeux de données publiés par une organisation présente sur DataSud. De cette manière, le référent des données de cette organisation n'aura pas besoin d’importer à la main sur data.gouv.fr les jeux de données déjà publiés sur DataSud. Chaque organisation publiant ses données sur DataSud reste souveraine pour mettre en place (ou non) une synchronisation de ses données vers Data.gouv.fr.

Dans cette section, vous apprendrez comment créer un point de moissonnage entre DataSud et Data.gouv.fr.<br>

DataSud.fr fonctionne avec la solution OneGeoSuite. Le moissonneur utilise l’API de CKAN pour récupérer les métadonnées des publications de DataSud.fr afin de les faire remonter quotidiennement vers la plateforme nationale.

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th data-hidden></th><th data-hidden></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Les limites du moissonnage</strong></td><td></td><td></td><td><a href="/pages/bb55EQArtquR81OpXrTh">/pages/bb55EQArtquR81OpXrTh</a></td></tr><tr><td><strong>Correspondance des champs entre les catalogues</strong></td><td></td><td></td><td><a href="/pages/vVhxnVDMX2FYvxvlea9R">/pages/vVhxnVDMX2FYvxvlea9R</a></td></tr><tr><td><strong>Mettre en place un moissonneur entre DataSud et Data.Gouv</strong></td><td></td><td></td><td><a href="/pages/oY3reunsU1krvkDEOzl0">/pages/oY3reunsU1krvkDEOzl0</a></td></tr></tbody></table>


# Les limites du moissonnage

{% hint style="warning" %}
Le moissonnage n’a aucune connaissance de l’usage que vous faites du modèle de données. Il s’appuie uniquement sur les spécifications de chaque protocole ou plateforme pour récupérer les informations. Il y a donc certaines limitations techniques liées aux spécificités de chaque plateforme. Certaines limitations sont communes et détaillées ci-dessous.
{% endhint %}

## Correspondances des métadonnées <a href="#correspondances-des-metadonnees" id="correspondances-des-metadonnees"></a>

Certains champs du modèle de data.gouv.fr possèdent un équivalent qui peut être spécifié sur spécifié différemment sur DataSud, sur plusieurs champs par exemple. Dans ce cas, la valeur du champ est récupérée en “best effort’ sur Data.gouv.fr; c’est-à-dire qu’elle va être devinée en fonction des éléments à disposition. Se référer à la page Correspondance des champs entre les catalogues pour voir lesquels sont dans ce cas pour chaque implémentation.

## Suppression à la source et archivage <a href="#suppression-a-la-source" id="suppression-a-la-source"></a>

Lors d'une suppression à la source d'une ressource ou d'un jeu de données dans DataSud.fr, ceux-ci sont conservés sur la plateforme nationale afin d'éviter les suppressions en masse par erreur, ce qui entraînerait une perte des statistiques et des discussions. Au bout d'une période de 7 jours, ces ressources sont marqués comme archivés. L'archivage des jeux de données implique qu'ils ne soient plus indexés ou visibles dans les statistiques des producteurs, mais encore accessibles par lien direct pour les utilisateurs qui souhaiteraient continuer à y accéder.

Dans le cas d’une suppression ponctuelle d'une ressource ou d'un jeu de données dans DataSud.fr, nous vous invitons à supprimer manuellement cette ressource ou ce jeu de données moissonné sur Data.gouv.fr qui a perdu sa source.

Dans le cas d’une suppression massive de jeux de données, veuillez contacter l'équipe en charge de Data.gouv.fr afin de trouver une solution satisfaisante.

## Changement d’identifiant <a href="#changement-didentifiant" id="changement-didentifiant"></a>

Les moissonneurs utilisent les identifiants de jeu de données distants pour retrouver leurs données entre deux moissonnages. Il est donc important de veiller à ce qu’un jeu de données conserve son identifiant au fil du temps et des modification successives. Dans le cas contraire, cela donnera lieu à la création d’un doublon.

Il faut donc aussi veiller à ne pas supprimer puis recréer un jeu de données ou une ressource pour faire sa mise à jour.


# Correspondance des champs entre les catalogues

Le moissonneur utilise l’API de CKAN pour récupérer les métadonnées des publications de DataSud.fr

Ce moissonneur attend l’URL racine de l’instance CKAN et non du portail&#x20;

Exemple

{% tabs %}
{% tab title="CKAN" %}

#### Spécifications techniques <a href="#specifications-techniques" id="specifications-techniques"></a>

Ce moissonneur n’est pas compatible avec les changements de modèles qui peuvent être effectués par certains plugins. Les champs d’un jeu de données doivent rester les mêmes, et le format de leur contenu aussi.

Les champs additionnels du modèle sont ignorés.

#### Correspondance des champs du modèle <a href="#correspondance-des-champs-du-modele" id="correspondance-des-champs-du-modele"></a>

**Jeu de données**

La notion équivalente au jeu de données sur data.gouv.fr (`Dataset`) est le `Package` dans DATASUD.

<table><thead><tr><th width="137"></th><th width="161">DATA.GOUV.FR</th><th width="216">DATASUD</th><th>NOTES</th></tr></thead><tbody><tr><td>Slug</td><td><code>slug</code></td><td><code>name</code></td><td>Création uniquement, si disponible</td></tr><tr><td>Titre</td><td><code>title</code></td><td><code>title</code></td><td></td></tr><tr><td>Acronyme</td><td><code>acronym</code></td><td>❌</td><td></td></tr><tr><td>Description</td><td><code>description</code></td><td><code>notes</code></td><td></td></tr><tr><td>Mots-clés</td><td><code>tags</code></td><td><code>tags.name</code></td><td></td></tr><tr><td>Date de création</td><td><code>created_at</code></td><td><code>metadata_created</code></td><td></td></tr><tr><td>Date de mise à jour</td><td><code>last_modified</code></td><td><code>metadata_modified</code></td><td></td></tr><tr><td>Licence</td><td><code>license</code></td><td><code>license_id</code> et <code>license_title</code></td><td>deviné</td></tr><tr><td>Couverture spatiale</td><td><code>spatial</code></td><td><code>extras.spatial</code> et <code>extras.spatial-test</code></td><td>deviné</td></tr><tr><td>Couverture temporelle</td><td><code>temporal_coverage</code></td><td><code>extras.temporal_start</code> et <code>extras.temporal_end</code></td><td></td></tr><tr><td>Fréquence de mise à jour</td><td><code>frequency</code></td><td><code>extras.frequency</code></td><td><a href="http://dublincore.org/groups/collections/frequency/">Dublin Core Frequency</a></td></tr></tbody></table>

**Autres métadonnées**

Certaines propriétés additionnelles sont conservées dans l’attribut `harvest` par soucis de traçabilité. Les informations de date sont sauvegardées dans ces métadonnées.

<table><thead><tr><th width="149"></th><th>DATA.GOUV.FR HARVEST</th><th width="105">DATASUD</th><th>NOTES</th></tr></thead><tbody><tr><td>Identifiant distant</td><td><code>remote_id</code></td><td><code>id</code></td><td></td></tr><tr><td>Slug</td><td><code>ckan_name</code></td><td><code>name</code></td><td>Car <code>slug</code> peut déjà être pris</td></tr><tr><td>URL de consultation</td><td><code>remote_url</code></td><td><code>url</code></td><td>Conservé dans <code>ckan:source</code> si URL invalide</td></tr></tbody></table>

Tous les attributs `extras` des métadonnées de DataSud qui ne font pas l’objet d’un traitement particulier sont aussi conservés dans l’attribut `extras`.

**Ressource**

La notion équivalente à la ressource sur data.gouv.fr (`Resource`) est aussi la `Resource` dans CKAN.

<table data-full-width="true"><thead><tr><th width="127"></th><th>DATA.GOUV.FR</th><th>DATASUD</th><th>NOTES</th></tr></thead><tbody><tr><td>Identifiant</td><td><code>id</code></td><td><code>id</code></td><td>Un UUID valide</td></tr><tr><td>Titre</td><td><code>title</code></td><td><code>name</code></td><td></td></tr><tr><td>Description</td><td><code>description</code></td><td><code>description</code></td><td></td></tr><tr><td>URL</td><td><code>url</code></td><td><code>url</code></td><td></td></tr><tr><td>Type</td><td><code>filetype</code></td><td><code>resource_type</code></td><td><code>api</code> ou <code>remote</code></td></tr><tr><td>Type MIME</td><td><code>mime</code></td><td><code>mimetype</code></td><td></td></tr><tr><td>Format</td><td><code>format</code></td><td><code>format</code></td><td></td></tr><tr><td>Date de création</td><td><code>harvest.created_at</code></td><td><code>created</code></td><td></td></tr><tr><td>Date de mise à jour</td><td><code>harvest.modified_at</code></td><td><code>last_modified</code></td><td></td></tr></tbody></table>

### Filtrage <a href="#filtrage" id="filtrage"></a>

La filtrage donne la possibilité d’inclure ou d’exclure un sous-ensemble de jeux de données du moissonnage.

Lorsqu’un ou plusieurs filtres sont déclarés, seuls les jeux de données remplissant **toutes** les conditions (**ET**) seront traités.

#### **Portail multiproducteur : restriction à une organisation**

![Exemple de restriction à une seule organisation](https://doc.data.gouv.fr/img/moissonnage/harvest-filter-include.png)

#### **Exclusion de mots-clés**

![Exemple d'exclusion de mots-clés](https://doc.data.gouv.fr/img/moissonnage/harvest-filter-exclude.png)

#### **Combinaisons multiples**

![Exemple de combinaison de filtres](https://doc.data.gouv.fr/img/moissonnage/harvest-filter-combined.png)

#### Contribuer <a href="#contribuer" id="contribuer"></a>

Le moissonneur CKAN est publié sur github dans le plugin [`udata-ckan`](https://github.com/opendatateam/udata-ckan). Vous pouvez donc soumettre des améliorations ou signaler des anomalies.
{% endtab %}
{% endtabs %}

#### Métadonnées communes <a href="#metadonnees-communes" id="metadonnees-communes"></a>

Les jeux de données moissonnés possèdent les attributs suivants dans leur champ `extras` pour la traçabilité :

| ATTRIBUT              | CONTENU                               |
| --------------------- | ------------------------------------- |
| `harvest:domain`      | Nom de domaine moissonné              |
| `harvest:source_id`   | Identifiant technique du moissonneur  |
| `harvest:remote_id`   | Identifiant distant du jeu de données |
| `harvest:last_update` | Date du dernier moissonnage           |

## Détection des licences par le moissonnage

Lors du moissonnage, la liste de référence de data.gouv.fr, [disponible ici au format json](https://www.data.gouv.fr/api/1/datasets/licenses/), est utilisée pour détecter la licence du jeu de données distant.

Cette détection utilise les attributs suivants :

* `id`
* `title`
* `alternate_titles`
* `url`
* `alternate_urls`

Le meilleur moyen d’assurer une compatibilité parfaite est d’utiliser l’`id` sur le flux distant lorsque c’est possible.


# Mettre en place un moissonneur entre DataSud et Data.gouv

La procédure est relativement simple et elle se décompose en plusieurs étapes :

1. Vous créez une organisation sur data.gouv.fr avec un compte utilisateur administrateur de l’organisation.
2. Vous créez un moissonneur depuis l’interface d’administration de data.gouv.fr qui vient se brancher sur les données de votre organisation présente au catalogue de Datasud.fr ;
3. Vous demandez la validation de votre moissonneur en écrivant un mail à <datasud@maregionsud.fr> ;
4. La configuration du moissonneur est validée par les équipes de DataSud qui en assure la communication auprès de l'équipe support en charge de data.gouv.fr ;
5. Le moissonneur de data.gouv.fr vient automatiquement récupérer quotidiennement les données de votre plateforme ;
6. Les données de votre plateforme sont référencées et visibles sur data.gouv.fr. :tada:

{% hint style="info" %}
Si vous souhaitez tester la mise en place d'un moissonneur et observer le résultat du moissonnage avant une mise en production sur [data.gouv.fr](https://www.data.gouv.fr/), vous pouvez le créer sur la plateforme de démo [https://demo.data.gouv.fr/](https://demo.data.gouv.fr/fr/) pour effectuer vos tests dans un premier temps. L'ensemble des étapes sont les mêmes que celles décrites sur cette page.
{% endhint %}

## Créer un moissonneur <a href="#creer-un-moissonneur" id="creer-un-moissonneur"></a>

La création d’un moissonneur sur data.gouv.fr nécessite la création d’un compte gratuit.

Pour créer un nouveau moissonneur :

1. [Connectez-vous à votre compte](https://www.data.gouv.fr/fr/login) ;
2. Rendez-vous sur [votre tableau de bord](https://www.data.gouv.fr/fr/admin/), en cliquant sur **Administration** en haut à droite de votre écran ;
3. Cliquez sur l’icône en forme de plus (`+`) qui se trouve à gauche de votre avatar ;
4. Cliquez sur **Un moissonneur**.

À partir de là, la création du moissonneur se déroule en 3 étapes.

## 1. Définir qui publie les données moissonnées <a href="#id-1-definir-qui-publie-les-donnees-moissonnees" id="id-1-definir-qui-publie-les-donnees-moissonnees"></a>

Une fois moissonnées, c’est-à-dire récupérées sur votre plateforme, vos données sont publiées sur data.gouv.fr. L’étape 1 vous permet de choisir le compte qui sera associé à la publication sur data.gouv.fr des données moissonnées sur votre site.

Il peut s’agir de :

* votre propre compte, pour une publication à titre individuel, sous votre propre nom ;
* le compte d’une organisation dont vous êtes membre, pour une publication à titre collectif.

Si vous êtes membre d’une organisation, nous vous conseillons de publier vos jeux de données en son nom. Une fois votre choix effectué, cliquez sur le bouton **Suivant** pour accéder à l’étape 2.

## 2. Configurer le moissonneur <a href="#id-2-configurer-le-moissonneur" id="id-2-configurer-le-moissonneur"></a>

Cette étape est importante pour que les données de votre organisation récupérées par data.gouv.fr soient aussi complètes que celles que vous publiez sur le portail Datasud à l’origine.

### **Nom**

Donnez un nom à votre moissonneur est obligatoire.

Il s’agit d’une référence interne, qui vous permet de vous y retrouver si vous créez plusieurs moissonneurs. Le nom de votre moissonneur ne sera pas public.

* **Mauvais nom** : Moissonneur de mon portail
* **Bon nom** : Département de Vaucluse - DataSud

### Description <a href="#description" id="description"></a>

La description est facultative.

Vous pouvez ajouter des précisions sur votre moissonneur dans le champ description. Il s’agit d’une référence interne qui n’a de valeur que pour vous.

<figure><img src="/files/VkRAJooQXOiWp9i7Zbyb" alt=""><figcaption></figcaption></figure>

### URL <a href="#url" id="url"></a>

L’URL est obligatoire.

Saisissez ici l’URL du portail DataSud [**https://www.datasud.fr/fr/indexer/service/ckan/**](https://www.datasud.fr/fr/indexer/service/ckan/)qui permet au moissonneur de parcourir et récupérer tous vos jeux de données.

<figure><img src="/files/PkN7Uw32nKjj7oavnQm1" alt=""><figcaption></figcaption></figure>

### Implémentation <a href="#implementation" id="implementation"></a>

Le type d’implémentation est obligatoire.

Choisissez ici le format **Ckan** \
Ce format permet au moissonneur de savoir comment lire et interpréter vos métadonnées, pour bien les retranscrire sur data.gouv.fr.

### Filtres

<figure><img src="/files/uLjSxvs4xh5FIBJdOMDA" alt=""><figcaption></figcaption></figure>

Bien veiller à mettre le nom de votre organisation entre "guillemet", sans espace, sans accent ni apostrophe, dans le but d’inclure ou uniquement les jeux de données appartenant à votre organisation au sein du portail DataSud.\
Exemple ci dessus "communaute-dagglomeration-var-esterel-mediterranee"

### Actif et archivage automatique <a href="#actif" id="actif"></a>

Ce champ est obligatoire.

Cochez la case pour que votre moissonneur se mette au travail dès qu’il aura été validé par l’équipe en charge de data.gouv.fr. \
Si vous souhaitez activer votre moissonneur manuellement, alors laissez là décochée.

Archivage automatique est une option pour que vos données soient archivées dans Data.gouv.fr, meme en cas de rutpture de lien avec le catalogue d'origine. Cet archivage présente aussi un risque de doublonnage de vos données.\
Nous déconseillons de décocher cette option d'archivage automatique

<figure><img src="/files/QxeGRJblVaoZxxXN3Saq" alt=""><figcaption></figcaption></figure>

Une fois tous les champs obligatoires remplis, cliquez sur le bouton **Enregistrer** pour terminer la création de votre moissonneur.

## 3. Demander la validation du moissonneur <a href="#id-3-demander-la-validation-du-moissonneur" id="id-3-demander-la-validation-du-moissonneur"></a>

Une fois votre moissonneur configuré, demandez validation de votre moissonneur par mail à l'équipe de DataSud par mail à l'adresse <datasud@maregionsud.fr>. \
Votre demande sera relayé par nos soins auprès de l’équipe en charge de data.gouv.fr, pour  vérifier qu’il est bien réglé. Si c’est le cas, le moissonneur sera validé et vous recevrez une notification.

De votre côté, vous pouvez vérifier que votre moissonneur moissonne correctement votre site. Pour ce faire :

1. Cliquez sur le bouton **Voir dans l’administration** une fois votre moissonneur créé ;
2. Cliquez sur le bouton **Prévisualiser** ;
3. Vérifiez que le moissonneur récupère bien des jeux de données.

Tant que votre moissonneur n’est pas validé, il ne référence aucun des jeux de données que vous publiez sur DataSud sur data.gouv.fr.


# Analyser le rapport de moissonnage

Chaque moissonnage donne lieu à un rapport accessible depuis l’interface d’administration de data.gouv.fr. Il vous permet de comprendre ce qu’il se passe et, le cas échéant, de corriger les erreurs existantes et de vérifier le filtrage.

## Vue synthétique <a href="#vue-synthetique" id="vue-synthetique"></a>

![Vue synthétique du rapport de moissonnage](https://doc.data.gouv.fr/img/moissonnage/admin-harvest-summary.png)

## Détails d’un jeu de données <a href="#details-dun-jeu-de-donnees" id="details-dun-jeu-de-donnees"></a>

![Détails d'un jeu de données du rapport de moissonnage](https://doc.data.gouv.fr/img/moissonnage/admin-harvest-dataset-modal.png)

## En cas d’erreur <a href="#en-cas-derreur" id="en-cas-derreur"></a>

![Erreur sur un jeu de données du rapport de moissonnage](https://doc.data.gouv.fr/img/moissonnage/admin-harvest-dataset-error-modal.png)

* **1** correspond à l’erreur **technique** formulée de façon compréhensible pour un humain
* **2** contient la “**stacktrace**” de l’erreur qui servira à ceux qui développent des moissonneurs ou contribuent aux existants.


# Les Carte : MAPS

Découvrez comment utiliser la nouvelle solution de création et de consultation de carte dans DataSud avec OneGeo MAPS.

Cette solution de WebSIG permet de créer des cartes pour :&#x20;

* explorer une donnée, la croiser avec d'autres données, sans avoir besoin d'enregistrer son travail ;
* visualiser des données contenant des informations géographiques en les affichant sur une carte ;
* éditer de la donnée et partager les cartes dans des différents supports ( papier ou numérique).

**Dans cette section, vous apprendrez à :**

<table data-view="cards"><thead><tr><th></th><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td>Consulter les cartes</td><td></td><td></td><td><a href="/pages/azxqasCKsRxowsMSz3uM">/pages/azxqasCKsRxowsMSz3uM</a></td></tr><tr><td>Créer une carte</td><td></td><td></td><td><a href="/pages/ZJUSEMNZkkMDiqNxoZGe">/pages/ZJUSEMNZkkMDiqNxoZGe</a></td></tr><tr><td>Partager sa carte</td><td></td><td></td><td><a href="/pages/XAVa1dMX4ABJNUZ8Mwfo">/pages/XAVa1dMX4ABJNUZ8Mwfo</a></td></tr></tbody></table>

{% embed url="<https://youtu.be/grQRrFsUZOU>" %}


# Consulter les cartes de DataSud

Il y a 3 façons de consulter une carte dans DataSud :

* soit en cliquant sur une carte du carrousel de la page d'accueil&#x20;
* soit en consultant une donnée géographique depuis le catalogue des données
* soit en allant directement dans l'onglet **Les donnée**s puis choisir le sous-menu **Les cartes**.

<details>

<summary>Les cartes du carrousel de la page d’accueil</summary>

Certains jeux de données sont mis en valeur directement depuis la partie droite de la page d’accueil de DataSud en cliquant sur ce lien <https://www.datasud.fr/portal/>

L'illustration ci dessous permet d'ouvrir la carte correspondant au jeu de donnée cartographique dans le module Maps

<img src="/files/IUKCW0UyCwZJ0CI6NsF4" alt="" data-size="line">

<img src="/files/SbrH1hmCSl7HdrGpUIK8" alt="" data-size="original">

</details>

<details>

<summary>Les données géographiques dans le catalogue des données</summary>

Le catalogue des données <https://www.datasud.fr/explorer/fr/recherche> propose de nombreux fichiers de types Données géographiques

<img src="/files/QCd863jy22ol9mKM1vZg" alt="" data-size="original">

Ces fichiers sont publiées dans des formats GeoJson ou Shapefile qui sont directement interprétés par le portail DataSud pour être affichés sur une carte.&#x20;

Les contributeurs qui publient sur DataSud ce type de fichier n'ont pas besoin d'effectuer de tache spécifiques pour générer des cartes, mis à part le versement de leur fichier dans l'outil d'édition Publish

Pour visualiser la carte correspondant à ces données géographiques, sélectionner l'onglet "Données"

<img src="/files/hUKQiyxkL5PkazpgXJlo" alt="" data-size="original">

</details>

<figure><img src="/files/sI2t42rzRYjXGWX69exC" alt=""><figcaption></figcaption></figure>


# Créer une carte dans DataSud


# Partager sa carte dans un espace de travail


# Guides open data

Des guides pour vous aider à mieux comprendre les enjeux liés aux données ouvertes.

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Guide qualité</strong></td><td>Comment améliorer la qualité de ses données ?</td><td><a href="/pages/vXPyxT5ZMXUlBeBCfBdO">/pages/vXPyxT5ZMXUlBeBCfBdO</a></td></tr><tr><td><strong>Guide juridique</strong></td><td>Quelles données doivent être publiées en open data ?</td><td><a href="/pages/WvU6n2qMEifrfw9ScCHB">/pages/WvU6n2qMEifrfw9ScCHB</a></td></tr></tbody></table>


# Guide juridique

Ce guide a pour vocation de vous présenter le cadre légal de l'ouverture et de la réutilisation des données publiques et de vous aider à l'appliquer facilement.

La première partie de ce guide s'adresse notamment aux organismes publics et privés en charge d'une mission de service public. La seconde partie de ce guide s'adresse aux réutilisateurs de données.\_

{% hint style="danger" %}
Ce guide n'a pas vocation à traiter des obligations prévues par des législations spéciales.\
\
Il a une visée avant tout pratique et opérationnelle. Pour obtenir des informations juridiques plus détaillées, nous vous invitons à consulter le [guide de publication en ligne et réutilisation des données publiques](https://www.cnil.fr/fr/publication-en-ligne-et-reutilisation-des-donnees-publiques-open-data) proposé par la CNIL et la CADA.
{% endhint %}


# Producteurs de données

**Grâce à cette section, les producteurs de données pourront répondre aux interrogations suivantes :**

* Qu'est-ce que l'open data ? A quoi cela sert-il ?
* Suis-je concerné par les obligations légales relatives à l'ouverture des données ?
* Quelles sont les obligations légales et les règles à respecter ?

<table data-view="cards"><thead><tr><th></th><th></th><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Comprendre la notion d'open data 🔍</strong></td><td>À quoi sert-elle ?</td><td></td><td><a href="/pages/IeQ7WKvR8o5sdaTWh0kt">/pages/IeQ7WKvR8o5sdaTWh0kt</a></td></tr><tr><td><strong>Qui est concerné ? 👤</strong></td><td>Suis-je tenu(e) de faire de l'open data ?</td><td></td><td><a href="/pages/DqLgx4FOs6w8K9tTMnUk">/pages/DqLgx4FOs6w8K9tTMnUk</a></td></tr><tr><td><strong>Quelles sont les obligations ? ⚖️</strong></td><td>Que suis-je légalement tenu(e) de faire ?</td><td></td><td><a href="/pages/zlbxhNsjLqKE8FuCJeYw">/pages/zlbxhNsjLqKE8FuCJeYw</a></td></tr></tbody></table>


# Comprendre la notion d'open data

{% hint style="info" %}
Il existe de nombreuses définitions de l'open data.\
\
L'objectif de ce guide n'est pas d'apporter une définition essentielle et exclusive du concept, mais de proposer une interprétation de l'open data public, qu'[Etalab](https://www.etalab.gouv.fr/) a pour mission de mettre en œuvre.
{% endhint %}

## Open data public : la mise à disposition libre et gratuite des documents administratifs

Dans le cadre de ses missions de service public, l’administration produit et reçoit des documents administratifs. Ces documents administratifs peuvent contenir des informations publiques, qui peuvent elles-mêmes être représentées sous forme de données publiques.

**L'open data public consiste à assurer la large mise à disposition à tous de ces données, en accès libre et gratuit, sous un format numérique facilement réutilisable.**

{% hint style="info" %}
**Lexique**

* **Administration** : L'administration englobe l’État, les collectivités territoriales ainsi que les autres personnes de droit public ou les personnes de droit privé chargées d'une mission de service public ([Article L300-2 du CRPA](https://www.legifrance.gouv.fr/affichCodeArticle.do;jsessionid=38EE7903F1DB9BDF237E3916D5943464.tplgfr29s_3?idArticle=LEGIARTI000033218936\&cidTexte=LEGITEXT000031366350\&dateTexte=20170701https://)) ;
* **Document administratif** : Tout document que l'administration a pu produire ou recevoir (de la part d’une autre administration ou d’un prestataire par exemple), dans le cadre de sa mission de service public ([Article L300-2 du CRPA](https://www.legifrance.gouv.fr/affichCodeArticle.do;jsessionid=38EE7903F1DB9BDF237E3916D5943464.tplgfr29s_3?idArticle=LEGIARTI000033218936\&cidTexte=LEGITEXT000031366350\&dateTexte=20170701https://)). Ces documents peuvent correspondre à des notes de services, une base de données, une législation, un code source de logiciel, des cartes, un algorithme, etc. Un document sur lequel un tiers détient des droits de propriété n'est pas considéré comme un document administratif ;
* **Information publique** : Information contenue dans un document administratif communicable à tous ou faisant l'objet d'une diffusion publique, sur lequel des tiers ne détiennent pas de droits de propriété intellectuelle ([Article L321-2 du CRPA](https://www.legifrance.gouv.fr/affichCodeArticle.do;jsessionid=3D26427599551CBACAF75B4C44C8715B.tplgfr24s_3?idArticle=LEGIARTI000033218992\&cidTexte=LEGITEXT000031366350\&dateTexte=20191018)) ;
* **Donnée publique** : Représentation d’une information publique sous une forme conventionnelle destinée à faciliter son traitement. Cela peut être par exemple des données géographiques (adresses, références cadastrales), financières (budgets, commande publique, subventions, etc.), environnementales (émissions, vente de produits, etc.), etc.
  {% endhint %}

## Les bénéfices liés à l'open data public

Au-delà du respect du cadre légal, ouvrir vos données présente de multiples intérêts. Cela vous permet notamment de :

* **Valoriser votre action** : publier en open data les données que vous produisez donne de la visibilité à votre travail et à vos missions ;
* **Alléger votre charge de travail** : une fois le jeu de données publié, vous n’avez plus besoin de répondre à chaque demande d'accès isolée émanant d'un citoyen ou d'une administration ;
* **Améliorer la qualité de vos données** : les données que vous publiez seront réutilisées par des acteurs publics ou privés qui pourront les croiser avec d’autres données ou détecter des anomalies voire les corriger ;
* **Renforcer votre efficacité et améliorer les services publics** : les données ouvertes par des administrations peuvent être réutilisées par d’autres services ou aboutir à des collaborations entre équipes, ce qui peut améliorer la mise en œuvre des missions de service public ;
* **Favoriser la transparence** ;
* **Favoriser la création de nouveaux services, notamment par des acteurs privés ou la société civile** : les données qui auront été ouvertes pourront être utilisées par des tiers afin de créer de nouveaux services numériques.

{% hint style="info" %}
**Le partage de données**\
\
Le partage de données entre acteurs, que ce soit à l’intérieur ou l’extérieur d’une organisation, est devenu un enjeu économique, politique et culturel.

La circulation des données démultiplie leur potentiel d’usage et rend possible leur réutilisation pour des finalités qui n’étaient pas envisagées lors de leur production. La qualité de la donnée se traduit donc par sa bonne compréhension et par son potentiel de réutilisation.

En France, le mouvement de l'ouverture des données publiques se fonde sur ces principes depuis 2011. En avril 2023, la plateforme data.gouv.fr comptait plus de 45 000 jeux de données pour près de 4 000 organisations. En interne, les organisations ont également pris conscience de l’intérêt que représente la circulation et l’exploitation croisées des données pour leurs activités.
{% endhint %}


# Qui est concerné ?

Différents acteurs sont soumis aux obligations de diffusion de leurs documents administratifs, et donc d'ouverture de leurs données. Vous êtes concerné par la diffusion des documents administratifs, et donc la publication de vos données en open data, si vous êtes :

* **une administration centrale de plus de 50 agents** ;
* **une personne morale de droit privé chargée d'une mission de service public qui emploie plus de 50 agents à temps plein** ;
* **une collectivité territoriale de plus de 3 500 habitants et de plus de 50 agents**.


# Quelles sont les obligations ?

Voici une synthèse des principales obligations de diffusion des documents administratifs, et donc d'ouverture de données.

## Quel est le cadre juridique de l'open data ?

{% hint style="info" %}
Le cadre juridique de l’open data public repose principalement sur **les textes applicables en matière d'accès, de diffusion et de réutilisation des documents administratifs**.

* Le [livre III du Code des relations entre le public et l’administration (CRPA)](https://search.piaf.etalab.studio/crpa) définit le cadre général de l’ouverture des données publiques. Il intègre tous les textes applicables en matière de communication, de diffusion et de réutilisation des documents administratifs.
* Le cadre juridique relatif à l’ouverture de l’information publique a considérablement évolué au fil des décennies, jusqu’à la [loi pour une République numérique](https://www.legifrance.gouv.fr/affichLoiPubliee.do?idDocument=JORFDOLE000031589829\&type=general\&legislature=14), promulguée en 2016, qui fait de l’ouverture des données publiques par défaut la règle.
  {% endhint %}

## Que faut-il diffuser en open data ?

{% hint style="info" %}
**La communication de vos documents administratifs**

Le régime de droit d’accès aux documents administratifs a peu évolué depuis [la loi dite “CADA” de 1978](https://www.legifrance.gouv.fr/affichTexte.do?cidTexte=JORFTEXT000000339241) : toute administration ou délégation de service public doit communiquer à un administré le document dont il a fait la demande.\\

Si l’administré demande en outre la diffusion en ligne de ce document administratif, toute administration, quelle que soit sa taille, doit répondre à cette obligation. Si le document contient des données couvertes par un secret légal ou des données à caractère personnel, ces données devront au préalable faire l’objet d’une occultation ou d’une anonymisation.
{% endhint %}

Si vous êtes concernés par l'obligation légale, vous êtes tenus de diffuser en open data ([Article L. 312-1-1 du CRPA](https://www.legifrance.gouv.fr/affichCodeArticle.do;jsessionid=699E85A138CEA30E2185BB71F8735F9A.tplgfr24s_3?idArticle=LEGIARTI000033205512\&cidTexte=LEGITEXT000031366350\&dateTexte=20161009)) :

* **Les documents administratifs que vous avez communiqué à des demandeurs** ;
* **L'inventaire des documents administratifs que vous produisez dans le cadre de vos missions de service public** ;
* **Les bases de données produites et reçues dans le cadre des missions de service public** : ces bases de données doivent êtres mises à jour régulièrement ;
* **Les données dont la publication représente un intérêt économique, social, sanitaire ou environnemental**.

**Les documents administratifs diffusés doivent être achevés**, c'est-à-dire qu'ils ont atteint leur version finale, à date (les brouillons, documents de travail, notes préalables ne sont pas considérés comme des documents achevés). Si le document administratif contient une décision, cette dernière ne doit pas être en cours de délibération mais bien prise.

{% hint style="info" %}
**Lexique : Base de données**

On entend par base de données un recueil d’œuvres, de données ou d'autres éléments indépendants, disposés de manière systématique ou méthodique, et individuellement accessibles par des moyens électroniques ou par tout autre moyen ([Article L112-3 du code de la propriété intellectuelle](https://www.legifrance.gouv.fr/affichCodeArticle.do?idArticle=LEGIARTI000006278879\&cidTexte=LEGITEXT000006069414\&dateTexte=19980702)).\
À titre d'exemple, sont des bases de données : le registre des entreprises, l'annuaire des adresses, les données de demande de valeurs foncières, etc.
{% endhint %}

## Comment faut-il publier en open data ?

### Format

Les documents administratifs, informations publiques et données doivent être publiés dans un format :

* **Ouvert** : tout protocole de communication, d’interconnexion ou d’échange et tout format de données interopérable et dont les spécifications techniques sont publiques, sans restriction d'accès ou de mise en œuvre ;
* **Aisément réutilisable** : le producteur prend en considération les connaissances et besoins du réutilisateur lors de la publication ;
* **Exploitable par un système de traitement automatisé** : la publication est optimisée pour une utilisation par un système de traitement automatisé et non pour une exploitation immédiate par des humains.

### Occultation des secrets légaux

**Si vos documents administratifs contiennent des secrets légaux, vous êtes tenus d'occulter ces secrets par un traitement d'usage courant**, sans que cette opération implique des efforts disproportionnés ou que le document soit dénaturé ou vidé de son sens. Le cas échéant, vous n'êtes pas tenu de diffuser le document administratif.

{% hint style="info" %}
**Quels sont les documents couverts par un secret légal ?**

* Les documents qui ne sont aucunement communicables. Ce sont par exemple les documents dont la diffusion porterait atteinte au secret des délibérations du Gouvernement, au secret de la défense nationale ou de la sûreté de l’État, etc ([Article L. 311-5 du CRPA](https://www.legifrance.gouv.fr/affichCodeArticle.do;jsessionid=B12CCBE39831FB4644322E0902EB97B9.tplgfr34s_1?idArticle=LEGIARTI000033265181\&cidTexte=LEGITEXT000031366350\&dateTexte=20170701)).
* Les documents dont la diffusion porterait atteinte à la protection de la vie privée, au secret médical et au secret des affaires. Les documents qui portent une appréciation ou un jugement de valeur sur une personne physique ou qui font apparaître le comportement d’une personne ([Article L. 311-6 du CRPA](https://www.legifrance.gouv.fr/affichCodeArticle.do;jsessionid=B12CCBE39831FB4644322E0902EB97B9.tplgfr34s_1?idArticle=LEGIARTI000033218964\&cidTexte=LEGITEXT000031366350\&dateTexte=20170701)).
  {% endhint %}

{% hint style="info" %}
**Comment occulter les données par un traitement automatisé d'usage courant ?** L'occultation correspond au masquage ou au retrait des données identifiées comme confidentielles et non communicables.
{% endhint %}

### Anonymisation des données <a href="#que-faire-si-mes-documents-administratifs-contiennent-des-donnees-a-caractere-personnel" id="que-faire-si-mes-documents-administratifs-contiennent-des-donnees-a-caractere-personnel"></a>

{% hint style="info" %}
**Lexique : Donnée à caractère personnel**

Toute information relative à une personne physique identifiée ou qui peut être identifiée, directement ou indirectement, par référence à un numéro d’identification (par exemple le numéro de sécurité sociale) ou à un ou plusieurs éléments qui lui sont propres.
{% endhint %}

Le cadre juridique général proscrit la diffusion en ligne, sans anonymisation, de documents administratifs contenant des données à caractère personnel. Cependant, **trois situations** permettent la publication de ces documents sans avoir recours à l'anonymisation :

* Si une disposition législative spécifique autorise la publication des données sans anonymisation ;
* Si les personnes concernées ont donné leur accord à la diffusion des données sans anonymisation ;
* Si les documents administratifs figurent dans la liste prévue par le [décret n°2018-1117 du 10 décembre 2018](https://www.legifrance.gouv.fr/affichTexte.do?cidTexte=JORFTEXT000037797147\&categorieLien=id) relatif aux catégories de documents administratifs pouvant être rendus publics sans faire l'objet d'un processus d'anonymisation. Ce sont notamment les documents relatifs aux conditions d’organisation de l’administration, de la vie économique, associative, culturelle et sportive, des professions réglementées, etc.

**Si votre document administratif contenant des données à caractère personnel ne correspond à aucune de ces situations, vous êtes tenus de l'anonymiser.** Cette opération ne doit toutefois pas impliquer d'efforts disproportionnés. L'anonymisation ne doit également pas dénaturer ou vider de son sens le document. Le cas échéant, vous n'êtes pas tenu de diffuser le document administratif.

{% hint style="info" %}
**Lexique : Anonymisation des données**

Processus consistant à traiter des données à caractère personnel afin d’empêcher totalement et de manière irréversible l’identification d’une personne physique. L’anonymisation suppose donc qu’il n’y ait plus aucun lien possible entre l’information concernée et la personne à laquelle elle se rattache.
{% endhint %}

Si vous souhaitez obtenir d'avantage d'informations juridiques sur l'articulation entre open data et protection des données à caractère personnel, nous vous invitons à consulter le [guide de publication en ligne et de réutilisation des données publiques](https://www.cnil.fr/fr/publication-en-ligne-et-reutilisation-des-donnees-publiques-open-data) produit par la CNIL.

## Licence

* Lorsque les données sont mises à disposition gratuitement, l’usage d’une licence est conseillé, mais pas obligatoire ;
* Si les données publiées sont mises à disposition contre le paiement d’une redevance, les administrations productrices sont dans l’obligation d’apposer une licence de réutilisation.

La réutilisation des données doit être libre. **La licence doit répondre aux différents critères de libre réutilisation**. À ce titre, la libre réutilisation ne peut être restreinte que pour des motifs d’intérêt général. Cette restriction doit être proportionnée et ne doit pas avoir pour effet ou objectif de limiter la concurrence.

{% hint style="info" %}
**Licences de réutilisation autorisées**

Dans le but d'avoir un nombre restreint de licences, la loi pour une République numérique a prévu la création d’une liste, [fixée par décret](https://www.legifrance.gouv.fr/affichTexte.do?cidTexte=JORFTEXT000034502557\&categorieLien=id), de licences qui peuvent être utilisées par les administrations pour la réutilisation à titre gratuit de leurs informations publiques.

Les administrations peuvent choisir parmi cette liste de licences lorsqu'elles publient des éléments en ligne. Les administrations souhaitant recourir à une licence ne figurant pas dans la liste des licences autorisées par décret doivent au préalable [demander son homologation auprès de la direction interministérielle du numérique (DINUM)](https://support.data.gouv.fr/administration-centrale/licence).

Vous pouvez consulter [la liste des licences autorisées par décret](https://www.data.gouv.fr/fr/licences).
{% endhint %}


# Réutilisateurs de données

**Grâce à cette section, les réutilisateurs de données pourront répondre aux interrogations suivantes :**

* Qu'est-ce que l'open data ?
* Quelles sont les conditions de réutilisation des données ouvertes ?


# Comprendre la notion d'open data

**Les données ouvertes (open data) sont des données en accès libre et gratuit et facilement réutilisables par toutes et tous.**

Ces données sont produites par l’administration (ministères, collectivités locales, etc.) mais aussi par des acteurs privés ou encore des citoyens.

Elles portent donc sur des sujets particulièrement variés. Il existe par exemple :

* [des données relatives aux élections](https://www.data.gouv.fr/fr/pages/donnees-des-elections/)
* [des données relatives à la santé](https://www.data.gouv.fr/fr/pages/donnees-sante/)
* [des données relatives à l'emploi](https://www.data.gouv.fr/fr/pages/donnees-emploi/)
* etc.

Les données ouvertes permettent une transparence accrue, de développer des analyses et de créer de nouveaux services. Elles ont par exemple été exploitées pour élaborer des solutions permettant de :

* [connaître la production d'énergies renouvelables sur son territoire](https://www.data.gouv.fr/fr/pages/onboarding/EnR_PdlL/)
* [identifier les entreprises en difficulté](https://www.data.gouv.fr/fr/pages/onboarding/signaux_faibles/)
* [connaître le prix de vente des biens immobiliers](https://www.data.gouv.fr/fr/pages/onboarding/dvf/)
* [proposer un parcours d'orientation professionnel](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees/creer-un-schema-de-donnees/etape-4-phase-de-promotion-et-de-maintien)
* etc.


# Respecter les conditions de réutilisation

## Qu'est-ce qu'une réutilisation ? <a href="#qu-est-ce-qu-une-reutilisation" id="qu-est-ce-qu-une-reutilisation"></a>

La réutilisation des informations publiques désigne l’utilisation des données publiques par des tiers à d’autres fins que celle de la mission de service public pour laquelle les documents ont été produits ou reçus.

La réutilisation des données doit être libre, c'est-à-dire :

* **Elle est gratuite** ;
* **Elle peut viser une autre finalité que le but initial de production du jeu de données** ;
* **Elle peut être réalisée par tout acteur, qu'il soit public ou privé** : une administration ne peut demander à ce que le réutilisateur ait une qualité particulière pour accéder aux données.

## Quelles sont les obligations du réutilisateur de données ?

Lorsqu'un individu réutilise un jeu de données publiques, il est tenu de respecter les conditions de la licence sous laquelle les données publiques ont initialement été publiées. Deux principales licences sont utilisées dans ce cadre, la [Licence ouverte 2.0 - Licence Etalab](https://www.etalab.gouv.fr/licence-ouverte-open-licence/) ou la Licence ODbL. Dans le cas d'une réutilisation de données publiées sous **licence ouverte 2.0**, vous êtes tenu(e) de :

* **Mentionner la source des données** ;
* **Mentionner la date de dernière mise à jour de la réutilisation** ;
* **Ne pas altérer le sens des données**.

Dans le cas de données publiées sous une **licence ODbL**, vous êtes tenu(e) de respecter l'ensemble des conditions fixées par la Licence ouverte 2.0 précédemment mentionnées tout en repartageant votre réutilisation sous licence ODbL. Cette **clause de partage à l'identique** concrétise la logique *share alike*.

{% hint style="info" %}
**À défaut de mention d'une licence**, les dispositions de [l'article L322-1 du CRPA](https://www.legifrance.gouv.fr/codes/article_lc/LEGIARTI000032255220) s'appliquent. Cet article fixe des conditions de réutilisation identiques à celles de la licence ouverte, à sa voir : la **non-altération** des données publiques, la **mention de leurs sources** (paternité des données) et la **mention de la date de leur dernière mise à jour.**
{% endhint %}

Le réutilisateur est aussi tenu de se conformer aux obligations légales qui découlent du [**Règlement général sur la protection des données**](https://www.legifrance.gouv.fr/affichTexte.do?cidTexte=JORFTEXT000037085952\&categorieLien=id).

## Quelles sont les restrictions à la réutilisation de données publiques ? <a href="#faut-il-utiliser-une-licence" id="faut-il-utiliser-une-licence"></a>

### Le cas de la propriété intellectuelle <a href="#le-cas-de-la-propriete-intellectuelle" id="le-cas-de-la-propriete-intellectuelle"></a>

D'après le cadre général, l'administration ne peut se prévaloir d'un droit de propriété intellectuelle sur une base de données afin de restreindre sa réutilisation.

Cependant, une administration peut se prévaloir d'un droit *sui generis* sur une base de données, uniquement si elle valide les conditions suivantes :

* l'administration est en situation de concurrence ;
* la création de la base de données relève d'une création de l'esprit et a entraîné des investissements substantiels.

### Le cas de la redevance <a href="#le-cas-de-la-redevance" id="le-cas-de-la-redevance"></a>

Certaines administrations, notamment celles pratiquant des opérations de numérisation, sont habilitées à pratiquer des redevances pour l'accès et la réutilisation des données. Certaines limitations à la réutilisation peuvent être envisagées pour les administrations qui pratiquent des redevances, afin de préserver ce modèle, notamment en interdisant la rediffusion des données achetées. La tendance actuelle est à la réduction de l'utilisation des redevances tel que le prévoit la circulaire 6264


# Chronologie de l'open data

La formalisation de l’ouverture des données publiques a été progressive, au niveau national et européen :

## En France

* 1978 - [Loi n°78-753 du 17 juillet 1978, dite “loi CADA](https://www.legifrance.gouv.fr/affichTexte.do?cidTexte=JORFTEXT000000339241)**”** : création du droit d’accès aux documents administratifs
* 2005 - [Ordonnance n°2005-650 du 6 juin 2005 sur la réutilisation de l’information publique](https://www.legifrance.gouv.fr/affichTexte.do?cidTexte=JORFTEXT000000629684) (transposition de la directive européenne de 2003) : création du droit de réutiliser l’information publique
* 2011 - [Création d'une mission « Etalab »](https://www.legifrance.gouv.fr/affichTexte.do?cidTexte=JORFTEXT000023619063\&categorieLien=id) chargée de la création d'un portail unique interministériel des données publiques
* 2015 - [Loi relative à la gratuité et aux modalités de la réutilisation des informations du secteur public](https://www.legifrance.gouv.fr/affichTexte.do?cidTexte=JORFTEXT000031701525\&fastPos=1\&fastReqId=929140163\&categorieLien=id\&oldAction=rechTexte) : création du droit de réutiliser librement les données publiques
* 2016 - [Loi pour une République numérique](https://www.legifrance.gouv.fr/affichLoiPubliee.do?idDocument=JORFDOLE000031589829\&type=general\&legislature=14) : consécration du principe de l’open data par défaut.

Ce cadre général s’est étoffé de législations sectorielles ou territoriales, notamment en matière de transport, santé et énergie :

* 2015 - [Loi pour la croissance, l’activité et l’égalité des chances économiques](https://www.legifrance.gouv.fr/affichLoiPubliee.do?idDocument=JORFDOLE000029883713\&type=general\&legislature=14) : ouverture en open data des données de transport
* 2015 - [Loi sur la Nouvelle organisation territoriale de la République](https://www.legifrance.gouv.fr/affichTexte.do?cidTexte=JORFTEXT000030985460\&categorieLien=id) : publication en open data des données des collectivités publiques de plus de 3500 habitants
* 2016 - [Loi pour la Modernisation de notre système de santé](https://www.legifrance.gouv.fr/affichTexte.do?cidTexte=JORFTEXT000031912641\&categorieLien=id) : publication en open data des données de santé.

## En Europe

* 2003 - [Directive européenne 2003/98/CE, dite PSI](https://eur-lex.europa.eu/legal-content/FR/TXT/HTML/?uri=CELEX:32003L0098) : ensemble de règles concernant la réutilisation des données et documents détenus par les organismes des Etats membres de l’Union européenne
* 2007 - [Directive européenne INSPIRE](https://eur-lex.europa.eu/legal-content/FR/TXT/HTML/?uri=CELEX:32007L0002) : obligation de publier en open data les données environnementales et géographiques
* 2013 - [Directive 2013/37/UE modifiant la directive 2003/98/CE](https://eur-lex.europa.eu/legal-content/FR/TXT/PDF/?uri=CELEX:32013L0037\&from=FR) : encadrement du droit de redevance accordé aux administrations
* 2018 - [Directive 2019/1024/UE concernant les données ouvertes et la réutilisation des informations du secteur public](https://eur-lex.europa.eu/legal-content/FR/TXT/HTML/?uri=CELEX:32019L1024\&from=EN) : inclusion des données des entreprises investies d’une mission de service public dans le champ de l’open data et création des ensembles de données de forte valeur
* 2022 - [Règlement d’exécution 2023/138 établissant une liste d’ensembles de données de forte valeur spécifiques et les modalités de leur publication et de leur réutilisation](https://eur-lex.europa.eu/legal-content/FR/TXT/?uri=CELEX:32023R0138) : désignation des catégories et des données rentrant dans les ensembles de données de forte valeur.


# Guide qualité

Ce guide a pour vocation de vous accompagner dans la production de jeux de données de qualité, notamment dans le cadre d'une démarche d'ouverture.

{% hint style="info" %}
**Lexique : Jeu de données**\
Un jeu de données est un ensemble de ressources : il contient des fichiers contenant des données (csv, json, shp, etc.), de la documentation pour décrire le contenu de ces données, ainsi que la licence sous laquelle le jeu est publié.
{% endhint %}

\
Dans ce guide, vous apprendrez comment :

<table data-card-size="large" data-column-title-hidden data-view="cards"><thead><tr><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Evaluer le niveau de qualité d'un jeu de données</strong></td><td><a href="/pages/nWaf3ogBrUETnIZ5k2pP">/pages/nWaf3ogBrUETnIZ5k2pP</a></td></tr><tr><td><strong>Préparer un jeu de données de qualité</strong></td><td><a href="/pages/F0DkLovztGtBmfBd4yqt">/pages/F0DkLovztGtBmfBd4yqt</a></td></tr><tr><td><strong>Documenter des données</strong></td><td><a href="/pages/FDWpeXup30YC8RHXaHoq">/pages/FDWpeXup30YC8RHXaHoq</a></td></tr><tr><td><strong>Améliorer la qualité d'un jeu de données en continu</strong></td><td><a href="/pages/rKEMMFeirwJEyEtRL4zu">/pages/rKEMMFeirwJEyEtRL4zu</a></td></tr><tr><td><strong>Maîtriser les schémas de données</strong></td><td><a href="/pages/Gr9G2w4N13KLRh8c28tl">/pages/Gr9G2w4N13KLRh8c28tl</a></td></tr></tbody></table>


# Evaluer le niveau de qualité d'un jeu de données

## Définir la qualité d'un jeu de données

Pour une donnée, **la notion de qualité dépend grandement de l'usage qui en est fait**.

Les jeux de données publiés sont généralement produits dans un contexte propre à un processus métier et pour un usage particulier. Cet environnement métier n'est pas toujours familier aux tiers, qu'ils soient internes ou externes à l'organisation.

> Exemple : [La *base de données des demandes de valeur foncière*](https://www.data.gouv.fr/fr/datasets/demandes-de-valeurs-foncieres/) est historiquement produite par la Direction générale des finances publiques pour tenir un fichier immobilier et collecter l'impôt.

Les réutilisateurs peuvent alors rencontrer des difficultés lorsqu'ils souhaitent s'approprier des données ouvertes :

* **Difficultés dans la compréhension de la structure du jeu de données** ;
* **Difficultés dans la compréhension des données elles-mêmes** ;
* **Qualité non adaptée aux usages voulus** (mise à jour, documentation insuffisante ou inexacte, etc.).

Il est donc indispensable de **prendre en compte les pratiques des réutilisateurs** en amont de la production des jeux de données.

## Evaluer le niveau de qualité d'un jeu de données

Plusieurs critères permettent d'évaluer le niveau de qualité d'un jeu de données, notamment :

<details>

<summary>Des éléments sur les données elles-mêmes et leur structure</summary>

* **Le format de fichier,** qui doit permettre de facilement récupérer les données pour les réutiliser de la manière souhaitée (CSV, JSON plutôt que des formats propriétaires comme Excel) ;
* **La structure du fichier**, avec notamment des propriétés au nom explicite, compréhensible rapidement et interprétable facilement par des machines ;
* **Le contenu**, qui doit être le plus épuré possible, avec un type de donnée simple (un nombre, un pourcentage, une chaîne de caractère, une date, etc.) et un sens "métier" le plus clair possible.

</details>

<details>

<summary><strong>Des éléments attestant du potentiel de réutilisation et de croisement des données</strong></summary>

* **Le respect de standards**, référentiels et schémas déjà établis ;
* **La présence de données et colonnes pivots** pour lier les données à un référentiel (par exemple le SIRET).

</details>

<details>

<summary><strong>Des éléments qui accompagnent les données</strong></summary>

* **Une documentation** claire et rigoureuse avec des métadonnées sur le format du fichier, les versions et les référentiels ;
* **La gestion des versions et des mises à jour des données** ;
* **Des échanges entre producteurs et réutilisateurs du jeu de données** avec si possible des mécanismes de contribution aux données.

</details>


# Préparer un jeu de données de qualité

Dans cette section, vous apprendrez comment :

<table data-view="cards"><thead><tr><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Extraire un jeu de données de votre système d'information</strong></td><td><a href="/pages/kKivnC9ErmzdNxeVVWb2">/pages/kKivnC9ErmzdNxeVVWb2</a></td></tr><tr><td><strong>Structurer un jeu de données</strong></td><td><a href="/pages/PuJhfeHzOXAm4E7saXbZ">/pages/PuJhfeHzOXAm4E7saXbZ</a></td></tr><tr><td><strong>Lier des données à un référentiel</strong></td><td><a href="/pages/MxoJLdbUYaGTYRKfPNBG">/pages/MxoJLdbUYaGTYRKfPNBG</a></td></tr></tbody></table>


# Extraire un jeu de données d'un système d'information

Si les données que vous souhaitez faire circuler ne sont pas structurées sous la forme d'un jeu de données, il est nécessaire de réaliser une extraction des données depuis le système d'information où elles sont stockées. L'extraction permet d'obtenir un jeu de données structuré, qui ordonne les données selon différentes caractéristiques.

Lorsque vous cherchez à extraire des données d'un système d'information, plusieurs situations peuvent se présenter :

1. **Un outil permet d'exporter l'ensemble des données depuis le système d'information -->** il est nécessaire de sélectionner les données éligibles à la circulation en aval de l'export ;
2. **Un outil permet d'exporter l'ensemble des données ou de sélectionner un sous ensemble des données à exporter depuis le système d'information** ;
3. **Le système d'information ne prévoit pas d'outil d'exportation des données -->** il est nécessaire de réaliser une opération technique pour exporter ces données et cette opération est directement liée aux spécificités du système d'information utilisé.

Quel que soit le mode d'export, il est recommandé **d'automatiser l'opération** afin de faciliter la mise à jour des données publiées. Cette automatisation instaure un processus sur le long terme et fait gagner du temps à l'organisation.


# Structurer un jeu de données

{% hint style="success" %}
Les jeux de données qui ont vocation à circuler seront réutilisés par des acteurs tiers qui ne connaissent pas l’environnement de votre organisation.

Il est nécessaire de proposer une structure de jeu de données compréhensible et appropriable par tous.
{% endhint %}

Deux approches sont possibles pour structurer un jeu de données, selon le cas de figure dans lequel la structure se situe :

* **Cas 1 : La structure de vos données ne correspond à aucun schéma de données existant** : un travail de modélisation est nécessaire en amont de la création du jeu de données.
* **Cas 2 : La structure de vos données correspond à un schéma de données existant**, comme par exemple s'il s'agit d'une Base Adresse Locale.

{% hint style="info" %}
Les préconisations pour structurer une Base Adresse Locale sont détaillées sur [cette page](/guides-open-data/guide-qualite/preparer-un-jeu-de-donnees-de-qualite/structurer-un-jeu-de-donnees/structurer-une-base-adresse-locale).
{% endhint %}

{% tabs %}
{% tab title="Cas 1" %}

### Cas 1 : La structure de vos données ne correspond à aucun schéma de données existant <a href="#cas-2-la-structure-de-vos-donnees-ne-correspond-a-aucun-schema-de-donnees-existant" id="cas-2-la-structure-de-vos-donnees-ne-correspond-a-aucun-schema-de-donnees-existant"></a>

Il est nécessaire de réfléchir en amont à la meilleure structure pour vos données.

{% hint style="info" %}
Tant que les données de votre structure sont dans un environnement logiciel, leur usage reste adapté à des problématiques métiers spécifiques.

L’ouverture de ces données en dehors de leur environnement impose de **structurer le jeu de données en fonction des attentes des réutilisateurs** et non plus en fonction des besoins propres à l’organisation.
{% endhint %}

✨ Quelques bonnes pratiques vous permettront de bien structurer votre jeu de données :

#### Soigner le contenu du jeu de données <a href="#le-contenu-du-jeu" id="le-contenu-du-jeu"></a>

**Les champs du jeu de données**

Il est conseillé de :

* **Occulter l’ensemble des colonnes dont les champs contiennent des données couvertes par un secret légal** (cf. [Guide juridique](/guides-open-data/guide-juridique)) ;
* **Occulter l’ensemble des colonnes dont les champs contiennent des données à caractère personnel** dont la publication n’est pas nécessaire à l’information du public (cf. [Guide juridique](/guides-open-data/guide-juridique)) ;
* **Privilégier la présence de variables pivots** : ces variables proposent des identifiants communs qui permettent de lier plusieurs jeux de données entre eux (ex. le numéro SIRET de la [base Sirene](https://www.data.gouv.fr/fr/datasets/base-sirene-des-entreprises-et-de-leurs-etablissements-siren-siret/)) (cf. [section "Lier des données à un référentiel"](/guides-open-data/guide-qualite/preparer-un-jeu-de-donnees-de-qualite/lier-des-donnees-a-un-referentiel)).

**L’entête des colonnes (pour le format tabulaire)**

{% hint style="info" %}
Dans un fichier tabulaire, la première ligne du fichier peut être utilisée pour nommer chaque colonne et donner des informations sur les données associées.
{% endhint %}

Il est conseillé de :

* Donner **un nom de colonne explicite** ;
* Donner **un nom de colonne sans majuscule, abréviation, accents, ni espaces** (préférez le caractère `_`) afin de faciliter la manipulation des fichiers.

**Gestion des champs non attribués**

Il est possible que certaines occurrences d’un champ d'un fichier ne soient pas attribuées.

Il convient de :

* **Laisser ces occurrences vides plutôt que d’attribuer la valeur 0** (ou une autre valeur par défaut) : le zéro correspond à une valeur, qui peut dénaturer le sens de votre fichier.

**Le titre du jeu de données**

Il est recommandé de choisir un titre qui doit pouvoir renseigner n’importe quel réutilisateur sur le contenu du fichier. Pour cela, il est recommandé de :

* **Ne pas donner un titre trop générique** qui obligerait le réutilisateur à ouvrir le jeu de données pour comprendre son contenu (i.e. “liste.csv” ou encore “balance comptable” sans indiquer l’organisation concernée) ;
* **Ne pas donner un titre trop long** qui rendrait la manipulation du fichier difficile (i.e. le titre du jeu de données “Fichiers consolidés des données essentielles de la commande publique” est suffisamment générique pour ne pas revenir sur toutes les sources de données utilisées pour agréger le jeu de données) ;
* **Ne pas donner un titre contenant des accents ou caractères spéciaux** qui poseraient des problèmes d’interopérabilité des fichiers ;
* **Ne pas donner de titre trop technique** issu de nomenclatures métier.

**L’encodage du fichier**

{% hint style="info" %}
**Lexique : Encodage**

L’encodage d’un fichier est la norme utilisée pour coder chaque caractère par une suite de 0 et de 1 compréhensible par une machine.

Lorsque l’encodage est mal choisi, le réutilisateur des données est souvent contraint de convertir le fichier, notamment afin de faire apparaître les accents et caractères spéciaux.
{% endhint %}

**Il est conseillé de :**

* **Utiliser l’encodage UTF-8** : il permet d’encoder l’ensemble des caractères du répertoire universel de caractères codés (notamment les caractères contenant des accents ou des caractères spéciaux).

**Le séparateur (pour le format tabulaire)**

{% hint style="info" %}
Dans un fichier tabulaire, le séparateur permet de structurer les données sous forme de cellules.
{% endhint %}

Il est conseillé d'**utiliser la virgule comme séparateur.**

{% hint style="warning" %}
**Séparateurs décimaux**

Dans un fichier CSV, la virgule n’est pas considérée comme un séparateur décimal. Si votre fichier contient des valeurs décimales, il est nécessaire d’encapsuler chaque champ entre des guillemets.

La plupart des tableurs (Excel, OpenOffice Calc, etc) proposent l’encapsulement des champs entre guillemets.

Une seconde solution consiste à convertir l’ensemble des virgules utilisées pour des valeurs décimales par un point.
{% endhint %}

**Granularité du jeu de données**

Il est important de mener une réflexion sur la granularité du jeu de données.

*Faut-il proposer des données fines ou agrégées ? Faut-il proposer un export quotidien, mensuel, trimestriel ou annuel ?* Ces questions doivent être posées en amont de l’automatisation des exports.

Il est conseillé de **mener un dialogue avec les réutilisateurs afin de comprendre leurs besoins** : certains utilisateurs peuvent souhaiter manipuler des données granulaires tandis que d’autres préfèrent disposer d’agrégats qui permettent une réutilisation simple et rapide. A minima, il est conseillé de proposer un fichier complet unique qui contient l’ensemble des données historiques.

#### Choisir le format du jeu de données <a href="#le-choix-du-format-du-jeu-de-donnees" id="le-choix-du-format-du-jeu-de-donnees"></a>

Afin qu'un maximum d’utilisateurs puisse s’approprier les données, il est conseillé de les faire circuler dans un format :

* **ouvert** : un format ouvert n’impose pas de spécifications techniques qui entraveraient l’exploitation des données (i.e. l’utilisation d’un logiciel payant) ;
* **aisément réutilisable** : un format aisément réutilisable sous-entend que toute personne ou machine peut réutiliser facilement le jeu de données ;
* **exploitable par un système de traitement automatisé** : un système de traitement automatisé permet de réaliser des opérations par des moyens automatiques, relatifs à l’exploitation des données (i.e. un fichier CSV est aisément exploitable par un système de traitement automatisé contrairement à un fichier PDF).

Il est possible de choisir parmi les formats ouverts et communément acceptés suivants :

<table><thead><tr><th width="176">Type de données</th><th width="111">Formats conseillés</th><th width="310">Description</th><th width="246">Documentation</th></tr></thead><tbody><tr><td>Données tabulaires</td><td>CSV</td><td>Un fichier CSV est constitué de lignes de données, où chaque champ est séparé par une virgule. Ce format est le standard le plus réutilisable, car ouvert et facilement exploitable par une machine.</td><td><a href="https://opendatafrance.gitbook.io/odl-ressources/fiches-pratiques/premiers-pas/produire-un-fichier-csv-de-qualite#contexte">Ici</a></td></tr><tr><td>Données statiques de transport</td><td>GTFS/NeTEx</td><td>Le format GTFS est le format le plus utilisé en France par les services de mobilité d’information voyageur. Le format NeTEx est le format de référence européen qui vise l’interopérabilité des données entre États membres.</td><td><a href="https://transport.data.gouv.fr/guide">Ici</a></td></tr><tr><td>Données géographiques</td><td>GeoJSON, Shapefile, MapInfo MIF/MID, MapInfo TAB et GML, pour les vecteurs / ECW, JPEG2000 et GeoTIFF, pour les données pixelisées (raster)</td><td>Les données géographiques sont organisées sous forme d’ensemble de données hiérarchisées. Les formats proposés sont conçus spécifiquement pour être largement exploitables et être intégrés facilement dans des outils de cartographie.</td><td><a href="https://geo.data.gouv.fr/fr/doc/publish-your-data">Ici</a></td></tr><tr><td>Données hiérarchiques</td><td>JSON / XML / YAML</td><td>Les données hiérarchiques décrivent des relations hiérarchiques entre différentes données. Le format JSON est préconisé lorsque les données sont liées entre elles sous forme d’arbres verticaux.</td><td>indisponible</td></tr></tbody></table>
{% endtab %}

{% tab title="Cas 2" %}

### Cas 2 : La structure des données correspond à un schéma de données existant

{% hint style="info" %}
**Lexique : Schéma de données**

Un schéma de données est un document qui permet de décrire de manière précise et univoque les différents champs et valeurs possibles qui composent un fichier.

Il permet notamment de valider qu’un fichier est conforme à une structure communément partagée, de générer de la documentation automatiquement, de générer des jeux de données d’exemple ou de proposer des formulaires de saisie standardisés.

Ces schémas facilitent la montée en qualité et le croisement des données proposées en open data, surtout lorsque plusieurs producteurs de données sont amenés à produire un même jeu de données.

➡️ **Pour plus de détails sur les schémas de données, consultez** [**la section "Maîtriser les schémas de données"**](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees)
{% endhint %}

#### **Identifier un schéma de données déjà existant**

Il est possible d'identifier un schéma de données déjà existant [**en consultant le site schema.data.gouv.fr**](https://schema.data.gouv.fr/), qui référence une liste de schémas de données existants. Le site offre aussi la possibilité à tout utilisateur de soumettre de nouveaux schémas de données.

Lorsque les données que vous souhaitez faire circuler correspondent à un schéma existant, **il est conseillé de l’appliquer au plus près**.

#### **Produire des données conforme à un schéma de données identifié**

Si les données ne sont pas extraites d’un système d’information mais saisies manuellement, **il est possible d'utiliser** [**l’outil publier.etalab.studio**](https://publier.etalab.studio/) qui permet, à partir d’un schéma de données sélectionné, de saisir les valeurs de chaque information et ainsi de produire un fichier exhaustif et conforme.

<figure><img src="/files/vCzRGKYoT4WZCcJOJbW6" alt=""><figcaption><p>Page d'accueil de publier.etalab.studio</p></figcaption></figure>

{% hint style="info" %}
📖 **Tutoriel : Utiliser** [**publier.etalab.studio**](https://publier.etalab.studio/) **pour saisir, valider et publier des données de qualité**

Cet outil vous permet de créer un fichier CSV en vous assurant qu'il est conforme à un schéma, c'est-à-dire que ses données sont complètes, valides et structurées.

Les étapes à suivre sont les suivantes :

1. **Sélectionnez le schéma** qui vous intéresse dans la liste déroulante (les schémas disponibles sont ceux référencés sur [schema.data.gouv.fr](https://schema.data.gouv.fr/)).
2. **Produisez vos données. Trois modes de production sont possibles :**
   * **Téléversez (uploadez)** votre fichier si les données sont déjà consolidées au bon format ;
   * **Saisissez vos données dans un formulaire** à l'aide des descriptions des différents champs et des valeurs d'exemples : les champs indiqués par un astérisque rouge doivent obligatoirement être renseignés au moment de la saisie
     * Une fois votre formulaire valide, les valeurs apparaissent sous la forme d'une ligne dans un tableau récapitulatif
     * Vous pouvez alors choisir d'ajouter une ou plusieurs lignes ou télécharger le fichier CSV correspondant au tableau récapitulatif
   * **Saisissez vos données sur un tableur en ligne**
3. La conformité de vos données par rapport au schéma choisi est vérifiée/validée. En cas d'erreur de validation, vous pouvez les **corriger**.
4. Une fois les données conforme au schéma correspondant, **publiez-les sur** [**data.gouv.fr**](https://www.data.gouv.fr/fr/) grâce à un formulaire de publication simplifié permettant une authentification tierce.
   {% endhint %}

<figure><img src="/files/LlX7T1zXfC0MDtGuFJDs" alt=""><figcaption><p>Schéma synthétisant la procédure pour saisir, valider et publier des données à l'aide de publier.etalab.studio</p></figcaption></figure>

#### **Valider la conformité d’un fichier avec un schéma de données**

Pour valider la conformité d'un fichier avec un schéma de données, il est possible de :

* **Utiliser la solution** [**Validata**](https://validata.fr/) : vous pouvez valider la conformité de votre fichier à un schéma parmi la liste déroulante ou via une URL. Vous pouvez ensuite faire valider ce fichier, soit en l'important au format csv, soit en renseignant également son URL.

![Capture d'écran du menu de validata](https://guides.etalab.gouv.fr/assets/img/validata.f6a9dd72.png)

Sur l'interface d'administration de data.gouv.fr, il est possible d'indiquer que votre fichier correspond à un schéma.

* Lorsque vous déposez ou éditez une ressource, vous pouvez sélectionner le schéma correspondant à vos données dans une liste déroulante.

![Capture d'écran de la sélection d'un schéma depuis l'interface d'administration de data.gouv.fr](https://guides.etalab.gouv.fr/assets/img/selection-schema.d958a2c6.png)

* Le fait d'indiquer que votre ressource est censée respecter un schéma permet de bénéficier de vérifications de la qualité des données, d'indiquer aux réutilisateurs que vos données respectent un référentiel, ainsi que de contribuer aux fichiers agrégés (i.e. [pour les données IRVE](https://www.data.gouv.fr/fr/datasets/fichier-consolide-des-bornes-de-recharge-pour-vehicules-electriques/)).

<figure><img src="/files/qvqCxTzvK4WYOwCaH7KC" alt=""><figcaption></figcaption></figure>

D'autres solutions en dehors de data.gouv.fr existent : des solutions disponibles en anglais comme [goodtables.io](http://goodtables.io/) ou [CSV Lint](https://csvlint.io/) proposent des validateurs de jeux de données.

Il est aussi possible d’intégrer une fonction de validation d’un jeu directement dans la procédure de publication (exemple : les données d’adresses locales qui font l’objet d’une validation directement sur le site [adresse.data.gouv.fr](https://adresse.data.gouv.fr/)).
{% endtab %}
{% endtabs %}


# Structurer une Base Adresse Locale

{% hint style="info" %}
**Lexique : Base Adresse Locale**\
Fichier géré par une collectivité locale (habituellement une commune ou un EPCI) et contenant toutes ses adresses géolocalisées. Elle respecte le schéma Base Adresse Locale et une gouvernance qui prévoit que la commune est au centre du dispositif.\
\
Depuis 2019, les Bases Adresses Locales sont prioritaires dans la Base Adresse Nationale : une commune qui publie sa Base Adresse Locale devient la seule source d'adresses sur son territoire.
{% endhint %}

<figure><img src="/files/if57fV19JU5OoAaHNzJR" alt=""><figcaption><p>Rappel : Schéma de constitution de la Base Adresse Nationale (BAN)</p></figcaption></figure>

## Respecter le schéma de données

Les Bases Adresses Locales correspondent à un [**schéma de données établi**](https://schema.data.gouv.fr/etalab/schema-bal/). Il est conseillé de le suivre au plus près. Le respect de ce schéma garantit une intégration réussie des Bases Adresses Locales dans la Base Adresse Nationale.

Une seule Base Adresse Locale est publiée par commune.

{% hint style="success" %}
Toute commune peut **vérifier que son fichier d'adresses est conforme au schéma** et qu'il pourra être intégré à la Base Adresse Nationale grâce au [validateur](https://adresse.data.gouv.fr/bases-locales/validateur) proposé par adresse.data.gouv.fr.\
\
Il suffit de glisser le fichier contenant toutes les adresses au format .csv pour obtenir la liste des erreurs à corriger impérativement (en rouge) et des anomalies (problèmes non bloquants mais réduisant la qualité des adresses et leur utilisation).
{% endhint %}

{% hint style="info" %}
Si vous n'avez pas déjà votre propre outil, **il est recommandé d'utiliser** [**l'éditeur "Mes Adresses"**](https://mes-adresses.data.gouv.fr/), conçu pour permettre à toutes les communes de gérer directement leurs adresses/bases adresses locales en respectant les normes et le schéma sans besoin de compétences techniques. Il permet à la fois de publier et de modifier sa Base Adresse Locale. La transmission des adresses à la Base Adresse Nationale se fait en temps réel.

\
L'outil est gratuit, open source et simple d'utilisation.
{% endhint %}

<figure><img src="/files/Qa9jvgNpUZLiK5qpAHbC" alt=""><figcaption><p>L'éditeur "Mes Adresses"</p></figcaption></figure>

## Suivre les bonnes pratiques

* [ ] **voie\_nom, numero, suffixe** : le nom de la voie et de son complément sont rédigés en toutes lettres, **en minuscules accentuées**, la première lettre de la voie et du nom seulement étant écrites en majuscules. Le complément est réservé aux hameaux et lieux-dits historiques. Il est conseillé de **limiter le champ suffixe** aux indices de répétition du type bis, ter.
* [ ] **cad\_parcelles** : la commune délivrant un certificat de numérotage associe une numérotation à une parcelle. Le registre de filiation parcellaire de DGFiP, disponible en open data, permet de connaître les parcelles associées à une adresse.
* [ ] **Voies sans adresse** : le numéro attendu pour les voies sans adresse est 99999.
* [ ] **Mettre à jour vos données** !

Pour aller plus loin, [un guide des bonnes pratiques de l'adressage](https://guide-bonnes-pratiques.adresse.data.gouv.fr/) ("Comment constituer et établir une adresse ?") est disponible. Il détaille les règles et les normes en vigueur.


# Lier des données à un référentiel

{% hint style="success" %}
Il est important d'intégrer dans vos jeux de données des données pivots relevant d'un référentiel.
{% endhint %}

> **Exemple** : Mon jeu de données est une liste d'actions culturelles menées par ma région. Certaines de ces actions sont gérées par des associations. Il peut être intéressant de publier un jeu de données recensant ces actions avec un champ correspondant à l'identification des associations. Cet identifiant existe et est standardisé, il s'agit du numéro RNA, identifiant national des associations dont [le répertoire](https://www.data.gouv.fr/fr/datasets/repertoire-national-des-associations/) est opéré par le ministère de l'intérieur.

## Pourquoi intégrer des données pivots dans un jeu de données ? <a href="#avantages" id="avantages"></a>

L'intégration dans un jeu de données de données pivots qui correspondent à un référentiel présente plusieurs avantages :

* **Une meilleure formalisation** : en se basant sur un référentiel, le producteur de données a l'assurance d'utiliser un format de données standard et partagé par un grand nombre de jeux de données ;
* **Une meilleure synthèse** : en se basant sur un référentiel, le producteur évite l’abondance de détails et va à l’essentiel. L’obtention d’informations complémentaires se fera par le biais de la consultation du référentiel lui-même ;
* **Une meilleure compréhension** : en intégrant dans son jeu de données des données correspondant à un référentiel, le producteur facilite la compréhension de celui-ci par les utilisateurs car il se réfère à un standard largement adopté ;
* **Une meilleure réutilisation** : intégrer des données liées à un référentiel facilitera la réutilisation du jeu de données et permettra son enrichissement avec d'autres données partageant la même donnée pivot ;
* **Une meilleure interopérabilité** : intégrer des données pivots facilite le lien avec des données de référence fiables et à jour.

## Quels référentiels utiliser pour intégrer des données pivots ? <a href="#exemples-de-referentiels" id="exemples-de-referentiels"></a>

Voici une liste non exhaustive de référentiels sur lesquels il est possible de s'appuyer pour l'intégration de variables pivots :

### Le service public de la donnée <a href="#le-service-public-de-la-donnee" id="le-service-public-de-la-donnee"></a>

Le [service public de la donnée (SPD)](https://www.data.gouv.fr/fr/pages/spd/reference/) vise à mettre à disposition avec un haut niveau de qualité les jeux de données de référence qui présentent un fort impact économique et social.

À ce jour, 9 jeux de données ont été identifiés comme des données de référence :

| Nom du jeu de données                                                                                                                                                                             | Variable(s) pivot(s) | Description                                                                                                                                                                       | Producteur                                                                                                                   |
| ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | -------------------- | --------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------- |
| [Base SIRENE](https://www.data.gouv.fr/fr/datasets/base-sirene-des-entreprises-et-de-leurs-etablissements-siren-siret/)                                                                           | SIRET, SIREN         | Liste des établissements (SIRET) et unités légales (SIREN) françaises                                                                                                             | [INSEE](https://www.data.gouv.fr/fr/organizations/institut-national-de-la-statistique-et-des-etudes-economiques-insee/)      |
| [Base Adresse Nationale (BAN)](https://www.data.gouv.fr/fr/datasets/base-adresse-nationale/)                                                                                                      | BAN                  | Référencement de l'intégralité des adresses du territoire français                                                                                                                | [BAN](https://www.data.gouv.fr/fr/organizations/base-adresse-nationale/)                                                     |
| [Code Officiel Géographique (COG)](https://www.data.gouv.fr/fr/datasets/code-officiel-geographique-cog/)                                                                                          | Codes et libellés    | Liste des communes, cantons, arrondissements, départements, régions, pays et territoires étrangers                                                                                | [INSEE](https://www.data.gouv.fr/fr/organizations/institut-national-de-la-statistique-et-des-etudes-economiques-insee/)      |
| [Plan Cadastral Informatisé (PCI)](https://www.data.gouv.fr/fr/datasets/plan-cadastral-informatise/)                                                                                              | Identifiant          | Représentation de chacune des sections du cadastre français                                                                                                                       | [Ministère de l'Économie et des Finances](https://www.data.gouv.fr/fr/organizations/ministere-de-leconomie-et-des-finances/) |
| [Registre parcellaire graphique (RPG)](https://www.data.gouv.fr/fr/datasets/registre-parcellaire-graphique-rpg-contours-des-parcelles-et-ilots-culturaux-et-leur-groupe-de-cultures-majoritaire/) | Identifiant          | Base de données géographique de référence pour l'instruction des aides de la politique agricole commune (PAC)                                                                     | [IGN](https://www.data.gouv.fr/fr/organizations/institut-national-de-l-information-geographique-et-forestiere/)              |
| [Référentiel de l'organisation administrative de l'Etat](https://www.data.gouv.fr/fr/datasets/referentiel-de-lorganisation-administrative-de-letat/)                                              | Identifiant          | Liste des institutions régies par la Constitution de la Ve république ainsi que les administrations qui en dépendent                                                              | [DILA](https://www.data.gouv.fr/fr/organizations/premier-ministre/)                                                          |
| [Référentiel à grande échelle (RGE)](https://www.data.gouv.fr/fr/datasets/referentiel-a-grande-echelle-rge/)                                                                                      | Identifiant          | Composantes orthophotographique, topographique et adresse, parcellaire et altimétrique des territoires de l'Etat français                                                         | [IGN](https://www.data.gouv.fr/fr/organizations/institut-national-de-l-information-geographique-et-forestiere/)              |
| [Répertoire National des Associations (RNA)](https://www.data.gouv.fr/fr/datasets/repertoire-national-des-associations/)                                                                          | N° RNA / N° Waldec   | Ensemble des associations relevant de la loi du 1er juillet 1901 relative au contrat d’association, dont le siège est en France                                                   | [Ministère de l'Intérieur](https://www.data.gouv.fr/fr/organizations/ministere-de-l-interieur/)                              |
| [Répertoire Opérationnel des Métiers et des Emplois (ROME)](https://www.data.gouv.fr/fr/datasets/repertoire-operationnel-des-metiers-et-des-emplois-rome/)                                        | Code ROME            | Inventaire des dénominations d’emplois/métiers les plus courantes, analyse des activités et compétences, regroupement des emplois selon un principe d’équivalence ou de proximité | [Pôle Emploi](https://www.data.gouv.fr/fr/organizations/pole-emploi/)                                                        |

> **Exemple :** Afin de lister l'ensemble des actions culturelles de ma région, nous avons vu que le numéro RNA pouvait être utile pour identifier les associations. Grâce à celui-ci, il est également possible de récupérer le numéro SIRET de l'association si celle-ci en possède un. Il est également possible de détailler dans le jeu de données le code commune et le code département de chaque action. Pour cela, il convient de se référer au Code officiel géographique. Attention à bien respecter celui-ci. Par exemple, le code département de l'Ariège est le "09" et pas le "9". Ce type d'erreur pourrait entraîner des difficultés lors de la réutilisation des données.

### Autres référentiels <a href="#les-autres-referentiels" id="les-autres-referentiels"></a>

Des jeux de données standardisées et communément partagées avec le plus grand nombre peuvent aussi être utilisés comme référentiels.

> **Exemple** : L'identifiant unique d'une certification professionnelle est le [numéro RNCP](https://www.data.gouv.fr/fr/datasets/repertoire-national-des-certifications-professionnelles-et-repertoire-specifique/). Ce jeu de données ne fait pas partie du service public de la donnée mais est largement partagé par les acteurs du domaine de la formation professionnelle.

#### Référentiels métiers

<table><thead><tr><th width="245">Nom du jeu de données</th><th>Variable(s) pivot(s)</th><th>Description</th><th>Producteur</th></tr></thead><tbody><tr><td><a href="https://www.data.gouv.fr/fr/datasets/nomenclature-dactivites-francaise-naf/">Nomenclature d’activités française (NAF)</a></td><td>Code NAF</td><td>Nomenclature des activités économiques productives, principalement élaborée pour faciliter l'organisation de l'information économique et sociale</td><td><a href="https://www.data.gouv.fr/fr/organizations/institut-national-de-la-statistique-et-des-etudes-economiques-insee/">INSEE</a></td></tr><tr><td><a href="https://www.data.gouv.fr/fr/datasets/repertoire-national-des-certifications-professionnelles-et-repertoire-specifique/">Répertoire National des Certifications Professionnelles (RNCP) et Répertoire Spécifique (RS)</a></td><td>N°RNCP / N°RS</td><td>Répertoire des certifications officielles inscrites au RNCP et au RS</td><td><a href="https://www.data.gouv.fr/fr/organizations/france-competences/">France Compétences</a></td></tr><tr><td><a href="https://www.data.gouv.fr/fr/datasets/fichier-fantoir-des-voies-et-lieux-dits/">Fichier FANTOIR des voies et lieux-dits</a></td><td>N° FANTOIR</td><td>Nom des lieux-dits et des voies pour chaque commune, y compris celles situées dans les lotissements et les copropriétés</td><td><a href="https://www.data.gouv.fr/fr/organizations/ministere-de-leconomie-et-des-finances/">Ministère de l'Économie et des Finances</a></td></tr><tr><td><a href="https://www.data.gouv.fr/fr/datasets/etats-et-capitales-du-monde/#_">Etats et capitales du monde</a></td><td>Code Pays</td><td>Liste des états indépendants reconnus par la France</td><td><a href="https://www.data.gouv.fr/fr/organizations/ministere-des-affaires-etrangeres-et-du-developpement-international/">Ministère de l'Europe et des Affaires Etrangères</a></td></tr><tr><td><a href="https://www.insee.fr/fr/information/2406153">Nomenclatures des professions et catégories socioprofessionnelles</a></td><td>Code PCS / Code PCS-ESE</td><td>Nomenclatures des professions et catégories socioprofessionnelles</td><td><a href="https://www.data.gouv.fr/fr/organizations/institut-national-de-la-statistique-et-des-etudes-economiques-insee/">INSEE</a></td></tr><tr><td><a href="https://www.data.gouv.fr/fr/datasets/etablissements-denseignement-superieur-2/">Liste des établissements d'enseignements supérieurs</a><br><br><a href="https://www.data.gouv.fr/fr/datasets/etablissements-denseignement-secondaire/">Liste des établissements d'enseignements secondaires</a></td><td>N°UAI</td><td>Liste des unités administratives immatriculées</td><td><a href="https://www.data.gouv.fr/fr/organizations/office-national-d-information-sur-les-enseignements-et-les-professions/">ONISEP</a></td></tr></tbody></table>

**Référentiels techniques**

Les référentiels techniques n'ont pas de significations métiers mais ils permettent de décrire une donnée de manière standardisée. Ces standards permettent aux utilisateurs et aux algorithmes de pouvoir interpréter automatiquement la donnée de manière correcte.

Voici deux exemples de référentiels techniques :

| Nom du référentiel | Description                                        | Information                                         |
| ------------------ | -------------------------------------------------- | --------------------------------------------------- |
| WGS84              | Coordonnées géodésiques d'un lieu                  | [Wikipedia](https://fr.wikipedia.org/wiki/WGS_84)   |
| ISO8601            | Représentation numérique d'une date et d'une heure | [Wikipedia](https://fr.wikipedia.org/wiki/ISO_8601) |

### Partager ses propres référentiels <a href="#partager-ses-propres-referentiels" id="partager-ses-propres-referentiels"></a>

{% hint style="info" %}
**Cadre Commun d'Architecture des référentiels de données de l'État**

Le Cadre Commun d'Architecture des référentiels de données de l'État fait spécifiquement mention de l'importance des variables pivots dans le partage et la publication de données. Il stipule notamment que :

* Les données sont un bien, un actif de l’État, elles doivent être gérées et valorisées en conséquence ;
* Les données doivent être standardisées, définies sur la base d’un vocabulaire commun, contextualisées, et combinables les unes aux autres ;
* Les données doivent être facilement réutilisables, partageables et accessibles à travers les frontières des administrations ;
* Les données publiques doivent être mises à disposition librement et ouvertement sur internet ;
* La sécurité et l'archivage des données doit être assuré.
  {% endhint %}

Les acteurs sont encouragés à mettre en place leurs propres référentiels internes ou à les partager s'ils existent déjà pour favoriser au mieux le partage et l'interopérabilité des données.

Il est pertinent de diffuser, en même temps qu'un jeu de données, la liste des valeurs possibles correspondant à votre propre référentiel métier. Celui-ci sera connu et potentiellement réutilisé par d'autres acteurs.

La mise en place de référentiels fait partie d'une stratégie de montée en qualité de la donnée. Néanmoins ce n'est souvent pas suffisant : il est ensuite nécessaire de diffuser, former et vérifier que les données produites intègrent ces référentiels et n'en dérivent pas (à partir d'un contrôle humain ou de tests automatiques).

> **Exemple** : J'utilise en interne un numéro unique permettant d'identifier chaque type d'action culturelle (arts du spectacle, cirque, arts plastiques...). Il peut être pertinent de diffuser en parallèle à la diffusion de mon jeu de données la liste de mon référentiel. Des communes de ma région pourraient potentiellement le réutiliser pour décrire leurs actions culturelles à une maille plus fine.

## Comment intégrer des adresses dans un jeu de données ? <a href="#le-cas-specifique-des-adresses" id="le-cas-specifique-des-adresses"></a>

Il existe des référentiels pour décrire une adresse de manière unique.

Le référentiel officiel d'adresse est la [**Base Adresse Nationale (ou BAN)**](https://www.data.gouv.fr/fr/datasets/base-adresse-nationale/).

* Si vous partez de zéro pour constituer un jeu de données --> il est pertinent de partir de la Base Adresse Nationale pour décrire vos adresses.
* Si vous travaillez sur un jeu de données qui contient déjà des adresses saisies --> il peut s'avérer fastidieux de corriger manuellement l'ensemble des adresses erronées et vous pouvez obtenir une base d'adresse normalisée grâce à la méthode décrite ci-dessous.

### Le géocodage <a href="#le-geocodage" id="le-geocodage"></a>

{% hint style="info" %}
**Lexique : Géocodage**

Le géocodage consiste à affecter des coordonnées géographiques à une adresse postale.
{% endhint %}

Le géocodage peut être en partie automatisé grâce à des outils proposés par Etalab.

**Le site** [**https://adresse.data.gouv.fr/**](https://adresse.data.gouv.fr/) permet de géocoder une liste d'adresse via un appel à une API ou par le dépôt de fichier csv.

Il permet aussi, à partir d'un jeu de données contenant des adresses déjà saisies, de retourner un jeu de données enrichi :

* de coordonnées géographiques (longitude/latitude) ;
* des adresses « corrigées » récupérées de la BAN.

Le site [adresse.data.gouv.fr](https://adresse.data.gouv.fr/) est limité à des utilisations ponctuelles et des volumétries de données considérées faibles (moins d'un million de lignes).

<figure><img src="/files/tBpEEHmtBq8cPtGkJh6m" alt=""><figcaption><p>Page d'accueil d'adresse.data.gouv.fr</p></figcaption></figure>

Pour géocoder davantage de données (plusieurs millions de lignes), il est recommandé d'installer votre propre environnement de géocodage, en utilisant par exemple le géocodeur [Addok](https://addok.readthedocs.io/fr/latest/). Des ressources sont disponibles sur [GitHub](https://github.com/etalab/addok-docker) pour vous aider dans l'installation de votre environnement.

Quelle que soit la méthode utilisée, le processus de géocodage retournera une liste d'adresses standardisées avec leurs coordonnées géographiques associées. Il donne aussi accès à une information `geo_score` correspondant au score de confiance que le géocodeur accorde à l'adresse retournée. Cet indicateur peut être utile à garder dans un jeu de données final, il donnera une indication aux utilisateurs sur la performance du géocodage de chaque adresse.

**--> Le géocodage est détaillé** [**ici**](https://gitlab.datasud.fr/projets_publics/guide_datasud/-/blob/main/guides-open-data/guide-qualite/preparer-un-jeu-de-donnees-de-qualite/broken-reference/README.md)**.**


# Documenter des données

{% hint style="success" %}
Les données issues d'une organisation ont été produites dans un contexte métier particulier. Un individu externe à l’organisation n’est pas forcément familier avec cet environnement métier, ce qui peut le freiner dans l’exploitation des données diffusées.

**La documentation d'un jeu de données a une visée pédagogique et facilite la réutilisation des données.**

Elle décrit les données et la structure des fichiers publiés.
{% endhint %}

Dans cette section, vous apprendrez comment :

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Bien documenter un jeu de données</strong></td><td><a href="/pages/IOkXGj7RI2vVn2j8fQ4L">/pages/IOkXGj7RI2vVn2j8fQ4L</a></td></tr><tr><td><strong>Diffuser la documentation d'un jeu de données</strong></td><td><a href="/pages/Ai0RBBuZLzgQ3oJ1VoDu">/pages/Ai0RBBuZLzgQ3oJ1VoDu</a></td></tr></tbody></table>


# Bien documenter un jeu de données

{% hint style="success" %}
La bonne documentation d'un jeu de données recouvre, entre autres :

* une description générale du jeu de données
* une description du mode de production des données
* une description du modèle de données
* une description du schéma de données
* une description des métadonnées
* une description des changements majeurs
  {% endhint %}

## Description générale du jeu de données <a href="#description-generale-du-jeu-de-donnees" id="description-generale-du-jeu-de-donnees"></a>

Il est conseillé de commencer la documentation par une **description synthétique du jeu de données** qui donne un aperçu rapide des informations mises à disposition.

La description générale peut couvrir les points suivants :

* [ ] **Une description générale des données** ;
* [ ] **La liste des fichiers mis à disposition** ;
* [ ] **La description du format des fichiers** ;
* [ ] **La fréquence de mise à jour**.

> **Exemple** : Description générale du [jeu de données du Répertoire national des élus](https://www.data.gouv.fr/fr/datasets/repertoire-national-des-elus-1/)

<figure><img src="/files/mBcs2tdFfkxEtEMGwxAW" alt=""><figcaption><p>Description générale du <a href="https://www.data.gouv.fr/fr/datasets/repertoire-national-des-elus-1/">jeu de données du Répertoire national des élus</a></p></figcaption></figure>

## Description du mode de production des données <a href="#description-du-mode-de-production-des-donnees" id="description-du-mode-de-production-des-donnees"></a>

La structure d'un jeu de données et son contenu sont liés au contexte de production des données. La description de l'environnement métier est donc indispensable.

La description du mode de production du jeu de données permet au réutilisateur de comprendre la structure du jeu, la nature des données et les possibles manques ou incohérences du fichier.

Il est donc conseillé de préciser :

* [ ] **comment les données ont été produites** (saisie manuelle, collecte automatique, etc.) ;
* [ ] **qui sont les acteurs producteurs des données** et si les données sont produites par plusieurs acteurs, le modèle de gouvernance mis en place pour centraliser les données ;
* [ ] **si les données sont exhaustives et si elles présentent des limites dans leur qualité** ;
* [ ] **les points d'attention et précautions d'usage** pour manipuler ces données.

{% hint style="info" %}
Certains jeux de données ne peuvent pas être utilisés à certaines fins ou possèdent des limitations qui rendent impossible certaines analyses.

Par exemple, [l’article R112 A-3 du Livre des procédures fiscale](https://www.legifrance.gouv.fr/affichCodeArticle.do?idArticle=LEGIARTI000038001715\&cidTexte=LEGITEXT000006069583\&dateTexte=20181231) précise que la réutilisation du jeu de données « [Demandes de valeurs foncières](https://www.data.gouv.fr/fr/datasets/demandes-de-valeurs-foncieres/) » ne peut avoir ni pour objet ni pour effet de permettre la ré-identifications des personnes liés à des transactions immobilières.
{% endhint %}

## Description du modèle de données <a href="#description-du-modele-de-donnees" id="description-du-modele-de-donnees"></a>

{% hint style="info" %}
**Eclairage : Schéma de données VS Modèle de données**

S'ils peuvent être utilisés dans des contextes proches, les termes "schéma" et "modèle" sont bien différents :

* un schéma décrit la structure d'un fichier (ses champs et leur format).
* un modèle décrit la structure logique du jeu de données sous la forme d'objets (ou entités) et de relations (ou associations). Les objets sont définis par une liste d'attributs.

Les champs d'un schéma sont la traduction physique des attributs des entités du modèle. Le modèle de données est avant tout un outil de dialogue entre les différents intervenants.
{% endhint %}

> Exemple : Dans le [jeu de données des IRVE](https://schema.data.gouv.fr/etalab/schema-irve-statique/) (infrastructures de recharge des véhicules électriques), on peut identifier que:
>
> * les champs "id\_station\_itinerance" et "nom\_station" correspondent à des attributs d'une même entité "station",
> * les champs "id\_pdc\_itinerance" et "puissance nominale" correspondent à des attributs d'une même entité "point de charge".
>
> Une "station" contient un ou plusieurs "point de charge" (relation entre les deux entités).

Il est conseillé de :

* [ ] **Faire apparaître le modèle de données à l’aide de schémas et de tableaux**
* [ ] Si le jeu de données se compose de plusieurs entités, **faire apparaître les relations entre elles**.

Une fois le modèle établi, il convient de définir le découpage en fichiers. Il est possible de :

* regrouper des entités dans un même fichier
* créer un fichier par entité

> **Exemple** : [La documentation](https://mtes-mct.github.io/secmar-documentation/schema.html) du [jeu de données des opérations de sauvetage en mer](https://www.data.gouv.fr/fr/datasets/operations-coordonnees-par-les-cross/) décrit le modèle de données utilisé. Ce modèle de données permet de comprendre rapidement les relations qui unissent les différentes entités du jeu de données. Dans cet exemple, il a été choisi d'associer un fichier par entité.

<figure><img src="https://guides.etalab.gouv.fr/assets/img/schema_secmar.37dd98f3.png" alt=""><figcaption><p>Modèle de données du jeu de données des opérations de sauvetage en mer</p></figcaption></figure>

## Description du schéma de données <a href="#description-du-schema-de-donnees" id="description-du-schema-de-donnees"></a>

Si vous publiez des données tabulaires, il est conseillé de produire un tableau récapitulatif indiquant, pour chaque colonne :

* [ ] **le nom de la colonne**
* [ ] **son type de données** (entier, chaîne de caractères, nombre décimal, etc.)
* [ ] **la description de la donnée contenue dans cette colonne**
* [ ] **une ou plusieurs valeurs d’exemple**

Cela constituera une base solide en vue de la création d'un schéma de données, dont le processus est détaillé [ici](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees/creer-un-schema-de-donnees).

> **Exemple :** La documentation du [jeu de données des opérations de sauvetage en mer](https://www.data.gouv.fr/fr/datasets/operations-coordonnees-par-les-cross/) présente un tableau récapitulatif des différentes colonnes. La description des champs permet de faire le lien avec le fichier de données, ce qui facilite la lecture des données.

<figure><img src="https://guides.etalab.gouv.fr/assets/img/table_secmar.561dfb7c.png" alt=""><figcaption><p>Description du schéma de données du jeu de données des opérations de sauvetage en mer</p></figcaption></figure>

Les termes employés dans un jeu de données sont propres à un environnement métier.

S’il existe des termes complexes ou des énumérations, il est conseillé de :

* **Fournir un lexique de ces valeurs**

Cet effort de définition fait gagner un temps considérable au réutilisateur et permet de prévenir des contre-sens dans l’exploitation des données.

> **Exemple :** La base de données de [demande de valeur foncière](https://www.data.gouv.fr/fr/datasets/demandes-de-valeurs-foncieres/) recense l’ensemble des transactions immobilières intervenues au cours des cinq dernières années.\
> Le vocabulaire utilisé dans ce jeu de données est issu d’un environnement administratif, parfois difficile à appréhender. La Direction générale des Finances publiques met à disposition une [documentation](https://static.data.gouv.fr/resources/demande-de-valeurs-foncieres/20190419-091745/notice-descriptive-du-fichier-dvf.pdf) qui comprend notamment un lexique de définition des termes rencontrés. Ce lexique facilite l’appropriation et la réutilisation des données par des acteurs tiers. ![Lexique des données du jeu de données Demande de valeur foncière](https://guides.etalab.gouv.fr/assets/img/lexique_dvf.64d1e5cc.png)

## Description des métadonnées <a href="#description-des-metadonnees" id="description-des-metadonnees"></a>

{% hint style="info" %}
**Lexique : Métadonnée**

Une métadonnée est une donnée qui décrit ou définit une autre donnée.

Dans la vie courante, l’étiquette d’un produit fournit des informations/métadonnées sur le produit (origine, composition, date de péremption, etc.). Appliqué aux jeux de données, les métadonnées sont des descriptions normalisées du contenu du jeu.
{% endhint %}

Des formats standards de métadonnées existent afin de faciliter leur collecte, leur recherche et leur traitement automatique.

Sur data.gouv.fr, il est possible de renseigner directement les métadonnées d’un jeu de données. Les métadonnées retenues sont les suivantes :

* Titre
* Sigle
* Description
* Licence
* Fréquence de mise à jour
* Mots clés
* Couverture temporelle
* Couverture spatiale
* Granularité spatiale
* Mode privé

La description des métadonnées apportera à un jeu de données une meilleure visibilité sur les catalogues.

## Description des changements majeurs <a href="#description-des-changements-majeurs" id="description-des-changements-majeurs"></a>

En pratique, il est souhaitable que le modèle de données et la nature de vos données n’évoluent pas au fil du temps.

Toutefois, des changements dans la structure des données, dans le mode de collecte ou dans les dispositions réglementaires peuvent affecter le jeu de données.

Dans cette situation, il est conseillé de **tenir une liste de ces changements**

Cette liste peut faire figurer :

* la date
* la version des données (si vous versionnez vos données)
* la nature du changement

Si nécessaire, il est possible d’indiquer des liens, comme par exemple lorsque des changements sont introduits par une modification du code de transformation des données.

> **Exemple :** [La documentation](https://mtes-mct.github.io/secmar-documentation/CHANGELOG.html) du [jeu de données des opérations de sauvetage en mer](https://www.data.gouv.fr/fr/datasets/operations-coordonnees-par-les-cross/) comporte une section “Changement sur le jeu de données”. Cette section référence les changements du jeu de données en renseignant les informations suivantes :
>
> * La date du changement
> * La nature du changement
> * Les liens associés au changement
>
> <img src="https://guides.etalab.gouv.fr/assets/img/maj_secmar.02c31ca5.png" alt="Liste des modifications réalisées sur le jeu de données SECMAR" data-size="original">

## Points de contact <a href="#points-de-contact" id="points-de-contact"></a>

Les réutilisateurs des données peuvent avoir des questions à propos des fichiers mis à disposition.

Il est conseillé de **proposer un espace d’échange entre les producteurs et réutilisateurs des données** : il est préférable que cet espace d’échange soit public afin qu’il puisse bénéficier aux personnes qui auraient des questions similaires.

La collecte des retours d’usage permettra d’améliorer votre documentation de manière incrémentale.


# Diffuser la documentation d'un jeu de données

Il est conseillé de **proposer votre documentation en ligne et non sous format PDF** : une documentation en ligne permet de s’assurer que les réutilisateurs des données disposent toujours de la version la plus à jour.

Des portails de données, tels que [data.gouv.fr](https://www.data.gouv.fr/), proposent des espaces dédiés à la documentation du jeu de données.

Vous pouvez également héberger votre documentation sur des sites web statiques.

Si le jeu de données a pour vocation de circuler en interne de votre organisation, nous vous conseillons a minima de proposer une documentation dans un fichier séparé des données :

* Le fichier contenant les données doit être réservé à la manipulation de ces dernières ;
* Le fichier contenant la documentation a lui pour vocation d’informer sur la nature des données et sur la structure des fichiers.

> **Exemple :** Dans le cadre de la publication [des données de sauvetage en mer (opérations coordonnées par les CROSS)](https://www.data.gouv.fr/fr/datasets/operations-coordonnees-par-les-cross/), un [site statique](https://mtes-mct.github.io/secmar-documentation/) a été créé afin de présenter la documentation du jeu de données.

<figure><img src="https://guides.etalab.gouv.fr/assets/img/doc_secmar.99fbde88.png" alt=""><figcaption></figcaption></figure>


# Améliorer la qualité d'un jeu de données en continu

Dans cette section, vous apprendrez comment :

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Améliorer votre score de qualité des métadonnées</strong></td><td><a href="/pages/ohFuvdmAsIuxn7bjWgLf">/pages/ohFuvdmAsIuxn7bjWgLf</a></td></tr><tr><td><strong>Connaître et suivre les usages d'un jeu de données</strong></td><td><a href="/pages/749yp78xZ7AqneZOxm4Z">/pages/749yp78xZ7AqneZOxm4Z</a></td></tr><tr><td><strong>Mettre en place une stratégie organisationnelle</strong></td><td><a href="/pages/TomVNm8GZZLxS6CWma5c">/pages/TomVNm8GZZLxS6CWma5c</a></td></tr></tbody></table>


# Améliorer le score de qualité des métadonnées

Un score de qualité des métadonnées a été mis en place sur data.gouv.fr pour répondre principalement à deux problématiques :

* Les réutilisateurs de données peinent à identifier les jeux de données de qualité et à évaluer si tel ou tel jeu de donnée est digne d’intérêt ;
* Les producteurs de données ne sont pas suffisamment incités et accompagnés à améliorer la qualité de leurs données.

Grâce à ce score de qualité des métadonnées, **il est possible d'identifier les axes sur lesquels travailler pour améliorer la qualité de vos données**.

<figure><img src="/files/nmcgJUiXSRVHWYpRi2us" alt=""><figcaption><p>Exemple de score de qualité des métadonnées</p></figcaption></figure>

🧭 Les critères sont les suivants :

| Critère                    | Description                                                                                                                                                                       |
| -------------------------- | --------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| Description des données    | La description des données est de qualité (la description du jeu de données suffisamment longue).                                                                                 |
| Ressources documentées     | Présence d'au moins un fichier de type documentation ou description des fichiers suffisamment longue.                                                                             |
| Mise à jour                | <p>- La fréquence de mise à jour est renseignée.<br>- La fréquence de mise à jour est respectée.</p>                                                                              |
| Licence                    | <p>- La licence est renseignée.<br>- La licence est ouverte.<br><a href="https://www.data.gouv.fr/fr/pages/legal/licences/">Voir la page licence pour plus d’information</a>.</p> |
| Métadonnées des ressources | Présence d’au moins une ressource avec un format ouvert déclaré.                                                                                                                  |
| Couverture spatiale        | <p>- La couverture spatiale est renseignée.<br>- La granularité spatiale est renseignée.</p>                                                                                      |
| Couverture temporelle      | La couverture temporelle des données est renseignée.                                                                                                                              |

Ce score est encore en phase d’expérimentation :

* Le poids de chaque critère sera ajusté en fonction de [vos retours](https://support.data.gouv.fr/) ;
* De nouveaux critères seront ajoutés progressivement notamment pour intégrer la notion de schéma de données.


# Connaître et suivre les usages d'un jeu de données

Bien souvent, la qualité de données que vous proposez, bien qu'adaptée aux utilisations internes à votre structure, peut être améliorée pour **les usages nouveaux engendrés par l'ouverture, qu'il s'agit alors de mieux connaître**.

{% hint style="info" %}
**Lexique : Réutilisation**

Une réutilisation désigne communément l’exploitation de données ouvertes par des tiers, à d’autres fins que celle de la mission de service public pour laquelle elles ont été produites ou reçues.

Elle peut prendre la forme d’une visualisation, d’une application, d’un article de presse, d’un papier de recherche, etc.
{% endhint %}

## Suivre et mesurer les usages d'un jeu de données

Il est possible de combiner approches quantitatives et qualitatives pour cerner les usages d'un jeu de données.

Selon les moyens disponibles, plusieurs leviers sont disponibles :

* **Mesurer les volumes d'usage** : en suivant les [métriques des jeux de données publiés proposés par data.gouv.fr](https://stats.data.gouv.fr/) ou sur son propre portail (nombre de consultations, nombre de téléchargements, nombre de réutilisations, etc.).
* **Répondre aux commentaires et aux questions soumis sur data.gouv.fr**, dans lesquels les réutilisateurs font régulièrement remonter leurs besoins. D'après [l'analyse réalisée par des étudiantes et des étudiants de l'Université Bordeaux Montaigne](https://www.data.gouv.fr/fr/posts/que-se-dit-il-dans-les-commentaires-sur-data-gouv-fr/), sur data.gouv.fr, de nombreux commentaires peuvent être catégorisés comme relevant de problématiques d'accessibilité, suivie de celles d'actualisation des données puis des questions de fiabilité et d'exploitabilité des données.

<figure><img src="/files/RP0g0jf7oxp8R2ePGrre" alt=""><figcaption><p>Echantillon de discussions sur le jeu de données "Demandes de valeur foncière"</p></figcaption></figure>

* **Suivre les réutilisations ajoutées sur ses jeux de données sur data.gouv.fr et inciter au référencement.**

<figure><img src="/files/O4sQ2WZm6qKV7TQzLbSn" alt=""><figcaption><p>Consultation des réutilisations références sur le jeu de données "Prix des carburants - Flux instantané"</p></figcaption></figure>

* **Réaliser des enquêtes auprès des réutilisateurs.**

{% hint style="info" %}
**Exemples :**

* A l'automne 2021, les producteurs de la [Base Sirene](https://www.data.gouv.fr/fr/datasets/base-sirene-des-entreprises-et-de-leurs-etablissements-siren-siret/) (INSEE) ont sondé leurs réutilisateurs sur des questions de contenu, de format ou encore de documentation des données.

* En décembre 2022, le [ministère de la Culture](https://www.data.gouv.fr/fr/organizations/ministere-de-la-culture-et-de-la-communication/) a lancé [une consultation publique](https://www.culture.gouv.fr/Thematiques/Innovation-numerique/Actualites/Open-data-decouvrez-les-resultats-de-la-consultation) sur l'ouverture des données publiques culturelles. Cette consultation visait à recueillir les besoins et les remarques des usagers concernant les jeux de données déjà ouverts et ceux qui auraient vocation à être ouverts.
  {% endhint %}

* **Animer des communautés de réutilisateurs**, notamment en organisant régulièrement des ateliers de discussions entre producteurs et réutilisateurs ou en proposant un espace d'échange en ligne.

{% hint style="info" %}
**Exemple :**

[L'Institut National de l'Information Géographique et Forestière](https://www.data.gouv.fr/fr/organizations/institut-national-de-l-information-geographique-et-forestiere/) (IGN) organise un certain nombre d'événements mettant à l'honneur les réutilisateurs. Il propose également des conférences, des webinaires de prise en main des différents services ainsi que des tutoriels d'accompagnement.
{% endhint %}

* **Réaliser des entretiens avec les principaux réutilisateurs.**

{% hint style="info" %}
**Exemple**

[Pôle Emploi](https://www.data.gouv.fr/fr/organizations/pole-emploi/) travaille étroitement avec la [startup d’Etat DiagOriente](https://beta.gouv.fr/startups/diagoriente.html) pour améliorer le [Répertoire Opérationnel des Métiers et des Emplois (ROME)](https://www.data.gouv.fr/fr/datasets/repertoire-operationnel-des-metiers-et-des-emplois-rome/) en intégrant les retours des utilisateurs de l’outil (compétences pertinentes à retenir, celles qui sont renommées, jamais sélectionnées) et ses travaux de reformulation sémantique des compétences professionnelles.
{% endhint %}


# Mettre en place une stratégie organisationnelle

Pour être en capacité d'améliorer la qualité des données en continu, il convient d'adapter sa stratégie organisationnelle. Il est notamment conseillé de :

* **Identifier une personne coordinatrice de la démarche d'ouverture des données** : elle a pour mission de publier les jeux de données, de s'assurer que leurs mises à jour sont effectuées et d'animer la vie des jeux de données sur la plateforme (répondre aux commentaires, etc.). La personne coordinatrice travaille en lien direct avec les équipes métiers afin de comprendre les problématiques techniques.
* **Elaborer un processus de rétroaction** : lors de l'exploitation des jeux de données, les réutilisateurs peuvent identifier des anomalies ou des problèmes de qualité ou encore proposer des améliorations. Il est nécessaire d'instaurer un canal de rétroaction afin d'intégrer ces remarques dans les processus métiers et ainsi améliorer la qualité des jeux de données.


# Maîtriser les schémas de données

{% hint style="info" %}
**Lexique : Schéma de données**

Les schémas de données (ou simplement schémas) permettent de décrire la structure d'un fichier d'un jeu de données.

Ils indiquent clairement quels sont les différents champs, comment sont représentées les données, quelles sont les valeurs possibles, leur format, etc.
{% endhint %}

{% hint style="success" %}
**Notion clef : Le cycle de vie de la donnée ouverte de qualité**

Le cycle de vie de la donnée ouverte de qualité se compose de 5 étapes principales :

1. **Fédérer une communauté ayant pour objectif de produire en open data des données aisément consolidables**

Il est essentiel que des acteurs ayant pour ambition de produire le même type de données se réunissent afin de définir ensemble un standard commun : un [schéma de données](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees/creer-un-schema-de-donnees).

2. **Référencer le schéma de données**

Une fois le schéma établi, il s’agit de le référencer, notamment sur [schema.data.gouv.fr](http://schema.data.gouv.fr/), la plateforme nationale de référencement qui permet un accès aux schémas et facilite l’intégration avec des systèmes informatiques.

3. **Saisir les données**

Un consensus ayant été atteint sur le schéma des données, il est temps de saisir les données en elles-même conformément au schéma.

4. **Valider les données par rapport au schéma**

Pour valider la conformité de ses données par rapport à un schéma particulier, il est possible d'utiliser l'outil [Validata](https://validata.fr/), développé par [la coopérative multi](https://www.multi.coop/) à l’initiative [d'OpenDataFrance](https://www.opendatafrance.net/).

5. **Publier les données en open data**

Les données désormais validées, il ne reste plus qu’à les publier !
{% endhint %}

Dans cette section, vous apprendrez à réaliser l'ensemble des étapes du cycle de vie de la donnée ouverte de qualité, notamment :

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Pourquoi il est intéressant d'utiliser un schéma de données</strong></td><td><a href="/pages/mxv6Ui66SdWBrSOIBBas">/pages/mxv6Ui66SdWBrSOIBBas</a></td></tr><tr><td><strong>Comment créer un schéma de données</strong></td><td><a href="/pages/r6ouoLXsIn8Mks5nt2pO">/pages/r6ouoLXsIn8Mks5nt2pO</a></td></tr><tr><td><strong>Comment intégrer un schéma de données à schema.data.gouv.fr</strong></td><td><a href="/pages/SoED2UWs7IabMajXBU1B">/pages/SoED2UWs7IabMajXBU1B</a></td></tr><tr><td><strong>Comment produire des données en conformité avec un schéma de données</strong></td><td><a href="/pages/GztFaq98siHoJyjhoY5b">/pages/GztFaq98siHoJyjhoY5b</a></td></tr><tr><td><strong>Comment indiquer et vérifier qu'une ressource respecte un schéma de données</strong></td><td><a href="/pages/GHV96XqfCyItAP7CXDPh">/pages/GHV96XqfCyItAP7CXDPh</a></td></tr></tbody></table>

*Ce guide sur les schémas de données résulte d'une co-rédaction entre les équipes d'*[*Etalab*](https://www.etalab.gouv.fr/) *et d'*[*OpenDataFrance*](https://www.opendatafrance.net/)*.*\
\
*Il s'inspire du contenu rédigé par de nombreux partenaires, listés par ordre alphabétique :*

* [*Charles Nepote*](https://twitter.com/charlesnepote)
* [*Datactivist*](https://datactivist.coop/)
* [*La FING*](https://fing.org/)
* [*OpenDataFrance*](http://www.opendatafrance.net/)

*Merci à eux !*


# Comprendre les bénéfices d'utiliser un schéma de données

La production de données en conformité avec un schéma de données existant présente de nombreux bénéfices :

* **Croisement** : les données créées peuvent être facilement croisées avec d’autres données conformes au schéma de données utilisé ;
* **Intéropérabilité** : l’interopérabilité des données et leur croisement est simplifié ;
* **Facilité d'agrégation** : si le jeu de données créé est une agrégation de plusieurs fichiers produits par différents acteurs, la formalisation et le partage d’un schéma de données facilite le travail d’agrégation des données --> ce schéma devient un standard pour votre communauté ;
* **Pérennité** : la formalisation d’un schéma de données assure une pérennité des fichiers dans le temps ;
* **Documentation** : la documentation d’un schéma de données existant est déjà rédigée et accessible ;
* **Ouverture** : la présence d'un schéma de données existant peut faciliter l'ouverture des données, les producteurs ayant directement une procédure claire à suivre ;
* **Qualité** : la conformité d'un fichier vis à vis d'un schéma de données, qu'il est possible de vérifier, permet de valider un premier niveau de qualité.

Il est aussi possible de générer des jeux de données d’exemple ou de proposer des formulaires de saisie standardisés.


# Créer un schéma de données

La création d'un schéma de données se décompose en 4 phases :

1. [**Investigation**](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees/creer-un-schema-de-donnees/etape-1-phase-dinvestigation) : envisager de créer un schéma de données ;
2. [**Concertation**](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees/creer-un-schema-de-donnees/etape-2-phase-de-concertation) : rassembler plusieurs parties prenantes pour créer un schéma de données ;
3. [**Construction**](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees/creer-un-schema-de-donnees/etape-3-phase-de-construction) : implémenter le schéma de données obtenu après la phase de concertation ;
4. [**Maintien et promotion**](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees/creer-un-schema-de-donnees/etape-4-phase-de-promotion-et-de-maintien) : faire la promotion d'un schéma auprès d'autres parties prenantes et le faire évoluer si besoin.

Dans cette section sont proposés pour chaque phase un processus à suivre, des bonnes pratiques et des outils.

{% hint style="success" %}
**Conseil de lecture**

Nous vous recommandons de lire une première fois cette section sur la création de schémas de données **en intégralité** afin de prendre connaissance des différentes phases. Vous pourrez ensuite vous référer aux pages pertinentes au fur et à mesure de votre avancée.
{% endhint %}


# Etape 1 : Phase d'investigation

{% hint style="info" %}
**Lexique : Phase d’investigation**

La phase d’investigation est la première phase de la création d’un schéma de données. Elle permet de s’assurer que la création d’un schéma est pertinente et en confirme la nécessité.
{% endhint %}

## Marche à suivre <a href="#etapes-a-suivre" id="etapes-a-suivre"></a>

Pour déterminer s’il est nécessaire de créer ou non un schéma de données, il est recommandé de suivre les étapes suivantes :

1. **Lire attentivement les différentes sections de ce guide** ;
2. **Organiser une réunion réunissant des acteurs métiers, techniques et de potentiels réutilisateurs** : vous débattrez de la pertinence de la création de votre schéma de données ;
3. **Référencez votre schéma pour entrer en contact avec les équipes d'Etalab et leurs partenaires** et bénéficier de conseils pour sa création, d'une visibilité accrue et d'une assistance d'experts.

## Exemples d'illustration <a href="#exemples" id="exemples"></a>

### :white\_check\_mark: Situations favorables à la création d’un schéma de données <a href="#situations-favorables-a-la-creation-d-un-schema-de-donnees" id="situations-favorables-a-la-creation-d-un-schema-de-donnees"></a>

> Exemple 1 : Le ministère chargé des transports souhaite consolider une base nationale des lieux pouvant servir de points de covoiturage. Les collectivités territoriales sont en charge de la création, du recensement et de l'aménagement de ces lieux.
>
> \--> Il est pertinent de créer un schéma de données car un grand nombre de producteurs de données doivent produire des données dans un format homogène. Un schéma facilitera la diffusion des prérequis, permettra la validation des données et facilitera l’agrégation nationale.

> Exemple 2 : L’INSEE souhaite diffuser le Code Officiel Géographique. Il rassemble des données sur des communes, des cantons, des arrondissements, des départements, des régions et des pays. Ce fichier est actualisé tous les ans.
>
> \--> Il est pertinent de créer un schéma car ces données sont des données de référence. Un grand nombre de réutilisateurs est susceptible d’utiliser ces données. Il est primordial que ces réutilisateurs aient accès à une documentation de qualité, que la structure des fichiers des données reste stable dans le temps et que les données publiées soient de bonne qualité.

> **Le cas des schémas de données en interne**\
> Bien qu’il ne paraisse pas nécessaire dans certaines situations de créer et de diffuser un schéma, vous pouvez choisir de le faire. En effet, les schémas de données comportent de nombreux avantages (documentation, montée en qualité, réutilisations, etc.) qui sont bénéfiques, même lorsque les données sont utilisées uniquement en interne.

### ❌ Situations dans lesquelles la création ou la diffusion d'un schéma de données ne semble pas nécessaire <a href="#situations-ou-le-referencement-d-un-schema-sur-schema-data-gouv-fr-ne-semble-pas-necessaire" id="situations-ou-le-referencement-d-un-schema-sur-schema-data-gouv-fr-ne-semble-pas-necessaire"></a>

> Une administration centrale diffuse des statistiques d’activité d’un bureau, en open data, de manière annuelle.
>
> \--> Avec ces seules informations, il ne semble pas nécessaire de créer un schéma : il n’y a qu’un seul producteur et le potentiel de réutilisation semble limité.

## Points de sortie <a href="#points-de-sortie" id="points-de-sortie"></a>

À l’issue de cette phase, vous devriez :

* [ ] Connaître les schémas de données ;
* [ ] Être en mesure de décider si votre projet requiert la création d’un schéma de données ;
* [ ] Savoir si votre schéma de données devra être référencé à terme sur schema.data.gouv.fr.\\


# Etape 2 : Phase de concertation

{% hint style="info" %}
**Lexique : Phase de concertation**

La phase de concertation est la phase centrale de la création d’un schéma de données.

C'est l’étape où plusieurs parties prenantes (producteurs, réutilisateurs, experts métiers et techniques) se rassemblent pour définir et spécifier les éléments essentiels à la constitution du schéma.
{% endhint %}

## Spécifier un schéma de données

Pour spécifier un schéma de données, il est nécessaire de définir :

* [ ] **les champs** ;
* [ ] **les types associés de ces champs** (une date, un nombre, une chaîne de caractère, etc.) ;
* [ ] **les contraintes de chaque champ** (entier positif, texte dans une liste fermée, etc.) ;
* [ ] **la description de chaque champ** ;
* [ ] **une documentation associée** au schéma de données décrivant le contexte, les acteurs, les cas d’usage.

Pour obtenir ce résultat, il peut être utile de réaliser au préalable un [modèle de données](/guides-open-data/guide-qualite/documenter-des-donnees/bien-documenter-un-jeu-de-donnees#description-du-modele-de-donnees) qui présente la structuration des informations. La modélisation ne prend pas en compte les contraintes d'implémentation, elle est un outil de dialogue entre les différents intervenants.

## Organiser la collaboration entre les différentes parties prenantes autour d'un schéma de données <a href="#procedure-de-collaboration" id="procedure-de-collaboration"></a>

Il est conseillé de :

* [ ] **travailler sur un document partagé**, accessible en ligne, tel qu'un Framapad ou Google Doc : l'important est que plusieurs contributeurs puissent contribuer (modifier ou mettre des commentaires) sans avoir besoin d'être présents physiquement ou de recevoir des versions intermédiaires par email.
* [ ] en complément du document partagé, **organiser plusieurs réunions** afin de débattre du schéma de données à produire (et de l'éventuel modèle de données construit).
* [ ] **impliquer une multitude d'acteurs** : vous devez rassembler des producteurs, experts métiers, experts techniques et réutilisateurs. La richesse des profils et des enjeux permettra d’aboutir à la solution la plus adaptée.

{% hint style="success" %}
**Référencer votre schéma de manière anticipée**

Référencer votre schéma sur [schema.data.gouv.fr](https://schema.data.gouv.fr/) vous permettra de bénéficier de conseils de la part d’Etalab et de ses partenaires institutionnels et associatifs.\
\--> La marche à suivre pour référencer votre schéma est détaillée [ici](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees/integrer-un-schema-de-donnees-a-schema.data.gouv.fr).
{% endhint %}

## Construire un schéma de données de qualité <a href="#grands-principes" id="grands-principes"></a>

Pour construire un schéma de données de qualité, il est conseillé de :

* [ ] **Construire un** [**modèle de données**](/guides-open-data/guide-qualite/documenter-des-donnees/bien-documenter-un-jeu-de-donnees#description-du-modele-de-donnees)**.** Il est important de disposer d'un outil visuel qui présente les entités "métier" mais surtout les dépendances et relations entre ces "entités". Ce modèle peut être enrichi de tous les attributs nécessaires au fur et à mesure de la concertation.
* [ ] **Profiter de l’existant.** De nombreux standards existent déjà, qu’ils concernent des formats de données ou des formats de champs. Certains standards sont devenus incontournables aujourd’hui, comme [ISO-8601](https://fr.wikipedia.org/wiki/ISO_8601) pour les dates ou [WGS 84](https://fr.wikipedia.org/wiki/WGS_84) pour les coordonnées géographiques.
* [ ] **Identifier et associer l’écosystème.** Les personnes/organisations que vous associez sont la meilleure garantie d’un schéma de données efficace et largement adopté, permettant d'aboutir à un véritable standard :

- D'un côté les producteurs, qui connaissent la réalité de leurs données, de la collecte, etc. et qui ont leurs propres usages.
- De l'autre les réutilisateurs, avec leurs besoins et leurs difficultés, qu’ils soient déjà connus, « sous le radar » ou en devenir.

* [ ] **Prendre le temps.** Un schéma de données est susceptible de concerner beaucoup de producteurs et d’usagers. Sa modification peut avoir un impact important. Il est donc crucial de prendre le temps d’obtenir tous les retours avant de publier un schéma utilisable par le plus grand nombre. Un schéma de données devrait être publié quand il est prêt, non pas en fonction d’un impératif de délai.
* [ ] **Lever les implicites et les ambiguïtés.** Toutes les spécifications d’un schéma de données doivent être les plus claires possibles, y compris pour des cas/données qui n’existent pas encore mais pourraient apparaître à l’avenir.
* [ ] **Éviter la redondance mais sans l’exclure absolument.** Trois champs pour définir une latitude et une longitude (`latitude`, `longitude`, `lat-lon`) est inutilement redondant. Toutefois, préciser le nom d’une commune en plus de son code INSEE rend les données plus faciles à lire et à exploiter.
* [ ] **Utiliser des données pivot relevant d’un référentiel ouvert** pour relier les données à d’autres données, par exemple l’utilisation du numéro SIREN pour identifier des organisations. Ce principe permet aussi d’éviter l’abondance de détails et d’aller à l’essentiel : l’obtention d’informations complémentaires se fera par le biais d’un autre référentiel.

{% hint style="info" %}
**Exemples à votre disposition**

Il est possible de retrouver des fichiers de schémas sur [schema.data.gouv.fr](https://schema.data.gouv.fr/) (exemple : [le schéma des lieux de stationnement](https://schema.data.gouv.fr/etalab/schema-stationnement/latest.html)).

En complément, [le guide dédié à la préparation de jeux de données](/guides-open-data/guide-qualite/preparer-un-jeu-de-donnees-de-qualite) pourrait être utile pour définir votre schéma.
{% endhint %}

## Points de sortie <a href="#points-de-sortie" id="points-de-sortie"></a>

À l’issue de cette phase, vous devriez :

* [ ] Avoir réuni différents partenaires afin de collaborer sur votre schéma de données ;
* [ ] Avoir décidé des différents champs de votre schéma de données, leurs types et définitions et produit une documentation associée.


# Etape 3 : Phase de construction

{% hint style="info" %}
**Lexique : Phase de construction**

La phase de construction consiste à implémenter techniquement le schéma de données obtenu après la phase de concertation. Pour cela, il est nécessaire de choisir un standard technique, créer les fichiers requis, les tester et les diffuser.

Durant cette phase, il est nécessaire de mobiliser des personnes possédant des compétences techniques. Cette phase consiste à transcrire les décisions prises lors de la phase de concertation en un ou plusieurs schémas de données suivant le découpage en fichiers retenu.
{% endhint %}

## Choisir un standard technique pour la description d'un schéma de données <a href="#choisir-un-standard-technique-pour-la-description-de-votre-schema-de-donnees" id="choisir-un-standard-technique-pour-la-description-de-votre-schema-de-donnees"></a>

{% hint style="info" %}
**Lexique : Standard**

On utilise les termes « normes » et « standards » pour décrire un référentiel commun et documenté destiné à harmoniser l’activité d’un secteur.
{% endhint %}

Il existe plusieurs standards techniques pour les schémas de données.

Le standard est à choisir en fonction :

* **de la nature des données concernées** ;
* **des habitudes de l’écosystème** produisant ou réutilisant les données liées au schéma.

Les principaux standards techniques sont les suivants :

* [**Table Schema**](https://frictionlessdata.io/specs/table-schema/) : adapté pour la description de données tabulaires (sous forme de tableurs ou de CSV). Ce standard technique utilise le format JSON ;
* [**JSON Schema**](https://json-schema.org/) : adapté pour la description de données avec une notion de hiérarchie. Ce standard utilise le format JSON ,
* [**XML Schema Definition (XSD)**](https://www.w3.org/TR/xmlschema11-1/) : adapté pour la description de données avec une notion de hiérarchie. Ce standard utilise le format XML.

Tous ces standards techniques sont supportés par [schema.data.gouv.fr](https://schema.data.gouv.fr/).

{% hint style="success" %}
**Conseil : Aller au-delà de la documentation texte**

Un schéma de données décrit uniquement par du texte ou par un tableau se prive de nombreux avantages, notamment celui de l'interopérabilité entre différents systèmes informatiques.

Les schémas de données décrits par des standards techniques permettent, en plus d’une documentation textuelle ou sous forme d’un tableau, de valider que des données correspondent à un modèle de données, d’agréger des données similaires, de générer automatiquement des données respectant un schéma.
{% endhint %}

## Créer un schéma de données <a href="#creer-votre-schema-de-donnees" id="creer-votre-schema-de-donnees"></a>

Une fois un standard technique choisi, **il faudra créer les fichiers requis pour modéliser les données**.

La documentation de chaque standard technique décrit le contenu des fichiers à renseigner. Reportez-vous aux documentations respectives pour tirer parti des fonctionnalités avancées offertes : types de données et contraintes sur les valeurs en particulier.

Il est possible de vérifier qu’un fichier correspond à un standard à l’aide d’outils en ligne ou en ligne de commande. Utilisez ces outils pour vérifier que vos productions correspondent au standard.

{% hint style="info" %}
**Exemples à votre disposition**

Pour un schéma au format Table Schema, [un modèle de départ](https://github.com/etalab/tableschema-template) est mis à disposition pour créer un dépôt Git contenant un schéma au format Table Schema.

Pour les autres formats de schémas, il est conseillé de consulter les schémas et dépôts Git listés sur [schema.data.gouv.fr](https://schema.data.gouv.fr/).
{% endhint %}

## Documenter un schéma de données <a href="#documenter-votre-schema-de-donnees" id="documenter-votre-schema-de-donnees"></a>

En complément du fichier du schéma de données, il est recommandé de rédiger a minima deux documents complémentaires :

* **Une documentation générale** qui indique le contexte, les modalités de production des données, le cadre juridique, la finalité, les cas d’usage etc. Ce fichier est traditionnellement rédigé en Markdown et nommé `README.md` ;
* **Un fichier répertoriant les changements** permettant de suivre les modifications, d’une version à une autre. Ce fichier est traditionnellement rédigé en Markdown et nommé `CHANGELOG.md`.

La présence de ces fichiers représente un package complet (*documentation, liste des changements et schéma de données décrit dans un standard technique*), apprécié des réutilisateurs. [schema.data.gouv.fr](https://schema.data.gouv.fr/) se repose sur ces éléments pour intégrer votre documentation et votre liste de changements sur une page web.

> **Exemple :** [La documentation](https://github.com/etalab/schema-stationnement/blob/master/README.md) et [la liste des changements](https://github.com/etalab/schema-stationnement/blob/master/CHANGELOG.md) du schéma des lieux de stationnement.

## Publier et diffuser un schéma de données <a href="#publier-et-diffuser-votre-schema-de-donnees" id="publier-et-diffuser-votre-schema-de-donnees"></a>

Une fois votre schéma de données créé, il est nécessaire de le publier et de le diffuser pour que d’autres personnes puissent en bénéficier.

**Il est recommandé de publier vos schémas de données en tant que logiciels libres, sur votre forge de développement ou par le biais de** [**GitLab**](https://about.gitlab.com/) **ou** [**GitHub**](https://github.com/)**.**

Vous bénéficierez alors des avantages habituels des dépôts de code Git en ligne :

* Historique des modifications
* Fonctionnalités de tickets
* Demandes de modifications.
* etc.

Il est conseillé d'utiliser un compte d’organisation (dédié à votre entreprise, direction, service, ministère) et non un compte personnel afin d’assurer une URL stable dans le temps.

> **Exemples à votre disposition :** Plusieurs dépôts Git de schémas sont disponibles sur [schema.data.gouv.fr](https://schema.data.gouv.fr/) (exemple : [le dépôt Git décrivant les lieux de stationnement](https://github.com/etalab/schema-stationnement) à l’aide d’un schéma TableSchema sur GitHub).

Pour faciliter la découverte de votre schéma de données et des données sous-jacentes, il est recommandé de le faire référencer sur [schema.data.gouv.fr](https://schema.data.gouv.fr/). La marche à suivre est détaillée [ici](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees/integrer-un-schema-de-donnees-a-schema.data.gouv.fr).

## Points de sortie <a href="#points-de-sortie" id="points-de-sortie"></a>

À l’issue de cette phase, vous devriez :

* [ ] Avoir implémenté votre schéma de données dans un des standards reconnus ;
* [ ] Avoir publié votre travail en ligne, dans un répertoire Git dédié ;
* [ ] Avoir pris contact avec les équipes de [schema.data.gouv.fr](https://schema.data.gouv.fr/) dans le but de référencer votre schéma de données si nécessaire.


# Etape 4 : Phase de promotion et de maintien

{% hint style="info" %}
**Lexique : Phase de maintien et de promotion**

La phase de maintien est la dernière phase du cycle de vie d'un schéma.\
Elle consiste à itérer sur la version actuelle en prenant en compte des évolutions du terrain et des retours des producteurs et des réutilisateurs pour peaufiner la structure du schéma.\
Elle est étroitement liée à la promotion du schéma qui permettra, grâce à son adoption par le plus grand nombre de parties prenantes, une montée en qualité et en quantité d'utilisations.

Modifier ou commenter un schéma contribue à faire vivre l'écosystème open data et permettra de vous identifier comme contributeur.rice sur un schéma spécifique.
{% endhint %}

## Promouvoir un schéma de données <a href="#promouvoir-votre-schema-de-donnees" id="promouvoir-votre-schema-de-donnees"></a>

De nouveaux acteurs peuvent vouloir publier des données qui rentrent dans le cadre de votre schéma, mais peuvent ne pas en avoir connaissance, ou ne pas avoir les compétences techniques pour se l'approprier.

Pour faciliter l'adoption d'un schéma de données, il est possible de :

* [ ] **diffuser ses travaux à ses partenaires et au grand public**, sur ses réseaux sociaux ou newsletters, pour mettre en valeur sa proactivité et susciter de l'intérêt ;
* [ ] **utiliser son réseau de connaissances pour inciter d'autres parties prenantes à publier leurs données**, par exemple via la plateforme [publier.etalab.studio](https://publier.etalab.studio/), que ce soit sous son schéma ou dans d'autres domaines, qui pourront donner lieu à d'autres schémas ;
* [ ] **aider des acteurs souhaitant utiliser son schéma**, en leur faisant bénéficier de son expérience, par exemple en leur répondant directement dans les commentaires sur [data.gouv.fr](https://www.data.gouv.fr/) ;
* [ ] **interagir avec les réutilisateurs** afin de mieux cerner leurs besoins, des améliorations possibles ou des champs d'investigation.

Des scripts ont été mis au point par les équipes d'Etalab pour permettre de vérifier et d'agréger toutes les données publiées par type de schéma et ainsi créer des fichiers consolidés à l'échelle nationale (i.e.[ données IRVE](https://www.data.gouv.fr/fr/datasets/fichier-consolide-des-bornes-de-recharge-pour-vehicules-electriques/)). Cela permet à des solutions à grande échelle d'émerger.

## Maintenir un schéma de données <a href="#maintenir-votre-schema-de-donnees" id="maintenir-votre-schema-de-donnees"></a>

Aussi exhaustive qu'ait été la phase de concertation, il est probable que des corrections ou des évolutions du schéma soient nécessaires afin de le rendre plus précis ou plus accessible par exemple.

**Clarifications de la documentation, corrections d’erreurs, évolutions du cadre réglementaire, etc. sont autant de raisons où il est indispensable de mettre en œuvre une nouvelle version.**

[schema.data.gouv.fr](https://schema.data.gouv.fr/) récupère le contenu de votre dépôt via des `releases` de celui-ci, c'est à dire des versions packagées de votre code (schéma + documentation). Avec ce système, il est alors possible pour schema.data.gouv.fr de suivre l'évolution formelle de votre schéma et d'en référencer les différentes versions au cours du temps. Cela permet également aux contributeurs de considérer les branches du dépôt Github qui héberge le schéma (`main` ou autre) comme un espace de développement participatif qui reste dissocié du référencement sur schema.data.gouv.fr tant qu'une nouvelle version n'est pas publiée.

Une fois que l'état de votre branche principale, `main` par exemple, vous conviendra, vous pourrez sur Github ou Gitlab créer une release. Pour cela, il suffit d'ajouter un tag et une version correspondant à la nouvelle version que vous souhaitez publier. Celle-ci sera par la suite automatiquement récupérée par schema.data.gouv.fr et publiée (généralement sous 24h).

Si un schéma que vous maintenez doit être modifié, la marche à suivre peut être la suivante :

1. **faire une nouvelle** [**phase de concertation**](https://guides.etalab.gouv.fr/producteurs-schemas/phase-concertation) afin d'évoquer les problématiques qui imposent un changement et de trouver la solution la plus adaptée. Si vous n'avez pas d'espace pour cela, nous vous conseillons de publier une [`issue` sur le dépôt Github de schema.data.gouv.fr](https://github.com/etalab/schema.data.gouv.fr/issues).
2. lorsqu'un accord est trouvé, **mettre à jour techniquement le schéma** lui-même (cf. le paragraphe ci-après);
3. **mettre à jour la documentation du schéma** ;
4. **déployer les mises à jour sous un nouveau tag de version** ;
5. **communiquer sur cette mise à jour**.

Lorsque les modifications à faire à un schéma font consensus, il est nécessaire de les implémenter et de déployer une nouvelle version. La marche à suivre peut être la suivante :

1. **répertorier tous les changements à faire avant de les implémenter** : anticiper l'impact sur les fichiers techniques et sur la documentation (notamment l'incrémentation de la version)
2. **faire les modifications listées à l'étape précédente** :
   * en local, puis pousser les changements avec les commandes git (add, commit et push)
   * ou directement sur Github
3. **créer une release (nouvelle version)** :
   * sur la page Github de votre schéma, cliquer sur `X tags` (à côté des branches) : ici sont listées toutes les versions du schéma
   * cliquer sur `Releases` puis `Draft a new release`
   * indiquer le nom de la nouvelle version dans `Choose a tag` : par exemple si la version actuelle est v1.0.1, la nouvelle sera v1.0.2 (dans certains cas, il sera opportun de passer en 1.1.1 ou en 2.0.1)
   * la branche cible (`target`) doit être la branche principale, si des développements ont été faits sur d'autres branches, il est nécessaire de les fusionner - `merge` - avec la branche principale via une [`pull request`](https://docs.github.com/fr/pull-requests) (après validation des modifications)
   * documenter la nouvelle version : ajouter un titre et une description exhaustive des changements dans les champs dédiés, juste avant la publication
   * publier la release (`Publish release`)

Que ce soit pour des considérations techniques ou "conceptuelles", il est possible de solliciter les équipes de schema.data.gouv.fr qui pourront vous accompagner dans le processus de mise à jour de votre schéma.

## Points de sortie <a href="#points-de-sortie" id="points-de-sortie"></a>

À l’issue de cette phase, vous devriez :

* [ ] Comprendre l'importance de la proactivité dans la promotion, la diffusion et le maintien d'un schéma ;
* [ ] Avoir des pistes d'actions concrètes pour porter un schéma auprès d'autres parties prenantes ;
* [ ] Savoir pourquoi, quand et comment mettre à jour un schéma de données.


# Focus : Construire un schéma TableSchema

La pertinence de la mise en place d'un standard de données réside dans son adéquation entre les capacités de sa mise en oeuvre par les producteurs de données et les outils permettant l'automatisation des jeux de données valides par rapport à cette spécification.

Cette standardisation doit permettre de **faciliter la mise en relation des jeux de données** issus de différents producteurs.

{% hint style="info" %}
Cette page détaille des recommandations, visant à faciliter la création de nouveaux schémas et **leur intégration dans une chaîne de validation et de publication généralisable**, notamment :

* Des recommandations pour le formatage des fichiers csv
* Des recommandations de formatage des données
* Des recommandations de champs obligatoires
* Des recommandations pour le nommage des fichiers
* Des recommandations pour le nommage des champs
* Des recommandations pour la mise en conformité
  {% endhint %}

## Recommandations pour le formatage des fichiers csv <a href="#formatage-csv" id="formatage-csv"></a>

Un des formats privilégiés pour les standards de données est le [CSV](https://fr.wikipedia.org/wiki/Comma-separated_values) (Comma Separated Values, valeurs séparées par des virgules). Il s'agit d'un format de données "à plat", **adéquat pour les structures de données simples**.

Cependant, ce format simple ne dispose pas de spécifications contraignant la saisie des données. Pour cela un schéma en Json est ajouté dont la structure est défini par le standard [TableSchema](https://specs.frictionlessdata.io/table-schema/). TableSchema permet d'indiquer les formats des données attendus, de spécifier des contraintes (types de valeurs, cardinalité) et de documenter les différents champs composant le schéma.

{% hint style="success" %}
L'outil de validation utilisé pour vérifier la conformité d'un fichier csv au standard auquel il fait référence s'appuie sur la structure tabulaire des données. Elles peuvent donc être contenues dans un tableur numérique au format .xls, .xlsx ou .ods ou dans un fichier texte au format .csv, .txt ou autre.
{% endhint %}

La question du séparateur utilisé pour séparer deux champs de données dans un fichier .csv n'est donc pas essentielle. Cependant, certains outils se basent sur la valeur de ce séparateur pour traiter et publier des jeux de données. Nous vous proposons donc un certain nombre de recommandations afin de favoriser la généralisation d'un usage contribuant à l'interopérabilité des données produites.

### Format de fichier csv <a href="#format-de-fichier-csv" id="format-de-fichier-csv"></a>

Bien que de nombreux jeux de données en CSV utilisent le point-virgule comme séparateur de champs, il a été décidé de privilégier le **séparateur virgule** car plus conforme à l'esprit du format csv.

Les tableurs numériques courants (Excel et Calc) peuvent produire et lire des fichiers csv. Lors de l'enregistrement d'un fichier créé avec l'outil Calc, l'utilisatrice ou utilisateur doit spécifier le format d'encodage des données ainsi que le séparateur de champs. Lorsque le séparateur de champs retenu est la virgule, il est recommandé d'utiliser les guillemets double " comme séparateur de chaîne de caractères. De cette manière, si une virgule est présente à l'intérieur d'une cellule elle ne sera pas considérée comme un séparateur de champs.

{% hint style="success" %}
Lors de l'ouverture d'un fichier csv dans Calc, une fenêtre modale propose plusieurs options permettant de spécifier un caractère de séparation et un encodage des données.

Dans Excel, il faut aller dans l'onglet données et sélectionner l'option Fichier texte pour accéder à l'assistant d'import des données.
{% endhint %}

L’encodage des caractères à privilégier est l'[UTF-8](https://fr.wikipedia.org/wiki/UTF-8) de manière à garantir une **meilleure interopérabilité des données**.

Pour faciliter la lecture des fichiers publiés en CSV il est recommandé d'y associer dans les outils de publication le **type MIME ou Content-Type "text/csv"**.

**Chaque ligne du fichier doit avoir le même nombre de champs**, ce qui signifie que lorsqu'une cellule est vide elle doit quand même être présente soit avec la valeur Null, soit avec des crochets vides \[] dans le cas des champs de type tableau (array), soit laissée vide mais apparaître à l'export avec 2 virgules qui se suivent ,, .

## Recommandations de formatage des données <a href="#recommandations-de-formatage-des-donnees" id="recommandations-de-formatage-des-donnees"></a>

Les recommandations de formatage pour les données sont généralement issues du standard [TableSchema](https://specs.frictionlessdata.io/table-schema/), lui-même inspiré des spécifications du format [Json](https://www.json.org/json-fr.html), dans lequel sont exprimés les schémas de données permettant l'automatisation de leur validation.

Ce standard dispose des types de données suivants :

* **string** : s'applique pour toutes les chaînes de caractères
* **number** : s'applique pour les chiffres et nombres contenant éventuellement des décimales
* **integer** : s'applique pour les chiffres et nombres entiers
* **boolean** : s'applique pour indiquer que la valeur d'un champs ne peut être égale qu'à "vrai" ou "faux" (ou "1" et "0" ou "oui" ou "non")
* **object** : s'applique pour les données de type objet
* **array** : s'applique pour les tableaux de données

Les types de données peuvent être assortis de formats de données facilitant l'automatisation de leur validation.

Pour déclarer un format de données dans un schéma JSON il est possible d'utiliser différentes propriétés permettant de le caractériser :

* **name** : le nom du champ
* **title** : le titre du champ
* **description** : la description des valeurs attendues dans ce champ
* **format** : le format du champ
* **type** : le type du champ

Il est également possible de contraindre les valeurs autorisées dans ce champ à l'aide de plusieurs proriétés :

* **required** : indique l'obligation de la présence d'une valeur pour ce champ dans toutes les lignes du fichier
* **unique** : indique que chaque valeur de ce champ à l'intérieur du fichier doit être unique
* **minLength** : indique la taille minimale des valeurs de ce champ
* **maxLength** : indique la taille maximale des valeurs de ce champ
* **minimum** : indique la valeur minimum autorisée pour ce champ (par exemple pour une date on peut indiquer une année en deça de laquelle les valeurs ne sont pas autorisées)
* **maximum** : indique la valeur maximale autorisée pour ce champ
* **pattern** : indique une expression régulière à laquelle doivent être conforme les valeurs de ce champ (par exemple pour un numéro SIRET on peut indiquer `^\\d{14}$` ce qui signifie que les valeurs de ce champ doivent contenir exactement 14 chiffres)
* **enum** : indique une liste de valeurs autorisées pour ce champ

Ci-dessous quelques exemples tirés du [schéma des menus de la restauration collective](https://schema.data.gouv.fr/scdl/menus-collectifs/1.2.1.html).

Le champ permettant d'indiquer le numéro SIRET d'une collectivité est spécifiée de la manière suivante :

```
{
    "name": "menuCollSiret",
    "title": "Code SIRET de la collectivité qui produit les données.",
    "description": "Identifiant du Système d'Identification du Répertoire des Etablissements (SIRET) de la collectivité qui commandé le menu. Ce code doit obligatoirement être composé de 9 chiffres SIREN + 5 chiffres NIC d’un seul tenant.",
    "type": "string",
    "examples": "21330063500017",
    "constraints": {
        "required": true,
        "pattern":	"^\\d{14}$"
    }
}
```

Le champ permettant d'indiquer la date de publication d'un enregistrement du jeu de données est spécifié de la manière suivante :

```
{
    "name": "menuPublicationDate",
    "title": "Date de publication de l'enregistrement d'un menu",
    "description": "Lors de la publication ce champ d'horodatage permet d'indiquer la date de publication de la donnée présente dans le fichier.",
    "type": "datetime",
    "examples": "2020-05-11T14:08:32Z",
    "constraints": {
    "required": true
    }
}
```

Les informations ci-dessous décrivent les différents types de champs disponibles dans la spécification TableSchema.

### Données de type string <a href="#donnees-de-type-string" id="donnees-de-type-string"></a>

Pour le type string, les formats de données suivants sont disponibles :

* **default** : n'importe quelle chaîne de caractère
* **email** : une adresse email valide.
  * motif de validation :
* **uri** : une URI valide
* **binary** : une chaîne de caractère encodées en base 64 représentant des données binaires.
* **uuid** : une chaîne de caractère représentant un identifiant unique.

### Données de type décimal <a href="#donnees-de-type-decimal" id="donnees-de-type-decimal"></a>

* **Description** : Les valeurs décimales doivent utiliser le point afin d'être plus facilement exploitables par les tableurs numériques.
* **Type** : number
* **Exemple** : 3900.50

### Données de type date <a href="#donnees-de-type-date" id="donnees-de-type-date"></a>

* **Description** : date au format AAAA-MM-JJ suivant la norme internationale [ISO 8601](https://fr.wikipedia.org/wiki/ISO_8601).
* **Type** : date
* **Exemple** : 2017-10-15
* **Format** : "%Y-%m-%d"
* **Nommage** : abreviation-du-schemaDate

### Données de type date avec heure <a href="#donnees-de-type-date-avec-heure" id="donnees-de-type-date-avec-heure"></a>

* **Description** : date au format aaaa-mm-jjThh:mi:ssZZZZZZ suivant la norme internationale [ISO 8601](https://fr.wikipedia.org/wiki/ISO_8601). On considérera que ZZZZZZ (+ou- décalage horaire GMT), est par défaut +01:00 en France et qu'il est inutile de le préciser dans les formats.
* **Type** : datetime
* **Exemple** : 1997−07−16T19:20:00

### Données de type date avec heure de début et de fin <a href="#donnees-de-type-date-avec-heure-de-debut-et-de-fin" id="donnees-de-type-date-avec-heure-de-debut-et-de-fin"></a>

* **Description** : date au format aaaa-mm-jjThh:mi/hh:mi suivant la norme internationale ISO 8601. Ce type de données s'applique pour un créneau horaire dans la même journée, sans les secondes. Pour une extension de ces conditions, voir la norme [ISO 8601](https://fr.wikipedia.org/wiki/ISO_8601).
* **Type** : datetime
* **Exemple** : 1997−07−16T08:30/17:30

### Données de type horaires d'ouverture <a href="#donnees-de-type-horaires-d-ouverture" id="donnees-de-type-horaires-d-ouverture"></a>

* **Description** : horaires indiquant les heures d'ouverture d'un service ou d'un commerce. Ce type de données permet de préciser les différents horaires d'ouverture pour les différents jours de la semaine. Il s'agit donc d'un type de données multi-valeur au sein duquel le nom du jour de la semaine est abrégé et suivi par les heures d'ouvertures. Les abréviations pour les jours sont en anglais (Mo, Tu, We, Th, Fr, Sa, Su) et les horaires sont sous la forme HH:MM

{% hint style="success" %}
Un assistant graphique en ligne [yohours](https://projets.pavie.info/yohours) permet de générer simplement cette structure de données
{% endhint %}

* **Type** : string (chaîne de caractères)
* **Exemple** : Mo 08:15-13:15; Tu 03:15-06:15; We 03:15-09:30; Th 02:30-07:15; Fr 01:30-05:45; Sa 00:30-05:00; Su 02:45-08:30
* **Nommage** : abreviation-du-schemaHoraires

### Données de type géolocalisation <a href="#donnees-de-type-geolocalisation" id="donnees-de-type-geolocalisation"></a>

La possibilité est laissée de décrire les points de géolocalisation d'une donnée à l'intérieur d'un champ unique (geopoint) ou à l'aide de 2 champs (latitude et longitude).

#### **Latitude**

* **Description** : ce type de données permet de saisir la coordonnée de latitude exprimée en [WGS 84](https://fr.wikipedia.org/wiki/WGS_84) permettant de localiser un équipement. Le signe de séparation entre les parties entière et décimale du nombre est le point. Précision : 6 décimales maximum.
* **Type** : number
* **Exemple** : 48.563433
* **Nommage** : abreviation-du-schemaLat

#### **Longitude**

* **Description** : ce type de données permet de saisir la coordonnée de longitude exprimée en [WGS 84](https://fr.wikipedia.org/wiki/WGS_84) permettant de localiser un équipement. Le signe de séparation entre les parties entière et décimale du nombre est le point. Précision : 6 décimales max.
* **Type** : number
* **Exemple** : 2.572875
* **Nommage** : abreviation-du-schemaLon

#### **Geopoint**

* **Description** : ce type de données permet de saisir les coordonnées de latitude et de longitude exprimée en [WGS 84](https://fr.wikipedia.org/wiki/WGS_84) permettant de localiser un équipement. Le signe de séparation entre les parties entière et décimale du nombre est le point. Précision : 6 décimales max. Le séparateur de valeur est la virgule. Il est donc nécessaire d'entourer ces valeurs de guillemets. La première valeur est la latitude
* **Type** : number
* **Exemple** : "48.563433, 2.572875"
* **Nommage** : abreviation-du-schemaGeo

#### **Geoshape**

* **Description** : ce type de données permet de décrire la forme géographique d'un équipement. La forme est décrite à l'aide de paires de coordonnées, séparées par un espace vide et chaque paire séparée par une virgule. La description d'une ligne est exprimée à l'aide de 2 ou plus paires de points séparés par des virgules. La description d'un polygone est exprimée par 4 ou plus paires de points séparés par des virgules dont la dernière est identique à la première.
* **Type** : string
* **Exemple** : "48.563433 2.572875, 49.234933 2.134432, 49.885311 2.134003, 48.974635 2.1134567, 48.563433 2.572875"

### Données de type adresse <a href="#donnees-de-type-adresse" id="donnees-de-type-adresse"></a>

Ce type de champ permet de décrire l'adresse postale d'un équipement. Il est décomposé entre 3 champs permettant de distinguer et de faciliter le tri à l'intérieur des informations de voirie, de code postal et de commune. Le numéro et le nom de la voie sont séparés par une virgule.

#### **Voie**

* **Description** : ce type de champs permet de saisir le numéro et le nom de la voie
* **Type** : string
* **Exemple** : 34, rue de Latresne
* **Nommage** : abreviation-du-schemaVoie

#### **Code postal ou Code INSEE**

* **Description** : ce type de champs permet de saisir le code postal (ou le code INSEE) de la commune
* **Type** : number
* **Exemple** : 45800
* **Nommage** : abreviation-du-schemaCodePostal

#### **Commune**

* **Description** : ce type de champs permet de saisir le nom de la commune
* **Type** : string
* **Exemple** : Saint-Jean-de-Braye
* **Nommage** : abreviation-du-schemaCommune

## Recommandations de champs obligatoires <a href="#recommandations-de-champs-obligatoires" id="recommandations-de-champs-obligatoires"></a>

Afin d'unifier la description des données au travers des différentes thématiques abordées par le propositions de standard de données, **il est fortement recommandé de rendre obligatoire la présence d'un certains nombre de champs**.

Ceux-ci contribuent à la **portabilité des données** (qui produit la donnée) ou à **leur fiabilité** (quand a été produite la donnée).

### Identification du producteur <a href="#identification-du-producteur" id="identification-du-producteur"></a>

Pour l'identification des autorités publiques à l'origine de la production et de la publication des jeux de données, il est recommandé d'indiquer le nom et le numéro de SIRET sur chaque ligne de chaque jeu de données.

### **Nom de la collectivité**

* **Description** : ce champs permet de saisir le nom de l'autorité publique responsable de la production des données
* **Type** : string
* **Exemple** : Conseil départemental de la Creuse
* **Nommage** : abreviation-du-schemaColl

Par exemple

```
{
    "name": "menuCollNom",
    "title": "Nom de la collectivité qui produit les données",
    "description": "Nom officiel de la collectivité ou de l'établissement public responsable de l'offre de restauration collective et qui produit les données.",
    "type": "string",
    "examples": "Grand Poitiers Communauté urbaine",
    "constraints": {
        "required": true 
    }
}
```

#### **SIRET de la collectivité**

* **Description** : ce champ permet d'indiquer le numéro d'identification de l'autorité publique au sein de la base nationale des établissements.
* **Type** : string
* **Exemple** : 21330063500017
* **Motif** : ^\d{14}$
* **Nommage** : nom-ou-abreviation-du-schemaCollSiret

Par exemple :

```
{
    "name": "menuCollSiret",
    "title": "Code SIRET de la collectivité qui produit les données.",
    "description": "Identifiant du Système d'Identification du Répertoire des Etablissements (SIRET) de la collectivité qui commandé le menu. Ce code doit obligatoirement être composé de 9 chiffres SIREN + 5 chiffres NIC d’un seul tenant.",
    "type": "string",
    "examples": "21330063500017",
    "constraints": {
        "required": true,
        "pattern":	"^\\d{14}$"
    }
}
```

### **Horodatage des données**

Pour faciliter la réutilisation et la mise à jour des données, il est recommandé de fournir aux réutilisatrices et réutilisateurs potentiels **des dates de première publication et de dernière modification pour chaque entité du jeu de données**.

Ces informations au format Date avec horaire peuvent correspondre à la date de première publication et faire apparaître les dates de dernière modification pour l'ensemble des lignes ou en cas de mise à jour partielle pour une ligne de données particulière.

Il est également recommandé d'y associer un champ permettant de décrire la raison ayant entraîné une mise à jour des données depuis leur publication.

#### **Date de création/publication**

* **Description** : ce champs permet de décrire la date de première publication de la donnée
* **Type** : datetime
* **Exemple** : 2020-05-11T14:08:32Z
* **Nommage** : nom-ou-abreviation-du-schemaPublicationDate

Par exemple :

```
{
    "name": "menuPublicationDate",
    "title": "Date de publication de l'enregistrement d'un menu",
    "description": "Lors de la publication ce champ d'horodatage permet d'indiquer la date de publication de la donnée présente dans le fichier.",
    "type": "datetime",
    "examples": "2020-05-11T14:08:32Z",
    "constraints": {
        "required": true
    }
}
```

#### **Date de dernière modification**

* **Description** : ce champs permet de décrire la date de dernière modification de la donnée
* **Type** : datetime
* **Exemple** : 2020-05-11T14:08:32Z
* **Nommage** : nom-ou-abreviation-du-schemaModificationDate

Par exemple :

```
{
    "name": "menuModificationDate",
    "title": "Date de dernière modification de l'enregistrement d'un menu",
    "description": "Lors de la modification ce champ d'horodatage permet d'indiquer la date de dernière modification de la donnée présente dans le fichier.",
    "type": "datetime",
    "examples": "2020-05-11T14:08:32Z",
    "constraints": {
    "required": false
    }
}
```

#### **Information sur les modifications**

* **Description** : ce champs permet de décrire la raison d'une modification de la donnée depuis sa publication initiale
* **Type** : string
* **Exemple** : changement dû à un aléa de livraison
* **Nommage** : nom-ou-abreviation-du-schemaModificationInfo

Par exemple :

```
{
    "name": "menuModificationInfo",
    "title": "Information sur la modification ayant entraîné une mise à jour de la donnée",
    "description": "Afin de renseigner les usagers de la donnée, il est possible de préciser dans ce champ la raison de la mise à jour effectuée.",
    "type": "string",
    "examples": "changement dû à un aléa de livraison",
    "constraints": {
        "required": false
    }
}
```

## Recommandations pour le nommage des fichiers <a href="#recommandations-pour-le-nommage-des-fichiers" id="recommandations-pour-le-nommage-des-fichiers"></a>

Les fichiers doivent, sauf exception et autant que possible, respecter les règles de nommage suivantes :

**AAAAMMJJ\_idProducteur\_nom-du-fichier.extension**

* **AAAAMMJJ** : Date de création du fichier
* **idProducteur** : Numéro [SIREN](https://fr.wikipedia.org/wiki/Syst%C3%A8me_d'identification_du_r%C3%A9pertoire_des_entreprises) sur 9 chiffres pour identifier le producteur
* **nom-du-fichier** Chaîne de caractères dont les termes, en minuscules non accentuées, sont séparés par un tiret du milieu
* **.extension** : Si les règles de formatage sont respectées, l'extension est .csv

Les 3 éléments constitutifs de la chaîne principale avant l'extension sont assemblés en un seul tenant et séparés par un tiret du bas.

* **Exemple** : '20180314\_213502388\_prenoms-nouveaux-nes-rennes-2017.csv'

## Recommandations pour le nommage des champs <a href="#recommnandations-pour-le-nommage-des-champs" id="recommnandations-pour-le-nommage-des-champs"></a>

Afin d'uniformiser les fichiers produits dans le cadre de schémas de standardisation, il est recommandé de **normaliser les intitulés des champs composant chaque standard**.

La règle générale préconisée est l'utilisation de **l'écriture camelCase** où chaque mot composant l'intitulé du champ est écrit avec une majuscule à l'exception du premier.

En complément il est recommandé d'utiliser un préfixe (mot complet ou abréviation) pour l'ensemble des champs d'un standard.

En conséquence, pour le standard des menus, les intitulés des champs sont préfixés par le mot menu suivi des intitulés à proprement dit. Par exemple :

* menuCollNom
* menuRestaurantIdType
* menuRepasType

**Aucun caractère accentué ou spécial** ne doit être utilisé dans l'intitulé d'un champ. Il est également préconisé de ne pas dépasser 50 caractères pour l'intitulé d'un champ et d'utiliser le singulier pour les mots composant l'intitulé du champ.

## Recommandations pour la mise en conformité <a href="#recommandations-pour-la-mise-en-conformite" id="recommandations-pour-la-mise-en-conformite"></a>

Pour garantir la conformité des jeux de données, il est demandé aux producteurs de s'assurer que la structure, les champs et les contenus attendus sont effectivement respectés.

De fait, les fichiers tabulaires doivent, autant que possible, contenir :

* **Toutes les colonnes**, y compris celles dont les cellules ne sont pas renseignées, dans le bon ordre, et avec des en-têtes correctement nommées sur la première ligne ;
* **Autant de lignes que nécessaire** comprenant des cellules dont les valeurs peuvent être **obligatoires** (elles doivent être impérativement renseignées) ou **optionnelles** (elles sont seulement recommandées ou soumises à condition de disponibilité / pertinence).


# Intégrer un schéma de données à schema.data.gouv.fr

{% hint style="info" %}
**Qu'est-ce que schema.data.gouv.fr ?**

[schema.data.gouv.fr](https://schema.data.gouv.fr/) est l’initiative de [data.gouv.fr](https://data.gouv.fr/) de référencement des schémas de données publiques pour la France.

Cette plateforme de référencement national permet un accès aux schémas produits par différents acteurs et facilite l’intégration avec des systèmes informatiques par le biais de standards, d’URLs stables, de processus de validation et d’API.
{% endhint %}

<figure><img src="/files/N5JtktGTTy9rUKOm5mer" alt=""><figcaption><p>Page d'accueil de schema.data.gouv.fr</p></figcaption></figure>

## Qui peut référencer des schémas de données ?

**Tout acteur est libre de proposer le référencement de schémas sur** [**schema.data.gouv.fr**](https://schema.data.gouv.fr/) : administration, entreprise privée, association, citoyen, etc.

## Quels schémas de données sont acceptés ?

### Schémas de données acceptés sur schema.data.gouv.fr

* **Des schémas de données décrivant des données publiques.**

{% hint style="success" %}
Les schémas de données sont acceptés dès lors que leur l’existence est justifiée par voie :

* **réglementaire** : c'est une disposition réglementaire qui est à l'origine de la définition du schéma de données ;

* **d’usage** : la réutilisation des données décrites par le schéma bénéficie à un grand nombre ou de nombreux producteurs sont amenés à utiliser ce schéma de données.
  {% endhint %}

* **Des schémas de données décrits par un standard technique** (cf. page ["Phase de construction"](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees/creer-un-schema-de-donnees/etape-3-phase-de-construction)) : les schémas de données décrits uniquement par de la documentation textuelle ou des tableaux ne sont pas acceptés.

{% hint style="info" %}
**Standards techniques supportés**

Les standards techniques de schémas de données actuellement supportés sont les suivants :

* [**Table Schema**](https://frictionlessdata.io/specs/table-schema/) : adapté pour la description de données tabulaires (sous forme de tableurs ou de CSV). Ce standard technique utilise le format JSON.
* [**JSON Schema**](https://json-schema.org/) : adapté pour la description de données avec une notion de hiérarchie. Ce standard utilise le format JSON.
* [**XML Schema Definition (XSD)**](https://www.w3.org/TR/xmlschema11-1/) : adapté pour la description de données avec une notion de hiérarchie. Ce standard utilise le format XML.
  {% endhint %}

### Prérequis de validation des schémas de données sur schema.data.gouv.fr <a href="#prerequis-de-validation-des-schemas-de-donnees" id="prerequis-de-validation-des-schemas-de-donnees"></a>

{% hint style="info" %}
**Lexique : Validation d’un schéma de données**

La validation d’un schéma de données est l’étape qui permet de vérifier si celui-ci est conforme au standard technique sélectionné et aux prérequis de [schema.data.gouv.fr](https://schema.data.gouv.fr/). Cette étape s’intéresse uniquement au schéma de données et à la façon dont il est publié.

Il ne faut pas confondre la validation d’un schéma avec le fait de vérifier que des données correspondent à un schéma.
{% endhint %}

Pour tous les types de schéma de données, il faut que :

* [ ] **le schéma de données soit sur un dépôt Git, à raison d’un dépôt par schéma**. Ce dépôt doit pouvoir être cloné depuis Internet sans authentification préalable ;
* [ ] **le dépôt Git doit comporter des tags indiquant les versions du schéma de données**. Ces versions doivent respecter la [gestion sémantique de version semver](https://semver.org/lang/fr/), sous la forme `1.3.2` par exemple ;
* [ ] **le dépôt doit comporter un fichier `README.md` à la racine** contenant une documentation du schéma de données indiquant par exemple le contexte de production, la gouvernance ;
* [ ] **passer avec succès les tests spécifiques au type de schéma de données que le dépôt contient.**

{% hint style="info" %}
**Critères complets de validation**

Cette page présente les grands principes de validation des schémas de données.

**Le détail des prérequis propres à chaque type de schéma de données, ainsi que des exemples, sont disponibles** [**ici**](https://schema.data.gouv.fr/validation.html)**.**
{% endhint %}

Etalab se réserve le droit de refuser le référencement de schémas en motivant son refus. Il est encouragé d'[initier une discussion](https://github.com/etalab/schema.data.gouv.fr/issues) préalablement à l’ouverture d’une *pull request*.

## Quand référencer un schéma de données ?

Il est recommandé de référencer un schéma de données le plus tôt possible, **dès** [**la phase d’investigation**](/guides-open-data/guide-qualite/maitriser-les-schemas-de-donnees/creer-un-schema-de-donnees/etape-1-phase-dinvestigation).

En référençant celui-ci en amont, vous bénéficierez de l’accompagnement d’Etalab et de partenaires tout au long de la création de votre schéma de données : de l'investigation au référencement sur [schema.data.gouv.fr](https://schema.data.gouv.fr/).

## Comment référencer un schéma de données ?

Pour référencer un schéma de données, vous pouvez :

* **ouvrir un ticket sur GitHub**
* **entrer en contact** [**avec notre équipe par e-mail**](mailto:schema@data.gouv.fr)

[**Une page dédiée détaille la procédure**](https://schema.data.gouv.fr/contribuer.html)**.**

Une liste de schémas de données actuellement en phase d'investigation ou de construction est tenue à jour sur cette même page.


# Produire des données en conformité avec un schéma

\--> La marché à suivre est détaillée [ici](/guides-open-data/guide-qualite/preparer-un-jeu-de-donnees-de-qualite/structurer-un-jeu-de-donnees#produire-des-donnees-conforme-a-un-schema-de-donnees-identifie).


# Indiquer et vérifier qu'une ressource respecte un schéma de données

Une fois qu'un schéma est finalisé et référencé sur [schema.data.gouv.fr](https://schema.data.gouv.fr/), il est temps de produire des données conformes à ce schéma.

[data.gouv.fr](https://data.gouv.fr/) propose de multiples intégrations avec [schema.data.gouv.fr](https://schema.data.gouv.fr/) permettant de spécifier qu'une ressource présente sur [data.gouv.fr](https://data.gouv.fr/) est censée être conforme à un schéma.

**Il est ensuite possible de procéder à la validation de la ressource par rapport au schéma ou de consulter la documentation du schéma à partir de la page d'un jeu de données.**

Il est possible d'indiquer qu'une ressource d'un jeu de données correspond à un schéma depuis l'interface d'administration de data.gouv.fr.

* Lorsque vous déposez ou éditez une ressource, vous pouvez sélectionner le schéma correspondant à vos données depuis une liste déroulante.

![Capture d'écran de la sélection d'un schéma depuis l'interface d'administration de data.gouv.fr](https://guides.etalab.gouv.fr/assets/img/selection-schema.d958a2c6.png)

* Le fait d'indiquer que votre ressource est censée respecter un schéma permet de bénéficier de vérifications de la qualité des données et d'indiquer aux réutilisateurs que vos données respectent un référentiel.

<figure><img src="/files/qvqCxTzvK4WYOwCaH7KC" alt=""><figcaption></figcaption></figure>


# Réutiliser des données


# Utiliser les API géographiques

Ce guide a vocation à vous accompagner dans l'usage des API géographiques principalement opérées par Etalab.

{% hint style="danger" %}
[La Base Adresse Nationale est désormais portée par l'IGN](https://www.numerique.gouv.fr/espace-presse/la-base-adresse-nationale-ban-franchit-de-nouvelles-etapes-en-poursuivant-son-action-au-sein-de-lign/).
{% endhint %}

Ce guide propose d'explorer des cas pratiques d'utilisation des API géographiques mises à votre disposition pour vous accompagner dans leur utilisation, que vous soyez en train de construire une carte ou que vous souhaitiez récupérer des données géographiques.

Ce guide s'adresse donc à plusieurs types de profils :

* Néophytes dans l'utilisation des APIs ;
* Intégrateurs web ;
* Spécialistes du secteur géospatial.

Il s'agit d'un outil évolutif et ouvert. Vous pouvez contribuer à l'améliorer en proposant une modification sur [GitHub](https://github.com/etalab/guides.data.gouv.fr/tree/main/reutiliser-des-donnees/utiliser-les-api-geographiques) ou en [contactant directement](mailto:geo@data.gouv.fr) l'équipe Géo d'Etalab.

{% hint style="info" %}
**Quelles sont les API géographiques dont il est question dans ce guide ?**

* **API Adresse (Base Adresse Nationale - BAN)**

L'API Adresse permet d'interroger la Base Adresse Nationale, base de données de l’intégralité des adresses du territoire français.\
En intégrant l'API dans votre système d'information, vous pouvez facilement rechercher une adresse et notamment faire de l'autocomplétion et de la vérification d'adresse, géolocaliser une adresse sur une carte ou encore faire une recherche géographique inversée (trouver la rue la plus proche de coordonnées géographiques).

* **API Découpage administratif (API Geo)**

L'API Découpage Administratif permet d'interroger les référentiels géographiques plus facilement.\
En intégrant l'API dans votre système d'information, vous pouvez notamment rechercher une commune par nom, code postal ou coordonnées géographiques, rechercher un département par son nom ou encore rechercher une région par son nom.

* **Les tuiles vectorielles openmaptiles.geo.data.gouv.fr**

L'API permet de mettre à disposition des tuiles vectorielles qui sont affichables sur des cartes géographiques interactives.\
Elles servent principalement à afficher des fonds de plan mais aussi les contours cadastraux et les limites administratives en France.\
Cela permet de vous affranchir d'APIs cartographiques comme Google Maps.
{% endhint %}

{% hint style="success" %}
**Recommandations logiciels**

Il est recommandé d'avoir un navigateur web en ayant installé [l'extension JSONView](https://jsonview.com/) pour faciliter la compréhension des retours JSON.

Vous pouvez aussi installer un éditeur de texte plus agréable à utiliser que le Bloc-Notes/Notepad par défaut si vous êtes sous Windows. Il vous permettra en particulier lorsque vous faites des tests sur les URLs de les modifier avant de les copier dans la barre d'adresse de votre navigateur. Il peut s'agir de [Notepad++](https://notepad-plus-plus.org/downloads/) si vous êtes sous Windows ou bien de [Microsoft Visual Studio Code](https://code.visualstudio.com/) quel que soit votre système d'exploitation. Une liste plus complète d'éditeurs de texte est disponible [ici](https://fr.wikipedia.org/wiki/%C3%89diteur_de_texte#%C3%89diteurs_de_texte_couramment_utilis%C3%A9s).
{% endhint %}

Dans ce guide, vous apprendrez comment :

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Utiliser l'API Adresse</strong></td><td><a href="/pages/YQypTxoNv36LobJK1gPw">/pages/YQypTxoNv36LobJK1gPw</a></td></tr><tr><td><strong>Utiliser l'API Découpage administratif</strong></td><td><a href="/pages/qU9SAnuyw4qujBwqVCmQ">/pages/qU9SAnuyw4qujBwqVCmQ</a></td></tr><tr><td><strong>Utiliser les tuiles vectorielles</strong></td><td><a href="/pages/UTGpuiGNTr1bLoK2G2yG">/pages/UTGpuiGNTr1bLoK2G2yG</a></td></tr></tbody></table>


# Utiliser l'API Adresse

{% hint style="info" %}
Familier des APIs ? Vous pouvez directement vous référer à :

➡️ [La documentation générale autour de l’adresse](https://doc.adresse.data.gouv.fr/)

➡️ [La documentation de l’API Adresse](https://adresse.data.gouv.fr/api-doc/adresse)

N'hésitez pas non plus à vous rendre à la partie ["Cas pratiques"](/reutiliser-des-donnees/utiliser-les-api-geographiques/utiliser-lapi-adresse/geocoder-des-adresses-pratique) qui donne des exemples prêts à l'emploi.
{% endhint %}

Dans cette section, vous apprendrez comment :

<table data-card-size="large" data-view="cards"><thead><tr><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Rappel sur les données adresses</strong></td><td><a href="/pages/lAVeVHhUUE8m5DmWpxhp">/pages/lAVeVHhUUE8m5DmWpxhp</a></td></tr><tr><td><strong>Géocoder des adresses - théorie</strong></td><td><a href="/pages/Bn5SQMeg2pqj7QorillL">/pages/Bn5SQMeg2pqj7QorillL</a></td></tr><tr><td><strong>Géocoder des adresses - cas pratiques</strong></td><td><a href="/pages/SgEFssbCbZKkakMa4AMX">/pages/SgEFssbCbZKkakMa4AMX</a></td></tr><tr><td><strong>FAQ Adresse</strong></td><td><a href="/pages/V1nwhbDo9LGNehfuAGzZ">/pages/V1nwhbDo9LGNehfuAGzZ</a></td></tr></tbody></table>


# Rappel sur les données adresses

## Comment les données d’adresses sont-elles constituées ? <a href="#comment-les-donnees-d-adresses-sont-elles-constituees" id="comment-les-donnees-d-adresses-sont-elles-constituees"></a>

La donnée adresse qui compose la Base Adresse Nationale (BAN) est soit :

* issue de données provenant d’acteurs historiques de l’adresse (IGN, Cadastre, etc.) ;
* issue des Bases Adresses Locales (BAL) qui sont l’inventaire des adresses créé par les communes.

À terme, ces dernières devraient devenir la seule source. La commune doit certifier ces adresses, c’est-à-dire valider que les adresses saisies sont justes.

L’image ci-dessous résume la situation pour consolider les données adresses :

<figure><img src="/files/if57fV19JU5OoAaHNzJR" alt=""><figcaption><p>Schéma explicatif de la consolidation des données d'adresses</p></figcaption></figure>

## **Quels sont les usages de l’API Adresse ?** <a href="#quels-sont-les-usages-de-l-api-adresse" id="quels-sont-les-usages-de-l-api-adresse"></a>

L'API Adresse est utilisée principalement pour :

* trouver par un formulaire une adresse pour la corriger et/ou récupérer des coordonnées en ayant une liste de choix pour trouver le résultat : c’est l’autocomplétion;
* fournir un fichier tabulaire pour obtenir en retour une version enrichie des coordonnées et d’autres informations.

## Comment accéder aux données d’adresses ? <a href="#comment-acceder-aux-donnees-d-adresses" id="comment-acceder-aux-donnees-d-adresses"></a>

Pour accéder aux données d'adresses, il est possible de :

* **Récupérer directement les données**. Cette méthode s’adresse à des utilisateurs avancés. Vous avez 2 choix
  * prendre les données au niveau départements ou France via <https://adresse.data.gouv.fr/donnees-nationales>
  * récupérer les communes à une échelle EPCI ou communes en passant par <https://adresse.data.gouv.fr/deploiement-bal> Vous pouvez vous référer à [cet article du site Geotribu](https://geotribu.fr/articles/2021/2021-09-07_traiter_fichiers_adresse_gdal_csv_vrt/#introduction) pour un exemple d'intégration
* **Utiliser l’API de recherche**. Cette API peut rechercher des adresses soit via un appel unique par adresse soit en mode "*batch*" : on passe un fichier avec une liste d’adresse, une par ligne et on retourne la première adresse retournée pour chacune des lignes.

<figure><img src="/files/WCpZZHO5dXcw3AyITtav" alt=""><figcaption><p>Page d'accueil d'adresse.data.gouv.fr</p></figcaption></figure>


# Géocoder des adresses - théorie

## Qu'est-ce que le géocodage ?

{% hint style="info" %}
**Lexique : Géocodage**\
Le géocodage consiste à affecter des coordonnées géographiques (longitude/latitude) à une adresse postale (Wikipédia).

Il permet ainsi de positionner des adresses sur une carte ou encore de trouver les points de départ et d’arrivée pour déterminer votre trajet lorsque vous voyagez par exemple.
{% endhint %}

### Les indispensables pour réaliser un géocodage

Pour réaliser un géocodage, il est nécessaire de disposer :

* des **données de référence** contenant numéro, nom de rue, [code INSEE](https://www.data.gouv.fr/en/datasets/code-officiel-geographique-cog/), code postal, nom de commune ;
* des **coordonnées géographiques** x et y qui sont généralement la longitude(x) et la latitude(y) ;
* une **entrée correspondant à l’adresse recherchée**.

### Le fonctionnement d'un géocodeur <a href="#comment-fonctionne-un-geocodeur" id="comment-fonctionne-un-geocodeur"></a>

Un géocodeur transforme une donnée textuelle des données de référence en utilisant des algorithmes qui séparent l’adresse en syllabes, mots et groupes de mots.

Les différents éléments sont indexés, puis en s’appuyant sur des algorithmes relatifs à du traitement textuel, le géocodeur compare la similarité entre les mots constituant l’adresse à rechercher et ceux qui sont indexés depuis les données de référence.

Un algorithme permet généralement d’ordonner les résultats. Il s’agit par exemple de faire apparaitre en premier les résultats ayant les coordonnées fixes les plus proches ou encore ceux dont la population est la plus forte.

Il est également possible de filtrer selon des critères comme le pays (si le géocodeur a une vocation internationale, comme [Nominatim](https://nominatim.openstreetmap.org/)) ou encore par type de résultat.

En pratique, un certain nombre de géocodeurs visent à réaliser des recherches de communes et de POIs (Points Of Interest ou points d’intérêts) et pas seulement des adresses.

Le **géocodage peut aussi se faire de façon inverse**, c’est-à-dire retourner une adresse en envoyant une coordonnée. Dans ce cas de figure, il s’agit de trouver la donnée de référence la plus proche des coordonnées envoyées.

### Les limites du géocodage <a href="#les-limites-du-geocodage" id="les-limites-du-geocodage"></a>

Nous nous concentrons ici sur les cas liés aux adresses, le géocodeur utilisé par [adresse.data.gouv.fr](http://adresse.data.gouv.fr/) étant spécifiquement conçu pour répondre à ce besoin.

**La qualité des données de référence**

Les données textuelles de l’adresse de référence ne sont pas toujours uniformes.

> Exemple : "rue" peut être représenté par les lettres "r" ou "R" ou "rue" ou "Rue".

Il s’agit donc en premier lieu d’uniformiser les différentes manières de décrire le type de voie.

Il s’agit également d’omettre les articles lors d’une comparaison.

> Exemple : chercher "rue métanies" au lieu de "rue des métanies".

D’un autre côté, les coordonnées géographiques peuvent manquer de précision. Dans certains cas, il arrive de disposer uniquement du centroïde de la commune, de la voie ou du lieu dit (point d’une zone géographique choisi au voisinage de son centre de gravité et dont les coordonnées servent de localisant pour cette zone).

Dans d’autres cas, les coordonnées peuvent avoir été interpolées : les adresses ont été positionnées en fonction du nombre de numéros dans une voie et la longueur de celle-ci.

#### Les principales problématiques liées aux adresses

<details>

<summary><strong>Plusieurs communes pour un code postal</strong>.</summary>

Cette problématique se pose par exemple lorsqu’on met le nom de la commune dans une adresse. En effet, 68,9% des codes postaux sont associés à plus d’une commune et jusqu’à 46 communes sont rattachées à un même code postal.

</details>

<details>

<summary><strong>Plusieurs codes postaux pour une commune</strong>.</summary>

1,5% des communes ont plus d’un seul code postal sur leur territoire. On compte même jusqu’à 9 codes postaux pour une même commune pour le cas extrême !

</details>

<details>

<summary><strong>Des communes ont des noms identiques</strong>.</summary>

10,6% des communes ont une ou plusieurs communes homonymes.

</details>

<details>

<summary><strong>Des codes postaux n’ont pas le même code que celui du département</strong>.</summary>

Ces cas de figure sont très rares (quelques dizaines).

</details>

<details>

<summary><strong>Plusieurs noms de voie avec un nom identique sont situés à différents endroits pour une même commune</strong>.</summary>

Cette situation s’explique en particulier avec la création des communes nouvelles qui a encouragé le regroupement de communes. Ce problème peut être réglé en ajoutant le nom de la commune déléguée dans l’adresse postale, en renumérotant les rues ou en les renommant. Or les géocodeurs ne gèrent pas forcément bien (voir pas du tout) l’ajout d’adresse de la commune déléguée.

</details>

<details>

<summary><strong>Plusieurs coordonnées pour une même adresse.</strong></summary>

* Il peut exister des différences liées à la vision sur la position du numéro de l’adresse (entrée principale, boîte aux lettres, bâtiment, cage d’escalier, logement, parcelle, position dérivée du segment de la voie de rattachement, point d’accès technique, etc.) ;
* Des référentiels différents selon les acteurs même si la BAN (Base Adresse Nationale) et les BAL (Bases Adresses Locales) amènent à une amélioration et une uniformisation des référentiels : données héritées de la Poste, de l’IGN, du cadastre, des opérateurs réseaux (fibre, etc.).

</details>


# Géocoder des adresses - cas pratiques

## Comment faire de l’**autocomplétion d’adresse ?** <a href="#comment-faire-de-l-autocompletion-d-adresse" id="comment-faire-de-l-autocompletion-d-adresse"></a>

Il existe plusieurs solutions pour faire de l’autocomplétion dans un outil web.

Vous pouvez vous appuyer sur de nombreuses bibliothèques, celles-ci étant généralement liées à des bibliothèques cartographiques.

#### **Solutions basées sur Leaflet**

* <https://github.com/entrepreneur-interet-general/leaflet-geocoder-ban>
* <https://github.com/komoot/leaflet.photon>

> **Exemples :**
>
> * <https://entrepreneur-interet-general.github.io/leaflet-geocoder-ban/demo/demo_control.html>
> * <https://entrepreneur-interet-general.github.io/leaflet-geocoder-ban/demo/demo_search_bar.html>
> * <https://gist.githack.com/ThomasG77/0b99013795f76699c5c9a0d7daf4411e/raw/a6b65c033efa73cecb3ea8473ba83aabc973d373/demo-ban-leaflet-photon.html>

#### **Solutions basées sur OpenLayers**

* <https://github.com/webgeodatavore/photon-geocoder-autocomplete>
* <https://viglino.github.io/ol-ext/examples/search/map.control.searchban.html>

> **Exemples :**
>
> * <https://raw.githack.com/webgeodatavore/photon-geocoder-autocomplete/master/demo/index-ol.html>

#### **Solutions indépendantes de bibliothèques cartographiques**

* <https://github.com/webgeodatavore/photon-geocoder-autocomplete>

> **Exemples :**
>
> * [Exemple avec Maplibre, mais non lié à Maplibre](https://raw.githack.com/webgeodatavore/photon-geocoder-autocomplete/master/demo/index-maplibre.html)
> * [Exemple avec OpenLayers, mais non lié à OpenLayers](https://gist.githack.com/ThomasG77/0b99013795f76699c5c9a0d7daf4411e/raw/a6b65c033efa73cecb3ea8473ba83aabc973d373/demo-ban-openlayers.html)
> * [Formulaire exemple 1](https://raw.githack.com/webgeodatavore/photon-geocoder-autocomplete/master/demo/index-no-map.html)
> * [Formulaire exemple 2](https://gist.githack.com/ThomasG77/0b99013795f76699c5c9a0d7daf4411e/raw/a6b65c033efa73cecb3ea8473ba83aabc973d373/demo-ban-form-only-alternate.html)

## Comment faire du **géocodage par adresse unitaire ?** <a href="#comment-faire-du-geocodage-par-adresse-unitaire" id="comment-faire-du-geocodage-par-adresse-unitaire"></a>

Avec Python, pour faire des appels unitaires, vous pouvez :

* **utiliser** [**le code de ce script**](https://gist.githubusercontent.com/ThomasG77/32329a8557135f11cb5656e3bfd4d35c/raw/9bd7883be31d2c9758d4393d72e9dc1ae4c5bed3/geocode-addok-unit-call.py) ;
* **passer par** [**Geopy**](https://geopy.readthedocs.io/en/stable/#installation) : il existe une [classe `BANFrance` pour ce besoin](https://geopy.readthedocs.io/en/stable/#banfrance).

En JavaScript, vous pouvez utiliser [ces exemples](https://addok.readthedocs.io/en/latest/examples/#using-javascript-client-side) que ce soit pour un usage côté navigateur ou côté serveur (Node.js/deno).

## Comment réaliser un géocodage massif ? <a href="#geocodage-massif" id="geocodage-massif"></a>

Lorsqu'on choisit cette option, on privilégie l'appel par le endpoint CSV de l'API.

Il faut préalablement s'assurer que son CSV est bien formaté : il s'avère que le géocodage peut ponctuellement dysfonctionner si le CSV n'est pas bien formaté.

#### **Option manuelle** <a href="#option-manuelle" id="option-manuelle"></a>

Il existe une interface graphique pour envoyer des fichiers CSV sur <https://adresse.data.gouv.fr/csv> dont la taille maximum est de 50Mo.

Pour tester, téléchargeons [le fichier exemple](https://gist.githubusercontent.com/ThomasG77/32329a8557135f11cb5656e3bfd4d35c/raw/9bd7883be31d2c9758d4393d72e9dc1ae4c5bed3/annuaire-des-debits-de-tabac-2018-utf8-20lines.csv) puis suivez l'exemple en utilisant le GIF animé ci-dessous.

![](/files/vrLPkoKSpa66CromeCaH)

Pour réaliser un géocodage massif, il faut généralement vérifier le formatage de votre CSV.

#### **Python seul**

* Solution partant d'appels unitaires plutôt que des appels CSV : <https://github.com/MTES-MCT/bulk-geocoding-python-client>
* Solution partant d'appels à l'API CSV. Il suffit de récupérer [le zip](https://gist.github.com/ThomasG77/32329a8557135f11cb5656e3bfd4d35c/archive/3681bd0c070540abfdae55e6ff0bf9a41795cf42.zip), de décompresser le fichier. Ensuite, il vous suffit de lancer le script Python avec `python chunk-csv-python.py`. Cela permettra de faire l'appel vers l'API CSV soit en une fois, soit en plusieurs phases. On obtiendra ainsi le fichier `annuaire-des-debits-de-tabac-2018-utf8-20lines.geocoded.csv` qui est la version géocodée par l'API CSV d'un fichier de 20 lignes ainsi que `myresults.csv` qui est une version qui résulte d'une phase de découpage d'un gros fichier en plusieurs morceaux, d'appels à l'API CSV à partir de chacun de ces fichiers, puis du réassemblage des fichiers ainsi retournés. Vous n'avez plus qu'à adapter le code du fichier `chunk-csv-python.py`.
* <https://github.com/MTES-MCT/bulk-geocoding-python-client> (attention, la solution fait des appels unitaires plutôt que des appels CSV)

#### **JavaScript** <a href="#javascript" id="javascript"></a>

* Géocodage massif avec une solution en ligne de commande utilisant Node.js : <https://github.com/jdesboeufs/addok-geocode-stream>

#### **Autres outils utilisant la BAN** <a href="#autres-outils-utilisant-la-ban" id="autres-outils-utilisant-la-ban"></a>

**--> Vous faites du SIG, néophyte comme expert et utilisez le logiciel SIG QGIS ?**

* Recherchez des adresses : <https://oslandia.gitlab.io/qgis/french_locator_filter/>
* Géocodez des tables depuis une table dans QGIS QBano : <https://www.data.gouv.fr/en/reuses/plugin-experimental-qbano-pour-qgis/>. À ce jour, le plug-in est mal maintenu, il vaut mieux récupérer [ce zip](https://labs.webgeodatavore.com/partage/QBano.zip) puis installer le plug-in depuis celui-ci.
* Avec PyQGIS, vous pouvez aussi géocoder en partant de : <https://gis.stackexchange.com/a/395415/638>

**--> Vous utilisez d’autres outils?**

* Vous faites du R ? <https://cran.r-project.org/web/packages/banR/index.html>
* Vous souhaitez intégrer la recherche dans le CMS SPIP ? <http://plugins.spip.net/gisban.html>

## Que faire lorsqu'on est un gros consommateur de l’API [api-adresse.data.gouv.fr](http://api-adresse.data.gouv.fr/) ? <a href="#gros-consommateurs-de-l-api-api-adresse-data-gouv-fr" id="gros-consommateurs-de-l-api-api-adresse-data-gouv-fr"></a>

Si vous êtes un organisme public, vous pouvez faire une demande pour augmenter les quotas par défaut sur l’API publique [api-adresse.data.gouv.fr](http://api-adresse.data.gouv.fr/).

Si ce n’est pas le cas, vous pouvez vous autohéberger.

* Dans ce cas, le plus simple est de passer par l’utilisation de Docker : <https://github.com/etalab/addok-docker#readme>.
* Il est possible aussi de regarder du côté de Addok, le logiciel open source derrière l’API Adresse si vous avez des besoins plus spécifiques au niveau de votre installation ou de la personnalisation de la recherche : <https://github.com/addok/addok>.

## Quels autres géocodeurs est-il possible d'utiliser ? <a href="#geocodeurs-alternatifs" id="geocodeurs-alternatifs"></a>

Même si nous avons abordé l’usage du géocodeur Addok, utilisé par adresse.data.gouv.fr, il existe d'autres possibilités pour géocoder.

Leurs principaux intérêts sont de pouvoir chercher des POIs (un centre commercial, une enseigne, etc.) ainsi que de marcher sur des données internationales, contrairement à [l'instance publique de Addok](https://adresse.data.gouv.fr/api-doc/adresse).

Il est ainsi possible d'installer des solutions OpenSource comme :

* [Pelias](https://github.com/pelias/pelias)
* [Photon](https://github.com/komoot/photon)
* [Nominatim](https://github.com/osm-search/Nominatim)

Il est aussi possible de détourner Addok pour lui faire effectuer d’autres types de recherche, par exemple des POIs en utilisant le projet <https://github.com/osm-fr/osmpoi4addok> par exemple.

Une instance alternative d'Addok (<http://demo.addok.xyz>) est mise à disposition et contient des données venant de la BANO, des POIs d'OpenStreetMap ainsi que des intersections de rues/routes.

Vous pouvez aussi vous appuyer sur les services mis à disposition par l’IGN pour le géocodage : <https://geoservices.ign.fr/services-web-experts-calcul> (voir les sections "Services de géocodage" et "Service de recherche Look4"). Vous pouvez aussi regarder [leur nouveau service de géocodage.](https://geoservices.ign.fr/documentation/services/services-beta/nouveau-service-de-geocodage-demonstrateur)


# FAQ Adresse

Une majorité des questions sont adressées déjà dans [la FAQ officielle](https://adresse-data-gouv-fr.gitbook.io/faq/manipulations-techniques). Cette FAQ présente surtout l'intérêt d'expliquer comment chercher à comprendre d'où vient une erreur d'adresse: cela peut venir des sources, des données ou bien du service de géocodage lui-même.

## Comment faire si une recherche d’adresse ne fonctionne pas ? <a href="#comment-faire-si-une-recherche-d-adresse-ne-fonctionne-pas" id="comment-faire-si-une-recherche-d-adresse-ne-fonctionne-pas"></a>

* Vérifier en utilisant l’[autocomplétion](https://adresse.data.gouv.fr/base-adresse-nationale#4.4/46.9/1.7) :
  * Tapez votre adresse. Par exemple, "20 avenue de Ségur". Si le numéro est bien proposé et que la commune est la bonne pour le premier résultat, c’est la manière dont vous avez récupéré l’adresse qui est en cause. Si vous êtes en mode "batch", la première adresse retournée peut être mauvaise et c’est la 2ème ou 3ème adresse que vous attendiez.
  * Imaginons que vous pensiez que le numéro existe, mais ne le trouvez pas dans votre résultat de géocodage. Essayez alors de trouver la rue. Essayons "87 avenue de Ségur". On ne voit que des rues qui sont retournées suite à la recherche. Cliquez sur la rue qui semble correspondre à votre recherche. Cela va zoomer. Vous allez pouvoir voir s’il y a des adresses et lesquelles sont inventoriées.
* La donnée de référence n’est pas présente : c’est un oubli ou personne ne l’a encore produite.
* Le résultat est une adresse BAL. Votre commune est entrée dans une démarche de recensement et valorisation de ces adresses.
  * Vous pouvez confirmer si l'adresse existe en allant sur <https://adresse.data.gouv.fr/deploiement-bal>.
    * Zoomez sur la carte pour trouver votre commune ou l'organisme qui porte votre BAL, par exemple un intercommunalité.
    * Cliquez sur le polygone. Allons par exemple à [la communauté d'agglomération Arles Crau Camargue Montagnette](https://adresse.data.gouv.fr/bases-locales/jeux-de-donnees/601402f5818a575b16081fe3).
    * Descendons et recherchons une commune puis cliquons dessus, par exemple [Arles](https://adresse.data.gouv.fr/base-adresse-nationale/13004).
    * On peut maintenant chercher par nom de voie ou lieu dit pour vérifier que la voie existe. Prenons [l'allée des Manades](https://adresse.data.gouv.fr/base-adresse-nationale/13004_2865#15.05/43.66235/4.6205).
    * Nous pouvons ensuite vérifier dans la liste l'existence du numéro.
* Adresse IGN vs adresse cadastre vs adresse BAL.
* La donnée est présente, mais les termes de recherche ne permettent pas de la trouver.

{% hint style="success" %}
Vous êtes un particulier ? Vous pouvez récupérer les coordonnées de votre commune pour lui faire part de vos retours en passant par <https://adresse.data.gouv.fr/contribuer> puis en cherchant votre commune.
{% endhint %}

## Que faire lorsqu'on est un gros consommateur de l’API [api-adresse.data.gouv.fr](http://api-adresse.data.gouv.fr/) ? <a href="#gros-consommateurs-de-l-api-api-adresse-data-gouv-fr" id="gros-consommateurs-de-l-api-api-adresse-data-gouv-fr"></a>

Si vous êtes un organisme public, vous pouvez faire une demande pour augmenter les quotas par défaut sur l’API publique [api-adresse.data.gouv.fr](http://api-adresse.data.gouv.fr/).

Si ce n’est pas le cas, vous pouvez vous autohéberger.

* Dans ce cas, le plus simple est de passer par l’utilisation de Docker : <https://github.com/etalab/addok-docker#readme>.
* Il est possible aussi de regarder du côté de Addok, le logiciel open source derrière l’API Adresse si vous avez des besoins plus spécifiques au niveau de votre installation ou de la personnalisation de la recherche : <https://github.com/addok/addok>.


# Utiliser l'API Découpage administratif

{% hint style="info" %}
**Pourquoi utiliser l’API Découpage administratif ?**

L’API Découpage administratif permet d’obtenir des données administratives françaises :

* à des échelles différentes (communes, départements, régions) ;
* à des années différentes (notion de millésime).

L'API Découpage administratif est principalement destinée à un besoin de recherche pour des formulaires en partant du nom de la commune, du code postal ou bien du code INSEE.

Les usages départements ou régions bien que pratiques semblent moins intéressants car les données ne changent quasiment jamais dans le temps et le nombre limité d'éléments fait qu'il est possible de gérer ces informations côté client.
{% endhint %}

<figure><img src="/files/q0fhBRWVCIeJsEFWv8Bc" alt=""><figcaption><p>Accès à l'API Découpage administratif</p></figcaption></figure>

## Comment utiliser l'API dans un site web ? <a href="#utilisation-de-l-api-dans-un-site-web" id="utilisation-de-l-api-dans-un-site-web"></a>

L’API est très utile pour permettre de faire **l'auto-complétion** qu’il s’agisse d’un formulaire ou pour permettre de zoomer sur une commune trouvée dans un contexte web : <https://gist.githack.com/ThomasG77/0b99013795f76699c5c9a0d7daf4411e/raw/a6b65c033efa73cecb3ea8473ba83aabc973d373/index.html>

La partie importante se base sur un simple [Fetch](https://developer.mozilla.org/fr/docs/Web/API/Fetch_API).

Il est aussi possible de [remplir les informations de coordonnées dans un tableur comme Libre Office](https://medium.com/@ThomasG77/api-et-g%C3%A9ocodage-dans-libre-office-calc-488ab78dc360).

## Quels sont les exemples officiels d'utilisation de l'API ? <a href="#rappels-des-exemples-officiels" id="rappels-des-exemples-officiels"></a>

Ici sont présentés les exemples les plus courants.

Pour des usages plus spécifiques, vous pouvez utiliser [les exemples de la documentation officielle](https://geo.api.gouv.fr/decoupage-administratif).

{% tabs %}
{% tab title="Pour récupérer des communes" %}

#### Utilisation de l’API pour récupérer des communes <a href="#utilisation-de-l-api-pour-recuperer-des-communes" id="utilisation-de-l-api-pour-recuperer-des-communes"></a>

* Rechercher par code postal : <https://geo.api.gouv.fr/communes?codePostal=78000>
* Rechercher par code INSEE : <https://geo.api.gouv.fr/communes?code=44109>
* Rechercher par nom : <https://geo.api.gouv.fr/communes?nom=Nantes&boost=population&limit=5> (on ajoute un boost par population pour que la plus grande commune soit privilégiée)
* Rechercher par coordonnées : <https://geo.api.gouv.fr/communes?lat=47.0482944&lon=-1.1501568>
* Filtrer par département pour éviter les problèmes liés à l'homonymie de commune, par exemple la commune de Saint-Aubin existe dans les départements 10, 21, 36, 39, 40, 47, 59, 62, 91 et 02 : <https://geo.api.gouv.fr/communes?nom=Saint-Aubin&codeDepartement=21>
* Obtenir toutes les communes d'un département : <https://geo.api.gouv.fr/departements/44/communes>
* Obtenir toutes les communes d'une région : <https://geo.api.gouv.fr/communes?codeRegion=84>

Tous les exemples ci-dessus ne filtrent pas les champs, ne permettent pas de choisir si on veut des géométries pour les communes : soit le centre, au sens mathématique, de la commune, soit son contour, ni ne permettent pas le choix de la sérialisation : pour la cartographie, généralement, on utilise un JSON spécifique dit GeoJSON.

La meilleure manière de comprendre comment cela fonctionne est d'utiliser [la démo recherche avancée de la documentation officielle](https://geo.api.gouv.fr/decoupage-administratif/communes#advanced). Elle permet, en cochant, de voir comment l'URL d'appel change en particulier l'option `fields` pour ne retourner que les colonnes/champs nécessaires.

{% hint style="info" %}
**Ce qu'il faut retenir pour les aspects géo :**

* Si vous souhaitez les GeoJSON avec le centre de la commune --> rajoutez aux URLs de la première partie `&format=geojson&geometry=centre` si votre URL contient déjà un `?` sinon il faut ajouter plutôt `?format=geojson&geometry=centre`
* Si vous souhaitez les GeoJSON avec le contour de la commune --> rajoutez aux URLs de la première partie `&format=geojson&geometry=contour` si votre URL contient déjà un `?` sinon il faut ajouter plutôt `?format=geojson&geometry=contour`

Un exemple pour illustrer

<https://geo.api.gouv.fr/communes?lat=47.0482944&lon=-1.1501568>

devient :

* Si l’on souhaite le centre de la commune : <https://geo.api.gouv.fr/communes?lat=47.0482944&lon=-1.1501568&format=geojson&geometry=centre>
* Si l’on souhaite le contour de la commune : <https://geo.api.gouv.fr/communes?lat=47.0482944&lon=-1.1501568&format=geojson&geometry=contour>

Il faut également penser à mettre en cache quand on a des appels lourds qui ne changent pas ou qu'on retourne des contours. Ainsi :

* Sans contour, la réponse fait 480Ko <https://geo.api.gouv.fr/communes?codeRegion=84>
* Avec contour, la réponse fait 34Mo <https://geo.api.gouv.fr/communes?codeRegion=84&format=geojson&geometry=contour>

Vous pouvez très bien sauvegarder dans un fichier le résultat des URLs ci-dessus : le résultat ne va pas changer en permanence car ce n'est pas de l'autocomplétion.
{% endhint %}
{% endtab %}

{% tab title="Pour récupérer des régions et des départements" %}

#### Utilisation de l’API pour récupérer des régions et des départements <a href="#utilisation-de-l-api-pour-recuperer-des-regions-et-des-departements" id="utilisation-de-l-api-pour-recuperer-des-regions-et-des-departements"></a>

Dans ce cas de figure, le principal intérêt est la correspondance entre un nom et un code.

Si l’on souhaite le code d'un département ou d'une région, on prend :

* pour la région : <https://geo.api.gouv.fr/regions?nom=Auvergne>
* pour le département : [https://geo.api.gouv.fr/departements?nom=Loire Atl](https://geo.api.gouv.fr/departements?nom=Loire%20Atl)

Les cas départements et régions fonctionnent comme les communes et changent très rarement. Il est souvent envisageable d'avoir les fichiers globaux JSON plutôt que passer par des appels API. On a ainsi sous forme JSON (sans géométrie) :

* [Les départements](https://unpkg.com/@etalab/decoupage-administratif/data/departements.json)
* [Les régions](https://unpkg.com/@etalab/decoupage-administratif/data/regions.json)
  {% endtab %}
  {% endtabs %}

## Quelles sont les sources alternatives pour les communes ? <a href="#les-sources-alternatives-pour-les-communes" id="les-sources-alternatives-pour-les-communes"></a>

<details>

<summary>Utiliser le WFS de l'IGN</summary>

Un [WFS](https://fr.wikipedia.org/wiki/Web_Feature_Service) (Web Feature Service) est un service web d’inspiration [SOAP](https://fr.wikipedia.org/wiki/SOAP). Il est basé sur une approche en [XML](https://fr.wikipedia.org/wiki/Extensible_Markup_Language).

Le WFS de l’IGN existe en version 1.0.0, 1.1.0 et 2.0.0. Cette dernière rajoute des facilités en particulier pour paginer les appels. Généralement, sauf si le serveur est très ancien, c'est la version 2.0.0 qu'il faut privilégier.

Même s'il est possible de retrouver comment fonctionne le WFS en regardant le [standard WFS](https://www.ogc.org/standards/wfs), nous vous recommandons plutôt d'aller sur [la page WFS du site GeoRezo.net](https://georezo.net/wiki/main/standards/wfs). Ce n'est pas un prérequis ici mais pourra vous aider à approfondir le sujet si vous devez utiliser ce standard plus régulièrement.

Si vous avez besoin de récupérer toutes les communes, il est plutôt recommandé de récupérer les données brutes depuis [Admin Express](https://geoservices.ign.fr/adminexpress), documenté aussi sur cette page. Nous vous recommandons d'avoir installé [GDAL](https://gdal.org/), un utilitaire en ligne de commande.

Son principal intérêt est de pallier à certains scénarios que n'adresse pas pour le moment l'API Découpage administratif. Il nécessite de comprendre quelques préalables.

**Lister les couches d'un endpoint WFS**

On doit pouvoir lister les couches du service fournissant les communes.

*Dans le navigateur, peu lisible car XML avec un "GetCapabilities"*

<https://wxs.ign.fr/administratif/geoportail/wfs/?SERVICE=WFS&REQUEST=GetCapabilities&VERSION=2.0.0>

*Avec GDAL*

```
ogrinfo -so WFS:https://wxs.ign.fr/administratif/geoportail/wfs
```

Astuce : recommencez avec l'option `--DEBUG ON` comme ci-dessous

```
ogrinfo --DEBUG ON -so WFS:https://wxs.ign.fr/administratif/geoportail/wfs
```

L'intérêt de la manoeuvre est de pouvoir comprendre les appels HTTP utilisés lors de l'usage du WFS plutôt que devoir apprendre la spécification WFS.

**Trouver la structure du WFS**

Trouver la structure du WFS est important car pour pouvoir filtrer, vous pouvez soit utiliser des filtres qui jouent sur les attributs soit sur des propriétés spatiales. Il s’agit donc de connaître le nom des champs. Il s’agit également potentiellement de connaitre le nom de la colonne contenant la géométrie pour pouvoir effectuer les requêtes spatiales.

On part dans cet exemple de la couche `ADMINEXPRESS-COG.LATEST:commune`

Dans le navigateur, copiez l'URL :

<https://wxs.ign.fr/administratif/geoportail/wfs/?SERVICE=WFS&REQUEST=DescribeFeatureType&VERSION=2.0.0&TYPENAMES=ADMINEXPRESS-COG.LATEST:commune&outputFormat=application/json>

Avec GDAL, en ligne de commande :

```
ogrinfo -so -noextent WFS:https://wxs.ign.fr/administratif/geoportail/wfs "ADMINEXPRESS-COG.LATEST:commune"
```

Dans les deux cas, on sait quelles sont les colonnes disponibles. On pourra réutiliser leur nom pour faire des filtres ou choisir les colonnes qui seront retournées.

**Usages du WFS**

Nous avons appris quelles couches contiennent un WFS et quelle est la structure d'une couche comme ses noms de champs. Maintenant nous allons pouvoir consommer la couche pour la filtrer.

Il est possible de le faire via un appel à une URL ou en passant pas des utilitaires associés à GDAL, utiles pour notre besoin :

* le premier `ogrinfo` permet d'inspecter le contenu d'une source de données, dans ce cas particulier, un WFS.
* le second `ogr2ogr` permet de consommer le WFS en utilisant si nécessaire la pagination et surtout de transformer le GML dans d'autres formats géographiques comme le SHP (Shapefile), le GPKG (Geopackage), le GeoJSON, le CSV parmi les formats géospatiaux les plus courants.

Parmi les cas régulièrement demandés, il nous est demandé de répondre à des besoins de multi-filtrage, par exemple si on veut les communes de plusieurs régions ou départements.

```
# Filtrer les communes pour plusieurs départements en retournant un GeoJSON
ogr2ogr -f GeoJSON communes-44-35.geojson \
        --config OGR_WFS_PAGING_ALLOWED ON \
        --config OGR_WFS_PAGE_SIZE 250 \
        WFS:https://wxs.ign.fr/administratif/geoportail/wfs \
        -sql "SELECT * FROM \"ADMINEXPRESS-COG.LATEST:commune\" WHERE insee_dep IN ('44', '35')" \
        -lco RFC7946=YES
```

Nous vous proposons des recettes ci-dessous. La majorité n'utilise que les communes mais nous employons ponctuellement les EPCI, ayant parfois des demandes pour adresser comment les récupérer ou récupérer leurs communes.

On peut dans un premier temps récupérer la commune qui a un code INSEE car elle contient aussi le SIRET de l'EPCI.

```
# Obtenir la commune par code commune INSEE sous forme CSV
ogr2ogr -f CSV commune-44109.csv WFS:https://wxs.ign.fr/administratif/geoportail/wfs -sql "SELECT * FROM \"ADMINEXPRESS-COG.LATEST:commune\" WHERE insee_com = '44109'"
```

En inspectant le fichier epci-with-44109-from-geom.csv, on voit que le code SIREN est `244400404`. On peut ainsi retourner les communes qui sont membres de l'EPCI.

```
# Obtenir les communes de l'EPCI grâce au code Siren de l'EPCI
ogr2ogr -f GeoJSON communes-epci-with-44109.geojson WFS:https://wxs.ign.fr/administratif/geoportail/wfs -sql "SELECT * FROM \"ADMINEXPRESS-COG.LATEST:commune\" WHERE siren_epci = '244400404'"
```

On pourrait aussi obtenir la commune qui contient le point de longitude -1.54241 et latitude 47.21791 sous forme CSV puis depuis le code SIREN, faire la même opération que ci-dessus.

```
ogr2ogr -f CSV commune-44109-from-geom.csv WFS:https://wxs.ign.fr/administratif/geoportail/wfs -sql "SELECT * FROM \"ADMINEXPRESS-COG.LATEST:commune\" WHERE ST_Contains(ST_GeomFromText('POINT(-1.54241 47.21791)', 'EPSG:4326'), the_geom)" -lco RFC7946=YES
```

Il est possible aussi d'obtenir l'EPCI lui-même:

depuis un code SIREN :

```
ogr2ogr -f GeoJSON epci-with-44109-from-siren.geojson WFS:https://wxs.ign.fr/administratif/geoportail/wfs -sql "SELECT * FROM \"ADMINEXPRESS-COG.LATEST:epci\" WHERE code_siren = '244400404'"
```

depuis un point qui est est contenu dans l'EPCI :

```
ogr2ogr -f GeoJSON epci-with-44109-from-geom.geojson WFS:https://wxs.ign.fr/administratif/geoportail/wfs -sql "SELECT * FROM \"ADMINEXPRESS-COG.LATEST:epci\" WHERE ST_Contains(ST_GeomFromText('POINT(-1.54241 47.21791)', 'EPSG:4326'), the_geom)"
```

**FAQ WFS**

* **Pourquoi ne pas passer par le WFS pour de l'autocomplétion ?** --> Cela demeure nettement plus lent qu'une API dédiée car il n'y a pas d'index spécifiques pour cet usage.

</details>

<details>

<summary>Passer par les fichiers Admin Express</summary>

Il s'agit de la solution à privilégier lorsque l'on a besoin de travailler avec les données France entière et qu'on dispose d'un back-end.

**Contexte**

Historiquement, il existait un produit nommé Geofla pour avoir les communes, qui depuis a été remplacé par un nouveau jeu de données dit **Admin Express** qui contient les données suivantes :

* DEPARTEMENT (Polygon)
* COMMUNE\_ASSOCIEE\_OU\_DELEGUEE (Polygon)
* COMMUNE (Polygon)
* COLLECTIVITE\_TERRITORIALE (Polygon)
* ARRONDISSEMENT\_MUNICIPAL (Polygon)
* EPCI (Polygon)
* REGION (Polygon)
* CANTON (Polygon)
* CHFLIEU\_COMMUNE\_ASSOCIEE\_OU\_DELEGUEE (Point)
* CHFLIEU\_COMMUNE (Point)
* CHFLIEU\_ARRONDISSEMENT\_MUNICIPAL (Point)
* ARRONDISSEMENT (Polygon)

Le jeu de données et la documentation officielle sont disponibles [la page officielle Admin Express](https://geoservices.ign.fr/adminexpress).

**Choisir entre les différents produits Admin Express**

Il existe des **différences entre les produits Admin Express** et nous vous invitons à consulter cet [article qui résume ces différences](https://geoservices.ign.fr/admin-express-passe-la-grande-echelle).

Ce qu'il faut retenir pour choisir les produits :

* Si vous avez besoin de suivre l'évolution des communes par mois --> prenez "Admin Express" simple.
* Si vous voulez faire des cartes thématiques qui utilisent les données INSEE --> prenez les données "Admin Express COG Carto" qui sont généralisées c'est-à-dire avec moins de points pour les contours.
* Si vous avez besoin de compter par exemple les commerces qui sont dans une commune mais aussi de faire des cartes thématiques --> prenez "Admin Express COG" car les coordonnées sont plus précises.

**Eviter le "piège" des projections**

L'autre difficulté lors de la récupération de ces données est de prendre les données dans les "bonnes projections" : il existe des jeux de données dont la description mentionne "par territoire" et "France entière".

Pour comprendre (en empruntant des raccourcis), il faut savoir que la France utilise "des systèmes de projection officiels" qui définissent comment "bien placer les coordonnées mesurées".

Ces systèmes sont choisis pour pouvoir garder une grande précision de mesure qui permettent ensuite d'être sûr de l'emplacement de votre maison au centimètre près. L'inconvénient est qu'ils fonctionnent sur des étendues faibles : ils sont différents sur la métropole et sur les DOM.

* Si vous prenez les données "par territoire", vous récupérerez les données pour chaque territoire séparément avec chacun sa projection officielle.
* Si vous prenez France entière, vous aurez les données assemblées dans une projection mondiale indépendamment des territoires.

Ainsi :

* Si vous devez travailler sur France métropolitaine et DOM --> vous pouvez prendre les données "France entière".
* Si vous travaillez uniquement sur un DOM ou uniquement la métropole --> vous pourrez travailler tant avec les données "par territoire" que "France entière".

</details>

## Foire aux questions (FAQ) <a href="#faq" id="faq"></a>

<details>

<summary>Bons à savoir concernant les communes</summary>

* [La longueur des noms de commune peut être problématique](https://twitter.com/JulesGrandin/status/1448563444601532422).
* [Il existe une normalisation des noms de communes](https://www.collectivites-locales.gouv.fr/sites/default/files/Accueil/Notes).
* Il existe des communes homonymes, le nom n'est donc pas un identifiant fiable.
* Le code postal ne correspond pas à toujours à une seule commune.
* Certaines communes ont plusieurs codes postaux.
* Le code postal peut contenir le code d'un autre département que son département réel.

</details>

<details>

<summary>Bonnes pratiques à adopter</summary>

Partout où vous le pouvez, utilisez le code INSEE du COG ([Code Officiel Géographique](https://www.data.gouv.fr/fr/datasets/code-officiel-geographique-cog/)) plutôt qu'un code postal ou un nom. Celui-ci est le plus fiable dans le temps même si des cas particuliers emergent parfois suite aux évolutions des communes (fusions ou séparation).

Avec l'API Découpage Administratif, cette complexité du COG est cachée. Si vous avez des besoins avancés, vous pouvez utiliser soit [les fichiers du COG](https://www.insee.fr/fr/information/2560452) soit pour une recherche ponctuel, passer par [l'interface de recherche de commune](https://www.insee.fr/fr/recherche/recherche-geographique?debut=0).

</details>


# Utiliser les tuiles vectorielles

## Qu'est-ce que les tuiles vectorielles ?

{% hint style="info" %}
Pour mieux comprendre ce que sont que les tuiles vectorielles et leurs usages, rendez-vous sur la documentation de l’IGN.
{% endhint %}

### **Pourquoi utiliser les tuiles vectorielles ?**

Le service proposé par Etalab permet de :

* mettre à disposition des tuiles avec un style pour avoir un fond de plan de tuiles vecteur. Ce style est publié en s’appuyant sur une version d’OpenMapTiles déployée par Etalab sur la France.
* servir les tuiles des limites administratives ainsi que celles du cadastre.

Ce service s'appuie sur les données du [projet OpenStreetMap](https://openstreetmap.org/).

OpenStreetMap (ou "OSM") est une carte du monde entier librement modifiable, faite par des gens comme vous. OpenStreetMap vous permet de voir, modifier et utiliser des données géographiques de n'importe quel endroit dans le monde.

Si vous identifiez des données manquantes sur la carte, vous pouvez contribuer sur [https://openstreetmap.org](https://openstreetmap.org/) et vous verrez les changements au plus tard une semaine après. En effet, les tuiles vecteur des fonds de plan sont mises à jour une fois par semaine.

Il faut aussi noter que vous devez obligatoirement [créditer OpenStreetMap et ses contributeurs](https://www.openstreetmap.org/copyright/fr) quand vous utilisez les fonds de plan.

<figure><img src="/files/JT1AdNo8ODvybb2KCgfh" alt=""><figcaption><p>Page d'accueil d'OpenMapTiles</p></figcaption></figure>

### **Qui utilise ce service ?**

Ce service est utilisé par plusieurs produits d’Etalab ainsi que par d’autres acteurs institutionnels en raison de la légèreté des tuiles vectorielles et des styles associés en comparaison à ceux mis à disposition actuellement par l’IGN.

Ces tuiles ont une structure standardisée par un schéma <https://openmaptiles.org/schema/> ainsi que des styles par défaut associés à cette structure <https://openmaptiles.org/styles/>.

### **Quelles sont les limites de ce service ?**

Bien que ce service réponde à de nombreux besoins, il présente certaines limites.

❌ **Les cas où vous ne devriez pas utiliser OpenMapTiles :**

* Si votre besoin nécessite des tuiles dont les informations ne sont pas dans les couches OpenMapTiles, un grand nombre d’acteurs commerciaux proposent de consommer des tuiles vectorielles en créant un compte, sans coût : <https://switch2osm.org/providers/#tile-hosting>.
* Si vous avez besoin d’une qualité de service garantie, là encore, adressez-vous à ces mêmes acteurs commerciaux ou autohébergez-vous. Dans ce cas, pour des outils pour gérer vos propres tuiles vecteur en autohébergé, allez sur : <https://github.com/mapbox/awesome-vector-tiles#servers>.
* Si vous avez un besoin qui vous parait correspondre à celui des tuiles vectorielles et styles associés de l’IGN (voir des exemples en fin de guide). Ces tuiles sont un peu plus lourdes mais elles sont par nature plus homogènes en terme de contenu car elles utilisent les données de l’IGN. Celles du projet OpenMapTiles étant basées sur OpenStreetMap, la complétude dépend des contributions à OpenStreetMap.

## Rappels sur les tuiles vecteur <a href="#rappel-sur-les-tuiles-vecteur" id="rappel-sur-les-tuiles-vecteur"></a>

### Les tuiles raster <a href="#les-tuiles-raster" id="les-tuiles-raster"></a>

Historiquement, pour faire du webmapping, on renvoyait des tuiles images qui étaient des images de cartes découpées en 256px ou 512px (si écran haute définition).

Ce qu'on peut encore voir par exemple :

![Tuiles 256px](https://tile.openstreetmap.org/5/15/11.png)

![Tuiles 512px](https://d.basemaps.cartocdn.com/light_all/7/63/44@2x.png)

Le découpage des tuiles est normalisé en s'appuyant sur "une grille" qui change avec les échelles et dont les conventions sont reprises par tous.

### Les « tuiles vectorielles » <a href="#les-tuiles-vectorielles" id="les-tuiles-vectorielles"></a>

Même si ces solutions raster sont toujours fonctionnelles, il existe des cas qui nécessitent d’avoir plus de souplesse pour pouvoir styler des fonds de plan en particulier ou bien pour afficher une couche « par-dessus » les autres. Ils peuvent être adressés avec les tuiles vectorielles.

On parle abusivement de tuiles vectorielles pour désigner généralement deux choses :

* les tuiles vectorielles à proprement parler
* les styles « Mapbox Vector Style »

### **Les tuiles vectorielles en elles-même**

On peut les assimiler à des objects vectoriels, des points, des lignes, des polygones qui sont associés à des attributs par exemple un nom. On groupe ces objets par couche, généralement un objet métier, par exemple, les limites communales, les commerces, etc. On découpe ensuite ces vecteurs selon une emprise fixe qui reprend celle historiquement utilisées par les tuiles raster. On peut ainsi voir quelles couches contiennent une tuile.

Il existe plusieurs standards pour ces tuiles mais celui le plus adopté est celui de la société Mapbox : on parle de "Mapbox Vector Tiles" ou MVT.

Leur contenu est encapsulé dans un format binaire appelé Protocol Buffer, non spécifique à la cartographie, c'est pour cela que l'extension des tuiles est souvent `.pbf` même si cela était historiquement `.mvt`.

> Quelques exemples pour inspecter :
>
> * Les tuiles du cadastre : <https://stevage.github.io/vector-inspector/#?url=https://openmaptiles.geo.data.gouv.fr/data/cadastre/15/16241/11497.pbf&loc=13.71/47.21687/-1.55235>
> * Le fond OpenMapTiles : <https://stevage.github.io/vector-inspector/#?url=https://openmaptiles.geo.data.gouv.fr/data/cadastre/15/16241/11497.pbf&loc=13.71/47.21687/-1.55235>
>
> Vous pouvez aussi aller sur [https://openmaptiles.geo.data.gouv.fr](https://openmaptiles.geo.data.gouv.fr/) puis dans le bloc "DATA", choisir une couche et faire "Inspect".

Ici, nous avons choisi de nous concentrer sur la consommation des tuiles. Il existe de nombreux outils pour les générer. Nous vous renvoyons à nouveau à <https://github.com/mapbox/awesome-vector-tiles#servers> déjà mentionné.

### **Les styles**

Ils permettent d'indiquer pour quelles couches, pour quelles caractéristiques comme la population et quels zooms il faut appliquer un style.

Ces styles peuvent être : l'épaisseur du trait, sa couleur pour le contour communal, etc.

Ils s'appuient sur le standard ["Mapbox/Maplibre GL JS Style Specification"](https://maplibre.org/maplibre-gl-js-docs/style-spec/) qui indique quelles sont les ressources "tuiles" (l'URL) à consommer puis quelles couches de cette ressource doivent être utilisées puis comment les styles doivent être appliqués.

C'est avant tout la combinaison des tuiles vectorielles et des styles qui a permis à ce standard de s'imposer.

On peut par exemple aller sur <https://maputnik.github.io/editor/#3.71/45.57/3.43> puis dans le menu supérieur, cliquer sur "Open". Dans la popup qui apparaît, dans la section "Load from URL", coller l'URL `https://openmaptiles.geo.data.gouv.fr/styles/osm-bright/style.json` puis sur le bouton "Open URL" pour voir le style utilisé par défaut sur les tuiles vectorielles.

Généralement, on consomme ces tuiles vectorielles via une bibliothèque cartographique JavaScript. Il faut également noter que selon les bibliothèques, il est possible de profiter de la combinaison des deux mais que certains ne permettent pas de gérer les styles mais simplement de consommer les tuiles vectorielles, les `pbf` mais en devant styler selon la syntaxe propre à la bibliothèque. Cela joue fortement sur les choix techniques à adopter selon votre besoin. Seuls Maplibre et OpenLayers via une bibliothèque intermédiaire sont à même de correctement utiliser les deux.

## Comment utiliser les tuiles vectorielles d’Etalab ? <a href="#comment-utiliser-les-tuiles-vectorielles-d-etalab" id="comment-utiliser-les-tuiles-vectorielles-d-etalab"></a>

Pour avoir un aperçu, vous pouvez vous rendre sur : [https://openmaptiles.geo.data.gouv.fr](https://openmaptiles.geo.data.gouv.fr/).

Les versions des tuiles pour les fonds de plan ont été mises à jour en mars 2022 et sont mises à jour une fois par semaine.

<figure><img src="/files/1wY8X2LOkmf9yaNsOfiD" alt=""><figcaption><p>openmaptiles.geo.data.gouv.fr</p></figcaption></figure>

### Consommer les styles <a href="#consommer-les-styles" id="consommer-les-styles"></a>

Nous abordons principalement l'usage avec MapLibre qui est capable de nativement gérer les tuiles et les styles associés.

Nous n'aborderons pas Mapbox GL JS, la bibliothèque JavaScript de Mapbox, car elle n'est maintenant plus OpenSource depuis la version 2.x et c'est MapLibre, une version forkée de la dernière version de Mapbox GL JS avant son passage en version non libre, qui a pris sa succession.

Voici quelques scénarios :

#### Avec le fond de plan et le cadastre

* [Avec MapLibre](https://gist.githubusercontent.com/ThomasG77/2c0f884c209eebb2710648e316052382/raw/95a8ad79b57fe2db9553ccab16946d679d41a8d8/index.html)

#### Avec uniquement le fond de plan

* [Exemples pour MapLibre et OpenLayers](https://github.com/webgeodatavore/openmaptiles-geo-data-gouv-fr)

#### Avec les limites administratives et le cadastre seulement

* [MapLibre](https://gist.githack.com/ThomasG77/e9eacae4cd4c75e61327944997cb82d4/raw/4943cd611e87fe26aa72e181e386b90d999769e4/index.html)

### Consommer les tuiles vectorielles seules <a href="#consommer-les-tuiles-vectorielles-seules" id="consommer-les-tuiles-vectorielles-seules"></a>

* Maplibre : <https://raw.githack.com/webgeodatavore/openmaptiles-geo-data-gouv-fr/master/maplibre-gl-js/maplibre-gl-js-openmaptiles-with-overlay.html>
* OpenLayers : <https://raw.githack.com/webgeodatavore/openmaptiles-geo-data-gouv-fr/master/openlayers/openlayers-openmaptiles-with-overlay.html>
* Leaflet : <https://raw.githack.com/webgeodatavore/openmaptiles-geo-data-gouv-fr/master/leaflet/leaflet-openmaptiles-with-overlay.html>

### Héberger les tuiles du cadastre ou faire une extrait sur votre zone <a href="#heberger-les-tuiles-du-cadastre-ou-faire-une-extrait-sur-votre-zone" id="heberger-les-tuiles-du-cadastre-ou-faire-une-extrait-sur-votre-zone"></a>

```
wget https://cadastre.data.gouv.fr/data/etalab-cadastre/2021-07-01/mbtiles/france/cadastre.mbtiles
npm install -g @mapbox/tilelive @mapbox/mbtiles

tilelive-copy \
    --minzoom=0 --maxzoom=24 \
    --bounds="-1.6029,47.18438,-1.501276,47.244547" \
    cadastre.mbtiles cadastre-extract-for-nantes-city.mbtiles

npm i -g ThomasG77/mbview#no-api-key
mbview cadastre-extract-for-nantes-city.mbtiles
```

Pour un aperçu, ouvrir : <http://localhost:3000/#16.17/47.215211/-1.567287>

Si vous souhaitez héberger vous-même, nous vous recommandons de passer par [TileServer-Gl Light](https://www.npmjs.com/package/tileserver-gl-light) combiné avec NGinx.

## L'alternative des tuiles vecteur de l'IGN <a href="#l-alternative-des-tuiles-vecteur-de-l-ign" id="l-alternative-des-tuiles-vecteur-de-l-ign"></a>

Selon vos besoins, vous pouvez choisir d'utiliser l'API de tuiles vectorielles de l'IGN plutôt que celles que nous mettons à disposition.

Voici deux exemples :

* [avec OpenLayers](https://gist.githack.com/ThomasG77/3047b6072f0411d11d23cfed1fdb2c5c/raw/212da03a956f0ab6accb8ae65aba74ec3ab30737/index.html)
* [avec Maplibre](https://gist.githack.com/ThomasG77/5a122812635a85af7f762858ecf052a3/raw/3e195f0a68b5e4c6705ed4205cd02ccc5ff9694c/index.html)

Ici, nous avons utilisé le plan "Standard" dont l'URL est <https://wxs.ign.fr/static/vectorTiles/styles/PLAN.IGN/essentiels/standard.json>. Vous verrez qu'il est possible de choisir d'autres styles et même d'avoir des tuiles vectorielles pour d'autres éléments que les fonds de plan. Pour cela, consultez la documentation officielle côté IGN, <https://geoservices.ign.fr/documentation/services/api-et-services-ogc/vecteur-tuile-tmswmts>.

Nous vous recommandons en complément de regarder <https://geoservices.ign.fr/services-web-essentiels> car la 1ère documentation à date mentionne encore une clé d'API alors que bien que présente, celle-ci est publique et s'appelle `essentiels`, ce que vous pouvez voir dans les démos mises à disposition.


# Utiliser les données du cadastre

Ce guide a pour vocation de vous accompagner dans l'utilisation des données ouvertes du cadastre.

Grâce à ce guide, vous pourrez :

<table data-card-size="large" data-column-title-hidden data-view="cards"><thead><tr><th></th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td><strong>Comprendre les données du cadastre et leurs usages</strong></td><td><a href="/pages/4Gl0XqpiQNvb7JBLpuGQ">/pages/4Gl0XqpiQNvb7JBLpuGQ</a></td></tr><tr><td><strong>Apprendre à manipuler les données du cadastre</strong></td><td><a href="/pages/wcVpTeqNzyNHsQZaafQb">/pages/wcVpTeqNzyNHsQZaafQb</a></td></tr><tr><td><strong>Trouver des réponses à vos questions sur le cadastre (FAQ)</strong></td><td><a href="/pages/ifzkpMn4iuWQxS6mOTW8">/pages/ifzkpMn4iuWQxS6mOTW8</a></td></tr></tbody></table>


# Comprendre les données du cadastre et leurs usages

## Qu'est-ce que le cadastre ?

Le cadastre est un document administratif qui recense et identifie les propriétés foncières (immeuble, maison, terrain, etc.) de chaque commune afin de permettre le calcul des impôts locaux (Ministère de l'économie, des finances et de la souveraineté industrielle et numérique).

## Quelles données en open data ?

Les données ouvertes sont celles du **plan cadastral** : parcelles, sections, bâti et éléments d'habillage.

Elles sont produites et publiées par la **Direction générale des finances publiques** (DGFiP) et font partie [des données de référence du service public de la donnée](https://www.data.gouv.fr/fr/pages/spd/reference/).

Le plan cadastral est une représentation graphique d'une commune qui dresse l'inventaire de ses propriétés foncières ainsi que l'emprise au sol des bâtiments qui les occupent. Il peut aussi indiquer certains détails facilitant sa compréhension tels que les voies de communication principale, cours d'eau, fossés, etc. (Ministère de l'économie, des finances et de la souveraineté industrielle et numérique). Le plan cadastral est découpé en plusieurs *sections cadastrales* (identifiées par une lettre). Chaque section est ensuite composée de *parcelles cadastrales* (identifiées par un numéro).

[Ce document](https://bofip.impots.gouv.fr/bofip/5359-PGP.html/identifiant=BOI-CAD-DIFF-10-20191105) détaille notamment les éléments qui figurent dans le plan cadastral (tel que publié par la DGFiP sur cadastre.gouv.fr).

Il est possible de **consulter** [**la carte du cadastre**](https://cadastre.data.gouv.fr/map?style=ortho).

{% hint style="info" %}
**Lexique**

Parcelle cadastrale : Portion de terrain, représentée au plan cadastral, possédant un identifiant unique composé du nom de sa section cadastrale et de son numéro.
{% endhint %}

![Illustration du plan cadastral](https://user-images.githubusercontent.com/72090652/268529403-e350b687-a132-4b5a-934c-05f132b0e92a.png)

## Quels usages possibles ?

Les données du plan cadastral constituent **des données géographiques de référence**, qui peuvent être utilisées dans tous types de cartographie. Vous pouvez notamment :

* Construire des zonages basés sur des données parcellaires ;
* Intégrer les références cadastrales dans des applications ou des formulaires en ligne.

### Croiser les données du cadastre avec d'autres données

Le plan cadastral peut notamment être croisé avec des données qui s'inscrivent à une maille parcellaire, comme par exemple (liste non exhaustive) :

* [Les données "Demandes de Valeurs Foncières" (DVF) géolocalisées](https://www.data.gouv.fr/fr/datasets/demandes-de-valeurs-foncieres-geolocalisees/) ;
* [Le produit BAN PLUS](https://geoservices.ign.fr/ban-plus), qui permet de lier l'adresse au bâti. Sur le même sujet, il existe également [la Base de Données Nationale des Bâtiments (BDNB)](https://www.data.gouv.fr/fr/datasets/base-de-donnees-nationale-des-batiments/) ;
* [Le Registre Parcellaire Graphique (RPG)](https://geoservices.ign.fr/rpg), utilisé pour les instructions des aides européennes de la Politique Agricole Commune (PAC). Vous pouvez aussi consulter les données des [Parcelles en Agriculture Biologique (AB) déclarées à la PAC](https://www.data.gouv.fr/fr/datasets/parcelles-en-agriculture-biologique-ab-declarees-a-la-pac/) ;
* Les parcelles protégées du Conservatoire du littoral, disponibles sous forme WFS dans les services proposés par l'IGN ;
* [Les délimitations parcellaires AOC viticoles](https://www.data.gouv.fr/fr/datasets/delimitation-parcellaire-des-aoc-viticoles-de-linao/) ;
* [Le Géoportail de l'urbanisme](https://www.geoportail-urbanisme.gouv.fr/), dont les PLU s'appuient sur les parcelles du cadastre.

### S'inspirer de projets existants

Pour inspiration, le plan cadastral a été utilisé pour développer des solutions permettant de :

* [Connaître le prix de vente des biens immobiliers](https://www.data.gouv.fr/fr/pages/onboarding/dvf/) ;
* [Réaliser l'état des risques d'un bien immobilier](https://www.data.gouv.fr/fr/pages/onboarding/errial/) ;
* [S'informer sur les règles d'urbanisme d'un territoire](https://www.data.gouv.fr/fr/reuses/iudo-app/).

## Comment accéder aux données ?

Pour consulter et télécharger les données cadastrales, vous pouvez vous rendre (selon votre besoin) sur :

* [**cadastre.data.gouv.fr**](https://cadastre.data.gouv.fr/)
* [**cadastre.gouv.fr**](https://www.cadastre.gouv.fr/scpc/accueil.do)

Pour accéder aux données matrice, vous êtes invités à contacter le Service de publicité foncière (notamment si vous êtes une collectivité) et/ou le Centre régional de l'information géographique (CRIGE) pertinent (qui peut proposer ce service).

<table><thead><tr><th width="156.33333333333331">Caractéristiques</th><th width="454">cadastre.data.gouv.fr</th><th width="454">cadastre.gouv.fr</th></tr></thead><tbody><tr><td>Porteur</td><td>Maintenu par la Direction interministérielle du numérique</td><td>Maintenu par la Direction générale des finances publiques</td></tr><tr><td>Mise à jour</td><td>Mise à jour tous les 3 mois (selon la livraison par la DGFiP)</td><td>Mise à jour en continu</td></tr><tr><td>Recherche</td><td>Recherche par adresse rapide, pas de recherche par numéro de parcelle</td><td>Recherche par adresse et par numéro de parcelle</td></tr><tr><td>Autres</td><td><ul><li>Référencement d'une parcelle par URL possible</li><li>Quelques parcelles ne sont pas bien récupérées lors du passage du format d'échange Edigéo vers les formats GeoJSON et SIG (type shp)</li></ul></td><td><ul><li>Possibilité de générer un PDF</li><li>Possibilité de voir la mitoyenneté quand renseignée</li><li>Demande de rechercher à chaque fois plutôt que de partager le lien</li></ul></td></tr></tbody></table>


# Manipuler les données du cadastre

{% hint style="success" %}
Dans cette section, nous vous guidons dans la manipulation des données du cadastre. Nous vous indiquons notamment comment :

* **télécharger les données**
* **rechercher des parcelles**
* **accéder aux fonds de plan du cadastre**
* **parser les données Edigeo**
* **faire l'intégration métiers parcelle et MAJIC (Fichiers des locaux et des parcelles des personnes morales)**
  {% endhint %}

> Si vous avez d'autres questions, ou si vous souhaitez que nous vous aidions sur d'autres aspects de l'utilisation du cadastre, [**n'hésitez pas à nous l'indiquer ici**](https://tally.so/r/wgdoJl) **pour que nous puissions compléter ce guide**.

## Télécharger les données

{% hint style="info" %}
**Les versions du plan cadastral**

Il existe aujourd'hui **trois versions** des données du plan cadastral :

* **la version de la Direction générale des finances publiques (DGFiP)**

  Elle est mise à jour tous les 3 mois environ, théoriquement aux 01/01, 01/04, 01/07 et 01/10 (il s'agit plutôt des dates d'extraction, les données sont réellement mises à disposition quelques jours après). Dans le cadre du [service public de la donnée (SPD)](https://www.data.gouv.fr/fr/pages/spd/reference/), la Direction interministérielle du numérique (DINUM) diffuse ces données pour le compte de la DGFiP. Plus d'informations sont disponibles sur [cette page](https://cadastre.data.gouv.fr/datasets/plan-cadastral-informatise) ;
* **la version d'Etalab**

  Elle consiste en un assemblage de données, qui s'appuie sur les données Edigeo (Plan Cadastral Informatisé issu de la DGFiP, ci-dessus) et les données de Strasbourg (hors PCI). Elle peut présenter quelques erreurs, en particulier du fait de l'interprétation des géométries issues du format Edigeo. Les formats proposés sont du *GeoJSON* et du *SHP*. Cette version étant dépendante de la version précédente mais nécessitant plus de traitement, elle requiert plusieurs semaines pour sa mise à disposition, à partir de la réception des données transmises par la DGFiP. Il s'agit d'un produit de la Direction interministérielle du numérique (DINUM). Plus d'informations sont disponibles sur [cette page](https://cadastre.data.gouv.fr/datasets/cadastre-etalab) ;
* **la version de l'Institut national de l'information géographique et forestière (IGN)** : proposée via le produit PCI Express.

  La mise à jour est effectuée après la mise à disposition des données Edigeo sur [cadastre.data.gouv.fr](https://github.com/etalab/guides.data.gouv.fr/blob/main/reutiliser-des-donnees/autour-du-cadastre/cadastre.data.gouv.fr).
  {% endhint %}

Pour télécharger les données, vous pouvez vous rendre sur :

* **Pour la version de la DGFiP** : [cadastre.data.gouv.fr/datasets/plan-cadastral-informatise](https://cadastre.data.gouv.fr/datasets/plan-cadastral-informatise) (formats *Edigeo*, *Edigeo-cc*, *DXF-PCI*, *DXF-PCI-cc*, *TIFF*) ;
* **Pour la version d'Etalab** : [cadastre.data.gouv.fr/data/etalab-cadastre](https://cadastre.data.gouv.fr/data/etalab-cadastre/) (formats *GeoJSON* et *SHP*). Pour comprendre les identifiants des parcelles utilisés, passez par [cette documentation](https://gist.github.com/ThomasG77/a9b39677d302e2405c18cfe9bc8e462b);
* **Pour la version de l'IGN** : [la page "Parcellaire Express (PCI)" du site Geoservices de l'IGN](https://geoservices.ign.fr/parcellaire-express-pci).

## Rechercher des parcelles

Pour rechercher des parcelles, il est possible de passer par [**le module Cadastre de l'API Carto**](https://apicarto.ign.fr/api/doc/cadastre#/Parcelle/get_cadastre_parcelle).

Il s'agit d'une surcouche au WFS de l'IGN qui facilite l'utilisation. Ce service s'appuie sur les données de PCI Express ou de [la BD Parcellaire](https://geoservices.ign.fr/bdparcellaire) (produit historique non maintenu depuis 2019).

Si vous êtes intéressé par le code de la surcouche, vous pouvez consulter le projet sur <https://github.com/IGNF/apicarto/>.

<figure><img src="/files/rFrVI3cjLdDKpecAg1Q0" alt=""><figcaption><p>Un exemple de recherche de parcelles avec l'API Carto</p></figcaption></figure>

*Vous pouvez aussi ouvrir* [*ce lien pour voir le résultat dans un navigateur*](https://apicarto.ign.fr/api/cadastre/parcelle?code_insee=44109\&section=EX\&numero=0080).

{% hint style="danger" %}
**Limites**

Il existe un léger décalage dans le temps de mise à jour entre les parcelles PCI Express et les données du cadastre que nous mettons à disposition sur [cadastre.data.gouv.fr](https://cadastre.data.gouv.fr).
{% endhint %}

## Accéder aux fonds de plan du cadastre

Plusieurs solutions sont disponibles pour accéder aux fonds de plan du cadastre, parmi lesquelles :

* [**WMS accès cadastre DGFiP**](https://www.cadastre.gouv.fr/scpc/pdf/Guide_WMS_fr.pdf). La limitation principale de ce WMS est qu'il n'est possible de demander que des images dont la taille est comprise entre *100x100* et *au maximum 1280x1024*. Il est possible de passer par un TMS via l'url `http://tms.cadastre.openstreetmap.fr/*/tout/{z}/{x}/{y}.png` pour contourner cette limitation (voir <https://lists.openstreetmap.org/pipermail/talk-fr/2015-February/075223.html>).

![Un aperçu de la configuration du TMS dans QGIS](/files/1cyxmVpLeprxAM4FJ4xo)

* **les tuiles vectorielles mises à disposition par la Direction interministérielle du numérique (DINUM)**. Elles contiennent les géométries du produit Cadastre Etalab. Un [tutoriel](https://guides.etalab.gouv.fr/apis-geo/3-tuiles-vecteur.html#l-alternative-des-tuiles-vecteur-de-l-ign) détaille comment les exploiter dans le cadre Web. Il est aussi possible d'accéder aux tuiles vectorielles depuis la version 3.14 du [logiciel bureautique SIG OpenSource nommé QGIS](https://www.qgis.org/fr/site/) comme illustré ci-dessous.

![Un aperçu de la configuration de la connexion aux tuiles vectorielles dans QGIS](/files/1RZBIOeYAmxu6DxpgDQ0)

* **IGN WMS cadastre**. La couche principale est `CADASTRALPARCELS.PARCELLAIRE_EXPRESS` du [service WMS](https://wxs.ign.fr/essentiels/geoportail/r/wms). Celle-ci s'appuie sur le produit PCI Express.

Il existe de nombreuses autres couches d'information liées aux cadastre proposées par l'IGN. Il est possible de les chercher depuis la [page de documentation de Geoservices](https://geoservices.ign.fr/documentation/services), en prenant les fichiers CSV des géoservices et de la Géoplateforme, qui remplacera dans les mois à venir les services OGC de l'IGN.

{% hint style="danger" %}
**Attention**

Contrairement à une croyance commune, **le contour des parcelles n'est pas fiable** : il ne s'agit que d'une représentation graphique imprécise, établie avant que les photos aériennes soient généralisées et de grande précision. **Seuls les actes de vente ont une valeur juridique.**

Il faut aussi noter que les parcelles aux limites entre communes se recoupent ou donnent un "no man land" car historiquement, chaque commune gérait séparément ses parcelles et aucune ne se préoccupait de la limite exacte avec les communes limitrophes de son territoire.

Pour évaluer ce décalage entre les contours des parcelles et le terrain, il est possible d'utiliser la couche "**Décalage de la representation cadastrale**" `CADASTRALPARCELS.HEATMAP` disponible sur [le WMS](https://wxs.ign.fr/parcellaire/geoportail/r/wms) et aussi consultable sur [le Géoportail](https://www.geoportail.gouv.fr/carte?c=-1.0309918634157356,46.551302493795134\&z=6\&l0=ORTHOIMAGERY.ORTHOPHOTOS::GEOPORTAIL:OGC:WMTS\(1\)\&l1=GEOGRAPHICALGRIDSYSTEMS.PLANIGNV2::GEOPORTAIL:OGC:WMTS\(1\)\&l2=CADASTRALPARCELS.HEATMAP::GEOPORTAIL:OGC:WMTS\(0.9\)\&l3=CADASTRALPARCELS.PARCELLAIRE_EXPRESS::GEOPORTAIL:OGC:WMTS\(1\)\&permalink=yes). Cette couche couvre une grande partie du territoire, mais pas son ensemble.
{% endhint %}

<figure><img src="/files/cs944qdHeuD1f1DdER9s" alt=""><figcaption><p>Un exemple de décalage de parcelles avec différents niveaux de précision</p></figcaption></figure>

## Parser les données Edigeo

EDIGEO signifie "*Échange de données informatisées dans le domaine de l'information géographique*". Il s'agit d'une norme. C'est principalement la norme d'échange des données du Plan Cadastral Informatisé (PCI).

> Pour aller plus loin, vous pouvez consulter [l'article Wikipedia associé](https://fr.wikipedia.org/wiki/EDIGEO) et [la documentation "Standard d'échange des objets du Plan Cadastral Informatisé fondé sur la norme EDIGéO" datant de 2013](https://raw.githubusercontent.com/etalab/edigeo-parser/master/resources/standard_edigeo_2013.pdf).

### Logiciels/Bibliothèques pour les exploiter

Pour parser les données Edigeo, plusieurs méthodes sont possibles. Vous pouvez notamment :

* [Parser en Javascript](https://github.com/etalab/edigeo-parser) : c'est ce parser qui est utilisé pour produire les données Etalab Cadastre ;
* [Utiliser GDAL](https://gdal.org/drivers/vector/edigeo.html) ;
* [Utiliser cet outil edigeoToGeojson](https://github.com/DoFabien/edigeoToGeojson) ;
* [Parser en Dotnet](https://github.com/ChristopheVergon/Integrateur_edigeo) : ce parser est utilisé par le GIRTEC pour son intégration en base de données ;
* Parser MAJIC fourni par le connecteur MAJIC associé [au logiciel propriétaire FME](https://www.veremes.com/produits/majic).

## Faire l'intégration métier parcelles et MAJIC

{% hint style="info" %}
Il est nécessaire de distinguer les données Plan Cadastral Informatisé (PCI) des données MAJIC :

* **Les données PCI** sont la représentation graphique des parcelles, mais aucune information associée aux propriétaires n'est fournie.
* **Les données MAJIC** (on parle aussi de matrice cadastrale) contiennent les données liées aux bâtiments, aux propriétaires. Elles sont à caractère personnel donc non ouvertes (à l'exception de celles se rapportant aux personnes morales, disponibles en open data). Elles peuvent être utiles, mais certains types d'acteurs qui ont besoin d'une base exhaustive liée à la propriété (comme les collectivités) peuvent souhaiter avoir accès aux données non ouvertes.
  {% endhint %}

Le [**jeu de données "Fichiers des locaux et des parcelles des personnes morales" (MAJIC)**](https://www.data.gouv.fr/fr/datasets/fichiers-des-locaux-et-des-parcelles-des-personnes-morales/) contient trois fichiers principaux :

* Les fichiers des personnes morales recensent au niveau départemental les personnes morales qui apparaissent dans la documentation cadastrale, en situation du 1er janvier de l'année de référence (n ou n-1 selon la date de téléchargement), comme détentrices de droits réels sur des immeubles, à l'exception des sociétés unipersonnelles et des entrepreneurs individuels ;
* Les fichiers des propriétés bâties (locaux) restituent les références cadastrales et l'adresse des locaux, complétés du code droit, de la dénomination et de la forme juridique des personnes morales propriétaires ;
* Les fichiers des propriétés non bâties (parcelles) restituent les références cadastrales, l'adresse, la contenance et la nature de culture des parcelles, complétées du code droit, de la dénomination et de la forme juridique des personnes morales propriétaires.

**Pour réaliser une intégration métier parcelles et MAJIC, plusieurs solutions sont mises à disposition :**

### Solutions open source

Il est possible d'utiliser le [**Plugin cadastre QGIS**](https://github.com/3liz/QgisCadastrePlugin) et de [récupérer les données du cadastre via ce plugin depuis des codes INSEE](https://github.com/3liz/QgisCadastrePlugin/blob/master/docs/extension-qgis/donnees.md).

Depuis QGIS, dans la console PyQGIS,

```python
import processing

processing.run("cadastre:telechargeur_edigeo_communal", {'LISTE_CODE_INSEE':'44109,44143,44162,44026,44190,44215','FILTRE':'','DOSSIER':'/tmp/cadastre-out','DATE':'latest','URL_TEMPLATE':'https://cadastre.data.gouv.fr/data/dgfip-pci-vecteur/{date}/edigeo/feuilles/{departement}/{commune}/'})
```

En ligne de commande si le plugin cadastre est installé

```bash

qgis_process run cadastre:telechargeur_edigeo_communal -- LISTE_CODE_INSEE=44109,44143,44162,44026,44190,44215 FILTRE= DOSSIER=/tmp/cadastre-out DATE=latest URL_TEMPLATE=https://cadastre.data.gouv.fr/data/dgfip-pci-vecteur/{date}/edigeo/feuilles/{departement}/{commune}/

# déduit de la commande suivante en s'appuyant sur https://docs.qgis.org/3.28/fr/docs/user_manual/processing/standalone.html
qgis_process help cadastre:telechargeur_edigeo_communal
```

### Solutions propriétaires

Deux outils sont disponibles :

* [ESRI (produits ArcGIS)](https://www.arcopole.fr/content/cadastre)
* [FME MAJIC](https://www.veremes.com/produits/majic)


# Foire aux questions sur le cadastre

> Si vous avez une autre question sur le cadastre ou sur l'utilisation des données ouvertes du plan cadastral, [**n'hésitez pas à nous l'indiquer ici**](https://tally.so/r/wgdoJl). Nous vous répondrons à travers ce guide et cette foire aux questions.

<details>

<summary>Comment rechercher/connaître un propriétaire ?</summary>

Nous ne disposons pas d'informations sur les propriétaires actuels ou anciens. De ce fait, nous ne pouvons pas les communiquer. Il vous est possible de demander ces informations.

1. Si vous êtes une collectivité, vous pouvez [vous adresser au Service de Publicité Foncière (SPF) dont dépend votre collectivité](http://www2.impots.gouv.fr/contacts/spf/index.htm).
2. Si vous êtes un particulier :
   * Si vous souhaitez connaître le propriétaire d'un bien, vous pouvez obtenir cette information en demandant un extrait de propriété (payant). Les démarches sont indiquées [ici](https://www.service-public.fr/particuliers/vosdroits/F17759).
   * Si vous êtes propriétaire et que vous cherchez certaines informations relatives à votre bien, que vous devez demander des modifications ou chercher des informations sur la mitoyenneté sur le plan ou un droit de passage, il est recommandé de [vous adresser aux impôts en passant par votre espace sécurisé](https://impots.gouv.fr).

</details>

<details>

<summary>Le fichier du cadastre téléchargé ne correspond pas à ma commune, comment faire ?</summary>

Vous avez peut-être confondu code INSEE et code postal, dans le cadre de votre recherche. Le code INSEE est unique, alors que le code postal correspond à une ou plusieurs communes. Pour retrouver plus facilement ce code INSEE, passez plutôt par "l'aide au téléchargement" pour [les données PCI (*Edigeo* ou *DXF*)](https://cadastre.data.gouv.fr/datasets/plan-cadastral-informatise) ou [celle des données Cadastre Etalab (*GeoJSON*/*SHP*)](https://cadastre.data.gouv.fr/datasets/cadastre-etalab) selon le format de fichier souhaité.

</details>

<details>

<summary>Comment remonter une erreur dans les données de valeurs foncières ?</summary>

Nous vous invitons à lire [la partie Questions fréquentes à ce propos](https://app.dvf.etalab.gouv.fr/faq.html). Si l'information vous paraît toujours erronnée, veuillez contacter le bureau GF-3B de la DGFiP à l'adresse suivante : <bureau.gf3b-dvf@dgfip.finances.gouv.fr>.

</details>

<details>

<summary>Comment faire retirer les informations de vente dans les données de valeurs foncières ?</summary>

Nous vous invitons à lire la partie [Cadre réglementaire de la publication de ces informations](https://app.dvf.etalab.gouv.fr/faq.html).

</details>

<details>

<summary>Comment s'informer sur la mitoyenneté ?</summary>

Nous vous invitons à consulter [cette page](https://www.service-public.fr/particuliers/vosdroits/F2415). Vous pouvez également consulter le plan avec figuré sur [cadastre.gouv.fr](https://www.cadastre.gouv.fr/). La [page de légende du cadastre](https://www.cadastre.gouv.fr/scpc/pdf/legendes/FR_fr/Legende%20du%20plan%20sur%20internet.pdf#page=3) vous permet de comprendre les figurés liés à la mitoyenneté. Il vous est possible d'avoir plus d'informations si vous êtes propriétaire en vous rapprochant des services concernés en passant par votre espace sécurisé sur [impots.gouv.fr](https://impots.gouv.fr).

</details>

<details>

<summary>J'ai un décalage entre les parcelles cadastrales et des photos aériennes et/ou je constate des chevauchements entre des parcelles, pourquoi ?</summary>

Contrairement à une croyance commune, **le contour des parcelles n'est pas fiable** : il ne s'agit que d'une représentation graphique imprécise, établie avant que les photos aériennes soient généralisées et de grande précision. **Seuls les actes de vente ont une valeur juridique.**

Il faut aussi noter que les parcelles aux limites entre communes se recoupent ou donnent un "no man land" car historiquement, chaque commune gérait séparément ses parcelles et aucune ne se préoccupait de la limite exacte avec les communes limitrophes de son territoire.

Pour évaluer ce décalage entre les contours des parcelles et le terrain, il est possible d'utiliser la couche "**Décalage de la representation cadastrale**" `CADASTRALPARCELS.HEATMAP` disponible sur [le WMS](https://wxs.ign.fr/parcellaire/geoportail/r/wms) et aussi consultable sur [le Géoportail](https://www.geoportail.gouv.fr/carte?c=-1.0309918634157356,46.551302493795134\&z=6\&l0=ORTHOIMAGERY.ORTHOPHOTOS::GEOPORTAIL:OGC:WMTS\(1\)\&l1=GEOGRAPHICALGRIDSYSTEMS.PLANIGNV2::GEOPORTAIL:OGC:WMTS\(1\)\&l2=CADASTRALPARCELS.HEATMAP::GEOPORTAIL:OGC:WMTS\(0.9\)\&l3=CADASTRALPARCELS.PARCELLAIRE_EXPRESS::GEOPORTAIL:OGC:WMTS\(1\)\&permalink=yes). Cette couche couvre une grande partie du territoire, mais pas son ensemble.

</details>

<details>

<summary>Comment rechercher des parcelles anciennes ?</summary>

Pour rechercher des parcelles anciennes, plusieurs solutions se présentent à vous :

* Si vous ne recherchez pas la représentation graphique, vous pouvez consulter [les documents de filiation informatisés (DFI)](https://www.data.gouv.fr/fr/datasets/documents-de-filiation-informatises-dfi-des-parcelles/) qui précisent la parenté ;
* Si les parcelles anciennes que vous recherchez ne figurent pas dans les DFI, nous vous invitons à consulter les remembrements aux archives départementales, ou à contacter le Service de publicité foncière (sans garantie).

Pour retrouver les contours du cadastre de l'époque, vous pouvez vous adresser :

* à la mairie ;
* au Service de publicité foncière, dans les annexes graphiques des actes notariaux.

</details>

<details>

<summary>Comment rechercher des photographies aériennes ?</summary>

Pour rechercher des photographies aériennes, deux options s'offrent à vous :

* [l'outil remonter le temps](https://remonterletemps.ign.fr/) "version facile", en choisissant "cartes" ;
* [l'outil remonter le temps](https://remonterletemps.ign.fr/), en cherchant les clichés. La position exacte et l'orientation ne sont pas toujours satisfaisants car il s'agit de clichés bruts et non calés : ce ne sont pas des ortho-photographies. L'investissement technique peut être élevé.

</details>

<details>

<summary>Certaines parcelles ne sont pas présentes, pourquoi ?</summary>

A la manière d'un traducteur, le parseur utilisé n'interprète pas toujours parfaitement les points indiqués dans les données pour décrire les contours des parcelles : des erreurs peuvent donc se glisser.

</details>


# Prendre en main l'API "Adresse" portée par l'IGN

Ce guide a vocation à accompagner les utilisateurs de l'API "Adresse", dans le cadre de son transfert de la DINUM à l'IGN.

Il présente :

* [Le transfert de l'API "Adresse" de la Base Adresse Nationale, de la DINUM à l'IGN](#transfert-de-lapi-adresse-de-la-base-adresse-nationale-de-la-dinum-a-lign) ;
* [Les modalités d’évaluation de l’API “Adresse” portée par l’IGN](#modalites-devaluation-de-lapi-adresse-portee-par-lign) ;
* [Comment utiliser l'API "Adresse" portée par l'IGN et les différences avec l'API "Adresse" portée par la DINUM](#utilisation-de-lapi-adresse-portee-par-lign-et-les-differences-avec-lapi-adresse-portee-par-la-dinum).

## Transfert de l’API “Adresse” de la Base Adresse Nationale, de la DINUM à l’IGN

La Base Adresse Nationale (BAN) est la base de données ouverte d’adresses officiellement reconnues par l’administration. Elle figure parmi les 9 données de référence du [service public de la donnée](https://www.data.gouv.fr/fr/pages/spd/reference/).

Elle est disponible en téléchargement et via une API ([licence ouverte Etalab 2.0](https://www.etalab.gouv.fr/wp-content/uploads/2017/04/ETALAB-Licence-Ouverte-v2.0.pdf)) sur :

* [adresse.data.gouv.fr](https://adresse.data.gouv.fr/)
* [www.data.gouv.fr/fr/datasets/base-adresse-nationale](https://www.data.gouv.fr/fr/datasets/base-adresse-nationale/)

L’API “Adresse” adossée à la BAN était initialement opérée par la Direction interministérielle du numérique (DINUM).

**Elle a entamé en décembre 2023 sa transition pour être dorénavant gérée par l’Institut de l’information géographique et forestière (IGN) au sein de la Géoplateforme.** Elle rejoint ainsi les API géographiques de l’IGN. Ce transfert garantit l’intégration de nouvelles fonctionnalités telles que la recherche par points d’intérêt (POI) et selon les parcelles cadastrales.

Ce nouveau portage s’inscrit dans le cadre du transfert de la BAN initié en mars 2022, de la DINUM à l’IGN.

{% hint style="info" %}
**Geoplateforme** : Espace public de l’information géographique visant à optimiser la production et la diffusion des géodatas au service de la décision publique.
{% endhint %}

Une période minimum de transition est mise en place pendant les 6 premiers mois de l’année 2024, au cours de laquelle “l’API DINUM” et “l’API IGN” coexisteront. **A partir du début 2024, l’IGN sera le point de contact principal pour les questions relatives à l’API “Adresse”.**

## Modalités d’évaluation de l’API “Adresse” portée par l’IGN

Dans le cadre du transfert, les performances de l’API « Adresse » gérée par l’IGN seront évaluées par la DINUM 3 mois après la mise en production : le service doit être iso-fonctionnel avec l’API “Adresse” de la DINUM.

Si cet audit s’avère satisfaisant, l’API BAN de la DINUM sera décommissionnée mi-2024.

L’évaluation sera réalisée selon le protocole suivant :

### **Documentation**

* Code publié en open source<https://gitlab.gpf-tech.ign.fr/geoplateforme/geocodage/geocodeur/>
* Documentation claire sur les réglages effectués sur Addok (joue sur le ranking et le scoring)

Actuellement on a `addok.conf` qui contient

```python
ATTRIBUTION = "BAN"
LICENCE = "ETALAB-2.0"
EXTRA_FIELDS = [
    {"key": "citycode"},
    {"key": "oldcitycode"},
    {"key": "oldcity"},
    {"key": "district"},
]
FILTERS = ["type", "citycode", "postcode"]
QUERY_PROCESSORS_PYPATHS = [
    "addok.helpers.text.check_query_length",
    "addok_france.extract_address",
    "addok_france.clean_query",
    "addok_france.remove_leading_zeros",
]
SEARCH_RESULT_PROCESSORS_PYPATHS = [
    "addok.helpers.results.match_housenumber",
    "addok_france.make_labels",
    "addok.helpers.results.score_by_importance",
    "addok.helpers.results.score_by_autocomplete_distance",
    "addok.helpers.results.score_by_ngram_distance",
    "addok.helpers.results.score_by_geo_distance",
]
PROCESSORS_PYPATHS = [
    "addok.helpers.text.tokenize",
    "addok.helpers.text.normalize",
    "addok_france.glue_ordinal",
    "addok_france.fold_ordinal",
    "addok_france.flag_housenumber",
    "addok.helpers.text.synonymize",
    "addok_fr.phonemicize",
]
SQLITE_DB_PATH = '/home/debian/addok-data/addok.db'
```

* Documentation détaillée de l’architecture pour la possibilité d’un déploiement iso par un tiers <https://gitlab.gpf-tech.ign.fr/geoplateforme/geocodage/geocodeur/-/blob/main/docs/user/installation.md>

### **Gouvernance**

* Maintenance du code et des dépendances de l’API (pérennité) : quelle réactivité suite aux sollicitations de la communauté ?
* Organisation mise en place
* Nom de domaine de l’API simple à utiliser « [sous-domaine.domaine.ign.fr](http://sous-domaine.domaine.ign.fr) »:
* Gestion des droits spéciaux : comment sont gérés les droits des tiers de confiance dont on lève la limitation de consommation
* Evaluation du coût d’hébergement de l’API
* Vérification que la fréquence de mise à jour des données et sources soit a minima hebdomadaire

### **Migration**

* Evaluation des modifications des payloads de l’API actuelle pour assurer la continuité de service
* Routes disponibles :
  * Adresse unitaire
  * Geocoding CSV
* Evaluation du parsing CSV (actuellement, l’API BAN effectue un pré-traitement de données avant appel à Addok)
* Suivi de la migration des gros acteurs publics (ANTS, Ameli, Pôle Emploi, etc.)

### **Performance de l’API**

* Evaluation de la tenue de la charge de l’API : doit pouvoir atteindre plusieurs centaines de millions d’appels par mois
* Temps de réponse moyen d’un appel unitaire inférieur à 100ms
* Nombre, durée des incidents, temps de rétablissement et/ou redéploiement du fait de la criticité de l’API

## Utilisation de l’API “Adresse” portée par l’IGN et les différences avec l’API “Adresse” portée par la DINUM

**L’API “Adresse” portée par l’IGN est rétrocompatible/iso-fonctionnelle avec celle jusqu’alors portée par la DINUM** pour la recherche via les points d’entrée `/search/` et `/reverse/` qui se font en GET.

**Nous vous invitons donc à consulter la documentation “**[**Utiliser l’API Adresse**](/reutiliser-des-donnees/utiliser-les-api-geographiques/utiliser-lapi-adresse)**” des guides de** [**data.gouv.fr**](http://data.gouv.fr)**.**

{% hint style="danger" %}
**La fonction géocodage CSV fortement utilisée n’est pas implémentée et reste un point majeur pour la rétrocompatibilité avec les fonctionnalités existantes.**
{% endhint %}

Des fonctionnalités ont été rajoutées mais elles ne concernent pas la recherche d’adresse à l’exception très limitée de rechercher par nom de commune avec l’option `city` qui fonctionne sur les `address` et les `poi`.

Elle supporte les options historiques :

* `limit`
* `autocomplete`
* `lat` et `lon`
* `type`
* `postcode`
* `citycode`

Il est possible de rechercher des POIs ou des parcelles en passant par l’option `index`. On peut combiner les options que sont `parcel`, `poi` et `address`.

Les options `postcode` et `citycode` fonctionnent aussi avec l’index des `poi` et pas seulement avec les `address`.

### **Spécifique à la recherche de POIs**

`category`: Il faut passer par les options relatives à `category` dans le `getCapabilities` disponible sur <https://data.geopf.fr/geocodage/getCapabilities> pour connaître les possibilités de filtre.

> Exemple : <https://data.geopf.fr/geocodage/search?index=poi&q=nantes&category=administratif&returntruegeometry=true>

### **Spécifique à la recherche de parcelles**

* `departmentcode`
* `municipalitycode`
* `oldmunicipalitycode`
* `districtcode`
* `section`
* `number`
* `sheet`

> Exemple : <https://data.geopf.fr/geocodage/search?index=parcel&departmentcode=44&municipalitycode=109&section=EX&number=8&returntruegeometry=true>

### **Autres remarques**

Il existe une option `returntruegeometry` assez intéressante mais encore plutôt inconsistante (elle est sérialisée ou pas selon le type d’index)

* Pour les parcelles : elle présente l’avantage de retourner la géométrie polygonale. Attention, cette géométrie est une propriété dans le GeoJSON retourné. La géométrie reste un point par ailleurs.
* Pour les POIs : on retourne la chaine échappée de la géométrie polygonale et comme pour les parcelles, le GeoJSON reste de type point.
* Pour les adresses : l’intérêt est limité, on retourne la chaine échappée de la géométrie ponctuelle qui est déjà dans le GeoJSON retourné.


# Autres ressources utiles


# Lexique de l'open data

Cette page a vocation à vous éclairer sur les différents concepts rencontrés dans le cadre d'une démarche d'ouverture ou de réutilisation de données.

## A

<details>

<summary>Administration</summary>

L'administration englobe l’État, les collectivités territoriales ainsi que les autres personnes de droit public ou les personnes de droit privé chargées d'une mission de service public ([Article L300-2 du CRPA](https://www.legifrance.gouv.fr/affichCodeArticle.do;jsessionid=38EE7903F1DB9BDF237E3916D5943464.tplgfr29s_3?idArticle=LEGIARTI000033218936\&cidTexte=LEGITEXT000031366350\&dateTexte=20170701https://)) ;

</details>

<details>

<summary>Anonymisation des données</summary>

Processus consistant à traiter des données à caractère personnel afin d’empêcher totalement et de manière irréversible l’identification d’une personne physique. L’anonymisation suppose donc qu’il n’y ait plus aucun lien possible entre l’information concernée et la personne à laquelle elle se rattache.

</details>

<details>

<summary>API</summary>

Une API est une interface, un contrat passé entre deux systèmes informatiques pour leur permettre de communiquer. Cette solution informatique permet d’automatiser des tâches depuis votre ordinateur ou vos serveurs.

</details>

## B

<details>

<summary>Base Adresse Nationale</summary>

La Base Adresse Nationale est l’une des neuf bases de données du [service public des données de référence](https://www.data.gouv.fr/fr/reference). Elle est la seule base de données d’adresses officiellement reconnue par l’administration.

Sous co-pilotage DINUM, ANCT et IGN, sa construction est assurée grâce à de nombreux partenaires et en premier lieu par les communes, seules autorités compétentes en terme d’adressage.

La Base Adresse Nationale est accessible sous forme de fichiers et d’API.

Un [service de géocodage gratuit](https://adresse.data.gouv.fr/api) est mis à disposition par Etalab.

</details>

<details>

<summary>Base Adresse Locale</summary>

Fichier géré par une collectivité locale (habituellement une commune ou un EPCI) et contenant toutes ses adresses géolocalisées. Une Base Adresse Locale publiée et à jour garantit une meilleure prise en compte des adresses dans les différents systèmes d’information des acteurs, qu’ils soient privés ou publics.\
\
Depuis 2019, les Bases Adresses Locales sont prioritaires dans la Base Adresse Nationale : une commune qui publie sa Base Adresse Locale devient la seule source d'adresses sur son territoire.

</details>

## C

## D

<details>

<summary>data.gouv.fr</summary>

data.gouv.fr est la plateforme ouverte et communautaire qui vise à centraliser et structurer les données ouvertes en France. Elle vise à favoriser la transparence et l’efficacité de l’action publique tout en facilitant la création de nouveaux services. data.gouv.fr est une plateforme communautaire qui s’adresse :

* À ceux qui produisent des données (producteurs de données) et qui souhaitent ouvrir leurs données ;
* À ceux qui exploitent des données (réutilisateurs de données) et qui veulent télécharger des données et partager leurs réalisations ;
* À tout citoyen qui souhaite découvrir des données ou trouver une information.

</details>

<details>

<summary>Documentation</summary>

La documentation d'un jeu de données décrit les données et la structure des fichiers publiés. Elle a une visée pédagogique et facilite la réutilisation des données.

</details>

<details>

<summary>Document administratif</summary>

Tout document que l'administration a pu produire ou recevoir (de la part d’une autre administration ou d’un prestataire par exemple), dans le cadre de sa mission de service public ([Article L300-2 du CRPA](https://www.legifrance.gouv.fr/affichCodeArticle.do;jsessionid=38EE7903F1DB9BDF237E3916D5943464.tplgfr29s_3?idArticle=LEGIARTI000033218936\&cidTexte=LEGITEXT000031366350\&dateTexte=20170701https://)). Ces documents peuvent correspondre à des notes de services, une base de données, une législation, un code source de logiciel, des cartes, un algorithme, etc.

</details>

<details>

<summary>Donnée à caractère personnel</summary>

Toute information relative à une personne physique identifiée ou qui peut être identifiée, directement ou indirectement, par référence à un numéro d’identification (par exemple le numéro de sécurité sociale) ou à un ou plusieurs éléments qui lui sont propres.

</details>

<details>

<summary>Donnée publique</summary>

Représentation d’une information publique sous une forme conventionnelle destinée à faciliter son traitement. Cela peut être par exemple des données géographiques (adresses, références cadastrales), financières (budgets, commande publique, subventions, etc.), environnementales (émissions, vente de produits, etc.), etc.

</details>

## E

## F

## G

<details>

<summary>Géocodage</summary>

Le géocodage consiste à affecter des coordonnées géographiques à une adresse postale.

</details>

## H

## I

<details>

<summary>Information publique</summary>

Information contenue dans un document administratif communicable à tous ou faisant l'objet d'une diffusion publique, sur lequel des tiers ne détiennent pas de droits de propriété intellectuelle ([Article L321-2 du CRPA](https://www.legifrance.gouv.fr/affichCodeArticle.do;jsessionid=3D26427599551CBACAF75B4C44C8715B.tplgfr24s_3?idArticle=LEGIARTI000033218992\&cidTexte=LEGITEXT000031366350\&dateTexte=20191018))

</details>

## J

<details>

<summary>Jeu de données</summary>

Un jeu de donnée sur data.gouv.fr est un ensemble de ressources ou d’informations (fichiers de données, fichiers d’explications, API etc.) et de métadonnées (description, producteur, date de publication, mots-clefs, couverture géographique temporelle etc.) sur un thème donné.

</details>

## K

## L

## M

<details>

<summary>Métadonnée</summary>

Une métadonnée est une donnée qui décrit ou définit une autre donnée.

Dans la vie courante, l’étiquette d’un produit fournit des informations/métadonnées sur le produit (origine, composition, date de péremption, etc.). Appliqué aux jeux de données, les métadonnées sont des descriptions normalisées du contenu du jeu.

</details>

<details>

<summary>Modèle de données</summary>

Un modèle de données décrit la structure logique du jeu de données sous la forme d'objets (ou entités) et de relations (ou associations). Les objets sont définis par une liste d'attributs. Le modèle de données est avant tout un outil de dialogue entre les différents intervenants.

</details>

<details>

<summary>Moissonnage</summary>

Le moissonnage est un mécanisme permettant de collecter les métadonnées sur un catalogue distant et de les stocker sur une autre plateforme afin de proposer un second point d’accès aux données.

</details>

## N

## O

<details>

<summary>Open data</summary>

Les données ouvertes (open data) sont des données en accès libre et gratuit et facilement réutilisables par toutes et tous.

Ces données sont produites par l’administration (ministères, collectivités locales, etc.) mais aussi par des acteurs privés ou encore des citoyens.

</details>

<details>

<summary>Open data public</summary>

L'open data public consiste à assurer la large mise à disposition à tous des données publiques, en accès libre et gratuit, sous un format numérique facilement réutilisable.

</details>

<details>

<summary>Organisation</summary>

Sur data.gouv.fr, une organisation est une entité au travers de laquelle plusieurs utilisateurs peuvent collaborer. Les jeux de données publiés au nom de l’organisation peuvent être édités par les membres de l’organisation. Elle peut contenir plusieurs utilisateurs et un même utilisateur peut appartenir à plusieurs organisations.

</details>

## P

## Q

<details>

<summary>Qualité d'un jeu de données</summary>

Plusieurs critères permettent d'évaluer le niveau de qualité d'un jeu de données, notamment :

* Des éléments sur les données elles-mêmes et leur structure (format, structure, contenu, etc.)
* Des éléments attestant du potentiel de réutilisation et de croisement des données (respect de standards, données pivot, etc.)
* Des éléments qui accompagnent les données (documentation, etc.)

</details>

## R

<details>

<summary>Réutilisation</summary>

Une réutilisation désigne communément l’exploitation de données ouvertes par des tiers, à d’autres fins que celle de la mission de service public pour laquelle elles ont été produites ou reçues.

Elle peut prendre la forme d’une visualisation, d’une application, d’un article de presse, d’un papier de recherche, etc.

</details>

## S

<details>

<summary>Secret légal</summary>

Les documents couverts par un secret légal sont :

* Les documents qui ne sont aucunement communicables. Ce sont par exemple les documents dont la diffusion porterait atteinte au secret des délibérations du Gouvernement, au secret de la défense nationale ou de la sûreté de l’État, etc. ([Article L. 311-5 du CRPA](https://www.legifrance.gouv.fr/affichCodeArticle.do;jsessionid=B12CCBE39831FB4644322E0902EB97B9.tplgfr34s_1?idArticle=LEGIARTI000033265181\&cidTexte=LEGITEXT000031366350\&dateTexte=20170701)).
* Les documents dont la diffusion porterait atteinte à la protection de la vie privée, au secret médical et au secret des affaires. Les documents qui portent une appréciation ou un jugement de valeur sur une personne physique ou qui font apparaître le comportement d’une personne ([Article L. 311-6 du CRPA](https://www.legifrance.gouv.fr/affichCodeArticle.do;jsessionid=B12CCBE39831FB4644322E0902EB97B9.tplgfr34s_1?idArticle=LEGIARTI000033218964\&cidTexte=LEGITEXT000031366350\&dateTexte=20170701)).

</details>

<details>

<summary>Service public de la donnée</summary>

Le service public de la donnée créé par [l’Article 14 de la loi pour une République numérique](https://www.legifrance.gouv.fr/affichTexteArticle.do?cidTexte=JORFTEXT000033202746\&idArticle=JORFARTI000033203033\&categorieLien=cid) vise à mettre à disposition, en vue de faciliter leur réutilisation, les jeux de données de référence qui présentent le plus fort impact économique et social.

À ce jour, neuf jeux de données, qui couvrent un large champ thématique ont été identifiés comme des données de référence.

* [Base Adresse Nationale (BAN)](https://www.data.gouv.fr/datasets/base-adresse-nationale/)
* [Base Sirene des entreprises et de leurs établissements (SIREN, SIRET)](https://www.data.gouv.fr/datasets/base-sirene-des-entreprises-et-de-leurs-etablissements-siren-siret/)
* [Code Officiel Géographique (COG)](https://www.data.gouv.fr/datasets/code-officiel-geographique-cog/)
* [Plan Cadastral Informatisé](https://www.data.gouv.fr/datasets/plan-cadastral-informatise/)
* [Registre parcellaire graphique (RPG) : contours des parcelles et îlots culturaux et leur groupe de cultures majoritaire](https://www.data.gouv.fr/datasets/registre-parcellaire-graphique-rpg-contours-des-parcelles-et-ilots-culturaux-et-leur-groupe-de-cultures-majoritaire/)
* [Référentiel de l'organisation administrative de l'Etat](https://www.data.gouv.fr/datasets/referentiel-de-lorganisation-administrative-de-letat/)
* [Référentiel à grande échelle (RGE)](https://www.data.gouv.fr/datasets/referentiel-a-grande-echelle-rge/)
* [Répertoire National des Associations (RNA)](https://www.data.gouv.fr/datasets/repertoire-national-des-associations/)
* [Répertoire Opérationnel des Métiers et des Emplois (ROME](https://www.data.gouv.fr/datasets/repertoire-operationnel-des-metiers-et-des-emplois-rome/)

</details>

<details>

<summary>Schéma de données</summary>

Un schéma de données permet de décrire la structure d'un fichier d'un jeu de données.

Il indique clairement quels sont les différents champs, comment sont représentées les données, quelles sont les valeurs possibles, leur format, etc.

</details>

<details>

<summary>schema.data.gouv.fr</summary>

[schema.data.gouv.fr](https://schema.data.gouv.fr/) est l’initiative de [data.gouv.fr](https://data.gouv.fr/) de référencement des schémas de données publiques pour la France.

Cette plateforme de référencement national permet un accès aux schémas produits par différents acteurs et facilite l’intégration avec des systèmes informatiques par le biais de standards, d’URLs stables, de processus de validation et d’API.

</details>

## T

## U

## V

## W

## X

## Y

## Z

##


# Données de la commande publique


# Publier les données essentielles d’attribution des marchés

### Obligation légale <a href="#obligation-legale" id="obligation-legale"></a>

Depuis le 1er octobre 2018, les acheteurs publics doivent publier les données d’attribution de leur marché, et ce, au plus tard deux mois après la notification du marché.

La publication devient obligatoire sur data.gouv.fr à partir du 1er janvier 2024.

### Structure des données à publier <a href="#structure-des-donnees-a-publier" id="structure-des-donnees-a-publier"></a>

La structure des données à publier **jusqu’au 31 décembre 2023** est définie par [des schémas de données aux formats XML et JSON dont vous trouverez la documentation sur ce lien](https://schema.data.gouv.fr/139bercy/format-commande-publique/1.5.0/).

La structure des données à publier **à partir du 1er janvier 2024** est définie par [des schémas de données aux formats XML et JSON dont vous trouverez la documentation sur ce lien](https://schema.data.gouv.fr/139bercy/format-commande-publique/2.0.0/).

Pour en savoir plus sur la publication des données, consultez [le site de la direction des affaires juridiques](https://www.economie.gouv.fr/daj/ouverture-des-donnees-commande-publique), ainsi que [l’article de blog](https://www.data.gouv.fr/fr/posts/le-point-sur-les-donnees-essentielles-de-la-commande-publique/) consacré par data.gouv.fr à ce sujet.

### Sources des données <a href="#sources-des-donnees" id="sources-des-donnees"></a>

Les données essentielles publiées sur data.gouv.fr proviennent de trois sources :

1. La **DGFiP (Direction générale des finances publiques)** propose aux acheteurs publics soumis à la comptabilité publics (par exemple les collectivités) de faire remonter ces données par l’intermédiaire d’Hélios ([PES Marché](https://www.collectivites-locales.gouv.fr/protocole-dechange-standard-pes-0)), pour ensuite les transmettre à la mission Etalab qui les met à disposition du public (voir ci-dessous) ;
2. L’**AIFE (Agence Informatique des Finances de l’État)** publie sur [data.gouv.fr](https://data.gouv.fr/) les données essentielles provenant des places de marchés qui utilisent son service, et notamment de la plateforme de marchés de l’État, [PLACE](https://www.marches-publics.gouv.fr/?page=entreprise.AccueilEntreprise) ;
3. Les données essentielles publiées sur les profils d’acheteurs (places de marché) peuvent être publiées sur data.gouv.fr par l’intermédiaire de l’API data.gouv.fr ou d’un fichier DCAT moissonnable.

### Publier des données par l’intermédiaire de l’API de data.gouv.fr <a href="#publier-des-donnees-par-lintermediaire-de-lapi-de-datagouvfr" id="publier-des-donnees-par-lintermediaire-de-lapi-de-datagouvfr"></a>

La documentation de l’API est [consultable en ligne](https://www.data.gouv.fr/fr/apidoc), le détails des propriétés des jeux de données est [visible sur cette page](https://www.data.gouv.fr/fr/apidoc/#!/datasets/create_dataset).

Afin de faciliter la localisation et donc l’utilisation des données essentielles, la publication de ces données doit respecter une certaine structure. Les deux structures proposées sont les suivantes :

1. Structure **plateforme** : un jeu de données (`dataset` dans l’API) par plateforme de marchés (identifiée par son SIRET) ;
2. Structure **acheteur** : un jeu de données par acheteur public (SIRET).

#### Jeu de données <a href="#jeu-de-donnees" id="jeu-de-donnees"></a>

Pour des raisons d’archivage, le téléversement des fichiers de données sur data.gouv.fr est fortement préféré par rapport à un lien vers des serveurs externes.

Une fois que le jeu de données a été créé, vous pouvez y ajouter des `ressources` ([API ressource](https://www.data.gouv.fr/fr/apidoc/#!/datasets/upload_new_dataset_resource)).

Exemple de commande :

```
curl --request POST --url https://data.gouv.fr/api/1/datasets/<dataset-id>/upload/ --header "content-type: multipart/form-data" --header "x-api-key: <api-key>" --form "file=@<chemin du fichier à téléverser>"
```

**Nom (`title` dans l’API)**

Le nom du jeu de données dépend de la structure choisie pour la publication :

* jeu de données pour une **plateforme** : Données essentielles des marchés publics - `{nom de la plateforme}`;
* jeu de données pour un **acheteur** : Données essentielles des marchés publics - `{nom de l’acheteur}`.

Exemple :

> Données essentielles des marchés publics - Conseil régional de Bretagne

**Description (`description`)**

La description attendue est un texte générique décrivant le contexte de publication des données essentielles, ainsi que quelques liens utiles. Le texte suivant remplit ces conditions et peut être étendu par le producteur, notamment avec un lien vers l’interface de visualisaton de données du profil d’acheteur concerné.

[L’arrêté du 14 avril 2017](https://www.legifrance.gouv.fr/eli/arrete/2017/4/14/ECFM1637256A/jo/texte), modifié par [l’arrêté du 27 juillet 2018](https://www.legifrance.gouv.fr/affichTexte.do?cidTexte=JORFTEXT000037282994\&dateTexte=\&categorieLien=id), impose à tous les acheteurs publics la publication des données essentielles de la commande publique. Ainsi, à partir du 1er octobre 2018, les acheteurs publics doivent publier les données d’attribution au plus tard deux mois après la notification du marché.

La structure des données est définie par [des schémas XML et JSON](https://github.com/etalab/format-commande-publique) qui appliquent les exigences des arrêtés.

Pour plus d’informations, vous pouvez consulter [la page thématique](https://www.economie.gouv.fr/daj/ouverture-des-donnees-commande-publique) sur le site de la direction des affaires juridiques.

**Mot-clés (`tags`)**

Renseignez les mot-clés suivants :

* `données-essentielles` ;
* `commande-publique`.

**Extras (`extras`)**

Si le jeu de données est spécifique à un **acheteur** et non à une plateforme, ajoutez une propriété `siret` à la propriété `extras` de l’objet `Dataset`, et indiquez le SIRET de l’acheteur.

```
{
    "title": "Données essentielles des marchés publics - Conseil régional de Bretagne"
    …
    "extras": {
        "siret": "89764547841001"
}
```

Si le jeu de données est spécifique à une **plateforme**, ne renseignez pas la propriété `extras`.

**Licence (`license`)**

La licence à renseigner est la [licence ouverte](https://www.etalab.gouv.fr/wp-content/uploads/2014/05/Licence_Ouverte.pdf) : `fr-lo`.

**Organisation (`organization`)**

Ajoutez votre identifiant d’organisation data.gouv.fr. L’utilisateur qui publie les données doit appartenir à cette organisation.

**Fréquence (`frequency`)**

Renseignez la fréquence de la publication des mises à jour.

#### Ressource <a href="#ressource" id="ressource"></a>

**Nom du fichier**

Format : DECP-`{SIRET}`-`{année}`-`{mois}`-`{jour}`-`{numéro de séquence}`.`{extension}`

* `DECP` pour « données essentielles de la commande publique » ;
* `siret` : SIRET de la plateforme si structure plateforme, sinon SIRET de l’acheteur ;
* `année` : année de la publication sur data.gouv.fr ;
* `mois` : mois de la publication sur data.gouv.fr ;
* `jour` : jour de la publication sur data.gouv.fr ;
* `numéro de séquence` : numéro de séquence du fichier à incrémenter si plusieurs fichiers sont publiées dans la même journée. Le premier numéro est `01` ;
* `extension` : `xml` ou `json` en fonction du format de publication. Il n’est pas obligatoire de publier les données à la fois en XML et en JSON, un seul des deux formats suffit.

Exemple :

> DECP-89764547841001-2018-11-28-01.xml

**URL (`url`)**

L’URL n’est renseignée que si le fichier n’est pas téléversé sur data.gouv.fr et hébergé sur un serveur externe.

**Nom (`title` dans l’API)**

Identique au nom de fichier.

**Type de fichier (`filetype`)**

* `xml` pour du XML ;
* `json` pour du JSON.

**Type MIME (`mime`)**

* `application/xml` pour du XML ;
* `application/json` pour du JSON.

**Type de ressource (`type`)**

Renseignez `main`.

### Téléchargement des données essentielles transmises par la DGFiP via le PES Marché <a href="#telechargement-des-donnees-essentielles-transmises-par-la-dgfip-via-le-pes-marche" id="telechargement-des-donnees-essentielles-transmises-par-la-dgfip-via-le-pes-marche"></a>

#### Via un système de fichier <a href="#via-un-systeme-de-fichier" id="via-un-systeme-de-fichier"></a>

Les données essentielles transmises par la DGFiP peuvent être téléchargées depuis leur emplacement sur un système de fichiers hébergé par Etalab. Cette méthode est particulièrement adaptée pour récupérer les données essentielles d’un acheteur qui passe beaucoup de marchés.

Le format des URL est le suivant :

> <http://files.data.gouv.fr/decp/{siret}/{année}/{mois}/{jour}/DECP-{siret}-{année}-{mois}-{jour}-{seq}.xml>

* `siret` : SIRET de l’acheteur ;
* `année` : année de la récéption par Etalab ;
* `mois` : mois de la récéption par Etalab ;
* `jour` : jour de la récéption par Etalab ;
* `seq` : numéro de séquence du fichier à incrémenter si plusieurs fichiers sont réceptionnés dans la même journée. Le premier numéro est `01`.

Exemple :

> <http://files.data.gouv.fr/decp/21440036800012/2019/01/18/DECP-21440036800012-2019-01-18-01.xml>

#### Via l’API <a href="#via-lapi" id="via-lapi"></a>

Aujourd’hui, les données essentielles transmises par la DGFiP ne sont pas référencées sur data.gouv.fr sous forme de ressources. Elles sont hébergées sur un serveur de fichier annexe, [https://files.data.gouv.fr](https://files.data.gouv.fr/decp). L’utilisation de l’API n’est donc pas pertinente, et nous vous conseillons par conséquent de consulter la section [via un système de fichiers](https://doc.data.gouv.fr/commande-publique/publier-donnees-essentielles-d-attribution/#via-un-syst%C3%A8me-de-fichier).

Pour récupérer les données via l’API, il vous faut :

1. Récupérer la liste des ressources du jeu de données ;
2. Télécharger les ressources dont vous avez besoin.

**Récupérer la liste des ressources du jeu de données**

Pour récupérer la liste des ressources d’un jeu de données, effectuez la requête suivante :

```
curl https://data.gouv.fr/api/1/datasets/<dataset id ou slug>
```

Exemples d’URL :

> <https://data.gouv.fr/api/1/datasets/56cc6d6988ee385864fa79d0>

> <https://data.gouv.fr/api/1/datasets/referentiel-de-donnees-marches-publics>


# Déclaration d’un profil d’acheteur

### Qui doit déclarer <a href="#qui-doit-declarer" id="qui-doit-declarer"></a>

La déclaration du profil d’acheteur est effectuée par l’acheteur, ou toute personne habilitée par celui-ci, sur [data.gouv.fr](https://data.gouv.fr/)). L’objectif est d’impliquer les **éditeurs** de profils d’acheteurs afin de simplifier la déclaration des profils d’acheteurs initialement confiée aux acheteurs publics. Dans le cas où l’éditeur n’est pas en mesure d’assurer la déclaration, l’administrateur du profil d’acheteur ou l’acheteur peut le faire directement.

### Comment déclarer <a href="#comment-declarer" id="comment-declarer"></a>

#### Format de fichier <a href="#format-de-fichier" id="format-de-fichier"></a>

Les éditeurs de profil d’acheteur sont invités à créer un fichier au format CSV contenant les informations suivantes :

* le SIRET des acheteurs (colonne `siretAcheteur`) ;
* l’adresse URL des profils d’acheteurs (colonne `urlProfilAcheteur`) ;
* l’adresse URL du catalogue DCAT qui répértorie les données (colonne `urlDCAT`) ;
* les coordonnées du ou des acheteurs concernés (colonne `coordonnees`).

Un modèle de fichier CSV est disponible [sur data.gouv.fr](https://www.data.gouv.fr/fr/datasets/structure-du-fichier-de-declaration-de-profil-dacheteur/).

#### Dépôt sur data.gouv.fr <a href="#depot-sur-datagouvfr" id="depot-sur-datagouvfr"></a>

Pour chaque fiche publiée il est essentiel de demander aux éditeurs de profils d’acheteurs d’associer le mot-clé (« tag ») suivant : « decp » (données essentielles de la commande publique) afin de permettre la centralisation de l’ensemble des contributions par Etalab.

La procédure complète pour déposer un ficher de déclaration de profil d’acheteur sur data.gouv.fr est la suivante :

1. Créer un compte individuel en allant sur : <https://www.data.gouv.fr/fr/register> ;
2. Une fois celui-ci validé via l’email de confirmation, créer une organisation correspondant à votre profil d’acheteur depuis : <https://www.data.gouv.fr/fr/admin/organization/new/> ;
3. Créer un jeu de données depuis <https://www.data.gouv.fr/fr/admin/dataset/new/> en choisissant lors de l’étape « Choisissez qui publie » l’organisation créée au point précédent ;
4. À l’étape « Décrivez votre jeu de données » renseigner un titre et éventuellement d’autres métadonnées (couverture spatiale, fréquence de mise à jour…) et **renseigner le tag (mot clé) « decp »** ;
5. À l’étape « Ajouter vos premières ressources » de la création du jeu de données, déposer le fichier CSV.

\\


# Données de forte valeur : métadonnées obligatoires et modalités de rapportage

Précisions pratiques pour les producteurs de données de forte valeur

{% hint style="info" %}
**Rappel juridique**

La "Directive Open Data" ([Directive 2019/1024](https://eur-lex.europa.eu/legal-content/FR/TXT/HTML/?uri=CELEX:32019L1024)) définit les données de forte valeur comme les "*documents détenus par un organisme du secteur public, dont la réutilisation est associée à des bénéfices importants pour la société, l'environnement et l'économie*". Il s'agit alors de les mettre à disposition avec un minimum de restrictions légales et techniques afin d'augmenter leur potentiel de réutilisation et leur impact.\
\
[Un règlement d'exécution (2023/138)](https://eur-lex.europa.eu/legal-content/FR/TXT/HTML/?uri=CELEX:32023R0138) établit la liste des ensembles de données de forte valeur.\
\
Les données de forte valeur devront être mises à disposition gratuitement en vue de leur réutilisation pour le **9 juin 2024**.
{% endhint %}

Les données de forte valeur (HVD) ont vocation à remonter sur la plateforme data.gouv.fr dans le cadre des obligations de rapportage établies dans [le règlement d'exécution](https://eur-lex.europa.eu/legal-content/FR/TXT/HTML/?uri=CELEX:32023R0138). Les modalités techniques définies ici font l'objet d'un travail concerté et itératif avec plusieurs parties prenantes, notamment dans le cadre de groupes de travail portés par le CNIG. Des discussions sont en cours sur ces modalités techniques et de nouvelles précisions sont à venir.

Ce guide présente :

* [Le processus global de remontée des données sur data.gouv.fr ;](#processus-global-de-remontee-des-fiches-de-donnees-sur-data.gouv.fr)
* [Les métadonnées obligatoires à renseigner pour les données de forte valeur ;](#metadonnees-obligatoires-pour-les-donnees-de-forte-valeur)
* [Les modalités de rapportage à la Commission européenne ;](#les-modalites-de-rapportage-a-la-commission-europeenne-depuis-data.gouv.fr)
* [L'articulation entre la directive INSPIRE et le règlement d'exécution relatif aux données de forte valeur.](#larticulation-entre-la-directive-inspire-et-le-reglement-dexecution-relatif-aux-donnees-de-forte-val)

Il a vocation à être enrichi au gré des nouvelles précisions. Une foire aux questions sera également alimentée.

## Processus global de remontée des fiches de données sur data.gouv.fr

Pour les producteurs concernés (cf. [ouverture.data.gouv.fr](https://ouverture.data.gouv.fr/)), la remontée des données de forte valeur sur data.gouv.fr se déroule selon les étapes suivantes :

1. Les données sont identifiées comme étant de forte valeur et sont classées dans l’une des 6 grandes catégories précisées dans les 6 annexes du règlement d'exécution (géospatiales, météorologiques, etc.). Selon la catégorie associée, les conditions de mise à disposition et les métadonnées obligatoires diffèrent.
2. Les données ainsi identifiées remontent au niveau national en étant :
   * soit moissonnées sur [data.gouv.fr](http://data.gouv.fr/) (cf. [Moissonnage](/guide-datasud.fr/moissonnage)) et éventuellement le [geocatalogue](https://www.geocatalogue.fr/) selon leur nature ;
   * soit publiées directement sur [data.gouv.fr](https://www.data.gouv.fr/).
3. Les données sont moissonnées par [data.europa.eu](https://data.europa.eu/en) pour proposer un catalogue européen des données de forte valeur.

## Métadonnées obligatoires pour les données de forte valeur

Plusieurs métadonnées sont obligatoires dans le cadre des données de forte valeur.

{% tabs %}
{% tab title="Pour les jeux de données" %}

1. **Une métadonnée identifiant le jeu de données comme étant un HVD** via l'utilisation d'un mot clé "**hvd**"\*.
2. **Une métadonnée identifiant la catégorie HVD à laquelle la donnée appartient**

   via les mots clés suivant\* :

   *Météorologiques*

   *Entreprises et propriété d'entreprises*

   *Géospatiales*

   *Mobilité*\
   *Observation de la terre et environnement*\
   *Statistiques*\
   Les mots clés sur data.gouv.fr sont automatiquement normalisés (mis en minuscule, etc.).
3. **La licence des données**. Celle-ci doit être équivalente ou moins restrictive que la [CC BY 4.0 DEED](https://creativecommons.org/licenses/by/4.0/). Nous recommandons la [licence ouverte 2.0](https://www.etalab.gouv.fr/wp-content/uploads/2017/04/ETALAB-Licence-Ouverte-v2.0.pdf).\
   En savoir plus sur les [licences utilisables par les administrations](https://www.data.gouv.fr/fr/pages/legal/licences/) ou sur les [conditions de réutilisations qui s'appliquent si aucune licence n'est indiquée](https://www.legifrance.gouv.fr/codes/article_lc/LEGIARTI000032255220).

**\*Si vous publiez via moissonnage à partir de plateformes géographiques** supportant les thèmes de vocabulaires contrôlés (ex: GeoNetwork) **les mots clés sont déduits**\
**via une URI du vocabulaire issue du** [**référentiel européen**](https://op.europa.eu/en/web/eu-vocabularies/dataset/-/resource?uri=http://publications.europa.eu/resource/dataset/high-value-dataset-category) ([exemple pour la catégorie météorologique](http://data.europa.eu/bna/c_164e0bf5)).

{% hint style="info" %}
**Si vous publiez par moissonnage** il est préconisé de suivre les bonnes pratiques DCAT-AP, [précisé ici dans le contexte des données de forte valeur](https://semiceu.github.io/DCAT-AP/releases/2.2.0-hvd/#c2) pour disposer d'un **identifiant stable dans le temps**.
{% endhint %}
{% endtab %}

{% tab title="Pour les API" %}

1. **Une métadonnée identifiant le jeu de données comme étant un HVD** via l'utilisation d'un mot clé "**hvd**".\*
2. **Une métadonnée identifiant la catégorie HVD à laquelle la donnée appartient**

   via les mots clés suivant:

   *Météorologiques\**

   *Entreprises et propriété d'entreprises*

   *Géospatiales*

   *Mobilité*\
   *Observation de la terre et environnement*\
   *Statistiques*\
   Les mots clés sur data.gouv.fr sont automatiquement normalisés (mis en minuscule, etc.).
3. **Un point de contact de l'API** : adresse mail ou formulaire de contact.
4. **La licence des données**. Celle-ci doit être équivalente ou moins restrictive que la [CC BY 4.0 DEED](https://creativecommons.org/licenses/by/4.0/). Nous recommandons la [licence ouverte 2.0](https://www.etalab.gouv.fr/wp-content/uploads/2017/04/ETALAB-Licence-Ouverte-v2.0.pdf).\
   En savoir plus sur les [licences utilisables par les administrations](https://www.data.gouv.fr/fr/pages/legal/licences/) ou sur les [conditions de réutilisations qui s'appliquent si aucune licence n'est indiquée](https://www.legifrance.gouv.fr/codes/article_lc/LEGIARTI000032255220).
5. **Un lien vers une page web de description de la qualité de service de cette API**. Par exemple un lien vers un SLA (service-level agreement).
6. **Un lien vers la documentation dans un format standard** pour les machines ou les utilisateurs humains, par exemple au format OpenAPI est aussi fortement recommandé.

**\*Si vous publiez via moissonnage à partir de plateformes géographiques** supportant les thèmes de vocabulaires contrôlés (ex: GeoNetwork) **les mots clés sont déduits**\
**via une URI du vocabulaire issue du** [**référentiel européen**](https://op.europa.eu/en/web/eu-vocabularies/dataset/-/resource?uri=http://publications.europa.eu/resource/dataset/high-value-dataset-category) ([exemple pour la catégorie météorologique](http://data.europa.eu/bna/c_164e0bf5)).

{% hint style="info" %}
**Si vous publiez par moissonnage** il est préconisé de suivre les bonnes pratiques DCAT-AP, [précisé ici dans le contexte des données de forte valeur](https://semiceu.github.io/DCAT-AP/releases/2.2.0-hvd/#c2) pour disposer d'un **identifiant stable dans le temps**.
{% endhint %}

{% hint style="warning" %}
**Aujourd’hui,** [**data.gouv.fr**](http://data.gouv.fr) **ne permet pas de modéliser et de moissonner les métadonnées d'API comme attendu dans le cadre des HVD.** [Des travaux](https://github.com/etalab/data.gouv.fr/issues/1294) sont en cours sur le sujet.
{% endhint %}
{% endtab %}
{% endtabs %}

## Les modalités de rapportage à la Commission européenne depuis [data.gouv.fr](http://data.gouv.fr)

Les Etats membres de l'Union européenne sont soumis à une obligation de rapportage auprès de la Commission européenne, dans le cadre du règlement d'exécution.

**Les producteurs de données ne sont pas responsables de ce rapportage. Celui-ci se fait par le catalogue** [**data.gouv.fr**](http://data.gouv.fr) **via** [**Data Catalogue Vocabulary**](https://w3c.github.io/dxwg/dcat/) **(DCAT)**.

Les [nouvelles lignes directrices](https://semiceu.github.io/DCAT-AP/releases/2.2.0-hvd/) pour la description en DCAT de ces jeux de données de forte valeur ont fait l'objet d’un travail concerté au niveau européen et des Etats membres.

Aujourd’hui, certaines des métadonnées demandées ne sont pas correctement modélisées ou moissonnées dans [data.gouv.fr](http://data.gouv.fr). C’est le cas des informations de description de service pour les APIs. **Ces points sont bien identifiés et seront résolus en amont de l’application du règlement relatif aux données de forte valeur**. Ils font l'objet de discussions lors du [groupe de travail métadonnées du CNIG](https://cnig.gouv.fr/gt-metadonnees-a958.html).

## L'articulation entre la Directive INSPIRE et le règlement d'exécution relatif aux données de forte valeur

{% hint style="info" %}
**INSPIRE** est une directive qui vise à établir une infrastructure d'information géographique pour l'environnement, à l'échelle européenne. \\

**"Données de forte valeur"** découle de la directive Open Data et est un label attribué à des données dont la mise en open data peut générer un impact économique, social et environnemental significatif.
{% endhint %}

La remontée des données INSPIRE se fait via le [géocatalogue](https://www.geocatalogue.fr/), portail national géré par le Bureau de recherches géologiques et minières (BRGM) et dédié aux données géographiques.

La remontée des données de forte valeur, quant à elle, se fait via [data.gouv.fr](https://www.data.gouv.fr/fr/), la plateforme nationale des données publiques françaises, gérée par la Direction interministérielle du numérique (DINUM).

Cependant, pour 3 catégories d'ensembles de données de forte valeur, [la Directive INSPIRE](https://eur-lex.europa.eu/legal-content/FR/ALL/?uri=celex%3A32007L0002) et le règlement d'exécution se rapportant aux données de forte valeur se recoupent et se renforcent :

* **Les données géospatiales**
* **Les données sur l’observation de la Terre et l’environnement**
* **Les données de mobilité**

**Dans ce cas, les métadonnées doivent également respecter le cadre défini par** [**la Directive INSPIRE**](https://eur-lex.europa.eu/legal-content/FR/ALL/?uri=celex%3A32007L0002)**.**

Pour éviter une double saisie, les producteurs de données ne produisent et ne maintiennent qu'une seule fiche, répondant aux deux législations. La remontée se fait ensuite de manière automatique au niveau européen pour répondre à ces deux obligations.

Voici **une proposition de schéma de rapportage** dans le cas de jeux de données concernés à la fois par la directive INSPIRE et le règlement d'exécution se rapportant aux données de forte valeur :

![Schéma de remontées d'une fiche de données HVD et INSPIRE à l'Europe](https://raw.githubusercontent.com/etalab/guides.data.gouv.fr/main/.gitbook/assets/sch%C3%A9ma%20remont%C3%A9e%20hvd.png)

Pour qu’une même fiche de données soit doublement moissonnée mais ne soit pas créée de manière dupliquée au niveau européen, il est important que **l’identifiant de la fiche de données soit stable dans le temps et correctement préservé au cours des différents moissonnages**.

Les producteurs de données doivent donc être particulièrement vigilants lors de la mise en place des différents moissonnages.

La question des identifiants fait l’objet d’[un point et d'une recommandation](https://github.com/cnigfr/metadonnee/issues/28) lors du [groupe de travail métadonnées du CNIG](https://cnig.gouv.fr/gt-metadonnees-a958.html).


