mardi 1 décembre 2015

Une étoile est née : construire des cartes thématiques en points étoilés


Jean Jacques Jesua (La Poste) est une "star" des sciences de la cartographie et plus généralement de la "dataviz". Il nous fait l'amitié de nous livrer ici une méthode insolite et originale pour représenter de façon claire des informations attributaires binaires sur une base de points localisés. Voici le brillant topo qu'il propose :


Les systèmes d’information géographique offrent à ses utilisateurs de nombreuses possibilités d’analyses thématiques. Selon la nature de la variable que l’on souhaite visualiser et selon la nature de l’objet cartographique à thématiser on utilise le plus souvent un dégradé de couleurs (carte choroplèthe), des valeurs individuelles, des symboles proportionnels, la densité de points ou encore des histogrammes/camemberts…

1/ Le problème et son principe de résolution

J’ai été confronté à un problème de représentation qu’aucune des méthodes courantes ne représente de façon satisfaisante i.e. lisible. Je souhaitais visualiser pour un ensemble de bureaux de Poste (objets points), une série de caractéristiques de ces bureaux, en l’occurrence les équipements disponibles pour le public (Automates postaux et bancaire, présence d’un conseiller financier, …). Le fichier de départ est donc une matrice avec en ligne les bureaux et en colonne les équipements :



L’idée est donc de cartographier simultanément l’ensemble des équipements pour tous les bureaux de Poste. L’utilisateur pourra ainsi localiser les bureaux qui possèdent tous les équipements ou ceux qui sont partiellement équipés : 1 et 4, …
On pourrait imaginer faire une carte par équipement ce qui reviendrait à comparer les cartes entre-elles. Mais l’objectif est la simultanéité dans une seule carte interactive. L’interactivité permet à l’utilisateur de zoomer où il le souhaite et de choisir les équipements qu’il souhaite étudier.
On pourrait également déterminer toutes les combinaisons existantes et représenter le résultat en valeur individuelles. Mais plus le nombre d’équipements est grand, plus le nombre de combinaisons est important rendant la carte illisible (4 équipement = 16 combinaisons !).


Pour répondre à ces objectifs de simultanéité et de lisibilité, je propose de faire une carte en étoile. Chaque bureau est représenté par une étoile avec autant de branches qu’il possède d’équipement.







Voici ce que cela donne sur le 17ème arrondissement de Paris. Dans cet exemple, il existe 6  équipements. Un bureau possède les 6 équipements, deux bureaux en ont 4 et deux autres en ont 2 seulement.

Stars postales à la place de l'Etoile (Paris)
NB : Les données sont fictives aléatoires.
Cliquez pour accéder à la carte interactive des points étoilés


2/ Détermination des branches

Chaque branche symbolise donc un équipement. Positionnée sur un cercle, elle est déterminée par un centre (coordonnées du bureau), par la longueur d’un rayon et par un angle. Toutes les branches ayant la même orientation (et la même couleur) indiqueront tous les bureaux ayant cet équipement.

Le problème revient donc à calculer les coordonnées des sommets de chacune des branches.
Pour rendre le problème générique, adoptons les notations suivantes :
·        R = rayon en mètres, je propose 200 mètres pour le cas des bureaux de Poste mais à adapter selon le nombre de points à représenter.
·        K = nombre d’équipements maximum.
·        Ѳ = 360 / K  l’angle qui nous permet de découper le cercle en K équipements. Pour K=6, on aura  Ѳ =60°  comme dans la carte en exemple.

La position des bureaux est exprimée par une longitude (x0) et une latitude (y0)  en projection WGS84 (EPSG 4326).


Nos manuels de trigonométrie indiquent que les coordonnées d’un point sur le cercle sont données par :
 x1 = x0  +  R * cos(Ѳ)
.y1 = y0  +  R * sin(Ѳ)
.


Il est donc facile de déterminer les coordonnées des sommets des branches. Malheureusement (ou heureusement) la terre n’est pas plate. L’utilisation des coordonnées polaires entraîne des distorsions locales : le cercle est déformé. On pourrait penser convertir les coordonnées en Lambert 93 pour calculer x1 et y1 (x1=x0+R) mais ce travail est fastidieux et la projection Lambert ne s’applique pas dans les DOM où La Poste possède plus de 200 bureaux. Il est possible que la projection métrique « Projection du Monde » WGS84 EPSG 3857 permette de résoudre le problème plus simplement, le lecteur courageux pourra essayer...

Je préfère cependant utiliser des coordonnées sphériques. La question se résume à : comment calculer le rayon R fixe (de 200 mètres dans notre exemple) que l’on soit à Lille, Marseille, Fort de France ou Mamoudzou (Mayotte) ?
Pour la latitude, c’est très simple puisque les méridiens passent par les pôles. La circonférence de la terre étant de 40000 km, 1 degré représente donc  40000/360 = 111,111 km.
R mètres vaut donc R * 0,001 / 111,111 degrés.  200 mètres = 0,0018°

Pour la longitude, 1° dépend de la circonférence de la terre à cette latitude.
La formule pour calculer la circonférence d’une latitude L est :
2 * pi * cos(L) * 6378 (Rayon de la terre)
La circonférence de l’équateur est donc : 2 * pi * cos(0) * 6378 = 40074 km
La circonférence du 45° parallèle Nord est donc : 2 * pi * cos(45) * 6378 = 28336 km

Nous pouvons ainsi déterminer la valeur de 1°de longitude pour une latitude L
Comme 360°   vaut 2 * pi * cos(L) * 6378 km, 1° vaut donc   2*pi * cos(L) *17,71  km
Ainsi à Lille (latitude de 50,6°), 1° de longitude représente 70,6 km alors qu’à Nice (latitude de 43,7°),  1° de longitude représente 80,4 km

Nous calculerons  R mètres comme  R / (17710 * 2* pi * cos(L) ) degrés.

En résumé, les coordonnées des branches sont données par les 2 formules suivantes :
x1 = x0  + (R / (17710 * 2*pi * cos(y1)))* cos(Ѳ)
y1 = y0  + (R * 0,001 / 111,111) * sin(Ѳ)

Pour le programme informatique, il faut calculer d’abord y1 puis x1 (qui dépend de y1) et convertir les angles en radians (Ѳ°   est égal à   Ѳ * pi / 180)

Voici le code SAS pour calculer les coordonnées des sommets des branches (x1,y1). Pour cet exemple, nous avons 6 équipements que l’on place tous les 60° (360/6).
%LET K = 6  ;  *** Nb d’équipements  ;
%LET RAYON = 200 ; *** Rayon en mètres ;
%let PI = 3.14159 ;

*** La boucle suivante crée les K points sur le cercle ;
Teta = (360 / &K) * (&PI / 180);
Do k = 1 to &K;
y1 = y0 + &RAYON * (0.001/111.111) * SIN(TETA * (k-1));
x1 = x0 + &RAYON * 1 /(2*&PI.*COS(y1*&PI/180)*17710)*COS(TETA * (k-1)  );
Output ;





3/ Représentation cartographique des branches : les points étoilés

Ainsi pour chaque bureau, j’ai déterminé les coordonnées des différents équipements. Il reste donc à tracer les lignes partant du centre (bureau) vers les sommets (équipements).
Avec MapInfo et plus particulièrement l’outil SPIDERGRAPH (que l’on trouve dans le menu Outils / Gestionnaires d’outils), cela donne :


Deux fichiers sont nécessaires pour créer les lignes : les bureaux et les équipements. L’identifiant du bureau figure dans le fichier des équipements.


Il ne reste plus qu’à faire l’analyse thématique des lignes par valeurs individuelles en colorant chacune des branches :


Une dernière remarque pour clôturer : il faut veiller à bien calibrer le rayon en fonction de la densité de points et d’équipements et du niveau de zoom de la représentation.








mercredi 25 novembre 2015

5 questions sur le "big data"

Dans le cadre d'une table ronde sur le sujet, très original!, du big data, la journaliste Martine Fuxa (Editialis) m'a posé 5 questions et voici mon point de vu de praticien.


Q1) On parle de la data comme de l'or du 21e siècle... Comment créer de la valeur autour de la data? 

Oui, on dit beaucoup de choses autour des données, on lit par exemple que le job de « data scientist » est le plus « sexy » des vingt prochaines années. Il faut relativiser ces slogans d’autopromotion d’une discipline. Les activités économiques et sociales ont toujours généré des besoins de collecte, traitement et interprétation des données. Et ceci depuis l’antiquité, pour compter les récoltes, les transactions. Le domaine s’est industrialisé avec le comptage des hommes : les naissances et les décès au 18e et 19e siècle (la démographie), puis l’informatique a industrialisé les processus de collecte en amont et de traitements en aval et permis le croisement de data au 20e. Désormais les nombreux capteurs génèrent des traces (logs). La collecte de données non structurées multiplie le spectre d’exploitation des données. Je note pour ma paroisse que la localisation désormais systématique des données d’activité contribue grandement aux nouvelles valeurs ajoutées que l’on trouve dans les données.

Dans les activités business, nous créons de la valeur en traçant la demande, les comportements des clients et en essayant d’anticiper leurs demandes futures. La VPC avait parfaitement compris le truc dans les années 70 en mettant au point sa politique de fidélisation, en suivant la Récence, Fréquence et Montant des achats de ses clients (RFM). Le e-commerce prend le relais aujourd’hui avec des données et des champs d’application plus diversifiés, mais le RFM qui reste souvent le corps des segmentations. On peut adapter l’offre à la demande via des moteurs de recommandation et/ou encore les modèles de maillage géomarketing.

Dans l’espace public, il y a aussi de multiples opportunités, si l’on dépasse les préventions du type big data = big brother : la ville et la santé connectées, l’adaptation de l’offre et la demande d’emploi, la prévention de la criminologie/sécurité publique, sécurité routière, l’efficacité de l’action publique.

La recette pour créer de la valeur repose selon moi sur deux points :
1/ Bien comprendre les mécanismes de production des sources, d’où viennent les données, comment elles ont été construites, détecter les biais ou les redondances entre les sources.
2/ Avoir une vision claire du problème qu’il faut résoudre, avec une longue expérience du domaine métier et ajustements permanents des modèles autour des facteurs clé d’une activité.

Je vous donne ma vision qui est traditionnelle. Autres méthodes déterministes sans a priori métier, le « machine Learning », permettent des modélisations à la volée, ajustables, en fonction de l’arrivée des données peu structurées.


Q2) Les datas liées au géomarketing ouvrent le champ de nombreuses opportunités de ciblage... toujours plus fines et précises... qu'est-ce que cela vous inspire?

Oui, le but principal du géomarketing est d’adapter la demande et l’offre locale, mailler au mieux un territoire en se concentrant sur toutes les activités de distribution pilotées par des relations de «proximité».

Nous sommes un prestataire spécialiste du sujet et nous consacrons beaucoup d’énergie à fiabiliser la géolocalisation des sources de l’offre et la demande locale (précision des géo-référentiels). Côté demande, nous imaginons comment mesurer au plus précis sans collecte/enquêtes coûteuses les flux de population de passage, les flux de population au travail dites « de jour », les résidents, les flux routiers origine/destination, les flux de fréquentation touristique. Nous calculons les populations de chaque immeuble, ainsi que leur profil socio-démographique. Nous caractérisons, via des scores par exemple, les immeubles « de luxe » ou ceux qui sont situés sur les hots spots de passage commercial, on localise les maisons avec piscine, etc. Ces données externes de précision, croisées avec des données internes d’entreprise, permettent d’identifier les lieux de gisement de prospection de fidélisation, de risque… On caractérise et on individualise pour chacun de nos clients, des cibles de demande réelle et potentielle à une maille micro/nano géographique. Nous faisons aussi du prédictif avec anticipation des variations locales et des migrations de population, on s’efforce de suivre tous les projets d’aménagements, mouvements d’emplois/entreprises, on suit de très près les variations des revenus et du pouvoir d’achat associé.

Côté offre, nous référençons tous les référentiels de distribution. Nous faisons du "grabbing" sur le web pour enrichir/préciser les données points de vente, nous suivons toutes les nouvelles ouvertures dans les réseaux d’agences, de grandes surfaces, etc.

Nous bénéficions pour tous ces travaux de l'accélérateur du mouvement d’open data. Nous travaillons sur des services spécifiques de données. Nous ne pouvons donc pas nous inscrire totalement dans ce mouvement, car toute peine mérite rétribution. En revanche, le prix des données basiques en géomarketing a fortement baissé. Avec un peu de débrouillardise, on peut aujourd'hui commencer avec une solution géomarketing avec des données libres.


Q3) Comment faire pour développer son business grâce au Big Data? Des exemples? 

La Poste adapte son offre et ses formats de bureau en fonction des données de trafic à proximité. Cela peut correspondre à une extension d’horaires le soir ou le samedi. La Poste vend des timbres spéciaux aux touristes de passage devant ses bureaux, via une segmentation basée sur la localisation des photos déposés par les touristes sur le net : s’il y a beaucoup de photos géo localisées à proximité d’un bureau, alors il bénéficie d’un afflux de clientèle spécifique. La tablette Facteo qui va permettre aux 100 000 facteurs de France de se reconvertir en vendeurs de services avec des informations précises sur les points de tournées : information à collecter, produits à fournir, livraison du pain, de médicaments, constats de sinistres, diagnostics énergétiques, contact et soin des personnes âgées, etc.

Avec les traces de logs routières qui remontent des GPS, la RATP réalise des comparaisons de temps de trajet routiers vs temps de transport aux jours et heures de pointe. C’est très utile pour justifier d’un prolongement de ligne, d’une augmentation de la fréquence de passage des rames ou tout simplement d’éviter des coûts d’enquêtes spécifiques sur les déplacements.

Je voudrais aussi citer un exemple d’action publique qui ne relève pas du géomarketing, mais qui utilise toutes les données et outils d’ajustement de l’offre et de la demande locale. En Angleterre, pour les autorités de police locale, nous avons développé une application « crime profiler » (logiciel predPol d’un concurrent américain). On rentre toutes les statistiques de population, passages, flux, croisées avec les statistiques historiques localisées par les services de police sur les lieux de délits. L’input, ce sont vraiment des datas localisées et de la stat. On utilise ces stats pour construire des tournées avec impact de visibilité maximal pour les agents. On réorganise ainsi les tournées/patrouilles traditionnelles des agents de police. Juste en faisant ce travail d’optimisation des tournées des patrouilles, on constate une baisse des infractions entre 10 et 20%.


Q4) Comment la data permet de répondre aux nouveaux enjeux que sont la gestion du risque (changements climatiques/inondations, fraudes, compliance, fragmentation de l’offre, Google, uberisation…). Pouvez-vous partager avec nous quelques réalisations concrètes? 

Pour les inondations, les modèles de simulation sont désormais basés sur des exploitations de données de précision Lidar dans les zones à risque. Dans le domaine de l’hydrologie, il existe des technologies qui permettent de suivre en temps réel la hauteur et le débit des rivières. Bien sûr, cela n’empêche pas les inondations, mais c’est très utile pour la prévention et le choix des investissements de protection des zones inondables.

Dans le domaine de l’assurance, en MRH, on peut croiser l’adresse de l’assuré et toutes ses données internes avec l’ensemble des zones de risques.
En auto, il y a aussi par exemple l’enjeu des nouveaux capteurs « boites noires » dans les voitures pour responsabiliser les conducteurs en tarifant leur prime selon la qualité de la conduite, le nombre de km parcourus et la localisation des trajets (route, autoroute, zone principale de circulation) (Pay as you drive). En Angleterre, un de nos très bons clients est très avancé sur ces sujets, en France les premières offres apparaissent.


Q5) Comment ne pas se perdre dans la gestion de la multitude de datas disponibles ? A qui incombe idéalement la responsabilité et le data management dans l'organigramme d'une entreprise ?

C’est vrai qu’on peut se laisser distraire et engloutir par la déferlante de données. Il faut savoir passer du big au « small et smart » data, c’est-à-dire à une donnée lisible au service de la stratégie de l’organisation. Le travail peut être celui de recherche d’une aiguille dans une botte de foin, mais c’est surtout un travail de gestion des 4V : Volume Variété Vélocité Véracité. Pour ma part, je considère que la véracité/robustesse des données est essentielle. C’est-à-dire « ne pas se tromper de mesure » et s’assurer que les corrélations mesurées sont reproductibles. Quand on s’occupe des datas dans une organisation, on a en général une idée des indicateurs clefs à suivre.

Si je suis par exemple responsable du géomarketing dans un établissement financier, sur les données externes, je vais me concentrer sur la localisation des populations, des revenus et des concurrents. Or, toutes les mesures locales de population revenus concurrence sont entachées d’erreurs ou imprécisions qui, à la marge, peuvent coûter cher. On cherche donc dans le big data les sources ou les proxys qui permettent d’affiner les indicateurs sur leur maille géographique ou sur leur contenu : bien mesurer la population au pâté de maison en infra-quartier, ne pas se tromper sur le géocodage d’un concurrent, bien identifier la population patrimoniale (« riche ») avec les indicateurs de revenu/patrimoine disponibles…
  

Pour le profil, je note que le CIO/DSI a un peu moins le vent en poupe que par le passé. On parle bien du ou de la responsable data : sur LinkedIn, cela donne « Chief Data Officer » ou « Chief Digital Officer ». Il navigue entre l’informatique et le marketing. 1/Il faut qu’il connaisse le métier, qu’il soit issu du business, qu’il connaisse parfaitement les produits/services de son organisation et les processus de stockage de l’information. 2/Une double casquette profil IT & profil Statistique est rare, mais très utile, il connait les infrastructures IT (Hadoop, nosql...), les outils d’intégration, de chargement d’alimentation, d’exploitation traitement modélisation et enfin la dataViz pour l’aspect communication (je range les SIG dans ces 2 dernières catégories). Donc a priori, c’est plutôt un sénior. Mais 3/ C’est pas mal aussi qu’il soit « jeune » (digital native), car mieux familiarisé avec la collecte et les problématiques Web. 4/ et cerise sur le gâteau, c’est bien s’il n’est pas très bien rasé ou barbu (geek), mais dire cela, je vous l’accorde, c’est sexiste. Il faut qu’il ou elle soit concerné et curieux de toutes les nouvelles applications et capteurs qui génèrent des traces, des données.



mardi 13 octobre 2015

Construire des hostspots à partir de points localisés

Un hotspot (point chaud en français) désigne en cartographie une zone de concentration d’un phénomène social, économique, biologique ou physique.

En géomarketing, on s’intéresse par exemple aux hotspots de population : blocs d’immeubles ou quartier d’habitat très dense et vertical. On identifie aussi les hotspots de richesse (zones de concentration de hauts revenus résidentiels) ou encore les hotspots d’attraction commerciale : limite de zones commerciales drainant des flux liés à une forte densité de points de vente, etc.

Techniquement une carte de hotspots est une couche de polygones : chacun délimite les frontières d’un hotspot et les polygones ont un attribut qui hiérarchise l’importance de la zone au regard du phénomène étudié. Lors de la restitution, il est souhaitable de coupler une couche de hotspots avec une couche carte de chaleur (heatmap), calculée sur la même base.

Après beaucoup d’errances sur ce sujet, je pense que j’ai validé une méthode empirique acceptable pour la mise au point d’une carte de hotspots à partir de fichier de points localisés. Si les points sont correctement placés, la méthode dessine des contours de concentrations réels qui s’affranchissent des zonages administratifs. Elle fonctionne aussi très bien sur les bases de points volumineuses. Ce tutoriel en quatre temps est destiné aux praticiens des données géo localisées familiers des systèmes d’information géographique.


1/ Le fichier de points : la localisation des photos du site Panoramio

Considérons l’exemple de l’identification des zones à forte fréquentation touristique en France métropolitaine. Notre beau pays regorge de zones d’intérêt touristique et il n’existe pas de recensement, carte exhaustive de ces zones. Je vous propose de la créer.

Pour cela, je dispose d’un fichier de plus de deux millions de points : chaque point correspond aux coordonnées géographiques d’une prise de vue photographique publiée sur Google Map (via Panoramio). Les photos sont prises par de nombreux contributeurs touristes et Panoramio fait un contrôle pour valider que la photo est pertinente pour décrire un lieu. Les photos sont prises avec des appareils obligatoirement équipés d’un système GPS. La localisation chargée sur Google/Panoramio est donc très précise (< 5 mètres). Une API de Google/Panoramio permet d’extraire les coordonnées géographiques de chaque photo sur tout ou partie de la planète. Le fichier que j’exploite couvre la France métropolitaine et toutes ses zones frontalières. Merci aux données massives (« bigdata ») : nous disposons ainsi d’une source libre de grande qualité pour établir une carte des hotspots de fréquentation touristique.



La localisation à Paris des photos chargées sous Panoramio, reflet brut des zones touristiques
Chaque point bleu = coordonnée GPS d’une photographie

Je surligne à la main en rouge les hotspots bien connus. On distingue au Sud-Ouest le château de Versailles, la zone de La Défense (la Grande Arche attire des travailleurs et aussi beaucoup de touristes), Montmartre, la Tour Eiffel, les Champs-Elysées, tout le centre de Paris et la Seine avec le trajet des bateaux Mouches. Au Nord, la Cité des Sciences et plus à l’Est, le cimetière du Père-Lachaise, qui accueille plus de 3 millions de visiteurs par an, soit le cimetière le plus visité au monde. En zoomant un peu plus sur ce cimetière, on trouve des concentrations inédites de photos sur la tombe de Jim Morrison.

La localisation des photos prises au cimetière du Père-Lachaise (Paris 20°)



Cette source est donc vraiment précise pour bien situer les lieux de fréquentation. Le parisien peut surligner à la main les hotspots, mais on conviendra que c’est arbitraire et fastidieux à généraliser sur un grand territoire !


2/ « rastérisation » des points avec une carte de chaleur

Passons donc à notre deuxième point, la génération d’une carte de chaleur à partir des points photos. Il s’agit d’une grille raster carroyée pour laquelle on attribue à chaque pixel (carreau) une valeur de mesure correspondant à la densité de points photos dans et autour du carreau. Pour une photo donnée de valeur 1, nous distribuons cette valeur sur tous les carreaux avoisinants dans la limite d’un rayon fixé et à raison inverse quartique de la distance du point au carreau. Ce calcul est fait pour les 2 millions de points et il faut utiliser une bonne technologie. QGIS (version 2.10) fait très bien le travail. Ce logiciel est libre et il possède de très riches et bons algorithmes pour générer des cartes de chaleurs et traiter les couches rasters. Voici le lien de téléchargement de QGIS.

Après chargement de notre couche vectorielle de 2 millions de points photos, générons une grille de chaleur raster (menu QGIS Raster + Carte de chaleur) : fixons d’abord un rayon de calcul de 200 m (un rayon trop étroit fait planter le soft). QGIS propose alors par défaut une grille à carreaux trop macro ; il faut re-calibrer la dimension de la grille. Si le système de projection est métrique, le redimensionnement est fait en mètres. Mes données sont en projection long/lat EPSG 4326, je dimensionne mes carreaux en degré. Ici je demande la création d’une grille raster format GeoTIFF de 10 551*16 880 carreaux, soient près de 180 millions de pixels avec un écartement de 0.001 degré de longitude et de latitude (soient en France des carreaux de 80m de large et 160m de haut).


Le choix du rayon et de la taille des carreaux dépend du problème que l’on traite. Il faut choisir un rayon court pour des mesures avec impact fort de proximité ou si les frontières de hotspots sont très tranchées. Si le nombre et la densité de points est faible ou si l’on veut une vision macro de la mesure, il faut élargir le rayon et la taille des carreaux de la grille. La taille du rayon doit aussi être compatible, supérieure aux côtés du carreau de la grille.

Notez que vous pouvez intégrer des paramètres complémentaires pour la définition de la carte de chaleur : pondération des points par un indice d’attractivité ou de taille, ou encore variation du rayon de calcul selon la nature de vos points.

QGIS mouline seulement quelques minutes pour ce calcul. Par défaut, le style de la grille résultat s’affiche en noir et blanc



En allant dans les propriétés de la couche, je définis un style d’affichage plus explicite pour cette couche raster. Il y a quelques paramètres à changer : choisir un rendu avec pseudo-couleur, choisir sa palette, puis recalculer les valeurs réelles minimum et maximum de la grille, n’oubliez pas ensuite de classer en mode continu les tranches de la palette de couleur, puis ajuster le nombre de classes et manuellement les tranches. Ici, je ne voulais pas que des photos trop isolées apparaissent dans le rendu de ma carte de chaleur, j’ai donc relevé le minimum de la valeur affichable de la grille.



On obtient une couche de chaleur et l’on vérifie qu’elle cale bien avec la densité de points :





3/ Création de courbes de niveaux à partir de la grille raster

Attention : le rayon de 200 m est bien calé pour le rendu visuel de l’attraction. En revanche, il est trop court pour le calcul des hotspots. En effet, l’identification des courbes de niveaux s’appuie sur la grille et ne fonctionne pas dans ses trous. Une courbe de niveau relie les carreaux de même mesure. Si la grille est trop resserrée autour des points photos, une courbe de plus bas niveau risque de ne pas se refermer sur elle-même du fait de carreaux manquants. Pour cette raison, j’ai généré une deuxième grille similaire hormis le rayon que j’ai étendu à 500 mètres. Cette grille très (trop) lissée est exploitable uniquement pour la définition des courbes de niveau.



Pour calculer les courbes de niveaux sur QGIS, rendez-vous sur le panel Raster+Extraction+Création de contours. Il faut préciser le nom de la grille raster en entrée, le nom du répertoire d’accueil du fichier vectoriel des contours en sortie, la variable attribut (ici TourismS) qui accueille le seuil de définition de chaque courbe de niveau.

Par défaut, QGIS propose la création d’une série de courbes de niveaux basées sur la mesure de la grille par pas de 10 entre les valeurs minimum et maximum de la grille. Notre grille de photo a une très forte variabilité de mesure. Ce n’est pas adapté. L’outil pré-génère une commande Gdal (outil libre de commandes SIG très puissant que QGIS exploite abondamment). Rentrons en édition sur cette commande et modifions le paramètre de définition des intervalles « –i 10.0 » en le remplaçant par une définition d’intervalles fixes « -fl 10 50 200 500 1000 ». J’ai un peu tâtonné en regardant la distribution de la mesure de la grille pour fixer ces seuils de 5 courbes de niveau de fréquentation touristique. Je souhaitais définir 5 seuils « d’étoilage » des niveaux de fréquentation et respecter la variance de la fréquentation. J’ai appliqué une recette bien parisienne ; j’ai calé mes seuils sur la région parisienne avec ses hotspots touristiques très importants et j’ai vérifié que cela collait bien pour le reste du pays. D’autres démarches sont certainement plus convaincantes…


J’ai donc demandé à QGIS de lancer la commande :
gdal_contour -a TourismS -fl 10 50 200 500 1000 10.0 "E:/0. PAUL RECUP/1. data/PhotosPanoramio/FR_HotSpot_Photos.tif" "E:/0. PAUL RECUP/0. PaulTemporaire/1. Dev/Tourisme/Fréquentation/FR_HotSpot_Contours"

J’obtiens 5 courbes de niveau et je leur applique un style catégorisé.


4/ « Polygonisation » des courbes de niveaux

Nous y sommes presque. Les courbes de niveaux qui délimitent les hotspots sont des objets lignes. Or, les requêtes cartographiques les plus courantes (inclusion, proximité…) fonctionnent avec des polygones. Avec QGIS, on « polygonise » donc la couche vecteurs de lignes de niveaux en allant sur Vecteur + Outil de géométrie + Lignes vers polygones. A l’affichage, la couche stylée et polygonisée est la même que celle des contours lignes, mais chaque Hotspot est désormais un objet polygone. Notons qu’un polygone de niveau inférieur englobe la surface de tous les polygones hotspots de niveaux plus élevés.



En fin de course, une série de traitement de vérifications et de nettoyage des géométries des polygones hotspots peut être nécessaire. Paris, par exemple est enserrée d’un très large hotspot de bas niveau (mesure = 10) qui couvre quasiment toute la ville. Il est vrai que la ville de Paris est une grande promenade touristique. Mais on peut aussi considérer des seuils relatifs plus élevés pour la définition des hotspots urbains et supprimer les hotspots de bas niveau qui couvrent un territoire trop vaste. A chacun de valider la bonne cohérence de sa nouvelle couche.


Voilà, c’est fait. Nous avons nos hotspots de fréquentation touristique avec une grille conjointe de compréhension de la géographie de l’intensité de la mesure. Il ne reste plus qu’à publier cela sur le net, mais c’est une autre histoire (pas forcément toujours simple) et que je ne vais pas développer ici.
Je vous remercie de m’avoir suivi jusqu’ici, j’espère que vous êtes équipé pour adapter cette méthode empirique à votre jeu de données points. Bonne session « hotspots ».

dimanche 27 septembre 2015

Télécharger les contours des zones touristiques internationales (en format SIG)

La loi Macron (août 2015) autorise l'ouverture des magasins le dimanche à Paris sur une dizaine de zones à très forte fréquentation commerciale et touristique.

Lien vers la carte interactive des ZTI (source OSM)

Open Street Map a édité ces zones et je les communique ici en téléchargement avec différents formats : KML, GeoJson, MapInfo et Shape.

La terminologie "zones touristiques internationales" est "politique". La carte ne correspond pas exactement à une notion de fréquentation touristique : l'île de la Cité (Notre Dame) et la tour Eiffel sont oubliées...

Il y a de multiples façons d'approcher les flux touristiques et j'espère revenir préciser ce sujet passionant lors d'un prochain post.