Aller au contenu

Données et datasets

Un dataset est un tableau de données que Matr connaît : un fichier que vous avez importé, une table de votre base, un export d’un outil métier. Tout ce que vous faites ensuite dans Matr (préparer, analyser, prédire) part de vos datasets.

Cette page explique où trouver vos données, comment créer un dataset, ce que contient sa fiche et comment limiter ce que chacun peut voir.

Cliquez sur Data dans la barre latérale. La page Données s’ouvre, avec quatre onglets :

Onglet Ce que vous y trouvez
Datasets Les datasets de l’organisation que vous avez le droit de lire.
Sources de données Les connecteurs : les accès à vos bases et outils. Voir Connecteurs.
Gouvernance Ce qui aide l’IA à comprendre vos données : Insights, Dimensions, Connaissance métier.
Lignage Le graphe qui montre d’où viennent vos données et où elles sont utilisées.

L’entrée Data affiche un badge quand d’autres personnes ont validé de nouveaux éléments de connaissance (« N nouveau(x) ») ou quand vos propositions attendent une décision (« N en attente »).

Page Données, onglet Datasets, avec les cartes groupées par étiquette

En haut à droite :

  • l’icône de tri : Alphabétique ou par date (le plus récent en tête) ;
  • la bascule Vue grille / Vue liste ;
  • Détection auto, pour décrire plusieurs datasets d’un coup avec l’IA (voir plus bas) ;
  • Ajouter un dataset.

Matr retient la vue et le tri choisis dans votre navigateur.

Les datasets sont regroupés par étiquette, dans des bandeaux que vous pouvez replier. Un dataset n’apparaît que sous sa première étiquette. Le dernier bandeau, Sans étiquette, regroupe les autres.

Au-dessus de la liste, vous pouvez filtrer par Tags (si votre organisation a des étiquettes) et par Dernière mise à jour (Aujourd’hui, 7 derniers jours, 30 derniers jours). Le champ de recherche porte sur le nom et la description.

Chaque carte montre le nom, la source (le connecteur, Fichier local ou Flux API), les étiquettes, le nombre de colonnes et de lignes, la date de mise à jour et l’auteur. Badges possibles :

Badge Signification
Live Le dataset est lu en direct dans la source (voir Lecture directe).
sync (icône qui tourne) L’import est en cours. La liste se met à jour toute seule.
N nouveau(x) / N en attente Des éléments de connaissance ont été ajoutés, ou attendent votre décision.

L’icône d’étiquette, sur une carte ou une ligne, ouvre le sélecteur Rechercher ou créer…. Vous pouvez choisir une étiquette existante ou en créer une. Elle n’est visible que si vous pouvez modifier le dataset et gérer les étiquettes de l’organisation.

Les étiquettes peuvent donner des droits d’accès. Si votre changement modifie qui voit le dataset, Matr vous le montre avant d’enregistrer : Changer qui peut voir ce dataset ?, avec le nombre de personnes avant et après, et les noms de ceux qui gagnent ou perdent l’accès. Cliquez Confirmer ou Annuler.

Détection auto demande à l’IA de décrire plusieurs datasets existants : contexte métier, règles de colonnes, clés, dimensions, insights, et les liens entre datasets. Elle ne crée pas de dataset.

  1. Cliquez Détection auto.
  2. Cochez les datasets à analyser (ou Tout sélectionner). Un dataset déjà décrit porte la mention « a des métadonnées ».
  3. Pour chacun, choisissez s’il faut compléter ce qui existe ou le remplacer (boutons globaux Fusionner tout / Remplacer tout).
  4. Facultatif : décrivez votre métier dans Contexte métier (optionnel), et ajoutez jusqu’à 10 documents avec Importer des documents. Ces documents servent seulement de contexte à l’IA.
  5. Cliquez Lancer l’auto-détection.
  6. Sur l’écran Revoir les suggestions, décochez ce que vous ne voulez pas garder, puis cliquez Appliquer N élément(s).

Les formats de documents acceptés dépendent de votre installation : soit PDF, DOCX, PPTX, images ou Markdown, soit Markdown, TXT ou YAML. La fenêtre indique lesquels.

Cliquez Ajouter un dataset dans l’onglet Datasets. La fenêtre Créer un dataset compte trois étapes : Source de données, Configuration, Sélection.

Chaque connecteur de l’organisation a sa carte. Deux sources existent d’office dans toutes les organisations :

  • Fichier local, pour importer un fichier depuis votre ordinateur ;
  • Flux API, pour qu’un de vos outils envoie lui-même les données à Matr (voir Flux API).

La carte Ajouter une source de données ouvre le catalogue des connecteurs. Une fois le connecteur créé, la fenêtre de création se rouvre, mais depuis le début.

Le bloc Étiquettes permet de choisir des étiquettes qui seront posées sur chaque dataset créé.

Cliquez Suivant.

  1. Choisissez le Type de fichier : CSV (par défaut), CSV compressé ou Excel.
  2. Pour un CSV, laissez Détection automatique des paramètres activé : Matr devine le séparateur, l’encodage et le caractère de citation. Désactivez-le seulement si l’import donne des colonnes mal coupées ou des accents abîmés.
  3. Déposez un ou plusieurs fichiers dans la zone, ou cliquez choisir un fichier.
  4. Cliquez Suivant.
Type Extensions Taille max Réglages
CSV .csv 500 Mo Détection automatique, ou Séparateur (défaut ,), Encodage (défaut UTF-8), Caractère de citation (défaut ")
CSV compressé .csv.gz, .gz 500 Mo Les trois réglages sont obligatoires : pas de détection automatique
Excel .xlsx, .xls 500 Mo Aucun. Pas de choix d’onglet : pour un classeur à plusieurs onglets, exportez l’onglet voulu en CSV.

Encodages proposés : UTF-8, ASCII, ISO-8859-1, Latin-1, UTF-16, UTF-32.

Chaque fichier devient un dataset. Avec 3 fichiers, vous créez 3 datasets.

Le formulaire dépend de la source. Pour la plupart des bases de données, vous choisissez le Type de source :

  • Table : cochez une ou plusieurs tables. Chaque table cochée devient un dataset. Selon la source, les tables sont rangées par schéma, par jeu de données ou par base.
  • Requête SQL : écrivez une requête SELECT. Elle crée un seul dataset.

Les connecteurs d’outils métier (HubSpot, Matomo, Google Sheets, Meta Ads, Cleyrop) ont leur propre formulaire et créent un dataset à la fois. Le détail de chaque formulaire est sur la page Connecteurs.

Pour PostgreSQL, BigQuery, Snowflake et Redshift, un interrupteur Lecture directe (live) apparaît à l’étape 2. Il n’apparaît que si l’option Autoriser les requêtes directes est activée sur le connecteur.

Dataset importé (par défaut) Dataset live
Où sont les données Copiées dans Matr Restent dans votre source
Fraîcheur Celle du dernier rafraîchissement Toujours à jour
Vitesse Rapide Plus lent, surtout sur une grosse table
Disponibilité Indépendante de la source Dépend de la source
Rafraîchissement Manuel ou planifié Inutile
Règles d’accès aux lignes et colonnes Possibles Impossibles

Laissez l’interrupteur désactivé, sauf si la table est très grosse ou si vous avez besoin de données à la minute.

L’étape Sélection liste les datasets qui vont être créés. Pour chacun, vous pouvez :

  • modifier le nom (prérempli avec le nom du fichier ou de la table) ;
  • ajouter une description ;
  • poser des étiquettes ;
  • le retirer avec Retirer de la liste.

Deux datasets de la liste ne peuvent pas porter le même nom. Pour un seul fichier CSV, un Aperçu montre les premières lignes : vérifiez que les colonnes sont bien coupées.

Refresh automatique : pour une source qui peut être relue (une base, un outil métier), ce bloc est activé par défaut, avec une fréquence Le 1er de chaque mois à 6h. Vous pouvez choisir Tous les jours à 6h ou Chaque lundi à 6h, ou le désactiver. Il n’apparaît pas pour un fichier, un Flux API ou un dataset live.

Cliquez Créer le dataset (ou Créer N datasets).

Les datasets sont créés un par un. La carte affiche sync pendant l’import, en général quelques secondes.

Si certains échouent, la fenêtre reste ouverte et montre le message d’erreur ligne par ligne. Corrigez puis cliquez Réessayer les échecs. Les datasets réussis sont déjà créés.

Si le message « Dataset créé, mais sa planification n’a pas pu être enregistrée » s’affiche, reposez la planification depuis la fiche du dataset (menu ⋮ > Planifier le refresh).

Le Flux API sert quand c’est votre outil qui envoie les données (un CRM, un script, un outil no-code), au lieu que Matr aille les chercher.

  1. Créez un dataset avec la source Flux API. Il n’y a rien à configurer : le dataset est créé vide, et ses colonnes seront celles du premier envoi.
  2. Ouvrez le dataset, onglet Flux client.
  3. Copiez l’URL du Point d’entrée.
  4. Cliquez Générer un token, donnez-lui un nom (par exemple « Export CRM nocturne »).
  5. Copiez le token tout de suite : il ne sera plus affiché. La fenêtre propose aussi une Commande prête à l’emploi.
  6. Dans Comment envoyer des données, choisissez vos réglages et copiez l’exemple en curl ou en Python. Remplacez sk-... par votre token.
Réglage Choix
Charge utile JSON : un objet, un tableau d’objets ou {"rows": [...]}. Les clés deviennent les colonnes. Vous pouvez envoyer une ligne par requête : Matr les regroupe. Fichier : un fichier entier.
Taille du fichier Petit fichier : envoi direct, jusqu’à 50 Mo. Gros fichier : envoi en trois temps, pour les fichiers plus lourds.
Mode d’écriture Ajout : les lignes s’ajoutent aux données existantes. Remplacement : tout le dataset est remplacé.

Le tableau des tokens montre pour chacun sa date de création, sa dernière utilisation, le nombre d’appels et son statut. Révoquer coupe immédiatement l’envoi pour tout système qui l’utilise.

Cliquez sur un dataset pour ouvrir sa fiche.

  • Le statut : succès si le dataset est prêt, échec de l’import en cas d’erreur.
  • Pour un dataset importé, le badge du dernier rafraîchissement (« il y a 2 heures », Jamais rafraîchi…). Un clic ouvre l’onglet Historique. Pour un dataset live, le badge Live.
  • Étiquettes et Accès (qui peut voir le dataset ; réservé à ceux qui gèrent les permissions de l’organisation).
  • Auto-détecter : l’IA complète la description du dataset (contexte, règles, insights). Elle ajoute à ce qui existe, sans rien remplacer. Vous validez ses suggestions avant qu’elles soient appliquées.
  • En cas d’erreur, Relancer la synchro.

Sous l’en-tête, quatre cartes : Colonnes, Lignes, Source (avec Voir la source) et la date de mise à jour.

En cas d’échec d’import, un bandeau rouge Échec de l’import donne l’heure et le message d’erreur. Le panneau Logs se déplie, et Copier vous permet de transmettre le détail au support.

Action Quand elle apparaît Ce qu’elle fait
Modifier Toujours Change le nom (100 caractères max) et la description.
Source des données Dataset importé depuis une base Montre la table ou la requête lue à chaque actualisation. Modifier, puis Enregistrer et actualiser : le dataset est relu avec la nouvelle source. Si cela échoue, il garde ses données actuelles.
Update Dataset importé depuis un connecteur Relit maintenant les données dans la source.
Download source data Fichier non live, sans restriction d’export Télécharge le fichier d’origine.
Rafraîchir Fichier local Remplace ou complète les données avec un nouveau fichier.
Planifier le refresh Dataset importé depuis un connecteur Relit la source automatiquement : Chaque jour, Chaque semaine, Chaque mois ou Personnalisé.
Automatisations Dataset non live Envoie le dataset par e-mail à une fréquence choisie, à chaque fois ou seulement si les données ont changé.
Supprimer Toujours Supprime le dataset. Matr prévient s’il est utilisé par des apps.

Certains libellés de ce menu s’affichent en anglais (Update, Download source data) : c’est bien ce que vous verrez à l’écran.

  1. Menu ⋮ > Rafraîchir.
  2. Choisissez le nouveau fichier.
  3. Choisissez le Mode de rafraîchissement : Remplacer (par défaut) ou Ajouter (les lignes s’ajoutent à la suite).
  4. Validez, puis rechargez la page pour voir les nouvelles données.

Les transformations sont rejouées sur les nouvelles données. Téléchargez le dataset avant, par précaution.

Onglet Visible
Couche d’intelligence des données Toujours (ouvert par défaut)
Aperçu Toujours
Accès aux lignes Si vous avez le droit de lire les règles d’accès
Flux client Datasets Flux API uniquement (voir Flux API)
Historique Toujours

Cet onglet rassemble ce que l’IA sait du dataset. Plus il est complet, meilleures sont les réponses de l’IA dans vos apps.

Historique de la connaissance ouvre la liste de tout ce qui a été ajouté, modifié ou supprimé. Les éléments proposés pendant une conversation, en attente de décision, s’y valident avec Ajouter à la mémoire ou s’écartent avec Ignorer.

Insights : des requêtes SQL enregistrées que l’IA réutilise pour répondre aux questions métier (voir Insights). Bouton Ajouter un insight.

Contexte métier : le bouton Ajouter vous demande d’abord ce que vous voulez décrire.

  • Une définition ou une convention : le sens d’un terme, d’une métrique, une règle qui traverse plusieurs tables, une façon de présenter les résultats. Elle va dans Définitions & conventions. Choisissez la Catégorie (Définition ou Convention), un Nom court (optionnel) et écrivez Le fait en une ou deux phrases.
  • Quelque chose lié à une colonne : ce que contient un champ, le sens de ses codes, un piège. Elle va dans Règles métier des colonnes.

Une règle de colonne comprend :

Champ À quoi il sert
Colonne La colonne décrite (seules celles sans règle sont proposées).
Description Ce que représente la colonne pour le métier.
Avertissements Les pièges ou limites que l’IA doit connaître.
Expression La formule SQL, si la colonne est calculée.
Sens des valeurs Ce que veut dire chaque code (ex. 1 → « client actif »). Cliquez les valeurs présentes dans la colonne pour les ajouter.

Clés & relations :

  • Identifiant unique : la colonne qui identifie une ligne (un numéro client, par exemple).
  • Liens vers d’autres datasets : Ajouter un lien déclare qu’une colonne correspond à une colonne d’un autre dataset (Colonne source, Dataset cible, Colonne cible). Matr mesure la correspondance sur 50 000 lignes et prévient si la jointure risque de dupliquer des lignes.
  • Dimensions : les informations partagées avec d’autres datasets. Elles se gèrent dans Gouvernance (voir Dimensions).

Couche d’intelligence des données : Insights, Contexte métier et Clés & relations

L’Aperçu affiche les données, 50 lignes par page (ou 25, 100). Sous chaque en-tête, un petit profil résume la colonne : histogramme, frise de dates, barres de catégories.

  • Ajouter un filtre : choisissez une Colonne, un Opérateur (Égal à, Contient, Dans la liste, Est vide…) et une Valeur. Les dates ont des raccourcis et une Plage personnalisée.
  • Mise en forme du tableau : nom affiché, décimales, format de date, préfixe ou suffixe, règles de style, tri par défaut, colonnes masquées. Ces réglages valent partout où les colonnes apparaissent ; chaque tableau peut ensuite les modifier.
  • Télécharger les données : export CSV des données filtrées et triées. Le bouton n’apparaît pas si le dataset est soumis à une restriction d’export.

Changer le type d’une colonne : cliquez sur l’en-tête de la colonne. Le panneau de détails s’ouvre. Dans Type, choisissez Numérique, Catégoriel, Texte, Date ou Identifiant. Le type compte : un code postal lu comme un nombre serait additionné au lieu d’être compté.

Le même panneau permet d’écrire une Description, de régler le Format de valeur, et montre les Statistiques (min, moyenne, max, valeurs uniques, valeurs manquantes, complétude), la Distribution des valeurs et la Corrélation.

Les profils de colonnes ne s’affichent pas pour un dataset live, ni pour une personne dont l’accès aux lignes est restreint.

Aperçu d’un dataset avec le panneau de détails d’une colonne ouvert

L’onglet Historique liste chaque actualisation : état (succès, en cours, erreur), utilisateur, date, durée et taille. Il est en lecture seule : pour relancer un import, utilisez le menu ⋮.

Par défaut, toute personne qui a accès à un dataset en voit toutes les lignes et toutes les colonnes. L’onglet Accès aux lignes permet d’aller plus loin : chaque vendeur ne voit que sa région, le salaire est caché à la plupart, etc.

Il faut le droit de lire les règles d’accès pour voir l’onglet, et le droit de les gérer pour les modifier. Qui peut ouvrir le dataset se règle, lui, avec le bouton Accès de l’en-tête et dans Permissions et accès aux données.

  1. Cliquez Marquer une colonne et choisissez la colonne qui décide des lignes visibles (ex. region). Elle devient un attribut de sécurité.
  2. Cliquez Modifier.
  3. Pour chaque utilisateur, choisissez les valeurs qu’il peut voir : une valeur de la liste, Saisir une autre valeur…, ou toutes les valeurs.
  4. Cliquez Enregistrer, vérifiez le récapitulatif, puis Appliquer les règles.

La vue Par utilisateur / Par attribut et la case Restreints seulement aident à relire les règles.

Aperçu tel que le voit (icône œil) montre les lignes exactement comme un utilisateur les verra. Faites-le après chaque changement. Historique liste les modifications passées, par auteur.

Onglet Accès aux lignes avec un attribut de sécurité et le tableau des valeurs par utilisateur

Si vous avez déclaré un lien entre deux datasets (dans Clés & relations), les règles d’un dataset peuvent s’appliquer à l’autre. L’onglet l’indique : « Les lignes de ce dataset sont restreintes par les règles de X, via la colonne Y ». Ces règles héritées se modifient sur le dataset d’origine. La fenêtre de confirmation liste les datasets liés concernés.

Un lien utilisé par une règle d’accès ne peut pas être supprimé.

Le sous-onglet Jetons liste les liens publics et jetons d’intégration qui lisent ce dataset, avec leur périmètre et leur dernière utilisation. Leur périmètre se règle depuis le dashboard qui les a créés (voir Report).

Dans le bloc Accès aux colonnes :

  1. Cliquez Déclarer une colonne pour la rendre sensible.
  2. Pour chaque utilisateur ou jeton, choisissez Visible ou Masquée.
  3. Enregistrez.

Une colonne Masquée est absente de l’aperçu, des exports et des requêtes. Anonymisée (valeur remplacée) n’est proposée que là où une règle de masquage existe déjà.

Si un dataset est soumis à une restriction d’export, le bouton Télécharger les données de l’Aperçu disparaît, comme le téléchargement du fichier source.

Un dataset live ne peut pas avoir de règles d’accès aux lignes ni aux colonnes : ses lectures directes dans la source ne sont pas filtrées. L’onglet passe en lecture seule. Si vous devez restreindre l’accès, importez la table au lieu de la lire en direct.

L’onglet Gouvernance de la page Données regroupe ce qui aide l’IA à comprendre vos données à l’échelle de l’organisation.

Un insight est une requête SQL enregistrée, avec un nom et des exemples de questions. Quand quelqu’un pose une question proche, l’IA réutilise cette requête au lieu d’en inventer une. Ce n’est pas une observation générée par l’IA.

  1. Cliquez Ajouter un insight.
  2. Remplissez Nom de l’insight (ex. « Revenu mensuel »), la Requête SQL et cochez les Datasets concernés.
  3. Facultatif : Description, Unité, et des Exemples de questions (« combien de transactions par mois ? »).
  4. Dans Avancé, vous pouvez choisir l’Affichage, une Mesure, des Filtres et des Paramètres (variables comme :date_start).
  5. Cliquez Créer.

Le contenu d’un insight est visible de tous les utilisateurs des datasets liés, quelles que soient leurs règles d’accès.

Une dimension dit qu’une même information existe dans plusieurs datasets : la ville, le magasin, le mois. Un filtre de dashboard posé sur une dimension filtre tous ces datasets d’un coup.

  1. Cliquez Ajouter une dimension.
  2. Donnez un Nom (ex. « Ville »).
  3. Dans Colonne dans chaque dataset, choisissez la colonne correspondante pour au moins deux datasets.
  4. Cliquez Vérifier que les valeurs correspondent : les valeurs doivent être écrites de la même façon partout, il n’y a pas de table de correspondance.
  5. Cliquez Enregistrer.

Modifier ou supprimer une dimension touche les dashboards qui filtrent dessus. Matr indique combien sont concernés avant de valider.

Ici, vous importez des documents sur votre entreprise : activité, vocabulaire, règles, conventions. Les agents IA s’en servent comme contexte pour tous les datasets.

  1. Cliquez Importer des documents (il faut le droit de modifier les datasets de l’organisation).
  2. Déposez un ou plusieurs fichiers.
Formats Markdown, TXT, YAML. Selon votre installation, aussi PDF, DOCX, PPTX et images (texte extrait automatiquement). L’écran indique ce qui est accepté.
Taille 50 000 caractères max par document
Total utilisé par l’IA 40 000 caractères : au-delà, le reste est ignoré

Un document dont aucun texte ne peut être extrait est refusé. Vous pouvez ensuite modifier le titre et le texte d’un document, ou le supprimer : il ne sera plus fourni à l’IA.

Gouvernance, Connaissance métier avec un document importé et le bouton Importer des documents

L’onglet Lignage montre le chemin de vos données. Il a deux vues.

Flux : un graphe qui va des connecteurs aux datasets, puis aux modèles et aux analyses. Le panneau Filtres permet de :

  • choisir les types d’objets affichés ;
  • afficher les Descriptions ;
  • utiliser les Filtres rapides : Production (seulement les modèles en production et ce qui les alimente), Usage (colorer les datasets selon leur usage), Orphelins (seulement les datasets que rien n’utilise) ;
  • faire un Focus sur une ressource : une app, un dataset ou un connecteur, et toute sa chaîne.

Relations : un bloc par dataset avec ses colonnes, et les liens déclarés entre datasets (clés marquées « PK » et « FK »). Les datasets sans lien sont rangés dans Sans relation. Une mention signale les datasets dont l’accès aux lignes est restreint, directement ou via un lien.

Lignage en vue Flux avec le panneau Filtres ouvert