Sécurité des données IA : quelles données confier, où, et à qui
Utiliser l’IA, c’est transmettre des données à des outils. Ce guide explique comment classer vos données, quelles questions poser aux fournisseurs, comment gérer les accès et ce que demande le RGPD, en termes généraux.
Par Enzo Airault, fondateur de Pecora · Mis à jour le
Quelles données peut-on confier à une IA ?
Tout dépend de la nature de la donnée et de l’outil qui la reçoit. La première étape consiste à classer vos informations. Quatre catégories suffisent pour commencer :
- Publiques : site internet, brochures, communiqués. Peu de contraintes de confidentialité, même si des questions de droits d’auteur peuvent subsister.
- Internes : procédures, consignes, informations produit non publiées. Utilisables en interne, pas nécessairement partageables avec n’importe quel fournisseur.
- Confidentielles : prix négociés, contrats, propositions commerciales, stratégie. Accès strict et usages précis.
- Personnelles : noms, coordonnées, historiques, échanges avec des clients ou des salariés. Le RGPD s’applique directement.
Pour chaque source que vous envisagez de connecter, décidez si son usage par l’IA est autorisé, pour quels usages, et qui en est propriétaire. Certaines données, comme les dossiers du personnel ou les informations de santé, sont souvent à exclure d’un premier projet, ou demandent une analyse spécifique avant tout usage.
Une précaution simple : ne pas brancher toute la documentation « pour voir ». Un catalogue des sources, même court, évite qu’un assistant donne accès à des documents que personne n’avait prévu de partager. Pour chaque source, il indique un propriétaire, une classification, les usages autorisés et une fréquence de mise à jour.
Où sont traitées les données envoyées à une IA ?
Quand vous utilisez un service d’IA, vos données peuvent passer par plusieurs endroits : le fournisseur du modèle, la plateforme d’automatisation, l’outil qui stocke l’index de recherche, les journaux techniques de chacun. Chacun est un lieu où une copie peut exister, parfois plus longtemps que prévu. Avant de choisir un outil, il faut suivre le chemin exact des données, de leur source jusqu’à la suppression.
Les questions à poser à chaque fournisseur :
- Quelles données sont transmises : textes, fichiers, réponses, représentations numériques, métadonnées ?
- Combien de temps sont-elles conservées, et dans quels journaux ?
- Servent-elles à entraîner ou à améliorer les modèles, par défaut ou sur option ?
- Où sont-elles traitées et stockées ?
- Quels sous-traitants interviennent, et êtes-vous informé en cas de changement ?
- Quelles protections existent : chiffrement, authentification forte, gestion des rôles, journaux d’accès ?
- Comment les supprimer, et que deviennent les sauvegardes ?
- Y a-t-il des transferts hors de l’Union européenne, et sur quelle base ?
Les réponses varient d’un fournisseur à l’autre, et parfois d’une fonction à l’autre chez un même fournisseur. Elles évoluent aussi dans le temps. Il n’existe pas de fournisseur sûr dans l’absolu, seulement des conditions à vérifier pour un usage donné, à consigner par écrit et à revoir régulièrement.
Principe
Aucun système n’est sûr à 100 %. L’enjeu est de savoir ce qui est contrôlé, ce qui reste un risque et comment il est surveillé.
Qui doit avoir accès aux données dans un projet IA ?
Un outil d’IA ne doit jamais élargir les droits existants. Si une personne n’a pas accès à un dossier, l’assistant ne doit pas lui en restituer le contenu. Les droits doivent être appliqués avant que les documents ne soient transmis au modèle, et suivre les changements : départ, changement de service, document supprimé ou reclassé.
Transformer un document en représentation numérique pour un index de recherche ne le rend pas anonyme. L’index garde le niveau de confidentialité des documents d’origine, et doit suivre les mêmes règles de protection et de suppression.
Les accès des prestataires suivent la même logique :
- des comptes nominatifs, jamais partagés ;
- des droits limités au strict nécessaire pour la mission ;
- une double authentification lorsque l’outil la propose ;
- aucun mot de passe personnel demandé, notamment celui du dirigeant ;
- des accès retirés à la fin de la mission.
Chez Pecora, les outils de production sont souscrits au nom du client et payés directement par lui : il en garde la maîtrise, y compris le jour où la mission s’arrête.
Que dit le RGPD sur l’utilisation de l’IA ?
Le RGPD ne traite pas l’IA comme un sujet à part : il s’applique dès qu’un traitement porte sur des données personnelles, avec ou sans IA. Plusieurs de ses principes pèsent directement sur un projet d’IA :
- une finalité définie : on sait pourquoi les données sont utilisées, et on ne les réutilise pas pour autre chose sans base juridique ;
- la minimisation : on ne transmet que les données nécessaires à cette finalité ;
- une durée de conservation définie, y compris pour les copies, les index et les journaux ;
- la protection des données dès la conception et par défaut ;
- un contrat encadrant chaque sous-traitant, ainsi que les éventuels transferts hors de l’Union européenne ;
- une analyse d’impact lorsque le traitement présente un risque élevé pour les personnes.
Dans la plupart des projets, l’entreprise qui décide de l’usage des données est responsable du traitement ; le prestataire qui les traite pour son compte est généralement sous-traitant, ce qui doit être vérifié au cas par cas. Le règlement européen sur l’intelligence artificielle ajoute, selon les usages, des obligations propres. La CNIL publie des recommandations utiles sur ces sujets.
Un prestataire peut documenter les flux, les outils et les mesures techniques. Il ne remplace ni votre délégué à la protection des données, ni votre conseil juridique, qui gardent leur rôle. Ce guide donne des repères généraux, pas un avis juridique.
Faut-il anonymiser les données avant de les confier à une IA ?
Quand c’est possible, retirer les données personnelles qui ne servent pas à la tâche est une bonne pratique : un résumé de réclamation n’a pas besoin du numéro de téléphone du client. Il faut cependant distinguer deux opérations. Remplacer un nom par un identifiant, c’est pseudonymiser : la personne reste identifiable par recoupement, et la donnée reste une donnée personnelle au sens du RGPD. Anonymiser, c’est rendre l’identification impossible, ce qui est beaucoup plus difficile à obtenir, en particulier sur des textes libres. Dans les deux cas, la réduction des données transmises limite les conséquences d’un incident.
Quelles bonnes pratiques adopter dès le premier projet IA ?
La plupart des risques se réduisent par des décisions simples, prises avant de connecter quoi que ce soit :
- commencer par un périmètre limité, avec des données internes peu sensibles ;
- tenir un catalogue des sources : propriétaire, classification, usage autorisé, date de mise à jour ;
- vérifier les conditions de chaque fournisseur avant de lui transmettre quoi que ce soit, et les consigner ;
- souscrire les outils au nom de l’entreprise, pas au nom d’un salarié ou d’un prestataire ;
- filtrer les droits avant l’envoi au modèle, et répercuter les suppressions sur les index ;
- tracer sans tout conserver : garder qui a lancé quoi, avec quelles sources et qui a validé, plutôt que des contenus sensibles en clair dans les journaux ;
- prévoir l’incident : qui est prévenu, comment le traitement est arrêté, comment les traces sont préservées ;
- former les équipes aux usages autorisés, en particulier face aux outils d’IA grand public utilisés à titre personnel.
Que faire en cas d’incident de données avec une IA ?
Un incident peut prendre plusieurs formes : un document transmis à un outil non prévu, un assistant qui restitue une information à la mauvaise personne, un accès resté ouvert après une mission. La réaction se prépare avant : arrêter le traitement concerné si nécessaire, préserver les traces, prévenir sans attendre la personne responsable, puis communiquer les faits connus et les mesures prises. Selon la nature de l’incident, des obligations de notification peuvent s’appliquer ; votre délégué à la protection des données ou votre conseil juridique les évalue.
Comment Pecora traite-t-elle vos données ?
Avant toute mission, Pecora vous présente les outils utilisés, les données qui leur sont transmises et leurs conditions d’hébergement. Vos données restent dans vos comptes. Les copies de travail sont restituées puis supprimées sous 30 jours après la fin de la prestation. En cas de problème sérieux, le traitement concerné est arrêté, les traces sont préservées et votre référent est prévenu sans attendre la résolution. Nous ne promettons pas un hébergement systématique en France : le choix dépend de vos contraintes.