Comment reconnaître les contenus générés par l’IA — et pourquoi aucun détecteur ne suffit à lui seul
C2PA, métadonnées, filigranes, classificateurs ML : un aperçu honnête des méthodes de détection des images et textes générés par l’IA — y compris leurs faiblesses.
« Cette image a-t-elle été créée par une IA ? » — la question semble simple, mais elle ne l’est pas. Il n’existe aucune méthode qui permette d’y répondre de façon fiable pour tout contenu. En revanche, plusieurs approches indépendantes existent, chacune avec ses propres atouts. Les connaître, c’est comprendre pourquoi une vérification sérieuse repose toujours sur plusieurs niveaux.
1. Preuves cryptographiques d’origine (C2PA)
La forme de preuve la plus solide ne provient pas de l’analyse de l’image, mais de l’image elle-même. La norme C2PA — soutenue notamment par Adobe, Microsoft, Google, OpenAI et plusieurs fabricants d’appareils photo — intègre une indication d’origine signée cryptographiquement directement dans le fichier. Celle-ci précise quel outil a généré ou modifié le contenu.
L’avantage majeur : il ne s’agit pas d’une probabilité, mais d’une information vérifiable. L’inconvénient : les métadonnées ne survivent pas à toutes les transformations. Si une image est recompressée, traitée par un CMS ou partagée sur les réseaux sociaux, la signature disparaît souvent. L’absence de credentials ne prouve donc pas une origine humaine — elle signifie simplement qu’aucune information n’est disponible.
Un bénéfice souvent sous-estimé
Les preuves d’origine fonctionnent dans les deux sens. Une photo signée par un appareil Leica, Sony, Nikon ou Canon atteste qu’une image a bien été prise. Dans un monde où le doute grandit, cela a souvent plus de valeur que de prouver le contraire.
2. Métadonnées et traces intégrées
En dehors de C2PA, il existe des sources plus simples mais étonnamment riches. La norme IPTC prévoit un champ pour le « type de source numérique », qui peut indiquer explicitement qu’un fichier a été généré par un algorithme — c’est précisément ce marqueur qui est référencé dans le code de conduite européen sur l’étiquetage. Les champs EXIF et XMP révèlent souvent l’outil utilisé. Et pour les fichiers PNG issus de générateurs d’images populaires, l’invite complète ainsi que les paramètres figurent dans l’en-tête du fichier — une découverte qui ne laisse place à aucune interprétation.
3. Filigranes invisibles
Certains fournisseurs intègrent un motif invisible à l’œil nu directement dans les pixels. L’avantage par rapport aux métadonnées : il résiste à la compression et au recadrage. L’inconvénient : ces filigranes ne peuvent généralement être lus que par celui qui les a créés. En pratique, cela signifie qu’il faut compter sur la coopération des fournisseurs.
4. Classificateurs statistiques
Si toutes les traces ont disparu, il reste l’analyse du contenu lui-même. Les classificateurs modernes atteignent de très bons taux de réussite sur les images, et identifient souvent même le modèle utilisé. Pour les textes, la situation est plus délicate : les bons détecteurs sont souvent justes, mais chacun d’eux produit des erreurs — dans les deux sens. Des textes humains soigneusement rédigés peuvent être faussement classés comme générés par une machine, tandis que des textes IA retravaillés peuvent passer inaperçus.
Un détecteur fournit une probabilité, pas une vérité. Prendre cela pour une affirmation, c’est confondre la statistique avec la preuve.
Pourquoi les couches ne suffisent pas à elles seules
En combinant ces méthodes, le résultat devient nettement plus fiable : une preuve cryptographique l’emporte sur toute estimation, une invite intégrée constitue une preuve matérielle, et un classificateur permet de traiter les cas où toutes les traces ont été supprimées. Malgré tout, une part d’incertitude subsiste — et ce n’est pas une faiblesse technique, mais une caractéristique intrinsèque du problème.
C’est pourquoi, chez Provifai, nous faisons délibérément les choses autrement : notre analyse fournit les éléments de preuve, mais la décision finale revient à l’exploitant. Pour chaque résultat, il voit quelle méthode a détecté quelque chose et avec quel degré de certitude — puis il confirme ou infirme. Cela évite la pire conséquence d’une détection automatique : qu’une personne soit injustement accusée d’un contenu qu’elle a elle-même photographié.
Règle pratique
Considérez les résultats de détection comme des indices, non comme des jugements. Examinez en priorité les cas avec des preuves solides — métadonnées, signatures, invites intégrées — et décidez consciemment pour le reste.
Audit gratuit
Que se cache-t-il réellement sur votre site web ?
Saisissez un domaine, patientez moins d'une minute — découvrez quels contenus portent des traces de génération par IA. Aucune inscription requise.
Lire la suite
Art. 50 EU AI Act : Qui doit signaler les contenus générés par l’IA — et ce que cela implique concrètement
Le guide pratique sur l’obligation de signalement : contenus concernés, rôle de l’exploitant et les idées reçues les plus fréquentes.
EU AI Act : La checklist en 10 points pour votre site web
De l’inventaire à la surveillance : les dix questions auxquelles chaque responsable de site web doit pouvoir répondre dès maintenant.
Images générés par IA : ce qui est obligatoire, ce qui est judicieux — et comment le faire proprement
La réponse honnête à la question la plus fréquente — et trois règles de présentation pour un marquage discret et professionnel.
Deepfakes sur votre site web : pourquoi la responsabilité incombe à l’exploitant — et non au créateur
Le levier le plus puissant de la loi ne vise pas les fournisseurs d’IA, mais vous — et les deepfakes apparaissent plus vite qu’on ne le pense.
C2PA, métadonnées, filigranes : comment fonctionne réellement l’identification machine des contenus générés par l’IA
Un regard dans le fichier plutôt que sur l’image : les standards qui rendent la provenance vérifiable — explications accessibles.
Photos de stock et IA : Pourquoi presque chaque site web contient de l’IA non signalée
Vous n’avez jamais utilisé l’IA consciemment ? Votre site web, probablement si — par des voies auxquelles personne ne pense.