Série Citations IA · N° 3

Votre propre site peut-il être cité par l'IA ?

Oui, environ un tiers du temps. Nous avons cherché à démontrer une « pénalité d'auto-publication », mais les données ont refusé de confirmer cette hypothèse. Nous avons donc testé quatre théories sur ce qui distingue les pages appartenant à la marque qui sont citées de celles provenant de tiers. Trois de ces théories n'étaient que du bruit statistique. Ce rapport les inclut tout de même.

39 pages les plus citées · 12 auto-publiées contre 27 tierces · Test exact de Fisher, bilatéral · Juillet 2026 · Perplexity uniquement — voir note sur le périmètre

31 %
des pages les plus citées appartiennent à la marque
12 sur 39 — votre site a une place bien à lui
1 sur 4
théories ayant survécu aux tests de significativité
les trois autres sont également publiés
p=0,004
celui qui a survécu : les blocs FAQ et les tableaux
75 % contre 22 %
Le périmètre, avant toute chose. Chaque chiffre ici provient de Perplexity, n=39. ChatGPT et Gemini ne fournissant aucune URL de citation, il est impossible d'analyser leurs sources. De plus, un échantillon de n=12 contre n=27 reste limité ; nous avons effectué des tests de significativité précisément parce qu'estimer des pourcentages à cette échelle est le meilleur moyen de se tromper soi-même.
Constat 01

Votre propre site est cité environ un tiers du temps

31%

Sur 39 pages les plus citées, 12 étaient auto-publiées — la page d'une marque, se classant pour une question qui intéresse commercialement cette marque. 27 étaient des sites tiers : listes, annuaires, sites d'avis, articles comparatifs.

Le scénario pessimiste — « l'IA ne vous citera pas, seulement les listes qui vous devancent » — est donc faux. Elle vous cite environ un tiers du temps. Ce qui est intéressant, c'est ce qui différencie ces pages.

Résultat 02 · le seul qui a survécu

La structure a fait la différence. Rien d'autre.

Nous avons testé quatre hypothèses. Voici tous les résultats, y compris les échecs :

TraitAuto-publiéTiersp (Fisher)
Blocs FAQ ou tableaux de données75 %22 %0,004significatif
Contient des données originales42 %26 %0,455bruit
Format liste ou « best-of »75 %78 %1,000bruit
A un auteur nommé42 %44 %1,000bruit
Pages contenant des blocs FAQ ou des tableaux de données
le seul trait distinguant les pages de marque citées des pages tierces citées
Auto-publié (n=12)
75 %
Tiers (n=27)
22 %
0 %50 %100 %

Un seul trait dépasse le seuil corrigé : le contenu structuré. Les pages appartenant à des marques qui sont citées ont trois fois plus de chances de contenir un bloc FAQ ou un tableau de données que les pages tierces citées.

Nous considérons que le mécanisme est purement technique et mécanique. Un bloc FAQ présente une question suivie directement de sa réponse. Un tableau regroupe des faits associés à des libellés. Les deux sont facilement extractibles. Un moteur de recherche en quête d'informations citables les trouvera plus rapidement dans un tableau que dans un paragraphe. Les articles de listes tiers n'ont pas besoin de cette aide, car leur format même leur assure le succès. Votre page, elle, en a manifestement besoin.

La structure n'est pas un simple élément décoratif. C'est ainsi que le moteur de recherche identifie la citation.

La mise en garde honnête. n=12. Il s'agit d'un signal fort pour un échantillon restreint. Nous avons effectué quatre comparaisons, le seuil corrigé de Bonferroni est donc p < 0,0125 et non 0,05 — ce qui valide le résultat, bien que nous ne miserions pas l'avenir de l'entreprise sur le multiplicateur exact. Nous misons en revanche sur la tendance.
Résultat 03 · la section que nous aurions supprimée si nous étions là pour vendre

Trois théories que nous avons dû écarter

Les données originales n'ont pas fait la différence. 42 % contre 26 % ressemble à un écart. Avec n=12 contre n=27, on obtient p = 0,455, ce qui se situe confortablement dans la marge d'erreur d'un tirage à pile ou face. Ailleurs dans nos recherches, les données originales constituent un avantage réel. Sur cette question et avec cette taille d'échantillon, nous ne pouvons pas l'affirmer, donc nous ne l'affirmons pas.

Le format n'a pas fait la différence. 75 % contre 78 % pour les listicles. p = 1,000. Les pages citées sont majoritairement des listicles, quel que soit l'éditeur. Être un article de type « best-of » est le minimum requis, pas un avantage concurrentiel.

La signature de l'auteur n'a pas fait la différence. 42 % contre 44 %. p = 1,000. Une grande partie des conseils en SEO repose sur les signaux liés à l'auteur ou à l'E-E-A-T. Dans ces données, la présence d'un auteur nommé ne permet pas de distinguer une page de marque citée d'une page tierce citée. Ce n'est pas la preuve que cela n'a pas d'importance, c'est la preuve que nous n'avons pas mesuré son impact.

Et la longueur a joué en sens inverse. Les pages appartenant aux marques citées comptaient une médiane de 3 158 mots, contre 3 901 pour les pages tierces. Si la longueur était le levier principal, les pages publiées par les marques seraient plus longues, et non plus courtes.

Résultat 04 · la découverte la moins défendable

La catégorie compte peut-être plus que tout ce que vous faites

Fréquence à laquelle la page d'une marque est la source la plus citée
par catégorie · 13 questions chacune · Perplexity uniquement
Agences de webdesign
46%
SaaS B2B
38%
E-commerce / DTC
8%
0%50%100%

Le site d'une agence a été cité près d'une fois sur deux. Le site d'une marque e-commerce a été cité une seule fois sur treize questions. Si cette tendance se confirme à plus grande échelle, cela vaut bien plus que toutes les tactiques on-page réunies dans ce rapport.

Mais nous devons être honnêtes avec vous : la différence entre agence et e-commerce est de p = 0,073. Ce n'est pas statistiquement significatif sur la base de 13 questions par catégorie. C'est le point le plus intéressant de cet ensemble de données et le meilleur argument pour mener une étude à plus grande échelle. C'est ce que nous sommes en train de faire.

Que faire à ce sujet

Quatre points réellement étayés par ces données

01

Structurez vos pages

Les blocs FAQ et les tableaux de données sont les seuls éléments qui distinguent significativement les pages de marque citées des pages tierces citées. Et ils ne coûtent rien.

02

N'investissez pas trop dans les signatures d'auteurs sur la base de ces preuves

Ils ont peut-être leur importance. Ils n'ont pas été mesurés comme tels ici, et nous n'allons pas prétendre le contraire.

03

Connaissez le plafond de votre catégorie

Si vous vendez en DTC, votre propre blog a atteint 8 % dans cet échantillon — le placement sur des sites tiers est probablement une stratégie plus efficace. Si vous êtes une agence, votre propre site est une réelle opportunité.

04

N'ajoutez pas de mots

Les pages de marque citées étaient plus courtes que les pages tierces citées. La longueur n'est pas le levier.

Les données

Tous les chiffres, au même endroit

MétriquePortéeValeur
Pages les plus citées analyséesPerplexity, 39 questions39
AutopubliéPerplexity, 39 questions12 / 39 = 31 %
TiersPerplexity, 39 questions27 / 39 = 69 %
FAQ/tableaux — autopublién=129 = 75 %
FAQ/tableaux — tiersn=276 = 22 %
FAQ/tableaux — significativitéTest de Fisher, bilatéralp = 0,004
Données originales — autopublication vs tiersn=12 / n=2742 % vs 26 % · p = 0,455
Article de type liste — autopublication vs tiersn=12 / n=2775 % vs 78 % · p = 1,000
Auteur nommé — autopublié vs tiersn=12 / n=2742 % vs 44 % · p = 1,000
Nombre médian de mots — autopublién=123 158
Nombre médian de mots — tiersn=273 901
Taux d'autopublication — agencesn=136 = 46 %
Taux d'autopublication — SaaS B2Bn=135 = 38 %
Taux d'autopublication — e-commercen=131 = 8 %
Agences vs e-commerceTest de Fisher, bilatéralp = 0,073
Des limites, clairement. Un seul moteur (Perplexity) — le seul qui affiche ses sources. n=39 pages, réparties en 12 / 27. Un résultat dépasse le seuil corrigé ; les autres sont signalés comme des échecs intentionnels. 13 questions par catégorie, c'est pourquoi la découverte la plus intéressante est celle que nous pouvons le moins défendre. Coder, c'est juger — « contient des données originales » et « auto-publié » ont été codés selon des règles, mais des cas limites existent. Le jeu de données est fourni avec ce rapport afin que vous puissiez contester nos choix spécifiques plutôt que de manière générale. Un instantané, juillet 2026. Et verify-numbers.py recalcule chaque chiffre ci-dessus directement à partir des fichiers CSV.
L'auteur

Écrit par Hesham Mashhour

Fondateur, HarperFlow

À propos de Hesham

Diplômé de l'Université de Cambridge et médecin, il est devenu créateur de contenu : sa chaîne YouTube, NeuroEverything, compte plus de 40 000 abonnés et vulgarise les neurosciences. Il s'est ensuite orienté vers l'ingénierie de l'automatisation, concevant des pipelines de contenu pour les fondateurs et créateurs qui préfèrent bâtir plutôt que promouvoir. Il a lancé HarperFlow avec une conviction : les idées brillantes méritent d'être vues, et ceux qui excellent dans la création manquent souvent de temps pour les faire connaître. Il écrit depuis le terrain : HarperFlow teste ses propres pipelines sur son propre blog avant tout.

Les questions auxquelles ce rapport répond

Des réponses rapides, issues directement des données

Le site web d'une marque peut-il être cité par l'IA ?

Oui — 12 des 39 pages les plus citées (31 %) étaient la propre page de la marque, et non un article de type « liste » tiers (Perplexity, juillet 2026).

Qu'est-ce qui rend une page de marque citables ?

La structure. Les pages de marque citées contenaient des blocs FAQ ou des tableaux de données dans 75 % des cas, contre 22 % pour les pages tierces citées — p=0,004, le seul trait significatif parmi les quatre que nous avons testés.

La signature d'un auteur ou le nombre de mots aident-ils une page à être citée ?

Pas de manière mesurable ici. Auteurs nommés : 42 % contre 44 % (p=1,000). Et les pages de marque citées étaient plus courtes que les pages tierces — médiane de 3 158 contre 3 901 mots — la longueur n'est donc pas le facteur déterminant.

Votre propre site est-il cité ?

La même méthode, appliquée à votre domaine. Nous poserons aux moteurs de recherche les questions de vos acheteurs et nous vous montrerons si vos pages — ou celles de vos concurrents — apparaissent en réponse.

Structurer le contenu de cette manière — blocs FAQ, tableaux, réponses claires — est exactement ce que fait le pipeline de publication de HarperFlow pour chaque article.

Lancer l'audit gratuit →