Comment nous mesurons
Une seule règle, appliquée à chaque agence, y compris la nôtre. L'essentiel est mesuré — des axes que n'importe quel auditeur externe peut rejouer à partir des requêtes et des dates que nous publions. Le reste est éditorial — notre jugement, signalé comme jugement, jamais déguisé en mesure. Chaque agence référencée a un droit de réponse.
Le filtre — qui entre dans le segment
Une agence n'est référencée que si les quatre conditions sont remplies. Le filtre trie par catégorie, pas par niveau : un acteur solide qui sert véritablement les petites entreprises se classe là où il le mérite, au-dessus de nous quand il est meilleur.
- PME prioritaire — sert les particuliers / les petites entreprises comme segment principal, et non l'entreprise grand compte exclusivement avec les PME comme simple mention.
- Offre en self-service — propose une offre en libre-service transparente qu'un acheteur peut acheter lui-même — un prix publié ou un forfait fixe, sans « contactez le service commercial » obligatoire.
- Substance GEO — désigne le GEO / la visibilité IA comme un véritable service (cite les moteurs de réponse, le travail de citation, les données structurées, mesure les réponses IA) — un SEO générique réétiqueté est référencé mais signalé.
- Entreprise active — est une entreprise en activité et joignable — site réel, contact réel.
Pourquoi ces axes
Chaque axe ici franchit trois filtres — avec une exception déclarée, nommée ci-dessous.
- Un acheteur conviendrait qu'il compte. Sans savoir qui y obtient de bons scores, un acheteur de petite entreprise en tiendrait-il compte pour choisir une agence ? Un axe que nous seuls franchissons est écarté.
- Il ne récompense pas seulement l'ancienneté. Un axe qui reflète surtout depuis combien de temps un domaine existe reconstruit l'annuaire habituel, où le plus ancien nom l'emporte — c'est pourquoi les axes portés par l'ancienneté sortent de la règle, avec une exception honnête : la visibilité IA propre (M1). Elle dépend en partie de l'ancienneté, et nous la gardons uniquement parce qu'une agence qui vend de la visibilité IA sans en avoir elle-même est un signal réel — et nous lui donnons le poids le plus léger (9%) précisément à cause de ce facteur de confusion.
- N'importe qui peut le vérifier. Un axe mesuré peut être reproduit par quelqu'un de l'extérieur ; un axe éditorial est signalé comme notre opinion.
Les sept axes
Chaque axe ci-dessous franchit ces trois filtres. Voici ce que chacun récompense, combien il pèse et pourquoi.
| Axe | Ce qu'il récompense | Poids |
|---|---|---|
| M1 · Visibilité IA propre | l'agence est elle-même trouvable, et décrite correctement, dans les réponses IA | 9% |
| M2 · Transparence de la méthode | publie comment elle travaille et ce qu'elle mesure, pas une boîte noire | 16% |
| M3 · Vérifiabilité des preuves | des preuves nommées, précises et vérifiables plutôt qu'un battage anonyme | 23% |
| M4 · Transparence des prix | prix / fourchette publiés, pas « demandez un devis » | 12% |
| M5 · Lisibilité pour l'IA | le site est explorable et lisible par les machines — non bloqué aux IA, rendu côté serveur, avec un balisage Schema.org, un sitemap et un llms.txt | 10% |
| E1 · Adéquation au segment | réellement conçu pour l'acheteur particulier / petite entreprise | 12% |
| E2 · Propreté des promesses | pas de poudre aux yeux — pas de classements garantis, pas de tromperie | 18% |
M1 · Visibilité IA propre · 9% — L'agence apparaît-elle elle-même, et décrite correctement, dans les réponses IA ? Une boutique qui vend de la visibilité IA et y est invisible est un vrai signal. Nous lui donnons le poids le plus léger car la visibilité brute tient largement à l'ancienneté du domaine, non à la qualité de l'agence — une vieille agence moyenne devance une nouvelle excellente rien que par l'âge. Comme signal « qui devrais-je engager », il est faible, il reste donc léger.
M2 · Transparence de la méthode · 16% — L'agence publie-t-elle comment elle travaille et, surtout, ce qu'elle mesure ? La mesure est la partie porteuse : un vrai spécialiste peut nommer comment il suit la visibilité dans les réponses IA — part de citations, tests sur des jeux de requêtes, suivi des mentions. « Nous augmentons votre trafic et vos classements » est une réponse SEO à une question GEO, et obtient ici un score bas.
M3 · Vérifiabilité des preuves · 23% — La preuve est-elle nommée, précise et vérifiable par un lien — un vrai client, une affirmation bornée, un cas que l'on peut ouvrir — plutôt qu'un battage anonyme « 5× de trafic » ? Nous notons si la preuve est vérifiable, non si un résultat privé est vrai ; ce résultat est derrière le mur du client, et prétendre le confirmer serait exactement la malhonnêteté que nous refusons. C'est l'axe le plus lourd car il est le plus prédictif pour l'acheteur et le plus difficile à truquer, et il protège le nouveau venu honnête avec deux vrais cas face à l'acteur installé aux cinquante vantardises anonymes.
M4 · Transparence des prix · 12% — Y a-t-il un prix ou une fourchette publiés, ou seulement « demandez un devis » ? Les acheteurs de petite entreprise ont besoin de connaître le coût d'emblée, c'est pourquoi cet axe figure sur la règle pour ce segment. Il se situe au milieu : un vrai prix est une information nécessaire, mais un prix peut tout de même masquer un service faible, c'est donc un axe d'adéquation et d'hygiène, pas de qualité.
M5 · Lisibilité pour l'IA · 10% — Le site de l'agence est-il réellement lisible par les machines — ouvert aux robots d'IA, rendu côté serveur, avec un balisage Schema, un sitemap et un llms.txt ? C'est la moitié de M1 indépendante de l'ancienneté : être cité (M1) dépend en partie de votre ancienneté, mais rendre votre propre site lisible par les machines est entièrement de votre ressort dès le premier jour. C'est entièrement reproductible — un auditeur peut récupérer le site et vérifier — et une agence opaque aux IA sur son propre terrain échoue dans son propre métier.
E1 · Adéquation au segment · 12% — L'agence est-elle vraiment conçue pour un acheteur particulier ou de petite entreprise — libre-service, périmètre proportionné — ou une opération grand compte avec une ligne PME symbolique ? C'est un jugement sur les cas limites, nous le signalons donc comme une opinion et envoyons les entrées douteuses à une revue humaine.
E2 · Propreté des promesses · 18% — Les promesses sont-elles prudentes et honnêtes, ou de la poudre aux yeux — classements garantis, faux avis, « nous manipulons l'IA » ? C'est de loin la première façon dont un acheteur se fait avoir dans cette catégorie, et c'est pourquoi c'est l'axe éditorial le plus lourd.
Comment chaque note est ancrée (1–5)
Chaque axe est noté de 1 à 5 selon les ancrages fixes ci-dessous, de sorte qu'un auditeur externe partant de la même preuve aboutisse au même nombre.
M1 · Visibilité IA propre — 5 apparaît dans la réponse de catégorie sur la plupart des moteurs + rappel de marque exact · 4 apparaît sur ≥1 moteur, rappel de marque globalement juste · 3 absent des réponses de catégorie mais rappel de marque à peu près juste · 2 rappel de marque mince/partiel · 1 invisible.
M2 · Transparence de la méthode — 5 méthode étape par étape + une métrique de visibilité IA nommée + un livrable d'exemple · 4 un vrai « comment nous travaillons », mesure nommée mais légère · 3 processus en termes marketing, seulement des métriques SEO · 2 « stratégies éprouvées » vagues · 1 boîte noire.
M3 · Vérifiabilité des preuves — 5 clients nommés + affirmations bornées + artefacts consultables, un échantillon se vérifie · 4 cas nommés, preuve consultable limitée · 3 quelques détails, surtout anonymes · 2 affirmations vagues, sans noms · 1 battage invérifiable / une affirmation échantillonnée échoue.
M4 · Transparence des prix — 5 grille de prix publiée complète · 4 « à partir de $X » ou paliers clairs · 3 fourchettes publiées · 2 qualitatif seulement · 1 « demandez un devis ».
M5 · Lisibilité pour l'IA — 5 SSR + ouvert aux robots d'IA + Schema + sitemap + llms.txt · 4 idem sans llms.txt · 3 explorable mais balisage mince · 2 majoritairement rendu côté client · 1 bloque les robots d'IA / JS uniquement.
E1 · Adéquation au segment — (éditorial) 5 clairement en libre-service PME · 4 majoritairement PME · 3 mixte · 2 majoritairement haut de gamme · 1 entreprise, PME symbolique.
E2 · Propreté des promesses — (éditorial ; plafond drapeau rouge) 5 prudent, explicite sur l'absence de garanties · 4 confiant mais raisonnable · 3 légère esbroufe · 2 surenchère proche de la poudre aux yeux · 1 DRAPEAU ROUGE (classements garantis, faux avis, « nous manipulons l'IA ») → plafonne le verdict.
Comment la pondération tient
Les axes mesurés (M1–M5) représentent 70 % du score ; le jugement éditorial (E1–E2) les 30 % restants. Le noyau reproductible mène par conception, si bien que l'essentiel du classement est quelque chose qu'un tiers peut rejouer. Le jugement est réel — on ne peut pas réduire « est-ce de la poudre aux yeux ? » à un balayage de mots-clés — mais il reste minoritaire, de sorte qu'une opinion ne peut jamais à elle seule faire basculer un verdict.
Il existe un test simple pour savoir si une règle est truquée : un axe pèse-t-il lourd seulement parce que son auteur y obtient de bons scores ? Appliquez-le à nous. Notre propre visibilité IA (M1) est faible aujourd'hui — domaine jeune, déréférencé de Google mi-2026 — et M1 est notre axe le plus léger. Les axes sur lesquels nous sommes forts pèsent lourd, mais chacun pèse lourd pour une raison qu'un acheteur donnerait avant même de voir notre score. Le seul axe sur lequel nous perdons aujourd'hui, nous l'avons abaissé par principe. C'est vérifiable, et c'est tout l'enjeu.
Les pondérations sont des a priori de départ, publiées comme telles, et évolueront à mesure que nous calibrons contre de vraies exécutions. Un axe où tout le monde obtient le même score n'apporte aucune information et perd du poids automatiquement.
À quel point le composite est précis. Le composite est une moyenne pondérée des sept scores d'axe. Quand un auditeur externe re-note les axes de façon indépendante, l'arithmétique se reproduit exactement, chaque axe concorde à un point près, et le composite tombe à environ ±0.3 près. Donc la dernière décimale n'est pas une vraie distinction : nous traitons deux fiches situées à moins de ~0.3 l'une de l'autre comme effectivement à égalité, et le profil par axes — pas le nombre composite — est le signal. Lisez les axes.
Le plafond des drapeaux rouges
Une affirmation disqualifiante — classements ou placements garantis, faux avis proposés, 'nous manipulons l'IA' — plafonne le verdict global quelle que soit la qualité du reste du site. Garantir un résultat que l'on ne contrôle pas ne peut être compensé par du vernis, et ce dont l'acheteur a le plus besoin, c'est qu'on l'éloigne du prestataire assez sûr de lui pour le promettre.
La pénalité de focalisation — un spécialiste qui fait tout n'en est pas un
C'est un registre pour une spécialité. Les vrais spécialistes du GEO restent peu nombreux, et une agence qui vend tout — ou une boutique SEO qui a ajouté « IA » à son menu — porte généralement la visibilité IA comme une ligne parmi d'autres, sans méthode ni cas qui lui soient propres. Là où le GEO n'est pas mené comme un service distinct (sa propre offre, sa propre page) et où le site ne nomme aucune façon de mesurer la visibilité dans les réponses IA, nous appliquons une pénalité de focalisation et la signalons : −0.5 pour un combiné de services généraux, −0.2 pour un hybride à dominante SEO, aucune pour un spécialiste focalisé. Un site mince et invérifiable est déjà traité par l'axe de preuve (M3) ; la pénalité de focalisation ne porte que le fait distinct que la spécialité n'est pas vraiment pratiquée. Comme être généraliste est une forte probabilité — non une certitude — de GEO faible, c'est une pénalité avec droit de réponse, non une disqualification automatique.
- Combiné généraliste — SEO + production de sites + tout en bloc : −0.5
- Hybride à dominante SEO — SEO d'abord, mais avec un vrai travail de GEO nommé : −0.2
- Spécialiste focalisé GEO / visibilité IA : pas de pénalité
C'est un modificateur de focalisation, pas un changement des poids des axes — la règle ci-dessus est inchangée. La classification est observable à partir de l'offre de l'agence et appliquée uniformément ; UserSignals est un spécialiste focalisé et ne porte aucune pénalité, selon la même règle.
Reproductible par conception
Les axes mesurés portent l'extrait de preuve et la source dont ils proviennent ; une donnée manquante est consignée comme un « non trouvé » explicite, jamais un chiffre deviné. Chaque score est daté d'un « données au », et le jeu de sondes (ChatGPT + Claude, ancrés sur la recherche, session vierge) est figé afin que tout auditeur externe puisse le rejouer. Les axes éditoriaux et le haut de la liste passent par une revue humaine avant publication.
Chaque fiche est balisée comme une Review éditoriale avec un Rating (pas AggregateRating) — affichez le code source de la page pour le vérifier.
D'où vient cette méthodologie — et comment elle est vérifiée
Provenance. La méthodologie de ce registre vient d'AI100, notre projet de recherche sur la façon dont les moteurs de réponse IA citent et classent les sources. Nous réutilisons la méthode et les standards d'AI100 — pas son moteur de scoring : comment un axe doit gagner sa place (un test d'acheteur neutre, d'indépendance à l'ancienneté et de vérifiabilité), pourquoi un signal biaisé comme la visibilité IA propre d'une agence est pondéré à la baisse plutôt que flatté, et la règle voulant que chaque score soit publié avec sa source et sa date pour que quiconque puisse le rejouer. Le propre produit de scoring d'AI100 ne touche pas ces notes — la visibilité de chaque fiche est mesurée par la même sonde bon marché et identique, notre propre fiche comprise.
Divulgation. AI100, ce registre et UserSignals sont gérés par la même équipe. AI100 n'est donc pas un label d'approbation extérieur — c'est notre propre standard de recherche, énoncé au grand jour. Nous préférons que vous vérifiiez la méthode plutôt que de faire confiance à un badge : les axes, les pondérations, les ancrages et les prompts sont tous publiés, et nous nous classons nous-mêmes selon la règle identique, montrés exactement là où nous en sommes, parties peu flatteuses comprises.
Vérification. Le registre est audité par rapport à cette méthodologie par l'équipe AI100, dans une session neutre, et l'audit est publié — y compris ce qu'il a trouvé. Un auditeur externe re-dérive l'arithmétique exactement, concorde sur chaque axe à un point près, et reproduit le composite à environ ±0.3 près — donc les fiches à moins de ~0.3 sont traitées comme à égalité et le profil par axes, pas la dernière décimale, est le signal. Là où l'audit a signalé des lacunes, nous les avons corrigées ; deux choix que nous gardons à dessein, avec des raisons publiées : un axe sensible à l'ancienneté (la visibilité IA propre), pondéré le plus léger, et notre rang dans le lot est établi selon notre propre composite, étiqueté comme tel.
Journal d'audit.
- 2026-07-09 — premier audit externe en session propre (équipe AI100, ChatGPT). Le composite a été recalculé exactement à partir des scores publiés ; l'audit a signalé des cellules mesurées qui ne montraient pas leur source, l'absence d'ancrages 1–5 publiés, et une couronne de lot non étiquetée. Tout corrigé.
- 2026-07-09 — ré-audit après les corrections. Les ancrages étant publics, une re-notation indépendante a reproduit chaque axe à un point près et le composite à ~±0.3 près (donc les fiches à moins de ~0.3 sont traitées comme à égalité). Deux choix de conception sont gardés à dessein, avec des raisons publiées : un axe sensible à l'ancienneté (la visibilité IA propre, pondéré le plus léger), et un rang dans le lot établi selon notre propre composite.