Agentur einreichen
Die Methode

Wie wir messen

Ein Maßstab, angewandt auf jede Agentur, einschließlich unserer eigenen. Das meiste ist gemessen — Achsen, die jeder externe Prüfer aus den von uns veröffentlichten Prompts und Daten nachvollziehen kann. Der Rest ist redaktionell — unser Urteil, als Urteil gekennzeichnet, nie als Messung verkleidet. Jede gelistete Agentur hat ein Recht auf Gegendarstellung.

Das Tor — wer in das Segment kommt

Eine Agentur wird nur gelistet, wenn alle vier Bedingungen gelten. Das Tor trennt nach Kategorie, nicht nach Stärke: ein starker Anbieter, der Kleinunternehmen wirklich bedient, rangiert dort, wo er es sich verdient — über uns, wenn er besser ist.

  • KMU-vorrangig — bedient Privatkunden / Kleinunternehmen als sein primäres Segment, nicht ausschließlich Enterprise mit KMU als Alibizeile.
  • Self-Service-Angebot — hat ein transparentes Self-Service-Angebot, das ein Käufer selbst kaufen kann — ein veröffentlichter Preis oder ein festes Paket, kein verpflichtendes „Vertrieb kontaktieren“.
  • GEO-Substanz — benennt GEO / KI-Sichtbarkeit als tatsächliche Leistung (nennt Antwortmaschinen, Zitierungsarbeit, strukturierte Daten, misst KI-Antworten) — umetikettiertes generisches SEO wird gelistet, aber markiert.
  • Aktives Unternehmen — ist ein aktives, erreichbares Unternehmen — echte Website, echter Kontakt.

Warum diese Achsen

Jede Achse hier besteht drei Filter — mit einer offengelegten Ausnahme, unten benannt.

  1. Ein Käufer würde zustimmen, dass sie zählt. Ohne zu wissen, wer darin gut abschneidet — würde ein Käufer aus dem Kleinunternehmen sie bei der Wahl einer Agentur berücksichtigen? Eine Achse, die nur wir bestehen, fällt weg.
  2. Sie belohnt nicht bloß das Alter. Eine Achse, die vor allem abbildet, wie lange eine Domain schon existiert, baut das übliche Verzeichnis nach, in dem der älteste Name gewinnt — deshalb sind altersgetriebene Achsen vom Maßstab weg, mit einer ehrlichen Ausnahme: die eigene KI-Sichtbarkeit (M1). Sie ist teils altersgetrieben, und wir behalten sie nur, weil eine Agentur, die KI-Sichtbarkeit verkauft und selbst keine hat, ein echtes Signal ist — und wir gewichten sie am leichtesten (9%) genau wegen dieser Störgröße.
  3. Jeder kann sie überprüfen. Eine gemessene Achse kann von außen reproduziert werden; eine redaktionelle ist als unsere Meinung gekennzeichnet.

Die sieben Achsen

Jede Achse unten besteht diese drei Filter. Hier ist, was jede belohnt, wie viel sie wiegt und warum.

AchseWas sie belohntGewicht
M1 · Eigene KI-Sichtbarkeit die Agentur ist selbst auffindbar und in KI-Antworten korrekt beschrieben 9%
M2 · Methodentransparenz veröffentlicht, wie sie arbeitet und was sie misst, keine Blackbox 16%
M3 · Nachweis-Überprüfbarkeit benannter, konkreter, überprüfbarer Beleg statt anonymem Hype 23%
M4 · Preistransparenz veröffentlichter Preis / Spanne, nicht „Angebot anfragen“ 12%
M5 · KI-Lesbarkeit die Website ist crawlbar und maschinenlesbar — nicht für KI blockiert, serverseitig gerendert, mit Schema.org-Markup, einer Sitemap und einer llms.txt 10%
E1 · Segment-Passung wirklich für den Privat- / Kleinunternehmenskäufer gebaut 12%
E2 · Sauberkeit der Versprechen kein Wundermittel — keine garantierten Rankings, keine Fälschungen 18%

M1 · Eigene KI-Sichtbarkeit · 9% — Taucht die Agentur selbst auf und wird sie in KI-Antworten korrekt beschrieben? Ein Laden, der KI-Sichtbarkeit verkauft und darin unsichtbar ist, ist ein echtes Signal. Wir gewichten sie am leichtesten, weil rohe Sichtbarkeit weitgehend vom Domain-Alter getrieben wird, nicht davon, wie gut die Agentur ist — ein alter durchschnittlicher Laden schlägt einen neuen exzellenten allein durch das Alter. Als Signal „wen sollte ich beauftragen“ ist sie schwach, deshalb bleibt sie leicht.

M2 · Methodentransparenz · 16% — Veröffentlicht die Agentur, wie sie arbeitet und vor allem was sie misst? Die Messung ist der tragende Teil: ein echter Spezialist kann benennen, wie er die Sichtbarkeit in KI-Antworten verfolgt — Zitationsanteil, Tests mit Prompt-Sätzen, Erwähnungs-Tracking. „Wir steigern Ihren Traffic und Ihre Rankings“ ist eine SEO-Antwort auf eine GEO-Frage und schneidet hier schlecht ab.

M3 · Nachweis-Überprüfbarkeit · 23% — Ist der Beleg benannt, konkret und verlinkbar — ein echter Kunde, eine abgegrenzte Behauptung, ein Fall, den man öffnen kann — statt anonymem „5× Traffic“-Hype? Wir bewerten, ob der Beleg überprüfbar ist, nicht ob ein privates Ergebnis wahr ist; dieses Ergebnis liegt hinter der Mauer des Kunden, und vorzugeben, es zu bestätigen, wäre genau die Unehrlichkeit, die wir ablehnen. Es ist die schwerste Achse, weil sie am stärksten käuferprädiktiv und am schwersten zu fälschen ist, und sie schützt den ehrlichen Neuling mit zwei echten Fällen vor dem Platzhirsch mit fünfzig anonymen Prahlereien.

M4 · Preistransparenz · 12% — Gibt es einen veröffentlichten Preis oder eine Spanne, oder nur „Angebot anfragen“? Käufer aus dem Kleinunternehmen müssen die Kosten vorab kennen, deshalb steht diese Achse für dieses Segment auf dem Maßstab. Sie liegt in der Mitte: ein echter Preis ist notwendige Information, aber ein Preis kann trotzdem einen schwachen Service kaschieren, deshalb ist sie eine Eignungs- und Hygiene-Achse, keine Qualitätsachse.

M5 · KI-Lesbarkeit · 10% — Ist die eigene Website der Agentur tatsächlich maschinenlesbar — offen für KI-Crawler, serverseitig gerendert, mit Schema-Markup, einer Sitemap und einer llms.txt? Das ist die altersunabhängige Hälfte von M1: zitiert zu werden (M1) hängt teils davon ab, wie alt man ist, aber die eigene Website maschinenlesbar zu machen liegt vom ersten Tag an vollständig in der eigenen Hand. Es ist vollständig reproduzierbar — ein Prüfer kann die Website abrufen und nachsehen — und eine für KI undurchsichtige Agentur auf dem eigenen Grund versagt im eigenen Handwerk.

E1 · Segment-Passung · 12% — Ist die Agentur wirklich für einen Privat- oder Kleinunternehmenskäufer gebaut — Self-Service, angemessener Umfang — oder ein Enterprise-Betrieb mit einer symbolischen KMU-Zeile? Das ist eine Ermessensfrage bei den Grenzfällen, deshalb kennzeichnen wir es als Meinung und schicken Grenzfälle in die menschliche Prüfung.

E2 · Sauberkeit der Versprechen · 18% — Sind die Versprechen sorgfältig und ehrlich, oder Wundermittel — garantierte Rankings, Fake-Bewertungen, „wir manipulieren KI“? Das ist die mit Abstand häufigste Art, wie ein Käufer in dieser Kategorie verbrannt wird, und deshalb ist es die schwerste redaktionelle Achse.

Wie jede Punktzahl verankert ist (1–5)

Jede Achse wird von 1 bis 5 anhand der festen Anker unten bewertet, sodass ein externer Prüfer, der von derselben Evidenz ausgeht, auf dieselbe Zahl kommt.

M1 · Eigene KI-Sichtbarkeit — 5 erscheint in der Kategorie-Antwort auf den meisten Engines + akkurate Markenerinnerung · 4 erscheint auf ≥1 Engine, Markenerinnerung überwiegend korrekt · 3 fehlt in Kategorie-Antworten, aber Markenerinnerung grob korrekt · 2 Markenerinnerung dünn/teilweise · 1 unsichtbar.

M2 · Methodentransparenz — 5 Schritt-für-Schritt-Methode + eine benannte KI-Sichtbarkeits-Kennzahl + ein Beispiel-Ergebnis · 4 echtes „wie wir arbeiten“, Messung benannt, aber dünn · 3 Prozess in Marketing-Begriffen, nur SEO-Kennzahlen · 2 vage „bewährte Strategien“ · 1 Blackbox.

M3 · Nachweis-Überprüfbarkeit — 5 benannte Kunden + eingegrenzte Aussagen + verlinkbare Artefakte, eine Stichprobe hält stand · 4 benannte Fälle, begrenzt verlinkbarer Nachweis · 3 einige Details, überwiegend anonym · 2 vage Aussagen, keine Namen · 1 unbelegbares Getöse / eine Stichprobe fällt durch.

M4 · Preistransparenz — 5 vollständig veröffentlichte Preisliste · 4 „ab $X“ oder klare Stufen · 3 veröffentlichte Spannen · 2 nur qualitativ · 1 „Angebot anfragen“.

M5 · KI-Lesbarkeit — 5 SSR + offen für KI-Crawler + Schema + Sitemap + llms.txt · 4 dasselbe ohne llms.txt · 3 crawlbar, aber dünnes Markup · 2 überwiegend clientseitig gerendert · 1 blockiert KI-Crawler / nur JS.

E1 · Segment-Passung — (redaktionell) 5 klar KMU-Selbstbedienung · 4 überwiegend KMU · 3 gemischt · 2 überwiegend gehoben · 1 Enterprise, KMU nur symbolisch.

E2 · Sauberkeit der Versprechen — (redaktionell; Warnsignal-Deckelung) 5 sorgfältig, ausdrücklich ohne Garantien · 4 selbstbewusst, aber angemessen · 3 leichte Schönfärberei · 2 Überzogenes nahe Schlangenöl · 1 WARNSIGNAL (garantierte Platzierungen, gefälschte Bewertungen, „wir manipulieren die KI“) → deckelt das Urteil.

Wie die Gewichtung standhält

Gemessene Achsen (M1–M5) sind 70 % des Werts; das redaktionelle Urteil (E1–E2) die übrigen 30 %. Der reproduzierbare Kern führt mit Absicht, sodass der Großteil des Rankings etwas ist, das ein Außenstehender nachvollziehen kann. Das Urteil ist real — man kann „ist das Wundermittel“ nicht auf einen Schlagwort-Scan reduzieren — aber es bleibt in der Minderheit, sodass eine Meinung nie allein ein Verdikt kippen kann.

Es gibt einen einfachen Test, ob ein Maßstab manipuliert ist: wiegt eine Achse nur deshalb schwer, weil ihr Autor darin gut abschneidet? Wenden Sie ihn auf uns an. Unsere eigene KI-Sichtbarkeit (M1) ist heute niedrig — junge Domain, Mitte 2026 aus Google entfernt — und M1 ist unsere leichteste Achse. Die Achsen, in denen wir stark sind, wiegen schwer, aber jede wiegt schwer aus einem Grund, den ein Käufer nennen würde, noch bevor er unseren Wert sieht. Die eine Achse, in der wir derzeit verlieren, haben wir aus Prinzip heruntergewichtet. Das ist überprüfbar, und darum geht es.

Gewichte sind Ausgangs-Annahmen, als solche veröffentlicht, und werden sich verschieben, sobald wir gegen echte Durchläufe kalibrieren. Eine Achse, in der alle gleich abschneiden, trägt keine Information und verliert automatisch an Gewicht.

Wie genau der Composite ist. Der Composite ist ein gewichteter Durchschnitt der sieben Achsen-Scores. Wenn ein externer Prüfer die Achsen unabhängig neu bewertet, reproduziert sich die Arithmetik exakt, jede Achse stimmt bis auf einen Punkt überein, und der Composite liegt innerhalb von etwa ±0.3. Die letzte Nachkommastelle ist also keine echte Unterscheidung: Wir behandeln zwei Einträge innerhalb von ~0.3 zueinander als effektiv gleichauf, und das Achsenprofil — nicht die Composite-Zahl — ist das Signal. Lies die Achsen.

Die Warnsignal-Deckelung

Eine disqualifizierende Behauptung — garantierte Rankings oder Platzierungen, angebotene Fake-Bewertungen, 'wir manipulieren KI' — deckelt das Gesamtverdikt, so gut der Rest der Website auch aussieht. Ein Ergebnis zu garantieren, das man nicht kontrolliert, lässt sich nicht durch Politur ausgleichen, und der Käufer muss am dringendsten von dem Anbieter weggelenkt werden, der selbstsicher genug ist, es zu versprechen.

Der Fokus-Abzug — ein Spezialist, der alles macht, ist keiner

Dies ist ein Register für eine Spezialität. Echte GEO-Spezialisten sind noch wenige, und eine Agentur, die alles verkauft — oder ein SEO-Laden, der 'KI' auf die Karte gesetzt hat — führt KI-Sichtbarkeit meist als eine Zeile unter vielen, ohne eigene Methode und ohne eigene Fälle. Wo GEO nicht als eigenständige Leistung betrieben wird (mit eigenem Angebot, eigener Seite) und die Website keine Art nennt, wie sie die Sichtbarkeit in KI-Antworten misst, wenden wir einen Fokus-Abzug an und markieren ihn: −0.5 für ein Allround-Kombinat, −0.2 für einen SEO-geführten Hybrid, keinen für einen fokussierten Spezialisten. Eine dünne, nicht überprüfbare Website wird bereits von der Beleg-Achse (M3) behandelt; der Fokus-Abzug trägt nur die separate Tatsache, dass die Spezialität nicht wirklich ausgeübt wird. Weil Generalist-Sein eine starke Wahrscheinlichkeit — keine Gewissheit — für schwaches GEO ist, ist es ein Abzug mit Recht auf Gegendarstellung, keine automatische Disqualifikation.

  • Generalisten-Kombinat — SEO + Website-Produktion + alles im Paket: −0.5
  • SEO-geführter Hybrid — zuerst SEO, aber mit echter, benannter GEO-Arbeit: −0.2
  • Fokussierter GEO-/KI-Sichtbarkeits-Spezialist: kein Abzug

Das ist ein Fokus-Modifikator, keine Änderung der Achsengewichte — der Maßstab oben bleibt unverändert. Die Einstufung ist aus dem eigenen Angebot der Agentur ablesbar und wird einheitlich angewendet; UserSignals ist ein fokussierter Spezialist und trägt nach derselben Regel keinen Abzug.

Reproduzierbar konzipiert

Gemessene Achsen tragen den Beleg-Ausschnitt und die Quelle, aus der sie stammen; ein fehlender Befund wird als ausdrückliches „nicht gefunden“ erfasst, nie als geratene Zahl. Jeder Wert ist mit einem „Datenstand“ datiert, und das Probe-Set (ChatGPT + Claude, suchgestützt, saubere Sitzung) ist festgelegt, damit jeder externe Prüfer es nachvollziehen kann. Redaktionelle Achsen und die Spitze der Liste durchlaufen vor der Veröffentlichung eine menschliche Prüfung.

Jeder Eintrag ist als redaktionelle Review mit einem Rating (nicht AggregateRating) ausgezeichnet — sieh dir den Seitenquelltext an, um es zu prüfen.

Woher diese Methodik stammt — und wie sie geprüft wird

Herkunft. Die Methodik dieses Registers stammt von AI100, unserem Forschungsprojekt dazu, wie KI-Antwortmaschinen Quellen zitieren und einordnen. Wir übernehmen AI100s Methode und Standards — nicht seine Scoring-Engine: wie eine Achse ihren Platz verdienen muss (ein Test auf neutralen Käufer, auf Altersunabhängigkeit und auf Überprüfbarkeit), warum ein konfundiertes Signal wie die eigene KI-Sichtbarkeit einer Firma heruntergewichtet statt geschmeichelt wird, und die Regel, dass jede Bewertung mit ihrer Quelle und ihrem Datum erscheint, damit jeder sie nachvollziehen kann. AI100s eigenes Scoring-Produkt berührt diese Bewertungen nicht — die Sichtbarkeit jedes Eintrags wird mit derselben günstigen, identischen Probe gemessen, unser eigener Eintrag eingeschlossen.

Offenlegung. AI100, dieses Register und UserSignals werden vom selben Team betrieben. AI100 ist also kein externes Gütesiegel — es ist unser eigener Forschungsstandard, offen dargelegt. Uns ist lieber, du prüfst die Methode, als dass du einem Abzeichen vertraust: die Achsen, Gewichte, Anker und Prompts sind alle veröffentlicht, und wir führen uns selbst am identischen Maßstab, gezeigt genau dort, wo wir stehen, unvorteilhafte Teile inklusive.

Verifizierung. Das Register wird vom AI100-Team gegen diese Methodik geprüft, in einer neutralen Sitzung, und die Prüfung wird veröffentlicht — einschließlich dessen, was sie fand. Ein externer Prüfer leitet die Arithmetik exakt neu ab, stimmt bei jeder Achse bis auf einen Punkt überein und reproduziert den Composite auf etwa ±0.3 genau — daher werden Einträge innerhalb von ~0.3 als gleichauf behandelt, und das Achsenprofil, nicht die letzte Nachkommastelle, ist das Signal. Wo die Prüfung Lücken aufzeigte, haben wir sie behoben; zwei Entscheidungen behalten wir bewusst bei, mit veröffentlichten Gründen: eine altersabhängige Achse (die eigene KI-Sichtbarkeit), am leichtesten gewichtet, und unser Rang im Batch erfolgt nach unserem eigenen Composite, als solcher gekennzeichnet.

Prüfprotokoll.

  • 2026-07-09 — erste externe Clean-Session-Prüfung (AI100-Team, ChatGPT). Der Composite wurde exakt aus den veröffentlichten Scores neu berechnet; die Prüfung markierte gemessene Zellen, die ihre Quelle nicht zeigten, fehlende veröffentlichte 1–5-Anker und eine unbeschriftete Batch-Krone. Alles behoben.
  • 2026-07-09 — Nachprüfung nach den Korrekturen. Mit öffentlichen Ankern reproduzierte eine unabhängige Neubewertung jede Achse bis auf einen Punkt und den Composite innerhalb von ~±0.3 (daher werden Einträge innerhalb von ~0.3 als gleichauf behandelt). Zwei Design-Entscheidungen behalten wir bewusst bei, mit veröffentlichten Gründen: eine altersabhängige Achse (die eigene KI-Sichtbarkeit, am leichtesten gewichtet) und ein Batch-Rang, angegeben nach unserem eigenen Composite.
Was dieser Maßstab NICHT misst Er bewertet nicht die Tiefe der Erfolgsbilanz oder die bloße Menge benannter Kunden — beides begünstigt denjenigen, der am längsten dabei ist, die Alters-Verzerrung, die wir vermeiden wollten. Er kann private Ergebnisse hinter der Mauer eines Kunden nicht verifizieren, also bewertet er, ob ein Beleg überprüfbar ist, nicht ob ein Ergebnis wahr ist. Und er liest, was Agenturen veröffentlichen; wo wir es durch eine direkte Anfrage bestätigen, ist das eine Stichprobe an der Spitze der Liste und an unserem eigenen Eintrag, kein verstecktes, auf alle angewandtes Ergebnis.