Methodik

Wie wir KI-Sichtbarkeit messen, und unsere Arbeit zeigen

Jeder Wert auf dieser Seite, Ihrer oder unserer, geht auf ein festgelegtes Set an Prompts, ein festgelegtes Set an Engines und eine festgelegte Anzahl an Durchläufen zurück, alles protokolliert. Diese Seite ist das Wie, vollständig, keine Marketing-Zusammenfassung davon.

Methodik v1.1

Die Messung

Prompts, Engines, Durchläufe: die drei Variablen, die wir jedes Mal offenlegen#

Eine Zitierrate ist nur aussagekräftig, wenn Sie genau wissen, was sie erzeugt hat. Wir legen alle drei Eingaben offen, bevor wir eine einzige Zahl zeigen.

Prompts stammen aus echter Nachfrage, nicht aus unseren Vermutungen

Wo möglich, stammen Prompt-Sets aus gemessenen Suchnachfrage-Daten für die Kategorie, in den Worten des Käufers selbst, nicht aus Fragen, die wir uns ausgesucht haben, weil sie einen guten Screenshot ergaben. Unser eigener Kategorie-Baseline nutzte 20 Kauf-Prompts, auf dieselbe Weise erhoben.

Jede Engine wird gemessen, und nach Familie gekennzeichnet

Chat-Engines und KI-generierte Suchergebnisse sind unterschiedliche Oberflächen mit unterschiedlicher Mechanik. Wir messen beide, vermischen sie aber nie zu einem Wert, ohne zu sagen, aus welcher Familie welche Zahl stammt.

Durchläufe werden gezählt, und als Spanne gezeigt, wenn es mehr als einen gibt

Ein Durchlauf ist eine Momentaufnahme; mehrere Durchläufe sind eine Spanne. Wir sagen jedes Mal, welche der beiden Sie gerade sehen, von unserer eigenen veröffentlichten Recherche bis zum Bericht, den Sie als Kunde erhalten würden.

Zwei Familien, nie vermischt

Chat-Engines und KI-Suchoberflächen sind nicht dieselbe Messung#

Eine Zitierung innerhalb eines ChatGPT-Gesprächs und eine Zitierung innerhalb einer Google AI Overview entstehen durch unterschiedliche Mechanik. Beide als eine Zahl zu melden würde verbergen, welche davon für eine bestimmte Kaufreise wirklich zählt. Wir halten die beiden getrennt, immer gekennzeichnet.

Chat-Familie

ChatGPT, Perplexity, Gemini und Claude. Sie stellen eine direkte Frage und erhalten eine gesprächsartige Antwort, manchmal mit einer zitierten Quelle. Die Modell-Stichprobe hat hier echte Zufälligkeit, deshalb wird diese Familie mehrfach pro Zyklus gemessen.

KI-Suchfamilie

Google AI Overviews, Google AI Mode und das KI-Antwortfeld innerhalb von Bing. Eine KI-geschriebene Zusammenfassung, direkt in eine vertraute Ergebnisseite eingebettet, kein Chat-Gespräch. Sie verhält sich für eine feste Suche nahezu deterministisch, braucht also weniger Durchläufe, ist aber trotzdem eine eigene Zahl.

Die 7 Oberflächen

Jeder Wert ist nach der Oberfläche gekennzeichnet, aus der er stammt#

Zwei Familien, sieben Oberflächen, ein öffentliches Methoden-Label an jeder Zahl, damit niemand raten muss, was sie erzeugt hat.

ChatGPT

gemessen · nativer Chat. Segmentiert danach, ob die Antwort mit Live-Websuche (Grounding) erfolgte.

Perplexity

gemessen · nativer Chat

Gemini

gemessen · nativer Chat

Claude

gemessen · nativer Chat

Google AI Overviews

gemessen · KI-beantwortete Suche

Google AI Mode

gemessen · KI-beantwortete Suche. Nur englischsprachige Suchanfragen.

Bing Copilot

Proxy · KI-Antwort in der Suche. Das KI-Antwortfeld innerhalb der Suchergebnisse, nicht die separate Copilot-Chat-App.

Die Sampling-Tiers

Wie oft wir jeden Prompt ausführen, nach Tier#

Mehr Wiederholungen erzeugen eine engere, vertrauenswürdigere Zahl, und kosten mehr im Betrieb. Wir lassen einen günstigen Tier nie das Label eines strengeren Tiers ausleihen. Jeder Wert sagt, welcher Tier ihn erzeugt hat.

Kostenloser Scan

Ein Durchlauf pro Prompt, auf jeder Engine.

Einzeldurchlauf-Momentaufnahme

Compete-Bericht

Fünf Durchläufe pro Prompt auf Chat-Engines, ein bis zwei auf KI-Suchoberflächen.

report-grade, mit gezeigter breiter Spanne

Deep-Research-Bericht

Sieben bis acht Durchläufe pro Prompt auf Chat-Engines, zwei auf KI-Suchoberflächen, entsprechend der Untergrenze des veröffentlichten GEO-Reproduzierbarkeits-Surveys.

research-grade

Konfidenz, keine falsche Präzision

Jeder wiederholte Wert kommt mit einem 95-Prozent-Konfidenzintervall#

Wir berechnen das Intervall per Bootstrap-Resampling der Durchläufe hinter einem Wert, nicht durch Annahme einer Glockenkurve, der KI-Antwortdaten tatsächlich nicht folgen. Eine Zahl ohne Intervall ist Theater: Sie wirkt präzise und sagt nichts darüber, wie weit sie auch anders hätte ausfallen können. Bei einem Einzeldurchlauf täuschen wir kein Intervall vor, wir zeigen stattdessen das Einzeldurchlauf-Label, und sagen das auch.

Eine Zitierrate von 40% mit einem 95-Prozent-Intervall von 10% bis 70% ist eine ganz andere Aussage als 40% mit einem Intervall von 35% bis 45%, auch wenn die Hauptzahl identisch ist. Wir zeigen die Breite jedes Mal, nie nur den Mittelwert.

Selection vs Absorption

Zitiert zu werden und die Antwort zu prägen sind zwei verschiedene Ereignisse#

Veröffentlichte Forschung zum Zitierverhalten von LLMs fand, dass die Aufnahme in zwei Phasen mit unterschiedlichen Treibern geschieht. Sie als einen vermischten Wert zu behandeln verbirgt, welchen der beiden Sie tatsächlich verbessern.

Selection

Ist die Marke überhaupt in den Pool der Quellen gelangt, aus denen das Modell schöpfte? Vor allem getrieben von klassischen Autoritätssignalen: Backlinks, Markenbekanntheit, Erwähnungen Dritter. Das ist es, was die meisten veröffentlichten Zitierraten tatsächlich messen.

Absorption

Hat die Marke, einmal ausgewählt, die Substanz der Antwort wirklich geprägt, oder blieb sie ungenutzt in einer Quellenliste? Getrieben von der Dichte extrahierbarer Belege: Definitionen, Statistiken, Vergleiche und strukturierte Inhalte, die ein Modell direkt übernehmen kann. Gut zu ranken löst Selection. Es löst Absorption nicht automatisch mit.

Within-tool, nie über Engines hinweg

Wir vergleichen nie einen absoluten Wert zwischen zwei verschiedenen Engines#

Das Zitierverhalten variiert enorm von einer KI-Engine zur nächsten. Veröffentlichte Forschung maß Schwankungen von bis zu 615-fach zwischen Engines in derselben Kategorie, und fand nur etwa 11% Überschneidung zwischen den Quellen, die ChatGPT zitiert, und denen, die Perplexity für vergleichbare Anfragen zitiert. Eine Veränderung innerhalb einer Engine, über die Zeit verfolgt, ist ein echtes Signal. Ein Vergleich des Rohwerts einer Engine gegen den Rohwert einer anderen Engine ist kein Befund, sondern als Befund verkleidetes Rauschen.

Die Ehrlichkeitsregeln

Was "gemessen" hier wirklich bedeutet#

Was bedeutet eine "Einzeldurchlauf-Momentaufnahme" eigentlich?

Es bedeutet, dass die Zahl aus genau einem Durchlauf stammt, nicht aus einem Durchschnitt wiederholter Durchläufe. LLM-Ausgaben sind nicht vollständig deterministisch: Stellen Sie dieselbe Frage zweimal, und Sie können zwei unterschiedliche Zitierungen erhalten. Eine Einzeldurchlauf-Zahl ist echtes Datenmaterial, aber sie ist eine Momentaufnahme, keine Trendlinie, und wir kennzeichnen sie jedes Mal so, auch bei unserem eigenen Baseline von 240 Antworten.

Wie Viele Durchläufe Fließen in Eine Zahl, die Keine Einzeldurchlauf-Momentaufnahme Ist?

Engines der Chat-Familie werden pro Messzyklus mehrfach abgetastet; KI-Suchoberflächen brauchen weniger Durchläufe, weil sie für eine feste Suche näher am Deterministischen liegen. Wo wir mehr als einmal messen, zeigen wir eine Spanne statt einer einzelnen schmeichelhaften Zahl.

Vermischen Sie jemals Chat-Engine- und KI-Suchergebnisse zu einem Wert?

Nein. Es sind unterschiedliche Oberflächen, unterschiedlich gemessen, und jedes Mal getrennt gemeldet, nach Familie gekennzeichnet. Ein vermischter "KI-Sichtbarkeits-Score" würde sauberer aussehen und weniger aussagen.

Warum versprechen Sie kein Ranking oder eine garantierte Zitierung?

Weil niemand kontrolliert, was ein Modell zu zitieren wählt, nicht wir, nicht Sie, nicht einmal das Labor, das es trainiert hat. Wer eine garantierte KI-Zitierung verspricht, verspricht etwas außerhalb der eigenen Kontrolle. Was wir garantieren können, ist, dass die Zahl, die wir Ihnen zeigen, so entstanden ist, wie diese Seite es beschreibt, nicht erfunden.

Was wir nie tun

Fünf Dinge, die Sie nie von uns sehen werden#

  • Einen einzigen vermischten "KI-Sichtbarkeits"-Score, gemittelt über verschiedene Engines.
  • Einen absoluten Wert einer Engine, direkt gegen eine andere Engine verglichen und als Ranking präsentiert.
  • Eine Zahl auf dieser Seite ohne das Methoden-Label, das sie erzeugt hat: die Engine, den Tier und die Anzahl der Durchläufe.
  • Ein garantiertes Zitat-, Ranking- oder Platzierungsversprechen. Niemand kontrolliert, was ein Modell zu zitieren wählt.
  • Einen fehlenden Datenpunkt, still als Null behandelt. Fehlend wird als fehlend gekennzeichnet.

Die Recherche

Unsere eigene Kategorie-Recherche, Zeile für Zeile#

Im Juli 2026 haben wir genau die oben beschriebene Methodik auf unsere eigene Kategorie angewendet, bevor wir sie an irgendeinen Kunden verkauft haben. Hier ist, was jedes Modul gemessen hat, direkt aus den protokollierten Recherche-Durchläufen.

Wettbewerber-Keyword-Kartierung

Jedes Keyword, für das 14 Wettbewerber-Domains bereits ranken: 1.721 einzigartige Keywords, das Rohmaterial für die Pflicht-Ranking-Warteschlange.

Suchergebnis- + AI-Overview-Landschaft

Wen Googles AI Overview heute für die Kategorie zitiert, erhoben über fünf Sprachen hinweg.

Zitier-Baseline (die 240-Antworten-Studie)

Die Kauf-Prompt-Studie hinter jeder Scoreboard-Zahl auf dieser Seite: 240 bewertete Antworten über vier Engines.

Lückenanalyse

Verknüpft all das Obige zu einer validierten Content-Warteschlange.

Gleiche Messlatte

Wir messen uns selbst mit derselben Messlatte#

Wir wenden die auf dieser Seite beschriebene Methodik exakt auf unsere eigene Kategorie an und veröffentlichen die Ergebnisse als datierte, laufende Fallstudie, aktualisiert vor Ort, sobald sich die Zahlen bewegen, oder eben nicht. Wenn eine Methode nicht übersteht, auf ihren eigenen Urheber angewendet zu werden, ist sie keine Methode.

Veröffentlicht, datiert und vor Ort aktualisiert, keine Rückschau

Selbst nachprüfen

Sie müssen uns nicht einfach glauben#

Jede Zahl auf dieser Seite kommt daher, dass wir echten KI-Engines echte Fragen stellen und zählen, was zurückkommt. So führen Sie genau dieselbe Prüfung selbst durch: ohne Konto, ohne Tool, nur die Engines und eine Stoppuhr.

Stellen Sie dieselbe Frage

Nehmen Sie einen Prompt aus einem festgelegten Set, wie im Beispiel unten, und stellen Sie ihn jeder Engine, die Sie interessiert, genau wie geschrieben, in einem neuen Gespräch ohne vorherigen Kontext.

Zählen Sie, was zitiert wird

Notieren Sie bei jeder Antwort, ob Ihre Marke oder Domain auftaucht und welche Quellen die Engine nennt oder verlinkt. Ein einzelner Durchlauf ist eine Momentaufnahme, kein Trend.

Vergleichen Sie innerhalb derselben Engine über die Zeit

Wiederholen Sie denselben Prompt bei derselben Engine an verschiedenen Tagen, um zu sehen, wie sich das Zitierverhalten bewegt. Vergleichen Sie niemals den Rohwert einer Engine direkt mit dem Rohwert einer anderen Engine.

Beispiel-Prompt aus unserem Kaufabsicht-Setbest CRM software providers
Ein echtes gemessenes Beispiel ansehen

Ein echtes gemessenes Beispiel ist noch nicht veröffentlicht. Es steht in der Warteschlange unseres nächsten eigenen Self-Scans und ersetzt diesen Hinweis, sobald es vorliegt.

Changelog

Jede Messänderung, datiert#

v1.1 19. Juli 2026

Sampling-Tiers für den Einmal-Launch umbenannt: Aus Starter und Pro werden die Berichte Compete und Deep Research, das Label monitoring-grade wird zu report-grade, und der Compete-Tier legt sich auf fünf Durchläufe pro Prompt fest. Durchlaufzahlen, die Konfidenzintervall-Methode und jedes Ehrlichkeits-Label bleiben unverändert.

v1.0 18. Juli 2026

Erstveröffentlichung: Sampling-Tiers mit ehrlichen Labels (Einzeldurchlauf-Momentaufnahme, monitoring-grade, research-grade), Selection und Absorption getrennt gemessen, nur Within-tool-Vergleich, versionierte Prompt-Sets, und ein Methoden-Label an jeder Oberfläche.

Quellen

Die Forschung hinter diesen Regeln#

Jede Regel auf dieser Seite geht auf eine konkrete veröffentlichte Quelle zurück, nicht auf eine interne Meinung darüber, was rigoros klingt.

Aggarwal et al., "GEO: Generative Engine Optimization," KDD 2024 (arXiv:2311.09735)

Die ursprüngliche Reproduzierbarkeits-Baseline für diese Kategorie: fünf Zufalls-Seeds, öffentlicher Code. Von den meisten kommerziellen Tools noch nicht befolgt.

Optimizing Visibility in Generative Engines: A Critical Survey, 2023 bis 2026 (arXiv:2607.14035)

Legt die Sieben-bis-Acht-Durchläufe-Untergrenze hinter unserem research-grade Tier fest, und die getrennten Estimanden, die wir erheben.

Zhang, He und Yao, 2026 (arXiv:2604.25707), Datensatz "geo-citation-lab"

602 Prompts und 21.143 Zitierungen hinter der Selection-versus-Absorption-Trennung.

Seer Interactive, Klickrate-Forschung unter AI Overview (3.119 analysierte Suchanfragen)

Der Ausschlag der organischen Klickrate unter AI Overviews, der überhaupt motiviert, diese Kategorie zu messen.

US-Patent 12.158.907 B1, Query-Fan-out für generative Suche

Warum eine einzelne Seed-Query nicht reicht: AI Overviews weiten einen Prompt vor der Beantwortung zu Sub-Queries aus.

Sehen Sie, wo Sie stehen, auf dieselbe Weise gemessen.

Einmaliger Bericht, kein Abonnement, Lieferung in wenigen Tagen.