So misst du KI-Sichtbarkeit: Sammle Antworten auf ein festes Set von Kundenfragen, erfasse Erwähnungen, Empfehlungen und Quellenangaben getrennt und wende dieselbe Methode immer wieder an. Gib an, welche Plattformen, Sprachen und Fragen du getestet hast, wie viele Antworten du bekommen hast und wie du mit Ausfällen umgegangen bist. Nutze ergänzend zu dieser Stichprobe die Berichte der Plattformen selbst, aber halte ihre Kennzahlen getrennt.
Ohne diesen Kontext ist ein Prozentwert schwer zu deuten. „Sichtbar in 40 % der Antworten“ kann ein nützliches Set von Kauffragen ohne Markennamen beschreiben – oder ein schmeichelhaftes Set, in dem dein Firmenname immer wieder vorkommt. Keins von beidem ist automatisch dein Anteil an den Nutzern der KI-Suche in Dubai.
Lege fest, was du beobachten willst
Starte mit wenigen, klar benannten Kennzahlen, bevor du einen Gesamtscore ergänzt:
Markennennung: Die Antwort nennt dein Unternehmen, auch in einer vereinbarten Schreibweise oder unter einem Alias. Zähl sie einmal pro Antwort, selbst wenn der Name mehrmals vorkommt.
Empfehlung: Die Antwort nennt dein Unternehmen als Option für den Bedarf, den der Kunde beschreibt. Ein beiläufiger Hinweis, eine Warnung oder eine ausdrückliche Ablehnung zählt nicht als positive Empfehlung.
Quellenangabe zur eigenen Domain: Die Antwort stützt sich mit einer Quellenangabe auf eine URL deiner vereinbarten Website-Domain. Ein Verzeichnis, das dein Unternehmen erwähnt, zählt als externe Quelle – nicht als Quellenangabe zu deiner Website.
Sachliche Richtigkeit: Gibt die Antwort wichtige Fakten zum Unternehmen korrekt wieder? Erfasse falsche Leistungen, Standorte, Preise oder Kontaktdaten getrennt davon, ob du überhaupt vorkommst. Eine falsche Empfehlung kann trotzdem sichtbar sein – sie verdient aber Aufmerksamkeit, nicht das Etikett „Erfolg“.
Schreib diese Definitionen auf und wende sie konsequent an. Entscheide, wie du mit Geschäftsnamen, Filialen, Muttergesellschaften und übernommenen Marken umgehst, bevor du Ergebnisse vergleichst. Heb unklare Fälle für eine manuelle Prüfung auf.
Wähle Fragen aus echten Kaufentscheidungen
Stell die Ausgangsliste aus dem zusammen, was bei deinen Kunden wirklich vorkommt: Anfragen, Verkaufsgespräche, die Wahl zwischen Leistungen und Vergleiche. Gruppiere die Liste nach Zweck, etwa einen Anbieter finden, Alternativen vergleichen oder prüfen, ob ein Angebot zu einem bestimmten Bedarf passt.
Bei einem Trainingsanbieter in Dubai könnten relevante Fragen zwischen Firmenworkshops, Abendkursen für Einzelpersonen und Kursen beim Kunden vor Ort unterscheiden. Diese Käufe brauchen unterschiedliche Belege. Wer nur „bestes Trainingsunternehmen in Dubai“ testet, übersieht einen Großteil dieser Unterschiede.
Arbeite mit zwei getrennten Sets:
- Entdeckungsfragen nennen deine Marke nicht. Damit testest du, ob sie als Option erscheint, ohne vorgegeben zu werden.
- Genauigkeitsfragen mit Markennamen fragen ausdrücklich nach deinem Unternehmen. Damit testest du Wiedererkennung und Darstellung, nicht das Auffinden ohne Vorgabe.
Behalte einen stabilen Kern für Vergleiche. Pack neue, experimentelle Fragen in eine eigene, datierte Gruppe. Änderst du den Kern, bewahre die vorherige Version auf und erkläre die Änderung, statt den neuen Score zu vergleichen, als wäre nichts passiert.
Sind beide Sprachen geschäftlich wichtig, nutze ein arabisches und ein englisches Set. Lass jemanden, der die jeweilige Sprache beherrscht, prüfen, ob die Fragen in beiden Sprachen den gleichen Kaufbedarf ausdrücken. Trenn die Ergebnisse, damit ein anderer Sprachmix nicht als bessere Sichtbarkeit durchgeht.
Halte die Bedingungen fest, nicht nur die Antwort
Speichere für jede Beobachtung:
- Prompt-ID und genauen Wortlaut, inklusive genanntem Einzugsgebiet oder Ort.
- Plattform, Consumer-App oder API sowie das sichtbare Modell oder den Modus, soweit verfügbar.
- Datum, Uhrzeit und Sprache.
- Bekannte Bedingungen bei Konto, Chatverlauf und Standort, die das Ergebnis beeinflussen könnten.
- Ob die geplante Suche tatsächlich stattfand, soweit erkennbar.
- Die vollständige Antwort, die belegenden URLs und deine Codierung jedes Ergebnisses.
- Jeden Erhebungsfehler, jedes fehlende Ergebnis und jeden neuen Versuch.
Ein neuer Chat hilft dabei, dass frühere Fragen nicht nachwirken. Für sich allein beweist er aber nicht, dass die Erinnerungsfunktion des Kontos oder der Standortkontext keine Rolle mehr spielen. OpenAI dokumentiert, dass Erinnerungen und Standort die ChatGPT-Suche beeinflussen können. Kontext in der ChatGPT-Suche.
Kennzeichne API-Antworten nicht als Beobachtungen aus der Consumer-App. Ein Monitoring-Tool nutzt vielleicht eine API, eine Erhebung im Browser oder eine andere Methode; halte fest, welche es tatsächlich verwendet. Die Vergleichbarkeit hängt von der Erhebungsmethode ab, nicht einfach vom Modellnamen auf einem Dashboard.
Speichere nur, was für die Untersuchung nötig ist. Entferne themenfremde personenbezogene Daten aus den gespeicherten Antworten, bevor du Berichte weitergibst.
Nutze Nenner, die Leser nachprüfen können
Hier ein hypothetisches Beispiel – kein Ergebnis aus unserer Arbeit und keine empfohlene Mindestgröße für die Stichprobe. Getestet werden eine Plattform und ein Modus mit 20 verschiedenen Fragen ohne Markennamen, jede zweimal nach vorab festgelegtem Zeitplan.
Das ergibt 40 geplante Beobachtungen. Nach vier technischen Erhebungsfehlern bleiben 36 verwertbare Antworten. Zwölf nennen die Marke, neun empfehlen sie und sechs geben ihre Website als Quelle an.
| Kennzahl | Berechnung in diesem Beispiel | Ergebnis |
|---|---|---|
| Vollständigkeit der Erhebung | 36 verwertbare Antworten ÷ 40 geplante Beobachtungen | 90% |
| Quote der Markennennungen | 12 Antworten mit Nennung der Marke ÷ 36 verwertbare Antworten | 33,3% |
| Empfehlungsquote | 9 Antworten mit Empfehlung der Marke ÷ 36 verwertbare Antworten | 25% |
| Quote der Quellenangaben zur eigenen Domain | 6 Antworten mit Quellenangabe zur Website ÷ 36 verwertbare Antworten | 16,7% |
Das sind vorgeschlagene Stichprobenkennzahlen, keine offiziellen, plattformübergreifenden Definitionen. Die drei Präsenzquoten können sich überschneiden – addiere ihre Prozentwerte also nicht. Es gibt 20 verschiedene Fragen, nicht 40 verschiedene Fragen oder 36 verschiedene Kunden. Außerdem sind wiederholte Antworten nicht unbedingt statistisch unabhängig.
Die Empfehlungsquote bezieht sich auf die 36 verwertbaren Antworten. Die Vollständigkeit von 90 % macht sichtbar, dass Beobachtungen fehlen, deren Ergebnis unbekannt ist. Keine der beiden Zahlen zeigt, wie oft echte Kunden die Marke sehen würden.
Lege vor dem Sammeln fest, wie du mit Ausfällen umgehst
Eine gültige Antwort, die dein Unternehmen nicht empfiehlt, bleibt im Nenner. Auch eine Antwort, laut der sich kein passender Anbieter finden lässt, kann eine gültige negative Beobachtung sein. Ein Timeout des Tools oder eine fehlende Aufzeichnung ist dagegen ein Erhebungsfehler – den Grund hältst du gesondert fest.
Lege vorab eine einheitliche Regel für Wiederholungen fest. Stell eine Frage nach einer ungünstigen Antwort nicht so lange neu, bis das Unternehmen auftaucht. Verlangt dein Protokoll ausdrücklich eine Websuche und eine Antwort nutzt sie nicht, bewahre diese Beobachtung in einer eigenen Kategorie auf, statt sie stillschweigend zu verwerfen.
Bei Googles Übersicht mit KI (AI Overviews) gilt: Zeigt eine erfolgreich beobachtete Suche keine Übersicht, ist das eine Nicht-Auslösung und keine fehlerhafte Erhebung. Berechnest du die Aufnahme nur für Suchen, die eine Übersicht ausgelöst haben, nenne diesen Nenner und auch die Zahl der Nicht-Auslösungen.
Vergleiche nur Vergleichbares – im Zeitverlauf und mit Wettbewerbern
Vergleiche Wettbewerber anhand derselben gültigen Antworten und mit denselben Codierregeln. Zähl für diese Präsenzquoten jede Marke höchstens einmal pro Antwort. Nimm jeden benannten Wettbewerber in den vereinbarten Vergleich auf, statt starke Konkurrenten von Bericht zu Bericht gegen leichtere Gegner auszutauschen.
Werte die Ergebnisse getrennt nach Plattform, Sprache und Kaufabsicht aus. Ein Durchschnitt über alle Gruppen kann schon deshalb steigen, weil mehr einfache Fragen mit Markennamen oder mehr günstige Plattformen getestet wurden.
Unterscheidet sich die Vollständigkeit von Zeitraum zu Zeitraum, schau dir neben der Hauptquote auch die Fragen und Durchläufe an, die in beiden Zeiträumen vorkommen. Fallen schwierige Prompts aus dem Nenner, kann das Ergebnis besser aussehen, obwohl sich die tatsächlich gesammelten Antworten nicht verändert haben.
Wähle einen Erhebungsrhythmus, den dein Team durchhalten kann. Wiederholte Beobachtungen helfen, Schwankungen zu erkennen. Es gibt aber keine allgemeingültige Zahl an Prompts und keine Frequenz, die ein handverlesenes Set für jeden Kunden repräsentativ macht. Führ ein Änderungsprotokoll für veröffentlichte Inhalte, Tracking-Methoden, Prompt-Versionen und sichtbare Änderungen an den Plattformen.
Ergänze Plattformdaten aus erster Hand, ohne Einheiten zu vermischen
Googles Generative AI performance report for Search zeigt Link-Impressionen in der Übersicht mit KI (AI Overviews) und im KI-Modus, aufgeschlüsselt nach Seite, Land, Gerät und Datum. Er misst nicht jede unverlinkte Markennennung und nicht jede Empfehlung. Summen für die Property und für einzelne Seiten können wegen der Aggregation voneinander abweichen; geh also nicht davon aus, dass die Summe der Seitenzeilen die Property-Summe ergibt. Googles Dokumentation zum Bericht.
Das sind Impressionen, die die Plattform selbst erfasst. Sie gehören neben die Ergebnisse deiner ausgewählten Prompts – nicht addiert zur Zahl der Testantworten und nicht gemittelt mit einer Empfehlungsquote aus der Stichprobe.
Microsofts Reporting AI Performance erfasst Quellenangaben in unterstützten Angeboten von Copilot, Bing und Partnern – inklusive zitierter Seiten und stichprobenartiger Daten zu Grounding-Queries. Eine Vollerhebung aller KI-Assistenten ist das nicht. Bings Überblick zu AI Performance.
Außerdem bietet Microsoft als Vorschau die Kennzahl Citation Share für eine Grounding-Query an: den Anteil der Quellenangaben einer Website an allen Quellenangaben zu dieser Query. Microsoft grenzt sie ausdrücklich von Traffic-Anteil, Qualitätsscores und einer Liste von Wettbewerber-Domains ab. Der Nenner ist ein anderer als bei den Präsenzquoten oben. Bings erweitertes Reporting zur KI-Sichtbarkeit.
Mach den Bericht für die nächste Entscheidung nutzbar
Ein praxistauglicher Bericht sollte Stichprobe, Vollständigkeit, die einzelnen Ergebnisse und Veränderungen bei vergleichbaren Gruppen zeigen. Füge Beispiele für neu beobachtete Empfehlungen, verlorene Quellenangaben und wesentliche sachliche Fehler hinzu und halte die zugrunde liegenden Antworten zur Prüfung bereit.
Halte dann fest, was du genauer untersuchen musst. Mehr ungenaue Erwähnungen können ein Grund sein, Unternehmensangaben zu korrigieren. Mehr Quellenangaben zu einem fachfremden Thema bringen geschäftlich vielleicht wenig. Eine Veränderung nach einem Content-Update ist einen genaueren Blick wert – der zeitliche Zusammenhang allein beweist aber nicht, dass das Update sie ausgelöst hat.
Beauftragst du unseren GEO-Service in Dubai, stimm vor der ersten Baseline die wichtigsten Fragen und die Reporting-Definitionen mit unserem Team ab. Nützlich wird das Ganze, wenn die beauftragte Arbeit an Content oder Unternehmensangaben genau bei den beobachteten Lücken ansetzt.
Besuche, qualifizierte Anfragen und Verkäufe gehören in einen eigenen Akquisebericht. Die Sichtbarkeitsmessung zeigt dir, wie dein Unternehmen in den gesammelten Belegen vorkam. Was Kunden danach getan haben, misst sie nicht – dafür brauchst du eine eigene Messung.
