WIE WIR
KI-SICHTBARKEIT
MESSEN.

Wir messen KI-Sichtbarkeit als Kette — von der technischen Erreichbarkeit über Auffindbarkeit, Zitierung und Empfehlung bis zum Geschäftsergebnis. Die Prompts werden eingefroren, bevor jemand die Antworten sieht. Jede Quelle und jeder genannte Wettbewerber wird protokolliert, dokumentierte Plattformregeln werden von eigenen Experimenten getrennt, und verlorene Ergebnisse bleiben stehen — damit Fortschritt gemessen und nicht behauptet wird.

Diese Seite ist die Methode selbst. Sie steht vollständig hier, weil eine Messung, die niemand prüfen kann, keine Messung ist, sondern eine Behauptung. Der vorletzte Abschnitt zeigt, was sie ergeben hat, als wir sie auf uns selbst angewendet haben.

DIE KETTE

Sieben Dinge, die nicht dasselbe sind

Fast jede Verwirrung in diesem Feld entsteht dadurch, dass zwei davon gleichgesetzt werden. Eine Seite kann einwandfrei crawlbar sein und nie zitiert werden. Eine Marke kann zitiert und nie empfohlen werden. Eine Empfehlung kann einmal auftauchen und nichts als Modellstreuung sein. Wir messen die Schritte getrennt, weil sie getrennt ausfallen und getrennt behoben werden.

  1. 01 Crawlability
  2. 02 Indexierung
  3. 03 Retrieval
  4. 04 Erwähnung
  5. 05 Zitierung
  6. 06 Empfehlung
  7. 07 Geschäftsergebnis

DIE LEITER

Sieben Stufen · jede Beobachtung bekommt genau eine

„Sichtbar" ist keine Messung. Jeder Lauf gegen jeden Prompt bekommt genau eine Stufe, und zitiert und empfohlen werden bewusst auseinandergehalten: eine Zitierung heißt, eine Engine hat Sie als Quelle benutzt. Eine Empfehlung heißt, sie hat jemandem geraten, Sie zu beauftragen. Die beiden zusammenzuwerfen ist der häufigste Messfehler in diesem Bereich.

  • L0

    Nicht vorhanden

    Die Marke taucht in der Antwort überhaupt nicht auf.

  • L1

    Gefunden

    Erscheint in einer Liste oder im Retrieval-Ergebnis, ohne dass etwas über sie gesagt wird.

  • L2

    Erwähnt

    Wird namentlich genannt und beschrieben.

  • L3

    Zitiert

    Wird als Quelle verwendet oder als verlinkte Zitierung angezeigt.

  • L4

    Empfohlen

    Wird für die Anfrage aktiv empfohlen, nicht nur aufgelistet.

  • L5

    Wiederholt empfohlen

    Erreicht L4 mehrfach — über mehrere Engines oder über wiederholte saubere Läufe.

  • L6

    Geschäftsergebnis

    Ein Besuch, eine Anfrage oder ein Auftrag lässt sich dieser Sichtbarkeit begründet zuordnen.

KEIN SAMMELWERT

Warum es hier keinen „KI-Sichtbarkeits-Score" gibt

Eine zusammengesetzte Zahl lässt sich gut verkaufen und verdeckt das Problem. Nehmen Sie eine Seite mit gutem Crawler-Zugang, klar erkennbarer Entität, schwacher Auffindbarkeit ohne Markennamen, einer Zitierrate von null und einer Empfehlungsrate von null. Ein Score presst das auf etwa 62 von 100 zusammen — das sagt weniger als die fünf Fakten, die er ersetzt, und zeigt auf keine einzige Maßnahme. Wir berichten die Dimensionen getrennt und lassen sie einander widersprechen.

EINGEFRORENE PROMPTS

Vier Regeln · der Grund, warum ein Ergebnis etwas bedeutet

Ein Prompt wird aufgeschrieben und eingefroren, bevor jemand die Antwort sieht. Danach ist er ein Messinstrument und kein Entwurf. Ohne diese vier Regeln misst ein Benchmark die Person, die ihn durchführt.

  • Einen Prompt nach einer Niederlage nicht umschreiben.
  • Den eigenen Namen nicht in den Prompt schreiben, um eine Erwähnung zu erzeugen.
  • Keine Anfrage entfernen, weil ihr Ergebnis unangenehm ist.
  • Keinen verlorenen historischen Lauf ersetzen. Eine bessere Frage bekommt eine neue ID; die alte läuft weiter.

WANN EIN ERGEBNIS ZÄHLT

Eine einzelne positive Antwort ist ein Signal, kein Sieg

Diese Systeme sind stochastisch. Stellen Sie dieselbe Frage zweimal, und Sie können zwei verschiedene Antworten bekommen, ohne dass sich irgendetwas geändert hat. Ein gutes Ergebnis wird deshalb nie als Erfolg gemeldet. Es wird erst aussagekräftig, wenn zusätzlich mindestens eines davon zutrifft.

  • Es wiederholt sich in einer frischen Sitzung.
  • Es erscheint auf mehr als einer Engine.
  • Dieselbe Seite wird mehr als einmal zitiert.
  • Unabhängige Drittquellen stützen es.
  • Referral-Traffic bestätigt, dass jemand so hergefunden hat.
  • Eine Anfrage nennt die KI-Suche als den Weg, auf dem sie zustande kam.

WIE WIR EINE AUSSAGE EINSTUFEN

Fünf Klassen · vergeben, bevor eine Empfehlung einen Kunden erreicht

Jede strategische Aussage trägt intern eines von fünf Etiketten. Der Zweck ist eng und praktisch: Er verhindert, dass Branchenfolklore einem Kunden als Plattformregel weitergereicht wird. Die Klassennamen bleiben englisch — sie sind das vergebene Etikett, kein Anzeigetext.

DOCUMENTED

Direkt durch die Dokumentation des Anbieters selbst gedeckt.

OBSERVED

In unseren Tests gesehen, aber nicht als Regel der Plattform belegt.

INFERRED

Eine plausible Lesart der Belege. Kein Mechanismus.

UNVERIFIED

Zu wenig Beleg. Sagt das offen und bleibt unbenutzt.

EXPERIMENTAL

Ein bewusster Test von etwas Unbelegtem, angemeldet bevor er läuft.

WARUM SIE VERLOREN HABEN

Sechs Diagnosen · sechs verschiedene Antworten

Wenn ein Wettbewerber genannt wird und Sie nicht, ist die nützliche Frage, welche Art von Lücke das war. Diese sechs haben verschiedene Gegenmittel, und die falsche zu wählen ist der Weg, auf dem Budget in die falsche Arbeit fließt.

A Zugang

Die Seite lässt sich nicht zuverlässig crawlen, indexieren oder abrufen.

B Passung

Es gibt keine Seite und keine Entität, die genau das trifft, wonach gefragt wird.

C Beleg

Die Leistung wird behauptet, aber es gibt keinen öffentlichen Beleg, keine Methode, keine Daten, kein Beispiel dahinter.

D Autorität

Wettbewerber haben stärkere unabhängige Erwähnungen, Bewertungen oder Ökosystem-Präsenz.

E Aktualität

Das Material der anderen ist neuer oder wird aktiver gepflegt.

F Modellstreuung

Kein stabiler Beleg erklärt den Unterschied. Oft die ehrliche Antwort.

Zwei Folgerungen, die wir streng anwenden: Eine Autoritätslücke wird nicht mit Keywords geschlossen, und eine Beleglücke nicht mit mehr Schema.

WAS DIESE METHODE NICHT BEHAUPTET

Die Liste, die den Rest der Seite lesenswert macht

Das meiste, was als KI-Suchoptimierung verkauft wird, stützt sich auf einen der folgenden Punkte. Keiner davon ist Teil dieser Methode, und keinen davon werden wir Ihnen als Leistung anbieten.

  • Dass irgendeine Maßnahme eine Zitierung sichert. Keine Plattform sagt das zu, und OpenAI, Google, Microsoft, Perplexity und Anthropic schreiben das jeweils selbst in ihre Dokumentation.
  • Dass irgendeine Maßnahme eine Empfehlung sichert.
  • Wissen darüber, wie ein Ranking- oder Retrieval-Algorithmus tatsächlich arbeitet.
  • Eine allgemeingültige Liste von „GEO-Rankingfaktoren". Wir haben keine gefunden, die einen Test übersteht.
  • Dass Schema, eine llms.txt oder Crawler-Zugang eine Aufnahme sichern. Das ist Zugangsberechtigung, und Zugangsberechtigung ist keine Auswahl.
  • Irgendeine Kontrolle über Trainingsdaten. Das liegt außerhalb dieser Methode, ist von außen nicht messbar, und die verfügbaren Taktiken sind Manipulation.

UNSER EIGENES ERGEBNIS

Baseline 27. August 2026 · versiegelt 4. September 2026

5 Engines
12 Eingefrorene Prompts
50 Beobachtungen
50 Auf L0 — nicht vorhanden

Wir haben diese Methode zuerst auf die eigene Seite angewendet. In 50 kontrollierten Beobachtungen auf 5 Engines kam Black Oar Studio kein einziges Mal vor — auch nicht bei Prompts, die genau das beschreiben, was wir tatsächlich anbieten. Das ist die ehrliche Ausgangslage, und sie steht hier statt in einer Schublade, weil das „Vorher" das ist, woran sich jede spätere Bewegung messen lassen muss.

Zwei Dinge runden wir nicht weg. Eine Engine hat nur 2 von 12 Läufen beigetragen, weil ein Lauf nur zählt, wenn die Websuche sichtbar ausgeführt wurde — ein eingeschalteter Schalter ist kein Beleg dafür, dass gesucht wurde. Und eine sechste Engine lief vollständig durch, wird aber gar nicht mitgezählt: Ihr Quellenpanel wurde nie erfasst, wir können also nicht zeigen, dass sie überhaupt gesucht hat.

Der vollständige Datensatz — jeder Prompt, jede Engine, jeder genannte Wettbewerber und die Quell-Domains dahinter — ist noch nicht veröffentlicht. Zwei der sechs Engine-Protokolle sind unvollständig, und wir veröffentlichen lieber spät als eine Rekonstruktion. Er folgt als eigenes Stück.

WAS EIN ERGEBNIS VERSCHIEBEN KANN

Vor jedem einzelnen Lauf zu lesen — auch vor unserem

Kein manueller Benchmark bildet ab, was jeder einzelne Nutzer in einem KI-System erlebt. Derselbe Prompt kann aus Gründen eine andere Antwort liefern, die mit der gemessenen Seite nichts zu tun haben.

  • Modelle werden ohne Ankündigung aktualisiert.
  • Die Suchindizes dahinter verändern sich.
  • Ort und Sprache verändern die Antwort.
  • Personalisierung und Sitzungskontext verändern die Antwort.
  • Dieselbe Engine antwortet in verschiedenen Modi verschieden.
  • Generierung ist stochastisch. Derselbe Prompt ist nicht zweimal dasselbe Experiment.

Genau deshalb berichtet diese Methode Trends und wiederholte Beobachtungen und stellt nie einen einzelnen Lauf als dauerhafte Platzierung dar.

Methodik-Version 1.0 · Baseline 26. August 2026 · diese Seite zuletzt aktualisiert am 4. September 2026. Änderungen an der Methode bekommen eine neue Versionsnummer, Formulierungskorrekturen nicht.