DOCUMENTED
Direkt durch die Dokumentation des Anbieters selbst gedeckt.
FORSCHUNG · METHODIK V1.0
Wir messen KI-Sichtbarkeit als Kette — von der technischen Erreichbarkeit über Auffindbarkeit, Zitierung und Empfehlung bis zum Geschäftsergebnis. Die Prompts werden eingefroren, bevor jemand die Antworten sieht. Jede Quelle und jeder genannte Wettbewerber wird protokolliert, dokumentierte Plattformregeln werden von eigenen Experimenten getrennt, und verlorene Ergebnisse bleiben stehen — damit Fortschritt gemessen und nicht behauptet wird.
Diese Seite ist die Methode selbst. Sie steht vollständig hier, weil eine Messung, die niemand prüfen kann, keine Messung ist, sondern eine Behauptung. Der vorletzte Abschnitt zeigt, was sie ergeben hat, als wir sie auf uns selbst angewendet haben.
Sieben Dinge, die nicht dasselbe sind
Fast jede Verwirrung in diesem Feld entsteht dadurch, dass zwei davon gleichgesetzt werden. Eine Seite kann einwandfrei crawlbar sein und nie zitiert werden. Eine Marke kann zitiert und nie empfohlen werden. Eine Empfehlung kann einmal auftauchen und nichts als Modellstreuung sein. Wir messen die Schritte getrennt, weil sie getrennt ausfallen und getrennt behoben werden.
Sieben Stufen · jede Beobachtung bekommt genau eine
„Sichtbar" ist keine Messung. Jeder Lauf gegen jeden Prompt bekommt genau eine Stufe, und zitiert und empfohlen werden bewusst auseinandergehalten: eine Zitierung heißt, eine Engine hat Sie als Quelle benutzt. Eine Empfehlung heißt, sie hat jemandem geraten, Sie zu beauftragen. Die beiden zusammenzuwerfen ist der häufigste Messfehler in diesem Bereich.
Die Marke taucht in der Antwort überhaupt nicht auf.
Erscheint in einer Liste oder im Retrieval-Ergebnis, ohne dass etwas über sie gesagt wird.
Wird namentlich genannt und beschrieben.
Wird als Quelle verwendet oder als verlinkte Zitierung angezeigt.
Wird für die Anfrage aktiv empfohlen, nicht nur aufgelistet.
Erreicht L4 mehrfach — über mehrere Engines oder über wiederholte saubere Läufe.
Ein Besuch, eine Anfrage oder ein Auftrag lässt sich dieser Sichtbarkeit begründet zuordnen.
Warum es hier keinen „KI-Sichtbarkeits-Score" gibt
Eine zusammengesetzte Zahl lässt sich gut verkaufen und verdeckt das Problem. Nehmen Sie eine Seite mit gutem Crawler-Zugang, klar erkennbarer Entität, schwacher Auffindbarkeit ohne Markennamen, einer Zitierrate von null und einer Empfehlungsrate von null. Ein Score presst das auf etwa 62 von 100 zusammen — das sagt weniger als die fünf Fakten, die er ersetzt, und zeigt auf keine einzige Maßnahme. Wir berichten die Dimensionen getrennt und lassen sie einander widersprechen.
Vier Regeln · der Grund, warum ein Ergebnis etwas bedeutet
Ein Prompt wird aufgeschrieben und eingefroren, bevor jemand die Antwort sieht. Danach ist er ein Messinstrument und kein Entwurf. Ohne diese vier Regeln misst ein Benchmark die Person, die ihn durchführt.
Eine einzelne positive Antwort ist ein Signal, kein Sieg
Diese Systeme sind stochastisch. Stellen Sie dieselbe Frage zweimal, und Sie können zwei verschiedene Antworten bekommen, ohne dass sich irgendetwas geändert hat. Ein gutes Ergebnis wird deshalb nie als Erfolg gemeldet. Es wird erst aussagekräftig, wenn zusätzlich mindestens eines davon zutrifft.
Fünf Klassen · vergeben, bevor eine Empfehlung einen Kunden erreicht
Jede strategische Aussage trägt intern eines von fünf Etiketten. Der Zweck ist eng und praktisch: Er verhindert, dass Branchenfolklore einem Kunden als Plattformregel weitergereicht wird. Die Klassennamen bleiben englisch — sie sind das vergebene Etikett, kein Anzeigetext.
Direkt durch die Dokumentation des Anbieters selbst gedeckt.
In unseren Tests gesehen, aber nicht als Regel der Plattform belegt.
Eine plausible Lesart der Belege. Kein Mechanismus.
Zu wenig Beleg. Sagt das offen und bleibt unbenutzt.
Ein bewusster Test von etwas Unbelegtem, angemeldet bevor er läuft.
Sechs Diagnosen · sechs verschiedene Antworten
Wenn ein Wettbewerber genannt wird und Sie nicht, ist die nützliche Frage, welche Art von Lücke das war. Diese sechs haben verschiedene Gegenmittel, und die falsche zu wählen ist der Weg, auf dem Budget in die falsche Arbeit fließt.
Die Seite lässt sich nicht zuverlässig crawlen, indexieren oder abrufen.
Es gibt keine Seite und keine Entität, die genau das trifft, wonach gefragt wird.
Die Leistung wird behauptet, aber es gibt keinen öffentlichen Beleg, keine Methode, keine Daten, kein Beispiel dahinter.
Wettbewerber haben stärkere unabhängige Erwähnungen, Bewertungen oder Ökosystem-Präsenz.
Das Material der anderen ist neuer oder wird aktiver gepflegt.
Kein stabiler Beleg erklärt den Unterschied. Oft die ehrliche Antwort.
Zwei Folgerungen, die wir streng anwenden: Eine Autoritätslücke wird nicht mit Keywords geschlossen, und eine Beleglücke nicht mit mehr Schema.
Die Liste, die den Rest der Seite lesenswert macht
Das meiste, was als KI-Suchoptimierung verkauft wird, stützt sich auf einen der folgenden Punkte. Keiner davon ist Teil dieser Methode, und keinen davon werden wir Ihnen als Leistung anbieten.
Baseline 27. August 2026 · versiegelt 4. September 2026
Wir haben diese Methode zuerst auf die eigene Seite angewendet. In 50 kontrollierten Beobachtungen auf 5 Engines kam Black Oar Studio kein einziges Mal vor — auch nicht bei Prompts, die genau das beschreiben, was wir tatsächlich anbieten. Das ist die ehrliche Ausgangslage, und sie steht hier statt in einer Schublade, weil das „Vorher" das ist, woran sich jede spätere Bewegung messen lassen muss.
Zwei Dinge runden wir nicht weg. Eine Engine hat nur 2 von 12 Läufen beigetragen, weil ein Lauf nur zählt, wenn die Websuche sichtbar ausgeführt wurde — ein eingeschalteter Schalter ist kein Beleg dafür, dass gesucht wurde. Und eine sechste Engine lief vollständig durch, wird aber gar nicht mitgezählt: Ihr Quellenpanel wurde nie erfasst, wir können also nicht zeigen, dass sie überhaupt gesucht hat.
Der vollständige Datensatz — jeder Prompt, jede Engine, jeder genannte Wettbewerber und die Quell-Domains dahinter — ist noch nicht veröffentlicht. Zwei der sechs Engine-Protokolle sind unvollständig, und wir veröffentlichen lieber spät als eine Rekonstruktion. Er folgt als eigenes Stück.
Vor jedem einzelnen Lauf zu lesen — auch vor unserem
Kein manueller Benchmark bildet ab, was jeder einzelne Nutzer in einem KI-System erlebt. Derselbe Prompt kann aus Gründen eine andere Antwort liefern, die mit der gemessenen Seite nichts zu tun haben.
Genau deshalb berichtet diese Methode Trends und wiederholte Beobachtungen und stellt nie einen einzelnen Lauf als dauerhafte Platzierung dar.