DIE CRAWLER
DER KI-SUCHE.

Welche Crawler und Abrufagenten die Anbieter der KI-Suche dokumentieren, wozu jeder nach Aussage des Anbieters dient, und wie sich prüfen lässt, ob eine Anfrage, die sich als einer von ihnen ausgibt, echt ist. Jede Zeile verlinkt das Dokument des Anbieters, trägt eine von fünf Klassen und zeigt das Datum, an dem dieses Dokument zuletzt gelesen wurde.

Diese Seite beschreibt Steuerungen. Sie empfiehlt nicht, etwas zu erlauben oder zu sperren — was Sie mit diesen Steuerungen tun, hängt von Ihren Inhalten und Ihrem Geschäft ab —, und kein Anbieter auf dieser Seite garantiert, dass ein erlaubter Crawler zu einer Zitierung führt.

WIE DIESE SEITE ZU LESEN IST

Fünf Klassen · ein Prüfdatum in jeder Zeile · ein Termin für die nächste Prüfung

Jede Zeile dieser Seite trägt dreierlei: einen Link auf das Dokument des Anbieters, eine von fünf Klassen und das Datum, an dem dieses Dokument zuletzt gelesen wurde. Die Klassen sind dieselben fünf, mit denen wir jede eigene Aussage einstufen — einmal definiert, auf der Methodik-Seite.

DOCUMENTED

Direkt durch die Dokumentation des Anbieters selbst gedeckt.

OBSERVED

In unseren Tests gesehen, aber nicht als Regel der Plattform belegt.

INFERRED

Eine plausible Lesart der Belege. Kein Mechanismus.

UNVERIFIED

Zu wenig Beleg. Sagt das offen und bleibt unbenutzt.

EXPERIMENTAL

Ein bewusster Test von etwas Unbelegtem, angemeldet bevor er läuft.

Eine Zeile ist hier nur dann DOCUMENTED, wenn der Anbieter es in seiner eigenen Dokumentation sagt, verlinkt und datiert. Ein Crawler, der in Server-Logs auftaucht, aber in keinem Anbieter-Dokument, ist OBSERVED, nie DOCUMENTED. Wo wir aus dokumentierten Fakten einen Schluss ziehen, ist der Schluss als INFERRED markiert, getrennt von den Fakten. Nichts wird hochgestuft, weil es bequem wäre.

Geprüft
das Datum, an dem wir die Quelle der Zeile zuletzt gelesen haben. Jede Zeile trägt ihr eigenes; heute lautet es überall .
Nächste Prüfung
— jede Quelle neu gelesen, jede umgezogene oder geänderte Quelle markiert und neu datiert.
Zitate
immer im englischen Wortlaut des Anbieters, als Zitat markiert, in beiden Sprachversionen. Einen Anbieter-Wortlaut zu übersetzen, würde aus DOCUMENTED ein INFERRED machen.

Wie wir eine Aussage einstufen — auf der Methodik-Seite

PRÜFEN, OB EINE ANFRAGE ECHT IST

Veröffentlichte Endpunkte · Reverse DNS · die Schicht vor dem Origin

Ein User-Agent-String ist eine Behauptung, keine Identität. Jeder kann ihn senden. Was ein Anbieter veröffentlicht, um die Frage zu klären, ist eine IP-Liste, ein Reverse-DNS-Muster oder ein Werkzeug — und jeder Endpunkt unten hat am Datum seiner Zeile geantwortet.

AnbieterMethodeVeröffentlichte EndpunkteAbgerufenKlasseGeprüftQuelle
OpenAI Veröffentlichte IP-Bereiche, eine Liste je Agent. HTTP 200 am DOCUMENTED OpenAI · crawler documentation
Anthropic If a crawler has a source IP address on this list, it indicates that the crawler is coming from Anthropic. Eine veröffentlichte IP-Liste für alle Anthropic-Agenten. HTTP 200 am DOCUMENTED Anthropic · does Anthropic crawl data from the web
Perplexity Veröffentlichte IP-Bereiche, eine Liste je Agent. HTTP 200 am DOCUMENTED Perplexity · crawlers
Google The common crawlers generally crawl from the IP ranges published in the common-crawlers.json object, and the reverse DNS mask of their hostname matches crawl-***-***-***-***.googlebot.com or geo-crawl-***-***-***-***.geo.googlebot.com. Veröffentlichte IP-Bereiche je Crawler-Gruppe, dazu eine Reverse-DNS-Maske für die allgemeinen Crawler. HTTP 200 am DOCUMENTED Google · common crawlers
Apple Traffic coming from Applebot is generally identified by using reverse DNS in the *.applebot.apple.com domain. Another way is to match the IP address with a CIDR prefix contained in the following JSON file Reverse DNS in *.applebot.apple.com, oder eine veröffentlichte IP-Liste. HTTP 200 am DOCUMENTED Apple · about Applebot
Mistral Veröffentlichte IP-Listen für Index- und Nutzer-Agent. HTTP 200 am DOCUMENTED Mistral · robots
Amazon Veröffentlichte IP-Adressen, eine Seite je Agent. HTTP 200 am DOCUMENTED Amazon · Amazonbot
Microsoft Das Werkzeug „Verify Bingbot" in den Bing Webmaster Tools. ein Werkzeug hinter einem Login — nichts abzurufen DOCUMENTED Bing · which crawlers does Bing use von der gerenderten Seite transkribiert — die Tabelle entsteht per JavaScript

Zwei Dinge, die die Dokumentation hinzufügt

Alternate methods like blocking IP address(es) from which Anthropic Bots operates may not work correctly or persistently guarantee an opt-out, as doing so impedes our ability to read your robots.txt file. Anthropic · DOCUMENTED · 2026-09-05

Die IP-Liste ist zum Erkennen der Anthropic-Crawler veröffentlicht. Anthropic sagt ausdrücklich, dass das Sperren dieser Adressen kein verlässlicher Opt-out ist — die dokumentierte Steuerung ist die robots.txt.

If you’re using a Web Application Firewall (WAF) to protect your site, you may need to explicitly whitelist Perplexity’s bots to ensure they can access your content. Perplexity · DOCUMENTED · 2026-09-05

Die Prüfung muss unter Umständen vor dem Origin stattfinden. Eine robots.txt, die einen Crawler erlaubt, hilft nicht, wenn eine Firewall oder ein Bot-Schutz diesem Crawler mit einer Challenge antwortet — ein Fehler, der in der robots.txt unsichtbar ist und in der Analytik ebenso. Perplexitys Dokumentation sagt das wörtlich und listet Firewall-Einstellungen dafür.

DIE DREI AUFGABEN EINES CRAWLERS

Suche · Nutzerabruf · Training

Die Tabellen dieser Seite sind danach sortiert, was ein Agent tut — denn daran hängen die Steuerungen. Derselbe Anbieter betreibt oft einen von jeder Sorte. Diese Dreiteilung ist unsere Rahmung — INFERRED aus den dokumentierten Zwecken, keine Taxonomie, die ein Anbieter veröffentlicht —, und die Zeilen darunter sagen je Anbieter, wo die Dokumentation die drei tatsächlich trennt und wo nicht.

AufgabeWas er tutWas Sperren kostet
Suche Baut einen Index, damit der Anbieter Ihre Seiten in seinem Suchprodukt anzeigen und verlinken kann. Ihre Seiten kommen für die Antworten dieses Produkts nicht mehr infrage.
Nutzerabruf Holt eine einzelne Seite, weil eine Person gerade eine Frage gestellt hat, die sie braucht. Der Assistent kann Ihre Seite für jemanden, der danach gefragt hat, nicht öffnen.
Training Sammelt Inhalte, die zum Training von Basismodellen verwendet werden können. Ihre Inhalte bleiben aus künftigen Trainingsdaten draußen — bei den Anbietern, die die Trennung dokumentieren.

SUCHBOTS

Der Agent, den man erlaubt, wenn man in den Antworten dieses Anbieters erscheinen will

AnbieterUser AgentWortlaut des AnbietersKlasseGeprüftQuelle
OpenAI OAI-SearchBot OAI-SearchBot is for search. OAI-SearchBot is used to surface websites in search results in ChatGPT’s search features. Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers, though can still appear as navigational links. DOCUMENTED OpenAI · crawler documentation
Google Googlebot Crawling preferences addressed to the Googlebot user agent affect Google Search (including Discover and all Google Search features), as well as other products such as Google Images, Google Video, Google News, and Discover. DOCUMENTED Google · common crawlers
Microsoft bingbot our standard crawler … handles most of our crawling needs each day von der gerenderten Seite transkribiert — die Tabelle entsteht per JavaScript DOCUMENTED Bing · which crawlers does Bing use von der gerenderten Seite transkribiert — die Tabelle entsteht per JavaScript
Perplexity PerplexityBot PerplexityBot is designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models. DOCUMENTED Perplexity · crawlers
Anthropic Claude-SearchBot Claude-SearchBot navigates the web to improve search result quality for users. It analyzes online content specifically to enhance the relevance and accuracy of search responses. Disabling Claude-SearchBot on your site prevents our system from indexing your content for search optimization, which may reduce your site’s visibility and accuracy in user search results. DOCUMENTED Anthropic · does Anthropic crawl data from the web

OpenAI dokumentiert noch einen vierten Agenten, OAI-AdsBot, der in keine der drei Klassen fällt: OAI-AdsBot only visits pages submitted as ads, and the data collected by OAI-AdsBot is not used to train generative AI foundation models. — DOCUMENTED · 2026-09-05 · OpenAI · crawler documentation.

Zwei Einträge, die Abwesenheiten sind

Google dokumentiert keinen eigenen Crawler für AI Overviews oder AI Mode.

To be eligible to be shown in generative AI features on Google Search, a page must be indexed and eligible to be shown in Google Search with a snippet, fulfilling the Search technical requirements. Just because a page meets all requirements, best practices, and complies with the policies, doesn’t mean that Google will crawl, index, or serve its content. Indexing and serving aren’t guaranteed. Google · DOCUMENTED · 2026-09-05

Googles Liste der allgemeinen Crawler enthält keinen Agenten für die generativen KI-Funktionen, und der Leitfaden knüpft die Berechtigung dafür an die Berechtigung für die Suche. Unsere Lesart: Für Googles KI-Antworten gibt es nichts Zusätzliches zu erlauben — Googlebot ist die Steuerung, und die dokumentierte Zusatzbedingung liegt in der Search Console, nicht in der robots.txt (siehe die Seitensteuerungen unten). INFERRED · Google · AI features and your website

Microsoft dokumentiert keinen eigenen Copilot-Crawler.

Bings dokumentierte Crawler sind bingbot, AdIdxBot, BingPreview, MicrosoftPreview und BingVideoPreview — von der gerenderten Seite gelesen, weil die Tabelle per JavaScript entsteht. Keiner ist Copilot-spezifisch. Unsere Lesart: Die Steuerungen, die Microsoft für KI-Antworten dokumentiert, sind Meta-Werte auf Seitenebene, kein User Agent (siehe die Seitensteuerungen unten). INFERRED · Bing · which crawlers does Bing use · von der gerenderten Seite transkribiert

NUTZERABRUF-AGENTEN

Eine Seite, weil eine Person gefragt hat — und die robots.txt gilt womöglich nicht

Diese Agenten holen eine Seite, weil jemand eine Frage gestellt hat, die sie braucht. Von den Anbietern dieser Seite, die einen solchen Agenten dokumentieren, nennen fünf eine Ausnahme von der robots.txt für nutzerveranlasste Abrufe — OpenAI, Perplexity, Google, Meta und Amazon, die letzten beiden in der Tabelle der fünf weiteren Anbieter weiter unten. Zwei dokumentieren einen solchen Agenten, ohne eine Ausnahme zu nennen: Anthropic, das pauschale Einhaltung erklärt, und Mistral. Ob sich dieser Unterschied in der Praxis zeigt, kann eine Tabelle aus Dokumentation nicht beantworten — das wäre OBSERVED und bräuchte Server-Logs. Es steht hier als Asymmetrie in der Dokumentation, nicht mehr.

AnbieterUser AgentWortlaut des Anbietersrobots.txtKlasseGeprüftQuelle
OpenAI ChatGPT-User When users ask ChatGPT or a CustomGPT a question, it may visit a web page with a ChatGPT-User agent. […] ChatGPT-User is not used for crawling the web in an automatic fashion. Because these actions are initiated by a user, robots.txt rules may not apply. DOCUMENTED OpenAI · crawler documentation
Perplexity Perplexity-User Perplexity-User supports user actions within Perplexity. When users ask Perplexity a question, it might visit a web page to help provide an accurate answer and include a link to the page in its response. […] It is not used for web crawling or to collect content for training AI foundation models. Since a user requested the fetch, this fetcher generally ignores robots.txt rules. DOCUMENTED Perplexity · crawlers
Anthropic Claude-User Claude-User supports Claude AI users. When individuals ask questions to Claude, it may access websites using a Claude-User agent. Claude-User allows site owners to control which sites can be accessed through these user-initiated requests. Anthropic’s Bots respect “do not crawl” signals by honoring industry standard directives in robots.txt. Eine Ausnahme für nutzerveranlasste Abrufe wird nicht genannt. DOCUMENTED Anthropic · does Anthropic crawl data from the web
Google Google-Agent · Google-GeminiNotebook · Google-Read-Aloud · Google-Pinpoint · … Google-Agent is used by agents hosted on Google infrastructure to navigate the web and perform actions upon user request. The Gemini Notebook fetcher requests individual URLs that Gemini Notebook users have provided as sources for their projects. Because the fetch was requested by a user, these fetchers generally ignore robots.txt rules. DOCUMENTED Google · user-triggered fetchers
  • Keine Erlaubnis. „Gilt womöglich nicht" beschreibt das Verhalten des Anbieters. Es macht den Abruf nicht autorisiert und berührt keine andere rechtliche oder vertragliche Steuerung, die Sie haben.
  • Kein Weg in die Suche. OpenAI: ChatGPT-User is not used to determine whether content may appear in Search. Please use OAI-SearchBot in robots.txt for managing Search opt outs and automatic crawl. Wer ChatGPT-User erlaubt, bringt damit keine Seite in die ChatGPT-Suche.

TRAININGSBOTS

Eine Entscheidung über Datenlizenzen — getrennt von der Suche, wo der Anbieter die Trennung dokumentiert

Diese zu sperren ist eine Entscheidung über Ihre Inhalte. Bei den drei Anbietern unten trennt die Dokumentation diese Entscheidung von der Suchsichtbarkeit — zweimal im Wortlaut des Anbieters, einmal als unser Schluss —, und die Spalte sagt, was was ist.

AnbieterUser AgentWortlaut des AnbietersKostet Sperren Suchsichtbarkeit?KlasseGeprüftQuelle
OpenAI GPTBot GPTBot is used to make our generative AI foundation models more useful and safe. It is used to crawl content that may be used in training our generative AI foundation models. a webmaster can allow OAI-SearchBot in order to appear in search results while disallowing GPTBot to indicate that crawled content should not be used for training OpenAI’s generative AI foundation models. DOCUMENTED DOCUMENTED OpenAI · crawler documentation
Anthropic ClaudeBot ClaudeBot helps enhance the utility and safety of our generative AI models by collecting web content that could potentially contribute to their training. When a site restricts ClaudeBot access, it signals that the site’s future materials should be excluded from our AI model training datasets. Ein eigener Agent neben Claude-SearchBot, jeder mit eigener dokumentierter Wirkung. Dass das Sperren des einen den anderen unberührt lässt, steht dort nicht wörtlich. INFERRED DOCUMENTED Anthropic · does Anthropic crawl data from the web
Google Google-Extended robots.txt-Token — kein eigener User-Agent-String Google-Extended is a standalone product token that web publishers can use to manage whether content Google crawls from their sites may be used for training future generations of Gemini models that power Gemini Apps and Vertex AI API for Gemini and for grounding […] in Gemini Apps and Grounding with Google Search on Vertex AI. Google-Extended doesn’t have a separate HTTP request user agent string. Crawling is done with existing Google user agent strings; the robots.txt user-agent token is used in a control capacity. Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search. DOCUMENTED DOCUMENTED Google · common crawlers

Die am häufigsten missverstandene Steuerung dieser Seite

Google-Extended steuert weder AI Overviews noch AI Mode. Beides ist Suche, und die Suche steuert Googlebot. Google-Extended steuert das Training der Gemini-Modelle und das Grounding in Gemini Apps und Vertex AI, und Google erklärt, dass es die Aufnahme einer Seite in die Suche nicht berührt. Dass eine Seite, die Google-Extended sperrt, weiterhin in Googles KI-Antworten erscheinen kann, folgt aus diesen beiden dokumentierten Sätzen — INFERRED, nicht zitiert.

Getrennte Steuerungen heißen nicht immer getrennte Abrufe. OpenAI: If your site has allowed both bots, we may use the results from just one crawl for both use cases to avoid duplicative crawling. — DOCUMENTED · 2026-09-05.

STEUERUNGEN, DIE KEIN USER AGENT SIND

Seitenebene: ein Meta-Wert, eine Einstellung in der Search Console

Nicht jede Steuerung ist eine Zeile in der robots.txt. Diese hier wirken auf Seitenebene, ohne User Agent, und vier Anbieter dokumentieren eine. Microsofts zwei Tags trennen drei Zustände: in der KI-Antwort mit Inhalt (kein Tag), in der Antwort nur als URL, Titel und Snippet (NOCACHE), ganz aus der Antwort heraus (NOARCHIVE) — und Microsoft erklärt, dass beide Tags die Seite in den normalen Suchergebnissen lassen.

SteuerungAnbieterWortlaut des AnbietersKlasseGeprüftQuelle
NOCACHE (robots meta) Microsoft Content with the NOCACHE tag may be included in Bing Chat answers. We will only display URL/Snippet/Title in the answer; Going forward, for content in our Bing Index that is labeled NOCACHE, only URLs, Titles and Snippets may be used in training Microsoft’s generative AI foundation models. Blogbeitrag vom September 2023; das Produkt heißt dort noch „Bing Chat". DOCUMENTED Bing Webmaster Blog · NOCACHE and NOARCHIVE
NOARCHIVE (robots meta) Microsoft Content tagged NOARCHIVE will not be included in Bing Chat answers, not be linked to in the answers. Going forward, for content in our Bing Index that is labeled NOARCHIVE, we will not use the content for training Microsoft’s generative AI foundation models. We can assure publishers that content with the NOCACHE tag or NOARCHIVE tag will still appear in our search results.Blogbeitrag vom September 2023; das Produkt heißt dort noch „Bing Chat". DOCUMENTED Bing Webmaster Blog · NOCACHE and NOARCHIVE
Search Console · “Search generative AI features” Google In addition to the technical requirements for Search, a site must be included in Search generative AI features in Search Console to be eligible for display in generative AI features on Google Search. DOCUMENTED Google · AI features and your website
nosnippet (robots meta) Apple Apple will not use data tagged nosnippet as additional context and up-to-date content when AI models are used to generate output for display in Apple products and services. Even if you disallow Applebot-Extended and tag website content with the nosnippet meta tag, your website instructions may still allow Applebot to crawl your webpages. DOCUMENTED Apple · about Applebot
noarchive (robots meta) Amazon When these user agents access web pages they respect the link-level rel=nofollow directive, and page level robots meta tags of noarchive (do not use the page for model training), noindex (do not index the page) and none (do not index the page). DOCUMENTED Amazon · Amazonbot

FÜNF WEITERE ANBIETER

Mistral · Meta · Apple · Amazon · Common Crawl

Fünf Anbieter, die ihre Agenten dokumentieren und in den Tabellen oben nicht stehen. Mistral dokumentiert ein sauberes Dreierset. Meta dokumentiert einen Such-Agenten, einen Nutzer-Abrufer und einen Trainings-Crawler — von der gerenderten Seite gelesen, weil der Rohabruf verweigert wurde, und in jeder Zeile so markiert. Apples Such-Crawler speist auch das Modelltraining, solange ein zweites Token nicht gesperrt ist. Amazon dokumentiert drei Agenten mit unabhängigen Einstellungen. Common Crawl ist weder Suchmaschine noch Assistent.

AnbieterUser AgentAufgabeWortlaut des Anbietersrobots.txtKlasseGeprüftQuelle
Mistral MistralAI-Index Suche MistralAI-Index is for automated crawling of the web for indexing purposes only. It indexes content for Mistral search, which helps answer user questions in Vibe. Content crawled by MistralAI-Index is not used for generative AI training of any kind. DOCUMENTED Mistral · robots
Mistral MistralAI-User Nutzerabruf MistralAI-User is for user actions in Vibe. When users ask Vibe a question, it may visit a web page to help answer and include a link to the source in its response. […] It is not used for crawling the web in any automatic fashion, nor to crawl content for generative AI training. DOCUMENTED Mistral · robots
Mistral MistralAI-Training Training MistralAI-Training crawls web content to help build datasets for training Mistral generative AI models. […] This crawler is not used for search indexing or to answer live user queries in Vibe. DOCUMENTED Mistral · robots
Meta Meta-WebIndexer Suche navigates the web to improve Meta AI search result quality cite and link to your content in Meta AI’s responsesvon der gerenderten Seite transkribiert — der Rohabruf wurde verweigert DOCUMENTED Meta · web crawlers von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert
Meta Meta-ExternalFetcher Nutzerabruf fetches individual links at a user’s request von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert might bypass robots.txt von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert DOCUMENTED Meta · web crawlers von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert
Meta Meta-ExternalAgent Training crawls the web for use cases such as training foundation AI models or improving products von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert DOCUMENTED Meta · web crawlers von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert
Apple Applebot Suche The data crawled by Applebot is used to power various features, such as the search technology integrated into many user experiences in Apple’s ecosystem including Spotlight, Siri, and Safari. The data crawled by Applebot may also be used to help train Apple foundation models powering generative AI features across Apple products […]. Web publishers can opt-out from having their content used to train generative foundation models by disallowing Applebot-Extended in the robots.txt file. DOCUMENTED Apple · about Applebot
Apple Applebot-Extended robots.txt-Token — kein eigener User-Agent-String Training Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results. Applebot-Extended is only used to determine how to use the data crawled by the Applebot user agent. DOCUMENTED Apple · about Applebot
Amazon Amzn-SearchBot Suche Amzn-SearchBot is used to improve search experiences in Amazon products and services. By permitting Amzn-SearchBot access to your website, your content is eligible to appear in search experiences such as Alexa. If robots.txt files don’t mention Amzn-SearchBot but allow other search bots, Amzn-SearchBot will crawl in accordance with the robots.txt directives given to other search bots. Amzn-SearchBot does not crawl content for generative AI model training. DOCUMENTED Amazon · Amazonbot
Amazon Amzn-User Nutzerabruf Amzn-User supports user actions, such as responding to Alexa queries that require up-to-date information. […] Amzn-User does not crawl content for generative AI model training. Because actions taken by Amzn-User can be initiated by a user, it may not follow all robots.txt directives. DOCUMENTED Amazon · Amazonbot
Amazon Amazonbot Training Amazonbot is used to improve our products and services. This helps us provide more accurate information to customers and may be used to train Amazon AI models. This page describes how webmasters can control Amazonbot, Amzn-SearchBot, and Amzn-User interactions with their site. Each user agent setting is independent of the othersEin Agent für Produktverbesserung und mögliches Training. Eine feinere Trennung innerhalb von Amazonbot dokumentiert Amazon nicht — der Trainings-Opt-out ist Amazonbot selbst; Suche und Nutzerabruf haben eigene Agenten. DOCUMENTED Amazon · Amazonbot
Common Crawl CCBot Offenes Archiv Common Crawl is a non-profit foundation founded with the goal of democratizing access to web information by producing and maintaining an open repository of web crawl data that is universally accessible and analyzable by anyone. Keine Suchmaschine und kein Assistent. Wer ihn sperrt, wirkt auf ein Archiv, das viele nutzen — Modellbauer darunter —, nicht auf ein Produkt, in dem man erscheinen kann. DOCUMENTED Common Crawl · CCBot

WAS NICHT DOKUMENTIERT IST

Zwei Namen, die kursieren — und für keinen eine Anbieterquelle

Zwei Crawler-Namen tauchen ständig auf und stehen in keinem Dokument ihres Anbieters. Sie sind hier UNVERIFIED und bleiben es, bis der Anbieter sie dokumentiert. Drittverzeichnisse wurden gefunden und als Quelle abgelehnt — es gibt mehrere, und keines ist eine Anbieterquelle.

AnbieterBefundKlasseGeprüftQuelle
DeepSeek Keine Crawler-Dokumentation des Anbieters gefunden. deepseek.com/robots.txt nennt keinen eigenen Agenten. Drittverzeichnisse führen einen „DeepSeekBot"; keines ist eine Anbieterquelle. Bleibt ungeprüft, bis DeepSeek es dokumentiert.
User-Agent: *
Allow: /
UNVERIFIED Keine Anbieterquelle gefunden.
ByteDance (“Bytespider”) Keine Crawler-Dokumentation des Anbieters gefunden. Der Name kursiert in Drittlisten und Server-Logs; beides ist keine Anbieteraussage. Gleiche Behandlung. UNVERIFIED Keine Anbieterquelle gefunden.

Ebenfalls nicht auf dieser Seite

  • Eine empfohlene robots.txt. Was Sie erlauben, ist eine Geschäftsentscheidung über Ihre Inhalte, kein technischer Standardwert. Diese Seite liefert die Klassen, mit denen Sie sie treffen können.
  • Die Behauptung, ein erlaubter Agent führe zu einer Zitierung. Jeder Anbieter, der sich dazu äußert, garantiert keine Aufnahme. Berechtigung ist keine Auswahl.
  • Crawler-Listen Dritter. Es gibt mehrere; keine ist eine Anbieterquelle, und diese Seite hat genau eine Quellenregel: Eine DOCUMENTED-Zeile kommt vom Anbieter.
  • Beobachtungen aus Server-Logs. Wir haben keine Crawler-Zugriffe veröffentlicht. Wenn wir es tun, sind diese Zeilen OBSERVED und stehen klar getrennt von diesen hier.

LLMS.TXT

Googles Wortlaut, zweimal — und die Datei, die wir trotzdem pflegen

Die Google-Suche ignoriert sie. In Googles Worten:

You don’t need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search (including its generative AI capabilities), as Google Search itself doesn’t use them. Google · DOCUMENTED · 2026-09-05
It’s completely fine if you decide to create and maintain LLMS.txt files (or other similar files) for other services or systems that use these files. Doing so will neither harm nor help your site’s visibility or rankings in Google Search, as Google Search ignores them. Google · DOCUMENTED · 2026-09-05

Das ist die ganze Google-Antwort, und diese Seite schwächt sie nicht ab. Welche Werkzeuge lesen die Datei? Einige. Diese Seite listet sie nicht, weil wir kein einziges aus einer Anbieterquelle geprüft haben — jede Liste hier wäre UNVERIFIED im Gewand einer Referenz. Prüfen wir eines, bekommt es eine Zeile, einen Link und ein Datum wie alles andere.

Wir veröffentlichen auf dieser Seite eine llms.txt und pflegen sie von Hand, für die Werkzeuge, die sie lesen. Sie ist nicht Teil irgendeiner Aussage über Google.

Drei benachbarte Annahmen, dieselbe Quelle, dasselbe Datum

Verbreitete AnnahmeGoogles WortlautKlasseGeprüftQuelle
Inhalte müssen für KI in kleine Stücke zerlegt werden. There’s no requirement to break your content into tiny pieces for AI to better understand it. DOCUMENTED Google · AI features and your website
Für KI-Funktionen braucht es besondere strukturierte Daten. Structured data isn’t required for generative AI search, and there’s no special schema.org markup you need to add. DOCUMENTED Google · AI features and your website
Für die KI-Suche braucht es einen eigenen Schreibstil. The best practices for SEO continue to be relevant because our generative AI features on Google Search are rooted in our core Search ranking and quality systems. DOCUMENTED Google · AI features and your website

WAS WIR AUF DER EIGENEN SEITE FAHREN

Offenlegung · OBSERVED · gegen die Live-Datei prüfbar

blackoarstudio.com/robots.txt · gelesen

User-agent: *
Allow: /

Sitemap: https://blackoarstudio.com/sitemap-index.xml

Jeder Agent dieser Seite ist auf dieser Website derzeit erlaubt, die Trainingsbots eingeschlossen. Das ist eine bewusste Position für ein Studio ohne lizenziertes Archiv, das es zu schützen gäbe — und kein Rat. Ein Verlag mit Inhalten, die sich lizenzieren lassen, kann vernünftigerweise das Gegenteil entscheiden; die Trainingstabelle oben ist genau die Tabelle, mit der das geht, ohne Suchsichtbarkeit zu verlieren — dort, wo der Anbieter die Trennung dokumentiert.

OBSERVED — eine Live-Kopie unserer eigenen Datei, 2026-09-05. Keine Anbieteraussage.

PRÜFRHYTHMUS

Nächste Prüfung: 2026-12-05

Diese Seite beschreibt die Systeme anderer und veraltet ohne Vorwarnung — auf eine Art, die ein Link-Check nicht erkennt. Unsere eigene Quellenliste entstand am 26. August 2026 und wurde am 2026-09-05 neu gelesen. Was dabei herauskam — OBSERVED:

  • Jede URL unserer eigenen Liste vom 26. August 2026 löste am 5. September 2026 noch auf. Ein Link-Check hätte nichts gemeldet.
  • In denselben zehn Tagen tauchten zwei Agenten in Anbieter-Dokumentationen auf, die auf keiner unserer Listen standen: OpenAIs OAI-AdsBot und Metas Meta-WebIndexer. Keiner bewegte eine URL.
  • Googles Leitfaden wurde zu llms.txt so deutlich, dass er sich wörtlich zitieren lässt. Die URL blieb; der Wortlaut nicht.
  • Zwei Dokumentations-Adressen zogen um (OpenAIs Bots-Seite und Googles Crawler-Übersicht), beide mit Weiterleitung. Beide stehen hier unter ihrer aktuellen Adresse.

Inhalte driften unter stabilen URLs. Deshalb trägt jede Zeile ein Datum und nicht nur einen Link.

  • Jede Zeile trägt das Datum, an dem ihre Quelle zuletzt gelesen wurde. Dieses Datum ist die Aussage.
  • Neu geprüft vierteljährlich — und immer, wenn ein Anbieter eine Änderung ankündigt.
  • Zieht eine Quelle um, ändert sie ihren Wortlaut oder verschwindet sie, wird die Zeile markiert und neu datiert. Die alte Aussage wird nie still umgeschrieben — dieselbe Regel, die wir auf unsere eigenen Messungen anwenden.
  • Nächste planmäßige Prüfung: 2026-12-05.

QUELLEN

Nur Anbieter-Dokumente · gelesen 2026-09-05 · mit Prüfsummen gesichert

Zwei Dokumente ließen sich nicht roh sichern und sind oben und in ihren Zeilen markiert. Beide wurden von der gerenderten Seite gelesen. Festgehalten, damit ein Leser weiß, welche Zeilen auf einem gesicherten Dokument ruhen und welche auf einer Abschrift. Die IP-Endpunkte der Prüftabelle wurden am selben Datum abgerufen und neben den Dokumenten gesichert.

Referenz Version 1.0 · veröffentlicht 2026-09-05 · jede Quelle gelesen 2026-09-05 · nächste Prüfung 2026-12-05. Eine umgezogene oder geänderte Quelle bekommt eine markierte, neu datierte Zeile; die alte Aussage wird nie still umgeschrieben. Die Versionsnummer ändert sich, wenn sich die Substanz einer Zeile ändert, nicht, wenn ein Satz umformuliert wird.