DOCUMENTED
Direkt durch die Dokumentation des Anbieters selbst gedeckt.
FORSCHUNG · REFERENZ V1.0 · QUELLEN GELESEN 2026-09-05
Welche Crawler und Abrufagenten die Anbieter der KI-Suche dokumentieren, wozu jeder nach Aussage des Anbieters dient, und wie sich prüfen lässt, ob eine Anfrage, die sich als einer von ihnen ausgibt, echt ist. Jede Zeile verlinkt das Dokument des Anbieters, trägt eine von fünf Klassen und zeigt das Datum, an dem dieses Dokument zuletzt gelesen wurde.
Diese Seite beschreibt Steuerungen. Sie empfiehlt nicht, etwas zu erlauben oder zu sperren — was Sie mit diesen Steuerungen tun, hängt von Ihren Inhalten und Ihrem Geschäft ab —, und kein Anbieter auf dieser Seite garantiert, dass ein erlaubter Crawler zu einer Zitierung führt.
Fünf Klassen · ein Prüfdatum in jeder Zeile · ein Termin für die nächste Prüfung
Jede Zeile dieser Seite trägt dreierlei: einen Link auf das Dokument des Anbieters, eine von fünf Klassen und das Datum, an dem dieses Dokument zuletzt gelesen wurde. Die Klassen sind dieselben fünf, mit denen wir jede eigene Aussage einstufen — einmal definiert, auf der Methodik-Seite.
Direkt durch die Dokumentation des Anbieters selbst gedeckt.
In unseren Tests gesehen, aber nicht als Regel der Plattform belegt.
Eine plausible Lesart der Belege. Kein Mechanismus.
Zu wenig Beleg. Sagt das offen und bleibt unbenutzt.
Ein bewusster Test von etwas Unbelegtem, angemeldet bevor er läuft.
Eine Zeile ist hier nur dann DOCUMENTED, wenn der Anbieter es in seiner eigenen Dokumentation sagt, verlinkt und datiert. Ein Crawler, der in Server-Logs auftaucht, aber in keinem Anbieter-Dokument, ist OBSERVED, nie DOCUMENTED. Wo wir aus dokumentierten Fakten einen Schluss ziehen, ist der Schluss als INFERRED markiert, getrennt von den Fakten. Nichts wird hochgestuft, weil es bequem wäre.
Veröffentlichte Endpunkte · Reverse DNS · die Schicht vor dem Origin
Ein User-Agent-String ist eine Behauptung, keine Identität. Jeder kann ihn senden. Was ein Anbieter veröffentlicht, um die Frage zu klären, ist eine IP-Liste, ein Reverse-DNS-Muster oder ein Werkzeug — und jeder Endpunkt unten hat am Datum seiner Zeile geantwortet.
| Anbieter | Methode | Veröffentlichte Endpunkte | Abgerufen | Klasse | Geprüft | Quelle |
|---|---|---|---|---|---|---|
| OpenAI | Veröffentlichte IP-Bereiche, eine Liste je Agent. | HTTP 200 am | DOCUMENTED | OpenAI · crawler documentation | ||
| Anthropic | If a crawler has a source IP address on this list, it indicates that the crawler is coming from Anthropic. Eine veröffentlichte IP-Liste für alle Anthropic-Agenten. | HTTP 200 am | DOCUMENTED | Anthropic · does Anthropic crawl data from the web | ||
| Perplexity | Veröffentlichte IP-Bereiche, eine Liste je Agent. | HTTP 200 am | DOCUMENTED | Perplexity · crawlers | ||
The common crawlers generally crawl from the IP ranges published in the common-crawlers.json object, and the reverse DNS mask of their hostname matches crawl-***-***-***-***.googlebot.com or geo-crawl-***-***-***-***.geo.googlebot.com. Veröffentlichte IP-Bereiche je Crawler-Gruppe, dazu eine Reverse-DNS-Maske für die allgemeinen Crawler. | HTTP 200 am | DOCUMENTED | Google · common crawlers | |||
| Apple | Traffic coming from Applebot is generally identified by using reverse DNS in the *.applebot.apple.com domain. Another way is to match the IP address with a CIDR prefix contained in the following JSON file Reverse DNS in *.applebot.apple.com, oder eine veröffentlichte IP-Liste. | HTTP 200 am | DOCUMENTED | Apple · about Applebot | ||
| Mistral | Veröffentlichte IP-Listen für Index- und Nutzer-Agent. | HTTP 200 am | DOCUMENTED | Mistral · robots | ||
| Amazon | Veröffentlichte IP-Adressen, eine Seite je Agent. | HTTP 200 am | DOCUMENTED | Amazon · Amazonbot | ||
| Microsoft | Das Werkzeug „Verify Bingbot" in den Bing Webmaster Tools. | | ein Werkzeug hinter einem Login — nichts abzurufen | DOCUMENTED | Bing · which crawlers does Bing use von der gerenderten Seite transkribiert — die Tabelle entsteht per JavaScript |
Alternate methods like blocking IP address(es) from which Anthropic Bots operates may not work correctly or persistently guarantee an opt-out, as doing so impedes our ability to read your robots.txt file.Anthropic · DOCUMENTED · 2026-09-05
Die IP-Liste ist zum Erkennen der Anthropic-Crawler veröffentlicht. Anthropic sagt ausdrücklich, dass das Sperren dieser Adressen kein verlässlicher Opt-out ist — die dokumentierte Steuerung ist die robots.txt.
If you’re using a Web Application Firewall (WAF) to protect your site, you may need to explicitly whitelist Perplexity’s bots to ensure they can access your content.Perplexity · DOCUMENTED · 2026-09-05
Die Prüfung muss unter Umständen vor dem Origin stattfinden. Eine robots.txt, die einen Crawler erlaubt, hilft nicht, wenn eine Firewall oder ein Bot-Schutz diesem Crawler mit einer Challenge antwortet — ein Fehler, der in der robots.txt unsichtbar ist und in der Analytik ebenso. Perplexitys Dokumentation sagt das wörtlich und listet Firewall-Einstellungen dafür.
Suche · Nutzerabruf · Training
Die Tabellen dieser Seite sind danach sortiert, was ein Agent tut — denn daran hängen die Steuerungen. Derselbe Anbieter betreibt oft einen von jeder Sorte. Diese Dreiteilung ist unsere Rahmung — INFERRED aus den dokumentierten Zwecken, keine Taxonomie, die ein Anbieter veröffentlicht —, und die Zeilen darunter sagen je Anbieter, wo die Dokumentation die drei tatsächlich trennt und wo nicht.
| Aufgabe | Was er tut | Was Sperren kostet |
|---|---|---|
| Suche | Baut einen Index, damit der Anbieter Ihre Seiten in seinem Suchprodukt anzeigen und verlinken kann. | Ihre Seiten kommen für die Antworten dieses Produkts nicht mehr infrage. |
| Nutzerabruf | Holt eine einzelne Seite, weil eine Person gerade eine Frage gestellt hat, die sie braucht. | Der Assistent kann Ihre Seite für jemanden, der danach gefragt hat, nicht öffnen. |
| Training | Sammelt Inhalte, die zum Training von Basismodellen verwendet werden können. | Ihre Inhalte bleiben aus künftigen Trainingsdaten draußen — bei den Anbietern, die die Trennung dokumentieren. |
Der Agent, den man erlaubt, wenn man in den Antworten dieses Anbieters erscheinen will
| Anbieter | User Agent | Wortlaut des Anbieters | Klasse | Geprüft | Quelle |
|---|---|---|---|---|---|
| OpenAI | OAI-SearchBot | OAI-SearchBot is for search. OAI-SearchBot is used to surface websites in search results in ChatGPT’s search features. Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers, though can still appear as navigational links. | DOCUMENTED | OpenAI · crawler documentation | |
| Googlebot | Crawling preferences addressed to the Googlebot user agent affect Google Search (including Discover and all Google Search features), as well as other products such as Google Images, Google Video, Google News, and Discover. | DOCUMENTED | Google · common crawlers | ||
| Microsoft | bingbot | our standard crawler … handles most of our crawling needs each day von der gerenderten Seite transkribiert — die Tabelle entsteht per JavaScript | DOCUMENTED | Bing · which crawlers does Bing use von der gerenderten Seite transkribiert — die Tabelle entsteht per JavaScript | |
| Perplexity | PerplexityBot | PerplexityBot is designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models. | DOCUMENTED | Perplexity · crawlers | |
| Anthropic | Claude-SearchBot | Claude-SearchBot navigates the web to improve search result quality for users. It analyzes online content specifically to enhance the relevance and accuracy of search responses. Disabling Claude-SearchBot on your site prevents our system from indexing your content for search optimization, which may reduce your site’s visibility and accuracy in user search results. | DOCUMENTED | Anthropic · does Anthropic crawl data from the web |
OpenAI dokumentiert noch einen vierten Agenten, OAI-AdsBot,
der in keine der drei Klassen fällt: OAI-AdsBot only visits pages submitted as ads, and the data collected by OAI-AdsBot is not used to train generative AI foundation models.
— DOCUMENTED · 2026-09-05 ·
OpenAI · crawler documentation.
Google dokumentiert keinen eigenen Crawler für AI Overviews oder AI Mode.
To be eligible to be shown in generative AI features on Google Search, a page must be indexed and eligible to be shown in Google Search with a snippet, fulfilling the Search technical requirements.Just because a page meets all requirements, best practices, and complies with the policies, doesn’t mean that Google will crawl, index, or serve its content. Indexing and serving aren’t guaranteed.Google · DOCUMENTED · 2026-09-05
Googles Liste der allgemeinen Crawler enthält keinen Agenten für die generativen KI-Funktionen, und der Leitfaden knüpft die Berechtigung dafür an die Berechtigung für die Suche. Unsere Lesart: Für Googles KI-Antworten gibt es nichts Zusätzliches zu erlauben — Googlebot ist die Steuerung, und die dokumentierte Zusatzbedingung liegt in der Search Console, nicht in der robots.txt (siehe die Seitensteuerungen unten). INFERRED · Google · AI features and your website
Microsoft dokumentiert keinen eigenen Copilot-Crawler.
Bings dokumentierte Crawler sind bingbot, AdIdxBot, BingPreview, MicrosoftPreview und BingVideoPreview — von der gerenderten Seite gelesen, weil die Tabelle per JavaScript entsteht. Keiner ist Copilot-spezifisch. Unsere Lesart: Die Steuerungen, die Microsoft für KI-Antworten dokumentiert, sind Meta-Werte auf Seitenebene, kein User Agent (siehe die Seitensteuerungen unten). INFERRED · Bing · which crawlers does Bing use · von der gerenderten Seite transkribiert
Eine Seite, weil eine Person gefragt hat — und die robots.txt gilt womöglich nicht
Diese Agenten holen eine Seite, weil jemand eine Frage gestellt hat, die sie braucht. Von den Anbietern dieser Seite, die einen solchen Agenten dokumentieren, nennen fünf eine Ausnahme von der robots.txt für nutzerveranlasste Abrufe — OpenAI, Perplexity, Google, Meta und Amazon, die letzten beiden in der Tabelle der fünf weiteren Anbieter weiter unten. Zwei dokumentieren einen solchen Agenten, ohne eine Ausnahme zu nennen: Anthropic, das pauschale Einhaltung erklärt, und Mistral. Ob sich dieser Unterschied in der Praxis zeigt, kann eine Tabelle aus Dokumentation nicht beantworten — das wäre OBSERVED und bräuchte Server-Logs. Es steht hier als Asymmetrie in der Dokumentation, nicht mehr.
| Anbieter | User Agent | Wortlaut des Anbieters | robots.txt | Klasse | Geprüft | Quelle |
|---|---|---|---|---|---|---|
| OpenAI | ChatGPT-User | When users ask ChatGPT or a CustomGPT a question, it may visit a web page with a ChatGPT-User agent. […] ChatGPT-User is not used for crawling the web in an automatic fashion. | Because these actions are initiated by a user, robots.txt rules may not apply. | DOCUMENTED | OpenAI · crawler documentation | |
| Perplexity | Perplexity-User | Perplexity-User supports user actions within Perplexity. When users ask Perplexity a question, it might visit a web page to help provide an accurate answer and include a link to the page in its response. […] It is not used for web crawling or to collect content for training AI foundation models. | Since a user requested the fetch, this fetcher generally ignores robots.txt rules. | DOCUMENTED | Perplexity · crawlers | |
| Anthropic | Claude-User | Claude-User supports Claude AI users. When individuals ask questions to Claude, it may access websites using a Claude-User agent. Claude-User allows site owners to control which sites can be accessed through these user-initiated requests. | Anthropic’s Bots respect “do not crawl” signals by honoring industry standard directives in robots.txt. Eine Ausnahme für nutzerveranlasste Abrufe wird nicht genannt. | DOCUMENTED | Anthropic · does Anthropic crawl data from the web | |
| Google-Agent · Google-GeminiNotebook · Google-Read-Aloud · Google-Pinpoint · … | Google-Agent is used by agents hosted on Google infrastructure to navigate the web and perform actions upon user request. The Gemini Notebook fetcher requests individual URLs that Gemini Notebook users have provided as sources for their projects. | Because the fetch was requested by a user, these fetchers generally ignore robots.txt rules. | DOCUMENTED | Google · user-triggered fetchers |
ChatGPT-User is not used to determine whether content may appear in Search. Please use OAI-SearchBot in robots.txt for managing Search opt outs and automatic crawl.
Wer ChatGPT-User erlaubt, bringt damit keine Seite in die ChatGPT-Suche.
Eine Entscheidung über Datenlizenzen — getrennt von der Suche, wo der Anbieter die Trennung dokumentiert
Diese zu sperren ist eine Entscheidung über Ihre Inhalte. Bei den drei Anbietern unten trennt die Dokumentation diese Entscheidung von der Suchsichtbarkeit — zweimal im Wortlaut des Anbieters, einmal als unser Schluss —, und die Spalte sagt, was was ist.
| Anbieter | User Agent | Wortlaut des Anbieters | Kostet Sperren Suchsichtbarkeit? | Klasse | Geprüft | Quelle |
|---|---|---|---|---|---|---|
| OpenAI | GPTBot | GPTBot is used to make our generative AI foundation models more useful and safe. It is used to crawl content that may be used in training our generative AI foundation models. | a webmaster can allow OAI-SearchBot in order to appear in search results while disallowing GPTBot to indicate that crawled content should not be used for training OpenAI’s generative AI foundation models. DOCUMENTED | DOCUMENTED | OpenAI · crawler documentation | |
| Anthropic | ClaudeBot | ClaudeBot helps enhance the utility and safety of our generative AI models by collecting web content that could potentially contribute to their training. When a site restricts ClaudeBot access, it signals that the site’s future materials should be excluded from our AI model training datasets. | Ein eigener Agent neben Claude-SearchBot, jeder mit eigener dokumentierter Wirkung. Dass das Sperren des einen den anderen unberührt lässt, steht dort nicht wörtlich. INFERRED | DOCUMENTED | Anthropic · does Anthropic crawl data from the web | |
| Google-Extended robots.txt-Token — kein eigener User-Agent-String | Google-Extended is a standalone product token that web publishers can use to manage whether content Google crawls from their sites may be used for training future generations of Gemini models that power Gemini Apps and Vertex AI API for Gemini and for grounding […] in Gemini Apps and Grounding with Google Search on Vertex AI. Google-Extended doesn’t have a separate HTTP request user agent string. Crawling is done with existing Google user agent strings; the robots.txt user-agent token is used in a control capacity. | Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search. DOCUMENTED | DOCUMENTED | Google · common crawlers |
Google-Extended steuert weder AI Overviews noch AI Mode. Beides
ist Suche, und die Suche steuert Googlebot. Google-Extended steuert das
Training der Gemini-Modelle und das Grounding in Gemini Apps und Vertex AI,
und Google erklärt, dass es die Aufnahme einer Seite in die Suche nicht
berührt. Dass eine Seite, die Google-Extended sperrt, weiterhin in Googles
KI-Antworten erscheinen kann, folgt aus diesen beiden dokumentierten Sätzen
— INFERRED, nicht zitiert.
Getrennte Steuerungen heißen nicht immer getrennte Abrufe. OpenAI:
If your site has allowed both bots, we may use the results from just one crawl for both use cases to avoid duplicative crawling.
— DOCUMENTED · 2026-09-05.
Seitenebene: ein Meta-Wert, eine Einstellung in der Search Console
Nicht jede Steuerung ist eine Zeile in der robots.txt. Diese hier wirken auf Seitenebene, ohne User Agent, und vier Anbieter dokumentieren eine. Microsofts zwei Tags trennen drei Zustände: in der KI-Antwort mit Inhalt (kein Tag), in der Antwort nur als URL, Titel und Snippet (NOCACHE), ganz aus der Antwort heraus (NOARCHIVE) — und Microsoft erklärt, dass beide Tags die Seite in den normalen Suchergebnissen lassen.
| Steuerung | Anbieter | Wortlaut des Anbieters | Klasse | Geprüft | Quelle |
|---|---|---|---|---|---|
| NOCACHE (robots meta) | Microsoft | Content with the NOCACHE tag may be included in Bing Chat answers. We will only display URL/Snippet/Title in the answer; Going forward, for content in our Bing Index that is labeled NOCACHE, only URLs, Titles and Snippets may be used in training Microsoft’s generative AI foundation models. Blogbeitrag vom September 2023; das Produkt heißt dort noch „Bing Chat". | DOCUMENTED | Bing Webmaster Blog · NOCACHE and NOARCHIVE | |
| NOARCHIVE (robots meta) | Microsoft | Content tagged NOARCHIVE will not be included in Bing Chat answers, not be linked to in the answers. Going forward, for content in our Bing Index that is labeled NOARCHIVE, we will not use the content for training Microsoft’s generative AI foundation models. We can assure publishers that content with the NOCACHE tag or NOARCHIVE tag will still appear in our search results.Blogbeitrag vom September 2023; das Produkt heißt dort noch „Bing Chat". | DOCUMENTED | Bing Webmaster Blog · NOCACHE and NOARCHIVE | |
| Search Console · “Search generative AI features” | In addition to the technical requirements for Search, a site must be included in Search generative AI features in Search Console to be eligible for display in generative AI features on Google Search. | DOCUMENTED | Google · AI features and your website | ||
| nosnippet (robots meta) | Apple | Apple will not use data tagged nosnippet as additional context and up-to-date content when AI models are used to generate output for display in Apple products and services. Even if you disallow Applebot-Extended and tag website content with the nosnippet meta tag, your website instructions may still allow Applebot to crawl your webpages. | DOCUMENTED | Apple · about Applebot | |
| noarchive (robots meta) | Amazon | When these user agents access web pages they respect the link-level rel=nofollow directive, and page level robots meta tags of noarchive (do not use the page for model training), noindex (do not index the page) and none (do not index the page). | DOCUMENTED | Amazon · Amazonbot |
Mistral · Meta · Apple · Amazon · Common Crawl
Fünf Anbieter, die ihre Agenten dokumentieren und in den Tabellen oben nicht stehen. Mistral dokumentiert ein sauberes Dreierset. Meta dokumentiert einen Such-Agenten, einen Nutzer-Abrufer und einen Trainings-Crawler — von der gerenderten Seite gelesen, weil der Rohabruf verweigert wurde, und in jeder Zeile so markiert. Apples Such-Crawler speist auch das Modelltraining, solange ein zweites Token nicht gesperrt ist. Amazon dokumentiert drei Agenten mit unabhängigen Einstellungen. Common Crawl ist weder Suchmaschine noch Assistent.
| Anbieter | User Agent | Aufgabe | Wortlaut des Anbieters | robots.txt | Klasse | Geprüft | Quelle |
|---|---|---|---|---|---|---|---|
| Mistral | MistralAI-Index | Suche | MistralAI-Index is for automated crawling of the web for indexing purposes only. It indexes content for Mistral search, which helps answer user questions in Vibe. Content crawled by MistralAI-Index is not used for generative AI training of any kind. | — | DOCUMENTED | Mistral · robots | |
| Mistral | MistralAI-User | Nutzerabruf | MistralAI-User is for user actions in Vibe. When users ask Vibe a question, it may visit a web page to help answer and include a link to the source in its response. […] It is not used for crawling the web in any automatic fashion, nor to crawl content for generative AI training. | — | DOCUMENTED | Mistral · robots | |
| Mistral | MistralAI-Training | Training | MistralAI-Training crawls web content to help build datasets for training Mistral generative AI models. […] This crawler is not used for search indexing or to answer live user queries in Vibe. | — | DOCUMENTED | Mistral · robots | |
| Meta | Meta-WebIndexer | Suche | navigates the web to improve Meta AI search result quality cite and link to your content in Meta AI’s responsesvon der gerenderten Seite transkribiert — der Rohabruf wurde verweigert | — | DOCUMENTED | Meta · web crawlers von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert | |
| Meta | Meta-ExternalFetcher | Nutzerabruf | fetches individual links at a user’s request von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert | might bypass robots.txt von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert | DOCUMENTED | Meta · web crawlers von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert | |
| Meta | Meta-ExternalAgent | Training | crawls the web for use cases such as training foundation AI models or improving products von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert | — | DOCUMENTED | Meta · web crawlers von der gerenderten Seite transkribiert — der Rohabruf wurde verweigert | |
| Apple | Applebot | Suche | The data crawled by Applebot is used to power various features, such as the search technology integrated into many user experiences in Apple’s ecosystem including Spotlight, Siri, and Safari. The data crawled by Applebot may also be used to help train Apple foundation models powering generative AI features across Apple products […]. Web publishers can opt-out from having their content used to train generative foundation models by disallowing Applebot-Extended in the robots.txt file. | — | DOCUMENTED | Apple · about Applebot | |
| Apple | Applebot-Extended robots.txt-Token — kein eigener User-Agent-String | Training | Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results. Applebot-Extended is only used to determine how to use the data crawled by the Applebot user agent. | — | DOCUMENTED | Apple · about Applebot | |
| Amazon | Amzn-SearchBot | Suche | Amzn-SearchBot is used to improve search experiences in Amazon products and services. By permitting Amzn-SearchBot access to your website, your content is eligible to appear in search experiences such as Alexa. If robots.txt files don’t mention Amzn-SearchBot but allow other search bots, Amzn-SearchBot will crawl in accordance with the robots.txt directives given to other search bots. Amzn-SearchBot does not crawl content for generative AI model training. | — | DOCUMENTED | Amazon · Amazonbot | |
| Amazon | Amzn-User | Nutzerabruf | Amzn-User supports user actions, such as responding to Alexa queries that require up-to-date information. […] Amzn-User does not crawl content for generative AI model training. | Because actions taken by Amzn-User can be initiated by a user, it may not follow all robots.txt directives. | DOCUMENTED | Amazon · Amazonbot | |
| Amazon | Amazonbot | Training | Amazonbot is used to improve our products and services. This helps us provide more accurate information to customers and may be used to train Amazon AI models. This page describes how webmasters can control Amazonbot, Amzn-SearchBot, and Amzn-User interactions with their site. Each user agent setting is independent of the othersEin Agent für Produktverbesserung und mögliches Training. Eine feinere Trennung innerhalb von Amazonbot dokumentiert Amazon nicht — der Trainings-Opt-out ist Amazonbot selbst; Suche und Nutzerabruf haben eigene Agenten. | — | DOCUMENTED | Amazon · Amazonbot | |
| Common Crawl | CCBot | Offenes Archiv | Common Crawl is a non-profit foundation founded with the goal of democratizing access to web information by producing and maintaining an open repository of web crawl data that is universally accessible and analyzable by anyone. Keine Suchmaschine und kein Assistent. Wer ihn sperrt, wirkt auf ein Archiv, das viele nutzen — Modellbauer darunter —, nicht auf ein Produkt, in dem man erscheinen kann. | — | DOCUMENTED | Common Crawl · CCBot |
Zwei Namen, die kursieren — und für keinen eine Anbieterquelle
Zwei Crawler-Namen tauchen ständig auf und stehen in keinem Dokument ihres Anbieters. Sie sind hier UNVERIFIED und bleiben es, bis der Anbieter sie dokumentiert. Drittverzeichnisse wurden gefunden und als Quelle abgelehnt — es gibt mehrere, und keines ist eine Anbieterquelle.
| Anbieter | Befund | Klasse | Geprüft | Quelle |
|---|---|---|---|---|
| DeepSeek | Keine Crawler-Dokumentation des Anbieters gefunden. deepseek.com/robots.txt nennt keinen eigenen Agenten. Drittverzeichnisse führen einen „DeepSeekBot"; keines ist eine Anbieterquelle. Bleibt ungeprüft, bis DeepSeek es dokumentiert. User-Agent: * Allow: / | UNVERIFIED | Keine Anbieterquelle gefunden. | |
| ByteDance (“Bytespider”) | Keine Crawler-Dokumentation des Anbieters gefunden. Der Name kursiert in Drittlisten und Server-Logs; beides ist keine Anbieteraussage. Gleiche Behandlung. | UNVERIFIED | Keine Anbieterquelle gefunden. |
Googles Wortlaut, zweimal — und die Datei, die wir trotzdem pflegen
Die Google-Suche ignoriert sie. In Googles Worten:
You don’t need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search (including its generative AI capabilities), as Google Search itself doesn’t use them.Google · DOCUMENTED · 2026-09-05
It’s completely fine if you decide to create and maintain LLMS.txt files (or other similar files) for other services or systems that use these files. Doing so will neither harm nor help your site’s visibility or rankings in Google Search, as Google Search ignores them.Google · DOCUMENTED · 2026-09-05
Das ist die ganze Google-Antwort, und diese Seite schwächt sie nicht ab. Welche Werkzeuge lesen die Datei? Einige. Diese Seite listet sie nicht, weil wir kein einziges aus einer Anbieterquelle geprüft haben — jede Liste hier wäre UNVERIFIED im Gewand einer Referenz. Prüfen wir eines, bekommt es eine Zeile, einen Link und ein Datum wie alles andere.
Wir veröffentlichen auf dieser Seite eine llms.txt und pflegen sie von Hand, für die Werkzeuge, die sie lesen. Sie ist nicht Teil irgendeiner Aussage über Google.
| Verbreitete Annahme | Googles Wortlaut | Klasse | Geprüft | Quelle |
|---|---|---|---|---|
| Inhalte müssen für KI in kleine Stücke zerlegt werden. | There’s no requirement to break your content into tiny pieces for AI to better understand it. | DOCUMENTED | Google · AI features and your website | |
| Für KI-Funktionen braucht es besondere strukturierte Daten. | Structured data isn’t required for generative AI search, and there’s no special schema.org markup you need to add. | DOCUMENTED | Google · AI features and your website | |
| Für die KI-Suche braucht es einen eigenen Schreibstil. | The best practices for SEO continue to be relevant because our generative AI features on Google Search are rooted in our core Search ranking and quality systems. | DOCUMENTED | Google · AI features and your website |
Offenlegung · OBSERVED · gegen die Live-Datei prüfbar
blackoarstudio.com/robots.txt · gelesen
User-agent: *
Allow: /
Sitemap: https://blackoarstudio.com/sitemap-index.xml Jeder Agent dieser Seite ist auf dieser Website derzeit erlaubt, die Trainingsbots eingeschlossen. Das ist eine bewusste Position für ein Studio ohne lizenziertes Archiv, das es zu schützen gäbe — und kein Rat. Ein Verlag mit Inhalten, die sich lizenzieren lassen, kann vernünftigerweise das Gegenteil entscheiden; die Trainingstabelle oben ist genau die Tabelle, mit der das geht, ohne Suchsichtbarkeit zu verlieren — dort, wo der Anbieter die Trennung dokumentiert.
OBSERVED — eine Live-Kopie unserer eigenen Datei, 2026-09-05. Keine Anbieteraussage.
Nächste Prüfung: 2026-12-05
Diese Seite beschreibt die Systeme anderer und veraltet ohne Vorwarnung — auf eine Art, die ein Link-Check nicht erkennt. Unsere eigene Quellenliste entstand am 26. August 2026 und wurde am 2026-09-05 neu gelesen. Was dabei herauskam — OBSERVED:
Inhalte driften unter stabilen URLs. Deshalb trägt jede Zeile ein Datum und nicht nur einen Link.
Nur Anbieter-Dokumente · gelesen 2026-09-05 · mit Prüfsummen gesichert
Zwei Dokumente ließen sich nicht roh sichern und sind oben und in ihren Zeilen markiert. Beide wurden von der gerenderten Seite gelesen. Festgehalten, damit ein Leser weiß, welche Zeilen auf einem gesicherten Dokument ruhen und welche auf einer Abschrift. Die IP-Endpunkte der Prüftabelle wurden am selben Datum abgerufen und neben den Dokumenten gesichert.