Was ist eine robots.txt? Regeln, AI-Crawler und was deine Karriereseite wirklich blockiert
Eine kleine Textdatei entscheidet mit, wer deine Karriereseite lesen darf. Bei AI-Crawlern trennt dabei ein einziger Name das Training von den Antworten, und manchmal blockiert gar nicht die Datei, sondern der Bot-Schutz davor.
10 Minuten Lesezeit
Kurz gesagt
Eine robots.txt ist eine einfache Textdatei direkt unter deiner Domain, in der du Crawlern mitteilst, welche Bereiche sie abrufen sollen und welche nicht. Sie ist eine Bitte, keine Zugangskontrolle. Bei AI-Crawlern zählt der genaue Name. Wer GPTBot sperrt, hält seine Inhalte aus dem Training von OpenAI heraus und bleibt in ChatGPT trotzdem auffindbar. Wer OAI-SearchBot sperrt, verschwindet dagegen aus den Suchantworten. Für Stellenanzeigen heißt das, die Such-Crawler offen zu lassen und auch den Bot-Schutz vor der Seite zu prüfen.
Was ist eine robots.txt, und was ist sie nicht?
Martijn Koster hat die robots.txt 1994 als Absprache zwischen Websites und Crawlern beschrieben, seit 2022 ist sie als Robots Exclusion Protocol in RFC 9309 offiziell festgeschrieben. Die Datei liegt immer direkt hinter dem Domainnamen. In einfachen Zeilen steht dort, welcher Crawler welche Pfade auslassen soll.
Genauso wichtig ist, was die Datei nicht leistet. Sie sperrt nichts ab. Der Standard hält ausdrücklich fest, dass ihre Regeln keine Form der Zugriffskontrolle sind, und jeder Crawler entscheidet selbst, ob er sich daran hält. Googles automatische Crawler tun das laut Google immer. Einen Crawler, der die Datei übergeht, hält sie nicht auf.
Sie ist außerdem kein Werkzeug, um eine Seite aus der Google-Suche zu nehmen, das schreibt Google selbst. Eine gesperrte Adresse kann trotzdem in den Ergebnissen auftauchen, wenn andere Seiten auf sie verlinken, dann eben ohne Beschreibung. Wer eine Seite wirklich aus dem Index haben will, braucht die Angabe noindex. Und die sieht Google nur, wenn es die Seite abrufen darf.
Wie ein Crawler die Datei liest
Bevor ein seriöser Crawler eine Seite deiner Domain abruft, holt er die robots.txt. Die Datei ist in Gruppen gegliedert. Jede Gruppe beginnt mit dem Namen eines Crawlers, darunter stehen die Pfade, die er meiden oder ausdrücklich betreten soll.
Eine Regel wird dabei oft übersehen. Findet ein Crawler eine Gruppe mit seinem eigenen Namen, folgt er nur dieser und lässt die allgemeine Gruppe komplett links liegen. Sperrst du für alle Crawler den Bereich /intern/ und legst darunter eine eigene Gruppe für GPTBot an, musst du /intern/ dort noch einmal aufführen. Sonst steht er GPTBot offen. Apple kennt dazu eine Besonderheit. Nennt die Datei Applebot nicht, wohl aber Googlebot, folgt Applebot den Anweisungen für Googlebot.
Innerhalb einer Gruppe gewinnt die genaueste Regel. Ist /karriere/ gesperrt und /karriere/stellen/ erlaubt, gilt für eine Stellenseite die längere Angabe, sie bleibt also erreichbar. Bei den Pfaden zählt Groß- und Kleinschreibung.
Spannend wird es, wenn die Datei fehlt oder der Server streikt. Meldet der Server sauber, dass es keine robots.txt gibt, darf ein Crawler laut Standard alles abrufen. Antwortet er dagegen mit einem Serverfehler, behandelt Google die Domain vorübergehend so, als wäre alles gesperrt. In den ersten 12 Stunden crawlt Google gar nicht, danach greift es bis zu 30 Tage lang auf die letzte funktionierende Fassung zurück. Fällt die robots.txt deiner Karriereseite so aus, holt Google in den ersten Stunden also auch keine neuen Stellen ab.
AI-Crawler blockieren, aber welchen?
Die großen AI-Anbieter schicken heute mehrere Crawler los, jeden mit einer eigenen Aufgabe. Einer baut den Suchindex auf, aus dem ein Assistent seine Antworten mit Quellen belegt. Ein anderer sammelt Material für das Training künftiger Modelle. Ein dritter ruft eine Seite erst ab, wenn jemand im Chat konkret danach fragt.
Für die robots.txt ist das die wichtigste Unterscheidung überhaupt. Jede Aufgabe hat ihren eigenen Namen, und eine Sperre wirkt nur auf genau diesen.
| Anbieter | Suche und Antworten | Training | Abruf auf Nutzerwunsch |
|---|---|---|---|
| OpenAI | OAI-SearchBot | GPTBot | ChatGPT-User, für den die robots.txt laut OpenAI womöglich nicht gilt |
| Anthropic | Claude-SearchBot | ClaudeBot | Claude-User, laut Anthropic an die robots.txt gebunden |
| Perplexity | PerplexityBot | Keiner aufgeführt, PerplexityBot sammelt laut Perplexity nicht für das Modelltraining | Perplexity-User, ignoriert die robots.txt in der Regel |
| Googlebot, auch für AI Overviews und AI Mode | Google-Extended, ein reiner Steuerungsname ohne eigenen Crawler, der auch die Antworten der Gemini-App betrifft | Eigene Abrufdienste wie Google-Agent, die die robots.txt in der Regel ignorieren | |
| Apple | Applebot | Applebot-Extended, ein reiner Steuerungsname ohne eigenen Crawler | In Apples Beschreibung nicht eigens aufgeführt |
Stand der Angaben ist die jeweilige Crawler-Dokumentation der Anbieter.
Daraus folgt der Punkt, an dem viele Anleitungen zu kurz greifen. Wer GPTBot oder ClaudeBot sperrt, nimmt seine Inhalte aus dem Training, nicht aus den Antworten. Wer dagegen OAI-SearchBot sperrt, taucht laut OpenAI in den Suchantworten von ChatGPT nicht mehr auf. Und wer Googlebot aussperrt, verliert AI Overviews und AI Mode gleich mit, denn beide setzen eine Seite voraus, die Google indexiert hat und mit einem Textauszug zeigen darf.
Google-Extended ist ein Sonderfall. Der Name regelt neben dem Training von Gemini auch, ob die Gemini-App deine Inhalte aus dem Google-Index für ihre Antworten heranziehen darf. Auf die Aufnahme in die Google-Suche hat er laut Google keinen Einfluss, AI Overviews und AI Mode hängen an den Regeln für Googlebot.
Die dritte Spalte entzieht sich der Datei teilweise. Weil ein Mensch den Abruf angestoßen hat, halten sich diese Dienste bei OpenAI, Perplexity und Google nicht verlässlich an die Regeln. Anthropic sagt dagegen, dass sich alle seine Crawler an die robots.txt halten, auch Claude-User.
Microsoft geht einen anderen Weg. Für die Nutzung in seinen Chat-Antworten, damals noch unter dem Namen Bing Chat, hat Microsoft zwei Angaben im Quelltext der Seite eingeführt, NOCACHE und NOARCHIVE. Mit NOARCHIVE bleibt eine Seite ganz aus den Chat-Antworten, mit NOCACHE darf Microsoft dort nur Adresse, Titel und Auszug verwenden. In der Bing-Suche bleiben so markierte Inhalte trotzdem.
Was das für deine Stellenanzeigen heißt
Eine Stellenanzeige ist dafür da, gefunden zu werden. Für eine Karriereseite fällt die Abwägung deshalb anders aus als für einen Verlag, der von seinen Texten lebt. Die Such-Crawler und die Abrufe auf Nutzerwunsch sollten deine Stellen immer erreichen, denn über sie landet eine Stelle in der Antwort auf die Frage nach einem Job in deiner Region.
Beim Training triffst du eine eigene Entscheidung, und zwar eine legitime. Sie lässt sich sauber von der Suche trennen, solange du die Namen auseinanderhältst. Eine Gruppe für GPTBot, ClaudeBot und Applebot-Extended mit einer vollständigen Sperre schließt das Training dieser Anbieter aus, ohne die Suche anzutasten. Google-Extended gehört nur dann dazu, wenn du auch auf die Antworten der Gemini-App verzichten willst.
Achte dabei auf den Ort. Die Regeln einer robots.txt gelten nur für genau den Host, auf dem sie liegt. Läuft deine Karriereseite auf einer eigenen Subdomain oder direkt beim Anbieter deines Bewerbermanagementsystems, zählt die Datei dort und nicht die deiner Hauptseite, und auf die hast du oft keinen direkten Zugriff.
Eine besetzte Stelle sperrst du nicht über die robots.txt. Google kann die Seite dann nicht mehr abrufen und bekommt deshalb nie mit, dass sie aus dem Index verschwinden soll. Für das Ende einer Stelle gibt es verlässlichere Wege.
Content Signals, ein Wunsch statt einer Sperre
Im September 2025 hat Cloudflare vorgeschlagen, die robots.txt um eine zusätzliche Zeile zu ergänzen, in der du für drei Nutzungsarten ja oder nein sagst. Der Wert search steht für einen Suchindex und klassische Ergebnisse mit Link und kurzem Auszug. Mit ai-input ist die Nutzung als Quelle für eine AI-Antwort im Moment der Frage gemeint, mit ai-train das Training und Feinabstimmen von Modellen.
Lässt du eine der drei Angaben weg, erteilst du damit weder eine Erlaubnis noch ein Verbot. Das unterscheidet ein fehlendes Signal von einem ausdrücklichen Nein.
Cloudflare beschreibt die Signale selbst als Wünsche und nicht als technische Sperre. Noch nennt keiner der großen AI-Anbieter die Zeile in seiner Crawler-Dokumentation. Wer sie heute setzt, legt eine Grundlage für den Moment, in dem Anbieter sie auswerten. Wer das Training schon jetzt verlässlich ausschließen möchte, nutzt dafür die Namen aus der Tabelle oben.
Wenn gar nicht die robots.txt blockiert
Es kommt vor, dass eine Seite AI-Crawler abweist, obwohl ihre robots.txt keinen einzigen davon nennt. Der Grund liegt dann eine Ebene davor. Oft läuft eine Website über ein Netzwerk, das Inhalte ausliefert und dabei Bots abwehrt, ein sogenanntes CDN. Ein Crawler, den es abweist, erreicht deine Seiten nicht, ganz gleich, was in der Datei steht.
Cloudflare hat seine Voreinstellungen dazu zweimal geändert. Seit dem 1. Juli 2025 fragt es jede neu angemeldete Domain, ob sie AI-Crawler zulassen will, und startet mit einer Sperre als Standard. Im Juli 2026 hat Cloudflare AI-Verkehr in drei Gruppen eingeteilt, Suche, Agent und Training, und seit dem 15. September 2026 sind für neu angemeldete Domains Training und Agent auf Seiten mit Werbung standardmäßig gesperrt.
Heikel für Karriereseiten ist eine weitere Änderung vom selben Tag. Wer bei Cloudflare Training sperrt, über die neuen Optionen oder die ältere Einstellung zum Blockieren von AI-Bots, sperrt seither auch Crawler mit mehreren Aufgaben aus. Cloudflare nennt dafür ausdrücklich Googlebot, Applebot und Bingbot. Ein Schalter, der einmal gegen AI-Training umgelegt wurde, hält also inzwischen auch Googlebot fern, ohne dass sich an der robots.txt eine Zeile geändert hat.
Prüfe deshalb auch die Sicherheitseinstellungen vor der Datei. Liegt deine Karriereseite beim Anbieter deines Bewerbermanagementsystems, liegen sie dort, und die Frage, welche Crawler durchkommen, gehört ins nächste Gespräch mit ihm.
Für technisch Interessierte
Die Zeilen einer robots.txt und wie du sie prüfst
Eine robots.txt ist reiner Text mit einer Anweisung pro Zeile. Die Tabelle zeigt die gängigen Bausteine, jeweils mit einem Beispiel aus dem Umfeld einer Karriereseite.
| Zeile | Was sie bewirkt |
|---|---|
| User-agent: * | Eröffnet eine Gruppe für alle Crawler, die nicht eigens genannt sind. |
| User-agent: GPTBot | Eröffnet eine Gruppe nur für den Trainings-Crawler von OpenAI. Für ihn gilt dann ausschließlich diese Gruppe. |
| Disallow: / | Sperrt die ganze Domain. In der Gruppe für GPTBot schließt das diesen Crawler komplett aus, OAI-SearchBot bleibt unberührt. |
| Disallow: /intern/ | Sperrt alles, was mit /intern/ beginnt. Der Schrägstrich am Ende lässt /internationale-stellen/ offen. |
| Allow: /karriere/stellen/ | Öffnet einen Pfad in einem gesperrten Bereich wieder. Bei Widerspruch gewinnt die längere Regel. |
| Disallow: /*?sortierung= | Der Stern steht für beliebige Zeichen. Gesperrt sind etwa sortierte Fassungen derselben Stellenliste. |
| Disallow: /*.pdf$ | Das Dollarzeichen markiert das Ende der Adresse. Gesperrt sind nur Adressen, die auf .pdf enden. |
| Sitemap: https://www.example.com/sitemap.xml | Nennt die vollständige Adresse der Sitemap. Die Zeile gehört zu keiner Gruppe. |
| # Bewerbungsbereich | Ein Kommentar für Menschen, den Crawler überspringen. |
| Content-Signal: search=yes, ai-train=no | Eine Wunschangabe, keine Sperre. Googles Parser etwa kennt neben den Gruppenregeln nur die Sitemap-Zeile. |
Google liest von einer robots.txt höchstens 500 KiB, alles danach wird ignoriert. Die Datei hält Google in der Regel bis zu 24 Stunden im Zwischenspeicher, eine Änderung wirkt also nicht sofort.
Zum Prüfen genügt zunächst der Browser. Hänge /robots.txt an deine Domain an, dann siehst du genau das, was ein Crawler sieht, oder eben eine Fehlerseite. In der Google Search Console gibt es dazu einen eigenen robots.txt-Bericht. Er zeigt, welche Dateien Google für die wichtigsten Hosts deiner Website gefunden hat, wann es sie zuletzt abgerufen hat und ob es beim Lesen Probleme gab. Nach einer Korrektur kannst du dort einen neuen Abruf anfordern.
Einen Bot-Schutz, der einzelne Crawler abweist, zeigt dir keiner dieser Blicke. Dein Browser kommt ja durch.
Wie wir es selbst halten
Unsere eigene robots.txt ist bewusst kurz. Sie hat eine einzige Gruppe für alle Crawler und sperrt nur, was hinter einer Anmeldung liegt oder für einen Crawler nichts enthält. Einen AI-Crawler sperren wir nicht eigens aus, denn Stellenanzeigen sollen gefunden werden.
Die Content-Signal-Zeile darin ist eine erklärte Präferenz und damit eine Grundlage für den Moment, in dem Anbieter sie auswerten.
Ist eine robots.txt Pflicht?
Nein. Meldet der Server sauber, dass es keine robots.txt gibt, darf ein Crawler laut Standard alles abrufen, und Google geht dann von keinerlei Einschränkungen aus. Sinnvoll wird die Datei, sobald es Bereiche gibt, die kein Crawler abrufen soll, oder wenn du auf deine Sitemap verweisen willst.
Kann ich ChatGPT mit der robots.txt aussperren?
Teilweise, und es kommt auf den Namen an. Eine Sperre für GPTBot hält deine Inhalte aus dem Training von OpenAI heraus, eine Sperre für OAI-SearchBot nimmt dich laut OpenAI nach rund 24 Stunden aus den Suchantworten von ChatGPT. Für ChatGPT-User, der eine Seite auf Wunsch einer Nutzerin abruft, gelten die Regeln laut OpenAI womöglich nicht.
Verschwindet eine gesperrte Seite aus der Google-Suche?
Nicht zuverlässig. Verlinken andere Seiten auf die Adresse, kann Google sie trotzdem anzeigen, dann ohne Beschreibung. Um eine Seite wirklich herauszunehmen, braucht sie die Angabe noindex, und die muss Google abrufen können, die Seite darf also gerade nicht gesperrt sein.
Wo liegt die robots.txt, und wie prüfe ich sie?
Sie liegt direkt hinter dem Domainnamen und gilt nur für genau diesen Host, eine Subdomain braucht ihre eigene. Ruf sie im Browser auf, dann siehst du, was ein Crawler sieht. Der robots.txt-Bericht in der Google Search Console zeigt dir außerdem, wann Google die Datei zuletzt geholt hat und ob es Probleme gab.
Schließt Google-Extended meine Seite aus der Google-Suche aus?
Nein. Google-Extended ist ein reiner Steuerungsname ohne eigenen Crawler und regelt, ob Gemini deine Inhalte für sein Training und für die Antworten der Gemini-App nutzen darf. Laut Google hat er keinen Einfluss darauf, ob eine Seite in der Google-Suche vorkommt, und ist kein Rankingsignal. Für AI Overviews und AI Mode zählen die Regeln für Googlebot.
Sollte ich AI-Crawler auf meiner Karriereseite blockieren?
Die Crawler für Suche und für Abrufe auf Nutzerwunsch besser nicht, denn über sie landen deine Stellen in den Antworten, nach denen Bewerbende fragen. Beim Training wägst du selbst ab, und das lässt sich getrennt regeln, weil die Anbieter dafür eigene Namen führen. Prüfe außerdem, ob ein Bot-Schutz vor deiner Seite diese Entscheidung nicht längst ohne dich getroffen hat.
Quellen
- RFC 9309: Robots Exclusion Protocol öffnet in neuem Fenster
- Google Search Central: Einführung in robots.txt öffnet in neuem Fenster
- Google Search Central: So interpretiert Google die robots.txt-Spezifikation öffnet in neuem Fenster
- Google Search Central: Indexierung mit noindex blockieren öffnet in neuem Fenster
- Google Search Central: AI-Funktionen und deine Website öffnet in neuem Fenster
- Google Search Central: Häufige Crawler von Google und Google-Extended öffnet in neuem Fenster
- Google Search Central: Von Nutzern ausgelöste Abrufe öffnet in neuem Fenster
- Google Search Console Hilfe: Der robots.txt-Bericht öffnet in neuem Fenster
- OpenAI: Überblick über die Crawler von OpenAI öffnet in neuem Fenster
- Anthropic: Crawler von Anthropic und die robots.txt öffnet in neuem Fenster
- Perplexity: Perplexity-Crawler öffnet in neuem Fenster
- Apple: Über Applebot öffnet in neuem Fenster
- Bing Webmaster Blog: Nutzung von Inhalten in Bing Chat steuern (2023) öffnet in neuem Fenster
- Cloudflare: AI-Crawler standardmäßig gesperrt (Juli 2025) öffnet in neuem Fenster
- Cloudflare Blog: Content Signals Policy öffnet in neuem Fenster
- Cloudflare Blog: Neue Optionen für AI-Verkehr (Juli 2026) öffnet in neuem Fenster
Mach deine Stellen bereit für
Gemini
Der Auffindbarkeits-Check zeigt dir, ob AI-Assistenten und die Google-Suche deine Stellen finden und verstehen. Wir werten ihn persönlich für dich aus.