robots.txt-Generator
Legen Sie fest, wie Crawler die Website behandeln sollen, listen Sie auszuschließende Pfade auf und kopieren Sie die Datei in Ihr Web-Root.
robots.txt
User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /*?s=
Sitemap: https://example.com/sitemap.xml
Über dieses Tool
robots.txt liegt im Wurzelverzeichnis der Domain und sagt Crawlern, welche Pfade sie auslassen sollen. Sie ist eine Crawl-Anweisung, keine Zugriffskontrolle: gesperrte URLs können trotzdem indexiert werden, wenn andere Seiten darauf verlinken. Für wirklich Vertrauliches nutzen Sie noindex oder eine Anmeldung.
Regeln werden je User-Agent gruppiert, und jeder Crawler folgt der spezifischsten passenden Gruppe. Die KI-Option ergänzt ausdrückliche Sperren für GPTBot, ClaudeBot, CCBot, Google-Extended, PerplexityBot und weitere Trainings-Crawler, die die Datei beachten.
Häufige Fragen
- Wohin gehört die Datei?
- In das Wurzelverzeichnis der Domain, erreichbar unter https://beispiel.de/robots.txt. In Unterordnern wirkt sie nicht.
- Beachtet Google Crawl-delay?
- Nein. Googlebot ignoriert es, Bing und Yandex beachten es. Für Google stellen Sie die Crawl-Rate in der Search Console ein.
- Entfernt eine Sperre die Seite aus Google?
- Nicht zuverlässig. Eine gesperrte URL kann ohne Snippet erscheinen. Für echte Entfernung setzen Sie noindex auf eine crawlbare Seite.