Eine robots.txt-Datei teilt Suchmaschinen mit, welche Teile deiner Website sie crawlen dürfen und welche nicht. Du platzierst die Datei im Stammverzeichnis deiner Website, und sie besteht aus einfachen Textzeilen mit Anweisungen pro Suchmaschinen-Bot. Falsch eingestellt kann sie dazu führen, dass Google deine gesamte Website ignoriert, daher ist es wichtig zu wissen, was du tust, bevor du sie anpasst.
Was genau ist robots.txt?
Suchmaschinen schicken Bots (auch Crawler genannt) über deine Website, um Seiten zu finden und zu indexieren. Bevor so ein Bot loslegt, prüft er zuerst, ob eine Datei robots.txt existiert, z. B. unter deinedomain.de/robots.txt. Darin steht, welche Ordner oder Dateien der Bot besuchen darf und welche nicht.
Wichtig zu wissen: robots.txt ist eine Anfrage, kein Schloss. Seriöse Bots wie Googlebot halten sich daran, aber bösartige Bots können die Datei ignorieren. Nutze robots.txt also nicht, um sensible Informationen zu schützen, dafür sind andere Maßnahmen nötig.
Ein Bot prüft zuerst robots.txt, bevor er deine Website crawlt.
Robots.txt erstellen und hochladen
Eine robots.txt-Datei erstellst du in jedem einfachen Texteditor, wie Notepad. Die Datei muss exakt robots.txt heißen und im Stammverzeichnis (Root) deiner Website liegen, nicht in einem Unterordner.
Erstelle die Datei
Öffne einen Texteditor und tippe deine Anweisungen, zum Beispiel: User-agent: * gefolgt von Disallow: /wp-admin/.
Speichere als robots.txt
Achte darauf, dass der Editor daraus nicht .txt.txt oder eine andere Erweiterung macht.
Lade in das Stammverzeichnis hoch
Platziere die Datei per FTP oder dem Dateimanager in Plesk im Root deiner Website, neben z. B. deiner index.php.
Füge gegebenenfalls eine Sitemap hinzu
Füge die Zeile Sitemap: https://deinedomain.de/sitemap.xml hinzu, damit Suchmaschinen deine Sitemap direkt finden.
Nutzt du WordPress, wird oft automatisch eine virtuelle robots.txt von SEO-Plugins wie Yoast oder Rank Math generiert. Diese kannst du meist direkt über die Plugin-Einstellungen anpassen, ohne eine separate Datei hochzuladen.
Häufige Fehler
Robots.txt wirkt einfach, aber ein kleiner Fehler kann große Auswirkungen auf deine Auffindbarkeit haben. Achte auf diese häufigen Fallstricke:
- Disallow: / ohne nachzudenken verwenden, blockiert deine gesamte Website für Suchmaschinen.
- Robots.txt verwenden, um sensible Seiten zu „verstecken“. Sie werden einfach nicht gecrawlt, bleiben aber über einen direkten Link erreichbar und können sogar in den Suchergebnissen erscheinen, wenn sie anderswo verlinkt sind.
- Die Datei im falschen Ordner platzieren, zum Beispiel in einem Unterordner statt im Root.
- Groß-/Kleinschreibung vergessen: Disallow-Pfade sind groß-/kleinschreibungsabhängig, also /Map/ und /map/ sind nicht dasselbe.
- Robots.txt verwenden, während du eigentlich einen noindex-Tag benötigst. Möchtest du, dass eine Seite gecrawlt, aber nicht indexiert wird, funktioniert ein Meta-noindex-Tag besser als eine Disallow-Regel.
Robots.txt testen
Bevor du eine angepasste robots.txt live schaltest, ist es ratsam zu testen, ob die Regeln das tun, was du möchtest. Die Google Search Console verfügt über ein Testtool, mit dem du prüfen kannst, ob eine bestimmte URL blockiert oder zugelassen wird.
Überprüfe auch regelmäßig, ob die Datei noch über deinedomain.de/robots.txt erreichbar ist, besonders nach einem Umzug zu einem anderen Hoster. Die Datei wird nämlich nicht immer automatisch bei einer Migration mitgenommen und muss manchmal erneut hochgeladen werden.
Häufig gestellte Fragen
Ist robots.txt für jede Website verpflichtend?
Nein, es ist nicht verpflichtend. Ohne robots.txt dürfen Suchmaschinen grundsätzlich alles crawlen. Die Datei ist vor allem nützlich, wenn du bestimmte Teile deiner Website ausschließen möchtest.
Kann ich robots.txt verwenden, um eine Seite aus Google zu entfernen?
Nein, dafür ist robots.txt nicht geeignet. Verwende einen noindex-Tag auf der Seite selbst, oder entferne die Seite und zeige eine 404- oder 410-Meldung an.
Funktioniert robots.txt auch für Bilder und Dateien?
Ja, du kannst bestimmte Dateitypen oder Ordner mit Bildern ausschließen, zum Beispiel durch Hinzufügen von Disallow: /uploads/private/.
Braucht jede Subdomain eine eigene robots.txt?
Ja, robots.txt gilt pro Subdomain. Hast du zum Beispiel shop.deinedomain.de, braucht diese Subdomain eine eigene robots.txt, wenn du dafür Regeln einrichten möchtest.
Fazit
Robots.txt ist eine kleine, aber einflussreiche Datei, die Suchmaschinen mitteilt, welche Teile deiner Website sie crawlen dürfen. Platziere sie im Stammverzeichnis, teste deine Regeln, bevor du sie live schaltest, und nutze sie niemals als Sicherheitsmaßnahme für sensible Daten. Bei Unklarheiten, wo du deine Dateien am besten verwalten kannst, hilft dir unsere Webhosting-Umgebung mit Plesk schnell weiter.