Lokaler HTTP-Konfigurationstest: robots.txt und noindex ===================================================== Was tatsächlich geprüft wurde ----------------------------- Sechs künstliche HTML-Seiten und eine robots.txt wurden über echtes lokales HTTP auf 127.0.0.1 abgerufen. Der verwendete User-Agent war ausschließlich TransparionLocalFixture/1.0. Der Test imitiert weder Googlebot noch eine andere Suchmaschine. Der Client befolgt robots.txt nicht automatisch. Auch gesperrte Pfade antworten deshalb mit HTTP 200. Das ist kein Widerspruch: robots.txt ist eine Anweisung für Crawler, keine serverseitige Zugriffssperre. Ausführung (UTC): 2026-09-24T19:22:41.969695+00:00 Ergebnis: 56/56 technische Prüfungen bestanden. Davon: 6 × 8 Prüfungen für HTML, 5 für robots.txt, 3 für Ablauf und Aufräumen. Anfragen: 7 lokale GETs. Server danach beendet: ja. Ausgelieferte robots.txt: User-agent: * Disallow: /blocked/ Beobachtungen und dokumentierte Einordnung ---------------------------------------- Fall A: Öffentlich, ohne Indexierungsanweisung Pfad: /public/indexable.html Beobachtetes HTTP: 200; text/html; charset=utf-8. HTML-Meta robots: nicht vorhanden. HTML-Meta googlebot: nicht vorhanden. HTTP-Header X-Robots-Tag: nicht vorhanden. Zuordnung zur lokalen robots.txt-Konfiguration: keine Disallow-Regel trifft zu. Technische Prüfungen: 8/8 bestanden. Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis): Die lokale Konfiguration enthält für diesen Pfad weder eine robots.txt-Sperre noch eine noindex-Anweisung. Das macht Indexierung grundsätzlich möglich, garantiert aber weder Crawling noch Aufnahme in den Google-Index. Fall B: Öffentlich, noindex im HTML Pfad: /public/noindex.html Beobachtetes HTTP: 200; text/html; charset=utf-8. HTML-Meta robots: noindex. HTML-Meta googlebot: nicht vorhanden. HTTP-Header X-Robots-Tag: nicht vorhanden. Zuordnung zur lokalen robots.txt-Konfiguration: keine Disallow-Regel trifft zu. Technische Prüfungen: 8/8 bestanden. Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis): Google muss die Seite abrufen können, um das noindex-Meta-Tag zu erkennen. Wenn Google die Anweisung beim Crawlen erkennt, soll die Seite nicht im Google-Index erscheinen. Ein tatsächlicher Google-Abruf oder Indexstatus wurde hier nicht gemessen. Fall C: robots.txt-Sperre, ohne noindex Pfad: /blocked/plain.html Beobachtetes HTTP: 200; text/html; charset=utf-8. HTML-Meta robots: nicht vorhanden. HTML-Meta googlebot: nicht vorhanden. HTTP-Header X-Robots-Tag: nicht vorhanden. Zuordnung zur lokalen robots.txt-Konfiguration: Disallow: /blocked/ trifft zu. Technische Prüfungen: 8/8 bestanden. Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis): Die robots.txt-Regel untersagt regelkonformen Crawlern den Abruf dieses Pfades. Sie verhindert keine direkte HTTP-Anfrage und garantiert keinen Ausschluss der URL aus Google: Eine anderweitig entdeckte URL kann ohne gecrawlten Seiteninhalt im Index erscheinen. Fall D: robots.txt-Sperre plus noindex im HTML Pfad: /blocked/noindex.html Beobachtetes HTTP: 200; text/html; charset=utf-8. HTML-Meta robots: noindex. HTML-Meta googlebot: nicht vorhanden. HTTP-Header X-Robots-Tag: nicht vorhanden. Zuordnung zur lokalen robots.txt-Konfiguration: Disallow: /blocked/ trifft zu. Technische Prüfungen: 8/8 bestanden. Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis): Das noindex-Meta-Tag liegt zwar im ausgelieferten HTML, ist für Google bei einem durch robots.txt verhinderten Abruf aber nicht lesbar. Die Kombination ist deshalb kein verlässlicher Weg, eine URL aus dem Index zu entfernen. Unser direkter HTTP-Client kann das Tag trotzdem lesen, weil er robots.txt nicht automatisch befolgt. Fall E: index im HTML, noindex im Antwort-Header Pfad: /public/header-conflict.html Beobachtetes HTTP: 200; text/html; charset=utf-8. HTML-Meta robots: index,follow. HTML-Meta googlebot: nicht vorhanden. HTTP-Header X-Robots-Tag: noindex. Zuordnung zur lokalen robots.txt-Konfiguration: keine Disallow-Regel trifft zu. Technische Prüfungen: 8/8 bestanden. Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis): Google kombiniert unterstützte, anwendbare robots-Anweisungen aus HTML und HTTP-Headern. Bei diesem Konflikt gilt die restriktivere Indexierungsanweisung noindex. Das index im HTML hebt das noindex im X-Robots-Tag nicht auf. Voraussetzung ist ein möglicher Abruf. Fall F: Allgemeines index, Googlebot-spezifisches noindex Pfad: /public/bot-specific.html Beobachtetes HTTP: 200; text/html; charset=utf-8. HTML-Meta robots: index,follow. HTML-Meta googlebot: noindex. HTTP-Header X-Robots-Tag: nicht vorhanden. Zuordnung zur lokalen robots.txt-Konfiguration: keine Disallow-Regel trifft zu. Technische Prüfungen: 8/8 bestanden. Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis): Für Googlebot sind hier die allgemeine robots-Anweisung und die googlebot-spezifische Anweisung anwendbar; die restriktivere Indexierungsanweisung noindex gilt. Das googlebot-Meta-Tag richtet sich nicht pauschal an andere Suchmaschinen. Deren Verhalten wurde nicht getestet. Grenzen und Reproduktion ----------------------- Gemessen wurden Auslieferung, HTML-Anweisungen und HTTP-Header. Nicht gemessen wurden Google-Crawling, Indexaufnahme, Entfernung aus einem Index, Rankings oder Verarbeitungsgeschwindigkeit. Alle Google-Aussagen sind Einordnungen anhand offizieller Dokumentation und keine Ergebnisse dieses lokalen Tests. Die .http-Dateien rekonstruieren die empfangene Antwort aus Status, geparsten Headern und unverändertem Body; sie sind keine Netzwerk-Paketmitschnitte. Erneute Ausführung: python3 run_fixture.py Ausgabe: fixtures/, raw-responses/, results.json, public-report.txt, SHA256SUMS. Der Server bindet nur an 127.0.0.1, nutzt einen freien Port und wird beendet. Keine externen Abhängigkeiten, keine externen HTTP-Anfragen. Port, Zeitangaben, HTTP-Date-Header und davon abhängige Hashes ändern sich je Lauf. Offizielle Quellen für die Einordnung ------------------------------------ Quellenprüfung separat durch die Artikelrecherche am 24. September 2026. Google Search Central: Indexierung mit noindex blockieren https://developers.google.com/search/docs/crawling-indexing/block-indexing Google Search Central: Einführung in robots.txt https://developers.google.com/search/docs/crawling-indexing/robots/intro Google Search Central: robots-Meta-Tag und X-Robots-Tag https://developers.google.com/search/docs/crawling-indexing/robots-meta-tag