Lokaler HTTP-Konfigurationstest: robots.txt und noindex
=====================================================

Was tatsächlich geprüft wurde
-----------------------------
Sechs künstliche HTML-Seiten und eine robots.txt wurden über echtes lokales
HTTP auf 127.0.0.1 abgerufen. Der verwendete User-Agent war ausschließlich
TransparionLocalFixture/1.0. Der Test imitiert weder Googlebot noch eine andere Suchmaschine.
Der Client befolgt robots.txt nicht automatisch. Auch gesperrte Pfade antworten
deshalb mit HTTP 200. Das ist kein Widerspruch: robots.txt ist eine Anweisung
für Crawler, keine serverseitige Zugriffssperre.

Ausführung (UTC): 2026-09-24T19:22:41.969695+00:00
Ergebnis: 56/56 technische Prüfungen bestanden.
Davon: 6 × 8 Prüfungen für HTML, 5 für robots.txt, 3 für Ablauf und Aufräumen.
Anfragen: 7 lokale GETs. Server danach beendet: ja.

Ausgelieferte robots.txt:
User-agent: *
Disallow: /blocked/

Beobachtungen und dokumentierte Einordnung
----------------------------------------
Fall A: Öffentlich, ohne Indexierungsanweisung
Pfad: /public/indexable.html
Beobachtetes HTTP: 200; text/html; charset=utf-8.
HTML-Meta robots: nicht vorhanden.
HTML-Meta googlebot: nicht vorhanden.
HTTP-Header X-Robots-Tag: nicht vorhanden.
Zuordnung zur lokalen robots.txt-Konfiguration: keine Disallow-Regel trifft zu.
Technische Prüfungen: 8/8 bestanden.
Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis):
Die lokale Konfiguration enthält für diesen Pfad weder eine robots.txt-Sperre noch eine noindex-Anweisung. Das macht Indexierung grundsätzlich möglich, garantiert aber weder Crawling noch Aufnahme in den Google-Index.

Fall B: Öffentlich, noindex im HTML
Pfad: /public/noindex.html
Beobachtetes HTTP: 200; text/html; charset=utf-8.
HTML-Meta robots: noindex.
HTML-Meta googlebot: nicht vorhanden.
HTTP-Header X-Robots-Tag: nicht vorhanden.
Zuordnung zur lokalen robots.txt-Konfiguration: keine Disallow-Regel trifft zu.
Technische Prüfungen: 8/8 bestanden.
Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis):
Google muss die Seite abrufen können, um das noindex-Meta-Tag zu erkennen. Wenn Google die Anweisung beim Crawlen erkennt, soll die Seite nicht im Google-Index erscheinen. Ein tatsächlicher Google-Abruf oder Indexstatus wurde hier nicht gemessen.

Fall C: robots.txt-Sperre, ohne noindex
Pfad: /blocked/plain.html
Beobachtetes HTTP: 200; text/html; charset=utf-8.
HTML-Meta robots: nicht vorhanden.
HTML-Meta googlebot: nicht vorhanden.
HTTP-Header X-Robots-Tag: nicht vorhanden.
Zuordnung zur lokalen robots.txt-Konfiguration: Disallow: /blocked/ trifft zu.
Technische Prüfungen: 8/8 bestanden.
Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis):
Die robots.txt-Regel untersagt regelkonformen Crawlern den Abruf dieses Pfades. Sie verhindert keine direkte HTTP-Anfrage und garantiert keinen Ausschluss der URL aus Google: Eine anderweitig entdeckte URL kann ohne gecrawlten Seiteninhalt im Index erscheinen.

Fall D: robots.txt-Sperre plus noindex im HTML
Pfad: /blocked/noindex.html
Beobachtetes HTTP: 200; text/html; charset=utf-8.
HTML-Meta robots: noindex.
HTML-Meta googlebot: nicht vorhanden.
HTTP-Header X-Robots-Tag: nicht vorhanden.
Zuordnung zur lokalen robots.txt-Konfiguration: Disallow: /blocked/ trifft zu.
Technische Prüfungen: 8/8 bestanden.
Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis):
Das noindex-Meta-Tag liegt zwar im ausgelieferten HTML, ist für Google bei einem durch robots.txt verhinderten Abruf aber nicht lesbar. Die Kombination ist deshalb kein verlässlicher Weg, eine URL aus dem Index zu entfernen. Unser direkter HTTP-Client kann das Tag trotzdem lesen, weil er robots.txt nicht automatisch befolgt.

Fall E: index im HTML, noindex im Antwort-Header
Pfad: /public/header-conflict.html
Beobachtetes HTTP: 200; text/html; charset=utf-8.
HTML-Meta robots: index,follow.
HTML-Meta googlebot: nicht vorhanden.
HTTP-Header X-Robots-Tag: noindex.
Zuordnung zur lokalen robots.txt-Konfiguration: keine Disallow-Regel trifft zu.
Technische Prüfungen: 8/8 bestanden.
Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis):
Google kombiniert unterstützte, anwendbare robots-Anweisungen aus HTML und HTTP-Headern. Bei diesem Konflikt gilt die restriktivere Indexierungsanweisung noindex. Das index im HTML hebt das noindex im X-Robots-Tag nicht auf. Voraussetzung ist ein möglicher Abruf.

Fall F: Allgemeines index, Googlebot-spezifisches noindex
Pfad: /public/bot-specific.html
Beobachtetes HTTP: 200; text/html; charset=utf-8.
HTML-Meta robots: index,follow.
HTML-Meta googlebot: noindex.
HTTP-Header X-Robots-Tag: nicht vorhanden.
Zuordnung zur lokalen robots.txt-Konfiguration: keine Disallow-Regel trifft zu.
Technische Prüfungen: 8/8 bestanden.
Dokumentierte Google-Einordnung (kein gemessenes Indexergebnis):
Für Googlebot sind hier die allgemeine robots-Anweisung und die googlebot-spezifische Anweisung anwendbar; die restriktivere Indexierungsanweisung noindex gilt. Das googlebot-Meta-Tag richtet sich nicht pauschal an andere Suchmaschinen. Deren Verhalten wurde nicht getestet.

Grenzen und Reproduktion
-----------------------
Gemessen wurden Auslieferung, HTML-Anweisungen und HTTP-Header. Nicht gemessen
wurden Google-Crawling, Indexaufnahme, Entfernung aus einem Index, Rankings
oder Verarbeitungsgeschwindigkeit. Alle Google-Aussagen sind Einordnungen
anhand offizieller Dokumentation und keine Ergebnisse dieses lokalen Tests.
Die .http-Dateien rekonstruieren die empfangene Antwort aus Status, geparsten
Headern und unverändertem Body; sie sind keine Netzwerk-Paketmitschnitte.

Erneute Ausführung: python3 run_fixture.py
Ausgabe: fixtures/, raw-responses/, results.json, public-report.txt, SHA256SUMS.
Der Server bindet nur an 127.0.0.1, nutzt einen freien Port und wird beendet.
Keine externen Abhängigkeiten, keine externen HTTP-Anfragen.
Port, Zeitangaben, HTTP-Date-Header und davon abhängige Hashes ändern sich je Lauf.

Offizielle Quellen für die Einordnung
------------------------------------
Quellenprüfung separat durch die Artikelrecherche am 24. September 2026.
Google Search Central: Indexierung mit noindex blockieren
https://developers.google.com/search/docs/crawling-indexing/block-indexing
Google Search Central: Einführung in robots.txt
https://developers.google.com/search/docs/crawling-indexing/robots/intro
Google Search Central: robots-Meta-Tag und X-Robots-Tag
https://developers.google.com/search/docs/crawling-indexing/robots-meta-tag
