PATERNOGA Research · Erhebung 2026
Wie steuern DAX-40-Unternehmen KI-Crawler?
PATERNOGA hat für eine klar definierte Stichprobe öffentlicher Unternehmenswebsites geprüft, welche Crawler-Richtlinien und technischen Discovery-Dateien am 30. August 2026 erreichbar waren. Die Auswertung misst veröffentlichte Konfiguration – nicht tatsächliche Bot-Besuche, Indexierung oder Zitationen.
Zentrale Beobachtung
Bei 33 von 40 Domains war eine verwertbare robots.txt abrufbar. Keine dieser 33 Dateien sperrte die geprüfte Startseite für Googlebot, Bingbot, OAI-SearchBot, GPTBot oder PerplexityBot. Für 7 Domains bleibt die Richtlinie wegen 403-Antwort oder Timeout unbekannt.
- robots.txt verwertbar
- 33
- von 40 Domains
- OAI-SearchBot explizit genannt
- 2
- in verwertbaren Richtlinien
- llms.txt verwertbar
- 6
- von 40 Domains
- Sitemap in robots.txt deklariert
- 28
- von 40 Domains
Was sich daraus ableiten lässt – und was nicht
Beobachtung
In der auswertbaren Teilstichprobe war kein vollständiger Startseiten-Block für die fünf geprüften User-Agents konfiguriert.
Einordnung
Die meisten Freigaben entstanden über generische Regeln. Nur wenige Unternehmen nannten die KI-Crawler ausdrücklich. Das zeigt Konfiguration, nicht Absicht.
Keine Aussage
Die Erhebung sagt nicht, ob ein Bot die Website tatsächlich besucht, ein CDN ihn zulässt, Inhalte indexiert werden oder in Antworten erscheinen.
Keine Hochrechnung
DAX-40-Unternehmen sind keine repräsentative Stichprobe aller deutschen Unternehmen oder des Mittelstands.
Methode
Erhoben am 30. August 2026 um 22:31. Die Domains wurden nacheinander verarbeitet. Pro Domain wurden genau vier öffentliche Ressourcen einmalig abgefragt: robots.txt, llms.txt, /sitemap.xml und die Startseite.
- 1
Stichprobe
Die 40 am Stichtag beobachteten DAX-Unternehmen. Für jedes Unternehmen wurde eine öffentliche Corporate-Domain vorab festgelegt.
- 2
robots.txt
Regeln wurden gruppenbezogen für den Pfad / ausgewertet. Spezifische User-Agent-Gruppen haben Vorrang vor der generischen Stern-Gruppe.
- 3
Discovery-Dateien
Erfasst wurde, ob eine Sitemap in robots.txt deklariert ist, ob /sitemap.xml ein URL-Set oder einen Sitemap-Index liefert und ob /llms.txt verwertbaren Klartext liefert.
- 4
Homepage
Erfasst wurde ausschließlich, ob JSON-LD-Syntax vorhanden ist. Inhaltliche Qualität oder Schema-Validität wurden nicht bewertet.
Detailbefunde
- 28 von 40 robots.txt-Dateien deklarierten eine Sitemap.
- 20 von 40 Domains lieferten unter /sitemap.xml ein erkennbares URL-Set oder einen Sitemap-Index. Eine Sitemap an einem anderen, nicht deklarierten Pfad kann damit übersehen worden sein.
- 6 von 40 Domains lieferten unter /llms.txt verwertbaren Klartext. Daraus wird keine Ranking- oder Zitationswirkung abgeleitet.
- 16 von 40 Startseiten enthielten erkennbares JSON-LD. Diese Präsenzprüfung ist keine Qualitätsbewertung.
- 3 Richtlinien nannten GPTBot explizit, 2 OAI-SearchBot und 3 PerplexityBot.
Alle 40 Beobachtungen
| Unternehmen | robots.txt | OAI Search | GPTBot | Perplexity | Sitemap deklariert | llms.txt |
|---|---|---|---|---|---|---|
| adidas | — | unbekannt | unbekannt | unbekannt | nein | nein |
| Airbus | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Allianz | 403 | unbekannt | unbekannt | unbekannt | nein | nein |
| BASF | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Bayer | 403 | unbekannt | unbekannt | unbekannt | nein | nein |
| Beiersdorf | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| BMW | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Brenntag | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Commerzbank | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Continental | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Daimler Truck | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Deutsche Bank | 200 | erlaubt | erlaubt | erlaubt | ja | ja |
| Deutsche Börse | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Deutsche Telekom | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| DHL Group | — | unbekannt | unbekannt | unbekannt | nein | nein |
| E.ON | 403 | unbekannt | unbekannt | unbekannt | nein | nein |
| Fresenius | 200 | erlaubt | erlaubt | erlaubt | nein | nein |
| Fresenius Medical Care | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| GEA | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Hannover Rück | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Heidelberg Materials | 200 | erlaubt | erlaubt | erlaubt | ja | ja |
| Henkel | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| HOCHTIEF | 200 | erlaubt | erlaubt | erlaubt | nein | nein |
| Infineon | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Mercedes-Benz Group | 403 | unbekannt | unbekannt | unbekannt | nein | nein |
| Merck KGaA | — | unbekannt | unbekannt | unbekannt | nein | nein |
| MTU Aero Engines | 200 | erlaubt | erlaubt | erlaubt | nein | nein |
| Munich Re | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| QIAGEN | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Rheinmetall | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| RWE | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| SAP | 200 | erlaubt | erlaubt | erlaubt | ja | ja |
| Scout24 | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Siemens | 200 | erlaubt | erlaubt | erlaubt | ja | ja |
| Siemens Energy | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Siemens Healthineers | 200 | erlaubt | erlaubt | erlaubt | ja | nein |
| Symrise | 200 | erlaubt | erlaubt | erlaubt | nein | nein |
| Volkswagen | 200 | erlaubt | erlaubt | erlaubt | ja | ja |
| Vonovia | 200 | erlaubt | erlaubt | erlaubt | ja | ja |
| Zalando | 200 | erlaubt | erlaubt | erlaubt | nein | nein |
Grenzen der Erhebung
- Öffentliche Richtlinie statt realer Bot-Traffic
- Keine IP-Verifikation externer Crawler
- Keine WAF-, CDN- oder Rendering-Simulation
- Keine Bewertung von Indexierung oder Zitation
- Stichtagsmessung; Domains und Regeln können sich ändern
- Keine repräsentative Aussage über deutsche Unternehmen insgesamt
Rohdaten und Reproduzierbarkeit
Die vollständigen Beobachtungen, Statuscodes, Ziel-URLs, Methodenversion und technischen Grenzen stehen als JSON und CSV bereit. Das Erhebungsskript bleibt im Projekt versioniert, damit eine spätere Wiederholung dieselbe Logik verwenden kann.
Stichprobe und technische Primärquellen
Crawler-Zugriff ist eine Voraussetzung, keine Sichtbarkeitsgarantie
Für eine belastbare Bewertung müssen Richtlinien, Serverzugriff, Indexierung, Inhalte, Quellen und reale Antwortmuster getrennt betrachtet werden.