PATERNOGA Research · Erhebung 2026

Wie steuern DAX-40-Unternehmen KI-Crawler?

PATERNOGA hat für eine klar definierte Stichprobe öffentlicher Unternehmenswebsites geprüft, welche Crawler-Richtlinien und technischen Discovery-Dateien am 30. August 2026 erreichbar waren. Die Auswertung misst veröffentlichte Konfiguration – nicht tatsächliche Bot-Besuche, Indexierung oder Zitationen.

Zentrale Beobachtung

Bei 33 von 40 Domains war eine verwertbare robots.txt abrufbar. Keine dieser 33 Dateien sperrte die geprüfte Startseite für Googlebot, Bingbot, OAI-SearchBot, GPTBot oder PerplexityBot. Für 7 Domains bleibt die Richtlinie wegen 403-Antwort oder Timeout unbekannt.

robots.txt verwertbar
33
von 40 Domains
OAI-SearchBot explizit genannt
2
in verwertbaren Richtlinien
llms.txt verwertbar
6
von 40 Domains
Sitemap in robots.txt deklariert
28
von 40 Domains

Was sich daraus ableiten lässt – und was nicht

Beobachtung

In der auswertbaren Teilstichprobe war kein vollständiger Startseiten-Block für die fünf geprüften User-Agents konfiguriert.

Einordnung

Die meisten Freigaben entstanden über generische Regeln. Nur wenige Unternehmen nannten die KI-Crawler ausdrücklich. Das zeigt Konfiguration, nicht Absicht.

Keine Aussage

Die Erhebung sagt nicht, ob ein Bot die Website tatsächlich besucht, ein CDN ihn zulässt, Inhalte indexiert werden oder in Antworten erscheinen.

Keine Hochrechnung

DAX-40-Unternehmen sind keine repräsentative Stichprobe aller deutschen Unternehmen oder des Mittelstands.

Methode

Erhoben am 30. August 2026 um 22:31. Die Domains wurden nacheinander verarbeitet. Pro Domain wurden genau vier öffentliche Ressourcen einmalig abgefragt: robots.txt, llms.txt, /sitemap.xml und die Startseite.

  1. 1

    Stichprobe

    Die 40 am Stichtag beobachteten DAX-Unternehmen. Für jedes Unternehmen wurde eine öffentliche Corporate-Domain vorab festgelegt.

  2. 2

    robots.txt

    Regeln wurden gruppenbezogen für den Pfad / ausgewertet. Spezifische User-Agent-Gruppen haben Vorrang vor der generischen Stern-Gruppe.

  3. 3

    Discovery-Dateien

    Erfasst wurde, ob eine Sitemap in robots.txt deklariert ist, ob /sitemap.xml ein URL-Set oder einen Sitemap-Index liefert und ob /llms.txt verwertbaren Klartext liefert.

  4. 4

    Homepage

    Erfasst wurde ausschließlich, ob JSON-LD-Syntax vorhanden ist. Inhaltliche Qualität oder Schema-Validität wurden nicht bewertet.

Detailbefunde

  • 28 von 40 robots.txt-Dateien deklarierten eine Sitemap.
  • 20 von 40 Domains lieferten unter /sitemap.xml ein erkennbares URL-Set oder einen Sitemap-Index. Eine Sitemap an einem anderen, nicht deklarierten Pfad kann damit übersehen worden sein.
  • 6 von 40 Domains lieferten unter /llms.txt verwertbaren Klartext. Daraus wird keine Ranking- oder Zitationswirkung abgeleitet.
  • 16 von 40 Startseiten enthielten erkennbares JSON-LD. Diese Präsenzprüfung ist keine Qualitätsbewertung.
  • 3 Richtlinien nannten GPTBot explizit, 2 OAI-SearchBot und 3 PerplexityBot.

Alle 40 Beobachtungen

Unternehmenrobots.txtOAI SearchGPTBotPerplexitySitemap deklariertllms.txt
adidasunbekanntunbekanntunbekanntneinnein
Airbus200erlaubterlaubterlaubtjanein
Allianz403unbekanntunbekanntunbekanntneinnein
BASF200erlaubterlaubterlaubtjanein
Bayer403unbekanntunbekanntunbekanntneinnein
Beiersdorf200erlaubterlaubterlaubtjanein
BMW200erlaubterlaubterlaubtjanein
Brenntag200erlaubterlaubterlaubtjanein
Commerzbank200erlaubterlaubterlaubtjanein
Continental200erlaubterlaubterlaubtjanein
Daimler Truck200erlaubterlaubterlaubtjanein
Deutsche Bank200erlaubterlaubterlaubtjaja
Deutsche Börse200erlaubterlaubterlaubtjanein
Deutsche Telekom200erlaubterlaubterlaubtjanein
DHL Groupunbekanntunbekanntunbekanntneinnein
E.ON403unbekanntunbekanntunbekanntneinnein
Fresenius200erlaubterlaubterlaubtneinnein
Fresenius Medical Care200erlaubterlaubterlaubtjanein
GEA200erlaubterlaubterlaubtjanein
Hannover Rück200erlaubterlaubterlaubtjanein
Heidelberg Materials200erlaubterlaubterlaubtjaja
Henkel200erlaubterlaubterlaubtjanein
HOCHTIEF200erlaubterlaubterlaubtneinnein
Infineon200erlaubterlaubterlaubtjanein
Mercedes-Benz Group403unbekanntunbekanntunbekanntneinnein
Merck KGaAunbekanntunbekanntunbekanntneinnein
MTU Aero Engines200erlaubterlaubterlaubtneinnein
Munich Re200erlaubterlaubterlaubtjanein
QIAGEN200erlaubterlaubterlaubtjanein
Rheinmetall200erlaubterlaubterlaubtjanein
RWE200erlaubterlaubterlaubtjanein
SAP200erlaubterlaubterlaubtjaja
Scout24200erlaubterlaubterlaubtjanein
Siemens200erlaubterlaubterlaubtjaja
Siemens Energy200erlaubterlaubterlaubtjanein
Siemens Healthineers200erlaubterlaubterlaubtjanein
Symrise200erlaubterlaubterlaubtneinnein
Volkswagen200erlaubterlaubterlaubtjaja
Vonovia200erlaubterlaubterlaubtjaja
Zalando200erlaubterlaubterlaubtneinnein

Grenzen der Erhebung

  • Öffentliche Richtlinie statt realer Bot-Traffic
  • Keine IP-Verifikation externer Crawler
  • Keine WAF-, CDN- oder Rendering-Simulation
  • Keine Bewertung von Indexierung oder Zitation
  • Stichtagsmessung; Domains und Regeln können sich ändern
  • Keine repräsentative Aussage über deutsche Unternehmen insgesamt

Rohdaten und Reproduzierbarkeit

Die vollständigen Beobachtungen, Statuscodes, Ziel-URLs, Methodenversion und technischen Grenzen stehen als JSON und CSV bereit. Das Erhebungsskript bleibt im Projekt versioniert, damit eine spätere Wiederholung dieselbe Logik verwenden kann.

Stichprobe und technische Primärquellen

Crawler-Zugriff ist eine Voraussetzung, keine Sichtbarkeitsgarantie

Für eine belastbare Bewertung müssen Richtlinien, Serverzugriff, Indexierung, Inhalte, Quellen und reale Antwortmuster getrennt betrachtet werden.