
Was llms.txt sein sollte
Die Idee stammt aus dem Jahr 2024: eine Textdatei im Wurzelverzeichnis einer Website, ähnlich der bekannten robots.txt, die Sprachmodellen in aufbereiteter Form mitteilt, welche Inhalte es gibt und wie sie zu verstehen sind. Der Gedanke war, den Modellen das Aufbereiten von HTML zu ersparen und dabei selbst zu bestimmen, was betont wird.
Vorgeschlagen hat das Format Jeremy Howard, Mitgründer von Answer.AI und fast.ai. Die Spezifikation auf llmstxt.org wurde am 3. September 2024 veröffentlicht und liegt seit dem 10. August 2026 in einer zweiten Fassung vor. Sie fällt kurz aus. Die Datei ist in Markdown geschrieben. Sie beginnt mit einer H1-Überschrift für den Namen des Projekts. Darunter folgt ein Zitatblock mit einer knappen Zusammenfassung. Danach kommen H2-Abschnitte mit Linklisten, wobei jeder Link eine kurze Notiz tragen darf. Ein Abschnitt mit der Überschrift „Optional“ markiert Inhalte, die ein Modell überspringen kann, wenn der Platz knapp wird.
In der Praxis sieht eine solche Datei so aus:
# Name Ihres Unternehmens
> Ein Satz dazu, was das Unternehmen macht und für wen.
## Leistungen
- [Leistung A](https://example.de/leistung-a): worum es geht
- [Leistung B](https://example.de/leistung-b): worum es geht
## Optional
- [Unternehmensgeschichte](https://example.de/historie)
Die Idee ist nachvollziehbar. Das Problem ist, dass kein relevanter Anbieter sie umgesetzt hat.
Weder OpenAI noch Google oder Perplexity dokumentieren llms.txt als Signal für Zitate oder Sichtbarkeit. Wo das Format tatsächlich gelesen wird, handelt es sich um Entwicklerdokumentation, die von KI-Programmierwerkzeugen verarbeitet wird. Googles John Mueller ordnete llms.txt in der von Ahrefs dokumentierten Diskussion als „vorübergehende Krücke“ ein, die solchen Werkzeugen ein paar Token spart. Für die Suche sei die Datei nicht gemacht.
Was die Daten sagen
Es gibt inzwischen belastbare Zahlen, und sie fallen eindeutig aus.
Die Ahrefs-Auswertung umfasste 137.210 Domains, die im Mai 2026 in Ahrefs Web Analytics Zugriffe verzeichneten. 28 Prozent davon, also rund 38.000 Websites, stellten eine gültige llms.txt bereit. Ahrefs weist selbst darauf hin, dass diese Kundschaft technisch versierter ist als der Rest des Webs, der Verbreitungswert also eher eine Obergrenze darstellt. 97 Prozent dieser Dateien erhielten im gesamten Monat keinen einzigen Abruf. Nicht von Menschen, nicht von Maschinen.
Bei den verbleibenden drei Prozent lohnt der Blick darauf, wer die Datei überhaupt liest. 96 Prozent der Abrufe stammten von Bots. 77 Prozent dieser Bots gehören nicht zu KI-Werkzeugen. 12 Prozent aller Abrufe kamen von GEO-Werkzeugen, llms.txt-Prüfdiensten und Forschung. Ein nennenswerter Teil der Nachfrage kommt also aus der Branche, die das Thema selbst beobachtet.
Ein Befund ist besonders aufschlussreich: Bei Domains ohne llms.txt gab es null Anfragen von KI-Bots nach der Datei. Die Systeme suchen gar nicht erst danach. Ein fehlender Eintrag im Crawling-Protokoll ist damit kein Versäumnis, sondern der Normalfall.
Google hat sich festgelegt. Der Leitfaden zur Optimierung für generative KI-Funktionen erschien Ende Mai 2026 und wurde zuletzt am 10. Juli 2026 aktualisiert. Er führt llms.txt unter den Dingen auf, die man für die Google-Suche ignorieren kann. Man brauche keine neuen maschinenlesbaren Dateien, um in der Google-Suche einschließlich ihrer generativen Funktionen zu erscheinen, denn die Suche verwende sie nicht. Wer solche Dateien für andere Systeme pflegen wolle, könne das tun. Auf Sichtbarkeit und Rankings in der Google-Suche wirke sich das weder positiv noch negativ aus.
Für einen typischen Unternehmensauftritt, also Dienstleister, Händler oder Hersteller, gibt es derzeit keinen dokumentierten Fall, in dem die Datei messbar geholfen hätte.
Die Datenlage in Zahlen
| Kennzahl | Wert | Quelle |
|---|---|---|
| Untersuchte Domains mit Zugriffen im Mai 2026 | 137.210 | Ahrefs, Juni 2026 |
| Anteil mit gültiger llms.txt (laut Ahrefs eher Obergrenze) | 28 % (rund 38.000) | Ahrefs, Juni 2026 |
| Gültige Dateien ohne einen einzigen Abruf | 97 % | Ahrefs, Juni 2026 |
| Anteil der Abrufe, die von Bots kamen | 96 % | Ahrefs, Juni 2026 |
| Lesende Bots ohne Bezug zu KI-Werkzeugen | 77 % | Ahrefs, Juni 2026 |
| Abrufe durch GEO-Werkzeuge, Prüfdienste, Forschung | 12 % | Ahrefs, Juni 2026 |
| Anfragen von KI-Bots nach nicht vorhandenen Dateien | 0 | Ahrefs, Juni 2026 |
Warum sie trotzdem überall empfohlen wird
llms.txt hat einen Vorteil, der nichts mit Wirkung zu tun hat: Sie lässt sich in zehn Minuten anlegen und sieht nach konkreter Arbeit aus. Für Anbieter, die schnell etwas Vorzeigbares im Bereich KI-Sichtbarkeit liefern wollen, ist das attraktiv.
Dazu kommt ein Denkfehler, der bei neuen Techniken regelmäßig auftritt: Weil robots.txt und sitemap.xml funktionieren, wirkt eine Datei nach demselben Muster plausibel. Plausibilität ist aber kein Beleg.
Ein Teil der Verbreitung hat außerdem einen technischen Auslöser. Wenige Tage nach dem Google-Leitfaden nahm das Chrome-Team eine llms.txt-Prüfung in die experimentellen Audits von Lighthouse auf. Laut Ahrefs erzeugte allein diese Prüfung etwa einen von tausend Abrufen der Datei. Ein Werkzeug, das eine Datei anmahnt, ist aber kein Anbieter, der sie auswertet.
Wenn Ihnen jemand llms.txt als zentralen Baustein für KI-Sichtbarkeit verkauft, ist das ein brauchbarer Prüfstein. Fragen Sie nach der Datengrundlage. Kommt keine, wissen Sie, woran Sie sind.
Schaden richtet die Datei übrigens nicht an. Wer sie bereits hat, kann sie liegen lassen. Nur bezahlen sollte man nicht dafür.
Wann eine llms.txt doch sinnvoll ist
Es gibt einen Fall, in dem das Format nicht sinnlos ist: umfangreiche technische Dokumentation. In der Ahrefs-Auswertung sind GPTBot und Claude-Code die beiden häufigsten KI-Leser der Datei, noch vor allen KI-Suchdiensten und Assistenten. Einzeln betrachtet ruft allerdings kein KI-Bot die Datei so oft ab wie SEO-Prüfwerkzeuge oder allgemeine Web-Crawler. Claude-Code ist ein Programmierwerkzeug. Genau dort passt die Datei zu ihrem ursprünglichen Zweck.
Drei Fragen grenzen das ab:
- Besteht ein großer Teil Ihrer Website aus Schnittstellenbeschreibungen, Handbüchern oder Software-Dokumentation?
- Arbeiten Ihre Leser mit KI-Programmierwerkzeugen, die diese Dokumentation verarbeiten?
- Können Sie die Datei bei jeder Änderung an der Seitenstruktur zuverlässig mitpflegen?
Nur wenn Sie alle drei Fragen mit Ja beantworten, hat die Datei einen erkennbaren Zweck. Für einen Hersteller, einen Dienstleister oder einen Händler trifft das in aller Regel nicht zu.
Der Pflegeaufwand wird dabei gern unterschätzt. Angelegt ist eine llms.txt in zehn Minuten. Danach veraltet sie mit jeder neuen Leistungsseite und jeder geänderten URL. Bei einer Website mit 40 Seiten lässt sich das noch von Hand nachziehen. Bei 400 Seiten braucht es einen automatischen Export aus dem Redaktionssystem, also Entwicklungsarbeit für eine Datei ohne belegte Wirkung. Dieselbe Zeit in sauberes Schema.org-Markup oder in einen fehlenden Inhalt gesteckt, ist nachweisbar besser angelegt.
Der Unterschied zur robots.txt
Eine Datei im Wurzelverzeichnis wird tatsächlich von allen KI-Anbietern ausgewertet, und zwar die robots.txt. Dort entscheiden Sie, ob Ihre Inhalte überhaupt abgerufen werden dürfen.
Das ist der Punkt, der in der Debatte um llms.txt untergeht: Während viele Unternehmen über eine Datei ohne dokumentierte Wirkung diskutieren, sperren manche von ihnen in der robots.txt versehentlich genau die Crawler aus, auf deren Zitate sie hoffen.
Die Kennungen sind dabei nicht austauschbar. Die Crawler-Dokumentation von OpenAI trennt sie klar: GPTBot steuert, ob Inhalte in das Training der Modelle einfließen. Ob Ihre Seite in den Suchantworten von ChatGPT auftaucht, entscheidet dagegen OAI-SearchBot. OpenAI empfiehlt ausdrücklich, OAI-SearchBot zu erlauben, damit die Seite in Suchergebnissen erscheint. Beide Einstellungen sind unabhängig voneinander.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
Der erste Block hält Ihre Inhalte aus dem Training. Der zweite nimmt Sie aus den Suchantworten von ChatGPT. Wer beides in einem Zug einträgt, weil es nach derselben Sache aussieht, verliert Sichtbarkeit, die er behalten wollte.
Bei Google ist die Verwechslungsgefahr noch größer. Laut der Übersicht der gängigen Google-Crawler, zuletzt aktualisiert am 14. Juli 2026, steuert Google-Extended das Training künftiger Gemini-Modelle sowie das Grounding in den Gemini-Apps und in Grounding with Google Search auf Vertex AI. Auf die Aufnahme in die Google-Suche hat die Kennung ausdrücklich keinen Einfluss, und als Rankingsignal wird sie ebenfalls nicht verwendet. Wer Google-Extended sperrt, verschwindet also nicht aus den AI Overviews. Diese speisen sich aus dem regulären Suchindex.
Bei Anthropic gilt dieselbe Trennung. Die Crawler-Übersicht von Anthropic unterscheidet ClaudeBot, der Inhalte für das Training sammelt, von Claude-SearchBot, der Inhalte für Suchantworten erschließt. Wer den zweiten sperrt, verliert laut Anthropic Sichtbarkeit in den Suchergebnissen von Claude.
Die Kennungen, die Sie kennen sollten
| Kennung | Anbieter | Wofür sie steht | Wirkung eines Disallow |
|---|---|---|---|
| GPTBot | OpenAI | Training der Modelle | Inhalte fließen nicht ins Training |
| OAI-SearchBot | OpenAI | Suchergebnisse in ChatGPT | Seite erscheint nicht in ChatGPT-Suchantworten |
| ClaudeBot | Anthropic | Training der Modelle | Künftige Inhalte bleiben aus den Trainingsdaten |
| Claude-SearchBot | Anthropic | Indexierung für Suchantworten | Geringere Sichtbarkeit in Suchergebnissen von Claude |
| PerplexityBot | Perplexity | Auffinden und Verlinken in Perplexity | Seite wird in Perplexity-Ergebnissen nicht mehr verlinkt |
| Google-Extended | Gemini-Training und Grounding | Kein Einfluss auf die Google-Suche |
Neben den Crawlern gibt es bei allen drei Anbietern noch die nutzergesteuerten Abrufe, also ChatGPT-User, Claude-User und Perplexity-User. Sie greifen zu, wenn ein Mensch im Chat eine Frage stellt und das System die Seite live öffnet. Weil diese Abrufe von einem Nutzer ausgelöst werden, gelten die robots.txt-Regeln dafür laut Dokumentation von OpenAI und Perplexity nicht zwingend.
Die Prüfung, die stattdessen lohnt
Bevor Sie über llms.txt nachdenken, arbeiten Sie diese sechs Schritte ab. Der ganze Durchgang dauert selten länger als eine halbe Stunde.
- robots.txt öffnen. Rufen Sie ihredomain.de/robots.txt im Browser auf. Kommt ein Fehler statt einer Textdatei, ist das der erste Befund.
- Nach den sechs Kennungen suchen. Prüfen Sie die Datei auf Disallow-Regeln für GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot und Google-Extended. Achten Sie besonders auf eine pauschale Regel für alle Bots.
- Zwischen Training und Suche unterscheiden. Entscheiden Sie bewusst, ob Sie nur das Training ausschließen wollen oder auch die Suchantworten. Für die meisten Unternehmen ist die Antwort: Training gern sperren, Suche auf keinen Fall.
- Firewall und CDN prüfen. Eine erlaubte robots.txt nützt nichts, wenn eine Web Application Firewall die Anfragen blockt. Perplexity beschreibt in seiner Bot-Dokumentation eigens, wie man die Kennungen in Cloudflare und AWS freigibt. Prüfen Sie das mit Ihrem Hoster.
- Änderung eintragen und abwarten. OpenAI gibt an, dass es nach einer Änderung an der robots.txt rund 24 Stunden dauert, bis die Systeme sie berücksichtigen. Perplexity nennt ebenfalls bis zu 24 Stunden. Prüfen Sie also nicht am selben Tag nach.
- Erst danach an Inhalten arbeiten. Sobald der Zugang steht, entscheidet der Inhalt. Klare Antworten auf klar gestellte Fragen, belegte Zahlen und Erwähnungen auf fremden Seiten sind die Signale, die über Zitierfähigkeit entscheiden.
Der zweite und der vierte Schritt sind die, bei denen wir in Projekten am häufigsten etwas finden. Ein einzelner Eintrag entscheidet darüber, ob Sie überhaupt zitiert werden können. Erst danach wird die Prompt-Sichtbarkeit zu einer Frage von Inhalten. Was Sie dafür an Inhalten und Erwähnungen brauchen, steht im Beitrag Wie kommt man in ChatGPT-Antworten.

Geschrieben von
Marcel Speckmann
Geschäftsführer der Speckmann Webdesign GmbH in Oldenburg. Ich arbeite an Suchmaschinenoptimierung, KI-Sichtbarkeit und den Websites, die dafür die Grundlage sind. Was hier steht, stammt aus laufenden Projekten, nicht aus Lehrbüchern.
Dazu passt
Was statt einer llms.txt tatsächlich Wirkung zeigt und wie wir es umsetzen, steht auf der Seite zur KI-Sichtbarkeit.