Eine einzelne kleine Karte in großer leerer Fläche, Sinnbild für die begrenzte Wirkung einer llms.txt

Was llms.txt sein sollte

Die Idee stammt aus dem Jahr 2024: eine Textdatei im Wurzelverzeichnis einer Website, ähnlich der bekannten robots.txt, die Sprachmodellen in aufbereiteter Form mitteilt, welche Inhalte es gibt und wie sie zu verstehen sind. Der Gedanke war, den Modellen das Aufbereiten von HTML zu ersparen und dabei selbst zu bestimmen, was betont wird.

Vorgeschlagen hat das Format Jeremy Howard, Mitgründer von Answer.AI und fast.ai. Die Spezifikation auf llmstxt.org wurde am 3. September 2024 veröffentlicht und liegt seit dem 10. August 2026 in einer zweiten Fassung vor. Sie fällt kurz aus. Die Datei ist in Markdown geschrieben. Sie beginnt mit einer H1-Überschrift für den Namen des Projekts. Darunter folgt ein Zitatblock mit einer knappen Zusammenfassung. Danach kommen H2-Abschnitte mit Linklisten, wobei jeder Link eine kurze Notiz tragen darf. Ein Abschnitt mit der Überschrift „Optional“ markiert Inhalte, die ein Modell überspringen kann, wenn der Platz knapp wird.

In der Praxis sieht eine solche Datei so aus:

# Name Ihres Unternehmens

> Ein Satz dazu, was das Unternehmen macht und für wen.

## Leistungen

- [Leistung A](https://example.de/leistung-a): worum es geht
- [Leistung B](https://example.de/leistung-b): worum es geht

## Optional

- [Unternehmensgeschichte](https://example.de/historie)

Die Idee ist nachvollziehbar. Das Problem ist, dass kein relevanter Anbieter sie umgesetzt hat.

Weder OpenAI noch Google oder Perplexity dokumentieren llms.txt als Signal für Zitate oder Sichtbarkeit. Wo das Format tatsächlich gelesen wird, handelt es sich um Entwicklerdokumentation, die von KI-Programmierwerkzeugen verarbeitet wird. Googles John Mueller ordnete llms.txt in der von Ahrefs dokumentierten Diskussion als „vorübergehende Krücke“ ein, die solchen Werkzeugen ein paar Token spart. Für die Suche sei die Datei nicht gemacht.

Was die Daten sagen

Es gibt inzwischen belastbare Zahlen, und sie fallen eindeutig aus.

Die Ahrefs-Auswertung umfasste 137.210 Domains, die im Mai 2026 in Ahrefs Web Analytics Zugriffe verzeichneten. 28 Prozent davon, also rund 38.000 Websites, stellten eine gültige llms.txt bereit. Ahrefs weist selbst darauf hin, dass diese Kundschaft technisch versierter ist als der Rest des Webs, der Verbreitungswert also eher eine Obergrenze darstellt. 97 Prozent dieser Dateien erhielten im gesamten Monat keinen einzigen Abruf. Nicht von Menschen, nicht von Maschinen.

Bei den verbleibenden drei Prozent lohnt der Blick darauf, wer die Datei überhaupt liest. 96 Prozent der Abrufe stammten von Bots. 77 Prozent dieser Bots gehören nicht zu KI-Werkzeugen. 12 Prozent aller Abrufe kamen von GEO-Werkzeugen, llms.txt-Prüfdiensten und Forschung. Ein nennenswerter Teil der Nachfrage kommt also aus der Branche, die das Thema selbst beobachtet.

Ein Befund ist besonders aufschlussreich: Bei Domains ohne llms.txt gab es null Anfragen von KI-Bots nach der Datei. Die Systeme suchen gar nicht erst danach. Ein fehlender Eintrag im Crawling-Protokoll ist damit kein Versäumnis, sondern der Normalfall.

Google hat sich festgelegt. Der Leitfaden zur Optimierung für generative KI-Funktionen erschien Ende Mai 2026 und wurde zuletzt am 10. Juli 2026 aktualisiert. Er führt llms.txt unter den Dingen auf, die man für die Google-Suche ignorieren kann. Man brauche keine neuen maschinenlesbaren Dateien, um in der Google-Suche einschließlich ihrer generativen Funktionen zu erscheinen, denn die Suche verwende sie nicht. Wer solche Dateien für andere Systeme pflegen wolle, könne das tun. Auf Sichtbarkeit und Rankings in der Google-Suche wirke sich das weder positiv noch negativ aus.

Für einen typischen Unternehmensauftritt, also Dienstleister, Händler oder Hersteller, gibt es derzeit keinen dokumentierten Fall, in dem die Datei messbar geholfen hätte.

Die Datenlage in Zahlen

KennzahlWertQuelle
Untersuchte Domains mit Zugriffen im Mai 2026137.210Ahrefs, Juni 2026
Anteil mit gültiger llms.txt (laut Ahrefs eher Obergrenze)28 % (rund 38.000)Ahrefs, Juni 2026
Gültige Dateien ohne einen einzigen Abruf97 %Ahrefs, Juni 2026
Anteil der Abrufe, die von Bots kamen96 %Ahrefs, Juni 2026
Lesende Bots ohne Bezug zu KI-Werkzeugen77 %Ahrefs, Juni 2026
Abrufe durch GEO-Werkzeuge, Prüfdienste, Forschung12 %Ahrefs, Juni 2026
Anfragen von KI-Bots nach nicht vorhandenen Dateien0Ahrefs, Juni 2026

Warum sie trotzdem überall empfohlen wird

llms.txt hat einen Vorteil, der nichts mit Wirkung zu tun hat: Sie lässt sich in zehn Minuten anlegen und sieht nach konkreter Arbeit aus. Für Anbieter, die schnell etwas Vorzeigbares im Bereich KI-Sichtbarkeit liefern wollen, ist das attraktiv.

Dazu kommt ein Denkfehler, der bei neuen Techniken regelmäßig auftritt: Weil robots.txt und sitemap.xml funktionieren, wirkt eine Datei nach demselben Muster plausibel. Plausibilität ist aber kein Beleg.

Ein Teil der Verbreitung hat außerdem einen technischen Auslöser. Wenige Tage nach dem Google-Leitfaden nahm das Chrome-Team eine llms.txt-Prüfung in die experimentellen Audits von Lighthouse auf. Laut Ahrefs erzeugte allein diese Prüfung etwa einen von tausend Abrufen der Datei. Ein Werkzeug, das eine Datei anmahnt, ist aber kein Anbieter, der sie auswertet.

Wenn Ihnen jemand llms.txt als zentralen Baustein für KI-Sichtbarkeit verkauft, ist das ein brauchbarer Prüfstein. Fragen Sie nach der Datengrundlage. Kommt keine, wissen Sie, woran Sie sind.

Schaden richtet die Datei übrigens nicht an. Wer sie bereits hat, kann sie liegen lassen. Nur bezahlen sollte man nicht dafür.

Wann eine llms.txt doch sinnvoll ist

Es gibt einen Fall, in dem das Format nicht sinnlos ist: umfangreiche technische Dokumentation. In der Ahrefs-Auswertung sind GPTBot und Claude-Code die beiden häufigsten KI-Leser der Datei, noch vor allen KI-Suchdiensten und Assistenten. Einzeln betrachtet ruft allerdings kein KI-Bot die Datei so oft ab wie SEO-Prüfwerkzeuge oder allgemeine Web-Crawler. Claude-Code ist ein Programmierwerkzeug. Genau dort passt die Datei zu ihrem ursprünglichen Zweck.

Drei Fragen grenzen das ab:

  1. Besteht ein großer Teil Ihrer Website aus Schnittstellenbeschreibungen, Handbüchern oder Software-Dokumentation?
  2. Arbeiten Ihre Leser mit KI-Programmierwerkzeugen, die diese Dokumentation verarbeiten?
  3. Können Sie die Datei bei jeder Änderung an der Seitenstruktur zuverlässig mitpflegen?

Nur wenn Sie alle drei Fragen mit Ja beantworten, hat die Datei einen erkennbaren Zweck. Für einen Hersteller, einen Dienstleister oder einen Händler trifft das in aller Regel nicht zu.

Der Pflegeaufwand wird dabei gern unterschätzt. Angelegt ist eine llms.txt in zehn Minuten. Danach veraltet sie mit jeder neuen Leistungsseite und jeder geänderten URL. Bei einer Website mit 40 Seiten lässt sich das noch von Hand nachziehen. Bei 400 Seiten braucht es einen automatischen Export aus dem Redaktionssystem, also Entwicklungsarbeit für eine Datei ohne belegte Wirkung. Dieselbe Zeit in sauberes Schema.org-Markup oder in einen fehlenden Inhalt gesteckt, ist nachweisbar besser angelegt.

Der Unterschied zur robots.txt

Eine Datei im Wurzelverzeichnis wird tatsächlich von allen KI-Anbietern ausgewertet, und zwar die robots.txt. Dort entscheiden Sie, ob Ihre Inhalte überhaupt abgerufen werden dürfen.

Das ist der Punkt, der in der Debatte um llms.txt untergeht: Während viele Unternehmen über eine Datei ohne dokumentierte Wirkung diskutieren, sperren manche von ihnen in der robots.txt versehentlich genau die Crawler aus, auf deren Zitate sie hoffen.

Die Kennungen sind dabei nicht austauschbar. Die Crawler-Dokumentation von OpenAI trennt sie klar: GPTBot steuert, ob Inhalte in das Training der Modelle einfließen. Ob Ihre Seite in den Suchantworten von ChatGPT auftaucht, entscheidet dagegen OAI-SearchBot. OpenAI empfiehlt ausdrücklich, OAI-SearchBot zu erlauben, damit die Seite in Suchergebnissen erscheint. Beide Einstellungen sind unabhängig voneinander.

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

Der erste Block hält Ihre Inhalte aus dem Training. Der zweite nimmt Sie aus den Suchantworten von ChatGPT. Wer beides in einem Zug einträgt, weil es nach derselben Sache aussieht, verliert Sichtbarkeit, die er behalten wollte.

Bei Google ist die Verwechslungsgefahr noch größer. Laut der Übersicht der gängigen Google-Crawler, zuletzt aktualisiert am 14. Juli 2026, steuert Google-Extended das Training künftiger Gemini-Modelle sowie das Grounding in den Gemini-Apps und in Grounding with Google Search auf Vertex AI. Auf die Aufnahme in die Google-Suche hat die Kennung ausdrücklich keinen Einfluss, und als Rankingsignal wird sie ebenfalls nicht verwendet. Wer Google-Extended sperrt, verschwindet also nicht aus den AI Overviews. Diese speisen sich aus dem regulären Suchindex.

Bei Anthropic gilt dieselbe Trennung. Die Crawler-Übersicht von Anthropic unterscheidet ClaudeBot, der Inhalte für das Training sammelt, von Claude-SearchBot, der Inhalte für Suchantworten erschließt. Wer den zweiten sperrt, verliert laut Anthropic Sichtbarkeit in den Suchergebnissen von Claude.

Die Kennungen, die Sie kennen sollten

KennungAnbieterWofür sie stehtWirkung eines Disallow
GPTBotOpenAITraining der ModelleInhalte fließen nicht ins Training
OAI-SearchBotOpenAISuchergebnisse in ChatGPTSeite erscheint nicht in ChatGPT-Suchantworten
ClaudeBotAnthropicTraining der ModelleKünftige Inhalte bleiben aus den Trainingsdaten
Claude-SearchBotAnthropicIndexierung für SuchantwortenGeringere Sichtbarkeit in Suchergebnissen von Claude
PerplexityBotPerplexityAuffinden und Verlinken in PerplexitySeite wird in Perplexity-Ergebnissen nicht mehr verlinkt
Google-ExtendedGoogleGemini-Training und GroundingKein Einfluss auf die Google-Suche

Neben den Crawlern gibt es bei allen drei Anbietern noch die nutzergesteuerten Abrufe, also ChatGPT-User, Claude-User und Perplexity-User. Sie greifen zu, wenn ein Mensch im Chat eine Frage stellt und das System die Seite live öffnet. Weil diese Abrufe von einem Nutzer ausgelöst werden, gelten die robots.txt-Regeln dafür laut Dokumentation von OpenAI und Perplexity nicht zwingend.

Die Prüfung, die stattdessen lohnt

Bevor Sie über llms.txt nachdenken, arbeiten Sie diese sechs Schritte ab. Der ganze Durchgang dauert selten länger als eine halbe Stunde.

  1. robots.txt öffnen. Rufen Sie ihredomain.de/robots.txt im Browser auf. Kommt ein Fehler statt einer Textdatei, ist das der erste Befund.
  2. Nach den sechs Kennungen suchen. Prüfen Sie die Datei auf Disallow-Regeln für GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot und Google-Extended. Achten Sie besonders auf eine pauschale Regel für alle Bots.
  3. Zwischen Training und Suche unterscheiden. Entscheiden Sie bewusst, ob Sie nur das Training ausschließen wollen oder auch die Suchantworten. Für die meisten Unternehmen ist die Antwort: Training gern sperren, Suche auf keinen Fall.
  4. Firewall und CDN prüfen. Eine erlaubte robots.txt nützt nichts, wenn eine Web Application Firewall die Anfragen blockt. Perplexity beschreibt in seiner Bot-Dokumentation eigens, wie man die Kennungen in Cloudflare und AWS freigibt. Prüfen Sie das mit Ihrem Hoster.
  5. Änderung eintragen und abwarten. OpenAI gibt an, dass es nach einer Änderung an der robots.txt rund 24 Stunden dauert, bis die Systeme sie berücksichtigen. Perplexity nennt ebenfalls bis zu 24 Stunden. Prüfen Sie also nicht am selben Tag nach.
  6. Erst danach an Inhalten arbeiten. Sobald der Zugang steht, entscheidet der Inhalt. Klare Antworten auf klar gestellte Fragen, belegte Zahlen und Erwähnungen auf fremden Seiten sind die Signale, die über Zitierfähigkeit entscheiden.

Der zweite und der vierte Schritt sind die, bei denen wir in Projekten am häufigsten etwas finden. Ein einzelner Eintrag entscheidet darüber, ob Sie überhaupt zitiert werden können. Erst danach wird die Prompt-Sichtbarkeit zu einer Frage von Inhalten. Was Sie dafür an Inhalten und Erwähnungen brauchen, steht im Beitrag Wie kommt man in ChatGPT-Antworten.

Marcel Speckmann

Geschrieben von

Marcel Speckmann

Geschäftsführer der Speckmann Webdesign GmbH in Oldenburg. Ich arbeite an Suchmaschinenoptimierung, KI-Sichtbarkeit und den Websites, die dafür die Grundlage sind. Was hier steht, stammt aus laufenden Projekten, nicht aus Lehrbüchern.

Mehr über meine Arbeit →

Dazu passt

Was statt einer llms.txt tatsächlich Wirkung zeigt und wie wir es umsetzen, steht auf der Seite zur KI-Sichtbarkeit.

Zur Seite KI-Sichtbarkeit →

Häufige Fragen

Das werden wir oft gefragt

Soll ich meine llms.txt löschen?

Nein, sie schadet nicht. Google hält in seinem Leitfaden ausdrücklich fest, dass solche Dateien Sichtbarkeit und Rankings in der Suche weder verbessern noch verschlechtern. Wenn die Datei existiert, kann sie liegen bleiben. Nur sollte niemand laufend Zeit oder Geld in ihre Pflege stecken, solange kein Anbieter sie dokumentiert auswertet. Falls sich das ändert, ist eine llms.txt in kurzer Zeit neu angelegt.

Gilt das auch für robots.txt?

Nein, das ist ein anderer Fall. Die robots.txt wird von allen relevanten Crawlern ausgewertet, auch von denen der KI-Anbieter. Dort steuern Sie, ob Ihre Inhalte überhaupt abgerufen werden dürfen. Wer OAI-SearchBot, Claude-SearchBot oder PerplexityBot dort aussperrt, kann in den Suchantworten dieser Systeme nicht zitiert werden. Diese Prüfung dauert wenige Minuten und ist wichtiger als jede llms.txt.

Was ist mit ai.txt oder ähnlichen Formaten?

Für diese Vorschläge gilt dasselbe: keine dokumentierte Auswertung durch die großen Anbieter, keine belastbaren Daten zur Wirkung. Google fasst maschinenlesbare Zusatzdateien in seinem Leitfaden pauschal als nicht erforderlich zusammen. Wenn ein Anbieter ein solches Format offiziell unterstützt, wird er es in seiner Dokumentation nennen. Bis dahin ist die Arbeit an Inhalten und Erwähnungen die verlässlichere Investition.

Wie viele Websites nutzen llms.txt überhaupt?

Laut der Ahrefs-Auswertung von 137.210 Domains mit Zugriffen im Mai 2026 stellten 28 Prozent eine gültige llms.txt bereit, also rund 38.000 Websites. Von diesen Dateien erhielten 97 Prozent im gesamten Monat keinen einzigen Abruf. Verbreitung ist also nicht dasselbe wie Wirkung. Die Datei wird angelegt, aber sie wird nicht gelesen.

Für wen kann eine llms.txt trotzdem sinnvoll sein?

Für Anbieter umfangreicher technischer Dokumentation. In der Ahrefs-Auswertung sind GPTBot und Claude-Code die häufigsten KI-Leser der Datei, und Claude-Code ist ein Programmierwerkzeug. Wer eine Schnittstelle oder eine Software-Dokumentation betreibt, deren Leser mit solchen Werkzeugen arbeiten, kann ihnen mit einer gepflegten Index-Datei Arbeit ersparen. Für Hersteller, Dienstleister und Händler trifft das nicht zu.

Woran erkenne ich einen ernsthaften Anbieter für KI-Sichtbarkeit?

Daran, dass er konkrete Signale nennt, die nachweislich ausgewertet werden, und seine Empfehlungen mit Daten belegt. Wer llms.txt als zentralen Baustein verkauft, ohne auf Auswertungen wie die von Ahrefs oder auf die Dokumentation der Anbieter einzugehen, arbeitet mit Vermutungen statt mit Belegen. Fragen Sie nach der Datengrundlage und danach, wie der Erfolg gemessen werden soll.

Nächster Schritt

Wo stehen Sie bei Google
und in der KI?

Im Erstgespräch sehen wir uns Ihre Sichtbarkeit gemeinsam an: was bei Google läuft, ob die Modelle Sie kennen und wo der größte Hebel liegt. 20 Minuten, kostenlos, ohne Verpflichtung.

20-Minuten-Sichtbarkeits-Check vereinbaren