Das llms.txt-Format: Schritt-für-Schritt-Anleitung für KMU

Wie Sie eine Datei bauen, die AI-Crawler wirklich navigieren können – und warum eine Prosa-Datei schlechter ist als gar keine.

GPTBot, OAI-SearchBot und PerplexityBot lesen Ihre Website – aber sie raten, welche Seiten wichtig sind. Eine /llms.txt gibt ihnen eine Karte. In dieser Anleitung baue ich mit Ihnen eine spec-konforme Datei, zeige die häufigsten Fehler aus meinen Audits und liefere ein fertiges Template.

Warum AI-Crawler eine Navigationskarte brauchen

Ein AI-Crawler kommt ohne Vorwissen auf Ihre Seite. Er sieht HTML mit Navigation, Werbung, Cookie-Bannern und JavaScript und muss daraus ableiten, was zitierwürdig ist. Search Engine Land bringt das Problem auf den Punkt: „Converting complex HTML pages with navigation, ads, and JavaScript into LLM-friendly plain text is both difficult and imprecise.“ Das Modell trifft also eine Relevanzentscheidung – und liegt oft daneben.

Die Analogie, die ich in Gesprächen immer benutze: robots.txt sagt Crawlern, was verboten ist. Eine XML-Sitemap listet, was existiert. Die llms.txt sagt, was wichtig ist. Es ist der Relevanz-Layer, den die anderen beiden Dateien nie liefern wollten.

Dass sich der Aufwand lohnen könnte, zeigt das Volumen: Laut Cloudflare stieg der Anteil von GPTBot am Crawler-Traffic zwischen Mai 2024 und Mai 2025 von 2,2 % auf 7,7 %, ein Plus von 305 % bei den Anfragen. PerplexityBot startete von nahezu null und verzeichnete im selben Zeitraum die mit Abstand höchste Wachstumsrate der Studie. Diese Bots sind bereits auf Ihrer Seite. Die Frage ist nur, ob sie das Richtige finden.

Was ist llms.txt – und wer hat es spezifiziert?

Die Spezifikation stammt von Jeremy Howard, Mitgründer von Answer.AI und fast.ai. Er veröffentlichte den Vorschlag am 3. September 2024. Seine Begründung: Den richtigen Kontext für ein LLM aus einer Website zu rekonstruieren, sei mehrdeutig – also solle der Betreiber selbst eine kuratierte Liste liefern. Sein Satz dazu: „Site authors know best, and can provide a list of content that an LLM should use.“

Das Format ist bewusst Markdown und nicht XML. Die offizielle Spec begründet das direkt: „At the moment the most widely and easily understood format for language models is Markdown.“ Und weiter: „The reason for this is that we expect many of these files to be read by language models and agents.“ Die Datei richtet sich an Sprachmodelle, nicht an Parser.

Wichtig zur Einordnung: Es ist kein offizieller Standard von Google oder OpenAI. Es ist eine De-facto-Konvention, die von der Community getragen wird. Und die Beweislage zum tatsächlichen Nutzen ist heute nüchtern – das gehört zu einer ehrlichen Anleitung dazu.

Anatomie einer spec-konformen llms.txt

Die Spec legt eine feste Reihenfolge fest. Streng erforderlich ist nur ein Element – aber erst die vollständige Struktur macht die Datei für einen Crawler navigierbar. Die vier Bausteine:

  1. H1 mit dem Namen der Seite – das einzige strikt erforderliche Element. Beispiel: # Muster GmbH.
  2. Ein Blockquote als Kurzzusammenfassung – ein bis zwei Sätze mit den wichtigsten Fakten zur Orientierung, eingeleitet mit >.
  3. Typisierte H2-Sektionen – etwa ## Leistungen, ## Über uns, ## Blog. Sie gruppieren die Links thematisch.
  4. Pro Eintrag ein Markdown-Link mit Einzeiler – im Format [Seitentitel](URL): kurze Beschreibung.

Die Spec beschreibt die Sektionen als „‘file lists‘ of URLs where further detail is available“. Genau diese kuratierten Link-Listen sind der Kern – nicht die Prosa drumherum. Ein annotiertes Minimalbeispiel:

# Muster GmbH

> WordPress-Seiten und Hosting für Handwerksbetriebe in Bayern. Sitz in München, gegründet 2018.

## Leistungen

- [Website erstellen](https://muster.de/leistungen/website): Festpreis-Websites ab 1.900 € netto, in 14 Tagen online.
- [WordPress-Hosting](https://muster.de/hosting): Managed Hosting mit Backups und automatischen Updates.

## Über uns

- [Team & Standort](https://muster.de/ueber-uns): Gegründet 2018, Sitz in München, sieben Mitarbeiter.

## Optional

- [Datenschutz](https://muster.de/datenschutz): Datenschutzerklärung nach DSGVO.

Beachten Sie die Sektion ## Optional am Ende. Sie hat eine Sonderbedeutung, die viele übersehen. Die Spec: „if it’s included, the URLs provided there can be skipped if a shorter context is needed. Use it for secondary information which can often be skipped.“ Nur wirklich zentrale Seiten gehören außerhalb von ## Optional. Alles Nachrangige – Datenschutz, AGB, Randthemen – wandert hinein.

Prosa vs. Struktur: Was an einer Prosa-Datei schiefläuft

In Audits sehe ich zwei kaputte Muster. Das erste ist der Sitemap-Dump: jede URL, keine Beschreibungen. Das zweite ist die Prosa-Datei – Marketing-Absätze ohne Sektionsschema und ohne maschinenlesbare Link-Liste. So sieht Letztere typischerweise aus:

# Willkommen bei der Muster GmbH!

Seit vielen Jahren sind wir Ihr kompetenter Partner rund um das Thema
Webdesign. Unser engagiertes Team steht Ihnen mit Rat und Tat zur Seite
und bietet maßgeschneiderte Lösungen auf höchstem Niveau. Kontaktieren
Sie uns gerne für ein unverbindliches Angebot!

Diese Datei erfüllt keinen einzigen Zweck der Spec. Drei konkrete Probleme:

  • Keine navigierbare Seitenliste. Ohne [Titel](URL)-Einträge gibt es nichts, dem der Crawler folgen kann. Der Betreiber von llmstxtgen formuliert die Faustregel treffend: „it’s a map, not a sitemap“ – aber diese Datei ist nicht einmal eine Landkarte, sie ist ein Werbeflyer.
  • Verschwendetes Crawl-Budget ohne Orientierung. Das Modell liest freundliche Sätze und weiß danach genauso wenig wie vorher, welche Seite die Leistungsübersicht ist.
  • Widersprüchliche Fakten werden zum Trust-Problem. Steht in der Prosa ein veralteter Standort oder ein altes Leistungsportfolio, prüft das Modell das gegen andere Quellen quer – und wertet den Konflikt als Unsicherheitssignal.

Zur Einordnung: Dass eine Prosa-Datei „schlechter als gar keine“ ist, ist eine begründete Praxisempfehlung, kein gemessenes Studienergebnis. Sie folgt direkt aus dem Designzweck der Spec – ein URL-navigierbarer Index. Eine Datei, die diesen Zweck verfehlt, kostet Pflegeaufwand, ohne Nutzen zu stiften.

Schritt für Schritt: Ihre llms.txt in unter 45 Minuten

Für eine typische KMU-Website mit einem Dutzend Seiten ist das Machbarkeit in einer Sitzung. Fünf Phasen:

  1. Seitenaudit. Listen Sie alle kanonischen URLs, die zitiert werden sollen. Nehmen Sie die echte URL aus dem <link rel="canonical">, nicht die aus dem Menü – Parameter und Weiterleitungen gehören nicht hinein.
  2. Priorität setzen. Fragen Sie bei jeder Seite: Soll ein KI-Modell diese Seite zitieren? Kernseiten kommen in die Hauptsektionen, Nachrangiges nach ## Optional.
  3. Sektionen benennen. Vier bis sechs H2-Sektionen reichen meist: Leistungen, Über uns, Blog, Kontakt. Keine Sprünge in der Hierarchie.
  4. Einzeiler formulieren. Ein Nutzen-Statement pro URL, kein Buzzword-Salat. „Festpreis-Websites ab 1.900 € netto“ schlägt „innovative Weblösungen auf höchstem Niveau“.
  5. Deployen. Datei unter https://ihre-domain.de/llms.txt ablegen, im Root, als reines UTF-8-Text. Optional einen Verweis im <head> ergänzen.

Die fünf häufigsten llms.txt-Fehler

Diese fünf begegnen mir am häufigsten:

  1. Prosa statt URL-Index. Der Klassiker – Marketingtext ohne Link-Liste. Die Datei sieht gepflegt aus und leistet nichts.
  2. Faktische Inkonsistenzen. Standort, Gründungsjahr, Preise weichen von anderen Quellen ab. Modelle prüfen quer und werten den Konflikt gegen Sie.
  3. Blog- oder Ressourcen-Sektion fehlt komplett. Gerade die Inhalte, die zitiert werden sollen, tauchen nicht auf.
  4. Doppelte oder zu generische Einzeiler. Fünfmal „professionelle Lösungen für Ihr Unternehmen“ hilft niemandem beim Navigieren.
  5. Kein Verweis auf llms-full.txt bei content-schweren Sites – dazu gleich mehr.

In den Audits, die ich durchführe, ist Fehler Nr. 2 – widersprüchliche Standortangaben – der am schnellsten behebbare Trust-Killer. Eine Firma steht im Impressum in Hamburg, in der llms.txt noch am alten Kölner Sitz, auf der Über-uns-Seite wieder in Hamburg. Fünf Minuten Arbeit, und das Signal ist wieder sauber. Achten Sie außerdem auf kaputte Markdown-Syntax und auf Links, die nach einem Seitenumzug ins Leere zeigen – laut llmstxtgen sind das neben dem Sitemap-Dump die häufigsten technischen Fehlerquellen.

Fortgeschritten: llms-full.txt für content-intensive Sites

Die llms.txt ist ein kuratierter Index – ein Inhaltsverzeichnis. Die begleitende llms-full.txt geht weiter und bündelt die tatsächlichen Seiteninhalte in einer Datei. GitBook beschreibt es so: „While llms.txt is usually a guide to your best sources, llms-full.txt takes things further. In most setups, llms-full.txt contains a fuller export of your documentation in one file.“

Für die typische KMU-Marketingseite lohnt sich das nicht. Sinnvoll wird die zweite Datei bei Dokumentationen, Wissensbasen, API-Referenzen und Blogs ab grob 50 Seiten – überall dort, wo der Volltext selbst der Wert ist. Sie verlinken beide Dateien, indem Sie in der llms.txt einen Eintrag auf /llms-full.txt aufnehmen. Ein Hinweis zur Namensgebung: llms-full.txt ist eine verbreitete Community-Konvention, steht aber so nicht wörtlich in der offiziellen Spec.

Validierung: So testen Sie auf Spec-Konformität

Drei Methoden, vom Technischen zum Praktischen:

1. curl-Test. Prüfen Sie, dass die Datei überhaupt sauber ausgeliefert wird – als Text, in UTF-8, ohne Redirect:

curl -sI https://ihre-domain.de/llms.txt

# erwartet: HTTP/2 200
#           content-type: text/plain; charset=utf-8

2. Manuelle Prüfung gegen die Checkliste. Gehen Sie die Punkte aus dem Schritt-für-Schritt-Abschnitt durch. H1 vorhanden? Jeder Eintrag mit Beschreibung? Nachrangiges unter ## Optional?

3. Der Frage-Test. Fragen Sie Perplexity oder ChatGPT direkt: „Was sind die Hauptleistungen von ihre-domain.de?“ Notieren Sie die Antwort vor dem Deployment und wieder danach. Verändert sich die Qualität, haben Sie ein Signal. Weil solche Momentaufnahmen aber unzuverlässig sind, lohnt kontinuierliches Beobachten statt Einzelstichproben. Genau dafür haben wir Cited gebaut – es verfolgt laufend, wie ChatGPT, Claude, Perplexity und Google AI Overviews Ihre Marke beschreiben, und macht Veränderungen sichtbar, statt dass Sie manuell nachfragen müssen.

Live-Beispiel: Die /llms.txt von Digital Domination

Zum Abschluss unsere eigene Datei als kommentiertes Template. Passen Sie Namen, URLs und Einzeiler an – die Struktur können Sie eins zu eins übernehmen:

# Digital Domination

> KI-Sichtbarkeit, WordPress-Hosting und Websites für den deutschen Markt.
> US-LLC mit Fokus auf KMU im DACH-Raum.

## Leistungen

- [KI-Sichtbarkeits-Audit](https://digitaldomination.xyz/leistungen/ki-sichtbarkeits-audit): Pauschal-Audit ab 99 €, das zeigt, wie ChatGPT, Claude und Perplexity Ihre Marke beschreiben.
- [Managed WordPress-Hosting](https://digitaldomination.xyz/wordpress-webhosting): Hosting mit Backups, Updates und Monitoring.
- [WordPress-Migration](https://digitaldomination.xyz/wordpress-migration): Umzug bestehender Seiten ohne Ausfallzeit.
- [Website erstellen](https://digitaldomination.xyz/website-erstellen): Festpreis-Websites für KMU.
- [Private KI & KI-Agenten](https://digitaldomination.xyz/ki): Selbst gehostete KI-Assistenten für interne Prozesse.

## Blog

- [Blog-Übersicht](https://digitaldomination.xyz/blog): Anleitungen zu KI-Sichtbarkeit, WordPress und AEO.

## Optional

- [Kontakt](https://digitaldomination.xyz/kontakt): Festpreis anfragen oder Termin buchen.
- [Für vegane Marken](https://digitaldomination.xyz/vegan): Spezialisiertes Angebot für vegane Unternehmen.

Beachten Sie: Der Blog steht in einer eigenen Sektion, nicht unter ## Optional – die Beiträge sollen ja zitiert werden. Kontakt und das Nischenangebot sind nachrangig und wandern nach hinten.

Ein letzter Gedanke: Die llms.txt ist keine einmalige Aufgabe. Jeder neue Blogpost, jede Preisänderung, jeder neue Standort gehört eingepflegt – sonst kippt die Datei genau in Fehler Nr. 2, den Signal-Konflikt. Rechnen Sie mit einer Fünf-Minuten-Routine pro Update. Wenn Sie ohnehin wissen wollen, wie KI-Systeme Sie heute beschreiben, ist unser KI-Sichtbarkeits-Audit der pragmatische erste Schritt – dort prüfen wir die llms.txt gleich mit.