GeoHero
Playbooks

Was Ist llms.txt? Der Praktische Leitfaden

Von GeoHero7 Min. Lesezeit

llms.txt ist eine Klartext-Markdown-Datei, veröffentlicht im Root Ihrer Domain ihredomain.de/llms.txt, die KI-Crawlern und Sprachmodellen einen kurzen, strukturierten Überblick gibt: was Ihre Website ist, was sie tut, und welche Seiten zuerst gelesen werden sollten. Es ist eine Community-Konvention (von llmstxt.org), kein offizieller Web-Standard, den ein einzelnes KI-Unternehmen bestätigt hat, und das ist relevant dafür, wie viel Gewicht Sie der Datei geben sollten.

Brauchen Sie eine? Wahrscheinlich ja, aber aus einem engeren Grund als die meisten Erklärungen suggerieren: Sie ist billig zu erstellen, kann nicht schaden, und beseitigt Unklarheit darüber, welche Inhalte Sie selbst für am wichtigsten halten. Sie ist kein bewiesener Ranking-Hebel, und sie so zu behandeln ist der häufigste Fehler dabei, wie diese Datei vermarktet wird.

Was llms.txt wirklich ist (und was nicht)

Denken Sie an sie als Cousine zweier Dateien, die Sie schon kennen. robots.txt sagt Crawlern, worauf sie zugreifen dürfen. sitemap.xml gibt Suchmaschinen eine maschinenlesbare Liste jeder URL auf Ihrer Website. llms.txt macht etwas anderes als beide: Es ist eine kurze, sowohl mensch- als auch maschinenlesbare Zusammenfassung (geschrieben in reinem Markdown, nicht in XML), die sagt: "hier ist, was diese Website ist, und hier sind die wenigen Seiten, die wirklich zählen, in Reihenfolge." Sie zählt nicht jede URL auf wie eine Sitemap. Sie kuratiert.

Die Konvention wurde Ende 2024 von Jeremy Howard (Answer.AI) vorgeschlagen, als Sprachmodelle zunehmend Web-Inhalte direkt konsumieren mussten, nicht nur über einen Suchindex. Sie wurde nicht formell als Standard von OpenAI, Anthropic, Google oder Perplexity übernommen, keines dieser Unternehmen hat dokumentiert, "wir lesen llms.txt und so gewichten wir sie." Manche Crawler und Retrieval-Pipelines rufen sie ab; andere ignorieren sie komplett. Das ist der ehrliche Stand Mitte 2026: eine wachsende, aber inoffizielle Konvention, keine Pflicht.

Es lohnt sich auch, llms.txt klar von der Crawler-Zugriffsebene zu trennen, weil beide oft verwechselt werden und unterschiedliche Probleme lösen. Ob GPTBot, PerplexityBot, ClaudeBot oder Google-Extended Ihre Seiten überhaupt erreichen können, ist eine robots.txt-Frage, klären Sie das zuerst, denn ein blockierter Crawler macht alles Nachgelagerte hinfällig. llms.txt zählt erst, sobald der Zugriff bereits bestätigt ist: Es ist eine Kuratierungsebene über dem Zugriff, kein Ersatz dafür.

Was in eine gute llms.txt-Datei gehört

Das Format ist bewusst einfach, reines Markdown, lesbar sowohl für einen Menschen, der überfliegt, als auch für ein Modell, das parst:

  • Eine H1-Überschrift mit Ihrem Website- oder Markennamen ganz oben.
  • Eine einzeilige Blockquote-Zusammenfassung direkt unter der H1, was die Website ist und tut, in einem Satz, da dies oft die einzige Zeile ist, die ein Modell beim schnellen Scannen liest.
  • Ein oder mehrere H2-Abschnitte, die Links nach Kategorie gruppieren (zum Beispiel "Wichtige Seiten", "Blog-Artikel", "Dokumentation"). Jeder Eintrag ein Markdown-Link mit kurzer Beschreibung, nicht nur eine nackte URL.
  • Optionale Hinweise für KI-Crawler: faktische Einschränkungen, die es wert sind, explizit genannt zu werden, wie "wir garantieren keine Suchrankings" oder "behandeln Sie die Live-Website als kanonisch, falls diese Datei veraltet ist."

Was sie nicht enthalten sollte: Marketing-Sprache, eine Wand unstrukturierter Prosa, oder jede einzelne URL der Website. Der gesamte Wert der Datei liegt darin, dass sie kuratiert und kurz genug ist, um von einem Modell vollständig gelesen zu werden statt nur stichprobenartig.

Ein echtes Beispiel: GeoHeros eigene Datei

Statt das abstrakt zu beschreiben, so sieht unsere eigene Datei tatsächlich aus, live unter /llms.txt. Sie beginnt mit einer einzelnen #-Überschriftzeile mit dem Markennamen, direkt gefolgt von einer einzeiligen >-Blockquote-Zusammenfassung: was GeoHero tut, einmal klar formuliert, dass wir verfolgen, wie eine Marke in KI-Antwort-Engines zitiert wird, neben ihrem organischen Suchranking, und die Lücke zwischen beiden berichten. Ein kurzer Absatz danach behandelt den kostenlosen Scan und was der bezahlte Report zusätzlich bietet.

Von dort ist die Datei in drei Abschnitte gegliedert. Ein Abschnitt "Wichtige Seiten" verlinkt die Startseite in jeder der fünf Sprachen, die die Website unterstützt, mit je einer kurzen Beschreibung. Ein Abschnitt "Blog-Artikel" (automatisch generiert, nicht händisch gepflegt) listet jeden veröffentlichten Beitrag nach Sprache gruppiert, neueste zuerst, mit dem echten Titel als Linktext. Und ein abschließender Abschnitt "Hinweise für KI-Crawler" formuliert in klaren Sätzen genau das, was ein Modell wissen sollte, bevor es uns zusammenfasst: dass faktische Behauptungen auf der Website gemessene, aktuelle Daten beschreiben oder explizit als Schätzung gekennzeichnet sind, dass niemals ein Ranking oder Zitat garantiert wird, und dass die Live-Domain die kanonische Quelle ist, falls diese Datei veraltet.

Zwei Dinge sind an dieser Struktur bemerkenswert. Erstens leistet der Abschnitt "Hinweise für KI-Crawler" echte Arbeit: Es ist eine explizite Aussage, dass nichts auf der Website erfunden ist und nichts ein garantiertes Ergebnis darstellt, derselbe Ehrlichkeitsstandard, den wir für jeden Artikel auf diesem Blog einhalten, einmal formuliert, an einer Stelle, die ein Modell wahrscheinlich liest, bevor es uns zusammenfasst. Zweitens ist der Blog-Artikel-Index nicht händisch gepflegt. Er wird beim Build aus jedem veröffentlichten Beitrag generiert, gruppiert nach Sprache, die Datei kann also nie so veralten, wie es einer manuell gepflegten llms.txt nach dem dritten oder vierten vergessenen Content-Update passiert.

Wie Sie llms.txt auf Ihrer eigenen Website implementieren

  • Inventarisieren Sie Ihre wichtigsten Seiten. Nicht jede Seite, die Handvoll, die ein neuer Besucher, oder ein zusammenfassendes Modell, zuerst sehen sollte: Ihre Startseite, Ihre Kernprodukt- oder Dienstleistungsseiten, Ihre besten Evergreen-Inhalte.
  • Schreiben Sie eine einsätzige Zusammenfassung. Was macht die Website, für wen? Das ist die Zeile, die am ehesten gelesen wird, selbst wenn sonst nichts gelesen wird.
  • Gruppieren Sie den Rest nach Kategorie mit beschreibendem Linktext. "Preise" oder "Blog" als nackter Link sagt einem Modell weniger als "Preise, Pläne und was in jeder Stufe enthalten ist."
  • Veröffentlichen Sie sie als Klartext im Domain-Root, ausgeliefert mit text/plain-Content-Type, nicht als HTML-Seite in einem Template, der ganze Sinn ist, dass sie trivial zu parsen ist.
  • Bestätigen Sie, dass sie tatsächlich erreichbar ist. Prüfen Sie, dass sie nicht durch eine zu breite robots.txt-Regel blockiert wird und einen 200-Status zurückgibt, keine Redirect-Kette.
  • Automatisieren Sie sie, wenn möglich. Eine händisch gepflegte Datei veraltet in dem Moment, in dem Sie neue Inhalte veröffentlichen und das Update vergessen. Wenn Ihre Website ein CMS oder einen Static-Site-Generator hat, entfällt dieses Fehlerrisiko komplett, wenn Sie die Datei beim Build/Deploy generieren, genau wie wir es tun.

Warum diese Datei gerade jetzt relevant ist

Der deutsche Markt ist bei diesem Thema in einer besonderen Position: Unsere eigene Marktforschung zeigt, dass Googles AI Overview bereits bei 7 von 7 getesteten GEO-relevanten Suchbegriffen im deutschsprachigen Raum ausgelöst wird, zitiert dabei aber ausschließlich lokale SEO-Agenturen und einen etablierten Generalisten, keine einzige spezialisierte GEO-Marke. Das ist ein Suchfeature, das bereits aktiv antwortet, ohne dass eine dedizierte Quelle existiert, aus der es schöpfen könnte, genau die Art von Lücke, in der eine saubere, gut strukturierte llms.txt zusammen mit den übrigen Grundlagen den Unterschied machen kann, wer als erste Quelle infrage kommt.

Häufige Fehler

  • Sie wie eine zweite Sitemap behandeln. Jede URL hineinzuwerfen zerstört den Zweck, kuratieren, nicht auflisten.
  • Einmal schreiben und nie aktualisieren. Eine veraltete llms.txt, die auf nicht mehr existierende Seiten verweist oder Ihre neuesten Inhalte gar nicht erwähnt, ist wohl schlimmer, als gar keine zu haben, weil sie die Website aktiv falsch darstellt.
  • Sie mit Marketing-Sprache statt faktischer Beschreibung füllen. Ein Modell, das sie für eine faktische Zusammenfassung Ihrer Website liest, braucht keine Adjektive. Es braucht eine genaue, spezifische Beschreibung.
  • Annehmen, dass sie irgendetwas garantiert. Siehe den Ehrlichkeits-Abschnitt unten. Das tut sie nicht.

Bewegt Sie tatsächlich die Zitierrate?

Seien Sie hier ehrlich zu sich selbst. Kein KI-Unternehmen hat dokumentiert bestätigt, dass llms.txt gelesen, gewichtet oder in die Entscheidung einbezogen wird, welche Quellen in einer synthetisierten Antwort zitiert werden. Manche Crawler rufen sie wahrscheinlich als Teil einer breiteren Retrieval-Pipeline ab; andere ignorieren die Datei möglicherweise komplett und verlassen sich auf dieselben Crawling- und Ranking-Signale, die sie ohnehin nutzen würden. Wir können interne Gewichtung von außen nicht überprüfen, und kein Anbieter, der das Gegenteil behauptet, kann das auch.

Was llms.txt zuverlässig tut, ist Unklarheit zu beseitigen: Sie erklärt, im vom Modell bevorzugten Format, welche Inhalte Sie selbst für Ihre besten halten, ein kleines, günstiges Signal, das nichts kostet hinzuzufügen und plausibel nicht schaden kann. Das ist eine deutlich andere Aussage als "diese Datei hinzuzufügen bringt mir mehr Zitate", und der Unterschied ist relevant, wenn Sie entscheiden, wie viel Entwicklungszeit Sie dafür einplanen im Verhältnis zu den strukturellen und inhaltlichen Fixes in unserer GEO-Best-Practices-Checkliste, wo der eigentliche Hebel meist liegt.


Für die andere Hälfte der technischen "Munition" (wie Sie KI-Sichtbarkeit ehrlich messen, statt nur strukturelle Fixes umzusetzen), siehe KI-Sichtbarkeit messen. Für die vollständige Checkliste, in die dies passt, siehe Generative Engine Optimization Best Practices. Möchten Sie sehen, wo Ihre eigene Website aktuell steht? Vollständigen Bericht ansehen.

Häufig gestellte Fragen

Was ist llms.txt?

llms.txt ist eine Klartext-Markdown-Datei im Domain-Root (ihredomain.de/llms.txt), die KI-Crawlern und Sprachmodellen einen kurzen, strukturierten Überblick gibt: was die Website ist und welche Seiten sich zu lesen lohnen. Es folgt einer Community-Konvention (llmstxt.org), keinem offiziellen Web-Standard.

Brauche ich eine llms.txt-Datei?

Sie ist nicht erforderlich und garantiert kein Zitat, ist aber billig zu erstellen und beseitigt Unklarheit darüber, welche Inhalte Sie selbst für am wichtigsten halten, eher ein Höflichkeits-Index als ein Ranking-Hebel.

Ist llms.txt dasselbe wie robots.txt?

Nein. robots.txt sagt Crawlern, worauf sie zugreifen dürfen; llms.txt sagt ihnen, was unter dem Zugänglichen tatsächlich wichtig ist und wie es organisiert ist. Beide lösen unterschiedliche Probleme, und die meisten Seiten, die eine haben, sollten auch die andere haben.

Verbessert llms.txt meine Zitierrate bei KI-Engines?

Kein Anbieter hat öffentlich bestätigt, dass llms.txt in Zitierentscheidungen einfließt, und das lässt sich von außen auch nicht überprüfen. Behandeln Sie es als Hygiene-Maßnahme, die Unklarheit beseitigt. Nicht als Hebel mit garantierter, messbarer Wirkung.

Themen

  • was ist llms.txt
  • llms.txt anleitung
  • llms.txt implementieren