Metodologia

Generator llms.txt skanuje domenę etapami: wykrywa adresy URL, klasyfikuje każdy z nich do sekcji, pisze jednolinijkowy opis, podsumowuje serwis, a następnie tworzy poprawne pliki i porównuje je z tym, co już opublikowano.

Pipeline

  1. Wykrycie: najpierw sitemap.xml (z podążaniem za indeksem sitemap o jeden poziom w głąb), w razie braku użytecznej mapy — crawl po linkach (głębokość 2) od strony głównej. Twardy limit: 200 adresów URL.
  2. Klasyfikacja: każdy adres URL do Docs, Blog, Services/Products, About, Legal lub Other — najpierw po wzorcu URL, potem po słowach kluczowych z tytułu/nagłówka.
  3. Opis: jedna linia na podstronę, z Twojego meta description, albo pierwszego zdania pierwszego akapitu treści, albo H1 — w tej kolejności. Przepisanie przez LLM uruchamia się tylko wtedy, gdy wszystkie trzy źródła są puste lub bezużyteczne (w tym częsty przypadek szablonowego meta description powtórzonego na wielu podstronach).
  4. Podsumowanie: jedno zdanie cytatu dla całego serwisu — pojedyncze wywołanie LLM, z prostym zdaniem szablonowym jako fallbackiem, gdy brak klucza LLM lub wywołanie się nie powiedzie.
  5. Emisja: llms.txt zgodnie z formatem propozycji (H1, opcjonalny cytat podsumowujący, listy sekcji H2) oraz llms-full.txt — wyraźnie oznaczony jako powszechna konwencja, a nie część specyfikacji.
  6. Diff: pobiera istniejący już llms.txt opublikowany w katalogu głównym i porównuje go linia po linii z nowo wygenerowanym.

Brak punktacji

To generator, nie audyt — nie ma tu nic sensownego do oceniania w pliku indeksu czytelnego dla maszyn. Jeśli chcesz oceny 0–100, jak bardzo cytowalna jest Twoja rzeczywista treść, to jest inne narzędzie.

Przypadki brzegowe