Metodologia
Generator llms.txt skanuje domenę etapami: wykrywa adresy URL, klasyfikuje każdy z nich do sekcji, pisze jednolinijkowy opis, podsumowuje serwis, a następnie tworzy poprawne pliki i porównuje je z tym, co już opublikowano.
Pipeline
- Wykrycie: najpierw
sitemap.xml(z podążaniem za indeksem sitemap o jeden poziom w głąb), w razie braku użytecznej mapy — crawl po linkach (głębokość 2) od strony głównej. Twardy limit: 200 adresów URL. - Klasyfikacja: każdy adres URL do Docs, Blog, Services/Products, About, Legal lub Other — najpierw po wzorcu URL, potem po słowach kluczowych z tytułu/nagłówka.
- Opis: jedna linia na podstronę, z Twojego meta description, albo pierwszego zdania pierwszego akapitu treści, albo H1 — w tej kolejności. Przepisanie przez LLM uruchamia się tylko wtedy, gdy wszystkie trzy źródła są puste lub bezużyteczne (w tym częsty przypadek szablonowego meta description powtórzonego na wielu podstronach).
- Podsumowanie: jedno zdanie cytatu dla całego serwisu — pojedyncze wywołanie LLM, z prostym zdaniem szablonowym jako fallbackiem, gdy brak klucza LLM lub wywołanie się nie powiedzie.
- Emisja:
llms.txtzgodnie z formatem propozycji (H1, opcjonalny cytat podsumowujący, listy sekcji H2) orazllms-full.txt— wyraźnie oznaczony jako powszechna konwencja, a nie część specyfikacji. - Diff: pobiera istniejący już
llms.txtopublikowany w katalogu głównym i porównuje go linia po linii z nowo wygenerowanym.
Brak punktacji
To generator, nie audyt — nie ma tu nic sensownego do oceniania w pliku indeksu czytelnego dla maszyn. Jeśli chcesz oceny 0–100, jak bardzo cytowalna jest Twoja rzeczywista treść, to jest inne narzędzie.
Przypadki brzegowe
- Brak sitemap → crawl po linkach, z odpowiednią adnotacją w notatkach wygenerowanego pliku.
- Więcej niż 200 podstron → zachowywane są podstrony linkowane najbezpośredniej ze strony głównej (lub najwcześniejsze w sitemap), a limit jest jasno zaznaczony.
- Nawigacja renderowana przez JavaScript → jeśli surowy HTML strony głównej nie ma wykrywalnych linków, narzędzie mówi o tym wprost, zamiast po cichu zwrócić pusty plik.
- Istniejący już llms.txt → porównywany, nigdy po cichu nadpisywany.
- Identyczne meta description na całym serwisie (bardzo częste) → wykrywane i traktowane jako szablon; następuje fallback do ekstrakcji pierwszego akapitu.