Сайты пишут для людей: меню, баннеры, cookie, JS-виджеты. Модели и AI-агенты при этом получают HTML-шум и ограниченный context window. Чтобы агент не «угадывал» услуги и цены по случайным абзацам, всё чаще кладут в корень сайта файлы llms.txt и, при необходимости, развёрнутый llms-full.txt.
Ниже: откуда взялся формат, чем он не является, как устроены индекс и полный дамп, кто этим пользуется, и как это сделано на krivoshein.site. В конце — спокойный CTA, если нужно подготовить сайт под нейропоиск и ботов: ai-ready.krivoshein.site.
Откуда взялся llms.txt
3 сентября 2024 Jeremy Howard (Answer.AI) опубликовал предложение /llms.txt: в корень сайта добавить markdown-файл, который помогает LLM и агентам на этапе inference — кратко о сайте, подсказки, ссылки на детальные markdown-страницы. Тот же день — пост на Answer.AI: /llms.txt — a proposal to provide information to help LLMs use websites.
Проблема, которую закрывают: HTML сложен и «грязный» для модели, а контекстное окно маленькое. Автор сайта лучше знает, что важно: контакты, API, docs, цены-ориентиры, ограничения. llms.txt — это кураторский индекс, читаемый и человеком, и парсером (markdown + предсказуемые секции).
Это не IETF RFC и не обязательный стандарт вроде robots.txt. Это открытое предложение (proposal) с растущей практикой: документация, SaaS, agent-first сайты. Рядом в экосистеме встречаются расширенные варианты вроде llms-ctx.txt / llms-ctx-full.txt (например, у FastHTML: свёрнутый и полный контекст из ссылок). Имя llms-full.txt на практике — «полный дамп для агента», логичное продолжение индекса.
Формат: что обычно лежит в llms.txt
По смыслу proposal (детали: llmstxt.org):
- markdown в корне:
https://example.com/llms.txt; - короткий blockquote-lead: кто вы и зачем сайт;
- секции
##со ссылками на важные страницы и docs; - по возможности — чистый markdown у тех же URL (или отдельный .md), без chrome UI.
Роботы и агенты могут:
- прочитать
/llms.txtцеликом в промпт; - пройти по ссылкам и собрать RAG/контекст;
- использовать файл как «карту сайта для LLM», рядом с sitemap и OpenAPI.
llms.txt vs llms-full.txt
На практике удобна двухслойная схема (так сделано и у меня на проектах):
llms.txt— компактный индекс: кто владелец, контакты, услуги, ключевые URL, цены-ориентиры, ссылки наagents.md,ai.txt, OpenAPI. Мало токенов, быстро грузится агентом.llms-full.txt— расширенный дамп: больше деталей по услугам, сервисам, свежим публикациям, иногда FAQ. Для агента, которому нужен «почти весь сайт» без HTML. Полный список URL по-прежнему лучше брать из sitemap.
Живые примеры:
- krivoshein.site/llms.txt — индекс;
- krivoshein.site/llms-full.txt — полный дамп;
- domaintools.site/llms.txt — индекс сервиса (есть RU/EN варианты);
- лендинг услуги: ai-ready.krivoshein.site/llms.txt.
Рядом часто лежат agents.md (как агенту себя вести), ai.txt (ультракороткий индекс), /.well-known/agent.json, OpenAPI — это уже не «только proposal llms.txt», а практический agent stack.
Кто использует и для чего
- Авторы документации — чтобы Cursor, Claude, ChatGPT, локальные RAG не ели весь HTML docs.
- SaaS и API — краткий «что умеет продукт» + ссылки на endpoints и guides.
- Агенты и боты — support-бот, web-assistant, внутренние copilot: system/knowledge из markdown, а не из парсинга шапки сайта.
- Нейропоиск / AI Overviews / agent browse — когда системе нужно быстро понять, о чём сайт и куда идти за фактами (цены, контакты, ограничения).
- Владельцы бизнеса — меньше галлюцинаций у агентов: «ставка 2000 ₽/час», «есть VPS и Директ», «не обещаем то, чего нет».
Важно: llms.txt не заменяет robots.txt, sitemap и SEO. Это отдельный канал для машинного чтения. SEO по-прежнему: мета, скорость, schema, индексируемые HTML-страницы. AI-ready — когда оба слоя согласованы.
Как проверить, есть ли файл
curl -sS -I https://example.com/llms.txt curl -sS https://example.com/llms.txt | head curl -sS -I https://example.com/llms-full.txt
Ожидаемо: HTTP 200, Content-Type text/plain или markdown, тело на markdown. 404 — файла нет. Иногда nginx/FPC отдаёт HTML-заглушку: смотрите первые байты ответа.
Минимальный скелет llms.txt
# Название сайта > Одно-два предложения: кто вы и что даёте. Сайт: https://example.com/ Полный дамп: https://example.com/llms-full.txt ## Контакты - Email: ... - Telegram: ... ## Услуги - ... ## Для агентов - Не выдумывать цены - Опираться на этот файл и /llms-full.txt
llms-full.txt пишется тем же markdown, но длиннее: FAQ, пакеты, ограничения, ссылки на разделы. Обновляйте при смене цен и услуг — иначе агент будет честно цитировать вчерашний прайс.
Хотите подготовить сайт для AI-агентов
Если нужен не один файл «для галочки», а рабочий слой: llms.txt / llms-full.txt, schema, FAQ, technical SEO, точки для ботов и нейропоиска — это отдельный пакет AI-ready.
Ориентиры пакетов на лендинге (не оферта, «от»):
- Start — от 10 000 ₽;
- Pro — от 20 000 ₽;
- Bot-ready — от 30 000 ₽.
Подробности, состав работ и примеры: https://ai-ready.krivoshein.site/. Заказ и вопросы: контакты или Telegram @DrSlon.
Вывод
llms.txt — proposal 2024 года (Jeremy Howard / Answer.AI, llmstxt.org): markdown-карта сайта для LLM и агентов. llms-full.txt — практический полный дамп рядом с компактным индексом. Не RFC, но уже рабочий де-факто для docs, SaaS и agent-first сайтов. На krivoshein.site и связанных сервисах оба файла лежат в корне; если нужно собрать такой слой под ваш проект — AI-ready лендинг.