llms.txt простыми словами: нужен ли он вашему сайту
Ещё один файл, который должен спасти ваш сайт?
Вы наверняка знаете robots.txt — простой текстовый файл в корне сайта, который объясняет поисковым роботам, куда им можно заходить, а куда нет. Знаете и sitemap.xml — список всех страниц, который помогает поисковику ничего не пропустить при индексации. Эти два файла десятилетиями тихо живут в корне практически любого сайта, и про их пользу спорить бессмысленно — она подтверждена годами практики и официальной документацией Google, Яндекса и остальных.
В 2024–2025 году к ним добавился третий персонаж — llms.txt. Идея быстро разошлась по SEO-блогам и профильным каналам: ещё один простой текстовый файл, только теперь не для поисковых роботов, а для языковых моделей и ИИ-агентов — ChatGPT, Perplexity и остальных. Логика на первый взгляд понятна: раз есть файл для краулеров, почему бы не завести файл для ИИ? Кто-то прочитал один такой пост, за вечер собрал llms.txt по шаблону, залил в корень домена — и стал ждать, что упоминания бренда в ответах ChatGPT и Perplexity начнут расти.
Проходит неделя, потом две. Заходишь в логи сервера — файл действительно скачивали, человек десять, в основном это люди, которые проверяли, что он вообще отдаётся без ошибки 404. Среди обращений нет ни одного запроса от известных user-agent'ов ИИ-систем. Упоминания бренда в ChatGPT и Perplexity за это время не изменились вообще. Возникает закономерный вопрос: файл не работает, или просто рано делать выводы за две недели?
Шум вокруг llms.txt подогревают сразу несколько факторов: тема ИИ в принципе сейчас продаётся лучше почти любой другой, формат предельно простой — результат виден сразу, в отличие от долгой работы над структурой контента, а ощущение «мы одни из первых, кто это сделал» приятно само по себе. Ничего плохого в этом нет, но к реальным ожиданиям от файла это обычно не имеет отношения.
Если вы в похожей ситуации — уже сделали файл или только думаете, нужен ли он, — короткий честный ответ звучит так: сам по себе llms.txt вряд ли что-то изменит, потому что крупные ИИ-системы его массово не читают. Но это не значит, что идея бесполезна в принципе. Дальше разберём, что это такое на самом деле, почему вокруг него столько шума и когда он действительно имеет смысл.
Что такое llms.txt на самом деле
llms.txt — это обычный markdown-файл, который кладут в корень сайта по адресу /llms.txt, рядом с robots.txt и sitemap.xml. Идею в 2024 году оформили на сайте llmstxt.org как открытое предложение сообществу — не стандарт W3C, не часть протокола HTTP, не требование, закреплённое в документации Google или OpenAI, а просто конвенция: если все будут класть файл по этому адресу в этом формате, языковым моделям станет проще.
Markdown выбрали не случайно: он в разы компактнее по числу токенов, чем тот же текст, обёрнутый в HTML-теги, навигацию и скрипты, а значит дешевле и быстрее для модели, которая фактически платит токенами за каждый символ контекста.
Автор предложения — Джереми Ховард, сооснователь fast.ai, а позже Answer.AI. В сентябре 2024 года его команда опубликовала спецификацию на llmstxt.org и предложила индустрии принять её так же добровольно, как в своё время приняли sitemap.xml. Некоторые платформы для технической документации довольно быстро начали генерировать llms.txt автоматически — так файл появился на сотнях сайтов, даже без осознанного решения их команд. Но автоматическое появление файла и то, что его реально используют при формировании ответов пользователям, — две разные истории.
- Заголовок первого уровня с названием сайта или продукта
- Короткая цитата-описание на одно-два предложения — чем сайт занимается
- Несколько разделов второго уровня со списками ссылок на ключевые страницы — документацию, API, тарифы, блог
- У каждой ссылки — короткая подпись простым языком, а не SEO-заголовок страницы
Представьте два сценария одного и того же запроса агенту: «открой сайт такого-то SaaS-продукта и найди, сколько стоит тариф для команды из 10 человек». Без llms.txt агент заходит на главную, пытается понять структуру навигации, кликает на вероятные разделы — «Pricing», «Для бизнеса», «Тарифы» — и может промахнуться, если меню нестандартное или цена спрятана за формой заявки. С llms.txt в теории всё проще: агент сразу видит раздел «Продукт» со ссылкой на /pricing и коротким описанием. На практике разница в том, читает ли конкретный агент этот файл вообще, — а здесь честный ответ пока «не всегда».
По задумке авторов, файл нужен не человеку и не классическому поисковому роботу, а ИИ-агенту или модели, которая в моменте разбирает сайт — например, когда пользователь просит ассистента «открой документацию такого-то сервиса и найди, как настроить X». Вместо того чтобы агент сам ползал по меню и парсил вёрстку, он сразу получает компактную карту: вот документация, вот API, вот блог, вот куда не стоит соваться. Примерно так же конспект курса экономит время по сравнению с чтением всего учебника — только не для человека, а для модели.
Это стандарт? Нет — и это многое объясняет
Здесь важна честность, потому что вокруг llms.txt много маркетингового шума. У robots.txt и sitemap.xml есть то, чего пока нет у llms.txt, — массовая поддержка со стороны тех, для кого они написаны. Googlebot официально документирует, как он читает robots.txt. Google Search Console официально принимает sitemap.xml. А вот у крупных ИИ-краулеров и агентов — от OpenAI, Anthropic, Perplexity, Google — нет единого публичного обязательства читать и использовать llms.txt при формировании ответов пользователям.
Это не значит, что ИИ-компании вообще игнорируют текстовые файлы в корне сайта — как раз наоборот, просто в игру чаще вступает robots.txt, а не llms.txt. У крупных провайдеров есть собственные краулеры с публичными именами: GPTBot у OpenAI, PerplexityBot у Perplexity, Google-Extended у Google, ClaudeBot у Anthropic. Все они официально обязуются уважать директивы Disallow, адресованные именно им в robots.txt — то есть сайт уже сегодня может ограничить, какие разделы эти краулеры индексируют или используют для обучения моделей. Этот механизм работает, потому что он встроен в давно существующий и проверенный протокол, а не изобретён заново.
На практике это означает, что большинство ответов ChatGPT, Perplexity, Copilot, Gemini и Google AI сегодня опираются на куда более приземлённые сигналы: смог ли краулер технически обойти и разобрать страницу, есть ли на ней структурированные данные, насколько понятно и структурно написан сам текст, авторитетность домена — в целом тот же набор, на котором строится обычный AEO/GEO-анализ (см. что такое AEO и GEO простыми словами). Наличие или отсутствие llms.txt в этот набор сигналов пока входит в лучшем случае эпизодически.
Это не повод полностью списывать llms.txt со счетов — просто ожидания нужно калибровать правильно. Даже если крупные провайдеры не читают файл напрямую, курирование списка ключевых страниц — полезное упражнение само по себе: оно заставляет чётко сформулировать, что на сайте действительно важно, а это пригождается и при работе со структурированными данными, и в обычной SEO-структуре навигации.
| Параметр | robots.txt | sitemap.xml | llms.txt |
|---|---|---|---|
| Назначение | Разрешает или запрещает обход страниц краулерам | Перечисляет URL для индексации поисковиком | Кратко описывает сайт и даёт ссылки на ключевые страницы для ИИ |
| Аудитория | Поисковые и прочие краулеры | Поисковые системы (Google, Яндекс и др.) | Языковые модели и ИИ-агенты — в теории |
| Формат | Простой текст, директивы User-agent/Disallow | XML со списком URL и метаданными | Markdown: заголовок, краткое описание, списки ссылок |
| Кто обязан соблюдать | Официально поддерживается крупными поисковыми роботами | Официально принимается Search Console и аналогами | Не закреплено официально ни одним крупным ИИ-провайдером |
| Статус | Де-факто индустриальный стандарт с 1994 года | Официально поддерживаемый протокол, принятый Google | Конвенция, предложенная сообществом (llmstxt.org, 2024) |
Мы разбирали эту тему детальнее, когда вышла вторая версия предложения llms.txt — см. заметку про адаптацию llms.txt v2: массового перехода крупные провайдеры пока не показали. Это не значит, что так будет всегда — конвенции иногда приживаются за пару лет, как в своё время прижился sitemap.xml. Но строить стратегию на файле, который сегодня читают не все и не всегда, рискованно.
Как выглядит llms.txt на практике
Проще один раз увидеть формат, чем читать про него абзацами. Ниже — пример минимального, но реалистичного llms.txt для условного SaaS-продукта (в примере вымышленный Example Brand на mysite.com, не путайте с настоящим сайтом):
# Example Brand > Example Brand — SaaS-платформа для мониторинга SEO и видимости бренда в ответах ИИ-систем. Помогает отслеживать позиции, упоминания и цитирования в ChatGPT, Perplexity, Gemini и других системах. ## Документация - [Быстрый старт](https://mysite.com/docs/quickstart): как подключить первый проект за 5 минут - [Справочник API](https://mysite.com/docs/api): эндпоинты, авторизация, лимиты запросов ## Продукт - [Тарифы](https://mysite.com/pricing): актуальные планы и ограничения - [Блог](https://mysite.com/articles): статьи про AEO, GEO и видимость в ИИ-поиске ## Необязательное - [Статус сервиса](https://mysite.com/status): аптайм и история инцидентов
Обратите внимание на три вещи. Во-первых, файл не пытается перечислить вообще все страницы сайта — это не замена sitemap.xml, а курированный список самого важного, буквально 5–15 ссылок. Во-вторых, у каждой ссылки есть короткое пояснение простым языком — не SEO title страницы, а именно ответ на вопрос «зачем сюда идти». В-третьих, никакой разметки, скриптов и инлайн-стилей — чистый markdown, который можно скормить модели без парсинга HTML.
У формата есть необязательный компаньон — llms-full.txt. Это тот же список разделов, но вместо ссылок на страницы в нём — полный текст каждой из них, собранный в один файл. Идея в том, чтобы агент мог забрать весь нужный контент одним запросом, не переходя по ссылкам одна за другой. На практике llms-full.txt быстро превращается в файл на сотни килобайт для сколько-нибудь большого сайта, и его тоже никто не обязан читать целиком — языковые модели всё равно работают в рамках ограниченного контекста за один запрос, так что гигантский файл просто обрежется где-то посередине.
Где llms.txt находится в общей картине SEO
Чтобы не переоценить роль файла, полезно увидеть его место в иерархии. llms.txt — это тонкий необязательный слой поверх того, что действительно определяет, появится ли сайт в ответе ИИ-системы.
Чем ниже слой на этой схеме, тем сильнее он влияет на то, процитирует ли вас ChatGPT или Perplexity. llms.txt стоит ближе к верхушке — рядом с технической обвязкой, а не с содержанием. Если хотите в принципе понять, насколько ваши страницы читаемы и структурированы для ИИ, для этого есть предметный аудит контента вроде AI Readiness: он разбирает страницу примерно так же, как это делает модель при извлечении информации, и показывает конкретные проблемы, а не гадает.
Если провести аналогию: чинить структурные проблемы контента одним необязательным файлом в корне — то же самое, что полировать дверную ручку в доме с протекающей крышей. Выглядит аккуратно, но не решает то, что действительно важно.
Нужен ли llms.txt именно вам
Ответ распадается на два сценария, и важно понять, в каком из них вы находитесь, до того как тратить время на файл.
Если у вас уже в порядке техническая часть — страницы нормально краулятся, отдают человекочитаемый HTML без критичной зависимости от JavaScript, на сайте есть структурированные данные (FAQPage, Article, Product — что уместно), а контент написан понятно и отвечает на реальные вопросы, — тогда llms.txt можно добавить. Он дешёвый: один markdown-файл, полчаса на сборку, нулевой риск что-то сломать. Он не навредит и теоретически может немного помочь тем немногим агентам, которые его уже читают. Но это низкоприоритетная задача, а не рычаг, который сдвинет видимость в ИИ-поиске. На практике такой чек-лист проверяется быстро: structured data можно прогнать через Rich Results Test от Google, а JS-зависимость контента — просто отключив JavaScript в devtools браузера и посмотрев, что останется на странице.
Если же у вас есть реальные проблемы — часть контента рендерится только через JavaScript и невидима без выполнения скриптов, структурированных данных нет вообще, sitemap.xml не обновлялся год, а тексты страниц написаны ради ключевых слов, а не ради ответа на вопрос, — llms.txt их не компенсирует. Он не «взламывает» ранжирование и не подменяет собой работу с контентом. Это как расставить красивые указатели у входа в магазин, где половина полок пустая: указатели не заставят покупателя найти товар, которого там нет. С этим лучше разобраться по чек-листу AEO и статье о том, как ИИ-системы выбирают источники, а уже потом возвращаться к llms.txt — если вообще будет нужно.
Чаще встречается промежуточный случай: часть сайта в порядке, а часть — нет. Например, маркетинговые лендинги отрендерены сервером и прекрасно читаются, а документация или блог собраны на SPA-движке, который без выполнения JavaScript отдаёт пустой div. В таком случае llms.txt тоже не спасёт: он может сослаться на страницу документации, но если контент за этой ссылкой невидим без JS, агент упрётся в тот же тупик, в который упёрся бы и без файла.
Проверить, в каком вы сценарии, несложно самостоятельно. Откройте ключевую страницу через curl -A "Mozilla/5.0 (compatible; GPTBot/1.0)" https://ваш-сайт/страница или через «просмотр кода страницы» в браузере — без выполнения JavaScript. Если там пусто или виден только каркас приложения без текста, у краулеров и ИИ-агентов, скорее всего, те же проблемы с извлечением контента, что видите вы. Это первое, что стоит проверить, прежде чем вообще задумываться про llms.txt.
Гадать не обязательно — отслеживайте, упоминают и цитируют ли вас ChatGPT, Perplexity, Copilot, Gemini и Google AI на реальных запросах, и сравнивайте динамику до и после изменений. Для этого в AI Control есть история видимости, Share of Voice и цитируемых ссылок по вашим трекинг-профилям.
Частые вопросы про llms.txt
Коротко закроем то, что обычно спрашивают.
llms.txt — это замена sitemap.xml?
Нет. sitemap.xml — исчерпывающий список URL для индексации поисковиком, а llms.txt — короткий курированный список из нескольких ключевых страниц для языковых моделей. Их стоит использовать вместе, а не вместо друг друга.
Может ли llms.txt навредить сайту?
Сам факт его наличия вреда не наносит. Риски возникают, только если в файл случайно попадают ссылки на непубличные или служебные страницы, или если он годами не обновляется и начинает вести на удалённые разделы — тогда он просто бесполезен, а не вреден.
ChatGPT, Perplexity и другие системы точно читают этот файл?
Единого публичного подтверждения от крупных провайдеров нет, а практика показывает, что поддержка неравномерная и непостоянная. Полагаться на llms.txt как на основной канал видимости в ИИ-поиске не стоит.
С чего начать, если у меня пока нет ни llms.txt, ни нормального технического SEO?
С технической части: краулимость страниц, структурированные данные, понятный и структурированный контент. llms.txt можно добавить в конце, за полчаса, когда остальное уже в порядке.
Нужно ли обновлять llms.txt так же часто, как контент сайта?
Да, если решите его завести. Устаревший файл со ссылками на удалённые страницы или старые разделы хуже, чем его отсутствие — он создаёт неверную карту сайта вместо полезной. Для большинства проектов достаточно обновлять его вручную при каждом значимом изменении структуры сайта.
Стоит ли делать llms.txt, если у меня небольшой сайт-визитка?
Скорее нет смысла. Формат рассчитан на сайты с заметным объёмом структурированного контента — документацией, блогом, справочником API, — где агенту действительно есть что курировать. Для сайта из 5–10 страниц разница между llms.txt и обычной навигацией для ИИ-агента практически отсутствует.
Чеклист: стоит ли делать llms.txt для вашего сайта
Если коротко — вот по каким пунктам стоит пройтись, прежде чем тратить время на файл (или прежде чем решить, что он вам не нужен). Специальных инструментов для этого не нужно — только трезвая оценка того, в каком состоянии сайт находится прямо сейчас.
- Страницы сайта нормально краулятся и отдают контент без обязательного выполнения JavaScript — если нет, начните отсюда, а не с llms.txt
- На ключевых страницах есть структурированные данные (FAQPage, Article и подобные) — сигнал, который реально используют и поисковики, и часть ИИ-систем
- sitemap.xml актуален и не содержит битых или устаревших ссылок
- Контент страниц написан так, чтобы прямо отвечать на вопрос пользователя, а не только ради ключевых слов
- Если всё перечисленное выше в порядке — добавьте llms.txt как недорогой бонус: 5–15 ссылок на документацию, тарифы, блог и ключевые разделы с коротким описанием каждой
- Не ждите от файла взрывного роста цитирований — это гигиенический элемент, а не рычаг роста
- Отслеживайте реальные упоминания и цитирования бренда в ответах ИИ-систем, чтобы видеть, что действительно работает, а не полагаться на один файл
Хотите проверить это на своём рынке?
AI Control регулярно собирает ответы AI-систем, позиции брендов, конкурентов и цитируемые источники по вашим промптам.
А ваш контент готов к историям вроде этих?
Используйте 50 приветственных лимитов для проверки AI Readiness — retrieval, extractability, сигналы schema.org и приоритизированное ТЗ на правки.