У вашего сайта появился второй читатель
Раньше у корпоративного сайта было два адресата: человек и поисковый робот. Теперь третий — агент, который читает страницу, чтобы ответить на вопрос пользователя. Он не листает выдачу, не кликает по десяти ссылкам и почти никогда не возвращается: он забирает несколько фрагментов, собирает ответ и указывает источник — или не указывает.
Разница принципиальная. Поисковику вы конкурируете за позицию в списке. Агенту — за то, чтобы ваш текст вообще попал в контекст ответа и был опознан как достоверный. Оптимизация под первое не гарантирует второго: страница может отлично ранжироваться и при этом быть непригодной для цитирования — потому что факт размазан по трём абзацам, нигде не назван прямо и не имеет даты.
curl). Если содержимое исчезло — агент видит примерно то же самое: пустой каркас. Большинство агентов не выполняют скрипты.Как работает классический поисковый индекс
Чтобы понимать разницу, полезно помнить механику обычного поиска. Она состоит из четырёх стадий, и на каждой сайт можно потерять.
- Обход. Робот приходит по ссылкам и по карте сайта, соблюдая ограничения
robots.txtи бюджет обхода. Медленный ответ сервера и тысячи бессмысленных URL (фильтры, сортировки, идентификаторы сессий) съедают бюджет, и до важных страниц робот доходит редко. - Рендеринг. Часть роботов исполняет JavaScript, но с задержкой и не всегда. Контент, доступный только после исполнения скриптов, индексируется позже и хуже.
- Индексация. Страница разбирается на текст, заголовки, ссылки и структурированные данные. Здесь решается вопрос дублей: канонический адрес, редиректы, языковые версии.
- Ранжирование. Соответствие запросу, качество источника, поведенческие сигналы. На этой стадии контент уже нельзя починить технически — только переписать.
Российская специфика: у Яндекса есть собственный инструмент принудительной переиндексации изменённых адресов через Вебмастер — им стоит пользоваться после каждой значимой публикации, не дожидаясь планового обхода.
Как работает AI-агент
Агент устроен иначе. Упрощённо он делает три вещи: ищет (часто через обычный поисковый API), забирает несколько страниц целиком и укладывает их фрагменты в ограниченный контекст модели. Отсюда практические следствия.
- Скрипты обычно не исполняются. Если контент рендерится на клиенте, для агента страницы нет.
- Контекст ограничен. В ответ попадёт не вся страница, а несколько фрагментов. Выигрывает текст, в котором факт помещается в один абзац вместе со своим контекстом — а не «как мы уже писали выше».
- Нет второго шанса. Агент не кликнет «подробнее». Ключевые сведения должны быть на той же странице, куда он пришёл.
- Атрибуция требует определённости. Чтобы сослаться на вас, агенту нужно однозначно понять, кто автор, что за организация и когда это написано. Безымянный текст без даты цитируют реже.
- Противоречия обходятся дорого. Если на сайте два разных ответа на один вопрос, агент выберет случайный — или чужой источник.
Технический слой: что именно проверять
Файлы в корне
robots.txt— не только запреты. Важно не заблокировать по инерции агентов, если вы хотите попадать в их ответы. Отдельный вопрос политики: решение «пускать или нет» должно быть осознанным, а не унаследованным.sitemap.xml— полный, с датами последнего изменения, без мусорных адресов. Для многоязычного сайта — со всеми языковыми версиями.llms.txt— предложенное сообществом соглашение: короткий машинно-читаемый обзор сайта со ссылками на ключевые разделы. Официальным стандартом оно не является, но стоит дёшево и решает задачу «дать агенту карту». Расширенный вариантllms-full.txtсодержит выжимку контента целиком.
Разметка страницы
- Структурированные данные (schema.org в формате JSON-LD):
Organizationс реквизитами,Articleс автором и датой,BreadcrumbList,FAQPageдля вопросов-ответов. Это единственный способ сообщить машине факт без разбора текста. - Канонические адреса и корректные
hreflangдля языковых версий — иначе дубли размывают сигнал. - Иерархия заголовков. Один
h1, осмысленныеh2/h3. По ним нарезают фрагменты и по ним же строят оглавление ответа. - Таблицы вместо абзацев там, где данные табличные: из таблицы факт извлекается однозначно.
- Осмысленные адреса и заголовки страниц — они часто становятся подписью к цитате.
Инфраструктура
- Серверный рендеринг или статическая генерация для всего значимого контента.
- Быстрый и стабильный ответ: агент не ждёт долго и не повторяет попытку.
- Отсутствие обязательных баннеров и модальных окон поверх контента — часть парсеров упирается именно в них.
- Честные коды ответов: 404 для отсутствующего, 301 для переехавшего. «Мягкая» 404 со страницей-заглушкой отравляет индекс.
Что делает текст цитируемым
Техническая доступность — необходимое условие, но не достаточное. Дальше решает форма изложения.
- Прямой ответ в первом абзаце раздела. Заголовок задаёт вопрос — первый абзац отвечает. Всё остальное — обоснование.
- Самодостаточные фрагменты. Абзац должен быть понятен вырванным из страницы: без «см. выше» и местоимений, отсылающих к предыдущему разделу.
- Конкретика вместо оценок. «Категорирование проводит комиссия субъекта» лучше, чем «мы поможем разобраться с категорированием». Цитируют факты.
- Даты и версии. У нормативных фактов — дата вступления в силу, у новостей — дата публикации. Без них материал стареет молча.
- Явная атрибуция. Кто автор, какая организация, на каком основании утверждает. Для компании — реквизиты и подтверждающие документы в машинно-читаемом виде.
- Одна версия правды. Один факт — одна страница-источник, остальные ссылаются на неё.
Чек-лист
Доступность
- Контент виден при отключённом JavaScript.
robots.txtне блокирует агентов, которых вы хотите видеть, и решение об этом принято осознанно.sitemap.xmlполный, с датами изменения, без мусорных URL.- Есть
llms.txtс картой ключевых разделов. - Ответ сервера быстрый и стабильный, без обязательных модальных окон поверх контента.
Разметка
- На каждой странице есть JSON-LD: организация, тип страницы, автор, дата.
- Заданы канонические адреса и
hreflangдля языковых версий. - Иерархия заголовков соблюдена,
h1один. - Табличные данные оформлены таблицами, а не списками в тексте.
Содержание
- Каждый раздел начинается с прямого ответа.
- Абзацы самодостаточны и понятны вне контекста страницы.
- У фактов есть даты, у утверждений — основания.
- Реквизиты, лицензии и подтверждающие документы доступны на отдельной странице без регистрации.
- Нет двух страниц, отвечающих на один вопрос по-разному.
Наблюдение
- В логах выделены обращения агентов, известна их доля и динамика.
- Есть регулярная проверка: что отвечают популярные ассистенты на ключевые вопросы о вашей компании.
- После публикации запускается принудительная переиндексация изменённых адресов.
Как измерять результат
Привычные метрики здесь работают плохо: агент часто не приводит трафик вовсе, а формирует представление у пользователя. Что измеримо на практике:
- Доля обращений агентов в логах — по User-Agent. Растёт вместе с их проникновением; резкий провал обычно означает, что вы их случайно заблокировали.
- Регулярный опрос ассистентов. Список из 20–30 вопросов о компании и её тематике, ежемесячная сверка ответов: что говорят, ссылаются ли на вас, нет ли устаревших сведений.
- Полнота индекса — доля страниц из карты сайта, попавших в поисковый индекс.
- Время до индексации новой публикации.
- Доля страниц с корректной структурированной разметкой — проверяется автоматически при сборке сайта.
Как это сделано у нас и чем помогаем
Собственный сайт РЕСТАРТ мы держим на статической генерации: контент отдаётся без исполнения скриптов, у каждой страницы есть JSON-LD и канонический адрес, языковые версии связаны, а для машин выложены llms.txt, llms-full.txt и сводная страница AI-index с машинно-читаемыми файлами. После каждой публикации изменённые адреса автоматически отправляются на переобход.
Если задача шире внешнего сайта — сделать пригодной для машинного чтения корпоративную базу знаний, — это уже Enterprise RAG: те же принципы (нарезка, атрибуция, одна версия правды) применяются к внутренним документам. Проверить на своей базе дешевле всего RAG-пилотом, а вопросы безопасности такого контура разобраны в материале про безопасный корпоративный AI.
Нужен аудит сайта под машинное чтение — напишите нам.
Обсудим ваш контур
Опишите задачу, текущие системы, ограничения и ожидаемый результат. Мы предложим первый практичный шаг: диагностику, пилот, аудит, дорожную карту или проектную команду.
