Блог

AI-index для компании: зачем сайту страница для ИИ-агентов

У корпоративного сайта появился третий читатель — агент, который забирает несколько фрагментов и собирает из них ответ. Разбираем, что он видит технически и что делает страницу цитируемой.

Hero-картинка для страницы «AI-index для компании: зачем сайту страница для ИИ-агентов»

У вашего сайта появился второй читатель

Раньше у корпоративного сайта было два адресата: человек и поисковый робот. Теперь третий — агент, который читает страницу, чтобы ответить на вопрос пользователя. Он не листает выдачу, не кликает по десяти ссылкам и почти никогда не возвращается: он забирает несколько фрагментов, собирает ответ и указывает источник — или не указывает.

Разница принципиальная. Поисковику вы конкурируете за позицию в списке. Агенту — за то, чтобы ваш текст вообще попал в контекст ответа и был опознан как достоверный. Оптимизация под первое не гарантирует второго: страница может отлично ранжироваться и при этом быть непригодной для цитирования — потому что факт размазан по трём абзацам, нигде не назван прямо и не имеет даты.

Проверка за одну минуту. Откройте страницу в режиме без JavaScript (или запросите её через curl). Если содержимое исчезло — агент видит примерно то же самое: пустой каркас. Большинство агентов не выполняют скрипты.

Как работает классический поисковый индекс

Чтобы понимать разницу, полезно помнить механику обычного поиска. Она состоит из четырёх стадий, и на каждой сайт можно потерять.

  • Обход. Робот приходит по ссылкам и по карте сайта, соблюдая ограничения robots.txt и бюджет обхода. Медленный ответ сервера и тысячи бессмысленных URL (фильтры, сортировки, идентификаторы сессий) съедают бюджет, и до важных страниц робот доходит редко.
  • Рендеринг. Часть роботов исполняет JavaScript, но с задержкой и не всегда. Контент, доступный только после исполнения скриптов, индексируется позже и хуже.
  • Индексация. Страница разбирается на текст, заголовки, ссылки и структурированные данные. Здесь решается вопрос дублей: канонический адрес, редиректы, языковые версии.
  • Ранжирование. Соответствие запросу, качество источника, поведенческие сигналы. На этой стадии контент уже нельзя починить технически — только переписать.

Российская специфика: у Яндекса есть собственный инструмент принудительной переиндексации изменённых адресов через Вебмастер — им стоит пользоваться после каждой значимой публикации, не дожидаясь планового обхода.

Как работает AI-агент

Агент устроен иначе. Упрощённо он делает три вещи: ищет (часто через обычный поисковый API), забирает несколько страниц целиком и укладывает их фрагменты в ограниченный контекст модели. Отсюда практические следствия.

  • Скрипты обычно не исполняются. Если контент рендерится на клиенте, для агента страницы нет.
  • Контекст ограничен. В ответ попадёт не вся страница, а несколько фрагментов. Выигрывает текст, в котором факт помещается в один абзац вместе со своим контекстом — а не «как мы уже писали выше».
  • Нет второго шанса. Агент не кликнет «подробнее». Ключевые сведения должны быть на той же странице, куда он пришёл.
  • Атрибуция требует определённости. Чтобы сослаться на вас, агенту нужно однозначно понять, кто автор, что за организация и когда это написано. Безымянный текст без даты цитируют реже.
  • Противоречия обходятся дорого. Если на сайте два разных ответа на один вопрос, агент выберет случайный — или чужой источник.

Технический слой: что именно проверять

Файлы в корне

  • robots.txt — не только запреты. Важно не заблокировать по инерции агентов, если вы хотите попадать в их ответы. Отдельный вопрос политики: решение «пускать или нет» должно быть осознанным, а не унаследованным.
  • sitemap.xml — полный, с датами последнего изменения, без мусорных адресов. Для многоязычного сайта — со всеми языковыми версиями.
  • llms.txt — предложенное сообществом соглашение: короткий машинно-читаемый обзор сайта со ссылками на ключевые разделы. Официальным стандартом оно не является, но стоит дёшево и решает задачу «дать агенту карту». Расширенный вариант llms-full.txt содержит выжимку контента целиком.

Разметка страницы

  • Структурированные данные (schema.org в формате JSON-LD): Organization с реквизитами, Article с автором и датой, BreadcrumbList, FAQPage для вопросов-ответов. Это единственный способ сообщить машине факт без разбора текста.
  • Канонические адреса и корректные hreflang для языковых версий — иначе дубли размывают сигнал.
  • Иерархия заголовков. Один h1, осмысленные h2/h3. По ним нарезают фрагменты и по ним же строят оглавление ответа.
  • Таблицы вместо абзацев там, где данные табличные: из таблицы факт извлекается однозначно.
  • Осмысленные адреса и заголовки страниц — они часто становятся подписью к цитате.

Инфраструктура

  • Серверный рендеринг или статическая генерация для всего значимого контента.
  • Быстрый и стабильный ответ: агент не ждёт долго и не повторяет попытку.
  • Отсутствие обязательных баннеров и модальных окон поверх контента — часть парсеров упирается именно в них.
  • Честные коды ответов: 404 для отсутствующего, 301 для переехавшего. «Мягкая» 404 со страницей-заглушкой отравляет индекс.

Что делает текст цитируемым

Техническая доступность — необходимое условие, но не достаточное. Дальше решает форма изложения.

  • Прямой ответ в первом абзаце раздела. Заголовок задаёт вопрос — первый абзац отвечает. Всё остальное — обоснование.
  • Самодостаточные фрагменты. Абзац должен быть понятен вырванным из страницы: без «см. выше» и местоимений, отсылающих к предыдущему разделу.
  • Конкретика вместо оценок. «Категорирование проводит комиссия субъекта» лучше, чем «мы поможем разобраться с категорированием». Цитируют факты.
  • Даты и версии. У нормативных фактов — дата вступления в силу, у новостей — дата публикации. Без них материал стареет молча.
  • Явная атрибуция. Кто автор, какая организация, на каком основании утверждает. Для компании — реквизиты и подтверждающие документы в машинно-читаемом виде.
  • Одна версия правды. Один факт — одна страница-источник, остальные ссылаются на неё.

Чек-лист

Доступность

  • Контент виден при отключённом JavaScript.
  • robots.txt не блокирует агентов, которых вы хотите видеть, и решение об этом принято осознанно.
  • sitemap.xml полный, с датами изменения, без мусорных URL.
  • Есть llms.txt с картой ключевых разделов.
  • Ответ сервера быстрый и стабильный, без обязательных модальных окон поверх контента.

Разметка

  • На каждой странице есть JSON-LD: организация, тип страницы, автор, дата.
  • Заданы канонические адреса и hreflang для языковых версий.
  • Иерархия заголовков соблюдена, h1 один.
  • Табличные данные оформлены таблицами, а не списками в тексте.

Содержание

  • Каждый раздел начинается с прямого ответа.
  • Абзацы самодостаточны и понятны вне контекста страницы.
  • У фактов есть даты, у утверждений — основания.
  • Реквизиты, лицензии и подтверждающие документы доступны на отдельной странице без регистрации.
  • Нет двух страниц, отвечающих на один вопрос по-разному.

Наблюдение

  • В логах выделены обращения агентов, известна их доля и динамика.
  • Есть регулярная проверка: что отвечают популярные ассистенты на ключевые вопросы о вашей компании.
  • После публикации запускается принудительная переиндексация изменённых адресов.

Как измерять результат

Привычные метрики здесь работают плохо: агент часто не приводит трафик вовсе, а формирует представление у пользователя. Что измеримо на практике:

  • Доля обращений агентов в логах — по User-Agent. Растёт вместе с их проникновением; резкий провал обычно означает, что вы их случайно заблокировали.
  • Регулярный опрос ассистентов. Список из 20–30 вопросов о компании и её тематике, ежемесячная сверка ответов: что говорят, ссылаются ли на вас, нет ли устаревших сведений.
  • Полнота индекса — доля страниц из карты сайта, попавших в поисковый индекс.
  • Время до индексации новой публикации.
  • Доля страниц с корректной структурированной разметкой — проверяется автоматически при сборке сайта.

Как это сделано у нас и чем помогаем

Собственный сайт РЕСТАРТ мы держим на статической генерации: контент отдаётся без исполнения скриптов, у каждой страницы есть JSON-LD и канонический адрес, языковые версии связаны, а для машин выложены llms.txt, llms-full.txt и сводная страница AI-index с машинно-читаемыми файлами. После каждой публикации изменённые адреса автоматически отправляются на переобход.

Если задача шире внешнего сайта — сделать пригодной для машинного чтения корпоративную базу знаний, — это уже Enterprise RAG: те же принципы (нарезка, атрибуция, одна версия правды) применяются к внутренним документам. Проверить на своей базе дешевле всего RAG-пилотом, а вопросы безопасности такого контура разобраны в материале про безопасный корпоративный AI.

Нужен аудит сайта под машинное чтение — напишите нам.

Обсудим ваш контур

Опишите задачу, текущие системы, ограничения и ожидаемый результат. Мы предложим первый практичный шаг: диагностику, пилот, аудит, дорожную карту или проектную команду.

Связаться
AI-помощник
Привет! Я AI-помощник РЕСТАРТ. Помогу найти нужный раздел сайта, ответить по услугам, лицензиям, партнерствам, контактам или сформулировать обращение в отдел продаж.