Как писать контент, который цитируют нейросети: данные исследований вместо мифов
Попадание страницы в ответ нейросети — измеримая инженерная задача, а не лотерея. Академическое исследование GEO (Princeton, KDD 2024) показало: добавление в текст проверяемой статистики, прямых цитат экспертов и ссылок на первоисточники повышает видимость в генеративных ответах до 40%, тогда как классическая накрутка плотности ключевых слов не даёт ничего. Прямой ответ нужно давать в первых 40–60 словах раздела — заметная часть всех цитат извлекается из первой трети текста. Разметка Schema.org помогает, а модный файл llms.txt — нет: реальные поисковые LLM его не читают. Ниже — разбор каждого фактора с источниками и чек-лист для автора.
Эта статья — продолжение материала о том, как устроена нейровыдача и как в неё попасть. Там — стратегия целиком; здесь — только контент: что писать на странице, чтобы её взяли в ответ.
Как нейросеть выбирает, кого процитировать

Чтобы управлять цитированием, нужно понимать конвейер, который его порождает. Все генеративные поисковики — нейроответы Яндекса (Алиса), Google AI Overviews, ChatGPT Search, GigaChat в режиме поиска — работают по схеме RAG (Retrieval-Augmented Generation), и она состоит из четырёх шагов.
Сначала декомпозиция: сложный запрос пользователя разбивается на несколько простых поисковых интентов. Затем извлечение: система обращается к обычному поисковому индексу и достаёт не страницы целиком, а релевантные фрагменты текста — чанки. Затем синтез: языковая модель собирает ответ из лучших фрагментов. И наконец цитирование: ссылки прикрепляются к тем фрагментам, чьи факты реально вошли в ответ.
Яндекс описал свой конвейер публично, и цифры стоит запомнить. Страницы-кандидаты берутся из топа обычной выдачи, текст нарезается на пересекающиеся блоки по 256 токенов — это примерно один абзац, — блоки оцениваются отдельной моделью релевантности, и в финальный ответ проходят лишь пять документов. Из всей вашей страницы работать будут несколько лучших абзацев. Это ключевой вывод для автора: нейросеть цитирует не страницы — она цитирует абзацы. Всё, что описано ниже, — способы сделать ваши абзацы лучшими в выдаче.
Что доказало исследование GEO: три фактора и одна мёртвая практика
Термин Generative Engine Optimization ввела научная работа «GEO: Generative Engine Optimization» (Aggarwal et al., Принстон и соавторы, конференция KDD 2024). Исследователи собрали бенчмарк из 10 000 запросов и измерили, какие изменения текста реально повышают шанс попасть в генеративный ответ. Официальный итог из аннотации: правильная оптимизация даёт до 40% прироста видимости в ответах генеративных движков.
Три метода показали лучшие результаты (в отраслевых разборах исследования их эффект оценивается примерно так):
Цитаты экспертов — сильнейший фактор (~+41% к видимости). Прямые, атрибутированные высказывания профильных специалистов: с именем, должностью, в кавычках. RAG-системы воспринимают такие фрагменты как сигнал достоверности и охотно встраивают в логику ответа. «По оценке руководителя практики N, в 2026 году…» работает лучше целого абзаца обезличенных рассуждений.
Проверяемая статистика (~+32%). Плотность квантифицируемых фактов: числа, даты, доли, результаты измерений. Исследование показало, что размытые утверждения вида «многие компании используют…» модели просто игнорируют. Практический ориентир: минимум один проверяемый факт или именованная сущность на каждые 100 слов текста.
Ссылки на первоисточники (~+30%). Исходящие ссылки на авторитетные источники прямо в тексте: исследования, госреестры, официальную статистику, документацию. Контент, который сам опирается на проверяемые источники, языковые модели расценивают как более надёжный — и чаще берут в ответ.
А теперь мёртвая практика. Плотность ключевых слов — ноль или минус. Тот же бенчмарк показал, что классическое «добавим больше ключевиков» не улучшает видимость в генеративных ответах, а в ряде конфигураций ухудшает её: перенасыщенный ключами текст модели отбраковывают как низкокачественный. Если ваш подрядчик до сих пор считает проценты вхождений — он оптимизирует под алгоритмы прошлого десятилетия.
Правило первой трети: где в тексте живут цитаты

Независимые разборы структуры AI Overviews дают согласованную картину: порядка 44% всех извлекаемых цитат приходится на первые 30% текста документа. Модели не любят длинные лирические подводки — они ищут готовый ответ как можно раньше.
Отсюда два практических правила.
Answer-First. Прямой, технически точный ответ на интент раздела — в первых 40–60 словах под заголовком H2/H3. Сначала ответ, потом развёртка, примеры и нюансы. Сравните. Плохо: «Вопрос выбора CRM-системы волнует многих руководителей, и прежде чем дать ответ, важно разобраться в истории вопроса…» Хорошо: «Для отдела продаж до 10 человек достаточно CRM с канбаном сделок, телефонией и интеграцией с почтой; внедрение занимает 2–4 недели. Ниже — критерии выбора и типичные ошибки».
Самодостаточные блоки. Помните про нарезку на чанки: каждый абзац должен сохранять смысл, будучи вырванным из контекста. Абзацы, начинающиеся с «как мы уже говорили выше» или «этот подход», при извлечении превращаются в мусор — модель не знает, о чём «этом» речь. Пишите так, чтобы каждый H2-раздел отвечал на свой подвопрос полностью: с называнием предмета, цифрами и выводом внутри блока.
Структурированная фактура усиливает извлекаемость: сравнения — таблицей, перечни критериев — списком, определения — отдельным абзацем. Из таблицы модель достаёт факт надёжнее, чем из сплошного текста на десять строк.
Разметка: что работает, а что — карго‑культ

Schema.org / JSON-LD — работает. Корректная микроразметка помогает ботам понимать структуру данных: таблицы, списки, FAQ, связи сущностей. Google при этом официально заявляет, что специальной разметки именно для AI Overviews не существует — но стандартная разметка, улучшающая понимание страницы классическим поиском, работает на первый и главный фактор: позиции, из которых нейросеть и берёт кандидатов.
llms.txt — не работает. Этот файл продвигали как «robots.txt для нейросетей»: положи в корень сайта дайджест контента, и LLM его прочтут. Проверка масштабом это опровергла. Ahrefs проанализировали 137 000 сайтов: 97% файлов llms.txt никогда не читаются реальными LLM-ботами. Независимый анализ 33 000 сессий ботов (агентство Seomix) дал ту же картину: 96–97% обращений к файлу — это краулеры самих SEO-сервисов, проверяющих его наличие друг у друга. Ни Google, ни OpenAI не используют llms.txt как фактор — они парсят обычный HTML. Если вам продают «внедрение llms.txt» как услугу GEO-продвижения — это продажа плацебо. Те же усилия, вложенные в answer-first-структуру обычных страниц, дают измеримый эффект.
Российская специфика: для коммерческих запросов текста мало
В рунете есть слой, которого нет в западных гайдах: коммерческие нейроответы собираются не только из текстов страниц, но и из структурированных данных экосистем.
Нейроответы Яндекса по товарным запросам интегрированы с сервисом «Яндекс Товары»: чтобы продукт попал в генеративный ответ с ценой и карточкой, магазин должен передавать валидный YML-фид через Яндекс Вебмастер. Текст на сайте может быть идеальным — но без корректного фида товарная выдача пройдёт мимо вас. GigaChat, в свою очередь, при рекомендациях B2B-компаний опирается в том числе на верифицированные профили в «Сбер Бизнес ID»: подтверждённая карточка компании повышает доверие системы.
Вывод для коммерческих сайтов: GEO — это контент плюс технический аудит фидов и бизнес-профилей. Проверьте фид и карточки компаний раньше, чем закажете десятый лендинг.
И ещё один российский инструмент, который стоит держать открытым: отчёты Яндекс Вебмастера по запросам. Страницы с большим числом показов и аномально низким CTR — частый признак того, что трафик по запросу перехватил нейроответ. Это готовая карта запросов, по которым вам особенно важно быть в источниках.
Чек‑лист автора: 10 пунктов перед публикацией
- Прямой ответ на главный вопрос — в первых 40–60 словах статьи.
- Каждый H2-раздел отвечает на свой подвопрос полностью и самодостаточно.
- Минимум один проверяемый факт или именованная сущность на 100 слов.
- Есть хотя бы одна прямая атрибутированная цитата эксперта.
- Есть исходящие ссылки на первоисточники (исследования, реестры, документация).
- Сравнения и критерии оформлены таблицами и списками, а не сплошным текстом.
- Ни один абзац не начинается с отсылки к предыдущему («как сказано выше»).
- Плотность ключевых слов не считалась вообще — вместо неё проверено покрытие подвопросов темы.
- Микроразметка Schema.org соответствует реальному содержимому страницы.
- Для коммерческих страниц: товарный фид валиден, бизнес-профили подтверждены.
Что дальше
Контент — это второй и третий фильтры воронки нейровидимости. Первый — позиции в обычной выдаче, четвёртый — доступность сайта для ботов, пятый — упоминание бренда как решения. Как устроена воронка целиком и как выстроить работу по всем фильтрам — в нашем базовом разборе: «Нейровыдача вместо поиска». А если хотите увидеть, кого нейросети цитируют по вашим запросам вместо вас, — начните с GEO-аудита: карта цитирований, разбор конкурентов и приоритизированный план.
Источники: Aggarwal et al., «GEO: Generative Engine Optimization», KDD 2024 (arxiv.org/abs/2311.09735); технический блог Яндекса о работе Нейро (Хабр); Google Search Central, документация AI Features; исследование Ahrefs по llms.txt (137 000 сайтов); анализ Seomix (33 000 сессий ботов); материалы о интеграции нейроответов Яндекса с «Яндекс Товары» и GigaChat со «Сбер Бизнес ID» (2024–2026).
