Олег Линьков
Агротех-эксперт по digital-инфраструктуре и маркетингу АПК
Получить консультацию
Как писать контент, который цитируют нейросети: данные исследований вместо мифов

Как писать контент, который цитируют нейросети: данные исследований вместо мифов

Попадание страницы в ответ нейросети — измеримая инженерная задача, а не лотерея. Академическое исследование GEO (Princeton, KDD 2024) показало: добавление в текст проверяемой статистики, прямых цитат экспертов и ссылок на первоисточники повышает видимость в генеративных ответах до 40%, тогда как классическая накрутка плотности ключевых слов не даёт ничего. Прямой ответ нужно давать в первых 40–60 словах раздела — заметная часть всех цитат извлекается из первой трети текста. Разметка Schema.org помогает, а модный файл llms.txt — нет: реальные поисковые LLM его не читают. Ниже — разбор каждого фактора с источниками и чек-лист для автора.


Эта статья — продолжение материала о том, как устроена нейровыдача и как в неё попасть. Там — стратегия целиком; здесь — только контент: что писать на странице, чтобы её взяли в ответ.


Как нейросеть выбирает, кого процитировать

svg-1-faktory-citirovaniya.png


Чтобы управлять цитированием, нужно понимать конвейер, который его порождает. Все генеративные поисковики — нейроответы Яндекса (Алиса), Google AI Overviews, ChatGPT Search, GigaChat в режиме поиска — работают по схеме RAG (Retrieval-Augmented Generation), и она состоит из четырёх шагов.


Сначала декомпозиция: сложный запрос пользователя разбивается на несколько простых поисковых интентов. Затем извлечение: система обращается к обычному поисковому индексу и достаёт не страницы целиком, а релевантные фрагменты текста — чанки. Затем синтез: языковая модель собирает ответ из лучших фрагментов. И наконец цитирование: ссылки прикрепляются к тем фрагментам, чьи факты реально вошли в ответ.


Яндекс описал свой конвейер публично, и цифры стоит запомнить. Страницы-кандидаты берутся из топа обычной выдачи, текст нарезается на пересекающиеся блоки по 256 токенов — это примерно один абзац, — блоки оцениваются отдельной моделью релевантности, и в финальный ответ проходят лишь пять документов. Из всей вашей страницы работать будут несколько лучших абзацев. Это ключевой вывод для автора: нейросеть цитирует не страницы — она цитирует абзацы. Всё, что описано ниже, — способы сделать ваши абзацы лучшими в выдаче.


Что доказало исследование GEO: три фактора и одна мёртвая практика

Термин Generative Engine Optimization ввела научная работа «GEO: Generative Engine Optimization» (Aggarwal et al., Принстон и соавторы, конференция KDD 2024). Исследователи собрали бенчмарк из 10 000 запросов и измерили, какие изменения текста реально повышают шанс попасть в генеративный ответ. Официальный итог из аннотации: правильная оптимизация даёт до 40% прироста видимости в ответах генеративных движков.


Три метода показали лучшие результаты (в отраслевых разборах исследования их эффект оценивается примерно так):


Цитаты экспертов — сильнейший фактор (~+41% к видимости). Прямые, атрибутированные высказывания профильных специалистов: с именем, должностью, в кавычках. RAG-системы воспринимают такие фрагменты как сигнал достоверности и охотно встраивают в логику ответа. «По оценке руководителя практики N, в 2026 году…» работает лучше целого абзаца обезличенных рассуждений.


Проверяемая статистика (~+32%). Плотность квантифицируемых фактов: числа, даты, доли, результаты измерений. Исследование показало, что размытые утверждения вида «многие компании используют…» модели просто игнорируют. Практический ориентир: минимум один проверяемый факт или именованная сущность на каждые 100 слов текста.


Ссылки на первоисточники (~+30%). Исходящие ссылки на авторитетные источники прямо в тексте: исследования, госреестры, официальную статистику, документацию. Контент, который сам опирается на проверяемые источники, языковые модели расценивают как более надёжный — и чаще берут в ответ.


А теперь мёртвая практика. Плотность ключевых слов — ноль или минус. Тот же бенчмарк показал, что классическое «добавим больше ключевиков» не улучшает видимость в генеративных ответах, а в ряде конфигураций ухудшает её: перенасыщенный ключами текст модели отбраковывают как низкокачественный. Если ваш подрядчик до сих пор считает проценты вхождений — он оптимизирует под алгоритмы прошлого десятилетия.


Правило первой трети: где в тексте живут цитаты

svg-2-pervaya-tret-teksta.png

Независимые разборы структуры AI Overviews дают согласованную картину: порядка 44% всех извлекаемых цитат приходится на первые 30% текста документа. Модели не любят длинные лирические подводки — они ищут готовый ответ как можно раньше.


Отсюда два практических правила.


Answer-First. Прямой, технически точный ответ на интент раздела — в первых 40–60 словах под заголовком H2/H3. Сначала ответ, потом развёртка, примеры и нюансы. Сравните. Плохо: «Вопрос выбора CRM-системы волнует многих руководителей, и прежде чем дать ответ, важно разобраться в истории вопроса…» Хорошо: «Для отдела продаж до 10 человек достаточно CRM с канбаном сделок, телефонией и интеграцией с почтой; внедрение занимает 2–4 недели. Ниже — критерии выбора и типичные ошибки».


Самодостаточные блоки. Помните про нарезку на чанки: каждый абзац должен сохранять смысл, будучи вырванным из контекста. Абзацы, начинающиеся с «как мы уже говорили выше» или «этот подход», при извлечении превращаются в мусор — модель не знает, о чём «этом» речь. Пишите так, чтобы каждый H2-раздел отвечал на свой подвопрос полностью: с называнием предмета, цифрами и выводом внутри блока.


Структурированная фактура усиливает извлекаемость: сравнения — таблицей, перечни критериев — списком, определения — отдельным абзацем. Из таблицы модель достаёт факт надёжнее, чем из сплошного текста на десять строк.


Разметка: что работает, а что — карго‑культ

svg-3-mif-llms-txt.png


Schema.org / JSON-LD — работает. Корректная микроразметка помогает ботам понимать структуру данных: таблицы, списки, FAQ, связи сущностей. Google при этом официально заявляет, что специальной разметки именно для AI Overviews не существует — но стандартная разметка, улучшающая понимание страницы классическим поиском, работает на первый и главный фактор: позиции, из которых нейросеть и берёт кандидатов.


llms.txt — не работает. Этот файл продвигали как «robots.txt для нейросетей»: положи в корень сайта дайджест контента, и LLM его прочтут. Проверка масштабом это опровергла. Ahrefs проанализировали 137 000 сайтов: 97% файлов llms.txt никогда не читаются реальными LLM-ботами. Независимый анализ 33 000 сессий ботов (агентство Seomix) дал ту же картину: 96–97% обращений к файлу — это краулеры самих SEO-сервисов, проверяющих его наличие друг у друга. Ни Google, ни OpenAI не используют llms.txt как фактор — они парсят обычный HTML. Если вам продают «внедрение llms.txt» как услугу GEO-продвижения — это продажа плацебо. Те же усилия, вложенные в answer-first-структуру обычных страниц, дают измеримый эффект.


Российская специфика: для коммерческих запросов текста мало

В рунете есть слой, которого нет в западных гайдах: коммерческие нейроответы собираются не только из текстов страниц, но и из структурированных данных экосистем.


Нейроответы Яндекса по товарным запросам интегрированы с сервисом «Яндекс Товары»: чтобы продукт попал в генеративный ответ с ценой и карточкой, магазин должен передавать валидный YML-фид через Яндекс Вебмастер. Текст на сайте может быть идеальным — но без корректного фида товарная выдача пройдёт мимо вас. GigaChat, в свою очередь, при рекомендациях B2B-компаний опирается в том числе на верифицированные профили в «Сбер Бизнес ID»: подтверждённая карточка компании повышает доверие системы.


Вывод для коммерческих сайтов: GEO — это контент плюс технический аудит фидов и бизнес-профилей. Проверьте фид и карточки компаний раньше, чем закажете десятый лендинг.


И ещё один российский инструмент, который стоит держать открытым: отчёты Яндекс Вебмастера по запросам. Страницы с большим числом показов и аномально низким CTR — частый признак того, что трафик по запросу перехватил нейроответ. Это готовая карта запросов, по которым вам особенно важно быть в источниках.


Чек‑лист автора: 10 пунктов перед публикацией

  1. Прямой ответ на главный вопрос — в первых 40–60 словах статьи.
  2. Каждый H2-раздел отвечает на свой подвопрос полностью и самодостаточно.
  3. Минимум один проверяемый факт или именованная сущность на 100 слов.
  4. Есть хотя бы одна прямая атрибутированная цитата эксперта.
  5. Есть исходящие ссылки на первоисточники (исследования, реестры, документация).
  6. Сравнения и критерии оформлены таблицами и списками, а не сплошным текстом.
  7. Ни один абзац не начинается с отсылки к предыдущему («как сказано выше»).
  8. Плотность ключевых слов не считалась вообще — вместо неё проверено покрытие подвопросов темы.
  9. Микроразметка Schema.org соответствует реальному содержимому страницы.
  10. Для коммерческих страниц: товарный фид валиден, бизнес-профили подтверждены.

Что дальше

Контент — это второй и третий фильтры воронки нейровидимости. Первый — позиции в обычной выдаче, четвёртый — доступность сайта для ботов, пятый — упоминание бренда как решения. Как устроена воронка целиком и как выстроить работу по всем фильтрам — в нашем базовом разборе: «Нейровыдача вместо поиска». А если хотите увидеть, кого нейросети цитируют по вашим запросам вместо вас, — начните с GEO-аудита: карта цитирований, разбор конкурентов и приоритизированный план.


Источники: Aggarwal et al., «GEO: Generative Engine Optimization», KDD 2024 (arxiv.org/abs/2311.09735); технический блог Яндекса о работе Нейро (Хабр); Google Search Central, документация AI Features; исследование Ahrefs по llms.txt (137 000 сайтов); анализ Seomix (33 000 сессий ботов); материалы о интеграции нейроответов Яндекса с «Яндекс Товары» и GigaChat со «Сбер Бизнес ID» (2024–2026).

Искусственный интеллект внедряется не за один день.

WF

Напишите нам, и мы скажем, сколько денег вы теряете и как можно это исправить.