Девять карточек с параметрами. Две — про конкретный сорт
Продукт и цифровое присутствие · обход 58 доменов
Агроном знает название сорта — услышал на дне поля, увидел в чужом севообороте, прочитал в реестре. Он вбивает название и хочет одного: страницу, где написано, что это за сорт и на что он способен. Карточки товара с параметрами в сегменте есть. Страниц, привязанных к имени конкретного гибрида, почти нет.

Показать данные текстом
Поправка к первой редакции
Первая версия этого материала утверждала, что карточка продукта есть у двух сайтов из 58. Это было неверно: под одно определение я свёл результаты двух разных детекторов, у которых разные предметы измерения. Замечание пришло от внешнего рецензента, проверено по исходным выгрузкам и подтвердилось.
Текст ниже переписан. Числа не «уточнены» — изменился вывод.
Что именно мерили
Обход 58 доменов сегмента «семена», слои 3 и 4 банка данных, 10–13 сентября 2026 года. У пяти доменов обход прервался по таймауту.
Состав выборки по продуктовым группам: полевые культуры — 29 доменов, овощи и цветы — 11, кукуруза и подсолнечник — 10, масличные и технические — 7, сахарная свёкла — 1.
В банке работают два независимых детектора, и путать их нельзя.

Показать данные текстом
| Детектор | Что ищет и что считает |
|---|---|
| Карточки товара | Ищет страницы товара на домене, до тридцати на сайт. На каждой считает пары «параметр — значение». Итог по домену — максимум пар на одной карточке. |
| Карточка сорта | Ищет страницу, посвящённую конкретному гибриду или сорту, с не менее чем двумя парами параметров. Итог по домену — один из трёх исходов: найдена, продукт упомянут без неё, продукт не найден. |
Слой 4 банка данных, два отдельных файла выгрузки. Первый отвечает на вопрос «есть ли на сайте описанные товары». Второй — на вопрос «найдёт ли покупатель страницу того сорта, название которого он знает».
Что нашёл первый детектор: воронка на 58 доменов

Показать данные текстом

Показать данные текстом
| Ступень | Доменов |
|---|---|
| Всего в выборке | 58 |
| Карточки товара найдены и обойдены | 31 |
| Из них: хотя бы одна пара «параметр — значение» | 12 |
| Из них: две и более пары | 9 |
| Ноль пар при найденных карточках | 19 |
Обход 58 доменов, слой 4, детектор карточек товара. У каждого домена обходилось не больше тридцати страниц продукции.
У 27 доменов карточек товара не нашлось вовсе. Из них у 23 обход завершился штатно — значит страниц товара действительно нет; у четырёх обход оборвался, и за них мы не отвечаем.
Девятнадцать доменов — отдельный случай. Карточки у них есть, они обойдены, и на них ноль пар параметров. Страницы существуют, индексируются, занимают место в карте сайта и не содержат данных. Читателю нечего прочитать, машине нечего забрать.
Что нашёл второй детектор: имя сорта

Показать данные текстом
| Исход | Доменов |
|---|---|
| Карточка конкретного сорта найдена | 2 |
| Продукт упомянут, отдельной карточки под него нет | 48 |
| Названий продукции детектор не нашёл | 8 |
Слой 4, детектор карточки сорта. Работает по всем 58 доменам: он ищет упоминание продукта и страницу под него, и таймаут обхода слоёв 3–4 ему не мешает.
Главное расхождение
Девять доменов имеют карточку товара с двумя и более параметрами. Только у двух карточка привязана к конкретному сорту так, что детектор её опознал. Пересечение двух множеств — один домен.

Показать данные текстом
Расхождение идёт в обе стороны, и это стоит назвать прямо. Из двух найденных карточек сорта в пересечение попала та, где вместо значений стоят прочерки. У второй — со значениями «урожайность 88» и «срок 150–160» — детектор карточек товара насчитал ноль пар: он обошёл две страницы каталога этого домена и до нужной не дошёл.
Ни один из двух детекторов не описывает сайт целиком. Они читают разные страницы одного и того же ресурса, и именно поэтому их результаты нельзя складывать в одно число — что и было ошибкой первой редакции.
Почему это важнее, чем «у всех плохие сайты»
Данные у компаний есть. Детектор их нашёл — местами в изрядном количестве: один сайт описывает товар двумястами тридцатью семью парами «параметр — значение». Второй результат — 27 пар, третий — 13.

Показать данные текстом
Проблема не в отсутствии данных, а в адресации. Покупатель приходит с именем сорта. Страница, которая по этому имени открывается, либо не существует, либо не содержит параметров.
И отдельно про две найденные карточки сорта. У одной из двух в полях параметров стоят прочерки: поле «срок» есть, значение — тире; поле «урожайность» есть, значение — тире. Формально критерий выполнен — две пары найдены. Фактически покупатель не узнаёт ничего.
Это ограничение детектора, и его надо называть: он считает поля, а не заполненность. Значит «две карточки сорта» — верхняя граница, а не точное число.
Каталог есть. Карточки сорта в нём нет
Отдельный раздел «Каталог» или «Продукция» обнаружен у 37 доменов из 53 обойдённых.

Показать данные текстом
| Есть раздел каталога | Что с карточкой сорта | Доменов |
|---|---|---|
| да | карточка найдена | 2 |
| да | продукт упомянут, карточки нет | 33 |
| да | названий продукции не найдено | 2 |
Знаменатель 53 — домены с завершённым обходом слоёв 3 и 4. У пяти доменов обход прервался по таймауту, их значения не учитывались.
Тридцать три сайта имеют каталог, внутри которого нет ни одной страницы конкретного сорта.
Ещё пять сайтов из 53 отдают каталог только в PDF. Шестой такой сайт есть, но его обход оборвался, и мы его не считаем.
Поправка про PDF. В первой редакции было сказано, что PDF-каталог не может быть приведён как источник ни поисковой системой, ни языковой моделью. Это неверно: PDF индексируется, у файла есть собственный адрес. Верно другое и более узкое: у отдельной страницы внутри файла адреса нет, поэтому по названию конкретного сорта посадочной страницы не получится, а обновление карточки требует перевыпуска всего файла.
Чем это кончается в ответе машины
В 14 013 ответах языковых моделей о компаниях сегмента ссылки на собственные сайты этих компаний составили 5,6 % цитирований, а на реестры юридических лиц — 14,0 %. Когда покупатель спрашивал не про компанию по имени, а про категорию и регион, конкретная компания появлялась в ответе в 7,8 % случаев.
Связь между этими наблюдениями и состоянием карточек — гипотеза, а не измеренная зависимость. Мы не ставили эксперимент: не добавляли карточки и не смотрели, изменилась ли доля цитирований. Утверждать причинность на двух независимых наборах наблюдений нельзя, и в первой редакции я это утверждал зря.
Что можно сказать без натяжки: модель приводит как источник то, что нашла по адресу. Страница сорта с параметрами — очевидный кандидат в такие источники, и в сегменте её почти нет.
Технический фон

Показать данные текстом
| Признак | Значение | Знаменатель |
|---|---|---|
| Битые ссылки найдены | 22 | 53 |
| Цепочки переадресаций | 6 | 53 |
| Канонический адрес корректен на всех проверенных страницах | 25 | 53 |
| Канонический адрес некорректен | 3 | 53 |
| Признак не измерялся | 25 | 53 |
Слой 3 банка данных, знаменатель 53. «Признак не измерялся» — строки, где обход не дошёл до проверки канонических адресов.
Блок характеристик текстом в HTML найден у 24 доменов из 53. Таблиц в тексте нет вообще у 40 из 53. Микроразметка товара подтверждена у 7 доменов из 53.
У одного домена 29 страниц закрыты от индексации служебным тегом. Осознанное это решение или забытая настройка — со стороны не различить, и мы не берёмся.
Как выглядит карточка сорта, которой почти ни у кого нет
Свой адрес
Одна страница — один сорт или гибрид. Адрес человекочитаемый и постоянный, не меняющийся при пересборке каталога. Это первое и главное: девять сайтов уже имеют параметры, но не имеют адреса, который открывается по имени сорта.
Параметры парами, текстом в HTML
Культура, группа созревания, срок вегетации в днях, потенциальная урожайность с указанием условий замера, норма высева, устойчивость к конкретным болезням и гербицидам, регионы допуска.
Значения вместо прочерков
Поле без значения хуже отсутствующего поля: оно показывает, что данные есть, но вам их не дали.
Ссылка в государственный реестр
Номер в реестре селекционных достижений и прямая ссылка на запись. Покупатель всё равно пойдёт проверять — лучше дать ссылку самому.
Микроразметка товара
В сегменте подтверждена у 7 доменов из 53.
Чего этот обход не доказывает
Не доказывает, что у компаний нет данных о сортах. Наоборот: у девяти доменов параметры найдены, а у одного их больше двухсот на карточку. Замер говорит о том, где эти данные лежат, а не о том, есть ли они.
Не доказывает, что карточка продаёт. Связь между карточкой и сделкой в этом замере не исследовалась.
Не доказывает причинности с ответами моделей. Два набора наблюдений сопоставлены, эксперимент не ставился.
Детектор карточки сорта считает поля, а не заполненность. Один из двух положительных случаев содержит прочерки вместо значений. Поэтому «две» — верхняя граница.
Отрицательные случаи вручную не перепроверялись. Страницы на JavaScript, нестандартные шаблоны и таблицы детектор мог не распознать. Правильная формулировка результата — «не распознано этим способом», а не «отсутствует».
Ограничение обхода. У каждого домена обходилось не больше тридцати страниц продукции. Для больших каталогов это выборка.
Пять доменов из 58 не обойдены полностью в слоях 3 и 4. Они войдут в январский срез.
Частые вопросы
Сколько сайтов имеют карточку товара с параметрами?
Девять из тридцати одного домена, у которых карточки товара нашлись и были обойдены. Ещё у трёх найдена одна пара параметров, у девятнадцати — ноль. У двадцати семи доменов карточек товара не обнаружено вовсе.
Сколько сайтов имеют карточку конкретного сорта?
Два из 58 по отдельному детектору, причём у одного из двух значения параметров — прочерки. Это верхняя граница, а не точное число: детектор считает поля, а не заполненность.
Почему два детектора дают разные ответы?
Они измеряют разное. Первый спрашивает «есть ли на сайте описанные товары», второй — «найдёт ли покупатель страницу сорта, название которого он знает». Пересечение множеств — один домен.
Почему каталог в PDF хуже страницы?
У отдельной страницы внутри файла нет собственного адреса: по названию сорта на неё не попасть, а обновление требует перевыпуска всего файла. Сам PDF при этом индексируется и может быть приведён как источник — универсальный запрет был бы неверен.
Сколько параметров должно быть на карточке?
Универсального числа нет. Медиана максимума среди тех двенадцати, у кого параметры есть, — пять с половиной пар, лучший результат — 237. Разумный минимум: культура, группа созревания, срок вегетации, урожайность с условиями замера, норма высева, устойчивости, регионы допуска.
Что делать, если данных по сорту действительно мало?
Публиковать то, что есть, и прямо помечать, чего нет. Пустое поле с прочерком читается хуже, чем честная строка «испытания в этом регионе не проводились».
Источники
Собственный замер сегмента «семена», слои 3 и 4 банка данных: 58 доменов, обход 10–13 сентября 2026 года, закрытие банка 13 сентября, сверка ключа 14 сентября. Два детектора: карточки товара и карточка сорта. Значения по каждому домену — в приложенных выгрузках, контрольные суммы SHA-256 приложены к каждому файлу.
Слой 6 того же банка: 14 013 содержательных ответов четырёх языковых моделей в двух режимах, 18 664 цитирования источников.
Государственный реестр селекционных достижений, допущенных к использованию.
Замер и разбор — Webformula. Полная версия с исходными выгрузками и методикой — на сайте Webformula.
