Как писать текст, чтобы его цитировали нейросети

Как писать текст, чтобы его цитировали нейросети
SEO/GEO

Нейросеть забирает в ответ не страницу целиком, а фрагменты по 200-500 условных единиц текста. В ответ попадает тот фрагмент, который отвечает на вопрос без опоры на соседние абзацы. Отсюда все правила: прямой ответ в начале раздела, заголовки в форме вопросов, самодостаточные абзацы. Текст, написанный сплошным потоком, разваливается при любой нарезке.

Привычная композиция статьи устроена наоборот. Сначала разгон про изменившийся рынок, потом история вопроса, потом определения, и только в середине - ответ. Читатель до него доходил, поисковая система оценивала страницу целиком. Модель оценивает кусок. Кусок, в котором стоит разгон, не содержит ответа и в выдачу не попадает - вместе со всей страницей. Общая картина по направлению разобрана отдельно: что такое GEO и чем оно отличается от SEO. Здесь речь про текст: что менять внутри абзацев.

Как нейросеть выбирает фрагмент страницы для ответа?

Найденную страницу нейросеть режет на фрагменты по 200-500 токенов, переводит каждый в числовое представление, сравнивает с вопросом и забирает в ответ несколько самых близких. Единица отбора - фрагмент, не страница. Поэтому каждый абзац конкурирует за место в ответе отдельно от соседей, а сильная статья со слабо написанным разделом проигрывает по этому разделу.

Схема работы называется RAG. Модель перед ответом обращается к поиску, забирает найденное и строит ответ из полученных кусков, а не только из того, что запомнила при обучении. Токен - минимальная единица, на которые система делит текст; для кириллицы это примерно два-три символа. Фрагмент в 200-500 токенов - это абзац или пара абзацев, не раздел и не страница.

Границами нарезки автор не управляет. Разные модели режут текст по-разному, и предсказать, где пройдет линия разреза в конкретном ответе, нельзя. Единственная защита - писать так, чтобы смысл сохранялся при любом варианте нарезки. Абзац, который читается только вместе с предыдущим, при неудачном разрезе теряет половину содержания.

Однородность фрагмента влияет на отбор. Абзац, в котором смешаны цена, этапы работы и пример из практики, проигрывает трем отдельным абзацам: система не понимает, какое из трех утверждений отвечает на вопрос, и предпочитает конкурента с однородным куском. Рабочий размер абзаца - 300-500 знаков, одна мысль на абзац.

Совпадение слов при этом вторично. Сравниваются смыслы, а не строки, поэтому набивка страницы поисковыми запросами не работает. Фрагмент без утверждения так и остается фрагментом без утверждения, сколько бы вхождений в нем ни стояло.

До нарезки есть еще один шаг. Вопрос пользователя разбивается на подзапросы, по каждому запускается свой поиск, и ответ собирается из фрагментов, найденных по разным подзапросам. Страница, которая закрывает основной вопрос, но молчит про смежный, выпадает из той части ответа. Конкуренция при этом жестче поисковой: на один ответ приходится от двух до семи процитированных доменов вместо десяти ссылок в выдаче.

Чувствительность к структуре у площадок разная. ChatGPT нередко забирает кусок и из сплошного текста без заголовков: разбор идет по смыслу, слабая структура его замедляет, но не останавливает. Блок AI Overviews в поиске Google строже. Туда попадают материалы с четкими разделами и прямыми ответами, а сплошное полотно проигрывает при прочих равных.

Отдельная оговорка: все написанное ниже работает при условии, что страница вообще доступна для разбора. Скрипты, скорость, иерархия документа - это техническая доступность страницы для моделей, отдельный разговор. Здесь про то, что написано внутри блоков.

Для автора это меняет способ письма. Текст перестает быть потоком с завязкой и развязкой и становится набором законченных ответов, соединенных переходами. Каждый такой ответ пишется так, будто читатель начал именно с него.

Путь фрагмента страницы в ответ нейросети Страница сайта Фрагмент 1 определение услуги Фрагмент 2 цена, сроки, пример Фрагмент 3 прямой ответ на вопрос Фрагмент 4: подробности Сопоставление с вопросом каждый фрагмент оценивается сам по себе Ответ нейросети взят фрагмент 1 взят фрагмент 3 ссылка на источник рядом с ответом Фрагмент 2 отброшен: в одном абзаце три темы, ни одна не отвечает на вопрос целиком. Фрагмент 4 отброшен: подробности без предмета, вырванные из контекста страницы.

Что такое капсула ответа и как ее написать?

Капсула ответа - плотный блок на 40-60 слов сразу под заголовком, который отвечает на вопрос заголовка целиком, без опоры на остальной текст. Формат отдает системе готовый кусок нужного размера: он совпадает с типичной длиной фрагмента и не требует достраивания. Страницы с капсулой ответа или кратким итогом в начале цитируются примерно на 22% чаще среднего.

Язык капсулы утвердительный. «Срок индексации нового раздела - две-три недели» вместо «срок индексации может составлять от двух до трех недель в зависимости от ряда факторов». При выборе между двумя одинаково релевантными фрагментами система берет определенный. Оговорки уместны ниже по тексту, в капсуле они снимают весь смысл конструкции.

Основное определение внутри капсулы выделяется жирным. Визуальная граница помогает и человеку, который сканирует страницу, и разбору документа.

Одной капсулы на статью мало. Каждый крупный раздел получает свою: раздел - самостоятельная единица отбора, и открывать его разгоном так же вредно, как открывать разгоном всю страницу.

Чего в капсуле быть не должно: отсылок к остальному тексту, слов «ниже», «выше», «как мы увидим», названия статьи, вступлений о важности темы. Каждый такой оборот превращает самодостаточный кусок в обрывок.

Пример 1. Стоматология, Ташкент.

Было. «Имплантация зубов сегодня стала доступной процедурой, и все больше пациентов задумываются о ней. В нашей клинике мы используем современные материалы и подходим к каждому случаю индивидуально. О стоимости и сроках лечения вам подробно расскажет администратор на консультации.»

Стало. «Имплантация зуба в Ташкенте занимает от трех до шести месяцев и проходит в два этапа: установка импланта, затем коронка после приживления. Цена складывается из системы импланта, материала коронки и объема подготовки, включая наращивание кости. Одноэтапный протокол с нагрузкой сразу возможен при достаточном объеме кости.»

Пример 2. Интернет-магазин техники, Казахстан.

Было. «Выбор робота-пылесоса зависит от множества факторов. Мы собрали для вас подборку моделей, которые представлены в нашем каталоге, и постарались учесть разные бюджеты и потребности покупателей.»

Стало. «Для квартиры с ковровым покрытием подходит робот-пылесос с силой всасывания от 4000 Па и щеткой с резиновыми ламелями. Для гладкого пола хватает 2500 Па. Модели с лидаром строят карту помещения и не пропускают участки, модели с оптическим датчиком дешевле, но чаще ходят по одному месту дважды.»

Пример 3. Бухгалтерское сопровождение, Кыргызстан.

Было. «Бухгалтерский учет - важная часть работы любой компании. Ошибки в отчетности могут привести к неприятным последствиям, поэтому многие предприниматели предпочитают доверить эту задачу профессионалам.»

Стало. «Передача бухгалтерии на аутсорсинг обходится дешевле штатного бухгалтера при обороте до 30 миллионов сомов в год. Порог смещается вверх, если у компании внешнеэкономическая деятельность или больше 20 сотрудников. В стоимость входят ведение учета, сдача отчетности и ответы на запросы налоговой.»

Разница между вариантами не в стиле. В первом нет ни одного утверждения, которое можно вынуть и процитировать: доступная процедура, множество факторов, важная часть работы. Во втором каждый абзац отвечает на конкретный вопрос и стоит отдельно от страницы.

Устройство раздела под извлечение Заголовок-вопрос формулировка совпадает с вопросом пользователя вес при отборе: максимальный Капсула ответа, 40-60 слов утвердительный язык, основное определение выделено жирным вес при отборе: высокий Подробности и условия исключения, оговорки, границы применимости вес при отборе: средний Факт с цифрой и источником проверяемое утверждение, отдельный абзац вес при отборе: высокий Около 40% ответов собираются из первой трети блока, поэтому цифры ставятся выше, а не в финал.

Почему первый абзац важнее остального раздела?

Около 40% ответов чат-ботов собираются из первых 30% блока или статьи. Ценное, отложенное к концу, до ответа не добирается. Система бегло проходит по началу блока, находит там либо утверждение, либо разгон, и во втором случае уходит к конкуренту. Первый абзац раздела - это и есть то место, где решается судьба всей страницы.

Принцип называется «главное вперед» и пришел из военной связи, где сообщение начинается с вывода, а обоснование идет следом. Он работает и для читателя, и для машинного разбора: человек при беглом чтении и языковая модель взвешивают начало и конец тяжелее середины. «Самый рабочий способ снизить стоимость заявки - переписать оффер на посадочной» вместо «за последние годы стоимость заявки в этой нише заметно выросла».

Композиция «сначала вывод, потом подробности» называется перевернутой пирамидой, и она старше любых нейросетей: у нее газетное происхождение. Новое здесь одно - раньше пирамида была вопросом удобства, теперь стала условием попадания в ответ.

Цифры и фактура ставятся вверх блока. Автор по привычке приберегает сильный аргумент к финалу, чтобы закончить эффектно. При сборке ответа финал часто вообще не рассматривается: система уже набрала нужные фрагменты из первой трети.

Типовая композиция статьи противоречит всему перечисленному. Разгон, история вопроса, определения, ответ в середине, вывод в конце. Для поиска она работала: страница оценивалась целиком, поисковые запросы находились где угодно. При отборе фрагментов первая треть текста уходит на то, что не содержит ни одного пригодного утверждения. Треть объема впустую.

Было. «Рынок доставки еды в ОАЭ за последние годы изменился до неузнаваемости. Появились новые игроки, выросла конкуренция, изменились ожидания клиентов. Разберемся, во сколько сегодня обходится привлечение одного заказа и что на это влияет.»

Стало. «Привлечение заказа в доставке еды в ОАЭ стоит дороже, чем в СНГ, в первую очередь из-за цены клика в Google Ads и Meta Ads. Разброс определяется городом, кухней и долей повторных заказов. Сильнее прочего работает доля повторных: она снижает стоимость привлечения по всей когорте, а не по отдельному заказу.»

Что попадает в ответ при двух композициях Привычная композиция Разгон: рынок изменился История вопроса Определения Ответ на вопрос Система смотрит первую треть блока и не находит там утверждения. Композиция под извлечение Ответ на вопрос, 40-60 слов Цифра с источником Условия и исключения Пример и подробности Та же первая треть содержит ответ и проверяемую цифру.

Какими должны быть заголовки в тексте под AI-поиск?

Заголовок повторяет вопрос в той формулировке, в какой его задают вслух или пишут в чат. «Польза зеленого чая» становится «чем полезен зеленый чай при ежедневном употреблении». Ответ собирается по вопросу, и совпадение формулировки заголовка с формулировкой вопроса дает прямое соответствие еще до того, как система дойдет до содержания абзаца.

Вопросы к моделям длиннее поисковых запросов. Средняя длина - около 8 слов против трех-пяти в поисковой строке, а промпты примерно в пять раз длиннее привычных поисковых запросов. Почти всегда есть условия: бюджет, город, срок, состояние дел. «Какой лендинг сделать для стоматологии в Ташкенте при бюджете до 2000 долларов» - нормальная формулировка вопроса, и заголовок может выглядеть так же. Привычка резать заголовок до трех слов ради красоты здесь работает против текста.

Формулировки клиентов расходятся с формулировками компании, и расходятся сильно. Бизнес пишет «комплексное сопровождение бизнеса», клиент спрашивает «кто будет сдавать отчетность, если бухгалтера в штате нет». Заголовок берется со стороны клиента. Правка неприятная: из подзаголовков приходится выкидывать привычные названия услуг и ставить на их место чужую речь, в которой этих названий нет.

Вопросительными становятся не все заголовки. Разумная доля - половина или чуть больше. Страница из сплошных вопросов читается механически, и человек это чувствует раньше, чем машина.

Под заголовком-вопросом идет прямой краткий ответ обычным текстом, дальше подробности. Уровни заголовков идут по убыванию без пропусков, первого уровня на странице один. Это скучная часть, но она держит структуру документа, по которой система понимает границы разделов.

Формулировки вопросов не выдумываются. Три источника: список вопросов из аудита, вопросы клиентов из переписки и уточняющие вопросы, которые пользователь задает модели после первого ответа. Первый источник разобран отдельно - где взять вопросы, по которым к вам приходят. Второй лежит в почте и мессенджерах и стоит недорого: выписать двадцать вопросов из переписки за месяц - работа на час.

Заголовок в форме вопроса дает еще один эффект. Он заставляет автора ответить. Раздел «Особенности настройки» можно наполнить чем угодно, раздел «сколько времени занимает настройка отслеживания конверсий» требует назвать срок.

Проверка раздела на самодостаточность

Самодостаточный фрагмент - законченная мысль, понятная вне контекста страницы, по устройству близкая к краткому изложению научной статьи. Проверка занимает минуту: раздел копируется в отдельное окно, читается заново, и все места, где нужен контекст страницы, помечаются. Не ясен без контекста - переписывается.

Самодостаточность рушат четыре вещи. Местоимение вместо подлежащего: «он настраивается через интерфейс» - кто он. Отсылка «как сказано выше». Нумерация без повтора предмета: «второй способ дешевле» - способ чего. Определение, оставшееся в предыдущем разделе, - термин используется, а объяснение осталось за границей фрагмента.

Повтор предмета кажется избыточным. Человеку, который читает подряд, третье упоминание словосочетания «отслеживание конверсий» в одном разделе режет глаз, и редактор по привычке меняет его на «оно». При извлечении фрагментов повтор превращается в необходимость: правило простое, название предмета стоит в первом предложении каждого раздела.

Формат «вопрос и ответ», где вопрос совпадает с заголовком, разбирается проще прочих. Структура сама себя объясняет: границы куска очевидны, тема куска названа в первой строке, ответ идет следом.

Блок вопросов и ответов в конце страницы работает по той же логике. Каждый вопрос клиента получает прямой ответ на два-три предложения, который читается отдельно от остальных: сроки доставки, условия возврата, совместимость с другим оборудованием. Каждый такой ответ - отдельная возможность попасть в цитату, а не украшение страницы.

По моим наблюдениям за блогом, в ответы попадают два формата: разбор в виде вопросов с ответами и пошаговая инструкция. Общая черта у них одна. Текст изначально разбит на законченные куски, и системе не приходится угадывать границы. Когда материал заранее разложен по фрагментам, попадание в ответ перестает быть лотереей.

Правило переносится со страницы на материал целиком. Статья, в которой смешаны две темы, оставляет систему без ответа на вопрос, что тут цитировать. Она не цитирует ничего и берет конкурента, у которого под каждую тему отведен свой материал. Один материал закрывает одну тему.

Упражнение на пять минут. Возьмите последнюю опубликованную статью, скопируйте из нее один средний раздел в пустой документ и прочитайте так, будто видите текст впервые. Отметьте каждое место, где приходится догадываться. В типичном разделе таких мест набирается от трех до восьми. Половину закрывает замена местоимения на существительное.

Один и тот же фрагмент вне страницы До правки Как мы писали выше, он настраивается через тот же интерфейс. Второй способ дешевле, но требует разметки на всех страницах сайта. Три места требуют контекста страницы. После правки Отслеживание конверсий настраивается через Диспетчер тегов. Способ с ручной разметкой ссылок дешевле, но требует меток на всех страницах сайта. Фрагмент читается отдельно от статьи. Что подсвечено слева Отсылка к предыдущему разделу: при нарезке предыдущего раздела рядом не будет. Местоимение без подлежащего: предмет назван абзацем выше и в кусок не попал. Термин без определения: разметка чего именно, из фрагмента непонятно.

Как давать определения терминов внутри текста

Термин определяется прямо в абзаце, где встретился, а не ссылкой на словарь на другой странице. Определение внутри текста усваивается системой заметно лучше: фрагмент с термином и его расшифровкой самодостаточен, фрагмент со ссылкой на словарь требует перехода, которого при сборке ответа не будет.

Формула определения умещается в одно предложение: термин, категория, отличие. «Капсула ответа - блок текста на 40-60 слов под заголовком, который отвечает на вопрос заголовка целиком». Категория говорит, к какому классу относится предмет, отличие - чем он отличается от соседей по классу. Без категории получается описание, без отличия - тавтология.

Определение ставится при первом упоминании в каждом крупном разделе, а не один раз на статью. Для читателя, идущего подряд, это повтор. Для отбора фрагментов - страховка: раздел, который начинается с термина без расшифровки, теряет смысл при извлечении.

Отдельный словарь терминов в конце статьи работает хуже определений по месту, хотя и не мешает. Он собирает термины в один фрагмент, оторванный от контекста употребления, и при сборке ответа система забирает либо словарь без применения, либо применение без словаря.

Английский термин при первом упоминании сопровождается русским эквивалентом. Не ради чистоты языка: вопросы к моделям задают на обоих языках, и текст, где встречается только одна форма, отвечает на половину формулировок. Дальше по тексту используется одна форма, разнобой размывает предмет.

Таблицы и списки под извлечение фрагментов

Таблицы, пошаговые разделы и блоки вопросов с ответами дают короткий путь к факту. Система получает готовую структуру и не тратит вычисления на восстановление связей из сплошного текста. Особенно это заметно на вопросах с условиями: бюджет, размер, срок, состояние. Там выигрывают точные числа и таблицы, а описательные прилагательные проигрывают.

Сравнение отдается таблицей в разметке страницы, не картинкой и не файлом. Разбор изображения или PDF дороже по вычислениям, и при сборке ответа выберут конкурента, у которого те же данные лежат текстом. Скриншот таблицы из отчета - самый частый способ потерять цитату на ровном месте.

В исследовании Принстона, где термин GEO и появился, три приема дали лучший результат по видимости: добавление статистики, ссылки на источники, цитаты специалистов. Прирост до 30-40% измерялся на наборе из 10 000 запросов по девяти тематическим наборам данных. Цифра относится к условиям того эксперимента, а не к произвольному сайту, и это стоит держать в голове при переносе на свой текст.

В наборе цитируемого материала повторяется одно и то же: подзаголовки-вопросы, проверяемые цифры, цитаты специалистов с именем и должностью, самодостаточные фрагменты, регулярное обновление. Разметка страницы усиливает этот набор - как именно, разобрано в материале про разметку, которая усиливает структуру текста. Формат сравнений и подборок заслуживает отдельного разбора: формат подборок и сравнений.

Списки вредят в одном случае - когда заменяют объяснение. Четыре пункта по одному слову вместо связного абзаца: «скорость», «удобство», «цена», «поддержка». Извлекать из такого нечего, утверждения там нет. Пункт списка работает, когда внутри него законченная мысль на строку или две.

Что мешает тексту попасть в ответ нейросети?

Поисковая система вознаграждала структуру, ссылки и накопленный вес домена. Когда систему просят собрать ответ, она отбирает по точности, ясности и доверию, а текст, написанный ради позиций, пропускает целиком. Дальше - то, что выбрасывает страницу из ответа при формально правильной оптимизации.

  • Неуверенные формулировки. «Может быть», «в некоторых случаях», «обычно принято». При выборе между двумя фрагментами берут определенный. Оговорка нужна там, где она несет содержание, и вредна там, где заменяет позицию автора
  • Разгон в начале блока. Абзацы про важность темы и изменившийся рынок не содержат ни одного извлекаемого утверждения и занимают ту самую первую треть
  • Размытые тезисы. Утверждение без числа, срока и условия не проверяется и не цитируется. «Быстрая доставка» против «доставка по Алматы за четыре часа»
  • Смешанные абзацы. Несколько тем в одном месте портят фрагмент: система предпочитает однородные куски и при прочих равных берет конкурента
  • Устаревшее содержание. Обновляемые материалы отбираются охотнее, дата последнего изменения учитывается. Статья двухлетней давности с актуальными фактами проигрывает свежей с теми же фактами
  • Текст, сгенерированный без проверки специалистом. Публикация черновиков модели без экспертной правки роняет качество домена, а заодно собирает нецелевую аудиторию: посетители приходят, совпадения с предложением нет

Есть и обратная ошибка, менее заметная. Мысль высказана один раз, в одном месте, одной формулировкой. При нарезке она попадает ровно в один фрагмент, и если фрагмент проиграл по близости к вопросу, утверждение потеряно вместе с ним. Основная мысль статьи повторяется разными словами в разных частях текста - так у нее несколько шансов вместо одного.

Отдельно про последний пункт. Тонкая страница с общеизвестными фактами не попадает в ответ по простой причине: те же факты система сгенерирует сама, обращаться к источнику незачем. Цитируют то, чего в модели нет - собственные цифры, наблюдения из практики, разбор частного случая.

Правила из этого текста применяются к новой статье за один подход. Сложность начинается на архиве: сотня опубликованных материалов, каждый со своей структурой, и решение по каждому - переписывать, дополнять или оставить. Порядок работы с архивом разобран отдельно: как переработать уже опубликованные материалы. Если объем не тянется своими силами, этим занимается перестройка контента под цитирование в HITZ Agency - GEO-агентство в Центральной Азии.

Коротко

  • Отбор идет по фрагментам в 200-500 токенов, а не по страницам: каждый абзац оценивается отдельно от соседних
  • Капсула ответа на 40-60 слов сразу под заголовком дает системе готовый кусок нужного размера, прирост цитирования у таких страниц - около 22% к среднему
  • Первая треть блока приносит около 40% ответов, поэтому цифры и выводы ставятся вверх, а не приберегаются к финалу
  • Половина заголовков формулируется как вопрос пользователя целиком, включая условия: город, бюджет, срок
  • Самодостаточность проверяется копированием раздела в пустой документ: предмет назван в первом предложении, отсылок к соседним разделам нет
  • Из текста убираются разгон, оговорки без содержания, смешанные абзацы и утверждения без числа

Частые вопросы

Как писать статьи, чтобы их цитировал ChatGPT?

Статья пишется как набор самодостаточных ответов. Каждый раздел открывается прямым ответом на свой заголовок в 40-60 слов, заголовки формулируются вопросами пользователя, предмет называется в первом предложении раздела. Цифры и проверяемые утверждения ставятся в первую треть блока. Сплошной поток с ответом в середине при нарезке на фрагменты разваливается.

Какой длины должен быть абзац для AI-поиска?

Рабочий размер абзаца - 300-500 знаков, одна мысль на абзац. Фрагменты, которыми оперирует система, составляют 200-500 токенов, для кириллицы это примерно абзац или пара абзацев. Абзац, где смешаны цена, сроки и пример, проигрывает трем отдельным абзацам: однородный кусок отбирается охотнее смешанного.

Что такое капсула ответа в статье?

Капсула ответа - плотный блок текста на 40-60 слов, который закрывает вопрос своего заголовка и читается отдельно от страницы. Язык утвердительный, основное определение выделено жирным, отсылок к соседним разделам нет. Страницы, где такой блок или краткий итог стоит в начале, цитируются примерно на 22% чаще среднего.

Нужно ли делать заголовки вопросами?

Вопросами формулируется половина заголовков или чуть больше. Ответ собирается по вопросу пользователя, и совпадение формулировки заголовка с вопросом дает прямое соответствие. Средняя длина вопроса к модели - около 8 слов, поэтому заголовок может быть длиннее принятого в SEO и содержать условия. Страница из сплошных вопросов читается механически.

Помогает ли раздел с вопросами и ответами попасть в AI-ответы?

Блок вопросов и ответов разбирается проще прочих форматов: границы фрагмента очевидны, тема названа в первой строке, ответ идет следом. Каждый ответ пишется на два-три предложения и читается отдельно от соседних. Работает при условии, что вопросы взяты из переписки с клиентами, а не придуманы для объема.

Влияет ли объем статьи на цитирование нейросетями?

Объем сам по себе не влияет: отбор идет по фрагментам, а не по длине страницы. Длинный текст дает больше фрагментов-кандидатов, но и больше мест, где структура рассыпается. В моей практике расширение материала с тысячи слов до трех тысяч сработало за счет разбивки, а не объема: после переработки статья попала в блок AI Overviews в поиске Google и в карточку со ссылкой и заголовком сбоку. Материал на 2000 слов с самодостаточными разделами обходит материал на 8000 слов сплошным потоком.

Об авторе

Марат Аксанов, performance‑маркетолог. 12 лет в маркетинге и медиа.

Сертифицированный специалист DV360, Google Ads и Google Analytics.

Заказать аудит вашего проекта или консультацию:

Марат Аксанов, performance-маркетолог