Непостоянство результатов поиска ChatGPT: исследование Грина и Моханадасана
Ключевые факты
- 1 ChatGPT использует скрытые и непредсказуемо переключающиеся retrieval-пайплайны (Labrador, Bright, Oxylabs).
- 2 Один и тот же запрос может давать разные источники информации в разное время.
- 3 В 11.6% случаев источник поиска менялся между запусками, снижая пересечение URL на ~45% и доменов на ~42%.
- 4 Попадание в контекст не гарантирует цитирование или упоминание бренда.
- 5 Для оценки видимости в ChatGPT необходимы многонедельные наблюдения, а не единичные проверки.
Крис Грин и Суганта Моханадасан провели масштабное исследование, прогнав 1000 промптов по 10 раз каждый, что составило 9946 сессий. Они обнаружили, что ChatGPT использует несколько внутренних retrieval-пайплайнов, таких как Labrador, Bright и Oxylabs, которые переключаются непредсказуемым образом. Это приводит к тому, что для одного и того же запроса источник поиска может меняться между запусками. В 11.6% случаев источник поиска менялся, при этом пересечение URL-адресов падало примерно на 45%, а доменов — примерно на 42%. Это означает, что один и тот же запрос, сделанный сегодня и завтра, может дать совершенно разный набор процитированных страниц, даже если ваш контент не менялся. Важно также понимать, что попадание в контекст (fetched) не равно цитированию (cited) и тем более не равно упоминанию бренда (mentioned). ChatGPT чаще цитирует страницы вендоров для собственных фактов (цены, характеристики), а рекомендации (например, «что лучше купить») чаще основываются на сторонних источниках. Вывод исследования заключается в том, что одна проверка видимости в ChatGPT не имеет большого значения, так как завтра запрос может дать другой результат из-за ротации внутренних пайплайнов. Для получения достоверных выводов о видимости контента в ответах ChatGPT требуется наблюдение в течение нескольких недель, а не по результатам одного запуска.