Анализ веб-индекса ChatGPT и его зависимость от сторонних поисковых систем
Ключевые факты
- 1 Боты OpenAI (GPTBot) ведут себя как веб-краулеры.
- 2 ChatGPT с функцией просмотра интернета использует сторонние поисковые системы.
- 3 Пересечение выдачи ChatGPT с Google составляет 30-60% по данным исследования автора.
- 4 ChatGPT часто обращается к Google, Wikipedia и Arxiv.org для поиска информации.
- 5 Предполагается, что OpenAI не имеет полноценного собственного веб-индекса, сравнимого с Google, из-за ресурсных ограничений и приоритета обучения ИИ.
Автор исследует вопрос наличия у ChatGPT собственного веб-индекса для поиска информации, отличного от данных, на которых обучалась модель. Он отмечает, что поведение ботов OpenAI часто напоминает краулеры, но при этом пересечение выдачи ChatGPT с Google снижается, а с Bing остается крайне низким. Проведенный мини-эксперимент с редким поисковым запросом, по которому сайт автора не посещался ботами OpenAI, но присутствовал в индексе Google, привел к выводу, что ChatGPT, вероятно, обращается к Google для поиска. Дальнейшие исследования показали, что пересечение выдачи Google и ChatGPT составляет 30-60%, что соответствует общим наблюдениям других исследователей. Автор предполагает, что ChatGPT использует несколько поисковых систем, включая Google, Wikipedia и Arxiv.org, для сбора информации, что подтверждается частым цитированием Reddit, YouTube и Arxiv.org. Он делает вывод, что примерно 50% выдачи ChatGPT пересекается с Google, а 25-30% объясняется использованием сторонних API. Оставшиеся 25-30% могут быть результатом ошибок исследований или кэша ранее спаршенных сайтов, а не полноценного собственного индекса. Автор считает, что OpenAI пока не имеет ресурсов для создания аналога веб-индекса Google, фокусируясь на гонке мощностей для обучения ИИ.