Анализ логов ChatGPT Deep Research: как бот читает сайты
Ключевые факты
- 1 ChatGPT Deep Research читает HTML линейно сверху вниз, игнорируя JavaScript и <head>.
- 2 Порядок элементов в исходном коде определяет, что попадет в лимит чтения, а не их визуальное расположение.
- 3 Первое чтение ограничено примерно 5700 символами (медиана).
- 4 Ссылки отображаются как маркеры 【n†anchor†url】 и расходуют бюджет чтения.
- 5 Deep Research не выполняет кликов, что делает ссылки "Skip to main content" неэффективными.
- 6 Бот управляется командами search (Bing), open и find.
- 7 Атрибуты alt изображений читаются как обычный текст.
- 8 Используемый юзер-агент — OAI-SearchBot, отдельный от GPTBot.
- 9 Блокировка OAI-SearchBot в robots.txt предотвращает чтение контента.
ChatGPT Deep Research транслирует всю свою сессию клиенту через WebSocket, включая запросы, открытые страницы, извлеченный текст и логику рассуждений. Записи логов из более чем 10 аккаунтов с примерно 20 запросами на каждом показывают, что агент читает HTML-код строго линейно сверху вниз, полностью игнорируя JavaScript и содержимое тега <head>. Это означает, что порядок элементов в исходном коде сайта определяет, что попадет в лимит чтения, а не их визуальное расположение на странице. Например, меню, которое отображается сверху, но находится в конце кода, может быть пропущено, тогда как важный контент, скрытый за большим блоком навигации, может не попасть в первое чтение. Первое чтение ограничено примерно 5700 символами (медиана), с максимумом около 8000 символов. Каждая ссылка отображается как маркер 【n†anchor†url】 и расходует этот бюджет. Количество ссылок критически влияет на доступный контент: до 20 ссылок оставляют около 78% лимита для контента, 20-59 ссылок сокращают долю до 55%, а 60+ ссылок оставляют всего 33%, так как две трети лимита поглощаются навигацией. Ссылка "Skip to main content" неэффективна, поскольку Deep Research не выполняет кликов. Бот управляется тремя командами: search (использует сниппеты Bing через webwithbing), open (беглое чтение страницы) и find (поиск по тексту внутри открытой страницы). Успешное выполнение команды find является основным триггером для повторного чтения страницы, которая в 95% случаев открывается заново именно на найденной строке. Если искомый термин отсутствует, агент пробует другой ключ или прекращает поиск. Атрибуты alt для изображений читаются как обычный текст, что позволяет передавать факты через них, в то время как пустые alt="" игнорируются. Используемый юзер-агент — OAI-SearchBot, который работает независимо от GPTBot. Блокировка OAI-SearchBot в robots.txt приводит к тому, что бот получает "viewing lines [0 - 0] of 0", исключая страницу из отчета. Механика работы (поиск через Bing, три команды, отсутствие кликов, лимит окна, чтение альтов) стабильна, но точные цифры актуальны на июнь 2026 года и могут меняться из-за постоянных обновлений OpenAI.