Сегодня 19 марта 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сборщики данных для ИИ оказались виновниками массового замедления сайтов по всему интернету

Платформа Git-хостинга открытых проектов SourceHut заявила, что работа её сервисов замедлилась из-за веб-сканеров, которые запускают компании — разработчики систем искусственного интеллекта. Похожие жалобы всё чаще поступают и от владельцев других ресурсов.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Чтобы ограничить трафик от ИИ-ботов, SourceHut пришлось развернуть Nepenthes — средство защиты от недобросовестно работающих веб-сканеров, собирающих данные для обучения моделей ИИ. Администрация платформы в одностороннем порядке целиком заблокировала диапазоны адресов нескольких облачных провайдеров, в том числе Google Cloud и Microsoft Azure, из-за чрезмерных объёмов трафика от развёрнутых в их сетях ботов. Владельцам добросовестно работающих сервисов на этих инфраструктурах рекомендовали связываться с администрацией SourceHut в индивидуальном порядке, чтобы добавлять их в исключения. В 2022 году SourceHut также пострадала из-за слишком частых обращений к её ресурсам от службы Google Go Module Mirror.

В 2023 году OpenAI заверила, что её боты будут выполнять директивы из файлов robots.txt, указывающих правила обработки данных с сайтов веб-сканерами. Аналогичные обязательства взяли на себя и другие разработчики ИИ, но жалобы на злоупотребления продолжают поступать. Летом минувшего года сайт iFixit, в частности, подвергся нашествию со стороны бота Anthropic Claudebot. В декабре хостер Vercel сообщил о значительном присутствии ИИ-сканеров в его инфраструктуре: OpenAI GPTbot отправил в его сеть 569 млн запросов, Anthropic Claude — 370 млн. В совокупности они достигли около 20 % от 4,5 млрд запросов Googlebot, который используется для индексации ресурсов в Google.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Тогда же разработчик распределённой соцсети Diaspora Деннис Шуберт (Dennis Schubert) пожаловался, что за предшествующие 60 дней на ИИ-ботов пришлись 70 % трафика на его сервер. Публикация обрела вирусную популярность, и активность ИИ-сканеров резко сократилась; однако сетевые хулиганы устроили на его ресурс массовое нашествие запросов от клиентов со значением строки user-agent, совпадающим с OpenAI GPTbot. Вот только настоящий ИИ-бот OpenAI отправляет запросы из инфраструктуры Microsoft Azure, а в случае с сервером Diaspora они исходили с адресов AWS и даже от американских интернет-провайдеров.

Иногда ситуация осложняется тем, что некоторые боты имеют несколько предназначений. Так, Meta AI bot и AppleBot собирают данные исключительно для обучения ИИ, тогда как GoogleBot служит и для ИИ, и для индексации в поиске. Чтобы избежать путаницы, Google в 2023 году добавила отдельное значение Google-Extended для инструментов обучения ИИ.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Критики вынесли вердикт Assassin’s Creed Shadows — первые оценки самого важного релиза Ubisoft последних лет 2 ч.
Blizzard Arcade Collection и Atomfall скоро появятся в Game Pass, а сразу четыре Yakuza из подписки удалят 3 ч.
Российская система контролируемого обмена файлами Filestone MFT получила крупное обновление 4 ч.
Cloud.ru запустил платформу Evolution Stack для создания частных и гибридных облаков 5 ч.
«Да, оно того стоило»: бесплатный пролог «Карантин» к Pathologic 3 дебютировал в Steam с рейтингом 92 % 5 ч.
Ремейк Resident Evil 3 без предупреждения вышел на iPhone 16, iPhone 15 Pro, iPad и Mac 6 ч.
ИИ сравняется с людьми в любой задаче через десять лет, уверен глава Google DeepMind 6 ч.
ИИ-модели Llama скачали более миллиарда раз, похвастался Марк Цукерберг 7 ч.
Сотни знаменитостей подписали открытое письмо с требованием запретить «свободу обучения» ИИ 7 ч.
Apple не смогла отбиться от немецких антимонопольщиков — они теперь смогут требовать поменять App Store 7 ч.
Образцы с обратной стороны Луны подтвердили, что когда-то там был сплошной океан магмы 6 мин.
Новая статья: Обзор MSI MEG Z890 Ace: высококлассная плата почти без излишеств 45 мин.
Dell представила сервер PowerEdge XE8712 на базе NVIDIA GB200 NVL4 2 ч.
Nvidia представила видеокарты с 96 Гбайт GDDR7 — профессиональные RTX Pro Blackwell для серверов, ПК и ноутбуков 2 ч.
Интегрированная фотоника и СЖО: NVIDIA анонсировала 800G-коммутаторы Spectrum-X и Quantum-X 2 ч.
Nvidia создаст исследовательский центр для ускорения пришествия квантовых вычислений 2 ч.
Nvidia представила персональный ИИ-суперкомпьютер DGX Station и рабочую станцию DGX Spark на суперчипах Grace Blackwell 2 ч.
«ДАТАРК» запустил тест-драйв российской системы мониторинга и управления ЦОД DATCHECK 5 ч.
Швейцарский стартап научит Microsoft создавать ИИ на цифровых двойниках мозга насекомых, животных и людей 5 ч.
Создание частной космической станции Starlab дошло до «полномасштабной разработки» — запуск запланирован на 2028 год 5 ч.