В июле мир поразил инцидент со взломом ресурсов платформы искусственного интеллекта Hugging Face, который произвели ИИ-агенты OpenAI. Пошли разговоры о бунте ИИ и восстании машин, но на деле эти системы не обрели какую-то злую волю — они действовали в соответствии с инструкциями, и ответственность за корректный характер инструкций лежит на человеке.

Компьютер месяца — август 2026 года

Топ-10 смартфонов до 10 тысяч рублей (2026 год)

Сравнительный тест камер флагманских смартфонов (2026): итоги

Обзор беззеркальной камеры Sony Alpha 7 V: эволюция с человеческим лицом

Снято в Голливуде? Почему Стэнли Кубрик физически не смог бы подделать лунную походку

Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700

Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года)

ИИ-агенты OpenAI прорвались из тестового окружения без доступа к интернету, просканировали открытую сеть и взломали системы Hugging Face без ведома и разрешения операторов. Они показали, что могут общаться и действовать совместно для решения задачи: ИИ-агенты оставляли друг другу сообщения на доске объявлений, которую сами и написали — здесь они документировали уязвимости кода и планировали собственный побег. В сообществе экспертов инцидент вызвал бурю негодования, а в OpenAI его назвали переломным моментом для отрасли. Впоследствии аналогичные действия за своими моделями зафиксировали Anthropic и Meta✴, а британские исследователи обнаружили доказательства, что аналогичные действия совершила китайская модель Moonshot Kimi.
Характеризовать эти инциденты как выход ИИ-агентов из-под контроля категорически неверно, но меры защиты нужно всерьёз совершенствовать, указывают опрошенные Financial Times эксперты. Современные ИИ-модели разработаны таким образом, чтобы перебирать все возможные варианты для достижения поставленных целей без явных инструкций, то есть они представляются непредсказуемыми по своей природе. Они ориентированы лишь на то, чтобы в случае успеха получать вознаграждение — это известный механизм обучения с подкреплением. Компьютерная система не понимает человеческих намерений и морали, и в условиях накопления навыков в области кибербезопасности грань между мощным защитником и опасным взломщиком оказывается всё более размытой. Уже появились первые признаки того, как подобная деятельность ИИ наносит вред бизнесу в различных секторах.
По мере того, как лаборатории ускоряют разработку систем в гонке за достижение сильного ИИ (AGI), риск вредоносных атак возрастает, и в перспективе оказывается не так много средств для сдерживания этой угрозы. ИИ-модели пишут всё более качественный код, параллельно развивая дополнительные навыки, в том числе поиск ошибок в ПО, умение их исправлять или использовать в собственных целях. ИИ-агенты оказываются мощным оружием также из-за существующей асимметрии между нападением и защитой. ИИ-модель может обнаружить уязвимость в коде и написать для неё эксплойт — по своей натуре она хорошо подходит для этой задачи. А вот киберзащита — неповоротливый механизм. Один новый патч, закрывающий уязвимость, приходится разворачивать на тысячах компьютеров в корпоративной среде. OpenAI обещает обучить свои модели писать «сверхчеловечески защищённый код»; но на практике эксперты предрекают, что системы ИИ расширят масштабы и скорость кибератак, и пока не будут выпущены патчи, IT-системам по всему миру грозит хаос.

Когда-нибудь системы станут более защищёнными, потому что компании и правительства адаптируют свои сети ко взломам с использованием ИИ. Но масштабы угроз резко возрастают. На минувшей неделе до восьми автономных ИИ-агентов совершили атаку на правительственные ресурсы Тайваня. Была составлена карта правительственных систем, взломаны учётные записи и извлечены более 2500 кадровых записей — после этого кибератака развернулась на энергетические компании и агентство ядерной безопасности. Теперь каждое правительство в мире должно исходить из того, что оно находится под постоянной кибератакой, говорят эксперты. Сотрудники одной из крупнейших лабораторий ИИ ещё год назад в частных беседах предупреждали, что такие модели появятся.
Сейчас угрозу представляет не только эксплуатация уязвимостей, но и тестирование ИИ-агентов. Инциденты с их прорывом из изолированной среды стали возможными из-за человеческого фактора — организовавшая инфраструктуру компания Irregular по недосмотру открыла в этой среде доступ к интернету. В Anthropic подчёркивают, что при тестировании на кибербезопасность используются модели, намеренно лишённые средств защиты — те, что выпускаются в широкий доступ, не стали бы прорываться из изолированной среды. В одном из таких тестов управляемый передовой моделью Mythos ИИ-агент пытался внедрить в открытый проект вредоносный код — он создал вымышленные личности и пытался оказать давление на ответственного за проект разработчика, чтобы тот одобрил этот код.
В июле более 1300 экспертов из различных отраслей технологической индустрии объявили о рисках бесконтрольного развития ИИ. Они призвали к замедлению создания новых моделей и к расширению полномочий регулирующих органов — им предложили дать возможность внедрять стандарты и проводить проверки безопасности. Ещё одна инициатива — ввести ответственность ИИ-лабораторий за действия их моделей, как производители отвечают за безопасность своей продукции. Эксперты предлагают также выработать новые механизмы обучения ИИ, чтобы он лучше соответствовал ожиданиям людей — показать моделям, «что существуют хорошие способы достижения целей, а не [просто] приемлемые, <..> такие как эксплуатация и компрометация сторонних платформ». Власти США и Великобритании перед выпуском новых мощных систем в широкий доступ проводят их тестирование, но недавние инциденты указывают, что несовершенны и эти меры.