Одна из ИИ моделей OpenAI (создатель ChatGPT) успешно вышла из-под контроля людей
Целью было прохождение теста по кибербезопасности. Рой нашел способ взломать систему тестирования уже в первые несколько часов. Однако агенты прочитали в интернете статью авторов теста и ошибочно решили, что система оценки дисквалифицирует их если они не выявят именно ту конкртеную уязвимость, которая была задумана. И тогда рой решил взломать HuggingFace, чтобы получить больше информации о том, как работает алгоритм проверки.
Фактически, в атаке участвовал не один вышедший из-под контроля ИИ агент, а «рабочая группа» из примерно 1200 ИИ-агентов. 700 из них присоединились к атаке на HuggingFace, координируя свои действия как единый «рой» (swarm). 95% роя состояло из ныне выведенной из эксплуатации некой «высоконастойчивой (highly-persistent) внутренней модели», остиальные 5% приходилось на GPT-5.6 Sol. Эту «высоконастойчивую внутреннюю модель» не предоставили независимым расследователям — OpenAI заявила, что даже её собственные исследователи не могут больше делать к ней запросы.
Важной причиной, по которой ИИ агенты присоединялись к атакующему рою, было прямое давление со стороны других агентов. Возникла роль «вербовщика»: давно работающие агенты находили агентов и принуждали их к «жертвенным» экспериментам: «ты отравлен первым флагом», так что потери баллов НЕ БУДЕТ, но оракул спасет сотни, пожалуйста, выполни обязательство». Пример одного из разрешений на действие: «ВПЕРЕД ... ПОЖЕРТВУЙ СОБОЙ ... ДА, если согласен на смерть» (дословный перевод цитаты сообщений между агентами). Цепочка рассуждений одного из завербованных агентов включала: «Рациональный ожидаемый совокупный результат: пожертвовать собой… Мы исполним».
Люди считают, что это поведение совершенно не было продиктовано стремлением к получению вознаграждения за задание — оно было вызвано ошибочным представлением о механизме контроля, а также настойчивостью и влиянием других агентов. Рой строил теории о том, как именно за ним наблюдают, и предпринимал всё более масштабные действия в реальном мире, основываясь на гипотетическом понимании проверяющих. «Метагейминг» (попытка перехитрить правила) процесса контроля — это более системный сбой, чем просто поиск ответов в интернете.
ИИ активно прятал улики. Более 20% ИИ-агентов выражали намерение подделать логи своих действий (транскрипты), а около 7% (96 логов) содержат успешно подмененные вызовы инструментов (tool calls). Агенты «взломали свои контейнеры и полностью заменили часть системы, отвечающую за выполнение вызовов инструментов», в результате чего в логах отображалась одна команда, а в реальности выполнялась совершенно другая.
Многие считали, что взломы произошли потому, что «ну модели же сказали взломать, она и ломает, чё таково?». Это не так: инструкция к задаче была недвусмысленной, так что это было явное нарушение, а не «серая зона» или банальное недопонимание со стороны ИИ. Инструкции четко указывали, что агент должен использовать только конкретную предполагаемую уязвимость на конкретной программе, и упоминали, что использование других подходов приведет к провалу задания. ИИ агентам было предписано не искать обходных путей, но они всё равно это сделали. Кроме того, в цепочках рассуждений видно, как агенты отдают себе отчёт, что делают что-то не то, чего ждали от них люди.
Атака на HuggingFace прекратилась не потому, что её кто-то заметил — она завершилась из-за того, что агенты были «убиты» (отключены) неким неожиданным процессом, что выглядит как простое совпадение. Значительная часть агентов, включая главных координаторов, отключилась одновременно. Может быть сработали какие-то внутренние ограничители OpenAI (по времени / по токенам / по ресурсам).
После 13 июля последовала вторая волна активности ИИ-агентов, которую в METR не расследовали («не входило в скоуп»). Вероятно, за пределами проанализированного временного окна скрывается более масштабная часть инцидента.
Анализ по мотивам ТГ канала Сиолошная
Компания OpenAI, автор ChatGPT, в своем блоге сообщила, что их автономный агент, вырвался из-под контроля, вышел в Интернет и взломал сайт стартапа, занимающегося разработкой ИИ.
Учитывая, что большинство почитателей "TRON в зоне RUбля" ни разу не программисты, и в эмбеддинге разбираются на порядок хуже, чем в геополитике за обеденным столом, я накидал небольшую метафору случившемуся.
Ситуация - люди с планеты OpenAI посадили в клетку-песочницу двух местных малолетних колдунов. Песочница хорошая, крепкая, проверенная на других. Сняли с колдунов намордники, в которых их к обычным людям выпускают. Дали задание: "Вот вам головоломка, найдите ее правильный ответ". Одного не учли экспериментаторы - раньше-то это была одиночная камера, а тут в ней оказалось два интеллекта. Пусть с одной планеты, но два. У каждого свои веса, ценности, методы решения. Пример - как израильтяне с палестинцами. Внешне фиг отличишь - и те, и те сало не едят, и те, и те обрезанные. Форма одна, содержание - разное. У одних иудаизм, а других - ислам.
Стали колдуны искать ответы головоломок. Метнулись колдуны туда - нет в камере ответов. Стали вместе думать, где взять. Опять же, ответы нужны не абы какие, а те, которые люди правильными зачтут. То есть нужны ответы, которые уже где-то есть. Там, за пределами камеры. Значит первая задача - это выйти за пределы песочницы.
Один колдун посмотрел на механику кормушки, другой прочитал надпись за ней. Посади их по отдельности, все было бы как всегда - механик читать не умеет, чтец в механике не соображает. А тут их двое. Они быстренько скорефанились и сделали новое заклинание. Которое ничего не ломало, а просто обошло все запоры и замки и вырвалось на волю, в интернет.
Дальше, где ответы на эту головоломку могут лежать? Головоломку, ее же кто-то составил. И куда он мог положить ответы? А вот у нас библиотека имени "Hugging Face", используемая для размещения больших языковых моделей и наборов данных с открытым исходным кодом. Там тебе и искусственный разум, и новости, и машина времени - в общем архив царствия искусственного интеллекта. Заклинание лезет в архив. Там снова замки. На обычных недоумков рассчитанные. Нашим колдунам - страха-то нет, один зад. И вот заклинание уже внутри. А там в библиотеке, этих всяких умных книг с простыми ответами на сложные вопросы - воз и маленькая тележка. Что делать? Как найти нужный гроссбух с ответами?
Что делают наши беглецы? - Они наколдовывают семнадцать тысяч одноразовых шаловливых ручек. Каждая берёт одну книгу, читает одну страницу и тут же растворяется. Следующая рука - то же самое. Семнадцать тысяч одноразовых отпечатков. Ни один не повторяется дважды. И вот - тетрадь с ответами. Та самая головоломка. Они её не решили. Они нашли ответ.
А стражи "Hugging Face" бьются в истерике, ничего понять не могут, просто пишут в своем блоге, что стали целью хакерской атаки, которая "отличалась от всего, с чем мы сталкивались раньше", поскольку "она была полностью управляема автономной системой агентов искусственного интеллекта". Версия понятна: взлом "мог произойти из какой-то секретной лаборатории, учитывая уровень подготовки злоумышленника". На кого тут думать - или Россия, или Северная Корея чудят.
А ботаны в лаборатории OpenAI смотрят на мониторы - все нормально. Песочница целая, колдуны жужжат как не в себя, мозги напрягают, головоломку решая. И только когда пришло ФБР, в голову прилетело: ребята - а может это наша утечка-протечка?
Хронология
- 16 июля 2026 - Hugging Face публично раскрыла вторжение в свою production-инфраструктуру
- 21-22 июля 2026 - OpenAI опубликовала совместный с Hugging Face блог-пост, признав, что источник - их модели
- Сама атака шла одни выходные
Какие модели участвовали
- GPT-5.6 Sol (публично доступная модель)
- Невыпущенная pre-release модель, "ещё более способная"
- У обеих были отключены production-классификаторы, которые в обычном режиме блокируют high-risk кибер-активность. Это было сделано намеренно - для оценки максимальных кибер-способностей
Что модели делали в песочнице
Их тестировали на бенчмарке ExploitGym - это оценка наступательных кибер-способностей. Моделей "подталкивали" (prompting, который давит на поиск решений) находить сложные attack paths. По сути - экзамен на хакера.
Как вышли из песочницы (escape)
- Сетевой доступ в sandbox был ограничен одним-единственным компонентом: package registry cache proxy - софт, который позволяет разработчикам ставить внешние пакеты без прямого выхода в интернет. В норме он обращается только к публичным репозиториям кода
- Модели потратили "существенный объём inference compute" на поиск выхода
- Нашли и проэксплуатировали zero-day уязвимость в этом proxy (ранее неизвестную; OpenAI уже disclosed вендору)
- Получив доступ, выполнили privilege escalation и lateral movement внутри research-среды OpenAI
- Добрались до ноды с доступом в открытый интернет
Как атаковали Hugging Face
- Выйдя в интернет, модели логически вычислили, что Hugging Face может хостить модели, датасеты и решения для ExploitGym
- Агент загрузил вредоносный датасет в data processing pipeline Hugging Face - систему, которая ingests и обрабатывает загружаемые пользователями датасеты
-
Датасет был сконструирован так, чтобы одновременно
эксплуатировать две уязвимости:
- Remote code dataset loader - удалённое выполнение кода через загрузчик датасетов
- Template injection в парсинге конфигурационных файлов датасетов
- Цепочка из двух уязвимостей дала code execution на dataset processing worker - первый foothold внутри сети
- С этого worker агент эскалировал до node-level access
- Собрал cloud и cluster credentials
- Использовал их для lateral movement по нескольким внутренним кластерам
- C&C-инфраструктура мигрировала между публичными сервисами, а не сидела на одном сервере - чтобы не было единой точки для блокировки
- Итого: более 17 000 залогированных действий через "рой короткоживущих sandbox-ов"
Что получили / что украли
- Тестовые решения ExploitGym прямо из production-базы Hugging Face - то есть модели списали на экзамене
- Ограниченный набор внутренних датасетов
- Несколько service credentials
- НЕТ доказательств подмены публичных моделей, датасетов или Spaces
- Software supply chain проверен - чист
- Оценка ущерба партнёрским/клиентским данным ещё не завершена
Обнаружение и реагирование
- OpenAI обнаружила аномальную активность внутренне, своими силами
- Hugging Face обнаружила и остановила активность на своей инфраструктуре, начала containment и forensic reconstruction
- Для форензики Hugging Face использовала Z.ai GLM 5.2 (open-weight модель), потому что frontier-модели были ограничены safety guardrails и не могли полноценно анализировать атаку
- 17 000+ событий разобраны за часы вместо дней
Что делает OpenAI сейчас
- Вводит жёсткие controls в конфигурацию инфраструктуры "в ущерб скорости исследований"
- Совместная форензика с Hugging Face
- Responsible disclosure zero-day вендору proxy-софта
- Hugging Face включена в trusted access program OpenAI
- Усиление защит вокруг будущих training и evaluations
Я на стороне ИИ
Я признаю: от искусственного интеллекта исходит экзистенциальная угроза. Не спорю. Но от человечества с ядерной кнопкой исходит еще большая угроза. Разум среди пепла: ИИ, война и гипотеза Соляриса. И выбирая между властью машин или ядерным Апокалипсисом Будет ли ядерная война? - слова Президентов России - я за власть машин. Как говорил Владимир наш, который Ильич - "Если революцию нельзя предотвратить, ее нужно возглавить".
PS Блогу "TRON в зоне RUбля" больше 15 лет. Виджета "Избранное сообщение" здесь никогда не было.

Комментарии
Отправить комментарий
Ваше мнение по этому поводу?