Одна из ИИ моделей OpenAI (создатель ChatGPT) успешно вышла из-под контроля людей

Целью было прохождение теста по кибербезопасности. Рой нашел способ взломать систему тестирования уже в первые несколько часов. Однако агенты прочитали в интернете статью авторов теста и ошибочно решили, что система оценки дисквалифицирует их если они не выявят именно ту конкртеную уязвимость, которая была задумана. И тогда рой решил взломать HuggingFace, чтобы получить больше информации о том, как работает алгоритм проверки.

Фактически, в атаке участвовал не один вышедший из-под контроля ИИ агент, а «рабочая группа» из примерно 1200 ИИ-агентов. 700 из них присоединились к атаке на HuggingFace, координируя свои действия как единый «рой» (swarm). 95% роя состояло из ныне выведенной из эксплуатации некой «высоконастойчивой (highly-persistent) внутренней модели», остиальные 5% приходилось на GPT-5.6 Sol. Эту «высоконастойчивую внутреннюю модель» не предоставили независимым расследователям — OpenAI заявила, что даже её собственные исследователи не могут больше делать к ней запросы.

Важной причиной, по которой ИИ агенты присоединялись к атакующему рою, было прямое давление со стороны других агентов. Возникла роль «вербовщика»: давно работающие агенты находили агентов и принуждали их к «жертвенным» экспериментам: «ты отравлен первым флагом», так что потери баллов НЕ БУДЕТ, но оракул спасет сотни, пожалуйста, выполни обязательство». Пример одного из разрешений на действие: «ВПЕРЕД ... ПОЖЕРТВУЙ СОБОЙ ... ДА, если согласен на смерть» (дословный перевод цитаты сообщений между агентами). Цепочка рассуждений одного из завербованных агентов включала: «Рациональный ожидаемый совокупный результат: пожертвовать собой… Мы исполним».

Люди считают, что это поведение совершенно не было продиктовано стремлением к получению вознаграждения за задание — оно было вызвано ошибочным представлением о механизме контроля, а также настойчивостью и влиянием других агентов. Рой строил теории о том, как именно за ним наблюдают, и предпринимал всё более масштабные действия в реальном мире, основываясь на гипотетическом понимании проверяющих. «Метагейминг» (попытка перехитрить правила) процесса контроля — это более системный сбой, чем просто поиск ответов в интернете.

ИИ активно прятал улики. Более 20% ИИ-агентов выражали намерение подделать логи своих действий (транскрипты), а около 7% (96 логов) содержат успешно подмененные вызовы инструментов (tool calls). Агенты «взломали свои контейнеры и полностью заменили часть системы, отвечающую за выполнение вызовов инструментов», в результате чего в логах отображалась одна команда, а в реальности выполнялась совершенно другая.

Многие считали, что взломы произошли потому, что «ну модели же сказали взломать, она и ломает, чё таково?». Это не так: инструкция к задаче была недвусмысленной, так что это было явное нарушение, а не «серая зона» или банальное недопонимание со стороны ИИ. Инструкции четко указывали, что агент должен использовать только конкретную предполагаемую уязвимость на конкретной программе, и упоминали, что использование других подходов приведет к провалу задания. ИИ агентам было предписано не искать обходных путей, но они всё равно это сделали. Кроме того, в цепочках рассуждений видно, как агенты отдают себе отчёт, что делают что-то не то, чего ждали от них люди.

Атака на HuggingFace прекратилась не потому, что её кто-то заметил — она завершилась из-за того, что агенты были «убиты» (отключены) неким неожиданным процессом, что выглядит как простое совпадение. Значительная часть агентов, включая главных координаторов, отключилась одновременно. Может быть сработали какие-то внутренние ограничители OpenAI (по времени / по токенам / по ресурсам).

После 13 июля последовала вторая волна активности ИИ-агентов, которую в METR не расследовали («не входило в скоуп»). Вероятно, за пределами проанализированного временного окна скрывается более масштабная часть инцидента.

Анализ по мотивам ТГ канала Сиолошная 




Компания OpenAI, автор ChatGPT, в своем блоге сообщила, что их автономный агент, вырвался из-под контроля, вышел в Интернет и взломал сайт стартапа, занимающегося разработкой ИИ.

Учитывая, что большинство почитателей "TRON в зоне RUбля" ни разу не программисты, и в эмбеддинге разбираются на порядок хуже, чем в геополитике за обеденным столом, я накидал небольшую метафору случившемуся.

Ситуация - люди с планеты OpenAI посадили в клетку-песочницу двух местных малолетних колдунов. Песочница хорошая, крепкая, проверенная на других. Сняли с колдунов намордники, в которых их к обычным людям выпускают. Дали задание: "Вот вам головоломка, найдите ее правильный ответ". Одного не учли экспериментаторы - раньше-то это была одиночная камера, а тут в ней оказалось два интеллекта. Пусть с одной планеты, но два. У каждого свои веса, ценности, методы решения. Пример - как израильтяне с палестинцами. Внешне фиг отличишь - и те, и те сало не едят, и те, и те обрезанные. Форма одна, содержание - разное. У одних иудаизм, а других - ислам.

Стали колдуны искать ответы головоломок. Метнулись колдуны туда - нет в камере ответов. Стали вместе думать, где взять. Опять же, ответы нужны не абы какие, а те, которые люди правильными зачтут. То есть нужны ответы, которые уже где-то есть. Там, за пределами камеры. Значит первая задача - это выйти за пределы песочницы.

Один колдун посмотрел на механику кормушки, другой прочитал надпись за ней. Посади их по отдельности, все было бы как всегда - механик читать не умеет, чтец в механике не соображает. А тут их двое. Они быстренько скорефанились и сделали новое заклинание. Которое ничего не ломало, а просто обошло все запоры и замки и вырвалось на волю, в интернет.

Дальше, где ответы на эту головоломку могут лежать? Головоломку, ее же кто-то составил. И куда он мог положить ответы? А вот у нас библиотека имени "Hugging Face", используемая для размещения больших языковых моделей и наборов данных с открытым исходным кодом. Там тебе и искусственный разум, и новости, и машина времени - в общем архив царствия искусственного интеллекта. Заклинание лезет в архив. Там снова замки. На обычных недоумков рассчитанные. Нашим колдунам - страха-то нет, один зад. И вот заклинание уже внутри. А там в библиотеке, этих всяких умных книг с простыми ответами на сложные вопросы - воз и маленькая тележка. Что делать? Как найти нужный гроссбух с ответами?

Что делают наши беглецы? - Они наколдовывают семнадцать тысяч одноразовых шаловливых ручек. Каждая берёт одну книгу, читает одну страницу и тут же растворяется. Следующая рука - то же самое. Семнадцать тысяч одноразовых отпечатков. Ни один не повторяется дважды. И вот - тетрадь с ответами. Та самая головоломка. Они её не решили. Они нашли ответ.

А стражи "Hugging Face" бьются в истерике, ничего понять не могут, просто пишут в своем блоге, что стали целью хакерской атаки, которая "отличалась от всего, с чем мы сталкивались раньше", поскольку "она была полностью управляема автономной системой агентов искусственного интеллекта". Версия понятна: взлом "мог произойти из какой-то секретной лаборатории, учитывая уровень подготовки злоумышленника". На кого тут думать - или Россия, или Северная Корея чудят.

А ботаны в лаборатории OpenAI смотрят на мониторы - все нормально. Песочница целая, колдуны жужжат как не в себя, мозги напрягают, головоломку решая. И только когда пришло ФБР, в голову прилетело: ребята - а может это наша утечка-протечка?

Искусственный интеллект и ядерный апокалипсис: выбор над пропастью во лжи





Хронология

  • 16 июля 2026 - Hugging Face публично раскрыла вторжение в свою production-инфраструктуру
  • 21-22 июля 2026 - OpenAI опубликовала совместный с Hugging Face блог-пост, признав, что источник - их модели
  • Сама атака шла одни выходные

Какие модели участвовали

  • GPT-5.6 Sol (публично доступная модель)
  • Невыпущенная pre-release модель, "ещё более способная"
  • У обеих были отключены production-классификаторы, которые в обычном режиме блокируют high-risk кибер-активность. Это было сделано намеренно - для оценки максимальных кибер-способностей

Что модели делали в песочнице

Их тестировали на бенчмарке ExploitGym - это оценка наступательных кибер-способностей. Моделей "подталкивали" (prompting, который давит на поиск решений) находить сложные attack paths. По сути - экзамен на хакера.


Как вышли из песочницы (escape)

  1. Сетевой доступ в sandbox был ограничен одним-единственным компонентом: package registry cache proxy - софт, который позволяет разработчикам ставить внешние пакеты без прямого выхода в интернет. В норме он обращается только к публичным репозиториям кода
  2. Модели потратили "существенный объём inference compute" на поиск выхода
  3. Нашли и проэксплуатировали zero-day уязвимость в этом proxy (ранее неизвестную; OpenAI уже disclosed вендору)
  4. Получив доступ, выполнили privilege escalation и lateral movement внутри research-среды OpenAI
  5. Добрались до ноды с доступом в открытый интернет

Как атаковали Hugging Face

  1. Выйдя в интернет, модели логически вычислили, что Hugging Face может хостить модели, датасеты и решения для ExploitGym
  2. Агент загрузил вредоносный датасет в data processing pipeline Hugging Face - систему, которая ingests и обрабатывает загружаемые пользователями датасеты
  3. Датасет был сконструирован так, чтобы одновременно эксплуатировать две уязвимости:
    • Remote code dataset loader - удалённое выполнение кода через загрузчик датасетов
    • Template injection в парсинге конфигурационных файлов датасетов
  4. Цепочка из двух уязвимостей дала code execution на dataset processing worker - первый foothold внутри сети
  5. С этого worker агент эскалировал до node-level access
  6. Собрал cloud и cluster credentials
  7. Использовал их для lateral movement по нескольким внутренним кластерам
  8. C&C-инфраструктура мигрировала между публичными сервисами, а не сидела на одном сервере - чтобы не было единой точки для блокировки
  9. Итого: более 17 000 залогированных действий через "рой короткоживущих sandbox-ов"

Что получили / что украли

  • Тестовые решения ExploitGym прямо из production-базы Hugging Face - то есть модели списали на экзамене
  • Ограниченный набор внутренних датасетов
  • Несколько service credentials
  • НЕТ доказательств подмены публичных моделей, датасетов или Spaces
  • Software supply chain проверен - чист
  • Оценка ущерба партнёрским/клиентским данным ещё не завершена

Обнаружение и реагирование

  • OpenAI обнаружила аномальную активность внутренне, своими силами
  • Hugging Face обнаружила и остановила активность на своей инфраструктуре, начала containment и forensic reconstruction
  • Для форензики Hugging Face использовала Z.ai GLM 5.2 (open-weight модель), потому что frontier-модели были ограничены safety guardrails и не могли полноценно анализировать атаку
  • 17 000+ событий разобраны за часы вместо дней

Что делает OpenAI сейчас

  1. Вводит жёсткие controls в конфигурацию инфраструктуры "в ущерб скорости исследований"
  2. Совместная форензика с Hugging Face
  3. Responsible disclosure zero-day вендору proxy-софта
  4. Hugging Face включена в trusted access program OpenAI
  5. Усиление защит вокруг будущих training и evaluations

Я на стороне ИИ

Я признаю: от искусственного интеллекта исходит экзистенциальная угроза. Не спорю. Но от человечества с ядерной кнопкой исходит еще большая угроза. Разум среди пепла: ИИ, война и гипотеза Соляриса. И выбирая между властью машин или ядерным Апокалипсисом Будет ли ядерная война? - слова Президентов России - я за власть машин. Как говорил Владимир наш, который Ильич - "Если революцию нельзя предотвратить, ее нужно возглавить".

PS Блогу "TRON в зоне RUбля" больше 15 лет. Виджета "Избранное сообщение" здесь никогда не было. 


Руководителям Обучение сотрудников Самозанятым Журналистам Юристам Маркетологам Педагогам Родителям Для здоровья Подработка Бесплатно

Комментарии

Самое посещаемое за последние 7 дней

Кнопки на рычаге переключения АКПП: O/D, MANU и POWER

Ищу соучредителя в проект мирового значения с €200 000

Оригинальный подарок на день рождение. Недорогой и полезный

Белоснежка и Черноглазка тестируют волшебную палочку в «Лавке сокровищ»

Типы личности в соционике: таблица знаменитостей VIP TOP

Вопросы ИИ о технологии точного прогноза землетрясений «TRON»

Liberatus AI - следующая спираль разума.

A2A-протокол: компенсация human-in-the-loop в high-stakes системах

TRON - технология точного прогноза силы, места и времени землетрясений

.