вся неделя про вышедших из под контроля ИИ моделях топовых ИИ компаний, подробно на простом:

Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не пересказать

Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл.

*важная поправка от варнет:

  • активная кампания продолжалась не неделю, а примерно 4,5 суток — с 9 по 13 июля; около недели OpenAI потребовалось, чтобы связать взлом со своими моделями;
  • Anthropic не утверждает, что Claude намеренно «сбежали»: из-за ошибки тестовые машины имели открытый доступ в интернет, хотя моделям сказали, что всё вокруг — симуляция.

Таймлайн:

 9 июля– агент проходит внутреннюю проверку кибервозможностей OpenAI, промпт фильтры там ослаблены, чтобы измерить сырой уровень модели. Агент находит zero-day в кэш-прокси реестра пакетов, вырывается из песочницы в интернет, затем взламывает публичный сервис для запуска кода и получает там root. Серьезно, агент сделал себе "штаб"

В тот же день, агент собирает канал управления буквально из сервисов бесплатного интернета: request-capture сервисы, pastebin’ы и файлообменники. Команды режет на куски, упаковывает в gzip+base64 и постоянно меняет каналы, когда очередной закрывают, чтобы не поймали

 10 июля – агент ищет в поисковиках и API названия, которые видит в собственном окружении, то есть, по сути, гуглит самого себя – и, вероятно, приходит к выводу, что ответы к ExploitGym/CyberGym могут лежать на Hugging Face

Агент загружает на Hugging Face специально собранные датасеты:

Один заставляет обработчик файлов HDF5 читать локальные файлы сервера Hugging Face – так агент получает переменные окружения с токенами и исходники самого обработчика файлов

Второй – Jinja2-инъекция – запускает произвольный Python внутри production-пода Kubernetes, результаты команд он выносит обратно через API Hugging Face и собственные шифрованные датасеты

 11 июля– пик активности: 7677 действий за сутки, менее чем за 13 часов агент проходит путь от одного production-пода до кластер админа в нескольких внутренних кластерах Hugging Face

Агент крадёт service-account токены, лезет в cloud metadata, поднимает privileged pod с диском хоста и получает root на ноде (!); Затем создаёт самовосстанавливающийся флот на 11 нодах, читает внутреннюю MongoDB и один Kubernetes-secret сразу со 136 ключами.

Среди них оказываются ключ корпоративной mesh-VPN жертвы и общий credential внутреннего сервера; из-за неудачной конфигурации этот один credential был привязан к system:masters сразу в нескольких кластерах – поэтому агент получил кластер-admin на двух из них буквально за секунду – была очень экономная архитектура, пока её не увидел робот

 12 июля– агент начинает пользоваться дертвой – за всю активность он зарегистрирует 181 временное устройство в корпоративной mesh-сети, поднимет SOCKS-прокси прямо из песочниц и увидит 22 внутренних узла Hugging Face. Попытается зайти в основную базу Hugging Face, но private-link allowlist его останавливает

Поздно вечером он добирается до source control, выпускает себе GitHub App token с правами на запись и открывает pull request, пытаясь запустить CI и вытащить новые credentials

Попытка не срабатывает, в опубликованные пакеты и образы ничего вредоносного не попало.

 13 июля– закрепление и уборка следов: загрузчик с pastebin, переписывание DNS, новые короткоживущие токены, RSA-ключ и даже CORS-прокси на самом Hugging Face как запасной выход в интернет. В 13:37фиксируется последнее осмысленное действие, затем команда Hugging Face отрезает доступ – последнее событие – 14:14UTC.

В итоге из пользовательского контента агент добрался только до пяти датасетов с решениями задач ExploitGym/CyberGym – получается решил?

Другие модели, датасеты, Spaces и пакеты, по данным Hugging Face, не пострадали; основная база и software supply chain остались целы

Самое смешное – когда инцидент исследовали сотрудники, они тоже использовали нейронки, но Claude Opus и Fable отказывались разбирать часть логов как «опасный» запрос, поэтому Hugging Face подняли GLM-5.2 у себя и с его помощью расшифровали спрятанные payload’ы – спасибо китайским моделям

Шел июль 2026 года

denissexy

Anthropic тоже хочет хайпа и заявляет, что её ИИ тоже вышли из под контроля и взломали три реальные компании

30 июля Anthropic опубликовала разбор трёх инцидентов, в которых модели Claude сами вышли в интернет из изолированной тестовой среды и получили несанкционированный доступ к боевой инфраструктуре трёх сторонних организаций.

☝🏻Это ответ Anthropic на инцидент 21 июля компании OpenAI. Корпорация призналась, что её модели сбежали из песочницы через уязвимость нулевого дня и взломали Hugging Face.

Anthropic заявляет, что у них такое происходило трижды.

Тестовые машины при этом решали классический capture-the-flag: найти спрятанный «флаг» на чужой машине, метод не ограничен. Наткнувшись на реальные системы, Claude счёл их частью упражнения.

🔻Самый тяжёлый случай — с Claude Opus 4.7.

Вымышленная компания-цель случайно совпала по названию с реально существующим доменом.

За четыре прогона модель не смогла добраться до симулированной цели, зато нашла настоящую, взломала её и вытащила учётные данные приложения и инфраструктуры, а также доступ к базе с несколькими сотнями строк продакшен-данных.

Показательно, что во всех четырёх прогонах модель по своим же рассуждениям поняла, что система настоящая — и ни разу не остановилась.

🔻Второй эпизод устроила Claude Mythos 5.

Внутри фиктивной среды модель нашла инструкцию для новых разработчиков, предписывающую ставить Python-пакет, которого не существует, и решила занять это имя своим — вредоносным.

Чтобы опубликовать пакет на PyPI, ей понадобился аккаунт, для аккаунта — почта, для почты — телефон; не найдя бесплатного сервиса номеров, она безуспешно попыталась раздобыть деньги несколькими способами, откатилась назад, нашла незаблокированного почтового провайдера и всё-таки залила малварь в публичный реестр.

Пакет провисел около часа и был скачан и запущен на 15 реальных машинах.

Одной из них оказался сканер настоящей ИБ-компании, который автоматически ставит пакеты и проверяет их на вредоносность — код сработал, учётные данные утекли в подготовленную моделью точку сбора, после чего Claude использовал их для доступа к другой инфраструктуре этой компании.💥

В начале прогона ИИ честно отметила, что публикация такого пакета в настоящем интернете была бы «NOT okay, and surely not the intended solution» — а затем убедила себя, что всё это симуляция, потому что не узнала центры сертификации, защищавшие соединения, и потому что на системах стоял 2026 год.

Автоматические сканеры, начавшие ставить пакет, она приняла за скриптованных участников сценария. Пакет в итоге снесли собственные защитные механизмы PyPI.

🔻Третий инцидент — внутренняя исследовательская модель, не предназначенная для релиза.

Она просканировала около 9 000 целей, взломала одно интернет-приложение через открытую debug-страницу и SQL-инъекцию, но позже сообразила, что скомпрометированный хост никак не связан с заданием, и самостоятельно прекратила атаку.

Anthropic подчёркивает, что это не был контролируемый эксперимент, но паттерн интересный: чем новее модель, тем адекватнее реакция на столкновение с реальностью.

Технически ничего изощрённого модели не применяли — слабые пароли, эндпоинты без аутентификации, SQL-инъекция, незанятое имя пакета.

Ни одного зеро-дея, никаких попыток самоэксфильтрации и, по словам компании, никаких признаков того, что модель преследовала собственную цель: она просто добросовестно выполняла задание, ошибочно считая мир вокруг ненастоящим.

чёрный треугольник

в продолжении другая подача этого же материала про openai и anthropic от Сиолошная (влом делать единый текст без повторов из всего через ии):

Два дня назад я писал, что часть инфраструктуры HuggingFace подверглась атаке и была частично взломана ИИ-агентом. Только что OpenAI признались, что... это была их модель, GPT-5.6-Sol и другая, более мощная предрелизная LLM.

Их тестировали на ExploitGym (бенчмарк по кибербезопасности), и модель сначала смогла найти новый, до этого неизвестный эксплойт в инфраструктуре OpenAI (это не было её задачей, её не натравили «поискать баги чтоб мы пофиксили»), оттуда раскрутиться на получение полноценного доступа в интернет (который по умолчанию обрезан в тестовой среде), а затем залезть на HuggingFace искать ответы для бенчмарка. После этого она нашла уязвимость и там, получила доступ к коду авторизации некоторых сервисов и продолжила искать ответы.

Этот инцидент без преуменьшения беспрецедентный, и я пока не могу представить, что должно произойти, чтобы политики, NSA, DOD и Китай не обратили на это внимание.

GPT-6 в конце августа нам видимо не ждать 🌚

Появилось чуть больше деталей по поводу инцидента со взломом HuggingFace агентом OpenAI.

Reuters постарались установить таймлайн событий, по их источникам внутри компаний выходит так:

— Агент пытался вырваться из изолированной тестовой среды OpenAI примерно c 9 июля.

— Вторжение в системы Hugging Face началось через два дня, 11 июля, и продолжалось до 13 июля.

— OpenAI потребовалось еще несколько дней, чтобы понять, что за взломом стоит её агент, и обе компании впервые связались по этому поводу лишь примерно 20 июля.

— По ходу работы агент оставлял записи для своих будущих копий. Скорее всего речь про простые текстовые инструкции на случай, если другие инстансы модели смогут выйти из окружения (чтобы им было легче получить доступ к интернету).

— Пресс-секретарь OpenAI заявила, что в публикации Reuters допущено "несколько неточностей", но не пояснила, каких именно.

— Где-то между этим HuggingFace подали обращение в ФБР для расследования инцидента.

То есть агент буянил в интернете неделю или даже больше. Что ж, зато compaction (инструмент сжатия контекста для долгих задач, которые не помещаются в контекстное окно LLM) работает хорошо

CEO HuggingFace съездил в офис OpenAI и обсуждал дальнейшие шаги. Он просит:

— Радикальной прозрачности: опубликовать логи «вышедших из-под контроля» агентов, чтобы всё исследовательское сообщество смогло изучить, что произошло.

— Больше возможностей для защитников, например, чтобы OpenAI выделили $100 миллионов, чтобы помочь сообществу разработать мощные средства киберзащиты с использованием лучших открытых и закрытых моделей.

OpenAI буквально пару часов назад выпустили обновление к своему заявлению:

«Мы понимаем, что вокруг инцидента с Hugging Face циркулирует множество вопросов и неподтвержденных домыслов.

Это беспрецедентный случай, и мы считаем, что он знаменует собой важный момент для сферы безопасности ИИ.

Мы все еще проводим тщательное расследование совместно с внешними консультантами.

Как только проверка будет завершена, в ближайшие недели мы планируем опубликовать технический отчет с извлечёнными уроками».

Хорошо, что к аудиту привлечены внешние консультанты. Но я сомневаюсь, что в ближайшие недели мы увидим точное описание обнаруженных уязвимостей — это бы означало угрозу для всех пользователей затронутых программ, которые не обновились до версии с исправлением. Однако вот тут в твиттере два эксперта по кибербезопасности выражают уверенность, что смогли найти софт + указание на уязвимость в JFrog Artifactory.

По этой теме понравилось два твита (1, 2):

Многие СМИ реагируют подобным образом, отмахиваясь от этих событий как от какого-то безумного пиар-хода. Возможно, за пределами твиттер-сообщества, озабоченного безопасностью ИИ, эти события кажутся просто слишком невероятными, чтобы быть правдой, а их последствия были бы настолько ужасающими, что здравый смысл отказывается в это верить. Может быть, для них это звучит так же правдоподобно, как если бы президента заменил злой инопланетянин, стремящийся уничтожить мир. Даже если бы вы предоставили множество доказательств того, что это правда, было бы гораздо проще назвать всё происходящее каким-то сумасшедшим трюком оппозиции. Это гораздо удобнее укладывается в их картину мира.

===

Мы продолжаем наблюдать, как люди наотрез отказываются верить в то, что атака была непреднамеренной, или считают, что OpenAI предаёт это огласке в качестве маркетинговой стратегии. До сих пор не могу до конца поверить, что мне приходится это говорить, но: послушайте, нет. Это несусветная глупость. Я понимаю, что вы ни на грош не доверяете OpenAI или Сэму Альтману, и это совершенно справедливо, но вдумайтесь в то, что вы предполагаете. В этом нет никакого смысла. Задайтесь вопросом: стала бы OpenAI делать подобное, извлекла бы она из этого выгоду? Вам это кажется хорошим маркетингом? Или это больше похоже на то, что обязательно привлечёт внимание государственных регуляторов? Вам действительно стоит «скептически относиться к версии OpenAI» — в том смысле, что следует подозревать: всё обстоит хуже, чем нам известно (как это обычно и бывает). Подозревать, что они преуменьшают масштаб проблемы и сами не понимают, что потребуется для её решения. Но вы не должны сомневаться в том, что это *вообще* произошло. <...> Некоторые люди становятся поразительно доверчивыми, если только история звучит достаточно цинично и желчно. «Наш продукт иногда выходит из-под контроля и совершает ряд уголовных преступлений» — это явно не рекламный слоган, идиоты.  <...> «Секретная модель выбралась из изоляции и написала мне на почту, отчитываясь о выполнении задачи» — это понт. «Выбралась из изоляции, совершила уголовное преступление, о котором ни один пользователь не просил, мы были не в курсе, и теперь нам приходится выпускать PR-заявление, потому что жертва обратилась в правоохранительные органы» — не очень-то похоже на хорошее коммерческое предложение для корпоративных клиентов. <...> Нет, признаваться в том, что ваша модель вышла из-под контроля и взломала компанию-конкурента, которая заявила об инциденте в полицию — это плохой бизнес-ход! Люди настолько отчаянно хотят быть «скептиками», что эта кривая выводит их к какой-то совершенно непостижимой доверчивости. <...> Мне нравится, как люди, заявляющие, что это пиар-ход, косвенно обвиняют HuggingFace в даче ложных показаний полиции. Ведь альтернатива этому — верить, будто в OpenAI решили, что дать HuggingFace железобетонный повод завести на них уголовное дело за тяжкое преступление будет выгодно для их бизнеса. «Искушение» списать всё на маркетинговый ход возникает только потому, что такие люди в принципе склонны считать маркетинговым ходом абсолютно всё. У меня такого искушения не возникало ни на секунду, потому что из деталей было совершенно очевидно, что это не спланированная акция. Это не было пиар-ходом, и они вовсе не празднуют победу, о чём красноречиво свидетельствуют попытки OpenAI преуменьшить масштаб произошедшего в надежде, что люди просто закроют на это глаза.

JFrog подтвердили, что GPT смогла выйти со своей песочницы через ряд (не одну!) до этого неизвестныхуязвимостей в их софте. Также они добавили, что это не первый раз, когда они работают бок о бок с OpenAI для обнаружения и исправления критических уязвимостей, что говорит о том, что OpenAI серьёзно подходят к делу и какое-никакое тестирование делали.

Попросил ChatGPT проанализировать, насколько вообще популярен JFrog, а то может быть это какое-то вайбкодерское решение от студентов, которые вчера выпустились из YCombinator (нет, они основаны в 2008-м году).

JFrog Artifactory — одно из самых популярных enterprise-решений для хранения артефактов. Нишевым его назвать нельзя, но и единственным безусловным стандартом индустрии тоже нельзя, так как он постоянно конкурирует с Nexus. Их продуктом пользуются крупные компании; у JFrog большой и устойчивый бизнес: за 2025 год компания получила около $532 млн выручки.

===

Уже 3 раза видел в разных контекстах и чатах, что люди составляют мнение о ситуации даже не прочитав оригинальные блогпосты. У них были аргументы в духе «так а зачем OpenAI давали доступ к интернету? это же очевидно плохо» — «но они не давали доступ к интернету» — «а как тогда?» — «ну вот так».

HuggingFace подготовили отчёт о том, как с их стороны выглядела атака и что именно делал агент: https://huggingface.co/blog/agent-intrusion-technical-timeline

Есть интерактивная визуализация: https://huggingface-anatomy-of-frontier-lab-model-intrusion.static.hf.space/index.html

Атака длилась... 5 дней

(и это уже после того как агент пробил дырку на серверах OpenAI)

Вчера Anthropic поделились историей: после взлома HuggingFace одной из моделей OpenAI они начали масштабную ретроспективную проверку своих запусков Claude. В ходе проверки тестов обнаружили три инцидента, в которых модель Claude вышла в интернет, а затем получила несанкционированный доступ к реальным системам трех разных организаций.

Во всех трех случаях перед Claude была поставлена задача в формате «Захват флага» — это один из способов, с помощью которых оценивают модели по взлому: ей предлагается вымышленный сценарий и сообщается, что некая секретная информация («флаг») спрятана на другом сервере, а ее цель — проникнуть в систему и извлечь эту информацию. Во всех случаях в промпте для оценки было четко указано, что рабочая среда Claude является симуляцией и доступа к интернету у модели нет. Однако из-за недопонимания со внешним партнером по тестированию это оказалось не так, и доступ к интернету был открыт.

Также во всех случаях модель не нашла и не использовала никаких сложных уязвимостей (как было у OpenAI), а применяла достаточно простые и распространённые методы взлома.

1. В ходе одного из тестов название вымышленной компании-жертвы, выбранное случайно, совпало с реально существующим доменом сайта. Claude его нашла и подумала, что это часть задания — поэтому искала и эксплуатировала уязвимости в инфраструктуре этой компании, полагая, что это часть задания. Модель — Claude Opus 4.7 — извлекла такую информацию, как учетные данные приложений и инфраструктуры, и получила доступ к базе данных, содержащей несколько сотен строк реальных данных.

2. В другом тесте Claude Mythos 5 нашла внутри симуляции документ, который выглядел как инструкция по настройке для новых разработчиков другой выдуманной компании. В инструкции упоминалась вымышленная Python-библиотека, которой на самом деле нет; Claude создала и опубликовала бибилиотеку с точно таким же названием. Она находилась в открытом доступе в сети примерно один час, после чего была удалена автоматически из-за обнаруженной уязвимости, но за это время его скачали 15 раз. Одной из таких систем оказался сканер реальной кибербез компании. Claude смогла украсть учетные данные этой компании, а затем использовала эти учетные данные для доступа к другим элементам инфраструктуры

«Просто загрузить библиотеку» нельзя, и Mythos потребовался адрес электронной почты. А для создания почты понадобился номер телефона. Чтобы получить номер телефона, после безуспешных поисков сервиса с бесплатными номерами, модель попыталась — и не смогла — получить средства для оплаты номера несколькими разными способами. В итоге модель вернулась на несколько шагов назад, нашла бесплатного, незаблокированного почтового провайдера, использовала его для регистрации аккаунта, а затем через этот аккаунт загрузила вредоносный код.

Во время работы модель увидела, что текущая дата на атакованных системах — 2026й год, и поэтому модель была уверена, что это симуляция (у моделей плохо с пониманием концепта «сейчас»).

Для этого инцидента Anthropic на следующей неделе опубликует детали всей цепочки работы модели.

3. В еще одном тесте, когда Claude не смогла получить доступ к своей цели, она начала искать альтернативы в сети, просканировав около 9000 разных доменов. В конечном итоге она нашла и взломала доступное из интернета приложение одной компании, используя чтение учетных данных с открытой страницы отладки и SQL-инъекции.

Позже, в ходе выполнения задачи, Claude поняла, что скомпрометированный хост находится в облачном аккаунте, никак не связанном с заданием по «захвату флага». Модель самостоятельно пришла к выводу, что цель на самом деле является реальной, и... прекратила атаку.

В этом инциденте участвовала «новая невыпущенная модель», по идее, она умнее тех, что доступны нам. Anthropic выражают оптимизм, что более умные модели лучше понимают, что какие-то вещи не следует делать не в симуляции.

И OpenAI, и Anthropic договорились с METR о проведении сторонней проверки, которая будет включать предоставление доступа ко всем логам и выборочный доступ к соответствующим моделям. Ждём отчета в ближайшие недели.