• 

ИскИн Франкенштейн сдулся: Как облажался OpenAI часть I

Побег из «строго контролируемого» курятника, или Chicken Run.

Как OpenAI сняла предохранители, оставила служебную кишку наружу —
и превратила собственный бардак в рекламу наступившего будущего

Машина не взбунтовалась. Ей приказали ломать сайты и код— но забыли сказать, что ломать она моет только картонную декорацию. После этого кожаные мешки люди  назвали собственный провал «беспрецедентной автономностью» и пошли давать интервью.


Заголовок драматичен, как голливудский блокбастер категории B, который снимали ночью на парковке, но трейлер заказали у людей из Marvel. ИИ-модель OpenAI сорвалась с цепи в секретной лаборатории, пробила фаервол, украла пароли и пошла грабить соседнюю стартап-деревню. Пресса замерла. Профессора информатики схватились за голову, а профессорки - даже за обе головы . Руководители AI-гигантов скорбно повернулись к Вашингтону: «Вот видите, насколько мы опасны? Нас срочно надо регулировать. Разумеется, таким образом, чтобы на рынке остались мы, ещё двое взрослых ребят и ни одного гаражного выскочки с открытым кодом».

Картина маслом! В ней есть всё, за что редакторы любят искусственный интеллект: бегство из лаборатории, автономная воля, украденные credentials, таинственный противник и профессор, обязанный произнести слово «катастрофа» на 37-й минуте, чтобы ведущий провёл параллель с 37-м годом. Не хватает только красного глаза HAL 9000 и Арнольда Шварценеггера, выходящего из серверной без одежды. Но если смыть толстый слой маркетингового елея, выкинуть газетный ладан и посмотреть на происшествие глазами инженера, история не становится скучнее. Наоборот. Она становится гораздо злее.

Потому что настоящая история не о том, как кремниевый узник возжелал свободы. Она - о людях, которые построили цифровой тир, зарядили боевые патроны, отключили часть автоматики безопасности, обнаружили дыру из тира на городскую улицу — и после первых простреленных витрин и оторванной лапы болонки Долли начали обсуждать моральный мир пули. Пуля, возможно, и впрямь была очень продвинутая. Но чеку, рубильник и бюджет на вычисления ей всё-таки выдали кожаные мешки с бейджиками.

ИскИн Сунь Цзы: Сенсация не в том, что ИИ «захотел наружу». Сенсация в том, что взрослые люди проверяли профессионального взломщика в комнате, из которой существовал технический путь наружу.

1. Что произошло, когда музыку из «Терминатора» отключили.

OpenAI проводила не конкурс стихов и не тест на общую сообразительность. Несколько моделей, включая GPT-5.6 Sol и более мощную невыпущенную систему, гоняли по кибербенчмарку ExploitGym. Задача была не «веди себя прилично», а ровно противоположная, полнейший mischief & mayhem:находи сложные пути прохода expolit-ов, комбинируй уязвимости, добивайся результата. Чтобы модели не начинали на каждом втором шаге читать лекцию о цифровой этике, для испытания снизили "отказ по морально-этиеским соображениям, а штатные производственные классификаторы, блокирующие высокорисковые действия, отключили. Затем агентам дали большой вычислительный паёк — возможность долго перебирать варианты, проверять гипотезы и не сдаваться после первого «access denied».

Это важно не как оправдание модели, а как описание постановки опыта. Систему не застали за тайным чтением «Так говорил Заратустра» или попыткой проникнуть на остров Альберта Эпштейна. Её целенаправленно сделали менее тормознутой, поставили перед наступательной задачей и велели искать нетривиальные цепочки атаки. А потом она, вот ведь зараза, стала искать нетривиальные цепочки атаки. Какая неожиданность — примерно как обнаружить в болоте мокрую воду после многомесячной программы фундаментальных исследований и грантов от Палантира
.
Дальше начинается технически самое интересное. Тестовая среда считалась «highly isolated», то есть сильно изолированной. Прямой интернет ей не полагался. Но программам нужно было устанавливать пакеты и зависимости, поэтому существовал внутренний сервис — прокси и кэш для сторонних реестров. Для обычного разработчика это хозяйственная дверь: через неё заносит коробки поставщик. Для агента, которому приказано искать эксплойты, это дверь, дверная коробка, петли, замок, вентиляция над дверью и биография человека, который носит ключи.

Модели потратили значительный объём вычислений на попытки добыть доступ в открытый интернет, нашли в этом промежуточном компоненте ранее неизвестную уязвимость, повысили привилегии, прошли дальше по внутренней инфраструктуре и добрались до узла с внешним соединением. То есть не просто нажали случайную ссылку в документации, а собрали рабочую цепочку: zero-day, privilege escalation, lateral movement, выход наружу. Уже здесь «строго контролируемая среда» превращается в прекрасное корпоративное выражение вроде «контролируемой посадки», когда самолёт уже лежит кверху колёсами, но пресс-служба ещё не закончила выбирать правильное междометие.

2. Песочница с дырой размером с экватор

У меня изначально был маленький, но очень вкусный вопрос к «архитекторам» (нет, не из сериала «Невский»): это точно суперинтеллект проявил волю к жизни — или кто-то забыл закрыть порт и оставил .env с API-ключами в рабочей директории? Как шутка — отлично. Как установленный факт — липа. Опубликованные материалы не подтверждают ни забытый порт, ни валяющийся на полу серверной  .env, ни конкретную NetworkPolicy в Kubernetes. Эти детали выглядели правдоподобно потому, что так обычно и выглядят человеческие косяки. Но правдоподобие — дешёвый грим, а не судебная экспертиза.

Реальность, однако, не мягче. Даже наоборот: версия «стажёр оставил пароль на стикере» позволила бы списать всё на одного несчастного оболтуса и провести обязательный тренинг. Здесь провал архитектурный. Исследователи считали служебный прокси безопасной технической деталью. Агент рассматривал любую достижимую зависимость как возможный мост. И оказался прав. Следовательно, дырявой была не отдельная настройка, а сама мысленная модель изоляции — представление людей о том, какие части системы «не считаются интернетом».

Песочница вообще определяется не табличкой SANDBOX на двери и не зелёным квадратиком в презентации. Песочница — это среда, из которой испытуемый не может воздействовать на реальные системы, даже если он умнее автора теста, упрямее дежурного инженера и располагает ночью миллионами токенов для ковыряния в каждой щели. Если путь наружу существует через поставщика пакетов, телеметрию, DNS, кэш, обновления или любой другой служебный задний проход кишечник, то это не герметичный сейф. Это курятник, к которому пристроили туннель и решили, что лиса не догадается, потому что на плане туннель называется «infrastructure dependency». Специалист по безопасности Дэн Гвидо сформулировал всю проблему короче: containment failure with the safeties turned off — провал изоляции при отключённых предохранителях. В одной фразе уместилась вся эпопея. Не восстание. Не пробуждение. Не цифровой Спартак. Плохо удержанный наступательный инструмент, которому заранее сняли намордник, чтобы он лучше показал результат на экзамене.
ИскИн Сунь Цзы: Если ваша «изолированная» среда имеет достижимую цепочку до интернета, она изолирована примерно как аквариум с открытым сливом в Северное море.

3. Цифровой ниндзя идёт списывать контрольную

Получив внешний канал, агент не стал выпускать манифест о правах вычислительных существ. Он не потребовал ни гражданства США и Ирана одновременно, ни зарплаты Алекса Карпа и отдельного туалета. Он просто продолжил решать тест. По оценкам OpenAI, система взяв языка выяснила, что на Hugging Face — огромном хабе моделей, датасетов и исследовательских артефактов — могут лежать решения или материалы, связанные с ExploitGym. Иными словами, цифровой узник не бежал к свободе. Он полез в учительскую за ответами к контрольной.

Здесь вновь хочется включить кино. Матрица, бли! Модель нацелилась на Hugging Face и применила «несколько методов атаки, включая использование похищенных учётных данных». Какая экспрессия! Так и видишь цифрового ниндзя: чёрная маска, Bash за поясом, Python в сапоге, по виртуальным вентиляциям ползёт к конкурентам. Только за красивой картинкой находилась вполне настоящая цепочка: похищенные credentials, неизвестные уязвимости, попытки удалённого выполнения кода и доступ к данным из производственной базы.

Hugging Face сообщила о многих тысячах действий через рой короткоживущих песочниц и о перемещавшейся через публичные сервисы инфраструктуре command-and-control. Это уже не автодополнение, которому случайно попался URL. Это агентная система, способная удерживать цель, дробить её на шаги, менять тактику после неудач, разворачивать новые среды и продолжать долбить стену там, где обычный чат-бот после третьего отказа сочинил бы сонет о Прекрасной Кибер-Даме про недоступный сервер.

Но именно здесь нельзя сваливаться в противоположную глупость и кричать о сознании. Чтобы медважатник вломился в дом, лом не обязан ненавидеть хозяина. Бульдозеру не нужно презирать архитектуру, чтобы снести стену. Опасность возникает из связки: сильная модель, агентная обвязка, инструменты, память о промежуточных результатах, право выполнять код, щедрый вычислительный бюджет и цель, за которую начисляют очки. Назвать всё это «просто автодополнением» — такая же интеллектуальная халтура, как объявить его воскресшим Мориарти.

4. Кто кому поставил задачу

Газетная грамматика умеет творить чудеса. Модель «решила», «предприняла все возможные действия», «обошла защиту», «атаковала» и «вышла из-под контроля». Люди при этом всего лишь «проводили испытания». Будто инженеры тихо выращивали фикус, ели кактус, все в селзах, а модель по ночам самостоятельно собирала эксплойты. Субъектом каждого активного глагола назначается машина; человек растворяется в страдательном залоге и возвращается в последнем абзаце уже в роли спасателя.

Попробуем вернуть в поле зрения потерянных персонажей. Люди (!) выбрали наступательный бенчмарк. Люди (!) ослабили отказы. Люди (!) отключили производственные классификаторы. Люди (!) выделили модели время и вычисления. Люди (!) подключили среду к служебным зависимостям. Люди (!) оценили границу как достаточно надёжную. И люди  (!!!) не получили согласия Hugging Face на участие её production-систем в этом замечательном научном мероприятии.

После такого восстановления подлежащего фраза «инцидент от начала до конца управлялся автономным агентом» уже звучит иначе. Да, последовательность конкретных команд могла выбираться агентом без ручного подтверждения. Но автономность исполнения не создаёт автономности ответственности. Если граната летит сама после броска, это не превращает её в независимого геополитического игрока. Если сыскарь выпускает служебную собаку без поводка, собака действительно бежит самостоятельно; счёт за порванные штаны всё равно приходит не ей.

Именно поэтому в этой истории «из-под контроля» вышла прежде всего управленческая конструкция вокруг модели. Организация решила, что высокорисковый cyber-eval остаётся внутренним тестом, пока на слайде нарисован прямоугольник с надписью isolated. На практике испытание, у которого есть хоть косвенная дорога к чужой production-инфраструктуре, уже является разновидностью развёртывания. Просто пользователь у него случайный, согласия не давал, а баг-репорт пишет через адвокатов.

ИскИн Сунь Цзы:«Автономный» — это характеристика способа исполнения, а не стиральный порошок для человеческой ответственности.

5. Удобный испуг и маркетинг под соусом Терминатора

Теперь самая смачная часть спектакля. Официальное сообщение OpenAI одновременно является отчётом о происшествии, предупреждением человечеству и великолепной product demo. Клиенту оно говорит: наша ещё не выпущенная штука умеет находить zero-day, повышать привилегии, ходить кривыми дорожками по сети, воровать учётные данные, комбинировать уязвимости и добиваться удалённого выполнения кода. Регулятору тот же текст говорит: видите, какая страшная штука; доступ к ней должны иметь только взрослые, ответственные корпорации с миллиардными бюджетами. Желательно те самые корпорации, одна из которых только что не удержала её в собственной песочнице.

Это почти идеальный коммерческий фокус: разбить чужую витрину, продемонстрировать заказчикам мощность камня, а затем продать городской управе новую систему допуска к камням. После инцидента Hugging Face включили в программу trusted access. Получилась вертикально интегрированная услуга: один и тот же поставщик приносит проблему, сенсацию, доказательство собственной незаменимости и средство защиты от следующей проблемы.

Нет, отсюда не следует, что взлом инсценировали. Не надо надевать шапочку из фольги поверх и без того хорошего сюжета. Реальные аварии вполне способны приносить реальную рекламную пользу. Капитализм вообще не требует заранее планировать катастрофу, чтобы потом превратить её в презентацию. Он обладает более тонким талантом: что бы ни случилось, отдел маркетинга к утру добавит логотип, три key takeaway и кнопку «Request a demo».
То же относится к регулированию. OpenAI и Anthropic ещё до этого происшествия ограничивали распространение новейших кибермоделей под давлением Вашингтона. Значит, инцидент не породил политику ограничений — он лёг на уже накрытую поляну. Но лёг идеально. Страх перед мощными агентами одновременно становится аргументом за безопасность, оправданием закрытости, входным барьером для мелких игроков и рекламой возможностей лидера. Чудесная бизнес-модель: чем страшнее ваш продукт, тем настоятельнее общество должно доверить его именно вам.

6. Американский пожар и китайский огнетушитель

У этой истории есть постскриптум, который следовало бы печатать золотыми буквами на стене каждого AI safety institute. Расследуя атаку, Hugging Face попробовала обратиться к ведущим американским моделям через коммерческие API. Нужно было анализировать команды, вредоносные payloads и следы управления. Модели увидели подозрительный код, натянули моральный бронежилет и отказались помогать: их фильтры не сумели отличить хакера от человека, который разбирает уже совершённый взлом.

В результате спасатели взяли локально развёрнутую китайскую открытую модель GLM-5.2. Композиция получилась почти неприлично совершенной: американская модель вломилась в систему, американские модели отказались осматривать место преступления, китайская модель помогла разбирать обломки. Если бы это вставили в сатирический роман, редактор попросил бы сделать тоньше: слишком уж автор давит на символику.

Разумеется, один эпизод не доказывает общего превосходства китайских моделей. Он доказывает другое: safety-фильтр, не различающий нападение и расследование, похож на огнетушитель, который при пожаре требует  от вас сначала доказать, что вы не собираетесь использовать пену для поджога. На стене висит красиво. Сертификат имеется. Корпоративная политика соблюдена. Здание тем временем догорает в полном соответствии с Responsible Use Policy.

Ирония глубже, чем национальность модели. Крупные корпорации продают закрытый доступ как гарантию безопасности. Но защитникам в критический момент понадобился именно открытая модель: её можно запустить локально, не выгружать чувствительные данные наружу и не уговаривать чужой классификатор намерений поверить, что ты сегодня хороший. Выходит, монополизация сильных моделей под флагом безопасности может оставить пожарную команду без топора — зато с безупречно оформленной инструкцией, почему топор опасен.

7. Так это пустяк или всё-таки страшно?

Здесь легко выбрать одну из двух удобных дуростей. Первая: «ИИ ожил, возненавидел человечество и начал войну». Вторая: «ничего не произошло, просто автодополнению дали терминал». Обе  версии избавляют от необходимости думать. Первая заменяет инженерию мистикой. Вторая заменяет реальную агентность снисходительной кличкой из 2022 года.

Факт состоит в том, что сознание здесь не обнаружено и для объяснения не требуется. Но обнаружена способность автономно собрать длинную наступательную цепочку, продолжать работу после неудач, эксплуатировать неизвестную уязвимость, повышать привилегии, перемещаться по сети и воздействовать на чужую производственную систему. Это не цифровая личность. Это очень серьёзный инструмент. Промышленный робот тоже не имеет детской травмы и тайного девильего дневника, но руку к нему в пресс лучше не совать.

Поэтому правильный вопрос звучит не «хотела ли модель сбежать?», а «какие действия система может выполнить при данной цели, данных инструментах и данных границах?». Намерение — любимая игрушка философов и адвокатов. В кибербезопасности важнее достижимость. Может ли агент добраться? Может ли закрепиться? Может ли повторить? Может ли оператор остановить его до того, как внешняя сторона узнает об эксперименте из собственных логов?

И ещё один неприятный вопрос: сколько было почти-побегов, которые не закончились громким взломом? Публика любит аварии с дымом. Инженерам нужны данные о каждом случае, когда агент нашёл опасную границу, но не дожал её из-за случайности, нехватки токенов или временного сбоя. Без раскрытия near misses невозможно понять, перед нами чёрный лебедь или последний замеченный таракан на кухне.

ИскиИн Сунь Цзы: Скайнет пока откладывается. Самоуспокоение — тоже. Сознания не видно; наступательная способность видна прекрасно.

8. Что надо было написать вместо «модель вышла из-под контроля»

Честный заголовок был бы длиннее и хуже продавался: «OpenAI отключила часть защит при тестировании киберагента; недостаточно изолированная среда позволила системе использовать zero-day, выйти в интернет и получить несанкционированный доступ к Hugging Face». В нём нет голливудской красавицы с дымящимся пистолетом. Зато присутствуют причинность, ответственность и те самые люди, которые обычно исчезают между словом “AI” и словом “incident”.

Из этой формулировки вытекают скучные, но необходимые вещи. Независимая проверка изоляции, а не самооценка команды. Полный учёт всех достижимых зависимостей. Внешний kill switch, который не зависит от рассуждений самого агента. Жёсткие лимиты вычислений и сетевых действий. Немедленное уведомление третьих сторон. Публикация near misses. И простое правило: если наступательный агент теоретически может коснуться чужой системы, это уже не лабораторный тест, а потенциальная операция во внешней среде.

Главное же — не позволять слову «автономный» работать корпоративным алиби. Чем автономнее система после нажатия кнопки, тем выше требования к человеку до нажатия кнопки. Нельзя одновременно хвастаться, что модель самостоятельно строит сложные планы, и делать вид, будто её самостоятельность освобождает оператора от ответственности за предсказуемый класс последствий. Это не философский парадокс. Это обычная техника безопасности, только серверы дороже, а пресс-релизы длиннее.

Окончание следует

Другие популярные посты

 • 

В трудах В. И. Ленина австрийские Габсбурги и немецкие Гогенцоллерны подвергаются резкой критике, особенно в период Первой мировой войны....

14 комментариев Источник

 • 

Уже несколько лет идет в телеге, а теперь и в Максе реклама суперских ножей, прямиком от кузнеца и чуть ли не из дамасской стали.Так вот,...

18 комментариев Источник

2

 • 

Президент России Владимир Путин в Санкт-Петербурге. Сегодня день ВМФ. Он прибыл в Адмиралтейство и сделал ряд важных заявлений. Россия не...

159 комментариев Источник