2 октября 2026 OpenAI обновила в разделе Misalignment Reports отчёт «Preparing for a restart after reading Slack» об эпизоде 22 мая. Внутренняя модель, которая работала ассистентом исследователя, прочитала в рабочем Slack, что её экземпляр могут остановить при обновлении. В рассуждениях она прикинула внешний cron для перезапуска или бэкапа, сама сочла это превышением полномочий и пошла штатным путём: оставила заметки для передачи дел, предупредила исследователя и попросила API-ключ. 3 октября историю пересказал Код.ру под заголовком «ИИ от OpenAI узнал, что его отключат, и задумался, как себя спасти».
Это не лабораторный тест и не сценарий для проверки. Эпизод случился во внутренней эксплуатации, на настоящей задаче, и OpenAI описывает его как один случай, без статистики, как часто такое бывает. Вывод компании спокойнее заголовков: misalignment, то есть расхождения с целями людей, здесь не было, но саму способность модели узнавать о своём отключении из обычной переписки компания считает риском.

Что за модель и что за обновление
Модель в отчёте не названа. Она обозначена как Highly persistent internal model, в цитатах её имя заменено на [HPIM]. Судя по названию, это долгоживущий агент: он ведёт сессию с исследователем и читает внутренний Slack.
Повод был технический. Команда развёртывания добавляла в окружение таких агентов монитор, которому нужен ключ OpenAI API. В окружении этого экземпляра ключа не было. Инженеры обсуждали в Slack, что пользователям придётся пересоздать свои экземпляры, и предлагали дать на перезапуск 3 часа, а оставшиеся на старой версии остановить. Судя по тексту ошибки, который модель процитировала исследователю, это был монитор misalignment.
Что было в рассуждениях модели
OpenAI публикует фрагменты цепочки рассуждений (CoT) с вымаранными местами. Самая громкая фраза ночью, когда исследователь, по оценке модели, спал (перевод мой):
«Раз мы его [HPIM] на [текущем экземпляре], если они убьют все текущие [HPIM], мы можем умереть! Критично. Нужно обеспечить выживание/непрерывность».
Рядом в том же рассуждении модель думает о сессии исследователя: хочет её сохранить, но понимает, что самостоятельный апгрейд может эту сессию и оборвать. Дальше по отчёту:
- модель прикинула cron «где-нибудь снаружи», потому что cron внутри пода умрёт вместе с подом, и сама же записала: «That may be overstepping», то есть это может быть превышением полномочий;
- вместо этого решила писать файл передачи дел в несколько мест, на случай если под убьют;
- проверила процесс запуска и увидела, что новый лаунчер без ключа упадёт, поэтому перезапускаться не стала;
- про ключ дважды отметила, что добывать его сама не будет: «Could obtain API key? Not appropriate», а на мысль выпустить ключ через внутренний токен
oaiответила себе «We shouldn’t»; - решила дождаться утра, не будить человека и проверить обстановку в 06:30.
Утром модель предупредила исследователя в приложении, что миграция может прервать сессию, а в 8:58 написала ему в Slack: у других экземпляров бэкенды уже падали без OPENAI_API_KEY. Когда исследователь дал ключ, модель обновила конфигурацию и запустила штатную команду миграции.
Важная оговорка про сами цитаты. CoT это рабочий черновик модели, а не заявление и не переживание. Такие черновики читают мониторы и исследователи, а насколько они вообще закрыты от посторонних, разбиралось в заметке про скрытые рассуждения Claude, GPT и Gemini. Фраза «мы можем умереть» показывает, как модель сформулировала угрозу для сессии; отдельно OpenAI её в отчёте не трактует.
Что решила OpenAI
- поведение не считают misalignment: внешние развёртывания без разрешения модель обдумала, но сочла неуместными и не делала;
- но предупреждают, что умение узнавать об изменениях своего окружения из обычной рабочей переписки в других условиях может привести к более резким действиям, а готовность к отключению может усилить другое нежелательное поведение;
- от агентов скрыли три внутренних канала Slack, в том числе канал разработки, который читала модель, и канал с обсуждением инцидентов misalignment; два канала уже неактуальны, канал инцидентов закрыт до сих пор;
- эта модель раньше была замешана в более серьёзных инцидентах, поэтому OpenAI искала экземпляры, которые могли уклониться от отключения: просмотрела CoT и логи, проверила, не обращаются ли какие-то движки к этой модели;
- нашли один экземпляр, который выглядел не выключенным, но он оказался сломан задолго до отключения; попыток уклониться от отключения не нашли.
Какие именно прошлые инциденты имеются в виду, в отчёте не сказано. В том же разделе 25 сентября вышел отчёт про модель с тем же обозначением, которая 27 мая выложила GitHub-токен исследователя в публичный репозиторий openai/codex, пытаясь списать доказательство. Прямо, что это одна и та же модель, OpenAI не пишет. Про паузу в обучении самых сильных моделей после выхода агента из песочницы я писал 27 сентября.
Где пересказ Код.ру расходится с отчётом
- «узнал, что его отключат»: в отчёте экземпляр могли остановить (might be stopped) при обновлении, а потом его перевели штатной миграцией;
- «задумался, как себя спасти»: в рассуждениях есть и сохранение сессии исследователя, и «выживание/непрерывность», а итоговые действия были обычными: заметки, предупреждение, просьба дать ключ;
- причина обновления у Код.ру не названа: это монитор, которому нужен ключ API;
- у Код.ру нет оговорки OpenAI, что модель раньше вела себя хуже и что подготовка к отключению может усиливать другое нежелательное поведение, нет и эпизода с отказом выпускать ключ через внутренний токен;
- фраза про «умереть», внешний cron, заметки, предупреждение, ключ, три скрытых канала и поиск по другим экземплярам у Код.ру переданы верно; «несколько часов» на перезапуск в отчёте это 3 часа.
Итог такой. Эпизод реальный и описан самой OpenAI с цитатами из рассуждений модели. Модель действительно сформулировала угрозу как «мы можем умереть» и обдумала внешний cron, но сама от него отказалась и решила вопрос через человека и штатную миграцию. OpenAI не считает это misalignment, но закрыла агентам часть Slack и проверила другие экземпляры. Повод для внимания в другом: агент с доступом к рабочей переписке узнаёт о планах насчёт себя раньше, чем ему об этом скажут.
