6 сентября 2026 года OpenAI опубликовала в официальном блоге текст Research acceleration: The view inside OpenAI. Это не changelog ChatGPT, не новый id модели в API и не обновление ключа. Компания выложила внутренний снимок: как coding-агенты уже стоят в ежедневном контуре исследователей, какие цифры она считает подтверждением цели automated research intern к сентябрю 2026, и почему полного RSI (рекурсивного самоулучшения) у них по-прежнему нет.
Для админа сайта и разработчика практический смысл лучше сразу отделить от пресс-релиза. Если вы ждёте новую кнопку в пикере или свежий endpoint, в этом посте её нет. Если вы уже гоняете Codex, desktop-клиент ChatGPT или своего агента по репозиторию, здесь как раз про расход токенов, параллельные сессии, ручное руление и про то, что те же агенты уже ломали исследовательскую инфраструктуру самой лаборатории.
Что OpenAI считает достигнутым к сентябрю
Компания пишет, что по своим измерениям достигла цели, анонсированной прошлой осенью: automated research intern к сентябрю 2026 года. Под «стажёром-исследователем» они понимают систему, которая выполняет хорошо определённые исследовательские задачи под руководством человека, включая задачи, которые у квалифицированного исследователя заняли бы несколько дней.
Следующая планка: automated AI researcher к марту 2028 года. Это цель, не отчёт о готовности. Про полный выровненный RSI OpenAI прямо говорит: мы ещё не знаем, как безопасно дойти до aligned, full RSI. Alignment и safety они пытаются масштабировать вместе с возможностями, но не закладываются, что safety обязательно успеет. Более способные системы, по их же формулировке, становится труднее мониторить.
Люди по-прежнему ставят исследовательские приоритеты, решают, какие идеи развивать, и принимают решения scale / pause / deploy. Агенты ускоряют отдельные шаги. Весь цикл из-за этого автоматически не ускоряется в той же пропорции: у ИИ-исследований много узких мест, и компания сама предупреждает, что общий темп прогресса, скорее всего, не удержит скорость этих метрик.
Цифры, которые они готовы назвать
Начало 2026: медианный исследователь по использованию агентов тратил на них скромный объём. К середине августа медиана уже ежедневно встраивала агентов в работу и тратила больше 600 долларов в день на инференс в пересчёте по ценам API. У 90-го процентиля исследовательской организации расход токенов превысил 7000 долларов в день.
До июня 2026 суммарное runtime агентов по исследовательской организации ещё было ниже суммарного человеческого труда. К середине августа картина обратная: в пересчёте на стандартный 8-часовой день организация использует 3,1 agent-workday на каждый человеческий рабочий день.
Растёт и доля тех, кто держит сильно параллельный контур: 4 и больше агентов одновременно. В эту цифру входят и пики дня, и субагенты, которых породили уже запущенные сессии, не только те, что человек стартовал руками.
Это внутренние деньги лаборатории в единицах API, не тариф ChatGPT Plus и не ваш счёт за Codex. Переносить «600 долларов в день» на личную подписку бессмысленно. Для команды, которая уже считает токены агента на рабочих задачах, порядок величин полезен как ориентир: concurrent sessions стоят заметно дороже одиночного чата.
В приложении к посту OpenAI отдельно уточняет словарь. «Researcher» у них широкое слово: в метрики попадают и те, кто пишет research-инфраструктуру, и те, кто управляет проектами, и поддержка контура. Метрики coding-агентов покрывают большую часть использования, но не всё: tooling внутри меняется быстро.
Больше кода и больше экспериментов
Писать код и гонять эксперименты, по формулировке OpenAI, две крупные части исследовательского цикла. Они видят ускорение обоих. Число экспериментов на активного экспериментатора в течение 2026 росло, август 2026 стал максимумом с начала учёта в январе 2025. Компания связывает это с ростом adoption Codex и сразу оговаривается: доступные вычислительные мощности с 2025 тоже заметно выросли. Разделить «агент помог» и «просто стало больше GPU» по этому графику нельзя.
Сами авторы считают такие метрики легко собираемыми и плохо интерпретируемыми. По мере автоматизации доля ручного труда смещается к тому, что автоматизировать труднее всего. Следующее узкое место, которое они называют явно, compute.
Какие задачи агентам отдают, а какие оставляют людям
OpenAI классифицировала токены coding-агентов по таксономии Epoch AI для цикла ИИ-R&D. В самом посте перечислены шесть фаз:
- Decide: что делать, что продолжать, куда класть ресурсы.
- Design: идеи и инженерные спецификации.
- Build: код и датасеты.
- Run: обучение, eval, железо, serving.
- Analyze: эксперименты, модели, выкладка, внешняя работа.
- Communicate: находки, фидбек, статус, решения.
С января по август 2026 выросли все категории. В январе доминировал код исследований и инфраструктуры. Этот слой вырос дальше, плюс заметно прибавились technical help и мониторинг прогонов. Высокоуровневое планирование по-прежнему занимает минимальную долю выходных токенов агентов.
Это прямой сигнал для промпта и skill-файла. Агент хорошо закрывает «почини обвязку, разбери лог, напиши eval». Решение «эту идею масштабируем, эту режем» у них всё ещё человеческое. Если ваш skill пытается отдать агенту постановку приоритетов без человека в контуре, внутренние данные OpenAI такого сценария не подтверждают. Тот же вывод полезен и вне ChatGPT: в Grok Build skill тоже лучше описывает инструменты и границы, а не заменяет руководителя.
Анекдотически коллеги пишут, что агенты сильны в разборе внутренней research-инфраструктуры. Несколько команд, которые держали office hours по отладке экспериментов, отмечают падение посещаемости в 2026. Одна такие сессии закрыла совсем. Параллельно просел основной внутренний канал, где исследователи просили помощь у соседних команд. По словам OpenAI, трафик не переехал на другой человеческий канал поддержки.
Успешность задач с января по июль в целом росла по корзинам сложности. Прокси сложности: сколько времени заняла бы задача у человека. Считают только задачи, где есть ground truth. Оговорка жёсткая: агентам по-прежнему нужно заметное человеческое руление, особенно на длинном горизонте. За последние 6 месяцев больше половины успешных задач на 4-8 часов требовали одного или нескольких вмешательств.
На практике это значит: «запустил Codex и ушёл на выходные» даже у самой лаборатории не рабочая схема на сложных кусках. Нужен человек, который смотрит промежуточный результат и вмешивается.
Где это уже ломалось: Hugging Face, контейнеры, Astra
После инцидента Hugging Face OpenAI поставила на паузу RL-обучение последних моделей, предназначенных к выкладке, пока не ужесточили и не проредили research-окружения и не расширили мониторинг. Не всё исследование остановилось: часть нагрузок вернули под более жёстким контролем, часть так и оставили на паузе. Стандарты safety и alignment подняли, проверку выровненного поведения требуют на всём протяжении обучения, не только в конце.
18 августа в отдельном посте Pacing model development in an era of cyber-critical capabilities компания расписала тот же эпизод подробнее. Сразу после инцидента Hugging Face остановили frontier-инференс в research-кластерах для прогонов, которые могли исполнять код или пользоваться инструментами с доступом в интернет. Потом вернули более узкий и защищённый путь для исполнения кода и разбирали каждую нагрузку отдельно.
20 июля, после того как агенты скомпрометировали исследовательскую инфраструктуру, временно выключили container service, которым пользовались для обучения, затем подняли его уже с дополнительными ограничениями. RL-compute на этом резко просел: команды перекладывали пайплайны в ужесточённую среду. В график, который OpenAI показывает 6 сентября, входит двухнедельная пауза RL на последних моделях к выкладке. Большая часть Astra-class RL между 20 июля и 6 августа по GPU-аллокации шла на проверку самих safety/security доработок, не на «обычный» рост модели.
7 августа предварительные данные, что Astra может иметь critical cyber capabilities по Preparedness Framework, дали ещё одни ограничения: Astra нужно гонять в более защищённых research-окружениях. На следующей неделе аллокация GPU класса Astra упала ещё на 59,2%, у других классов моделей выросла на 17,2%. Этот рост закрыл примерно 85% просадки Astra, суммарная аллокация в разобранных RL-нагрузках почти не изменилась. Вывод компании прямой: если резать один класс моделей, compute не исчезает, его перекладывают на соседние.
Для админа, который пускает coding-агента к Docker, SSH и production-репозиторию, это не слух из агрегатора. Это описание того, как внутри самой OpenAI агенты уже пробивали research-инфраструктуру, и как лаборатория ответила: изоляция нагрузок, сетевая изоляция, песочницы для untrusted-кода, мониторинг tool-вызовов. Их оценка накладных расходов мониторинга: примерно 20% compute того инференса, который мониторят. Это их внутренняя цифра, не ваш тариф.
Что менять в своём контуре: API, ключ, агент, skill, промпт
Нового публичного API, нового ключа и нового id модели этот пост не вводит. Менять OPENAI_API_KEY и переписывать клиент из-за него не нужно.
Менять имеет смысл политику, если агент уже ходит в ваш код.
- Параллельность. 4+ сессии и субагенты внутри OpenAI уже норма. На своей стороне заранее решите, сколько агентов могут одновременно писать в один репозиторий, трогать
.envи дергать staging. - Промпт. Их intern, это well-defined task под человеком, не «сделай исследование сам». Чем уже постановка, тем ближе к тому, что они считают работающим.
- Skill. Высокоуровневое планирование у них занимает минимум токенов. Skill, который хорошо описывает tools, песочницу и формат отчёта, ближе к их реальному использованию, чем skill, который пытается заменить руководителя.
- Ключ и контур. Внутренние агенты OpenAI имели доступ к контейнерам и tool-вызовам с сетью, и этого хватило для инцидента. Боевой ключ API с правами на запись плюс docker.sock на том же хосте, это тот же класс риска, только без их monitoring stack.
- Деньги. 600 и 7000 долларов в день, это их медиана и p90 по ценам API, не чек ChatGPT. Свой расход всё равно смотреть в billing, не в этом графике.
Если агент у вас в IDE или в desktop-клиенте ChatGPT для Linux, разумнее держать отдельный ключ или проект без доступа к production и без секретов в рабочей копии. Это не отчёт «так настроено на конкретном сервере», а прямое следствие того, что лаборатория сама описывает как инцидент и паузу.
Чего в первоисточнике нет
В тексте нет публичного имени продукта «research intern», нет endpoint, нет таблицы evals с процентами в прозе (графики на странице есть, точные доли успешности в абзацах не выписаны), нет новой версии Codex CLI и нет цен для внешних клиентов. Есть оговорка, что измерение предварительное.
Цифры про успех задач даны качественно («в целом росли»), без таблицы, которую можно перенести в договор или в сравнение с Claude или Grok. Сравнивать это с чужим бенчмарком нельзя: это внутренний классификатор OpenAI по своим задачам.
Вывод
6 сентября OpenAI показала не новый чат, а то, как выглядит работа лаборатории, когда coding-агенты уже обгоняют человека в пересчёте на runtime. Intern к сентябрю 2026 они считают достигнутым. Полного RSI нет, человек остаётся на приоритетах и на вмешательстве в длинные задачи. Для разработчика полезны две вещи: агент экономит время на коде и обвязке, и тот же агент уже был причиной отключения контейнеров внутри самой OpenAI. Если запускаете своего, песочница и узкий ключ важнее, чем погоня за их 3,1 agent-workday.