8 сентября 2026 года OpenAI опубликовала прикладной кейс: аспирантка MIT Беатрис Янкелевич (Beatriz Yankelevich) подключила GPT-5.6 Sol через Codex к лабораторному софту группы Engineering Quantum Systems (EQuS) и дала агенту самому гонять калибровку сверхпроводящих кубитов.
Это не новый id модели, не changelog ChatGPT и не скачиваемые веса. Компания показывает, как уже существующий агент встаёт в контур, где после изготовления, корпусирования и охлаждения чипа с железом разговаривают только программы.
Откуда это известно
Первичка, пост OpenAI в разделе Applied AI от 8 сентября. К нему приложен технический case study от 4 сентября: «Agentic Calibration of Superconducting Qubits». Авторы с MIT: Янкелевич, Jeffrey A. Grover и William D. Oliver. Со стороны OpenAI в PDF стоят Eva Zhang и JonLuca DeCaro.
Вклад в конце PDF прямо разделён. Инфраструктуру агента и сами эксперименты делали авторы MIT. OpenAI дала советы по контуру и комментарии к тексту. Это кейс лаборатории, который компания выложила у себя в блоге, а не заявление, что OpenAI собрала квантовый процессор.
Зачем это человеку с сайтом или сервером
Новой кнопки в пикере моделей нет. Практический смысл в схеме, а не в холодильнике на милликельвинах. Codex получил skills под конкретные измерения, тонкий доступ к живому оркестратору через Jupyter MCP и право крутить параметры, смотреть графики и решать, что делать дальше. На чистом сигнале это экономит ночь исследователя. На шумном без руки уже не работает.
Если вы уже гоняете Codex по репозиторию, боту или VPS, здесь те же развилки, только ставка выше: данные лаборатории уезжают в облако вендора, агент трогает живое железо, а «успешный график» ещё не значит, что физика понята. Для боевого сайта и root это по-прежнему плохой шаблон, не референс.
Как устроен контур
Сверхпроводящие кубиты EQuS охлаждает почти до абсолютного нуля в dilution refrigerator. Импульсы идут с комнатной электроники по кабелям, ответ оцифровывается и разбирается софтом. Калибровка, это цепочка зависимых измерений: частота резонатора задаёт readout, амплитуда импульса задаёт π-импульс, дальше уже времена когерентности. Свойства плывут. Неожиданное поведение даёт кривой сигнал. Опытный человек это видит и меняет план.
В PDF агент работал на GPT-5.6 Sol в режиме Ultra reasoning. Запускали его из приложения Codex, без отдельного тяжёлого harness: поверх оркестратора группы стоял простой Jupyter MCP. Доступ: живые параметры, программы, графики, сырые данные, логи, база измерений, плюс право строить графики в ноутбуке и вести лабораторные заметки в Markdown.
Skills под измерение, по тексту PDF, собирали несколько месяцев. В skill кладут шаблон запуска и разбора, какие калибровки обязательны заранее, как выбирать параметры, типичные физические причины провала, признаки удачного и неудачного результата и примеры графиков обоих видов. Отдельно авторы пишут: расписать failure modes в skill оказалось одним из рабочих способов поднять качество, сильнее чем «просто дать доступ».
Что агент сделал на шести кубитах
Чип стандартный для бенчмарка фабрикации EQuS, раньше его не мерили. Шесть несвязанных кубитов: четыре с фиксированной частотой, два перестраиваемых по потоку. У каждого свой readout-резонатор. Номинально кубиты одинаковые, после фабрикации ведут себя по-разному.
Агент нашёл все шесть резонаторов. В протоколе Codex они стоят примерно на 7.2920, 7.3770, 7.4715, 7.5585, 7.6580 и 7.7520 ГГц, с шагом как у шестиканальной multiplexed-схемы. Punchout, сдвиг резонатора когда импульс уже возбуждает кубит, агент увидел на всех шести. Рабочие мощности readout в этом прогоне он оценил примерно от −31 до −34 дБм.
Дальше на фиксированных кубитах прошли стандартные калибровки: частоты переходов, импульсы управления и считывания, сколько кубит держит квантовую информацию. По PDF, из 40 целевых измерений на четырёх фиксированных кубитах исследователь вмешался, чтобы поправить результат, только в четырёх. В блоге OpenAI это сформулировано мягче: при ясном сигнале стандартная цепочка часто закрывалась почти без руки.
На перестраиваемом кубите сигнал слабее, особенно далеко от максимума частоты. Там агент сначала упёрся в шум, сам решил, что фича слишком слабая для хорошего fit, и остановился. Исследователь расширил диапазон потока и подсказал параметры. Финальный принятый скан всё равно содержал лишнюю моду около 4.8 ГГц, вторую переходную линию и необъяснённую асимметрию, скорее физическую. Авторы прямо пишут: отличить «это важно для цели» от «это можно игнорировать» агенту пока трудно.
После калибровки в нуле потока агент запустил цикл оркестратора по сетке потока: когерентность в каждой точке, параметры меняются программно, провальные точки пропускаются. Цикл шёл 12 часов ночью и снял 200 измерений. Агент смотрел прогон и потом руками разобрал несколько сбоев.
Где схема ломается
Авторы не прячут потолок. Агенты хорошо идут, когда отношение сигнал/шум высокое и кубит ведёт себя как в учебнике. Даже в удачных прогонах они, по их же наблюдению, обычно медленнее опытного человека: нет лабораторной интуиции, тянут ложную ветку, не видят очевидную физическую причину провала.
Само измерение длится от секунд до десятков минут и идёт последовательно. Узкое место, физический съём, а не генерация токенов. Рой агентов здесь не ускоряет задачу перебором: железо одно, импульсы в очереди. Тонкая настройка модели «под интуицию экспериментатора» в тексте названа возможным следующим шагом, не фактом.
Чип в кейсе простой. Опытный человек характеризует набор фиксированных кубитов примерно за день, перестраиваемых примерно за неделю. Новые многокубитные схемы с связями заметно тяжелее: там уже писать софт управления и разбора. Codex это ускоряет. Отдельный плюс, который называют авторы: править код и сразу проверять его живым измерением, а не только симуляцией.
На длинной дистанции drift ещё не разбирали. Поток плывёт, времена когерентности гуляют, дефект на чипе может внезапно стать лишней модой. Завтра падает то, что вчера прошло. Тогда надо возвращаться на десятки шагов назад. Это ограничение кейса, не обещание «агент дежурит сам весь сезон».
Что проверить, если подключаете своего агента
Повторять dilution refrigerator не нужно. Повторять ошибки контура тоже не стоит. Если схема из PDF вам вообще близка, я бы начал с проверки по этому списку, а не с «дать агенту всё».
- Есть ли skill не «как нажать Run», а с failure modes, чужими плохими графиками и обязательными предварительными калибровками.
- Какой у агента периметр: Jupyter MCP и оркестратор у EQuS, не root сервера и не боевой WordPress.
- Куда уезжают сырые данные, логи и графики. Здесь это Codex и GPT-5.6 Sol, то есть контур OpenAI.
- Кто смотрит неоднозначный график. В кейсе на шуме без человека fit принимали ошибочно.
- Есть ли ночной цикл с пропуском сбоев и утренним разбором, а не надежда, что 12 часов пройдут идеально.
- Не путаете ли вы Ultra reasoning и дешёвый чат. Режим в PDF назван явно, цены в посте нет.
Янкелевич в блоге описывает бытовой режим так: агенты крутят измерения ночью или пока она в чистой комнате, она заглядывает с телефона и вмешивается, если надо сменить направление. Это про регулярную рутину стандартных чипов, не про «нейросеть сама открыла новую физику».
Чего в этом тексте нет
Нет нового API, нет новой модели в пикере, нет открытых весов и нет Linux-клиента. Нет тарифа. Нет обещания, что агент быстрее человека на живом железе. Нет доказательства, что так можно калибровать связный многокубитный эксперимент без постоянного ревью. Нет данных про доступ из РФ: в первоисточнике этого вопроса нет.
Маркетинговая рамка блога, «ИИ помогает квантовым экспериментам», здесь честнее читается как «агент закрывает рутинную калибровку стандартного чипа, когда сигнал понятный». EQuS теперь регулярно отдаёт таким агентам обычную характеризацию, потому что таких чипов много, а лучший из них ещё надо найти. Это экономия календарного времени исследователя, не отмена экспериментатора.
Если завтра кто-то принесёт этот кейс как аргумент выключить проверки «чтобы завелось» или скормить агенту чужие ключи и боевой проект, в PDF этого рецепта нет. Там как раз наоборот: узкий skill, живой оркестратор, рука на шумном сигнале.