2 октября 2026 года ServiceNow CoreAI опубликовала на Hugging Face разбор AutoSynthData. Пайплайн берёт провалы целевой модели в своей среде и собирает из них новые задачи на дообучение. Если бот сидит на ваших инструментах, а не в общем чате, здесь интересен отбор: задача должна выполняться, звучать как живая просьба и пока не даваться модели стабильно.
Задача у них записана тройкой. Системная спецификация, промпт пользователя и verifier. Спецификация держит инструкции, политики и стартовое состояние: в примере из поста это засеянная база или набор статей. Промпт говорит, чего хотят от агента. Verifier смотрит, сошёлся ли итог.
Промпт они пропускают через три фильтра, и это не украшение. Выполнимость: в текущей среде есть хотя бы один маршрут, который закрывает просьбу и не ломает политику. Реалистичность: так мог бы написать человек, а не генератор, которому надо усложнить пример. Сложность: способность ещё не закрыта надёжно. То, что модель и так решает, для обучения почти пустое.
У verifier отдельные требования, их легко смешать с качеством текста. Проверка должна совпадать с просьбой, спецификацией и стартовым состоянием. Неверный итог не проходит. Верное решение принимается, даже если цепочка вызовов не скопировала эталон. Слабый verifier наградит мусор. Слишком узкий накажет нормальный обход.
Карточки способностей
Дальше оба прогона на диагностических задачах: целевая модель и более сильный учитель. Из логов вытаскивают, какую способность мерили, какие инструменты и какой каркас сценария, где цель упала и чем прошёл учитель, каким должен быть верный финал и какие куски можно менять, не теряя саму способность.
Это сжимают в очищенные карточки. Генератор не получает исходные промпты, сущности, траектории и детали verifier. Ему отдают карточки, и он собирает новые задачи: другие формулировки, другое состояние, другой путь.
Target и Multiply
Сначала фаза Target, ядро набора. Воркеры параллельно делают независимые задачи. Кандидат идёт через проверку, исполнение в среде, оценку солверами и починку. В конфигурации из поста оставляют то, что цель решает не больше чем в одном из трёх заходов, а сильный солвер минимум в двух из трёх.
На каждый пример два шлюза. Positive: эталонную траекторию исполняют и сверяют состояние с verifier. Так видно, не разъехались ли промпт, старт, решение и критерий успеха. Negative: ожидаемый итог портят и смотрят, что испорченное уже не проходит. Иначе verifier ставит зачёт без нужного поведения.
Сломанный кандидат не выбрасывают с порога. Критик читает сбой: кривое состояние, невыполнимый сценарий, плохая траектория, дырявая проверка, мимо карточки способности. Чинка точечная, число повторов ограничено. После неё те же шлюзы заново.
Multiply размножает уже принятое. У варианта свои просьба, состояние, сущности, эталон и verifier, и он проходит те же проверки. Семеном для следующего Multiply такой вариант брать нельзя. Иначе набор уползает от проверенного ядра.
Пачку смотрят ещё и целиком. Если одна семья задач забила датасет, а какой-то разрыв пустой, контроллер урезает генерацию в сытом углу и докидывает работу в дырку.
Hybrid и ITSM
Среду взяли из EnterpriseOps-Gym. В посте это стенд, не метафора корпоративного агента. На карточке датасета лицензия Apache-2.0, агент ходит в контейнеры по MCP, а зачёт ставится по итоговому состоянию SQL-проверками. AutoSynthData гоняли на двух доменах этой среды: Hybrid и ITSM. Пост отсылает к статье Malay et al., 2026, по самой среде.
На Hybrid цель Gemma-4-26B-A4B-it, учитель Qwen3.8-27B. Примерно за 18 часов собрали 2 000 синтетических примеров, дообучили Gemma и сравнили чекпоинты. Лучший назван пятой эпохой. Средний Pass@1 вырос на 7,2 процентных пункта, относительный прирост 35%. Успех verifier поднялся с 63,01% до 68,55%. Это две разные строчки. 68,55% не новое значение Pass@1.
Там же написано, что закрыто 59% исходного разрыва Pass@1 между Gemma и reference model. Имени reference в абзаце нет. Подставлять вместо него учителя Qwen3.8 нельзя: пост их не уравнял. Генератор оценочные задачи не видел. Прирост заявлен внутри Hybrid того же зала, не на чат-бенчмарке.
ITSM, та же Gemma-4-26B-A4B-it, учитель уже DeepSeek-V4.1-Flash. 1 994 примера за 66 часов. Дольше, потому что учитель крупнее, и этот прогон шёл до оптимизаций пайплайна. Hybrid в тексте назван следующим. Средний Pass@1 с 18,77% до 27,18%. Цифры verifier, как на Hybrid, для ITSM не приведены.
Ссылки на код AutoSynthData, на эти тысячи примеров и на веса после SFT в посте нет. Скачивается среда, датасет EnterpriseOps-Gym. Опыты в тексте это supervised fine-tuning. Reinforcement learning упомянут как следующий заход: задачи у границы текущей политики, обучение, потом сдвиг границы. Такого прогона здесь нет.
После дообучения задачи, которые модель уже закрывает надёжно, для следующего круга менее полезны. Оставшиеся провалы задают новую генерацию. На своём боте схема жива только там, где итог можно проверить по состоянию. Переписка в чате без такого verifier этот пост не включает.