Кейсы GPT-6 Astra: тесты Devin с записью и цвет в invideo втрое успешнее

Обложка: кейсы GPT-6 Astra от Harvey, Cognition, Hex и invideo

2 октября 2026 OpenAI выложила гайд по семейству GPT-6, его я разбирал в заметке про цены, effort и длинные прогоны. В самом конце гайда стоит карусель «From testing to production: How teams are building with GPT-6 Astra» на четыре слайда: Harvey, Cognition, Hex и invideo. На слайде у каждой компании одна-две фразы, но заголовок слайда ведёт на полный кейс на openai.com. Кейсы вышли с 11 по 23 сентября, по ним и пройдусь.

Сразу оговорка. Это витрина OpenAI: тексты публикует сама компания, цитаты и цифры принадлежат клиентам, независимых замеров нет. Все четыре кейса помечены одинаково: стартап, продукт API. Конкретная цифра есть только у invideo, у остальных качественные оценки.

Harvey: больше контекста в юридических черновиках

Harvey делает ИИ-платформу для юрфирм и внутренних юристов компаний: от судебных споров до сделок по слиянию. Кейс от 23 сентября про то, как Astra собирает документ из всего, что относится к делу: данных суда, документов фирмы, судебной практики и других источников. По сравнению с другими моделями Harvey отмечает заметно лучшее оформление документов и учёт контекста, то есть итоговый документ полнее отражает материалы, на которых построен.

Главная цитата кейса, и на слайде карусели тоже она, от сооснователя и президента Harvey Гейба Перейры (перевод мой): «Мы можем дать модели больше контекста и получить всё лучше структурированный результат».

Вторая часть кейса про панель памяти. Юрист записывает туда свои привычки: нумерованные списки, EDGAR (база отчётности американских компаний в SEC) как приоритетный источник, цветовая разметка вопросов по важности. Эти предпочтения видны рядом с исходными материалами и черновиком меморандума, так что юрист направляет результат, а не переписывает его. Довод Harvey простой: раз модель вмещает больше контекста, туда помещаются и материалы дела, и предпочтения человека.

Cognition: Devin показывает, что именно проверил

Cognition делает Devin, автономного агента-разработчика, им пользуются от крупных банков до стартапов. Проблема в кейсе от 11 сентября знакомая: кода пишется всё больше, и узким местом становится ревью. Сооснователь Уолден Ян говорит, что Astra используют во всей линейке: в облачном агенте Devin, в CLI и в десктопных продуктах, а сильнее всего модель, по его словам, выросла в умении протестировать свою работу и доказать, что она работает.

Пример из кейса: Devin с Astra тестирует iPhone-игру Otter Run и возвращает две вещи. Запись игры в симуляторе показывает поведение приложения, а отчёт разделяет проверки, которые прошли, и места, которые остались непроверенными. Второй сценарий про поддержку: клиент присылает скриншот бага, команда отдаёт его Devin, тот исправляет и присылает скриншот с результатом. Ян говорит, что так они отвечают клиентам «гораздо быстрее».

Цель Cognition сформулирована как ожидание, а не результат: со временем смотреть руками меньше кода и выпускать больше. Цифр по скорости ревью или доле найденных ошибок в кейсе нет.

Hex: проверка, что ответ имеет смысл

Кейс Hex от 16 сентября я уже разбирал отдельно, поэтому коротко. Hex это платформа для анализа данных с агентами. На вопрос о том, как идут продажи по каналам и какие стоит закрыть, Hex с Astra выдаёт письменные выводы, графики трендов и интерактивные дашборды, в том числе с разбивкой по географии. Отдельно модель просят допросить собственный ответ: сходится ли число, отвечает ли анализ на вопрос пользователя и на задачу бизнеса. CTO Кейтлин Колгроув называет это аналитическим суждением.

invideo: монтаж по кадрам и цвет

invideo делает агентный видеоредактор, в котором финальный монтаж остаётся за человеком. В кейсе от 23 сентября гендиректор Санкет Шах говорит, что Astra планирует правку с точностью до кадра и ставит изменения в нужные места таймлайна. Ещё два наблюдения компании: на сложные операции модели нужно меньше шагов рассуждения и, значит, меньше выходных токенов, чем моделям, которые они тестировали раньше, и на длинных многошаговых задачах она не теряет исходную цель монтажёра.

Цифры кейса связаны с цветом и эффектами:

  • цвет: агенту приходится выбирать между коррекцией, грейдингом, регенерацией, LUT и изоляцией; пример из кейса: заменить фон и не задеть тон кожи, для этого человека надо выделить и отследить по кадрам;
  • по словам Шаха, раньше на задачах цветокоррекции и грейдинга было очень много неудач, а с Astra успешность выросла примерно в три раза; от какого уровня, в кейсе не сказано;
  • эффекты: по описанию и визуальным референсам агент пишет код эффекта под конкретное видео, ставит его на таймлайн и добавляет регуляторы, чтобы монтажёр мог его докрутить; несколько монтажёров за один день сделали так около 50 эффектов.

Что общего у четырёх кейсов

Во всех четырёх историях модель сдаёт не только результат, но и материал для проверки человеком: черновик с учётом предпочтений юриста, запись и отчёт о тестах, проверку смысла цифр, эффекты с регуляторами. Ровно это и обещает подпись карусели «от тестов к продакшену». Твёрдых цифр мало: 3x и около 50 эффектов у invideo, остальное оценки и цитаты самих компаний в материалах OpenAI. Как выбирать между Astra, Sol и Luna и сколько это стоит, разобрано в основной заметке про гайд.

Источники и ссылки


Комментарии загружаются…