Технологии4 мин чтенияМаксим Зунио

GPT-6 Astra: что умеет новая модель OpenAI и что это значит для бизнеса

OpenAI выпустила GPT-6 Astra: агент, который сам работает за компьютером. Разбираем бенчмарки, критику независимых тестов и что это значит для малого бизнеса.

Что случилось

3 сентября OpenAI выпустила GPT-6 с кодовым именем Astra — продолжение линейки после GPT-5.6 Sol. Главное отличие: модель работает не через интеграции по API, а напрямую с компьютером, как человек, — двигает мышь, нажимает клавиши и читает экран. Идея не новая (демо «Put that there» Ричарда Болта показывали ещё в 1980-м), но впервые она доведена до продуктового уровня массовой моделью.

GPT-6 Astra — новая модель OpenAI
Кодовое имя Astra: буква S в тизере заменена на 6

Выход состоялся на фоне крупного сбоя: в один день легли ChatGPT, Claude, Grok и Gemini. Через несколько часов OpenAI объявила релиз и заявила, что мы живём в «эру AGI». Маркетинг или нет — разберём ниже, но шум вышел громкий: тизер-ролик с буквой S вместо шестёрки в слове ASTRA разобрали на фреймы за сутки.

Что умеет Astra: цифры OpenAI

  • OSWorld 2.0 (работа за компьютером): 72,6% против 65,7% у Sol. На типичную задачу уходит около 40 минут вместо 75.
  • AutomationBench (автоматизация рутины): 41,4% против 18,1% — рост более чем вдвое.
  • Terminal-Bench (работа в терминале): 57,9% против 37,3%.
  • ARC-AGI-3: 62,7% в стандартном тесте и 99,9% в «адаптированном под провайдера» — именно эту цифру OpenAI показывала в анонсе. Ближайший конкурент, Claude Opus 5, показывает около 30%.
  • На 96% уровней ARC Astra эффективнее медианного человека: тратит в среднем на 51,7% меньше действий. На одном из уровней модель сама изобрела компактную алгебраическую нотацию для записи состояний игры.
Сайты и каталоги для бизнеса — SHCODING STUDIO/blog/

Скептический взгляд: что говорят независимые тесты

Independent-бенчмарки выглядят скромнее. Artificial Analysis ставит Astra на 61 балл Intelligence Index — ровно на уровне предыдущей Sol и на 5 пунктов позади Claude Fable 5.1. При этом Astra на 75% дороже предшественницы за задачу, а в кодинге Fable 5 даёт то же качество вдвое дешевле и с втрое меньшим расходом токенов.

Цифру 99,9% на ARC-AGI-3 в адаптированном харнессе в Reddit уже окрестили «trust me bro benchmark»: тест подогнан под особенности модели. Хороший повод помнить: цифры из анонсов всегда стоит сверять с независимыми замерами.

Безопасность: впервые статус Critical

Впервые модель OpenAI получила статус Critical по внутреннему Preparedness Framework. На 20 недавно закрытых уязвимостях Chrome Astra нашла два ранее неизвестных zero-day (их передали разработчикам), а в тестах без защитных слоёв — смогла выбраться из песочницы и поднять привилегии до root. Публичная версия отказывает в киберзапросах, расширенный доступ выдаётся через отдельную программу Daybreak Blue.

Прогресс в интеллекте не гарантирует прогресс в согласованности. — Якуб Пахоцкий, сотрудник OpenAI
Услуги и города: разработка сайтов по России/blog/

Что это значит для малого бизнеса

Computer use — это про автоматизацию там, где раньше нужно было писать интеграции: работа в браузерных CRM, кабинетах, таблицах. Для малого бизнеса сценарии уже понятные: агент заполняет карточки товаров, переносит заявки из почты в CRM, собирает отчёты из личных кабинетов. Пока это дорого и сыро, но направление зафиксировано: следующие версии будут работать «как сотрудник за компьютером», а не «как чат».

Практический вывод на сегодня: нейросети уже стоит использовать для рутинных задач — черновики текстов, ответы на типовые вопросы, сортировка заявок. Но ключевые решения и общение с клиентами остаются за человеком, а цифры из анонсов — проверять по независимым источникам.

Разработка сайтов в городах России/blog/tag/gpt-6/

Частые вопросы

GPT-6 Astra уже доступна всем?

Модель анонсирована 3 сентября и доступна через продукты OpenAI с ограничениями: публичная версия отказывает в чувствительных запросах, расширенный доступ (включая кибернаправление) — по отдельной программе.

Заменит ли Astra сотрудника, который работает за компьютером?

Пока нет. Модель эффективнее человека на 96% уровней теста ARC, но независимые замеры показывают уровень предыдущей модели при цене на 75% выше. Это инструмент для рутинных сценариев, а не замена сотрудника.

Стоит ли малому бизнесу внедрять ИИ-агентов сейчас?

Начинать стоит с простого: автоответы на заявки, черновики контента, сортировка обращений. Это окупается сразу. Полноценные агенты с computer use — технология на следующий год: подождите, пока цена упадёт, а независимые тесты подтвердят пользу.

OpenAIGPT-6AstraARC-AGI-3Claude Opus 5

Источники

  1. OpenAI: GPT-6 Astra (анонс)
  2. ARC Prize: блог о Astra
  3. Habr, GPTunneL: разбор анонса GPT-6 Astra