GPT-6 Astra: возможности, бенчмарки и затраты на работу
Neaptide · 6 сентября 2026 г. · 7 мин чтения
Сравниваем GPT-6 Astra и Sol по восьми опубликованным бенчмаркам. Разбираем контекст, работу с инструментами, цены API и проверку пользы на собственных задачах.
В этой статье

Что такое GPT-6 Astra и кому она подходит
GPT-6 Astra — модель OpenAI для сложных задач с кодом, данными и инструментами. Её имеет смысл сравнить с GPT-5.6 Sol на работе, где нужно связать несколько шагов и часто исправлять результат. В опубликованных тестах преимущество Astra различается по задачам, а при одинаковом количестве токенов её API дороже. Для простой массовой обработки Sol или менее дорогая модель могут оказаться выгоднее.
| Параметр | Значение |
|---|---|
| Идентификатор API | gpt-6-astra |
| Контекст, токенов | 1 050 000 |
| Максимальная длина ответа, токенов | 128 000 |
| Вход / выход | Текст и изображения / текст |
| Уровни reasoning effort | low · medium · high · xhigh · max |
Например, нужно обновить каталог сайта: сохранить старые ссылки, изменить фильтры и проверить оформление заказа. Написать код недостаточно — нужно учесть все требования и убедиться, что изменения не нарушили работу других функций. На такой задаче можно проверить, помогает ли Astra сократить доработки.
Для работы с проектом модели нужна среда, например Codex. Именно среда предоставляет файлы, браузер и другие инструменты, а также определяет разрешённые действия. Выбор Astra сам по себе не даёт доступа к проекту и не разрешает публикацию сайта.
Что показывают бенчмарки Astra
В таблице — восемь результатов из анонса OpenAI; самостоятельно мы эти тесты не проводили. Источник приводит лучшие результаты при разных настройках рассуждения, поэтому это не сравнение при одинаковом времени или бюджете. Тестовая среда, инструменты и инструкции также могут отличаться от доступных в вашем Codex или ChatGPT. В последней строке указаны баллы индекса, в остальных — проценты. Во всех строках более высокое значение означает лучший результат.
| Тест | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% |
| AutomationBench | 41.4% | 18.1% |
| ScreenSpot-Pro (no tools) | 92.7% | 76.9% |
| OpenAI MRCR v2 · 8-needle · 512K–1M | 96.3% | 73.8% |
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% |
| DeepSWE v1.1 | 74.1% | 72.7% |
| GPQA Diamond | 96.0% | 94.6% |
| Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 |
Разница между моделями заметно меняется от теста к тесту. В Terminal-Bench 4.0 Astra опережает Sol на 20,6 процентного пункта, в DeepSWE — на 1,4. Поэтому эти числа нельзя свести к утверждению «Astra пишет код на столько-то процентов лучше». В Intelligence Index Astra набрала 61,2 балла, а Claude Fable 5.1 — 65,7 в той же таблице OpenAI. По этим данным нельзя объявить одну модель лучшей во всех задачах.
Какие сложные задачи стоит проверить на Astra
Разработчик может передать описание ошибки со шагами воспроизведения и попросить исправить её, а затем проверить результат. Владелец сайта — заказать конкретную функцию с заранее заданными условиями готовности. Аналитик — поручить расчёт, который другой человек сможет повторить по исходным данным.
Это примеры возможного применения, а не обещание правильного результата с первого запроса. Преимущество в бенчмарке даёт повод провести собственную проверку. Оценивать нужно и изменения в файлах, и работу интерфейса, и соблюдение исходных требований.
Большой контекст: важен не только объём
У Astra в API контекстное окно составляет 1 050 000 токенов, максимальный ответ — 128 000. У Sol такое же окно, поэтому его размер не является уникальным преимуществом Astra. Важнее, насколько хорошо модель сопоставляет требования, код и результаты проверок. Тест MRCR оценивает работу с длинным контекстом, но не доказывает, что модель без ошибок разберётся в репозитории такого объёма.
Как модель учитывает изменения в задании
Требования часто уточняются по ходу работы: сначала нужен калькулятор, затем меняется валюта и добавляется мобильная версия. Если модель забывает прежние условия, их приходится объяснять снова. OpenAI описывает у Astra более устойчивую работу с длительными задачами, но также отмечает, что модель может чаще задавать уточняющие вопросы.
В API есть механизм mid-turn steering через WebSocket: он позволяет передать уточнение во время выполнения задачи с сохранением уже выполненной части работы. Чтобы этим пользоваться, приложение должно поддерживать такую интеграцию. Само наличие Astra в списке моделей этого не гарантирует.
Что можно делать, пока инструмент выполняет запрос
Асинхронные вызовы позволяют продолжать независимые действия, пока инструмент ещё работает. Например, во время расчёта отчёта можно подготовить структуру пояснения, но выводы придётся писать после получения данных. Приложение должно поддерживать этот механизм и правильно возвращать результаты вызовов. Одной замены названия модели в настройках недостаточно.
Как сравнивать расходы на Astra и Sol
По данным на 6 сентября 2026 года стандартные цены API Astra составляют $10 за миллион входных токенов и $50 за миллион выходных. У Sol — $4 и $20. Чтение кэша Astra стоит $1 за миллион токенов. Если вход превышает 272 тысячи токенов, для всего запроса ставки входа и кэша удваиваются, а выхода — увеличиваются в 1,5 раза. Это цены API; подписка ChatGPT оплачивается отдельно.
Рассмотрим учебный запрос без кэша и платных инструментов: 20 000 входных и 5 000 оплачиваемых выходных токенов. Он стоит $0,45 у Astra и $0,18 у Sol — при одинаковом объёме Astra дороже в 2,5 раза. В фактическом счёте нужно также учитывать оплачиваемые токены рассуждения, а не только видимый текст ответа.
К расходам на запросы добавьте повторные попытки и время сотрудника. Если более дорогая модель требует меньше исправлений, доплата за токены может окупиться. Но это нужно измерить на своём процессе. Сравнивайте затраты на задачи, которые прошли проверку, включая стоимость неудачных попыток.
Как менять настройки рассуждения во время работы
Параметр reasoning effort задаёт усилие рассуждения модели. В API его можно менять через configuration_update, сохраняя начальную часть контекста для кэширования. Например, повысить настройку для поиска сложной ошибки и снизить для простого продолжения. Возможная экономия зависит от задачи и использования кэша; ставить максимум для каждой небольшой правки не обязательно.
Когда более простой модели может хватить
- Массовые задачи по фиксированному шаблону. Если более дешёвая модель уже даёт нужное качество, сначала определите, какую пользу принесёт замена.
- Короткая правка с очевидным результатом. Скорость и стоимость могут быть важнее возможностей сложного рассуждения.
- Недостающие данные или инструменты. Более сильная модель не заменит отсутствующую спецификацию и не получит доступ к закрытой системе сама.
- Авторский текст. Результат всё ещё может быть слишком длинным или шаблонным. Нужны ориентир по стилю и редактура.
OpenAI отмечает, что Astra внимательно следует инструкциям в файлах и склонна подробно тестировать код. Поэтому проверьте правила проекта: противоречия в AGENTS.md могут усложнить простую задачу. В API доступны уровни low, medium, high, xhigh и max; режима none у Astra нет.
Как проверить пользу Astra на своём проекте
- Выберите несколько типичных задач: короткую правку, сложный баг и изменение с несколькими ограничениями. Не ограничивайтесь эффектной демонстрацией.
- Дайте Astra и текущей модели одинаковые исходные данные, инструменты и критерии готовности. Запишите настройки и бюджет каждой попытки.
- Проверьте результаты по заранее составленному списку. Отдельно запишите ошибки, количество уточнений и минуты ручной доработки.
- Повторите сравнение: один удачный запуск мало говорит об устойчивости. Выбирайте модель по принятым результатам, общей цене и времени.
В проекте нужно исправить [конкретную ошибку].
Воспроизведение: [шаги]. Ожидаемое поведение: [результат].
Сохрани [ограничения]. Работай до готового исправления и проверки.
Если данных достаточно, принимай обычные технические решения сам.
Если ответ на вопрос меняет требования — уточни.
В конце покажи изменения, выполненные проверки и оставшиеся пробелы.Начать знакомство можно с упражнения из нашего руководства по Codex. Оно помогает освоить работу с агентом, но слишком простое для доказательства преимущества Astra. Для сравнения моделей выберите задачи, в которых сейчас приходится повторять требования и исправлять результат вручную.
Данные и ссылки в исходном обзоре проверены 6 сентября 2026 года. Анонс описывает поэтапное развёртывание Astra, поэтому доступность нужно уточнять в своём аккаунте. Результаты бенчмарков опубликованы OpenAI; примеры применения и порядок сравнения предложены редакцией Neaptide.