OpenAI закрыла сентябрь тремя ходами. 3 сентября она анонсировала Astra — вершину семейства GPT-6 — и на следующий день открыла её для всех. 22 сентября вышли средняя и лёгкая модели семейства, Sol и Luna. А до конца месяца, 29 сентября, — GPT-6.1 Sol.
На первый взгляд знакомая история: большая модель, средняя, маленькая. Но на этот раз герой истории — не вершина, а та, что посередине.
Семейство: Astra, Sol, Luna
- Astra: самая мощная модель семейства. Её контекстное окно превышает миллион токенов (1 050 000): длинные документы и большие кодовые базы она читает за один проход.
- Sol: средний класс, для тяжёлой повседневной работы.
- Luna: для скорости и экономии; лёгкая модель, немного жертвующая точностью.
Astra: мощь и тормоз безопасности
Путь Astra к выпуску не был прямым. OpenAI на несколько недель задержала модель из-за рисков кибербезопасности и выпустила её с дополнительными мерами защиты. Общедоступная версия отклоняет некоторые запросы, связанные с кибербезопасностью. Первыми доступ получили организации из программы кибербезопасности OpenAI, участие в которой — по заявке; затем модель появилась в старших тарифах ChatGPT, в API и на AWS.
С технической стороны выделяются две детали. По словам вице-президента OpenAI по исследованиям, Astra — первая модель, прошедшая предобучение более чем на 100 тысячах GPU на площадке Stargate в Техасе. Кроме того, сообщается, что в ней используется техника, которую называют «рекуррентной глубиной»: она скрывает от наблюдения часть шагов рассуждения модели. Второй момент спорный: возможность видеть, как модель думает, была ценна для безопасности.
Цена: 10 долларов за миллион входных токенов, 50 долларов за миллион выходных. Цена флагмана.
GPT-6.1 Sol: почти Astra за пятую часть цены
Вот главная новость месяца. По данным OpenAI, GPT-6.1 Sol почти догоняет Astra в программировании в роли агента, работе с компьютером и профессиональных задачах. А стоит она пятую часть от Astra: 2 доллара за миллион входных токенов, 10 — за миллион выходных.
Опубликованные результаты:
- DeepSWE 1.1 (разработка ПО): тот же результат, что у Astra.
- OSWorld 2.0 (работа с компьютером): на 2,1 пункта позади Astra.
- AutomationBench (автоматизация бизнес-задач): на 4,8 пункта впереди прежней GPT-6 Sol.
Независимые измерения рисуют похожую картину. В индексе интеллекта Artificial Analysis на максимальных настройках GPT-6.1 Sol набирает 52 балла, Astra — 53; стоимость одной задачи у Sol — 0,72 доллара, у Astra — 3,26 доллара.
Один балл разницы — в четыре с половиной раза дороже.
Как читать эти цифры
Большинство тестов выбрала сама OpenAI. Независимые измерения, похоже, подтверждают общую картину, но в деталях каждая задача будет отличаться. Для меня важно соотношение: делать ту же работу за пятую часть цены при очень близком качестве.
Что меняется для меня
Я слежу за моделями обеих компаний; я не сижу на трибуне гонки. Важно, какую задачу я отдаю какому инструменту.
Картина в семействе GPT-6 почти точно повторяет ту, что я увидел у Anthropic в том же месяце: пиковая производительность переходит к модели уровнем ниже и по гораздо более низкой цене. У Anthropic Opus 5.5 вышла на уровень Fable; у OpenAI GPT-6.1 Sol приблизилась к Astra.
Практический вывод прост:
- Для работы по умолчанию — модель среднего класса. Длинные документы, многошаговые задачи, код. GPT-6.1 Sol — новый эталон этого класса.
- Флагман — когда он действительно нужен. Платить впятеро больше за разницу в один балл в большинстве задач бессмысленно.
- Главный навык — маршрутизация. Знать, какую задачу какой модели отдать, становится ценнее, чем выбрать лучшую модель.
Есть и вопрос безопасности. То, что Astra задержали из-за кибербезопасности, а часть её рассуждений невидима, напоминает: эти модели — уже не обычные программы. Я использую такие инструменты в технической инфраструктуре своего агентства; чем сильнее они становятся, тем внимательнее я слежу за тем, что оставляю на автоматике, а что проверяю сам.
Вывод
Год назад все спрашивали: «Какая модель лучшая?» Сегодня правильный вопрос другой: какая модель самая эффективная из тех, что достаточно хороши для этой задачи?
Обыденное смотрит на вершину. Бунтарское смотрит туда, где заканчивается работа.