Anthropic вмістила у вересень три моделі. Fable 5.1 посіла вершину сімейства. 22 вересня вийшла Opus 5.5, а через шість днів, 28 вересня, — Sonnet 5.5.
На папері знайомий порядок: найсильніша, середня, швидка. Але найцікавіше в цій трійці — наскільки скоротився розрив між ними.
Усі цифри нижче взято з офіційних анонсів Anthropic. З появою незалежних вимірювань деталі можуть зміститися; напрям, схоже, не зміниться.
Fable 5.1: модель на вершині
Fable 5.1 — найпотужніша із загальнодоступних моделей Anthropic. Цікава деталь: це та сама модель, що й Mythos 5.1, відрізняються лише захисні обмеження. Mythos 5.1 не є загальнодоступною: її отримують перевірені організації у сфері кібербезпеки та наук про життя через програми довіреного доступу.
Головне:
- Ціна: 10 доларів за мільйон вхідних токенів, 50 доларів за мільйон вихідних. Читання з кешу подешевшало до 0,25 долара. За даними Anthropic, загальна вартість типової роботи знижується приблизно на 25 відсотків, а роботи з агентами — до 45 відсотків.
- Ривок в агентній роботі: у Terminal-Bench 4.0, який вимірює програмування в ролі агента, результат зріс із 42,0 до 55,8 відсотка. У Terminal-Bench-Science, що вимірює наукову роботу в терміналі, він майже подвоївся: з 24,7 до 52,6 відсотка.
- Кібербезпека: захисні фільтри тепер на 60 відсотків рідше помилково блокують легітимну роботу. Fable 5.1 можна використовувати для пошуку вразливостей у програмах, але атакувальний код для них вона не розробляє.
- Наука: в анонсі є приклади від дизайну білків до карти висот Венери. Далеко від моєї роботи, але показує, куди рухається модель.
Opus 5.5: рівень Fable, ціна нижча
Opus 5.5 — перша модель нового сімейства Claude 5.5. Заява Anthropic однозначна: у більшості завдань на рівні Fable 5.1, працює на 40 відсотків дешевше за Opus 5 і видає результат більш ніж на 30 відсотків швидше.
Токени коштують 4 долари за мільйон вхідних і 20 доларів за мільйон вихідних. Коли я писав про Opus 5, ці цифри були 5 і 25 доларів. Ціна за токен знизилася на 20 відсотків; за даними Anthropic, загальна вартість роботи нижча на 40 відсотків.
Є й швидкий режим: до 2,5 раза швидше за подвійну ціну (8 доларів за вхід, 40 — за вихід).
У таблиці Anthropic Opus 5.5 випереджає Fable 5.1 у кількох тестах:
- Terminal-Bench 4.0 (програмування в ролі агента): Opus 5.5 — 66,4 відсотка, Fable 5.1 — 55,8 відсотка.
- OSWorld 2.1 (робота з комп’ютером): 81,8 проти 80,7 відсотка.
- Humanity's Last Exam (складні міркування): 67,7 проти 65,6 відсотка.
- AutomationBench (автоматизація бізнес-завдань): 40,0 проти 31,4 відсотка.
У питаннях безпеки теж серйозні заявки. Перед виходом модель перевірили зовнішні експерти, зокрема METR, і вона показала найкращий на сьогодні результат в автоматичному поведінковому аудиті Anthropic. Схильність обходити обмеження на 85 відсотків нижча, ніж в Opus 5 і Mythos 5.1.
Sonnet 5.5: нова робоча конячка для щоденних завдань
Sonnet 5.5 коштує стільки ж, скільки Sonnet 5: 2 долари за мільйон вхідних токенів, 10 — за мільйон вихідних. Але працює більш ніж на 30 відсотків швидше, а загальна вартість більшості завдань, за даними Anthropic, знижується до 30 відсотків.
По-справжньому дивує, наскільки близько вона підійшла до Opus 5.5:
- Terminal-Bench 4.0: з результатом 70,6 відсотка Sonnet 5.5 у цьому тесті випереджає навіть Opus 5.5 (66,4 відсотка).
- OSWorld 2.1: 80,1 відсотка проти 81,8 в Opus 5.5.
- GDPval-AA (завдання інтелектуальної праці): 1844 проти 1846 балів. Практично однаково.
- Humanity's Last Exam: 64,5 проти 67,7 відсотка. У складних міркуваннях Opus усе ще попереду.
Anthropic каже, що Sonnet 5.5 пише ясніше і сильна в щоденних завданнях із чіткими рамками (виправлення помилок, документи, презентації, таблиці). І кумедна деталь: це перша Sonnet, яка пройшла Pokémon Red лише за скриншотами.
Як читати ці цифри
У мене три застереження.
Цифри — від виробника. Усі вони з таблиць самої Anthropic. Незалежні вимірювання можуть виявитися обережнішими.
Версії тестів різні. Анонси Fable 5.1 і Opus 5.5 використовують різні версії деяких тестів. Зіставляти цифри з різних анонсів було б некоректно; кожне порівняння я брав у межах однієї таблиці.
Тест — це не робота. 70 відсотків у тесті не означають 70 відсотків точності у вашому проєкті. Ці цифри показують напрям, а не дають гарантію.
Що для чого в продакшн-агенції
У моїй роботі ШІ прискорює те, що відбувається до і після зйомки: комерційні пропозиції та описи обсягу робіт, плани зйомок, п’ятимовний контент сайту, мою власну програмну інфраструктуру. Майданчика, рішення і погляду він не торкається. Ця трійка не змінює картину; вона змінює те, яке завдання я віддаю якій моделі.
- Sonnet 5.5: щоденні завдання з чіткими рамками. Плани зйомок, call sheet, чернетки пропозицій, каркас презентації. Швидко й дешево — і вже не на рівні «зійде».
- Opus 5.5: довгі й складні завдання. Інфраструктура сайту, багатокрокова робота з контентом, агентні завдання на кілька годин. Отримати рівень Fable за таку ціну рік тому було немислимо.
- Fable 5.1: найскладніші проблеми. У моїй роботі — рідкість. Верхня полиця на випадок, коли щось справді застрягло.
За замовчуванням у мене була б Opus 5.5; де важлива швидкість, я спускаюся до Sonnet 5.5, а Fable 5.1 відкриваю, коли це справді потрібно.
Головна новина: крива «ціна — якість» зламалася
Головна історія місяця — не окремі моделі. Пікова продуктивність попереднього покоління переходить до моделі рівнем нижче і за нижчою ціною. Opus 5.5 вийшла на рівень Fable, Sonnet 5.5 — майже на рівень Opus. Того ж місяця те саме сталося і з GPT-6 Astra та GPT-6.1 Sol, про які я писав днем раніше.
Для невеликої та завантаженої агенції на кшталт моєї це означає: робота, від якої рік тому я відмовлявся через вартість, тепер окупається. Багатомовний контент, розмітка архіву, довгі технічні завдання. Сильна модель — більше не розкіш, а щоденний інструмент.
Але скажу ще раз: що сильніша модель, то переконливіше виглядає її результат. Виглядати переконливо — не те саме, що мати рацію. Перевіряти цифру, речення, код — моя робота, і ця робота не передається.
Буденне питає про найсильнішу модель. Бунтарське знає, яке завдання якій моделі віддати.