Анталія --:-- Обговорити проєкт
← Журнал Креативні технології 06.10.2026 5 хв читання

Три моделі, одне питання: Fable 5.1, Opus 5.5 чи Sonnet 5.5 — що для чого?

У вересні Anthropic випустила три моделі: Fable 5.1, Opus 5.5 і Sonnet 5.5. Можливості, ціни, результати тестів і яку модель розумно давати для якого завдання в продакшн-агенції.

Логотип Claude від Anthropic
Логотип Claude — торговельна марка Anthropic

Anthropic вмістила у вересень три моделі. Fable 5.1 посіла вершину сімейства. 22 вересня вийшла Opus 5.5, а через шість днів, 28 вересня, — Sonnet 5.5.

На папері знайомий порядок: найсильніша, середня, швидка. Але найцікавіше в цій трійці — наскільки скоротився розрив між ними.

Усі цифри нижче взято з офіційних анонсів Anthropic. З появою незалежних вимірювань деталі можуть зміститися; напрям, схоже, не зміниться.

Fable 5.1: модель на вершині

Fable 5.1 — найпотужніша із загальнодоступних моделей Anthropic. Цікава деталь: це та сама модель, що й Mythos 5.1, відрізняються лише захисні обмеження. Mythos 5.1 не є загальнодоступною: її отримують перевірені організації у сфері кібербезпеки та наук про життя через програми довіреного доступу.

Головне:

  • Ціна: 10 доларів за мільйон вхідних токенів, 50 доларів за мільйон вихідних. Читання з кешу подешевшало до 0,25 долара. За даними Anthropic, загальна вартість типової роботи знижується приблизно на 25 відсотків, а роботи з агентами — до 45 відсотків.
  • Ривок в агентній роботі: у Terminal-Bench 4.0, який вимірює програмування в ролі агента, результат зріс із 42,0 до 55,8 відсотка. У Terminal-Bench-Science, що вимірює наукову роботу в терміналі, він майже подвоївся: з 24,7 до 52,6 відсотка.
  • Кібербезпека: захисні фільтри тепер на 60 відсотків рідше помилково блокують легітимну роботу. Fable 5.1 можна використовувати для пошуку вразливостей у програмах, але атакувальний код для них вона не розробляє.
  • Наука: в анонсі є приклади від дизайну білків до карти висот Венери. Далеко від моєї роботи, але показує, куди рухається модель.

Opus 5.5: рівень Fable, ціна нижча

Opus 5.5 — перша модель нового сімейства Claude 5.5. Заява Anthropic однозначна: у більшості завдань на рівні Fable 5.1, працює на 40 відсотків дешевше за Opus 5 і видає результат більш ніж на 30 відсотків швидше.

Токени коштують 4 долари за мільйон вхідних і 20 доларів за мільйон вихідних. Коли я писав про Opus 5, ці цифри були 5 і 25 доларів. Ціна за токен знизилася на 20 відсотків; за даними Anthropic, загальна вартість роботи нижча на 40 відсотків.

Є й швидкий режим: до 2,5 раза швидше за подвійну ціну (8 доларів за вхід, 40 — за вихід).

У таблиці Anthropic Opus 5.5 випереджає Fable 5.1 у кількох тестах:

  • Terminal-Bench 4.0 (програмування в ролі агента): Opus 5.5 — 66,4 відсотка, Fable 5.1 — 55,8 відсотка.
  • OSWorld 2.1 (робота з комп’ютером): 81,8 проти 80,7 відсотка.
  • Humanity's Last Exam (складні міркування): 67,7 проти 65,6 відсотка.
  • AutomationBench (автоматизація бізнес-завдань): 40,0 проти 31,4 відсотка.

У питаннях безпеки теж серйозні заявки. Перед виходом модель перевірили зовнішні експерти, зокрема METR, і вона показала найкращий на сьогодні результат в автоматичному поведінковому аудиті Anthropic. Схильність обходити обмеження на 85 відсотків нижча, ніж в Opus 5 і Mythos 5.1.

Sonnet 5.5: нова робоча конячка для щоденних завдань

Sonnet 5.5 коштує стільки ж, скільки Sonnet 5: 2 долари за мільйон вхідних токенів, 10 — за мільйон вихідних. Але працює більш ніж на 30 відсотків швидше, а загальна вартість більшості завдань, за даними Anthropic, знижується до 30 відсотків.

По-справжньому дивує, наскільки близько вона підійшла до Opus 5.5:

  • Terminal-Bench 4.0: з результатом 70,6 відсотка Sonnet 5.5 у цьому тесті випереджає навіть Opus 5.5 (66,4 відсотка).
  • OSWorld 2.1: 80,1 відсотка проти 81,8 в Opus 5.5.
  • GDPval-AA (завдання інтелектуальної праці): 1844 проти 1846 балів. Практично однаково.
  • Humanity's Last Exam: 64,5 проти 67,7 відсотка. У складних міркуваннях Opus усе ще попереду.

Anthropic каже, що Sonnet 5.5 пише ясніше і сильна в щоденних завданнях із чіткими рамками (виправлення помилок, документи, презентації, таблиці). І кумедна деталь: це перша Sonnet, яка пройшла Pokémon Red лише за скриншотами.

Як читати ці цифри

У мене три застереження.

Цифри — від виробника. Усі вони з таблиць самої Anthropic. Незалежні вимірювання можуть виявитися обережнішими.

Версії тестів різні. Анонси Fable 5.1 і Opus 5.5 використовують різні версії деяких тестів. Зіставляти цифри з різних анонсів було б некоректно; кожне порівняння я брав у межах однієї таблиці.

Тест — це не робота. 70 відсотків у тесті не означають 70 відсотків точності у вашому проєкті. Ці цифри показують напрям, а не дають гарантію.

Що для чого в продакшн-агенції

У моїй роботі ШІ прискорює те, що відбувається до і після зйомки: комерційні пропозиції та описи обсягу робіт, плани зйомок, п’ятимовний контент сайту, мою власну програмну інфраструктуру. Майданчика, рішення і погляду він не торкається. Ця трійка не змінює картину; вона змінює те, яке завдання я віддаю якій моделі.

  • Sonnet 5.5: щоденні завдання з чіткими рамками. Плани зйомок, call sheet, чернетки пропозицій, каркас презентації. Швидко й дешево — і вже не на рівні «зійде».
  • Opus 5.5: довгі й складні завдання. Інфраструктура сайту, багатокрокова робота з контентом, агентні завдання на кілька годин. Отримати рівень Fable за таку ціну рік тому було немислимо.
  • Fable 5.1: найскладніші проблеми. У моїй роботі — рідкість. Верхня полиця на випадок, коли щось справді застрягло.

За замовчуванням у мене була б Opus 5.5; де важлива швидкість, я спускаюся до Sonnet 5.5, а Fable 5.1 відкриваю, коли це справді потрібно.

Головна новина: крива «ціна — якість» зламалася

Головна історія місяця — не окремі моделі. Пікова продуктивність попереднього покоління переходить до моделі рівнем нижче і за нижчою ціною. Opus 5.5 вийшла на рівень Fable, Sonnet 5.5 — майже на рівень Opus. Того ж місяця те саме сталося і з GPT-6 Astra та GPT-6.1 Sol, про які я писав днем раніше.

Для невеликої та завантаженої агенції на кшталт моєї це означає: робота, від якої рік тому я відмовлявся через вартість, тепер окупається. Багатомовний контент, розмітка архіву, довгі технічні завдання. Сильна модель — більше не розкіш, а щоденний інструмент.

Але скажу ще раз: що сильніша модель, то переконливіше виглядає її результат. Виглядати переконливо — не те саме, що мати рацію. Перевіряти цифру, речення, код — моя робота, і ця робота не передається.

Буденне питає про найсильнішу модель. Бунтарське знає, яке завдання якій моделі віддати.

ClaudeAnthropicFable 5.1Opus 5.5Sonnet 5.5Штучний інтелектКреативні технології
Çağlar Doğan

Çağlar DoğanКреативний директор, фешн- і рекламний фотограф та режисер з Анталії. Не фліртує зі світлом, а вибудовує його.