Claude Opus 5: 96% SWE-bench, та же цена, но Fable 5 не сдаётся

Anthropic сделала Claude Opus 5 дефолтом: 96% SWE-bench Verified при цене Opus 4.8. Fable 5 сохраняет узкие победы на SWE-bench Pro за вдвое больше.

Источник: BenchLM


Two labeled server racks face off in a boxing ring as a robot referee compares scorecards and a price card floats above each.

Claude Opus 5 стал дефолтом: 96% SWE-bench и война по цене в два раза дешевле

Anthropic выпустила Claude Opus 5 24 июля и сразу сделала его моделью по умолчанию для Claude Code, Claude Pro и Claude Max. Цена осталась прежней — $5 за миллион входных токенов и $25 за выходные, как у Opus 4.8. Контекст — миллион токенов. Уровни рассуждения — от low до max, и на двух последних thinking отключить нельзя.

Заголовок: 96.0% SWE-bench Verified

Эта цифра — главный аргумент. Opus 5 набрал 96.0% на SWE-bench Verified, опередив Fable 5 (95.0%). Anthropic усреднила пять испытаний, и результат подтверждён в верификационном реестре.

Но вот что интереснее: этот же Opus 5 на SWE-bench Pro набирает 79.2%. А Fable 5 — 80.0%. На FrontierCode 1.1 Main они практически равны — 53.4% против 53.5%. На CursorBench 3.2 — 70.0% против 70.5%.

Иными словами, Opus 5 выигрывает с заметным отрывом только на одном из четырёх одинаковых тестов. На остальных — отстаёт на доли процента.

Цена решает

Но Opus 5 стоит вдвое дешевле. $5/$25 против $10/$50 у Fable 5.

И вот тут логика покупки перевешивает логику бенчмарков. Если различия в 0.5–1.0% не воспроизводятся на ваших конкретных репозиториях, платить вдвое больше за статистическую близость — плохая стратегия.

BenchLM формулирует это прямо: для пользователей Opus 4.8 «бурден оф прув сменился». Теперь нужно обосновать, почему вы остаётесь на старой модели, а не почему переходите на новую. Для пользователей Fable 5 — всё наоборот: миграция имеет смысл только если узкое преимущество Fable на SWE-bench Pro воспроизводится на ваших задачах и окупает двойной счёт.

Fast mode: скорость в обмен на цену

Fast mode Opus 5 работает примерно в 2.5 раза быстрее дефолтного. Но токены стоят вдвое дороже. Опция называется «thinking нельзя отключить на xhigh и max» — и это не просто слайдер. Это изменение профиля модели.

Команда BenchLM предупреждает: максимальное усилие может потребовать больше reasoning-токенов, Fast mode удваивает ставку, а повторные попытки стирают номинальное ценовое преимущество. Полезный тест миграции записывает входные токены, выходные токены, повороты, повторные попытки и настенное время рядом с успешностью задачи.

Разные тесты — разные линейки

BenchLM отмечает, что сравнение Opus 5 и Fable 5 на OSWorld бессмысленно: Opus 5 тестировался на OSWorld 2.0 (70.6%), а Fable 5 — на OSWorld-Verified (85.0%). Это разные версии протокола. Сравнение чисел из разных протоколов превращает аккуратную таблицу в кривую линейку.

FrontierBench — внутренний запуск Anthropic на mini-SWE-agent и GKE-бэкенде, с fallback на Opus 4.8, когда safety-классификатор отклонял траекторию Opus 5 или Fable 5. Результат 43.3% сохранён как evidence, но это не benchmark-native строка рейтинга.

Миграция: тестировать, а не верить

Рекомендация BenchLM осторожна:

  • Opus 4.8: тестировать Opus 5, мигрировать если регрессии не выявлены
  • Fable 5: тестировать Opus 5 на тех же репозиториях; остаться если SWE-bench Pro воспроизводится и окупает 2× цену
  • Browser/desktop agent: оценивать Opus 5 на конкретном computer-use цикле; OSWorld 2.0 не предсказывает DOM сайта
  • Latency-sensitive продукт: сравнить Opus 5 Fast со стандартным Fable 5; удвоенная цена Fast стирает преимущество
  • Security research: держать bake-off вместо выбора из таблицы

Opus 5 достаточно убедителен, чтобы заменить Opus 4.8 как кандидата по умолчанию. Но недостаточно — чтобы стереть Fable 5. Мы всё ещё ждём сравнимого результата Terminal-Bench 2.1. Независимые long-horizon agent runs и production-speed measurements важнее очередного провайдерского графика.

Краткий ответ

Claude Opus 5 стал дефолтом Claude Code, Pro и Max. 96.0% SWE-bench Verified, цена $5/$25 как у Opus 4.8. На SWE-bench Pro Fable 5 впереди (80.0% vs 79.2%). Opus 5 стоит вдвое дешевле Fable 5. Рекомендуется тестировать миграцию, а не верить бенчмаркам слепо.

← Все новости