Разбор модели · 2026

Обзор Claude Opus 5.0 — практический обзор

Anthropic выпустила Claude Opus 5 — следующую большую версию семейства Opus. Это первый релиз, где история не сводится к «модель находит больше багов». Разбираем данные бенчмарков CodeRabbit: где Opus 5 точнее базовой линии, где теряет покрытие, сколько токенов съедает — и почему для длительной автономной работы Fable 5 всё ещё выглядит сильнее.

39,3%
Точность actionable-комментариев, Opus 5 x-high
▲ +4,1 п.п. к базовой линии
55,2%
Найдено известных проблем (actionable)
▼ −5,9 п.п. к базовой линии
×4
Больше нитпиков: 92 против 23
▼ выше нагрузка на триаж
28,6%
Точность всего потока комментариев
▼ −4,2 п.п. к базовой линии
~60,5k
Входных токенов на вызов ревью
▼ +50% против базовой линии
1M
Контекстное окно — по умолчанию и максимум
▲ стабильность заявлена
Интерактивный транскрипт
01

Введение: как менялось семейство Opus

Anthropic только что выпустила Claude Opus 5 — следующую большую версию семейства Opus, которое многие из нас успели полюбить (по крайней мере, до того как всё внимание украла Fable). Подходящий момент, чтобы сделать шаг назад и посмотреть, как Opus эволюционировала за время наших тестов в CodeRabbit.

Ступенчатая диаграмма эволюции семейства Opus от Opus 4 до Opus 5: каждый релиз добавлял actionability, системный контекст, покрытие, затем паритет по покрытию с базовой линией; Opus 5 поворачивает в сторону точности за счёт покрытия.
Эволюция семейства Opus: каждый релиз добавлял то actionability, то системный контекст, то покрытие — вплоть до паритета с базовой линией. Opus 5 впервые разворачивается в сторону точности, платя за это покрытием. Источник иллюстрации: CodeRabbit

Мы прогоняли через стенд каждый релиз Opus начиная с версии 4, так что картина эволюции у нас достаточно полная. Opus 5 — первый релиз, где история не сводится просто к «модель находит больше багов».

Нужна полная история семейства?

Начните с 4.1, затем 4.5, 4.7, 4.8 и Fable 5.


02

Что нового в Opus 5

Этот релиз — не столько прирост «сырых» возможностей, сколько сдвиг в том, как моделью управляют и куда она тратит усилия. Для ревью и написания кода важны пять изменений:

Управление

Effort становится главным рычагом

Thinking включён по умолчанию и может быть отключён только на уровне high и ниже. Бюджеты задачи и усилий теперь можно менять по ходу разговора, per-turn, без инвалидации кэша. Наши данные подтверждают эту рамку: effort оказался решением о маршрутизации — x-high покупал прирост точности ценой покрытия, и ничто не улучшалось равномерно.

Контекст

Длинный контекст — стабильность заявлена

Контекстное окно вырастает до 1 млн токенов — и как значение по умолчанию, и как максимум, причём производительность, по заявлению, держится на всём протяжении. Это напрямую адресует деградацию на 200k токенах, о которой мы писали в разборе Opus 4.8.

Агенты

Long-horizon agentic — главная сила

Рекомендации по использованию советуют давать полную спецификацию задачи сразу, рассчитывать на более длинные автономные сессии и применять мультиагентные паттерны «писатель — верификатор» (writer-verifier).

Поведение

Поведенческие сдвиги, меняющие промпты

Модель следует инструкциям ревью буквально (осторожные формулировки подавляют recall), выдаёт более длинный вывод по умолчанию, который реагирует на промптинг, а не на настройку effort, верифицирует свою работу без просьбы и может расширять скоуп задачи. Три из этих четырёх эффектов видны в наших данных — подробнее ниже.

Безопасность

Усиленные кибербез-предохранители

Как мы видели на Fable 5, безобидная работа с безопасностью иногда способна их триггерить. Мы отмечаем это ниже, в результатах по категории безопасности — хотя с Opus 5 это случалось реже.


03

Что именно тестировали: методика

Сравнение покрывает около 100 типовых паттернов ошибок (error patterns, EP), взятых из верифицированных проблем в реальных open-source пул-реквестах. Каждую конфигурацию мы запускали три раза и сравнивали средние с тремя прогонами нашего текущего продакшн-микса моделей.

Комментарии в этом отчёте — это post-pipeline выходы: они уже прошли верификацию, дедупликацию и assertive-фильтрацию.

Здесь важны четыре измерения. Два отвечают на вопрос «поймала ли модель баг?» (считаются на известную проблему), два — «стоило ли читать комментарий?» (считаются на комментарий):

Actionable pass rate

Доля EP, пойманных уверенным, actionable-комментарием.

Full-stream pass rate

Доля EP, пойманных любым классом комментариев — включая outside-diff и assertive/nitpick (низкая уверенность).

Actionable precision

Доля actionable-комментариев, попавших ровно в свою целевую проблему.

Full-stream precision

То же самое, но по всем комментариям, которые выдала модель.

Как читать эти четыре метрики вместе

Пара «pass rate» отвечает за полноту (что модель вообще увидела), пара «precision» — за шум (сколько мусора придётся разгребать разработчику). Одна цифра в отрыве от остальных трёх почти всегда вводит в заблуждение — это ключевой сюжет всего обзора Opus 5.


04

Коротко о главном (TL;DR)

Opus 5 — не лучший универсальный код-ревьюер из протестированных нами

Её конфигурация x-high дала более точный поток actionable-комментариев, чем наша продакшн-базовая линия — 39,3% против 35,2% — но поймала меньше известных проблем бенчмарка: 55,2% против 61,1%.

Она также сгенерировала примерно в четыре раза больше нитпиков, а её точность упала ниже базовой линии, когда мы считали весь post-pipeline поток: 28,6% против 32,8%.

Четыре столбчатые диаграммы сравнения продакшн-базовой линии с Opus 5 x-high: найдено известных проблем 61,1% против 55,2%, actionable-точность 35,2% против 39,3%, нитпики 23 против 92, точность полного потока 32,8% против 28,6%.
Четыре ключевых сравнения: базовая линия против Opus 5 x-high. Источник: CodeRabbit

Базовая линия против Opus 5 x-high — интерактивно

Наведите курсор на столбцы, чтобы увидеть точные значения. Нитпики — шкала справа (количество, не проценты).

Три метрики слева — проценты; «Нитпики» отложены по правой оси как абсолютное количество комментариев. Единственная метрика, где Opus 5 x-high выигрывает, — точность actionable-подмножества.

Наше прочтение сознательно узкое: Opus 5 может стать полезной «полосой на точность» внутри маршрутизируемого ансамбля, но эти результаты не поддерживают её использование как единственного ревьюера или как основной страховки на высокорисковых изменениях.

Мы прогнали три конфигурации ревью CodeRabbit:

  • Профиль junior-ревьюера на уровне effort по умолчанию (medium)
  • Профиль senior-ревьюера на high effort
  • Профиль senior-ревьюера на x-high effort

05

Результаты: таблица трёх прогонов

Среднее по трём прогонам · одни и те же 96 оценочных паттернов
Конфигурацияпрофиль ревью · effort Найдено известных проблем Точность комментариев Объём комментариев
Actionable ↑ Full stream ↑ Actionable ↑ Full stream ↑ Actionable Нитпики ↓
Продакшн-базовая линиятекущий микс моделей 61,1% 63,5% 35,2% 32,8% 181 23
Opus 5junior · default effort 56,9% 67,0% 35,4% 26,4% 174 110
Opus 5senior · high effort 55,6% 62,8% 35,6% 27,3% 176 91
Opus 5senior · x-high effort 55,2% 60,8% 39,3% 28,6% 166 92

Оранжевым отмечено лучшее значение в каждом столбце-ставке и минимальное число нитпиков. Расшифровка столбцов: Pass · actionable — поймано уверенным комментарием; Pass · full stream — поймано любым классом; Precision · actionable / full stream — доля попаданий в цель; Нитпики — низкоценные придирки. Данные: CodeRabbit — Opus 5 model review

Оригинальная таблица результатов CodeRabbit: средние по трём прогонам на одних и тех же оценочных паттернах, сравнение продакшн-базовой линии с тремя конфигурациями Opus 5 по pass rate, точности и объёму комментариев.
Оригинальная таблица результатов из отчёта CodeRabbit. Источник: CodeRabbit

Все четыре конфигурации по четырём метрикам

Кликните по элементам легенды, чтобы скрыть или показать конфигурацию.

Хорошо видно расхождение: junior/default выигрывает по full-stream покрытию (67,0%), но проигрывает по точности полного потока (26,4%). X-high — обратная картина.

Цена точности: нитпики по конфигурациям

Любая конфигурация Opus 5 даёт кратно больше нитпиков, чем базовая линия.

23 нитпика у базовой линии против 91–110 у Opus 5 — это и есть та «нагрузка на триаж», которая съедает выигрыш в точности actionable-подмножества.


06

Что это значит для разработчиков

Opus 5 x-high — не прямолинейный апгрейд продакшн-ревьюера. Она выдала самое чистое actionable-подмножество (точность 39,3% против 35,2%), но поймала меньше известных проблем и сгенерировала вчетверо больше нитпиков. Для разработчика это означает лишь чуть более высокий шанс, что actionable-комментарий окажется полезным, но при этом больший риск пропустить важную проблему и больше низкоценного фидбэка, который нужно триажить. Практически подходящая роль — второй, ориентированный на точность ревьюер.

Больше reasoning ≠ лучше ревью

Конфигурация junior/default нашла больше всего проблем, когда учитывались все классы комментариев, но её full-stream точность упала до 26,4%, и она выдала 110 нитпиков. X-high была более избирательна среди actionable-комментариев, но в целом оставалась шумной.

Поэтому командам стоит относиться к effort как к выбору между режимами отказа: решите, нужно ли рабочему процессу более широкое исследование или более чистое actionable-подмножество, а затем измерьте нагрузку по фильтрации, которую создаёт каждый выбор.

Режим отказа A

Junior · default effort

Full-stream покрытие67,0% — лучшее
Actionable покрытие56,9%
Точность полного потока26,4% — худшая
Нитпики110
Что вы получаетеширокий охват, дорогой триаж
Режим отказа B

Senior · x-high effort

Full-stream покрытие60,8%
Actionable покрытие55,2% — минимум
Actionable-точность39,3% — лучшая
Нитпики92
Что вы получаетечистый actionable-поток, больше пропусков

07

Сигналы по категориям ошибок

Opus 5 · сигналы на уровне категорий
Область Сигнал Наблюдаемый результат Сила доказательства
Ошибки конфигурации ▲ Перспективно +16,7 п.п. в junior · +25 п.п. в senior/high и senior/x-high по actionable pass 4 EP · только направленческий сигнал, не для заголовков
Качество кода ▲ Перспективно +5,6 п.п. в junior и senior/x-high; выигрыш появляется только после учёта нитпиков 6 EP · большой объём assertive-комментариев
Null-ссылки — Смешанно junior +3,0 п.п. · senior/high +6,1 п.п. · senior/x-high −9,1 п.п. 11 EP · чувствительно к конфигурации
Логические ошибки ▼ Слабее −3,3 … −5,6 п.п. во всех конфигурациях Opus 5 30 EP · самый достоверный негативный сигнал на уровне категории
Состояния гонки (race conditions) ▼▼ Явно слабее −10 … −20 п.п. по actionable pass и более низкая actionable-точность 10 EP · важно, потому что прежние модели Opus были здесь сильны
Неправильное использование API ▼ Слабее −5,6 … −13,9 п.п. по конфигурациям 12 EP · достаточно достоверно
Валидация данных ▼ Слабее −5,6 … −27,8 п.п. по конфигурациям 6 EP · самое слабое доказательство, широкий разброс

п.п. = процентные пункты · EP = оценочный паттерн (evaluation pattern). Данные: CodeRabbit — Opus 5 model review

Оригинальная таблица категорий Opus 5: перспективно по ошибкам конфигурации и качеству кода, смешанно по null-ссылкам, слабее по логическим ошибкам, неправильному использованию API и валидации данных, явно слабее по состояниям гонки.
Оригинальная таблица категорий из отчёта CodeRabbit. Источник: CodeRabbit

Изменение по категориям относительно базовой линии

Диапазон изменения в процентных пунктах (п.п.) — от минимального до максимального по конфигурациям.

Зелёные значения выше нуля — рост, красные ниже нуля — падение относительно продакшн-базовой линии. Обратите внимание на размер выборки: категории с 4–6 EP дают лишь направленческий сигнал.

Сильные стороны

Конфигурация и качество кода

Opus 5 сильнее всего на ошибках конфигурации и качестве кода. Она хорошо замечает детали интеграции и проблемы поддерживаемости — хотя этот более широкий стиль ревью и создаёт больше шума.

Слабые стороны

Логика, гонки, API

Более слабые области — логические ошибки, состояния гонки и неправильное использование API. Это делает Opus 5 полезной как дополнительный взгляд, но не как единственного ревьюера для изменений, критичных к корректности — особенно вокруг конкурентности и поведения API.


08

Место Opus 5 в ландшафте моделей

Это контекст, а не лидерборд

Исторические результаты CodeRabbit дают контекст, а не рейтинг. В разных отчётах использовались разные количества EP, миксы моделей, судьи, промпты и версии пайплайна, поэтому небольшие численные различия нельзя трактовать как победы в прямом сравнении.

Точечная диаграмма покрытия против actionable-точности: GPT-5.6 Sol на recall-ориентированном конце, Opus 5 x-high, Sonnet 5 и GPT-5.6 Terra на стороне точности, продакшн-базовая линия и Opus 4.8 посередине.
Ландшафт: покрытие по горизонтали, точность actionable-комментариев по вертикали. Источник: CodeRabbit

Фронтирные модели разделились на два лагеря: recall-ориентированные ревьюеры, которые находят больше и полагаются на продукт, чтобы за ними убирали, и precision-ориентированные, которые говорят меньше, но чаще оказываются правы. GPT-5.6 Sol закрепляет один конец спектра: 69,7% найденных известных проблем, но лишь 31,6% её комментариев стоило сохранять.

Карта «точность против покрытия» — интерактивно

Наведите на точку, чтобы увидеть детали модели. Вправо — больше найденных проблем, вверх — чище actionable-поток.

Оранжевая точка — Opus 5 x-high. Она держит вершину по точности при самом низком покрытии среди всех протестированных линеек Opus.

Позиции моделей на карте покрытие × точность
Модель / линейка Найдено проблем Actionable-точность Характер
GPT-5.6 Sol 69,7% 31,6% Recall-полоса, требует много уборки
Продакшн-базовая линия 61,1% 35,2% Тот же прогон · 23 нитпика · 32,8% full-точность
Opus 4.8 ~61% 33,8% Сбалансированное ревью · сильна в agentic
Opus 5 x-high 55,2% 39,3% Precision-ориентированные actionables · 92 нитпика · шумный полный поток (28,6%)
GPT-5.6 Terra 52,5% 35,7% Меньший объём · 143 комментария
Sonnet 5 ~50–51% 38–40% Высокий объём нитпиков

Значения взяты из разных отчётов CodeRabbit с разными пайплайнами — сравнивайте направления, а не десятые доли.

Opus 5 x-high закрепляет противоположный конец спектра: самый чистый actionable-поток на графике при самом низком покрытии среди всех линеек Opus, которые мы тестировали. Её ближайший сосед — Sonnet 5, достигшая похожей точности раньше. Разница в том, что Opus 5 удерживает чуть больше покрытия, но при этом выдаёт более шумный полный поток. Opus 4.8, сидящая рядом с базовой линией, остаётся сбалансированным вариантом семейства.


09

Где Opus 5 блестит: генерация кода

Opus 5 убедительнее в роли строителя, чем в роли ревьюера. Один из наших инженеров описал её как «менее тревожную», чем предыдущие модели Opus. Она не торопится: сначала уточняет цель, предлагает несколько правдоподобных подходов и справляется с открытыми проектами, не бросаясь в первое же решение. Она также тщательно документирует свою работу — это улучшает объяснимость, но может потреблять много токенов.

«Менее тревожная», чем предыдущие модели Opus — так один из инженеров CodeRabbit описал Opus 5 в работе над кодом.

На более крупных agentic-задачах Opus 5 координировала сотни фоновых агентов и показала гораздо лучшее проектное суждение, чем Opus 4.8. При этом она всё равно была медленнее и менее эффективной, чем Fable 5, иногда упиралась в лимиты и оставалась чрезмерно осторожной вокруг задач, связанных с безопасностью.

Наше раннее прочтение

Это явный шаг вперёд относительно Opus 4.8, особенно для неоднозначных, дизайн-ориентированных проектов — но это не конкурент Fable.


10

Расход токенов на вызов ревью

Столбчатая диаграмма токенов на вызов ревью: Opus 5 в среднем около 60 500 входных и 9 500 выходных токенов против примерно 40 500 входных и 5 800 выходных у продакшн-базовой линии (линейки GPT-5.6) в тех же прогонах.
Расход токенов на один вызов ревью: Opus 5 против линеек GPT-5.6 в базовой линии. Источник: CodeRabbit

На каждый вызов ревью Opus 5 читает примерно на 50% больше и пишет примерно на 65% больше, чем фронтирные модели в нашей базовой линии. В среднем это ≈60,5 тыс. входных токенов на вызов (от 55 до 64 тыс. в зависимости от конфигурации) и ≈9,5 тыс. выходных (от 8,1 до 10,8 тыс.) — против ≈40,5 тыс. на входе и ≈5,8 тыс. на выходе у линеек GPT-5.6, делающих ту же работу в тех же прогонах.

На практике каждый вызов ревью Opus 5 несёт больший контекст на входе и возвращает более длинный ответ — именно отсюда берётся и объём комментариев, и часть надбавки к стоимости.

Токены на вызов: Opus 5 против базовой линии

Средние значения на один вызов ревью в тех же прогонах.

Разрыв ≈ +50% на входе и ≈ +65% на выходе. При оценке стоимости считайте не цену за токен, а стоимость решённой задачи.

Больше effort ≠ больше вывода

X-high оказалась самым «многословным» писателем, выдав 10,8 тыс. выходных токенов на вызов. Но рост effort не означает автоматического роста вывода: high писала меньше, чем junior/default, тогда как x-high увеличила и объём размышлений, и объём вывода.


11

Подробное сравнение с Fable 5

Дополнение к оригинальной статье

Этот раздел расширяет оригинальный обзор Opus 5. Все данные и формулировки по Fable 5 взяты из отдельного отчёта CodeRabbit: Fable 5 model review. Обратите внимание: бенчмарк Fable 5 прогонялся на 105 EP и с другой версией пайплайна, тогда как Opus 5 — на 96 EP. Поэтому корректно сравнивать характер поведения и относительные разрывы, а не абсолютные проценты между двумя отчётами.

Решение в одном абзаце

Fable 5 стоит тестировать для автономной работы над кодом — особенно когда промпт неполный и агенту нужно сначала исследовать среду, прежде чем что-то строить. Для продакшн-ревью кода текущая базовая линия и Opus 4.8 по-прежнему выглядят безопаснее. Используйте Fable 5 там, где нужно исследовать, планировать и строить — особенно если задача может занять больше времени в обмен на более тщательную реализацию. Ревьюера пока оставьте текущего: сигнал по код-ревью близок по покрытию, но ещё недостаточно силён по точности и объёму, чтобы стать значением по умолчанию.

Что нового в Fable 5

Fable 5 позиционируется как модель класса Mythos для автономной интеллектуальной работы и кодинга, и это задаёт другую планку, чем рутинный апгрейд модели. Обещание — не просто «лучшие ответы» или «быстрая Opus 4.8». Это модель, построенная под длительную агентную работу: удерживать больше контекста, составлять план и вести задачу дальше, прежде чем потребуется вмешательство человека.

Ограничения на старте по-прежнему важны для понимания её возможностей. Модель включает блокирующие классификаторы для части запросов по кибербезопасности и биологии, а продукт поддерживает опциональный откат на Opus 4.8 после блокировок классификатором. Практический вывод для разработчика простой: используйте Fable 5, когда задаче нужна глубина, и сохраняйте существующий путь для процессов, где нужна предсказуемая скорость или точность.

Цена на старте

Публичная цена запуска в релизном брифе — 10 долл. за миллион входных токенов и 50 долл. за миллион выходных, с надбавкой 10% на региональные эндпоинты. Мы уже видели похожие цены у reasoning-моделей, особенно когда они вводят новую категорию моделей. Эти издержки могут снизиться в следующих итерациях, но ранняя картина ясна: оценивайте Fable 5 по стоимости решённой задачи, а не по цене за токен.

Код-ревью: близко по покрытию, слабее по точности

В бенчмарке код-ревью на 105 EP Fable 5 держалась близко к текущей базовой линии по покрытию находок. Она прошла 65 из 105 actionable EP — чуть позади базовой линии и Opus 4.8 с их 66 из 105. Если считать все типы комментариев, Fable 5 слегка обошла базовую линию: 74 из 105 full EP pass против 72 из 105.

Слабее — часть про точность. Fable 5 остановилась на 32,8% actionable-точности и 19,4% full-точности, тогда как Opus 4.8 достигла 35,5% и 26,5%. Она также выдала 253 комментария — больше, чем любой из сравниваемых прогонов, с большим ростом assertive- и nitpick-подобного вывода. Для код-ревью эта комбинация важна, потому что шумные комментарии создают работу ревьюеру, даже когда покрытие выглядит конкурентоспособным.

Fable 5 · бенчмарк код-ревью на 105 EP
Прогон Actionable pass Full pass Actionable-точность Комментариев
Текущая базовая линия 66/105 · 62,9% 72/105 · 68,6% 34,5% 206
Fable 5 65/105 · 61,9% 74/105 · 70,5% 32,8% 253
Opus 4.8 66/105 · 62,9% 77/105 · 73,3% 35,5% 220

Fable 5 слегка обходит базовую линию по full pass, но проигрывает по точности и заметно выигрывает по «шумности». Данные: CodeRabbit — Fable 5 model review

Оригинальная таблица CodeRabbit, сравнивающая текущую базовую линию, Fable 5 и Opus 4.8 по actionable pass, full pass, actionable-точности и количеству комментариев.
Оригинальная таблица из обзора Fable 5. Источник: CodeRabbit

Код-ревью: близкое покрытие, слабее точность

Бенчмарк Fable 5 по ключевым метрикам код-ревью (%).

Разрывы малы — но направление устойчиво: Opus 4.8 остаётся самым «спокойным» ревьюером из трёх.

Оригинальная столбчатая диаграмма CodeRabbit по бенчмарку код-ревью для трёх систем и трёх метрик.
Оригинальная диаграмма бенчмарка Fable 5. Источник: CodeRabbit

Разбивка по категориям делает результат более неровным, чем подсказывает заголовочная цифра покрытия. У Fable 5 полезная широта, но выигрыши не последовательны по тем видам проблем, которые разработчики ожидают от ревьюера. На практике командам стоит рассчитывать на полезные находки, но всё же держать ручной триаж и резервное покрытие для категорий, где доверие к ревью заслужить сложнее.

Более сложные примеры делают аргумент за раскатку осторожнее. На EP сложности 4 Fable 5 прошла 8 из 16, отставая от базовой линии (10 из 16) и Opus 4.8 (9 из 16). Это не делает Fable 5 плохим ревьюером, но означает, что на самых трудных случаях потребуется больше человеческого суждения.

Безопасность: полезно, но без автоматического доверия

Разработчики, скорее всего, воспримут Fable 5 как более осведомлённую в безопасности, чем обобщённая кодовая модель — особенно когда задача требует аккуратной реализации вокруг рискованного поведения. Но это не значит, что её стоит рассматривать как drop-in ревьюера по безопасности. Практичная позиция: использовать её для более глубокой работы над кодом, чувствительным к безопасности, и держать планку проверки высоко, прежде чем доверять её находкам.

Самый сильный сигнал по безопасности пришёл от активной реализации. В нашем бенчмарке кодовых задач Fable 5 выполнила связанную с безопасностью задачу Bandit, когда у неё была ясная цель и достаточно времени, чтобы проработать код. Fable 5 выглядит полезнее, когда безопасность — часть конкретной задачи по написанию кода, а не когда её просят поймать все проблемы в ревью.

Бенчмарк кодовых задач: способная, но долго работающая

Мы остановили бенчмарк кодовых задач досрочно, когда стал очевиден паттерн: Fable 5 может делать содержательный прогресс, но многие задачи работали достаточно долго, чтобы упереться в таймаут агента. Поэтому этот раздел — сигнал об опыте использования, а не финальный балл лидерборда. Полезная история здесь — как модель ведёт себя на реальной работе с кодом, когда задача продолжает расширяться.

Исходы кодовых задач Fable 5

19 таймаутов, 6 пройдено, 4 провалено, 4 отменено.

Микс исходов следует читать как сигнал о поведении агента, а не как завершённый балл бенчмарка. Доминирующий исход — таймаут: модель продолжала исследовать дольше, чем позволял стенд.

Оригинальная столбчатая диаграмма исходов кодовых задач Fable 5: 19 таймаутов, 6 пройдено, 4 провалено, 4 отменено.
Оригинальная диаграмма исходов кодовых задач. Источник: CodeRabbit

Сигнал режет в обе стороны. Когда Fable 5 заканчивала, она выдавала серьёзные патчи, а не поверхностные правки. Когда буксовала — исследовала дольше, чем мог поддержать стенд. Для разработчиков это делает её более подходящей для работы, где глубина стоит ожидания — при условии, что у агента есть ясные лимиты по времени, шагам и токенам.

Выполненные задачи также подсказывают, где Fable 5 наиболее полезна. Победы пришли из реализационной работы с реальной структурой: типы, API, поведение публикации, логика запросов, кэширование и код, связанный с безопасностью. Промахи тоже оказались полезны: часть — быстрые неверные повороты, другие показывали, как модель вкладывает реальное усилие, но не сходится к результату. Это и есть тот компромисс, который разработчикам стоит планировать: больше глубины, но не всегда чистый финиш.

Профиль кодовых задач: у глубины есть цена по времени выполнения

Среднее время агента (минуты) и средний вывод в токенах — пройденные против проваленных задач.

Fable 5 тратит реальное время и бюджет вывода, когда доходит до конца. Когда она уходит в таймаут, стенд всё равно может сжечь существенный контекст. Долгие агентные прогоны делают поведение кэша, выходные токены и rate таймаутов не менее важными, чем прайс-лист.

Оригинальные диаграммы CodeRabbit: среднее время агента 43,3 минуты для пройденных и 48,7 минуты для проваленных задач; средний вывод 35,8 тыс. и 33,2 тыс. токенов соответственно.
Оригинальные диаграммы времени и токенов. Источник: CodeRabbit

Профиль токенов рассказывает ту же историю, что и данные по времени. Fable 5 дороже не только из-за прайс-листа. Она также может дольше думать, исследовать и генерировать, прежде чем дойдёт до ответа. Скидки за кэш могут уменьшить итоговый счёт, а цены — снизиться в будущих итерациях, но командам всё равно стоит оценивать модель по стоимости решённой задачи. Для такой агентной работы rate таймаутов, поведение кэша и расход выходных токенов важны не меньше опубликованной цены за токен.

Кодовые проекты показывают потенциал

Кодовые проекты дали самый ясный взгляд на Fable 5 в её лучшем виде. В одном проекте модель не просто собрала работающую поверхность: она организовала реализацию в отдельные слои для состояния, принятия решений, рендеринга и управления, а затем выдала сборку, которая прошла. Оставшиеся пробелы были ровно такими, каких ждёшь от первой полной версии: более надёжное покрытие тестами, более безопасная работа с состоянием и более строгие проверки некорректных входов.

Другой проект показал тот же паттерн в более интерактивной постановке. Fable 5 построила работающее приложение реального времени со стабильным циклом, процедурной графикой, состояниями взаимодействий, сменой фаз, canvas-эффектами, несколькими состояниями приложения и успешной продакшн-сборкой. Проблемы были не базовыми провалами завершения — это был следующий слой инженерной работы: детерминированные тесты, полировка под маленькие экраны и краевые случаи состояния.

Это самое ясное качественное отличие от предыдущих обзоров моделей. При достаточном контексте Fable 5 переходит прямо к реализации, вместо того чтобы переобъяснять план или повторно спрашивать разрешения. Она также, похоже, тратит больше усилий на архитектуру, взаимодействия и форму продукта, чем более узкая модель автодополнения кода.

Видеодемонстрация из оригинального обзора

В отчёте CodeRabbit по Fable 5 приведена видеозапись работы модели над проектом: смотреть на YouTube.

Рекомендация по Fable 5: избирательное внедрение

Рекомендация — избирательное внедрение. Fable 5 стоит тестировать для автономной работы над кодом, особенно на задачах, которые выигрывают от более глубокого планирования, мультифайлового исполнения и дополнительного времени на реализацию. Я бы не делал её значением по умолчанию для продакшн-ревью кода пока что.

Где я бы использовал

Fable 5 на своём месте

  • Автономные кодовые проекты с ясной целью.
  • Мультифайловая реализация, где глубина стоит ожидания.
  • Агентные процессы с явными бюджетами времени, шагов и токенов.
Где я бы притормозил

Пока не стоит

  • Дефолтный трафик код-ревью до тюнинга точности.
  • Позиционирование как security-ревьюера без более сильных доказательств.
  • Высоконагруженные процессы, где долгие прогоны создают риск стоимости или задержки.

Для код-ревью держите текущую базовую линию или путь Opus 4.8 значением по умолчанию, пока Fable 5 не улучшит точность и объём комментариев. Для кодовых агентов Fable 5 убедительнее — особенно когда работа выигрывает от исследования и более глубокой реализации. Ограничитель здесь операционный: дайте ей ясные бюджеты, условия остановки и чекпоинты ревью. Для процессов безопасности позиционируйте её как полезную для реализации кода, чувствительного к безопасности, а не как доказательство лучшего security-ревью.


12

Opus 5 против Fable 5: лобовое сравнение

Ниже — сводная матрица по обоим отчётам CodeRabbit. Важно: бенчмарки прогонялись в разное время, на разном количестве EP (96 против 105) и на разных версиях пайплайна, поэтому это сопоставление профилей поведения, а не турнирная таблица.

Precision-специалист

Claude Opus 5

Класс моделиФлагман семейства Opus
Контекст1 млн токенов (по умолч. = макс.)
Лучшая рольВторой ревьюер на точность
Actionable-точность39,3% (x-high)
Покрытие (actionable)55,2%
Нитпики92 (×4 к базовой линии)
Токены / вызов ревью≈60,5k вход · ≈9,5k выход
Агентная работаСотни фоновых агентов, но медленнее
Характер«Менее тревожная», обдуманная
Автономный исполнитель

Fable 5

Класс моделиMythos-class, автономная работа
КонтекстРасчёт на длительные сессии
Лучшая рольАвтономный кодинг и оркестрация
Actionable-точность32,8% (при 105 EP)
Покрытие (actionable)61,9% · 65/105
Комментариев всего253 — больше всех в прогоне
Цена$10 / $50 за млн + 10% регион.
Агентная работаСильнее и эффективнее
ХарактерИсследует среду, работает до таймаута
Сводная матрица: Opus 5 · Fable 5 · Opus 4.8
Критерий Opus 5 (x-high) Fable 5 Opus 4.8
Роль в код-ревью Специалист на точность, вторая линия Пока не для дефолтного трафика Сбалансированный дефолт
Actionable pass 55,2% 96 EP 61,9% 65/105 62,9% 66/105
Full-stream pass 60,8% 70,5% 74/105 73,3% 77/105
Actionable-точность 39,3% 32,8% 35,5%
Full-точность 28,6% 19,4% 26,5%
Шумность 92 нитпика · ×4 к базовой линии 253 комментария · много assertive 220 комментариев
Сложные EP (difficulty 4) не приводилось отдельно 8/16 9/16 базовая линия: 10/16
Автономный кодинг Шаг вперёд от 4.8, но не конкурент Fable Сильнейшая, если есть время Надёжная, но менее глубокая
Главный риск Пропуск важных проблем + шум Таймауты и стоимость длинных прогонов Отсутствие прорыва по глубине
Безопасность Осторожна; предохранители срабатывают реже, чем у Fable 5 Блокирующие классификаторы + откат на 4.8 Без специфичных ограничений в отчёте

Источники: обзор Opus 5 · обзор Fable 5 · релиз Opus 4.8. Прогоны выполнены на разных наборах EP — сравнивайте профили, а не десятые доли процента.

Профили моделей по пяти осям

Нормализованная качественная оценка на основе обоих отчётов CodeRabbit (0–10). Кликните по легенде, чтобы сравнить парами.

Это интерпретация для наглядности, а не измеренный бенчмарк: значения выведены из приведённых выше цифр и качественных выводов отчётов. Точные метрики смотрите в таблицах.

Итог сравнения в трёх строках
  • Нужно чистое actionable-подмножество на рискованном PR как вторая линия → Opus 5 x-high, с фильтрацией и парой к recall-ревьюеру.
  • Нужно построить что-то большое при неполном промпте → Fable 5, с жёсткими бюджетами по времени, шагам и токенам.
  • Нужен один надёжный дефолт для потока ревью → Opus 4.8 или текущая базовая линия.

13

Как оценить Opus 5 самостоятельно

Не судите её по одной заголовочной цифре. Opus 5 может выдавать более чистые actionable-комментарии, при этом пропуская больше известных проблем и создавая больше шума в целом. Ваша оценка должна фиксировать и то, что модель находит, и то, через что разработчикам придётся просеиваться.

  1. Тестируйте каждый релевантный уровень effort — включая low и medium. Больше reasoning менялo компромисс в наших прогонах; оно не улучшало ревью последовательно.
  2. Сравните ограничительные промпты с широким репортингом + фильтрацией. Инструкции вроде «сообщай только о проблемах высокой критичности» могут подавить полезные находки.
  3. Настройте лаконичность и порог критичности до раскатки — и до того, как разработчики научатся пролистывать ревью не читая.
  4. Уберите избыточные инструкции по верификации и проследите их влияние на время выполнения, токены и стоимость.
  5. Разложите пропуски по категориям и критичности. Если дорогой режим отказа — это пропущенная проблема, сочетайте Opus 5 с recall-ориентированным ревьюером.
Практический чек-лист: что фиксировать в собственном прогоне
  • Обе пары метрик: actionable и full-stream, покрытие и точность — четыре цифры, не одна.
  • Абсолютное количество нитпиков на PR — это прямой прокси нагрузки на триаж.
  • Входные и выходные токены на вызов и итоговая стоимость решённой задачи.
  • Разбивка пропусков по категориям: логика, конкурентность, API, валидация.
  • Поведение на самых сложных EP — там разрывы между моделями заметнее всего.

14

Наш вердикт: дайте ей конкретную роль

Opus 5 легче рекомендовать как строителя, чем как самостоятельного ревьюера

Для неоднозначных, дизайн-ориентированных задач по написанию кода это значимый шаг вперёд относительно Opus 4.8. Она более обдуманная, лучше исследует варианты и способнее координировать сложную работу. Fable 5 всё ещё выглядит сильнее и эффективнее для длительной оркестрации.

Для код-ревью Opus 5 x-high — специалист. Она выдаёт более чистое actionable-подмножество, но ловит меньше известных проблем и добавляет существенный «хвост» нитпиков. Используйте её там, где важна точность, сочетайте с recall-ориентированным покрытием и фильтруйте её вывод до того, как он дойдёт до разработчиков.

Как ревьюер
Вторая линия на точность, с фильтром
Как строитель
Явный апгрейд от Opus 4.8
Против Fable 5
Проигрывает в длинной оркестрации
Не использовать как
Единственного ревьюера на рискованных изменениях
Берите, если

Точность дороже полноты

У вас уже есть recall-полоса, и вам нужен второй голос, который редко ошибается в actionable-комментариях. Плюс — задачи на конфигурацию и качество кода.

Осторожно, если

Бюджет на токены жёсткий

+50% на входе и +65% на выходе против базовой линии — при кратно большем объёме нитпиков. Считайте стоимость решённой задачи, а не цену за токен.

Не берите, если

Нужна страховка на корректность

Логика, состояния гонки и неправильное использование API — слабые места. На конкурентном коде это именно тот класс проблем, пропуск которых стоит дороже всего.


15

Частые вопросы

Стоит ли делать Opus 5 основным ревьюером?

Нет. Точность actionable-подмножества выше (39,3% против 35,2%), но покрытие ниже (55,2% против 61,1%), а нитпиков вчетверо больше. Это роль второго, точечного ревьюера, а не основной страховки.

Улучшает ли повышение effort качество?

Не равномерно. Effort — это выбор режима отказа: junior/default даёт максимум full-stream покрытия (67,0%), x-high — максимум actionable-точности (39,3%) при минимальном покрытии (55,2%).

Чем Opus 5 отличается от Fable 5?

Fable 5 — модель класса Mythos для автономной работы: сильна при неполном промпте, но часто уходит в таймаут и стоит $10/$50 за млн токенов. Opus 5 — более обдуманный «строитель» и точечный ревьюер, но в длительной оркестрации Fable 5 сильнее.

Сколько токенов уходит на вызов ревью?

≈60,5 тыс. входных (55–64 тыс. по конфигурациям) и ≈9,5 тыс. выходных (8,1–10,8 тыс.). Это +50% и +65% против линеек GPT-5.6 (≈40,5 тыс. и ≈5,8 тыс.) в тех же прогонах.

Где Opus 5 слабее всего?

Состояния гонки (−10…−20 п.п.) — самая явная слабость, притом что прежние Opus были здесь сильны. Далее логические ошибки, неправильное использование API и валидация данных.

Решена ли проблема длинного контекста?

Контекст вырос до 1 млн токенов как значение по умолчанию и максимум, стабильность заявлена на всём протяжении. Это прямой ответ на деградацию на 200k токенах, замеченную у Opus 4.8.


16

Источники и все внешние ссылки

Основные первоисточники

История семейства Opus и другие модели

Дополнительные материалы

О переводе и дополнении

Это русская версия материала с сохранением всех данных, формулировок выводов и внешних ссылок оригинала. Раздел о Fable 5 добавлен как расширение на основе отдельного отчёта CodeRabbit. Иллюстрации из оригинальных статей приведены как цитирование с указанием источника. Подготовил Дмитрий Жечков, 2026.