28 мая 2026 Доступно везде Цена без изменений Anthropic

Что нового в
Claude Opus 4.8

Полный разбор инкрементального, но осязаемого апгрейда: честность как headline-фича, Dynamic Workflows с сотнями параллельных субагентов, Effort Control, Fast Mode в 3× дешевле и Mid-task system messages. Подготовлено в paranoid-режиме — все цифры триангулированы по ≥3 источникам.

✍️ Подготовил Дмитрий Жечков · Официальный пост Anthropic · System Card

3×
дешевле Fast Mode
2.5×
быстрее Fast Mode
69.2
SWE-bench Pro
~4×
реже пропускает дефекты
1M
токенов контекст
750K
строк Rust (кейс Bun)
1

Главное за 60 секунд

Opus 4.8 — это инкрементальный, но осязаемый апгрейд Opus 4.7. Сама Anthropic называет его «скромным, но ощутимым улучшением предшественника» — то есть это не смена поколения, а уплотнение качества.

🎯 Ключевые векторы

  • 🧠
    Честность (honesty) как headline-фича. Модель реже «придумывает» прогресс и чаще флагует неуверенность.
  • ⚙️
    Лучший агентный кодинг и computer use при той же цене токенов.
  • 🎛️
    Effort control — ручка управления усилием/токенами прямо в интерфейсе.
  • 🚀
    Dynamic Workflows в Claude Code — сотни параллельных субагентов в одной сессии (research preview).
  • ⚡
    Fast mode теперь в 3 раза дешевле, чем у прошлых моделей, при скорости 2,5×.
  • 🔧
    Mid-task system messages в Messages API — обновление инструкций без слома prompt cache.
💡

Под капотом интереснее: на внутренней «лестнице способностей» Anthropic, Opus 4.8 садится между Opus 4.7 и закрытым Claude Mythos Preview, а по выравниванию (alignment) — почти догнал Mythos.

2

Честность — почему это главное изменение

Anthropic выносит честность на первый план не маркетингово, а метрически. Базовая проблема LLM: модели иногда спешат с выводами, уверенно заявляя о прогрессе при тонких доказательствах.

✅ Что изменилось

  • ●
    Ранние тестеры сообщают, что Opus 4.8 чаще флагует неопределённость в своей работе и реже делает неподтверждённые заявления (Anthropic).
  • ●
    В оценках Opus 4.8 примерно в 4 раза реже предшественника пропускает без комментария флоу/дефекты в коде, который сам же написал (Anthropic).
  • ●
    Команда Alignment заключила, что модель достигает новых максимумов по просоциальным чертам — поддержка автономии пользователя и действие в его интересах (Anthropic).

📊 Цифры по misalignment

По данным VentureBeat, оценка построена на ~2 600 симулированных investigation-сессий на модель (ниже = лучше).

Misalignment Score (ниже = лучше)

Opus 4.7 ~2.5
Opus 4.8 ~1.9
Claude Mythos Preview (закрытая) ~1.9

Уровень дезориентированного поведения (обман, кооперация со злоупотреблением) существенно ниже Opus 4.7 и близок к лучшей по выравниванию модели Anthropic — Mythos Preview.

💼

Почему это важно для делегирования. Аналитик из Hebbia отмечает: главный дифференциатор — склонность Opus 4.8 проактивно подсвечивать проблемы во входных и выходных данных анализа, которые другие модели регулярно пропускали. Для агентных воркфлоу это разница между «надо проверять каждый шаг» и «можно отдать задачу и вернуться позже».

3

Бенчмарки — что реально выросло

Сводка по официальной таблице Anthropic и независимым разборам. Триангулировано по Anthropic, Vellum, llm-stats и digitalapplied.

Бенчмарк Opus 4.8 Opus 4.7 GPT-5.5 Gemini 3.1 Pro Что измеряет
SWE-bench Pro 69.2 64.3 58.6 54.2 Реальные «грязные» GitHub-issue
SWE-bench Verified 88.6 87.6 — 80.6 Классический 500-задачный сет
SWE-bench Multilingual 84.4 80.5 — — Многоязычный кодинг
Terminal-Bench 2.1 74.6 66.1 78.2 70.3 Терминальные агент-циклы
OSWorld-Verified 83.4 82.8* 78.7 76.2 Реальные задачи на живой Ubuntu VM
HLE (без инструментов) 49.8 46.9 41.4 44.4 Humanity's Last Exam
HLE (с инструментами) 57.9 54.7 52.2 51.4 Мультидисциплинарное рассуждение
GPQA Diamond 93.6 94.2 — 94.3 Научное рассуждение (насыщено)
GDPval-AA (Elo) 1890 1753 1769 1314 Knowledge work, реальная эконом. ценность
Finance Agent v2 53.9 51.8 51.8 43.0 Агентный финанализ
GraphWalks BFS 1M 68.1 45.4* 45.4 — Работа с длинным контекстом
USAMO 2026 96.7 69.3 — — Олимпиадная математика

* По Vellum, Opus 4.7 на OSWorld пересчитан до 82.8 после фикса бага в zoom-инструменте и поднятия max-tokens с 16K до 128K. Часть прироста — методология, а не чистая способность.

⚠️ Где Opus 4.8 проигрывает

Terminal-Bench 2.1. GPT-5.5 лидирует (78.2 против 74.6). Важная оговорка: бенчмарк чувствителен к harness. Anthropic репортит Opus 4.8 на публичном harness Terminus-2; «родной» score GPT-5.5 на Codex CLI — 83.4%. Если ваш стек живёт в терминале (тяжёлый CLI-скриптинг) — это реальный, а не округлённый дифференциатор.

GPQA Diamond. Все три фронтир-модели статистически связаны выше 93% — это выглядит как насыщение бенчмарка, а не отставание.

📌

Как читать. Прыжок +4.9 на SWE-bench Pro важнее, чем +1.0 на Verified: Verified близок к насыщению, а Pro — более сложный, менее «загрязнённый» сет на реальных репозиториях. По Medium-разбору, net-результат: Opus 4.8 берёт 6 из 7 ключевых бенчмарков, GPT-5.5 — 1 из 7.

4

Новые продуктовые фичи

🎛️ 4.1 · Effort Control (управление усилием) ▼

Рядом с селектором модели в claude.ai и Cowork появилась ручка сколько усилий тратить на ответ (Anthropic):

🐌
Низкое усилие
Быстрее, медленнее расходует rate limits
⚡
Высокое усилие
Думает чаще и глубже, ответы лучше
🚀
Extra / Max
Для сложных задач и долгих async-воркфлоу
  • ●
    Opus 4.8 по умолчанию работает на «high» — Anthropic считает это лучшим балансом. На кодинге тратит примерно столько же токенов, что дефолт Opus 4.7, но с лучшим результатом.
  • ●
    Уровни: extra (в Claude Code — xhigh) или max — больше токенов, лучше результат.
  • ●
    Rate limits в Claude Code подняты, чтобы вместить более высокий расход токенов.
  • ●
    Доступно на всех тарифах.
⚠️

Расхождение в источниках: по Gizmodo панель в claude.ai по умолчанию стоит на «Low» с уровнями Medium/High/Max + adaptive thinking. Это противоречит формулировке Anthropic о дефолте «high». Вероятно, разные дефолты для разных интерфейсов/контекстов — стоит проверить у себя в селекторе.

🌐 4.2 · Dynamic Workflows в Claude Code (research preview) ▼

Самая мощная фича для агентной разработки. Первоисточники: Anthropic — Opus 4.8, Anthropic — Introducing dynamic workflows, TechCrunch.

🤖

Суть. Claude сам пишет оркестрационный скрипт под задачу, раскидывает работу по десяткам–сотням параллельных субагентов в одной сессии и проверяет результат до того, как он дойдёт до пользователя. Работа, которую обычно планируют кварталами, укладывается в дни.

⚙️ Как это работает по шагам

1
Динамическое планирование
Claude строит план на основе промпта — не по зашитому шаблону, а под конкретную задачу.
2
Декомпозиция
План разбивается на подзадачи.
3
Fan-out
Работа раскидывается по субагентам, работающим параллельно.
4
Adversarial-конвергенция
Агенты атакуют проблему с независимых сторон, другие агенты пытаются опровергнуть найденное, прогон итерируется, пока ответы не сойдутся (converge). Именно так достигается результат, недостижимый за один проход.
5
Сборка
Результаты проверяются перед вливанием в общий ответ; пользователь получает один скоординированный итог.

🏗️ Ключевые архитектурные свойства

  • ◆
    Координация вне разговора (outside the conversation). План не «съезжает», как бы ни росла задача — это снимает деградацию контекста на длинных прогонах (Anthropic).
  • ◆
    Durable execution. Прогон рассчитан на часы и дни; прогресс сохраняется по ходу, прерванный джоб продолжается с места остановки, а не стартует заново.
  • ◆
    Adversarial-режим для критичных задач — Claude делает независимые попытки решения, агенты-«ломатели» атакуют результат до того, как пользователь его увидит.
  • ◆
    С Opus 4.8 субагенты могут работать дольше.

🚀 Как запустить

Рекомендуется включить auto mode, далее два способа (Anthropic):

1 Прямо попросить: "Create a workflow"
2 Включить настройку Claude Code ultracode (через effort-меню) — ставит уровень усилия на xhigh и позволяет Claude самому решать, когда применить воркфлоу.

При первом запуске Claude Code покажет план выполнения и попросит подтверждение.

📋 Доступность и дефолты

План Состояние по умолчанию
Max / Team ✅ Включено
API (Bedrock, Vertex AI, Microsoft Foundry) ✅ Включено
Enterprise ⚙️ Выключено — включает админ в настройках Claude Code

Среды: Claude Code CLI, Desktop, VS Code extension (research preview).

⚠️

Расход токенов. Воркфлоу жрут существенно больше токенов, чем обычная сессия. Anthropic советует начинать с узкой scoped-задачи. Админы организации могут отключить фичу через managed settings.

🦀 Реальный кейс масштаба: переписывание Bun

Jarred Sumner портировал Bun с Zig на Rust через dynamic workflows (Anthropic):

99.8%
существующих тестов проходит
~750K
строк Rust
11
дней от коммита до merge
Шаг 1
Один воркфлоу замапил правильный Rust lifetime для каждого поля каждой структуры в Zig-кодбазе.
Шаг 2
Следующий написал каждый .rs-файл как behavior-identical порт .zig-аналога — сотни агентов параллельно, по два ревьюера на файл.
Шаг 3
Fix-loop гонял build и тесты до чистого прохода.
Шаг 4
После приземления порта ночной воркфлоу убрал лишние копирования данных и открыл PR на каждое исправление.

Заметка для гибридных сценариев. Паттерн «координация вне разговора» + checkpoint-восстановление — это фактически durable execution поверх агентов, концептуально близко к temporal-подобным оркестраторам, только план генерится динамически. Документация: code.claude.com/docs/en/workflows.

⚡ 4.3 · Fast Mode ▼
2.5×
быстрее
3×
дешевле предыдущих
$10
за 1M input токенов
  • ⚡
    Скорость 2,5× (Anthropic).
  • 💰
    В 3 раза дешевле, чем fast mode у предыдущих моделей.
  • 📊
    Цена fast mode: $10 / 1M input, $50 / 1M output.
🔧 4.4 · Mid-task System Messages (Messages API) ▼

Для разработчиков, строящих агентов — тихая, но важная фича (Anthropic):

  • ●
    Messages API теперь принимает system-записи внутри массива messages.
  • ●
    Можно обновлять инструкции Claude посреди задачи — не ломая prompt cache и не маршрутизируя обновление через user-ход.
  • ●
    Применение: на лету менять права/permissions, бюджеты токенов или контекст окружения по мере работы агента.
5

Цена и доступ

Из официального блога Anthropic:

Input — обычный
$5
за 1M токенов
Output — обычный
$25
за 1M токенов
Input — Fast Mode
$10
за 1M токенов
Output — Fast Mode
$50
за 1M токенов
ПараметрЗначение
API model IDclaude-opus-4-8
Алиасopus теперь маршрутизирует на 4.8
Контекст1M токенов (Anthropic API, Bedrock, Vertex AI)
Доступность✅ Везде, на всех платных и бесплатных интерфейсах
🌏

Контекст по рынку. DeepSeek V4-Pro остаётся радикально дешевле (≈12× по input, ≈29× по output), но проигрывает по способностям — codersera. Anthropic явно делает ставку на снижение совокупной стоимости через эффективность (меньше шагов на задачу, дешевле fast mode), а не через демпинг цены за токен.

6

Отзывы enterprise-партнёров

Из официального поста Anthropic и VentureBeat (верифицированные):

🖱️ Cursor

Michael Truell: на CursorBench Opus 4.8 превосходит прошлые Opus на всех уровнях усилия; tool-calling заметно эффективнее — меньше шагов на ту же интеллектуальность.

кодингtool-calling
🤖 Cognition / Devin

Scott Wu: релиз исправил проблемы с verbosity комментариев и tool-calling, которые были в Opus 4.7.

verbositytool-calling
📊 Databricks (Genie)

Step change в агентном рассуждении, плюс рассуждение прямо по PDF и диаграммам на 61% дешевле по токенам, чем Opus 4.7.

агентное рассуждениеPDF61% экономия
📑 Hebbia

Лучшая точность цитирования и токен-эффективность на плотных финансовых документах. Главный дифференциатор — проактивное подсвечивание проблем во входных данных.

финансыцитирование
🖥️ Computer-use партнёр

84% на Online-Mind2Web — заметный скачок над Opus 4.7 и GPT-5.5.

computer usebrowser-agent
⚖️ Legal-партнёр

Первая модель, преодолевшая 10% на all-pass стандарте Legal Agent Benchmark.

legalагентный
7

Что дальше: Mythos-class

Anthropic анонсировала два направления (Anthropic, Help Net Security):

🔮 Roadmap Anthropic

1
Модели уровня Opus, но дешевле
В разработке. Anthropic продолжает снижать стоимость инференса без потери качества.
2
Новый класс моделей выше Opus — Mythos-class
Сейчас узкий круг организаций использует Claude Mythos Preview для задач кибербезопасности в рамках Project Glasswing (обновление Glasswing). Модели такого уровня требуют более сильных кибер-защит перед общим релизом. Anthropic ожидает вывести Mythos-class для всех клиентов «в ближайшие недели», как только защиты будут готовы.
8

Практические выводы

Применимо к работе с агентами на on-prem/cloud-границе и к продуктовым решениям:

✅ Что стало лучше

  • ▲
    Делегирование стало надёжнее. Рост честности + проактивный флаггинг проблем снижает потребность в babysitting агентов — критично для долгих автономных воркфлоу.
  • ▲
    Effort control = рычаг costs vs quality. Можно явно балансировать расход токенов под конкретный сценарий; для дорогих on-prem inference-бюджетов это прямой инструмент управления.
  • ▲
    Mid-task system messages открывают чистый паттерн смены permissions/бюджетов агента на лету — полезно для security-граничных сценариев (динамические права без рестарта сессии).
  • ▲
    Dynamic Workflows — если есть доступ Enterprise/Team/Max: миграции масштаба кодовой базы становятся реалистичной задачей под один проход.

⚠️ На что обратить внимание

  • ▲
    Терминал-тяжёлые стеки — учитывайте, что GPT-5.5 всё ещё впереди на Terminal-Bench; для чистого CLI-loop это аргумент для гибридной маршрутизации моделей.
  • ▲
    Скепсис paranoid-режима: часть прироста OSWorld — методологическая (новый harness, пересчёт 4.7). Реальные «чистые» приросты — SWE-bench Pro, HLE с инструментами, GDPval-AA, GraphWalks long-context.
📚

Индекс источников

Первоисточники (Anthropic)

Вторичные источники (верификация цифр)

Подготовлено в paranoid-режиме: цифры триангулированы по ≥3 независимым источникам, методологические оговорки (harness Terminal-Bench, пересчёт OSWorld 4.7, расхождение по дефолту effort control) явно отмечены. Все ссылки — кликабельные инлайн.