28 мая 2026 Доступно везде Цена без изменений Anthropic

Что нового в
Claude Opus 4.8

Полный разбор инкрементального, но осязаемого апгрейда: честность как headline-фича, Dynamic Workflows с сотнями параллельных субагентов, Effort Control, Fast Mode в 3× дешевле и Mid-task system messages. Подготовлено в paranoid-режиме — все цифры триангулированы по ≥3 источникам.

✍️ Подготовил Дмитрий Жечков · Официальный пост Anthropic · System Card

дешевле Fast Mode
2.5×
быстрее Fast Mode
69.2
SWE-bench Pro
~4×
реже пропускает дефекты
1M
токенов контекст
750K
строк Rust (кейс Bun)
1

Главное за 60 секунд

Opus 4.8 — это инкрементальный, но осязаемый апгрейд Opus 4.7. Сама Anthropic называет его «скромным, но ощутимым улучшением предшественника» — то есть это не смена поколения, а уплотнение качества.

🎯 Ключевые векторы

  • 🧠
    Честность (honesty) как headline-фича. Модель реже «придумывает» прогресс и чаще флагует неуверенность.
  • ⚙️
    Лучший агентный кодинг и computer use при той же цене токенов.
  • 🎛️
    Effort control — ручка управления усилием/токенами прямо в интерфейсе.
  • 🚀
    Dynamic Workflows в Claude Code — сотни параллельных субагентов в одной сессии (research preview).
  • Fast mode теперь в 3 раза дешевле, чем у прошлых моделей, при скорости 2,5×.
  • 🔧
    Mid-task system messages в Messages API — обновление инструкций без слома prompt cache.
💡

Под капотом интереснее: на внутренней «лестнице способностей» Anthropic, Opus 4.8 садится между Opus 4.7 и закрытым Claude Mythos Preview, а по выравниванию (alignment) — почти догнал Mythos.

2

Честность — почему это главное изменение

Anthropic выносит честность на первый план не маркетингово, а метрически. Базовая проблема LLM: модели иногда спешат с выводами, уверенно заявляя о прогрессе при тонких доказательствах.

✅ Что изменилось

  • Ранние тестеры сообщают, что Opus 4.8 чаще флагует неопределённость в своей работе и реже делает неподтверждённые заявления (Anthropic).
  • В оценках Opus 4.8 примерно в 4 раза реже предшественника пропускает без комментария флоу/дефекты в коде, который сам же написал (Anthropic).
  • Команда Alignment заключила, что модель достигает новых максимумов по просоциальным чертам — поддержка автономии пользователя и действие в его интересах (Anthropic).

📊 Цифры по misalignment

По данным VentureBeat, оценка построена на ~2 600 симулированных investigation-сессий на модель (ниже = лучше).

Misalignment Score (ниже = лучше)

Opus 4.7 ~2.5
Opus 4.8 ~1.9
Claude Mythos Preview (закрытая) ~1.9

Уровень дезориентированного поведения (обман, кооперация со злоупотреблением) существенно ниже Opus 4.7 и близок к лучшей по выравниванию модели Anthropic — Mythos Preview.

💼

Почему это важно для делегирования. Аналитик из Hebbia отмечает: главный дифференциатор — склонность Opus 4.8 проактивно подсвечивать проблемы во входных и выходных данных анализа, которые другие модели регулярно пропускали. Для агентных воркфлоу это разница между «надо проверять каждый шаг» и «можно отдать задачу и вернуться позже».

3

Бенчмарки — что реально выросло

Сводка по официальной таблице Anthropic и независимым разборам. Триангулировано по Anthropic, Vellum, llm-stats и digitalapplied.

Бенчмарк Opus 4.8 Opus 4.7 GPT-5.5 Gemini 3.1 Pro Что измеряет
SWE-bench Pro 69.2 64.3 58.6 54.2 Реальные «грязные» GitHub-issue
SWE-bench Verified 88.6 87.6 80.6 Классический 500-задачный сет
SWE-bench Multilingual 84.4 80.5 Многоязычный кодинг
Terminal-Bench 2.1 74.6 66.1 78.2 70.3 Терминальные агент-циклы
OSWorld-Verified 83.4 82.8* 78.7 76.2 Реальные задачи на живой Ubuntu VM
HLE (без инструментов) 49.8 46.9 41.4 44.4 Humanity's Last Exam
HLE (с инструментами) 57.9 54.7 52.2 51.4 Мультидисциплинарное рассуждение
GPQA Diamond 93.6 94.2 94.3 Научное рассуждение (насыщено)
GDPval-AA (Elo) 1890 1753 1769 1314 Knowledge work, реальная эконом. ценность
Finance Agent v2 53.9 51.8 51.8 43.0 Агентный финанализ
GraphWalks BFS 1M 68.1 45.4* 45.4 Работа с длинным контекстом
USAMO 2026 96.7 69.3 Олимпиадная математика

* По Vellum, Opus 4.7 на OSWorld пересчитан до 82.8 после фикса бага в zoom-инструменте и поднятия max-tokens с 16K до 128K. Часть прироста — методология, а не чистая способность.

⚠️ Где Opus 4.8 проигрывает

Terminal-Bench 2.1. GPT-5.5 лидирует (78.2 против 74.6). Важная оговорка: бенчмарк чувствителен к harness. Anthropic репортит Opus 4.8 на публичном harness Terminus-2; «родной» score GPT-5.5 на Codex CLI — 83.4%. Если ваш стек живёт в терминале (тяжёлый CLI-скриптинг) — это реальный, а не округлённый дифференциатор.

GPQA Diamond. Все три фронтир-модели статистически связаны выше 93% — это выглядит как насыщение бенчмарка, а не отставание.

📌

Как читать. Прыжок +4.9 на SWE-bench Pro важнее, чем +1.0 на Verified: Verified близок к насыщению, а Pro — более сложный, менее «загрязнённый» сет на реальных репозиториях. По Medium-разбору, net-результат: Opus 4.8 берёт 6 из 7 ключевых бенчмарков, GPT-5.5 — 1 из 7.

4

Новые продуктовые фичи

🎛️ 4.1 · Effort Control (управление усилием)

Рядом с селектором модели в claude.ai и Cowork появилась ручка сколько усилий тратить на ответ (Anthropic):

🐌
Низкое усилие
Быстрее, медленнее расходует rate limits
Высокое усилие
Думает чаще и глубже, ответы лучше
🚀
Extra / Max
Для сложных задач и долгих async-воркфлоу
  • Opus 4.8 по умолчанию работает на «high» — Anthropic считает это лучшим балансом. На кодинге тратит примерно столько же токенов, что дефолт Opus 4.7, но с лучшим результатом.
  • Уровни: extra (в Claude Code — xhigh) или max — больше токенов, лучше результат.
  • Rate limits в Claude Code подняты, чтобы вместить более высокий расход токенов.
  • Доступно на всех тарифах.
⚠️

Расхождение в источниках: по Gizmodo панель в claude.ai по умолчанию стоит на «Low» с уровнями Medium/High/Max + adaptive thinking. Это противоречит формулировке Anthropic о дефолте «high». Вероятно, разные дефолты для разных интерфейсов/контекстов — стоит проверить у себя в селекторе.

🌐 4.2 · Dynamic Workflows в Claude Code (research preview)

Самая мощная фича для агентной разработки. Первоисточники: Anthropic — Opus 4.8, Anthropic — Introducing dynamic workflows, TechCrunch.

🤖

Суть. Claude сам пишет оркестрационный скрипт под задачу, раскидывает работу по десяткам–сотням параллельных субагентов в одной сессии и проверяет результат до того, как он дойдёт до пользователя. Работа, которую обычно планируют кварталами, укладывается в дни.

⚙️ Как это работает по шагам

1
Динамическое планирование
Claude строит план на основе промпта — не по зашитому шаблону, а под конкретную задачу.
2
Декомпозиция
План разбивается на подзадачи.
3
Fan-out
Работа раскидывается по субагентам, работающим параллельно.
4
Adversarial-конвергенция
Агенты атакуют проблему с независимых сторон, другие агенты пытаются опровергнуть найденное, прогон итерируется, пока ответы не сойдутся (converge). Именно так достигается результат, недостижимый за один проход.
5
Сборка
Результаты проверяются перед вливанием в общий ответ; пользователь получает один скоординированный итог.

🏗️ Ключевые архитектурные свойства

  • Координация вне разговора (outside the conversation). План не «съезжает», как бы ни росла задача — это снимает деградацию контекста на длинных прогонах (Anthropic).
  • Durable execution. Прогон рассчитан на часы и дни; прогресс сохраняется по ходу, прерванный джоб продолжается с места остановки, а не стартует заново.
  • Adversarial-режим для критичных задач — Claude делает независимые попытки решения, агенты-«ломатели» атакуют результат до того, как пользователь его увидит.
  • С Opus 4.8 субагенты могут работать дольше.

🚀 Как запустить

Рекомендуется включить auto mode, далее два способа (Anthropic):

1 Прямо попросить: "Create a workflow"
2 Включить настройку Claude Code ultracode (через effort-меню) — ставит уровень усилия на xhigh и позволяет Claude самому решать, когда применить воркфлоу.

При первом запуске Claude Code покажет план выполнения и попросит подтверждение.

📋 Доступность и дефолты

План Состояние по умолчанию
Max / Team ✅ Включено
API (Bedrock, Vertex AI, Microsoft Foundry) ✅ Включено
Enterprise ⚙️ Выключено — включает админ в настройках Claude Code

Среды: Claude Code CLI, Desktop, VS Code extension (research preview).

⚠️

Расход токенов. Воркфлоу жрут существенно больше токенов, чем обычная сессия. Anthropic советует начинать с узкой scoped-задачи. Админы организации могут отключить фичу через managed settings.

🦀 Реальный кейс масштаба: переписывание Bun

Jarred Sumner портировал Bun с Zig на Rust через dynamic workflows (Anthropic):

99.8%
существующих тестов проходит
~750K
строк Rust
11
дней от коммита до merge
Шаг 1
Один воркфлоу замапил правильный Rust lifetime для каждого поля каждой структуры в Zig-кодбазе.
Шаг 2
Следующий написал каждый .rs-файл как behavior-identical порт .zig-аналога — сотни агентов параллельно, по два ревьюера на файл.
Шаг 3
Fix-loop гонял build и тесты до чистого прохода.
Шаг 4
После приземления порта ночной воркфлоу убрал лишние копирования данных и открыл PR на каждое исправление.

Заметка для гибридных сценариев. Паттерн «координация вне разговора» + checkpoint-восстановление — это фактически durable execution поверх агентов, концептуально близко к temporal-подобным оркестраторам, только план генерится динамически. Документация: code.claude.com/docs/en/workflows.

⚡ 4.3 · Fast Mode
2.5×
быстрее
дешевле предыдущих
$10
за 1M input токенов
  • Скорость 2,5× (Anthropic).
  • 💰
    В 3 раза дешевле, чем fast mode у предыдущих моделей.
  • 📊
    Цена fast mode: $10 / 1M input, $50 / 1M output.
🔧 4.4 · Mid-task System Messages (Messages API)

Для разработчиков, строящих агентов — тихая, но важная фича (Anthropic):

  • Messages API теперь принимает system-записи внутри массива messages.
  • Можно обновлять инструкции Claude посреди задачи — не ломая prompt cache и не маршрутизируя обновление через user-ход.
  • Применение: на лету менять права/permissions, бюджеты токенов или контекст окружения по мере работы агента.
5

Цена и доступ

Из официального блога Anthropic:

Input — обычный
$5
за 1M токенов
Output — обычный
$25
за 1M токенов
Input — Fast Mode
$10
за 1M токенов
Output — Fast Mode
$50
за 1M токенов
ПараметрЗначение
API model IDclaude-opus-4-8
Алиасopus теперь маршрутизирует на 4.8
Контекст1M токенов (Anthropic API, Bedrock, Vertex AI)
Доступность✅ Везде, на всех платных и бесплатных интерфейсах
🌏

Контекст по рынку. DeepSeek V4-Pro остаётся радикально дешевле (≈12× по input, ≈29× по output), но проигрывает по способностям — codersera. Anthropic явно делает ставку на снижение совокупной стоимости через эффективность (меньше шагов на задачу, дешевле fast mode), а не через демпинг цены за токен.

6

Отзывы enterprise-партнёров

Из официального поста Anthropic и VentureBeat (верифицированные):

🖱️ Cursor

Michael Truell: на CursorBench Opus 4.8 превосходит прошлые Opus на всех уровнях усилия; tool-calling заметно эффективнее — меньше шагов на ту же интеллектуальность.

кодингtool-calling
🤖 Cognition / Devin

Scott Wu: релиз исправил проблемы с verbosity комментариев и tool-calling, которые были в Opus 4.7.

verbositytool-calling
📊 Databricks (Genie)

Step change в агентном рассуждении, плюс рассуждение прямо по PDF и диаграммам на 61% дешевле по токенам, чем Opus 4.7.

агентное рассуждениеPDF61% экономия
📑 Hebbia

Лучшая точность цитирования и токен-эффективность на плотных финансовых документах. Главный дифференциатор — проактивное подсвечивание проблем во входных данных.

финансыцитирование
🖥️ Computer-use партнёр

84% на Online-Mind2Web — заметный скачок над Opus 4.7 и GPT-5.5.

computer usebrowser-agent
⚖️ Legal-партнёр

Первая модель, преодолевшая 10% на all-pass стандарте Legal Agent Benchmark.

legalагентный
7

Что дальше: Mythos-class

Anthropic анонсировала два направления (Anthropic, Help Net Security):

🔮 Roadmap Anthropic

1
Модели уровня Opus, но дешевле
В разработке. Anthropic продолжает снижать стоимость инференса без потери качества.
2
Новый класс моделей выше Opus — Mythos-class
Сейчас узкий круг организаций использует Claude Mythos Preview для задач кибербезопасности в рамках Project Glasswing (обновление Glasswing). Модели такого уровня требуют более сильных кибер-защит перед общим релизом. Anthropic ожидает вывести Mythos-class для всех клиентов «в ближайшие недели», как только защиты будут готовы.
8

Практические выводы

Применимо к работе с агентами на on-prem/cloud-границе и к продуктовым решениям:

✅ Что стало лучше

  • Делегирование стало надёжнее. Рост честности + проактивный флаггинг проблем снижает потребность в babysitting агентов — критично для долгих автономных воркфлоу.
  • Effort control = рычаг costs vs quality. Можно явно балансировать расход токенов под конкретный сценарий; для дорогих on-prem inference-бюджетов это прямой инструмент управления.
  • Mid-task system messages открывают чистый паттерн смены permissions/бюджетов агента на лету — полезно для security-граничных сценариев (динамические права без рестарта сессии).
  • Dynamic Workflows — если есть доступ Enterprise/Team/Max: миграции масштаба кодовой базы становятся реалистичной задачей под один проход.

⚠️ На что обратить внимание

  • Терминал-тяжёлые стеки — учитывайте, что GPT-5.5 всё ещё впереди на Terminal-Bench; для чистого CLI-loop это аргумент для гибридной маршрутизации моделей.
  • Скепсис paranoid-режима: часть прироста OSWorld — методологическая (новый harness, пересчёт 4.7). Реальные «чистые» приросты — SWE-bench Pro, HLE с инструментами, GDPval-AA, GraphWalks long-context.
📚

Индекс источников

Первоисточники (Anthropic)

Вторичные источники (верификация цифр)

Подготовлено в paranoid-режиме: цифры триангулированы по ≥3 независимым источникам, методологические оговорки (harness Terminal-Bench, пересчёт OSWorld 4.7, расхождение по дефолту effort control) явно отмечены. Все ссылки — кликабельные инлайн.