Главное за 60 секунд
Opus 4.8 — это инкрементальный, но осязаемый апгрейд Opus 4.7. Сама Anthropic называет его «скромным, но ощутимым улучшением предшественника» — то есть это не смена поколения, а уплотнение качества.
🎯 Ключевые векторы
-
🧠
Честность (honesty) как headline-фича. Модель реже «придумывает» прогресс и чаще флагует неуверенность.
-
⚙️
Лучший агентный кодинг и computer use при той же цене токенов.
-
🎛️
Effort control — ручка управления усилием/токенами прямо в интерфейсе.
-
🚀
Dynamic Workflows в Claude Code — сотни параллельных субагентов в одной сессии (research preview).
-
⚡
Fast mode теперь в 3 раза дешевле, чем у прошлых моделей, при скорости 2,5×.
-
🔧
Mid-task system messages в Messages API — обновление инструкций без слома prompt cache.
Под капотом интереснее: на внутренней «лестнице способностей» Anthropic, Opus 4.8 садится между Opus 4.7 и закрытым Claude Mythos Preview, а по выравниванию (alignment) — почти догнал Mythos.
Честность — почему это главное изменение
Anthropic выносит честность на первый план не маркетингово, а метрически. Базовая проблема LLM: модели иногда спешат с выводами, уверенно заявляя о прогрессе при тонких доказательствах.
✅ Что изменилось
-
●
Ранние тестеры сообщают, что Opus 4.8 чаще флагует неопределённость в своей работе и реже делает неподтверждённые заявления (Anthropic).
-
●
В оценках Opus 4.8 примерно в 4 раза реже предшественника пропускает без комментария флоу/дефекты в коде, который сам же написал (Anthropic).
-
●
Команда Alignment заключила, что модель достигает новых максимумов по просоциальным чертам — поддержка автономии пользователя и действие в его интересах (Anthropic).
📊 Цифры по misalignment
По данным VentureBeat, оценка построена на ~2 600 симулированных investigation-сессий на модель (ниже = лучше).
Misalignment Score (ниже = лучше)
Уровень дезориентированного поведения (обман, кооперация со злоупотреблением) существенно ниже Opus 4.7 и близок к лучшей по выравниванию модели Anthropic — Mythos Preview.
Почему это важно для делегирования. Аналитик из Hebbia отмечает: главный дифференциатор — склонность Opus 4.8 проактивно подсвечивать проблемы во входных и выходных данных анализа, которые другие модели регулярно пропускали. Для агентных воркфлоу это разница между «надо проверять каждый шаг» и «можно отдать задачу и вернуться позже».
Бенчмарки — что реально выросло
Сводка по официальной таблице Anthropic и независимым разборам. Триангулировано по Anthropic, Vellum, llm-stats и digitalapplied.
| Бенчмарк | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro | Что измеряет |
|---|---|---|---|---|---|
| SWE-bench Pro | 69.2 | 64.3 | 58.6 | 54.2 | Реальные «грязные» GitHub-issue |
| SWE-bench Verified | 88.6 | 87.6 | — | 80.6 | Классический 500-задачный сет |
| SWE-bench Multilingual | 84.4 | 80.5 | — | — | Многоязычный кодинг |
| Terminal-Bench 2.1 | 74.6 | 66.1 | 78.2 | 70.3 | Терминальные агент-циклы |
| OSWorld-Verified | 83.4 | 82.8* | 78.7 | 76.2 | Реальные задачи на живой Ubuntu VM |
| HLE (без инструментов) | 49.8 | 46.9 | 41.4 | 44.4 | Humanity's Last Exam |
| HLE (с инструментами) | 57.9 | 54.7 | 52.2 | 51.4 | Мультидисциплинарное рассуждение |
| GPQA Diamond | 93.6 | 94.2 | — | 94.3 | Научное рассуждение (насыщено) |
| GDPval-AA (Elo) | 1890 | 1753 | 1769 | 1314 | Knowledge work, реальная эконом. ценность |
| Finance Agent v2 | 53.9 | 51.8 | 51.8 | 43.0 | Агентный финанализ |
| GraphWalks BFS 1M | 68.1 | 45.4* | 45.4 | — | Работа с длинным контекстом |
| USAMO 2026 | 96.7 | 69.3 | — | — | Олимпиадная математика |
* По Vellum, Opus 4.7 на OSWorld пересчитан до 82.8 после фикса бага в zoom-инструменте и поднятия max-tokens с 16K до 128K. Часть прироста — методология, а не чистая способность.
⚠️ Где Opus 4.8 проигрывает
Terminal-Bench 2.1. GPT-5.5 лидирует (78.2 против 74.6). Важная оговорка: бенчмарк чувствителен к harness. Anthropic репортит Opus 4.8 на публичном harness Terminus-2; «родной» score GPT-5.5 на Codex CLI — 83.4%. Если ваш стек живёт в терминале (тяжёлый CLI-скриптинг) — это реальный, а не округлённый дифференциатор.
GPQA Diamond. Все три фронтир-модели статистически связаны выше 93% — это выглядит как насыщение бенчмарка, а не отставание.
Как читать. Прыжок +4.9 на SWE-bench Pro важнее, чем +1.0 на Verified: Verified близок к насыщению, а Pro — более сложный, менее «загрязнённый» сет на реальных репозиториях. По Medium-разбору, net-результат: Opus 4.8 берёт 6 из 7 ключевых бенчмарков, GPT-5.5 — 1 из 7.
Новые продуктовые фичи
Рядом с селектором модели в claude.ai и Cowork появилась ручка сколько усилий тратить на ответ (Anthropic):
-
●
Opus 4.8 по умолчанию работает на «high» — Anthropic считает это лучшим балансом. На кодинге тратит примерно столько же токенов, что дефолт Opus 4.7, но с лучшим результатом.
-
●
Уровни:
extra(в Claude Code —xhigh) илиmax— больше токенов, лучше результат. -
●
Rate limits в Claude Code подняты, чтобы вместить более высокий расход токенов.
-
●
Доступно на всех тарифах.
Расхождение в источниках: по Gizmodo панель в claude.ai по умолчанию стоит на «Low» с уровнями Medium/High/Max + adaptive thinking. Это противоречит формулировке Anthropic о дефолте «high». Вероятно, разные дефолты для разных интерфейсов/контекстов — стоит проверить у себя в селекторе.
Самая мощная фича для агентной разработки. Первоисточники: Anthropic — Opus 4.8, Anthropic — Introducing dynamic workflows, TechCrunch.
Суть. Claude сам пишет оркестрационный скрипт под задачу, раскидывает работу по десяткам–сотням параллельных субагентов в одной сессии и проверяет результат до того, как он дойдёт до пользователя. Работа, которую обычно планируют кварталами, укладывается в дни.
⚙️ Как это работает по шагам
🏗️ Ключевые архитектурные свойства
-
◆
Координация вне разговора (outside the conversation). План не «съезжает», как бы ни росла задача — это снимает деградацию контекста на длинных прогонах (Anthropic).
-
◆
Durable execution. Прогон рассчитан на часы и дни; прогресс сохраняется по ходу, прерванный джоб продолжается с места остановки, а не стартует заново.
-
◆
Adversarial-режим для критичных задач — Claude делает независимые попытки решения, агенты-«ломатели» атакуют результат до того, как пользователь его увидит.
-
◆
С Opus 4.8 субагенты могут работать дольше.
🚀 Как запустить
Рекомендуется включить auto mode, далее два способа (Anthropic):
"Create a workflow"
ultracode (через effort-меню) — ставит уровень усилия на xhigh и позволяет Claude самому решать, когда применить воркфлоу.
При первом запуске Claude Code покажет план выполнения и попросит подтверждение.
📋 Доступность и дефолты
| План | Состояние по умолчанию |
|---|---|
| Max / Team | ✅ Включено |
| API (Bedrock, Vertex AI, Microsoft Foundry) | ✅ Включено |
| Enterprise | ⚙️ Выключено — включает админ в настройках Claude Code |
Среды: Claude Code CLI, Desktop, VS Code extension (research preview).
Расход токенов. Воркфлоу жрут существенно больше токенов, чем обычная сессия. Anthropic советует начинать с узкой scoped-задачи. Админы организации могут отключить фичу через managed settings.
🦀 Реальный кейс масштаба: переписывание Bun
Jarred Sumner портировал Bun с Zig на Rust через dynamic workflows (Anthropic):
.rs-файл как behavior-identical порт .zig-аналога — сотни агентов параллельно, по два ревьюера на файл.Заметка для гибридных сценариев. Паттерн «координация вне разговора» + checkpoint-восстановление — это фактически durable execution поверх агентов, концептуально близко к temporal-подобным оркестраторам, только план генерится динамически. Документация: code.claude.com/docs/en/workflows.
- ⚡Скорость 2,5× (Anthropic).
- 💰В 3 раза дешевле, чем fast mode у предыдущих моделей.
- 📊Цена fast mode: $10 / 1M input, $50 / 1M output.
Для разработчиков, строящих агентов — тихая, но важная фича (Anthropic):
-
●
Messages API теперь принимает system-записи внутри массива
messages. -
●
Можно обновлять инструкции Claude посреди задачи — не ломая prompt cache и не маршрутизируя обновление через user-ход.
-
●
Применение: на лету менять права/permissions, бюджеты токенов или контекст окружения по мере работы агента.
Цена и доступ
Из официального блога Anthropic:
| Параметр | Значение |
|---|---|
| API model ID | claude-opus-4-8 |
| Алиас | opus теперь маршрутизирует на 4.8 |
| Контекст | 1M токенов (Anthropic API, Bedrock, Vertex AI) |
| Доступность | ✅ Везде, на всех платных и бесплатных интерфейсах |
Контекст по рынку. DeepSeek V4-Pro остаётся радикально дешевле (≈12× по input, ≈29× по output), но проигрывает по способностям — codersera. Anthropic явно делает ставку на снижение совокупной стоимости через эффективность (меньше шагов на задачу, дешевле fast mode), а не через демпинг цены за токен.
Отзывы enterprise-партнёров
Из официального поста Anthropic и VentureBeat (верифицированные):
Michael Truell: на CursorBench Opus 4.8 превосходит прошлые Opus на всех уровнях усилия; tool-calling заметно эффективнее — меньше шагов на ту же интеллектуальность.
Scott Wu: релиз исправил проблемы с verbosity комментариев и tool-calling, которые были в Opus 4.7.
Step change в агентном рассуждении, плюс рассуждение прямо по PDF и диаграммам на 61% дешевле по токенам, чем Opus 4.7.
Лучшая точность цитирования и токен-эффективность на плотных финансовых документах. Главный дифференциатор — проактивное подсвечивание проблем во входных данных.
84% на Online-Mind2Web — заметный скачок над Opus 4.7 и GPT-5.5.
Первая модель, преодолевшая 10% на all-pass стандарте Legal Agent Benchmark.
Что дальше: Mythos-class
Anthropic анонсировала два направления (Anthropic, Help Net Security):
🔮 Roadmap Anthropic
Практические выводы
Применимо к работе с агентами на on-prem/cloud-границе и к продуктовым решениям:
✅ Что стало лучше
-
▲
Делегирование стало надёжнее. Рост честности + проактивный флаггинг проблем снижает потребность в babysitting агентов — критично для долгих автономных воркфлоу.
-
▲
Effort control = рычаг costs vs quality. Можно явно балансировать расход токенов под конкретный сценарий; для дорогих on-prem inference-бюджетов это прямой инструмент управления.
-
▲
Mid-task system messages открывают чистый паттерн смены permissions/бюджетов агента на лету — полезно для security-граничных сценариев (динамические права без рестарта сессии).
-
▲
Dynamic Workflows — если есть доступ Enterprise/Team/Max: миграции масштаба кодовой базы становятся реалистичной задачей под один проход.
⚠️ На что обратить внимание
-
▲
Терминал-тяжёлые стеки — учитывайте, что GPT-5.5 всё ещё впереди на Terminal-Bench; для чистого CLI-loop это аргумент для гибридной маршрутизации моделей.
-
▲
Скепсис paranoid-режима: часть прироста OSWorld — методологическая (новый harness, пересчёт 4.7). Реальные «чистые» приросты — SWE-bench Pro, HLE с инструментами, GDPval-AA, GraphWalks long-context.
Индекс источников
Первоисточники (Anthropic)
Вторичные источники (верификация цифр)
Подготовлено в paranoid-режиме: цифры триангулированы по ≥3 независимым источникам, методологические оговорки (harness Terminal-Bench, пересчёт OSWorld 4.7, расхождение по дефолту effort control) явно отмечены. Все ссылки — кликабельные инлайн.