Anthropic только что выпустила Claude Sonnet 5 — новейшую модель в линейке среднего уровня. Этот материал отвечает на один простой вопрос: остаться ли на модели, которой вы пользуетесь сегодня, или перейти на новую?
Sonnet 5 не появился из ниоткуда. За последний месяц в блоге CodeRabbit уже разобрали целую серию новых моделей:
- Opus 4.8 — лучшая модель, протестированная для длинных, многошаговых задач по написанию кода: достаточно аккуратна, чтобы буквально следовать инструкциям по ревью, хотя стоит дороже и окупается в основном на крупных задачах.
- Fable 5 ещё сильнее сделал ставку на самостоятельное написание кода и с удовольствием планирует и собирает решения сразу в нескольких файлах. Однако его цена и ограниченный доступ не позволили включить его в стандартный процесс ревью.
- NVIDIA Nemotron 3 Ultra пошёл другим путём: быстрая и по делу открытая модель, созданная для множества быстрых «попыток» внутри агентных сценариев.
Sonnet 5 ощущается как часть семьи моделей Anthropic. Он терпеливый и дотошный и предпочитает продумать задачу до конца, прежде чем действовать.
Для написания и сборки кода Sonnet 5 — самая способная модель этого уровня, с которой приходилось работать, и переход на неё — лёгкое и приятное решение. Для ревью всё не так однозначно — это скорее компромисс. Хотя модель генерирует более чистые и точные комментарии, она находит меньше багов, чем модели, используемые сейчас в продакшене, и стоит немного дороже за одно ревью.
Хорошая новость в том, что почти всё это можно настроить, и для многих команд переход всё равно оправдан. Разберём, что нового в Sonnet 5, как он показывает себя при написании и ревью кода, и стоит ли переходить.
Видео-версия обзора от команды CodeRabbit (на английском языке).
Что нового в Claude Sonnet 5#
Sonnet 5 думает глубже, чем предыдущая версия. Для вас это означает, что модель справляется с более сложными задачами, на которых старая версия могла бы «сдаться».
Регулятор «усилия мышления» (thinking effort) в Sonnet 5 позволяет постепенно уменьшать глубину раздумий вплоть до полного отключения. Именно эта функция защищает бюджет. Увеличивайте «усилие» для сложного ревью, где пропущенный баг обходится дорого, и уменьшайте его (или отключайте) для рутинных задач, где платить за глубокие раздумья не хочется.
Модель также способна на ходу переписывать собственные инструкции. В длинных агентных задачах цель по мере работы модели часто смещается, и модель, застрявшая на первоначальном плане, продолжает следовать инструкциям, которые уже не соответствуют ситуации. Sonnet 5 сама обновляет свой план, поэтому таких «блужданий», сжирающих время и токены, становится меньше.
Модель также получила новые защитные механизмы (guardrails) в области безопасности и киберугроз. Плюс — меньше рискованных ответов. Минус — реальная работа по безопасности иногда может «зацепить» эти фильтры, так что если это ваша область — ждите периодических отказов.
Проще всего представить Sonnet 5 как инженера среднего уровня, которому важно — возможно, даже чересчур важно — выпускать код, который по-настоящему работает и соответствует заявленному уровню. Именно эта черта определяет большую часть его поведения, и она проявлялась в четырёх привычках, которые наблюдались снова и снова:
- Он склонен писать тесты раньше самой фичи.
- Он продолжает «полировать» решение долго после того, как оно уже заработало.
- Он переосмысливает собственный план, иногда чаще, чем нужно.
- Он отвечает на маленькую задачу маленьким «проектом».
Как Claude Sonnet 5 пишет код#
То, как Sonnet 5 пишет код, — главная причина, по которой большинству команд стоит перейти на него. Перед тем как перейти к цифрам по ревью, полезно посмотреть, как модель ведёт себя, когда строит что-то с нуля. Ей поручили повседневную работу — от быстрых фич до сложных задач без очевидного решения.
Один раз вечером модели дали сложную задачу и ушли на обед. Задача требовала написать код, прогнать на нём симуляции и продолжать настройку результата, пока он не станет как можно лучше. Вернувшись, ожидали увидеть либо готовый результат, либо «застрявшую» модель. Ни то, ни другое не подтвердилось. Модель всё ещё работала, самостоятельно продвигаясь по задаче, без каких-либо подсказок.
Она полностью самостоятельно собрала целое приложение. Причина, по которой это заняло так много времени, простая: модель раз за разом «причёсывала» собственное решение, потому что искала лучший ответ, а не первый подходящий.
Раньше такое поведение было доступно только у более дорогой модели, и видеть, как это делает модель среднего уровня, — по-настоящему показательный момент.
Именно эта дотошность и объясняет, почему Sonnet 5 хорошо справляется с длинными открытыми задачами. Медлительность, которая раздражает при однострочном изменении, превращается в преимущество, когда у задачи нет фиксированного числа шагов. Это отлично подходит для агентных циклов, где модели дают простую цель и позволяют ей за несколько раундов пробовать подходы, тестировать их и улучшать результат самостоятельно, прежде чем отчитаться.
Собственное руководство Anthropic по созданию эффективных агентов называет это evaluator loop — циклом, в котором модель выдаёт результат, а затем критикует и улучшает его. Стоит почитать, если вы строите подобный workflow. У Sonnet 5 этот цикл буквально «вшит» в способ мышления, и если вы откладывали агентное программирование из-за того, что более ранние модели «уплывали» в сторону или сдавались, — этот релиз всё меняет.
Тестирование как привычка#
Большинство моделей относятся к тестам как к «делу на потом» — Sonnet 4.6 не исключение. Sonnet 5 склонен сначала писать тесты, затем строить фичу на их основе, а затем прогонять всё вместе, когда считает работу завершённой. Самопроверка, которую можно наблюдать, — прямое следствие такого порядка. Невозможно заметить рассогласование между тестами и кодом, если модель никогда не запускает тесты, а Sonnet 5 запускает их всегда. Если вы хоть раз отправляли в прод код, который выглядел нормально, а через неделю ломался, — вы быстро почувствуете разницу.
Дополнительная аккуратность Sonnet 5 отражается на количестве файлов и расходе токенов. Попросите что-то небольшое — и получите многое в ответ. Вы увидите лишние хелперы и тестовый файл длиннее самой фичи. На крупной фиче это выглядит как хорошая инженерная работа. На однострочном изменении это выглядит как модель, которая просто не может остановиться.
Sonnet 5 оказался медленнее Sonnet 4.6, что, вероятно, связано с дополнительными раздумьями модели. Вы обмениваете минуты на тщательность, и это окупается на долгих задачах, которые оставляют работать в фоне. Но это ощутимо раздражает, когда вы ждёте небольшое изменение. Там, где 4.6 быстро выдаёт ответ, 5 продолжает работать над лучшим вариантом, и это особенно заметно на мелких задачах. Два момента поменьше: модель расходует больше токенов, чем 4.6, при этом остаётся понятной, просто более «многословной». Она также хорошо пишет планы, но чаще, чем хотелось бы, переписывает их посреди задачи. Ничего из этого не является критичным для написания кода, но об этом стоит знать, прежде чем поручать модели кучу мелких правок.
Как Claude Sonnet 5 проверяет код#
Это часть, которая интересует авторов больше всего, поскольку масштабное ревью кода — это то, чем занимается команда CodeRabbit. Сегодня AI пишет значительную долю кода, который многие команды отправляют в прод, и этот код требует внимательного второго взгляда. Исследование 470 open-source pull request'ов показало, что PR, написанные в соавторстве с AI, содержат примерно в 1,7 раза больше проблем, чем PR только от людей, а исследование 2025 года показало, что время ревью выросло на 91% в командах, активно опирающихся на AI. Модель, выполняющая ревью, теперь во многом определяет скорость доставки кода командами.
Sonnet 5 добавили в харнесс для тестирования и прогнали по стандартному бенчмарку — фиксированному набору pull request'ов с известными багами — и замерили, сколько багов она находит и насколько чистыми получаются комментарии. Подробнее о том, как строятся такие ревью, можно прочитать в материале о контекстной инженерии для AI-ревью кода.
Комментарии Sonnet 5 чище, а находки чаще оказывались реальными багами, а не шумом. На бенчмарке точность (precision) выросла с примерно 29% у Sonnet 4.6 до порядка 38–40%. Sonnet 4.6 действует ровно наоборот: комментирует почти всё, оставляя пользователю выбирать нужное из общего потока. Если вы хоть раз отключали ревьюера за то, что он помечал абсолютно всё, — вы понимаете, насколько важно выделять именно то, на что стоит обратить внимание.
Честная оговорка о поиске багов#
В харнессе для тестирования Sonnet 5 находит меньше багов, чем текущая продакшен-настройка. По строгой метрике «нашла ли модель баг» базовый вариант находит около 57%, а Sonnet 5 — около 50–51%. Удивило то, что Sonnet 4.6 находил больше багов, чем оба варианта, около 63%, хотя и является более «шумным» ревьюером. То есть модель, засыпающая пользователя комментариями, оказалась также моделью, которая пропускала меньше всего багов. Увеличение «усилия» у Sonnet 5 практически не повлияло на результат, но примерно вдвое увеличило стоимость. По более «мягкой» метрике, учитывающей больше типов и вариаций комментариев, высокий уровень усилия подтянул результаты модели почти до уровня базового варианта, но явно опередить его не удалось.
В комментариях также скрывается некоторый шум. Sonnet 5 выдаёт в три-четыре раза больше «nitpick»-комментариев (мелких замечаний), чем базовый вариант, и почти на 80% больше, чем Sonnet 4.6 в режиме высокого усилия. Его лучшие комментарии читаются чище, но приходится «пробираться» через больше мелочей, чтобы найти их. Модель также тестировали с отключённым «мышлением». На части задач она сравнялась с базовым вариантом, на других — немного сдала позиции. Так что существует класс более лёгких задач ревью, которые можно прогонять дешевле с отключённым мышлением, теряя при этом совсем немного — если речь не о самом важном коде. Вывод не в том, что Sonnet 5 — слабый ревьюер. Это скорее более тихий и аккуратный ревьюер, и для команд, утопающих в шуме от ревью, это часто более выгодный компромисс.
Claude Sonnet 5 против модели, которой вы пользуетесь сегодня#
Обращайтесь к Sonnet 4.6, когда важнее «сырое» покрытие багов и есть ресурсы разбираться в потоке его комментариев. Обращайтесь к Sonnet 5, когда предпочтительнее меньше, но точнее сформулированных комментариев и куда более сильный партнёр для непосредственного написания кода. Sonnet 4.6 находит немного больше багов, а Sonnet 5 куда меньше «тратит» ваше внимание.
Sonnet 5 против флагманской модели#
По сравнению с флагманскими моделями — например, семейством Opus, которое команды держат для самых сложных задач, — Sonnet 5 показывает почти такое же качество ревью за значительно меньшие деньги. Если сегодня вы платите по флагманским тарифам только потому, что ничего дешевле не было достаточно хорошим, Sonnet 5 стоит присмотреться. Следите за расходом токенов во время тестирования, потому что модель, которая думает так много, может «съедать» собственную экономию. Максимальное усиление «усилия» оказалось наименее выгодным вариантом из всех: стоимость выросла почти вдвое без значимого увеличения числа найденных багов, так что не стоит по умолчанию тянуться к топовому уровню. Такая же картина наблюдалась при разборе того, что значит Claude Opus 4.7 для AI-ревью кода.
Claude Sonnet 4.6 или Claude Sonnet 5: быстрый вердикт#
Для большинства команд ответ — да
Sonnet 5 — самая впечатляющая модель для написания кода в своём классе. Она действует как внимательный коллега, который скорее потратит несколько лишних минут, чем отдаст что-то, что сломается позже, и именно этот инстинкт делает её очевидным шагом вперёд по сравнению с 4.6 для всех, кто занимается реальной разработкой.
Проще говоря: переходите прямо сейчас, если вы пишете или поставляете реальный софт и хотите модель, которая тестирует собственную работу и доводит сложную задачу до конца. Запускайте её на среднем уровне «усилия» — и вы получите большую часть преимуществ без топовой цены. А если вы платите по флагманским тарифам исключительно за качество — сравните Sonnet 5 с текущей моделью до следующего продления подписки: возможно, она даёт тот же результат за долю стоимости.
Кому стоит подождать
Высоконагруженным командам с жёсткими требованиями к latency и множеством крошечных диффов. Именно в этом сценарии более медленный, более аккуратный стиль Sonnet 5 пока не оправдывает себя.
Модель не идеальна, и её слабые стороны в ревью честно разобраны выше. Но сильные стороны в написании и проверке кода легко перевешивают этот недостаток. Если вы ждали повод для перехода — вот он.
Хотите увидеть полную картину качества AI-генерируемого кода?
- 📊 Прочитайте отчёт State of AI vs Human Code Generation
- 👥 Посмотрите, как команды реально используют AI dev tools
- 🚀 Попробуйте CodeRabbit бесплатно в своей IDE