Модель, которая не пропускает то, что должна была заметить
Claude Opus 4.8 — флагман Anthropic для ревью кода, аудита и сложных агентных задач. По данным разработчика, она примерно в 4 раза реже пропускает дефекты кода незамеченными, чем предшественница, и чаще прямо признаёт неуверенность вместо правдоподобной выдумки.
promo окажется None — упадёт с исключением. Проверка на существование кода не найдена выше по функции.
rate подтверждён проверкой выше по стеку вызовов — подставлять без опаски можно.
Шесть изменений, которые заметны в работе
Не косметика, а поведение: как модель распределяет усилия, как признаёт ошибки и как берётся за задачи, которые раньше приходилось дробить вручную.
Dynamic Workflows
Инструмент в режиме предпросмотра: модель разворачивает сотни параллельных саб-агентов на одну большую задачу и сводит результат воедино.
Контроль усилия
Три уровня — normal, extra, max. Простую задачу можно решить быстрее, сложное ревью — прогнать с максимальной тщательностью.
System entries
В Messages API инструкции теперь можно обновлять частями, не сбрасывая кэш целиком, — быстрее и дешевле для агентных пайплайнов.
Честность как приоритет
По тестам Anthropic модель реже делает недоказанные утверждения и чаще прямо говорит «не знаю», вместо того чтобы правдоподобно выдумывать.
Реже нарушает инструкции
В тестировании Anthropic снижена доля случаев обхода ограничений и несоблюдения инструкций по сравнению с предыдущей моделью.
Legal Agent Benchmark
Первая модель, преодолевшая порог 10% на этом бенчмарке юридических агентных задач — раньше все результаты были ниже.
Бенчмарки — включая те, где Opus проигрывает
Публичные результаты по независимым и внутренним тестам Anthropic. Два бенчмарка ниже показывают проигрыш GPT-5.5 — мы не стали их убирать.
Отдельно стоит Super-Agent: по данным обзора vc.ru, Opus 4.8 — единственная из протестированных моделей, завершившая каждый кейс от начала до конца. Профильные разборы (vc.ru) называют апдейт «скромным, но ощутимым улучшением» — не поколенческим скачком, а заметным ростом надёжности на прежней базе.
Почему «реже пропускает» — не маркетинговая фраза
Четыре конкретных поведенческих изменения, зафиксированных Anthropic и партнёрами в тестировании — из них и собран герой этой страницы.
Флагует, а не молчит
Примерно в 4 раза реже, чем Opus 4.7, модель пропускает дефекты кода незамеченными — по внутренним тестам Anthropic на задачах ревью.
Говорит «я не знаю»
В тестировании модель чаще прямо признаёт неуверенность в своей работе и реже делает недоказанные утверждения, чем предшествующие версии.
Реже нарушает инструкции
Зафиксировано снижение доли случаев обманчивого поведения и несоблюдения инструкций по сравнению с Opus 4.7 в тестах безопасности Anthropic.
Замечено партнёрами
Bridgewater Associates, тестировавшая модель, отметила её склонность проактивно сообщать о проблемах во входных и выходных данных — а не проходить мимо них.
Dynamic Workflows: сотни саб-агентов на одну задачу
Каждый квадрат ниже — условный саб-агент, которому Opus 4.8 может делегировать часть крупной задачи и свести результат обратно.
Три сценария, где Opus 4.8 на своём месте
Ревью и миграции
Код-ревью перед мержем, крупные миграции через Dynamic Workflows, CI-гейты, где важно не пропустить дефект, а не ответить на долю секунды быстрее.
Аудит и документы
Первая модель, преодолевшая порог 10% на Legal Agent Benchmark. Разбор договоров, финансовые агентные задачи, где нужна честная оценка рисков.
Точка эскалации
Opus 4.8 хорошо встаёт рядом: как модель для точечного глубокого ревью там, где Sonnet 5 работает на потоке. Кстати, именно на неё переводится часть чувствительных запросов Fable 5 — по кибербезопасности и биологии.
Сравнение трёх моделей ↓Claude Opus 4.8 можно попробовать совершенно бесплатно
Не нужно сразу оформлять подписку, чтобы понять, подходит ли модель под вашу задачу — проверьте её на своём коде или документе прямо после регистрации.
Что учесть перед тем, как переходить на неё
Пять вещей, о которых лучше знать заранее, чем выяснить на второй неделе использования.
Контекстное окно осталось на уровне предшественницы — 1 млн токенов. Если для вашей задачи важен именно рост контекста, в этом поколении его не случилось.
На Terminal-Bench 2.1 модель уступает GPT-5.5: 74,6% против 83,4%. На Humanity's Last Exam разрыв ещё заметнее — 49,8% против примерно 58%. Мы не стали прятать эти цифры в разделе бенчмарков.
Профильные обзоры (в частности vc.ru) описывают Opus 4.8 как ощутимый, но не поколенческий шаг вперёд по сравнению с Opus 4.7 — это заметная прибавка в надёжности, а не смена архитектуры.
Модель, склонная помечать неопределённость и переспрашивать, на очень простых задачах иногда выдаёт больше оговорок, чем нужно, — это обратная сторона повышенной честности.
Инструмент параллельных саб-агентов пока в статусе research preview у Anthropic: поведение и доступность могут измениться в следующих обновлениях.
Промпты, с которых удобно начать
Проверь этот код так, будто от твоей проверки зависит прод. Отдельно перечисли места, где ты не уверен, что понял логику правильно, — не пропускай их молчанием, а явно пометь как требующие взгляда человека.
Цель: перевести проект на новую версию библиотеки. Прочитай кодовую базу целиком, составь план по этапам с оценкой риска и держи существующий набор тестов зелёным на каждом шаге. В конце — отчёт и список мест для ревью человеком.
Прикладываю договор. Проверь внутреннюю непротиворечивость условий, отметь формулировки, которые можно трактовать двояко, и честно укажи, где тебе не хватает контекста для однозначного вывода.
Реши задачу, а затем перечитай собственный ответ так, будто ты — придирчивый ревьюер чужой работы. Отдельным списком выпиши всё, в чём ты не до конца уверен, и почему.
Характеристики
Данные на 15 сентября 2026 года.
- Идентификатор в API
- claude-opus-4-8
- Разработчик
- Anthropic
- Дата выхода
- 28 мая 2026
- Контекстное окно
- 1 000 000 токенов
- Максимальный ответ
- 128 000 токенов
- Знания до
- январь 2026
- Контроль усилия
- normal / extra / max
- Fast Mode
- до 2,5× быстрее на части задач
- Dynamic Workflows
- предпросмотр, параллельные саб-агенты
- System entries
- обновление инструкций без сброса кэша
- Инструменты
- исполнение кода, программные вызовы инструментов
- Доступ из России
- напрямую через Strelka AI, без VPN
Opus 4.8, Sonnet 5 или Fable 5
Три модели Claude на Strelka AI решают разные задачи — вот короткая карта различий.
Claude Opus 4.8
- Ревью кода, аудит, агентные задачи
- ×4 реже пропускает дефекты незамеченными
- Dynamic Workflows — сотни саб-агентов
- Контроль усилия: normal / extra / max
Claude Sonnet 5
- Тысячи однотипных запросов в день
- Быстрый отклик, повседневный код
- Чат-боты, поддержка, модерация
- Агенты на минуты, а не на сутки
Claude Fable 5
- Класс Mythos, задачи на часы и дни
- Крупные миграции и глубокая аналитика
- Часть чувствительных сессий уходит на Opus 4.8
- Лучшее зрение в линейке Claude
Соседние страницы
Вопросы про Claude Opus 4.8
01Что такое Claude Opus 4.8
02Когда вышла Claude Opus 4.8
03Чем Opus 4.8 отличается от Opus 4.7
04Что такое Dynamic Workflows
05Правда ли что модель реже ошибается в коде
06Какой контекст у Claude Opus 4.8
07Чем Opus 4.8 отличается от Claude Sonnet 5 и Fable 5
08Есть ли у модели слабые места
09Можно ли попробовать Claude Opus 4.8 бесплатно
10Нужен ли VPN для доступа к Claude Opus 4.8
11Что такое effort control (контроль усилия)
12Как получить доступ к Claude Opus 4.8 прямо сейчас
Попробуйте модель, которая помечает, а не молчит
Claude Opus 4.8 и ещё 50+ нейросетей — в одной подписке Strelka AI. Пробный доступ бесплатно, без VPN и зарубежной карты.
Источники
Официальный анонс и факты о Dynamic Workflows, effort control и честности модели — по материалам Anthropic. Бенчмарки и сравнение с GPT-5.5 — по разбору vc.ru. Дополнительный контекст о выходе модели — по материалам TechCrunch и Help Net Security. Практические сценарии использования — по обзору Habr.