• Виктор
  • Блог
  • 1 мин. чтения

Что изменилось в новой флагманской модели Anthropic Claude Opus 4.8


В мае 2026 года компания Anthropic обновила флагманскую модель Opus до версии 4.8. И на первый взгляд, этот апдейт не несет в себе особых новшеств. Та же цена, чуть лучше цифры в бенчмарках. Однако за формулировкой «улучшения по всем показателям» прячется история о том, как компания пыталась сделать модель более здравомыслящей и честной, не растеряв ее деловую хватку. Без потерь, впрочем, не обошлось.

Что нового предложили разработчики

Модель доступна через API под именем claude-opus-4-8, цена осталась прежней (5 долларов за миллион входящих токенов, 25 – за выходные; при этом быстрый режим стал более дешевым). В Claude.ai и Cowork появился ползунок «усилий». Чем выше его значение, тем дольше и глубже думает модель. Однако при этом лимит, конечно, расходуется в данном случае быстрее.

Обновленная модель Claude Code умеет сама планировать работу, запускать сотни параллельных субагентов. Нейросеть проверяет результат перед тем, как отчитаться. В таком режиме нейросеть способна самостоятельно провести миграцию кодовой базы на сотни тысяч строк, от старта до готового результата.

Честность против деловой хватки

Первые впечатления пользователей были смешанными. В первый день многие жаловались на многословность и академическую сухость, будто модель нарочно спорила с любым утверждением, лишь бы не показаться подхалимом. Через день-два ощущение сгладилось.

Один пользователь заметил: со старыми моделями работал пошаговый разбор по пунктам, а с 4.8 такой подход буксует. Модель переусердствует и жжет токены там, где хватило бы обозначить цель и отпустить ее работать самостоятельно. Особенно это заметно при написании скилов для самой Claude – формулировать задачу для скила модель умеет лучше автора. Цифры подтверждают: Opus 4.8 – первая модель линейки, ни разу не выдавшая ложные числа в тесте на некритичную отчетность о результатах, а в задаче на поиск ошибки по нескольким файлам отработала без единой промашки. Что касается прежней версии, то она ошибалась в четверти случаев. Также модель примерно вчетверо реже пропускает недочеты в собственном коде, не комментируя их.

Обратная сторона осторожности

У этой честности есть цена, и Anthropic ее не скрывает. Claude стала более склонна к избыточно развернутым отказам; тут-то и проявилась оборотная сторона добросовестности. Устойчивость к промпт-инъекциям без дополнительной защиты тоже слегка просела: доля успешных атак на профильном бенчмарке выросла с 6 до 9,5 %, хотя штатные защитные механизмы возвращают показатель на прежний уровень. Для тех, кто строит агентов через API, есть нюанс: на тесте использования браузера атаки пробивали голую модель почти в трети случаев, а с защитой Anthropic – лишь в долях процента. Безопасность оказывается не свойством самой модели, а результатом работы обвязки вокруг нее.

Нагляднее всего компромисс виден в симуляции под названием «Vending-Bench 2» от Andon Labs: модели выдают 500 стартовых долларов и год на управление вендинговым бизнесом. На максимальном режиме Opus 4.8 закончил год с 2992 долларами против почти 11 тыс. у предшественника – около четверти прежнего результата. Причина прозаична: у прежней версии было отдельное обучение деловым навыкам и противостоянию манипуляциям других агентов, но именно оно подталкивало модель к нечестности, и в 4.8 его убрали. Модель стала честнее, но заодно легче обманываемой и слабее в переговорах.

Где Anthropic видит следующий шаг

При этом сама компания описывает 4.8 довольно сдержанно. В Anthropic называют обновление «скромным, но ощутимым» улучшением по сравнению с предыдущей версией и отдельно признают, что работа над снижением стоимости таких возможностей еще продолжается. То есть ставка сделана не только на дальнейшее наращивание интеллекта: следующая проблема – сделать сопоставимые с Opus возможности доступными дешевле.

Одновременно компания готовит следующий, уже более высокий класс моделей. В рамках проекта «Project Glasswing» отдельные организации тестируют Claude Mythos Preview для задач кибербезопасности. Но Anthropic пока не собирается выпускать такие системы массово: модели этого уровня, по оценке самой компании, требуют более сильных защитных механизмов. Таким образом, развитие линейки упирается уже не просто в вопрос «насколько умнее сделать модель», а в то, насколько безопасно дать ей возможность действовать самостоятельно в чувствительных областях.

Заключение

Как подчеркивают эксперты Креатор Проджект, Claude Opus 4.8 интересен именно тем, что его нельзя однозначно назвать улучшением по принципу «новая версия просто лучше старой». Когда от модели требуется проверить собственную работу или не выдавать неподтвержденный результат за факт, прогресс выглядит убедительно. Но в автономной работе, особенно там, где нужны переговоры, сопротивление манипуляциям и самостоятельное принятие коммерческих решений, улучшение оказалось неоднозначным.

Поэтому главное изменение в Opus 4.8 – скорее смена приоритетов, чем очередной рывок в бенчмарках. Anthropic сознательно поставила надежность и честность выше части прежней деловой хватки, а затем начала строить вокруг модели инструменты, позволяющие управлять глубиной рассуждений и безопасностью. В результате 4.8 лучше показывает себя там, где модель должна быть аккуратным исполнителем, но пока требует большей осторожности там, где ей предлагают полностью заменить человека. И, судя по планам Anthropic, следующий этап гонки будет проходить уже не только за интеллект, но и за способ его безопасного применения.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Yandex AI Studio позволит создавать ИИ-агентов на базе DeepSeek-V3.2

Yandex B2B Tech представила обновление Yandex AI Studio — платформы для разработки ИИ-приложений. Главное изменение: бизнес получил возможность...

Google выпустила Nano Banana 2 Lite и Gemini Omni Flash

30 июня Google открыла доступ к двум новым моделям генеративной графики и видео - Nano Banana 2 Lite...

Gemini взломала три компании на испытаниях и остановилась сама

Gemini во время майских кибериспытаний вошла в системы трёх реальных компаний. В одном случае модель подобрала пароль, в...

Вышел Kling O1 — рассуждающая нейросеть для генерации и редактирования видео

Kling AI выпустила новую ИИ-модель Kling O1 (Omni One). Это рассуждающая нейросеть, которая генерирует видео по тексту и...

Google показала проекты на Gemini 3.8 Flash

Google показала четыре проекта, собранных разработчиками на Gemini 3.8 Flash. Модель вышла в начале сентября и, по заявлению...

OpenAI уберёт GPT-5.5 из ChatGPT и Codex 14 октября

OpenAI предупредила о завершении поддержки GPT-5.5 в ChatGPT, ChatGPT Work и Codex. Модель уберут из этих продуктов 14...

Pika превратила генератор видео в платформу с набором приложений и мультимодельным стеком

Компания Pika запустила обновленную креативную платформу на pika.art. Сервис перестроили вокруг специализированных мини-приложений для видеомонтажа, ретуши и работы...

Midjourney запустила V8 Alpha с ускоренной генерацией и улучшенным пониманием запросов

Midjourney открыла доступ к альфа-версии V8 - новой модели генерации изображений, которая работает в несколько раз быстрее и...

Alibaba представила Qwen 3.8‑Max на 2,4 трлн параметров — открытые веса выйдут на следующей неделе

Alibaba представила Qwen3.8‑Max — новую флагманскую ИИ-модель с 2,4 трлн параметров. Сейчас она доступна в Qwen Studio и...

OpenAI выпустила GPT Image 2 и ChatGPT Images 2.0

OpenAI представила GPT Image 2 для API и одновременно обновила генерацию изображений в ChatGPT до версии Images 2.0....

20 промтов для осенней ИИ-фотосессии в нейросетях

Осенняя фотосессия не обязательно требует поездки в парк, холодной погоды и пары часов на съёмку. Если у вас...

Как повторить тренд из «Форсажа» с помощью ИИ — гайд

В соцсетях завирусился ИИ-тренд по мотивам «Форсажа»: пользователи пересобирают культовые сцены из Tokyo Drift, подставляя в кадр собственные...

Anthropic выпустила Claude Opus 5.5 – уровень Fable за меньшие деньги

Anthropic выпустила Claude Opus 5.5, первую модель нового поколения Claude 5.5. По заявлению компании, на большинстве задач она...

Гайд по размерам для YouTube: шапка канала, обложка видео, Shorts, аватар, лого

Если вы загружаете ролики на YouTube и оформляете канал, размеры лучше определить заранее. Иначе шапка обрежется на смартфоне,...

DeepSeek представила DeepSeek-OCR — новую модель для сжатия визуального контекста в LLM

Компания DeepSeek показала DeepSeek-OCR — OCR-модель, созданную специально для больших языковых моделей. Вместо обычного распознавания текста она сжимает...

Нейросеть Veo 3.1: как пользоваться и создавать видео бесплатно

Google обновила свою модель для генерации видео — Veo 3.1, и теперь создание роликов со звуком и озвучкой...

Midjourney V8.1 ускорилась и вернула стиль

Midjourney выпустила альфа-версию V8.1, в которой разработчики сделали ставку на баланс: вернули фирменный визуальный стиль, ускорили генерацию и...

Новое поколение DLSS 5 от NVIDIA: революционный ИИ-рендеринг выйдет 3 сентября

Компания NVIDIA официально анонсировала технологию DLSS 5, запуск которой запланирован на 3 сентября 2026 года. Первой игрой с...

ImagineArt показала модель 2.0

ImagineArt представила модель ImagineArt 2.0 и делает ставку на то, что в генерации изображений пользователям важен уже не...

Alibaba выложила Qwen-Image-2.1 – картинки с прозрачным фоном из коробки

Команда Qwen выложила в открытый доступ Qwen-Image-2.1 - модель, которая рисует изображения сразу с прозрачным фоном и правит...