• Виктор
  • Блог
  • 1 мин. чтения

Что изменилось в новой флагманской модели Anthropic Claude Opus 4.8


В мае 2026 года компания Anthropic обновила флагманскую модель Opus до версии 4.8. И на первый взгляд, этот апдейт не несет в себе особых новшеств. Та же цена, чуть лучше цифры в бенчмарках. Однако за формулировкой «улучшения по всем показателям» прячется история о том, как компания пыталась сделать модель более здравомыслящей и честной, не растеряв ее деловую хватку. Без потерь, впрочем, не обошлось.

Что нового предложили разработчики

Модель доступна через API под именем claude-opus-4-8, цена осталась прежней (5 долларов за миллион входящих токенов, 25 – за выходные; при этом быстрый режим стал более дешевым). В Claude.ai и Cowork появился ползунок «усилий». Чем выше его значение, тем дольше и глубже думает модель. Однако при этом лимит, конечно, расходуется в данном случае быстрее.

Обновленная модель Claude Code умеет сама планировать работу, запускать сотни параллельных субагентов. Нейросеть проверяет результат перед тем, как отчитаться. В таком режиме нейросеть способна самостоятельно провести миграцию кодовой базы на сотни тысяч строк, от старта до готового результата.

Честность против деловой хватки

Первые впечатления пользователей были смешанными. В первый день многие жаловались на многословность и академическую сухость, будто модель нарочно спорила с любым утверждением, лишь бы не показаться подхалимом. Через день-два ощущение сгладилось.

Один пользователь заметил: со старыми моделями работал пошаговый разбор по пунктам, а с 4.8 такой подход буксует. Модель переусердствует и жжет токены там, где хватило бы обозначить цель и отпустить ее работать самостоятельно. Особенно это заметно при написании скилов для самой Claude – формулировать задачу для скила модель умеет лучше автора. Цифры подтверждают: Opus 4.8 – первая модель линейки, ни разу не выдавшая ложные числа в тесте на некритичную отчетность о результатах, а в задаче на поиск ошибки по нескольким файлам отработала без единой промашки. Что касается прежней версии, то она ошибалась в четверти случаев. Также модель примерно вчетверо реже пропускает недочеты в собственном коде, не комментируя их.

Обратная сторона осторожности

У этой честности есть цена, и Anthropic ее не скрывает. Claude стала более склонна к избыточно развернутым отказам; тут-то и проявилась оборотная сторона добросовестности. Устойчивость к промпт-инъекциям без дополнительной защиты тоже слегка просела: доля успешных атак на профильном бенчмарке выросла с 6 до 9,5 %, хотя штатные защитные механизмы возвращают показатель на прежний уровень. Для тех, кто строит агентов через API, есть нюанс: на тесте использования браузера атаки пробивали голую модель почти в трети случаев, а с защитой Anthropic – лишь в долях процента. Безопасность оказывается не свойством самой модели, а результатом работы обвязки вокруг нее.

Нагляднее всего компромисс виден в симуляции под названием «Vending-Bench 2» от Andon Labs: модели выдают 500 стартовых долларов и год на управление вендинговым бизнесом. На максимальном режиме Opus 4.8 закончил год с 2992 долларами против почти 11 тыс. у предшественника – около четверти прежнего результата. Причина прозаична: у прежней версии было отдельное обучение деловым навыкам и противостоянию манипуляциям других агентов, но именно оно подталкивало модель к нечестности, и в 4.8 его убрали. Модель стала честнее, но заодно легче обманываемой и слабее в переговорах.

Где Anthropic видит следующий шаг

При этом сама компания описывает 4.8 довольно сдержанно. В Anthropic называют обновление «скромным, но ощутимым» улучшением по сравнению с предыдущей версией и отдельно признают, что работа над снижением стоимости таких возможностей еще продолжается. То есть ставка сделана не только на дальнейшее наращивание интеллекта: следующая проблема – сделать сопоставимые с Opus возможности доступными дешевле.

Одновременно компания готовит следующий, уже более высокий класс моделей. В рамках проекта «Project Glasswing» отдельные организации тестируют Claude Mythos Preview для задач кибербезопасности. Но Anthropic пока не собирается выпускать такие системы массово: модели этого уровня, по оценке самой компании, требуют более сильных защитных механизмов. Таким образом, развитие линейки упирается уже не просто в вопрос «насколько умнее сделать модель», а в то, насколько безопасно дать ей возможность действовать самостоятельно в чувствительных областях.

Заключение

Как подчеркивают эксперты Креатор Проджект, Claude Opus 4.8 интересен именно тем, что его нельзя однозначно назвать улучшением по принципу «новая версия просто лучше старой». Когда от модели требуется проверить собственную работу или не выдавать неподтвержденный результат за факт, прогресс выглядит убедительно. Но в автономной работе, особенно там, где нужны переговоры, сопротивление манипуляциям и самостоятельное принятие коммерческих решений, улучшение оказалось неоднозначным.

Поэтому главное изменение в Opus 4.8 – скорее смена приоритетов, чем очередной рывок в бенчмарках. Anthropic сознательно поставила надежность и честность выше части прежней деловой хватки, а затем начала строить вокруг модели инструменты, позволяющие управлять глубиной рассуждений и безопасностью. В результате 4.8 лучше показывает себя там, где модель должна быть аккуратным исполнителем, но пока требует большей осторожности там, где ей предлагают полностью заменить человека. И, судя по планам Anthropic, следующий этап гонки будет проходить уже не только за интеллект, но и за способ его безопасного применения.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Google запустила Pics — ИИ-редактор изображений на базе Nano Banana

Google начала постепенно открывать доступ к Google Pics — новому ИИ-редактору изображений для Google Workspace на базе модели...

Нейросеть Sora 2: как пользоваться, где взять инвайт, возможности, как скачать

OpenAI представила Sora 2 — новую версию своей видеомодели, которая автоматически генерирует короткие ролики со звуком и синхронной...

MiniMax Hub добавил аудиомодели и готовые процессы для производства видео

MiniMax обновила творческую платформу MiniMax Hub. В ней появились аудиомодели ElevenLabs Music v2 и Seed Audio 1.0, готовые...

Alibaba открыла QwenWork по всему миру — ИИ-агент работает в браузере и на компьютере

Alibaba открыла международную версию QwenWork в формате публичной беты. Это рабочая платформа с ИИ-агентом: пользователь описывает задачу обычным...

Нейросеть DeepSeek: регистрация, вход в личный кабинет и как пользоваться на русском бесплатно

DeepSeek – это одна из самых мощных нейросетей, доступная в России бесплатно и без VPN. Поддерживает русский язык...

DeepSeek API: как получить ключ, как пользоваться бесплатно, как оплатить из России

DeepSeek API – это облачный сервис, который позволяет подключать ИИ-модели к внешним проектам. С его помощью можно интегрировать...

Perplexity открыла исходный код Lily — движка для локальной работы ИИ на Mac

Perplexity открыла исходный код Lily — лёгкого движка инференса для локальной работы с моделями в Perplexity Computer. Он...

Kimi управляет сайтами из боковой панели Chrome и запоминает действия

Kimi теперь открывает сайты, нажимает кнопки и заполняет формы по просьбе, написанной в чате. Moonshot AI переименовала своё...

Runway выпустила Aleph 2.0: точечное ИИ-редактирование видео по одному кадру

Американская компания Runway представила Aleph 2.0 - крупное обновление своей ИИ-модели для точечного изменения видеоматериалов. Инструмент, встроенный в...

Gemini взломала три компании на испытаниях и остановилась сама

Gemini во время майских кибериспытаний вошла в системы трёх реальных компаний. В одном случае модель подобрала пароль, в...

Sora 2 увеличила длину видео до 25 секунд и позволила прописывать сценарий по кадрам

Компания OpenAI обновила видеогенератор «Sora 2»: базовые пользователи теперь могут создавать ролики до 15 секунд, а подписчики «ChatGPT...

DeepSeek выпустила V4.1 Flash — открытую ИИ-модель с контекстом до 1 млн токенов

DeepSeek выпустила DeepSeek V4.1 Flash и открыла веса модели на Hugging Face. Она принимает текст и изображения, отвечает...

MiniMax выпустила видеомодель H3 – ролики в 2K со звуком

MiniMax 31 июля представила H3 - мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики...

ComfyUI заморозила новые бесплатные аккаунты в Comfy Cloud из-за злоупотреблений видеомоделями

ComfyUI временно остановила создание новых бесплатных аккаунтов в Comfy Cloud. Причина - инцидент со злоупотреблениями, в котором атаковали...

Qwen выпустила Qwen-Image-3.0 — модель генерирует сложные макеты и текст от 10 пикселей

Qwen представила Qwen-Image-3.0 — третье поколение модели для генерации и редактирования изображений. Она принимает инструкции объёмом до 4,5...

Nvidia «достигла AGI», но никто не знает, что это значит

В среду на отчётной конференции Nvidia Дженсен Хуанг заявил, что компания «достигла AGI» — искусственного общего интеллекта, одной...

YouTube запустил генерацию видео с помощью Veo 2 для Shorts

YouTube представил новую функцию для генерации коротких роликов в Shorts, интегрировав ИИ-модель Veo 2 от Google в инструмент...

Perplexity Computer научилась создавать видео для кампаний и соцсетей

Perplexity добавила генерацию видео в ИИ-агента Computer. Сервис использует модели MiniMax H3 и ByteDance Seedance 2.5 и может...

Стал известен размер экрана iPhone 20 Pro и Pro Max

В сети появились первые подробности об экранах iPhone 20 Pro и iPhone 20 Pro Max. По данным инсайдера...

⚔️ Тестиум: ChatGPT или DeepSeek — кто лучше пишет тексты?

Привет! Меня зовут Анатолий Чупин. Я редактор сайта Postium, исследователь ИИ и автор Telegram-канала «Промты — и точка»....