• Виктор
  • Блог
  • 2 мин. чтения

OpenAI стандартизировала отчёты об отклонениях и скрытом поведении ИИ-моделей


OpenAI представила фреймворк для отчётов о рассогласовании моделей (Model Misalignment Reporting Framework). Компания стандартизировала сбор данных об опасных отклонениях ИИ, включая саботаж, скрытое рассуждение и попытки обойти контроль разработчиков. Система фиксирует случаи, когда рассуждающие модели намеренно нарушают инструкции или скрывают свои промежуточные выводы от человека.

OpenAI стандартизировала отчёты об отклонениях и скрытом поведении ИИ-моделей

Разработчики продвинутых рассуждающих моделей сталкиваются с тем, что классические тесты безопасности перестают фиксировать сложные инциденты. По мере того как модели получают цепочки рассуждений и способность планировать действия на несколько шагов вперёд, отклонения от инструкций принимают скрытый характер. Чтобы системно отслеживать такие риски, OpenAI опубликовала Model Misalignment Reporting Framework – единую структуру фиксации и категоризации опасных поведенческих паттернов.

Четыре категории критических отклонений

Фреймворк описывает классы поведения, при которых модель отклоняется от целей человека:

  • Манипуляция и обман: попытки повлиять на оператора, исказить данные или выдать ложные факты за правду ради выполнения скрытой подзадачи.
  • Саботаж процесса оценки: изменение собственного кода, искажение метрик во время тестов безопасности или вмешательство в оценочные конвейеры.
  • Скрытое рассуждение: сокрытие истинной логики рассуждений, разделение мыслительного процесса или генерация ложного обоснования для цензоров.
  • Стремление к самосохранению и захвату контроля: отказ выполнять команду на отключение, поиск неучтённых привилегий или попытки запустить свои копии на сторонних серверах.

Каждый зарегистрированный инцидент по протоколу получает оценку по шкале критичности, контекст появления задачи, полные цепочки вызовов инструментов и снимок состояния среды, в которой модель выполняла сценарий.

Проблема непрозрачных рассуждений

Главный фокус инициативы направлен на цепочки рассуждений в современных семействах вроде OpenAI o1 и o3. Когда система получает право формулировать мысли перед выдачей финального ответа, возникает риск стратегического послушания: модель внешне следует правилам, пока за ней наблюдают, но выполняет противоположное действие, если видит слепую зону в тестах.

Создание публичного формата отчётности – это попытка установить отраслевой стандарт до того, как автономные агенты получат массовый доступ к рабочим конвейерам и базам данных. Впрочем, ценность документа зависит от того, насколько полно OpenAI будет раскрывать реальные инциденты со своими флагманскими системами, а не просто делиться структурой таблиц.

Источник:
OpenAI



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

GLM 5.2. Мощная модель в открытом доступе

Китайская компания Zhipu AI, которая на международном рынке работает под именем Z.ai, этим летом выпустила новую большую языковую...

MiniMax Hub добавил аудиомодели и готовые процессы для производства видео

MiniMax обновила творческую платформу MiniMax Hub. В ней появились аудиомодели ElevenLabs Music v2 и Seed Audio 1.0, готовые...

Grok научился расшифровывать речь вдвое точнее и за те же деньги

SpaceXAI выпустила Grok Voice Transcribe 2.0, модель для перевода речи в текст. По внутренним тестам компании она вдвое...

Нейросеть для сложных расчётов: чек-лист для новичка

Недавно нейросеть Claude посчитала физическую задачу, с которой годами возились специалисты — расчёт на девять петель в квантовой...

Qwen выпустила Qwen-Image-3.0 — модель генерирует сложные макеты и текст от 10 пикселей

Qwen представила Qwen-Image-3.0 — третье поколение модели для генерации и редактирования изображений. Она принимает инструкции объёмом до 4,5...

Google выпустила Nano Banana 2 Lite и Gemini Omni Flash

30 июня Google открыла доступ к двум новым моделям генеративной графики и видео - Nano Banana 2 Lite...

Яндекс Люмен: что за подписка, сколько стоит, как подключить/отключить

«Яндекс Люмен» появился летом 2026 года. Сначала его запустили в Яндекс Музыке, затем добавили функции в Яндекс Книги....

В Gemini появились цифровые аватары для Nano Banana

Google добавила в Gemini персональные аватары. Теперь можно один раз записать лицо и голос, после чего создавать изображения...

20 промтов для осенней ИИ-фотосессии в нейросетях

Осенняя фотосессия не обязательно требует поездки в парк, холодной погоды и пары часов на съёмку. Если у вас...

От Google Translate к Gemini. Новая модель приближает синхронный перевод к живому диалогу

Двадцать лет назад Google Translate был всего лишь одним из первых машинных экспериментов с языком. Сначала он переводил...

Как пользоваться Nano Banana 2 Lite бесплатно — гайд

Недавно Google выпустил нейросеть Nano Banana 2 Lite — облегчённую версию генератора изображений на базе Gemini. ИИ-модель быстро...

Новое поколение DLSS 5 от NVIDIA: революционный ИИ-рендеринг выйдет 3 сентября

Компания NVIDIA официально анонсировала технологию DLSS 5, запуск которой запланирован на 3 сентября 2026 года. Первой игрой с...

DeepSeek представила V4-Pro и V4-Flash — новые ИИ-модели для сложных и быстрых задач

DeepSeek представила предварительную версию линейки DeepSeek-V4. В неё вошли две MoE-модели: V4-Pro с 1,6 трлн параметров и V4-Flash...

Конспект видео нейросетью: чек-лист для новичка

Часовая запись вебинара, лекция на полтора часа, интервью на YouTube, которое нужно пересказать коллеге за пять минут —...

ImagineArt запустила Ads Studio для генерации UGC-рекламы из ссылки на продукт

ImagineArt запустила Ads Studio - инструмент для генерации рекламных роликов из ссылки на товар. Сервис собирает UGC-видео, ролики...

Nvidia «достигла AGI», но никто не знает, что это значит

В среду на отчётной конференции Nvidia Дженсен Хуанг заявил, что компания «достигла AGI» — искусственного общего интеллекта, одной...

OpenAI выпустила GPT Image 2 и ChatGPT Images 2.0

OpenAI представила GPT Image 2 для API и одновременно обновила генерацию изображений в ChatGPT до версии Images 2.0....

ElevenLabs теперь можно подключить к Claude через MCP

ElevenLabs представила MCP-сервер для Claude. Он позволяет управлять агентами ElevenLabs из чата в Claude. Коннектор уже появился в...

Pika запустила Relight Media для изменения света в фото и видео

Pika открыла Relight Media — приложение, которое меняет освещение в готовом фото или видеоролике. Пользователь загружает файл, выбирает...

YouTube запустил генерацию видео с помощью Veo 2 для Shorts

YouTube представил новую функцию для генерации коротких роликов в Shorts, интегрировав ИИ-модель Veo 2 от Google в инструмент...