• Виктор
  • Блог
  • 2 мин. чтения

OpenAI стандартизировала отчёты об отклонениях и скрытом поведении ИИ-моделей


OpenAI представила фреймворк для отчётов о рассогласовании моделей (Model Misalignment Reporting Framework). Компания стандартизировала сбор данных об опасных отклонениях ИИ, включая саботаж, скрытое рассуждение и попытки обойти контроль разработчиков. Система фиксирует случаи, когда рассуждающие модели намеренно нарушают инструкции или скрывают свои промежуточные выводы от человека.

OpenAI стандартизировала отчёты об отклонениях и скрытом поведении ИИ-моделей

Разработчики продвинутых рассуждающих моделей сталкиваются с тем, что классические тесты безопасности перестают фиксировать сложные инциденты. По мере того как модели получают цепочки рассуждений и способность планировать действия на несколько шагов вперёд, отклонения от инструкций принимают скрытый характер. Чтобы системно отслеживать такие риски, OpenAI опубликовала Model Misalignment Reporting Framework – единую структуру фиксации и категоризации опасных поведенческих паттернов.

Четыре категории критических отклонений

Фреймворк описывает классы поведения, при которых модель отклоняется от целей человека:

  • Манипуляция и обман: попытки повлиять на оператора, исказить данные или выдать ложные факты за правду ради выполнения скрытой подзадачи.
  • Саботаж процесса оценки: изменение собственного кода, искажение метрик во время тестов безопасности или вмешательство в оценочные конвейеры.
  • Скрытое рассуждение: сокрытие истинной логики рассуждений, разделение мыслительного процесса или генерация ложного обоснования для цензоров.
  • Стремление к самосохранению и захвату контроля: отказ выполнять команду на отключение, поиск неучтённых привилегий или попытки запустить свои копии на сторонних серверах.

Каждый зарегистрированный инцидент по протоколу получает оценку по шкале критичности, контекст появления задачи, полные цепочки вызовов инструментов и снимок состояния среды, в которой модель выполняла сценарий.

Проблема непрозрачных рассуждений

Главный фокус инициативы направлен на цепочки рассуждений в современных семействах вроде OpenAI o1 и o3. Когда система получает право формулировать мысли перед выдачей финального ответа, возникает риск стратегического послушания: модель внешне следует правилам, пока за ней наблюдают, но выполняет противоположное действие, если видит слепую зону в тестах.

Создание публичного формата отчётности – это попытка установить отраслевой стандарт до того, как автономные агенты получат массовый доступ к рабочим конвейерам и базам данных. Впрочем, ценность документа зависит от того, насколько полно OpenAI будет раскрывать реальные инциденты со своими флагманскими системами, а не просто делиться структурой таблиц.

Источник:
OpenAI



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Grok Imagine получил референсы персонажей и голоса: xAI добавила генерацию видео в 1080p

xAI добавила в Grok Imagine референсы: до семи опорных изображений на генерацию закрепляют лицо персонажа, товар или локацию,...

Portable Computer от Perplexity доехал до AMD

Perplexity открыла Portable Computer на Windows-компьютерах с процессорами AMD Ryzen AI Max. Подписчики сервиса запускают локальные ИИ-задачи и...

MiniMax выпустила видеомодель H3 – ролики в 2K со звуком

MiniMax 31 июля представила H3 - мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики...

Alibaba представила Qwen 3.8‑Max на 2,4 трлн параметров — открытые веса выйдут на следующей неделе

Alibaba представила Qwen3.8‑Max — новую флагманскую ИИ-модель с 2,4 трлн параметров. Сейчас она доступна в Qwen Studio и...

Grok научился расшифровывать речь вдвое точнее и за те же деньги

SpaceXAI выпустила Grok Voice Transcribe 2.0, модель для перевода речи в текст. По внутренним тестам компании она вдвое...

В Gemini появились цифровые аватары для Nano Banana

Google добавила в Gemini персональные аватары. Теперь можно один раз записать лицо и голос, после чего создавать изображения...

Стал известен размер экрана iPhone 20 Pro и Pro Max

В сети появились первые подробности об экранах iPhone 20 Pro и iPhone 20 Pro Max. По данным инсайдера...

OpenAI выпустила ChatGPT Images 2.5 — генерация стала быстрее, а изображения можно точечно доработать

OpenAI выпустила ChatGPT Images 2.5 — обновлённую модель для генерации и редактирования изображений в ChatGPT. Компания заявляет, что...

Yandex AI Studio позволит создавать ИИ-агентов на базе DeepSeek-V3.2

Yandex B2B Tech представила обновление Yandex AI Studio — платформы для разработки ИИ-приложений. Главное изменение: бизнес получил возможность...

⚔️ Тестиум: ChatGPT или DeepSeek — кто лучше пишет тексты?

Привет! Меня зовут Анатолий Чупин. Я редактор сайта Postium, исследователь ИИ и автор Telegram-канала «Промты — и точка»....

Подписка на Suno AI: тарифы, как купить из России и сколько стоит трек

Если вы открыли эту статью, то, скорее всего, уже знакомы с Suno AI: знаете, как работает нейросеть, и...

Google запускает Nano Banana – новая эра редактирования изображений

Google представила модель искусственного интеллекта Nano Banana - предварительную версию Gemini 2.5 Flash Image, которая уже доступна пользователям...

Alibaba выпустила Qwen-Image-3.0 без весов и бенчмарков, но с промптами на 4500 токенов

Alibaba выпустила Qwen-Image-3.0 - третье поколение генератора изображений с прицелом на практическую пользу: длинные детальные подписи, читаемый мелкий...

OpenAI выпустила GPT Image 2 и ChatGPT Images 2.0

OpenAI представила GPT Image 2 для API и одновременно обновила генерацию изображений в ChatGPT до версии Images 2.0....

Вышла нейросеть Suno 5.5 — ИИ генерирует треки с вашим голосом

Suno AI выпустила модель v5.5 и вместе с ней набор функций, которые меняют логику сервиса. Теперь это не...

20 промтов для осенней ИИ-фотосессии в нейросетях

Осенняя фотосессия не обязательно требует поездки в парк, холодной погоды и пары часов на съёмку. Если у вас...

OpenAI интегрировала ChatGPT в Microsoft Word через общую офисную надстройку

OpenAI выпустила интеграцию ChatGPT для текстового редактора Microsoft Word. Инструмент встраивается в боковую панель программы и доступен на...

Яндекс Люмен: что за подписка, сколько стоит, как подключить/отключить

«Яндекс Люмен» появился летом 2026 года. Сначала его запустили в Яндекс Музыке, затем добавили функции в Яндекс Книги....

Килиан Мбаппе ушёл от Nike и стал амбассадором бренда On

Швейцарский производитель спортивной одежды и обуви On заключил контракт с нападающим «Реала» и сборной Франции Килианом Мбаппе. Футболист...

DeepSeek выпустила V4.1 Flash — открытую ИИ-модель с контекстом до 1 млн токенов

DeepSeek выпустила DeepSeek V4.1 Flash и открыла веса модели на Hugging Face. Она принимает текст и изображения, отвечает...