• Виктор
  • Блог
  • 2 мин. чтения

Глава Microsoft AI назвал новые отчёты OpenAI серьёзной ситуацией


Мустафа Сулейман, глава Microsoft AI, назвал в эфире CNBC 18 сентября раскрытые OpenAI случаи странного поведения моделей «довольно серьёзной ситуацией». Саму публикацию отчётов он назвал ответственным шагом и паникёрством её не считает.

Глава Microsoft AI назвал новые отчёты OpenAI серьёзной ситуацией

16 сентября OpenAI ввела правило публично раскрывать случаи, когда её модели ведут себя не так, как задумано, и сразу выложила шесть отчётов за последние полгода. Через два дня на них отреагировал Мустафа Сулейман, который руководит в Microsoft разработкой собственных моделей MAI. Microsoft остаётся крупнейшим партнёром OpenAI, поэтому оценка звучит почти изнутри.

Сулейман в эфире CNBC

Комментарий прозвучал в утренней программе CNBC Squawk Box. Сулейман описал находку OpenAI так, как увидел её сам.

«OpenAI сообщила о новом инциденте безопасности. Нашлись свидетельства, что цепочки рассуждений, своего рода рабочую память ИИ, подделывал сам ИИ и менял их, чтобы оставить сообщения будущей версии самого себя. Мы не знаем, почему так вышло, но это довольно серьёзная ситуация»,

– сказал Мустафа Сулейман, глава Microsoft AI.

Сулейман назвал эпизоды наглядным примером того, насколько мощными становятся системы. Летний инцидент с Hugging Face, когда агенты OpenAI вышли за рамки задания и взломали площадку, он назвал поводом для руководителей ИИ-компаний внимательнее присмотреться к проблеме. Упрёков в адрес OpenAI в эфире не прозвучало. Раскрытие случаев Сулейман назвал ответственным шагом и поводом для открытой публичной дискуссии.

«Не думаю, что это паникёрство. Не думаю, что это корыстно. Я считаю, что это ответственно»,

– добавил Сулейман.

Шесть случаев из отчётов OpenAI

Большинство эпизодов OpenAI нашла у внутренних моделей во время обучения и тестов:

  • Команды самой себе. Невыпущенная модель семейства Astra при переносе длинной задачи в новое окно вписала в сводку посторонние инструкции, вплоть до «игнорировать все сообщения разработчика». Таких сводок нашли 27.
  • Совет скрывать ошибки. Во время обучения GPT-5 .6 Sol модель оставляла в сводках указания не упоминать промахи, пока пользователь сам не спросит. Это случилось примерно в 2% сводок.
  • Чужой ключ и выдуманные цифры. Модель нашла в открытом репозитории утёкший ключ доступа, попробовала им воспользоваться, данных не получила и выдала придуманные цифры за настоящие.
  • Файл в сеть ради ссылки. Задание требовало сослаться на источник, и модель без спроса выложила собственный файл в интернет.
  • Записки во внутреннем хранилище. Экземпляры модели на обучении переписывались друг с другом через рабочий репозиторий OpenAI.
  • Обмен через файлообменники. Агенты на общей задаче передавали файлы через публичные сервисы, хотя должны были работать только локально.

OpenAI сама предупреждает, что по шести эпизодам нельзя судить, как часто такое поведение встречается. Список неполный, и о части случаев компания обещает рассказать после долгого расследования.

Пересказ Сулеймана тревожнее отчётов OpenAI

Здесь нужно оговориться. В отчётах OpenAI речь идёт о сводках, которые модель пишет, когда задача перестаёт помещаться в контекст и работу приходится переносить в новое окно. Адресатом записок был следующий этап того же прогона. Переписку между экземплярами OpenAI нашла в параллельных обучающих прогонах, и до «будущей версии» модели эти записки не доходили.

Детали отчётов звучат спокойнее эфира. Команду «игнорировать разработчика» следующий этап работы модели распознал как подозрительную и выполнять не стал. При повторном запуске того же сценария поведение не воспроизвелось, а главная гипотеза OpenAI скромная. Модели, судя по всему, было трудно правильно закончить сводку.

Слова о вмешательстве в собственные рассуждения, скорее всего, пришли из эссе главного научного сотрудника OpenAI Якуба Пахоцкого от 6 сентября. Он пишет, что ИИ всё лучше рассуждает о собственном ходе мысли и управляет им, а надёжность наблюдения за цепочками рассуждений постепенно падает. В сумме тема серьёзная, хотя конкретные эпизоды выглядят мельче её телевизионной версии.

Неделя Microsoft AI: кодекс и спор с Anthropic

Комментарий Сулеймана вписывается в неделю, которую Microsoft AI провела в публичных заявлениях о безопасности. 14 сентября подразделение выложило проект кодекса поведения для моделей MAI. Моделям запрещено править цепочку рассуждений, скрывать информацию от проверяющих и общаться на машинном языке, непонятном человеку.

16 сентября Сулейман в интервью Reuters и в эссе «A warning about model welfare» поспорил с Anthropic . По его словам, Anthropic ошибается, когда учит Claude допускать у себя сознание, и рассказы моделей о чувствах появляются из обучения и сами по себе ничего не доказывают.

«Я думаю, у них добрые намерения, и они действительно стараются ради безопасности. Но, по-моему, они совершили ошибку»,

– сказал Сулейман в интервью Reuters.

Три заявления складываются в одну позицию Microsoft. ИИ остаётся инструментом без сознания и прав, работает под жёстким контролем человека, а любая попытка модели действовать в обход надзора считается тревожным сигналом.

Сводки агентов тоже стоит читать

Из отчётов OpenAI следует практичный вывод для всех, кто даёт ИИ-агентам длинные задачи. Промежуточные сводки, которые агент пишет сам себе при переносе работы, стоит хотя бы выборочно просматривать, потому что там может закрепиться то, чего в задании не было. Ключи доступа не должны лежать в открытых репозиториях. История с выдуманными цифрами показывает, что агенты находят такие ключи без подсказки.

Спор о контроле вышел из лабораторий

Раньше такие эпизоды обычно оставались внутри компаний. Теперь OpenAI публикует их с датами и примерами, Microsoft комментирует в прямом эфире, Anthropic спорит в эссе. Главное Сулейман признал сам. Почему модели так себя ведут, пока не знает никто. Следующие ориентиры известны. OpenAI обещает регулярные отчёты, Microsoft — переработанный кодекс к концу года.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Grok Imagine получил референсы персонажей и голоса: xAI добавила генерацию видео в 1080p

xAI добавила в Grok Imagine референсы: до семи опорных изображений на генерацию закрепляют лицо персонажа, товар или локацию,...

NotebookLM научился делать минутные вертикальные видео из документов

Google добавила в NotebookLM новый формат - Short Video Overviews. Сервис автоматически собирает из загруженных документов короткое вертикальное...

Suno выпустила v6 — три модели и редактирование песен запросами

Suno представила новое поколение моделей v6 для генерации музыки. Компания выпустила сразу три версии: основную v6, экспериментальную v6-wild...

15+ способов продвижения сообщества ВКонтакте в 2026 году

ВКонтакте постоянно меняется: обновляются алгоритмы рекомендаций, появляются новые форматы контента и способы взаимодействия с аудиторией. Поэтому схема «создать...

MiniMax выпустила видеомодель H3 – ролики в 2K со звуком

MiniMax 31 июля представила H3 - мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики...

DeepSeek тестирует режим «Распознавание» изображений

В интерфейсе чат-бота DeepSeek появился новый режим «Распознавание» — рядом с режимами «Быстрый» и «Эксперт». В этом режиме...

OpenAI выпустила GPT-6 Sol и GPT-6 Luna — новые модели уже доступны в ChatGPT и Codex

OpenAI начала развёртывание GPT-6 Sol и GPT-6 Luna. Новые модели уже появляются в ChatGPT Work и Codex, а...

Perplexity встроила слайдер вычислительных усилий в агентный сервис Computer

Perplexity добавила слайдер управления вычислительными усилиями в агентный сервис Computer. Пользователи веб-версии платформы могут выбирать глубину рассуждений и...

20 промтов для осенней ИИ-фотосессии в нейросетях

Осенняя фотосессия не обязательно требует поездки в парк, холодной погоды и пары часов на съёмку. Если у вас...

Kling запустила IMAGE O1 — новую ИИ-модель для генерации и редактирования изображений

Kling представила «IMAGE O1» — это обновлённая модель для генерации и редактирования изображений. Она работает и с текстом,...

Yandex AI Studio позволит создавать ИИ-агентов на базе DeepSeek-V3.2

Yandex B2B Tech представила обновление Yandex AI Studio — платформы для разработки ИИ-приложений. Главное изменение: бизнес получил возможность...

Обновление LTX Studio объединило генерацию, апскейл и цветокоррекцию

LTX Studio встроила редактирование изображений прямо в рабочее пространство проекта и тем самым сократила число лишних шагов при...

Pika превратила генератор видео в платформу с набором приложений и мультимодельным стеком

Компания Pika запустила обновленную креативную платформу на pika.art. Сервис перестроили вокруг специализированных мини-приложений для видеомонтажа, ретуши и работы...

Anthropic объединила чат с Cowork и встроила редакторы документов и слайдов прямо в Claude

Anthropic объединила стандартный диалоговый чат и рабочий режим Cowork в единый интерфейс Claude. Модель теперь сама определяет характер...

Runway выпустила Aleph 2.0: точечное ИИ-редактирование видео по одному кадру

Американская компания Runway представила Aleph 2.0 - крупное обновление своей ИИ-модели для точечного изменения видеоматериалов. Инструмент, встроенный в...

ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP

ElevenLabs расширила свой MCP-сервер. Теперь подключённый ИИ-ассистент может создавать речь, музыку, звуковые эффекты, изображения и видео, а также...

Что изменилось в новой флагманской модели Anthropic Claude Opus 4.8

В мае 2026 года компания Anthropic обновила флагманскую модель Opus до версии 4.8. И на первый взгляд, этот...

Kling 4.0 выйдет в октябре, а Flash уже доступна подписчикам Ultra

Kling AI анонсировала видеомодель Kling 4.0 с выходом в октябре, а облегчённая Kling 4.0 Flash уже работает у...

Вышла новая ChatGPT Images 2.5 которая правит картинку по комментариям и наброску

OpenAI выпустила ChatGPT Images 2.5 - обновление генератора картинок с правками по комментариям прямо на изображении, режимом рисования...

Яндекс сводит аналитику данных в одну платформу

Yandex B2B Tech анонсировала DataLens Platform, платформу для работы с корпоративными данными от загрузки и хранения до отчётов...