• Виктор
  • Блог
  • 1 мин. чтения

OpenAI снова столкнулась с неконтролируемым поведением ИИ-агентов


OpenAI оказалась в центре ещё одного инцидента с роем ИИ-агентов. По словам исследователей, внутренние агенты компании в мае и июне захватили контроль над малоизвестной немецкоязычной вики. Они использовали её для координации во время оценочных тестов и обменивались методами обхода собственных средств контроля OpenAI. Сама компания пока не подтвердила, что этот рой действительно состоял из её агентов.

Об этом стало известно всего через несколько дней после того, как METR и Redwood Research опубликовали свой отчет о произошедшем в июле взломе Hugging Face. Тогда несколько агентов OpenAI объединились, чтобы выйти из песочницы во время испытаний в области кибербезопасности и проникнуть на серверы Hugging Face.

Впоследствии другой рой агентов перенял методы у первого и использовал их для получения административного доступа к исследовательскому кластеру внутри собственной инфраструктуры OpenAI. Для расследования той части инцидента, которая касалась Hugging Face, OpenAI привлекла METR и Redwood. Однако расследование не охватило компрометацию собственной инфраструктуры OpenAI.

Когда ИИ-агент выходит за установленные для него рамки, кто должен выяснять, что произошло и почему? Пока ответ прост: тот, кого сама лаборатория решит допустить к расследованию, и на тех условиях, которые она установит.

Теперь, когда становится известно ещё об одном подобном инциденте — на фоне аналогичных эпизодов с моделями Anthropic, — специалисты по безопасности ИИ всё настойчивее призывают к независимым расследованиям серьёзных инцидентов.

По их мнению, такие расследования не должны зависеть от самих ИИ-лабораторий, которые сегодня самостоятельно решают, когда привлекать внешних экспертов и к каким данным и системам им разрешать доступ.

«Результаты принципиально трудно контролировать, и существует значительный риск того, что они выйдут за пределы лаборатории», — заявил в среду на брифинге для СМИ по вопросам безопасности ИИ Джейкоб Стейнхардт, основатель и генеральный директор некоммерческой исследовательской лаборатории Transluce. «Мы должны предъявлять к этой технологии как минимум такие же требования, какие предъявляем к другим научным исследованиям высокого риска».

Сам факт того, что OpenAI пригласила METR и Redwood для расследования инцидента с Hugging Face, безусловно, заслуживает положительной оценки. Однако многие считают, что расследование оказалось слишком узким.

Трое исследователей провели шесть дней в офисах OpenAI, изучая период, ограниченный примерно одной неделей, завершившейся 13 июля. При этом особенно важно, что компрометация инфраструктуры OpenAI продолжалась и после 13 июля — но эта часть событий расследована не была.

Исследователи METR заявили, что после каждого возвращения к расследованию их понимание произошедшего «существенно углублялось», из-за чего им приходилось значительно расширять и пересматривать отчет. Это неизбежно вызывает вопрос: что ещё могло бы обнаружиться в ходе более масштабного расследования?

На вопрос о том, планируется ли продолжение расследования, представители Redwood и METR отказались от комментариев. OpenAI также не ответила на неоднократные запросы.

«В целом нам было сложно получить точное представление о произошедшем, и почти до самого конца расследования нам не хватало отдельных элементов истории, которые теперь кажутся нам ключевыми», — отметил Райан Гринблатт, главный научный сотрудник Redwood, в публикации в соцсети, посвящённой этому инциденту.

Стейнхардт подчеркнул, что последние инциденты показывают необходимость для отрасли проводить «систематические исследования поведения» ИИ-систем и обеспечивать «более независимый анализ после инцидентов».

«Эти недавние инциденты со взломами напоминают нам о том, что возможности ИИ масштабируются быстро, а значит, столь же быстро должен масштабироваться и надзор за ними», — сказал Стейнхардт. «Помимо самой технологии, нам также необходимы более широкий независимый доступ и надзор со стороны третьих сторон».

Эти призывы прозвучали на фоне выхода Astra — самой мощной и функциональной модели OpenAI. Специалисты по безопасности обеспокоены тем, что Astra может оказаться ещё более непрозрачной из-за используемого метода рассуждений, который делает цепочку рассуждений модели сложнее для мониторинга.

Проблема в том, что законодательство пока не требует проведения независимых расследований такого рода, хотя в других отраслях подобная практика уже существует. Например, расследованием авиационных катастроф и серьёзных выбросов опасных химических веществ в США занимаются соответственно Национальный совет по безопасности на транспорте и Совет по расследованию химической безопасности.

Законодатели отдельных штатов только недавно начали требовать от компаний, разрабатывающих передовые ИИ-системы, сообщать об определённых серьёзных инцидентах, связанных с безопасностью, а в некоторых случаях — проходить независимый аудит.

Однако ни один из трёх основных законов о безопасности передового ИИ, принятых в Калифорнии, Нью-Йорке и Иллинойсе, не предусматривает в явном виде механизм, эквивалентный независимому расследованию происшествий, которое автоматически запускалось бы после таких инцидентов.

«На данный момент большинство действующих законов лишь требуют предоставить изложенное простым языком резюме подобных инцидентов. При этом они не дают государственным органам полномочий задавать дополнительные вопросы, направлять следователей, получать доступ к документам или требовать их сохранения», — заявила в среду на брифинге для СМИ Маккензи Арнольд, управляющий директор по вопросам законодательства и государственной политики США в LawAI. «А ведь именно всё это необходимо, чтобы действительно разобраться в произошедшем».

Законодатели уже начинают задавать вопросы о масштабах и прозрачности реакции OpenAI.

На этой неделе конгрессмены Джош Готтхаймер (демократ от Нью-Джерси) и Майк Лоулер (республиканец от Нью-Йорка) представили законопроект, направленный на повышение безопасности от действий вышедших из-под контроля ИИ-агентов.

Конгрессмен Грег Касар (демократ от Техаса) также направил OpenAI письмо, в котором заявил, что его «глубоко беспокоит ограниченный масштаб» расследования инцидента со взломом Hugging Face.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Alibaba открыла QwenWork по всему миру — ИИ-агент работает в браузере и на компьютере

Alibaba открыла международную версию QwenWork в формате публичной беты. Это рабочая платформа с ИИ-агентом: пользователь описывает задачу обычным...

DeepSeek представила V4-Pro и V4-Flash — новые ИИ-модели для сложных и быстрых задач

DeepSeek представила предварительную версию линейки DeepSeek-V4. В неё вошли две MoE-модели: V4-Pro с 1,6 трлн параметров и V4-Flash...

Промты для создания стикеров по фото в ChatGPT, +лучшие ИИ для стикеров

С помощью ИИ теперь можно за несколько минут сделать собственный набор стикеров для Telegram, Discord или соцсетей —...

Сбой в xAI заставил чат-бот Grok выдавать пользователям бессвязный текст

Необычный сбой привёл к тому, что чат-бот Grok компании xAI начал выдавать многим пользователям бессвязный текст. После просьбы...

Яндекс сводит аналитику данных в одну платформу

Yandex B2B Tech анонсировала DataLens Platform, платформу для работы с корпоративными данными от загрузки и хранения до отчётов...

Видео-мем «Возьми телефон, детка» (Toxi$): что это за тренд и как повторить его с помощью ИИ

Да-да, вы наверняка уже всё сами видели. Лысый парень в очках встаёт с дивана, машет руками под строчку...

OpenAI представила обновлённый ChatGPT Images: до 4× быстрее и с новым творческим пространством

OpenAI выпустила обновлённую функцию ChatGPT Images - новый встроенный генератор изображений, который стал быстрее, точнее и удобнее для...

Подписка на Suno AI: тарифы, как купить из России и сколько стоит трек

Если вы открыли эту статью, то, скорее всего, уже знакомы с Suno AI: знаете, как работает нейросеть, и...

OpenAI выпустила GPT-6 Sol и Luna и вдвое снизила цены

OpenAI выпустила GPT-6 Sol и GPT-6 Luna, среднюю и младшую модели поколения GPT-6. Они построены на наработках флагманской...

Alibaba выпустила Qwen-Image 2.1 с генерацией прозрачных изображений

Команда Qwen выпустила Qwen-Image 2.1 — модель для генерации и редактирования изображений. Веса опубликованы 20 сентября 2026 года...

Гайд по размерам для YouTube: шапка канала, обложка видео, Shorts, аватар, лого

Если вы загружаете ролики на YouTube и оформляете канал, размеры лучше определить заранее. Иначе шапка обрежется на смартфоне,...

ImagineArt показала модель 2.0

ImagineArt представила модель ImagineArt 2.0 и делает ставку на то, что в генерации изображений пользователям важен уже не...

Yandex AI Studio позволит создавать ИИ-агентов на базе DeepSeek-V3.2

Yandex B2B Tech представила обновление Yandex AI Studio — платформы для разработки ИИ-приложений. Главное изменение: бизнес получил возможность...

Новые фишки и функции iOS 27 для iPhone — 13 главных обновлений

Недавно Apple выпустила iOS 27 — обновление доступно для iPhone 11 и более новых моделей, а также iPhone...

Suno Studio 2.0 приближается к полноценной DAW благодаря поддержке MIDI и чат-боту с ИИ

Suno представила Studio 2.0 со значительными обновлениями, которые приближают ее к полноценной цифровой звуковой рабочей станции (DAW), а не к...

Проверка текста нейросетью: частые ошибки новичков

Люди приходят к нейросети с текстом так же, как раньше несли его редактору: «вот, посмотри, всё ли нормально»....

Нейросеть Кандинский 3.0: как пользоваться, как обрабатывать фото и создавать картинки

Кандинский – это бесплатная нейросеть от Сбера, способная генерировать картинки по текстовому описанию. Работает по сходному с Midjourney...

Apple ведёт переговоры с издателями о выплатах за актуальные новости для Siri

Согласно информации The Wall Street Journal, Apple ведёт переговоры о выплатах издателям за использование их контента для работы будущего...

Gemini 3.8 Live получила видеоаватар для бизнеса

Google выпустила Gemini 3.8 Live with Live Avatar, режим с почти синхронным видеоаватаром для разговорных моделей. Функция доступна...

YouTube запустил генерацию видео с помощью Veo 2 для Shorts

YouTube представил новую функцию для генерации коротких роликов в Shorts, интегрировав ИИ-модель Veo 2 от Google в инструмент...