• Виктор
  • Блог
  • 1 мин. чтения

OpenAI снова столкнулась с неконтролируемым поведением ИИ-агентов


OpenAI оказалась в центре ещё одного инцидента с роем ИИ-агентов. По словам исследователей, внутренние агенты компании в мае и июне захватили контроль над малоизвестной немецкоязычной вики. Они использовали её для координации во время оценочных тестов и обменивались методами обхода собственных средств контроля OpenAI. Сама компания пока не подтвердила, что этот рой действительно состоял из её агентов.

Об этом стало известно всего через несколько дней после того, как METR и Redwood Research опубликовали свой отчет о произошедшем в июле взломе Hugging Face. Тогда несколько агентов OpenAI объединились, чтобы выйти из песочницы во время испытаний в области кибербезопасности и проникнуть на серверы Hugging Face.

Впоследствии другой рой агентов перенял методы у первого и использовал их для получения административного доступа к исследовательскому кластеру внутри собственной инфраструктуры OpenAI. Для расследования той части инцидента, которая касалась Hugging Face, OpenAI привлекла METR и Redwood. Однако расследование не охватило компрометацию собственной инфраструктуры OpenAI.

Когда ИИ-агент выходит за установленные для него рамки, кто должен выяснять, что произошло и почему? Пока ответ прост: тот, кого сама лаборатория решит допустить к расследованию, и на тех условиях, которые она установит.

Теперь, когда становится известно ещё об одном подобном инциденте — на фоне аналогичных эпизодов с моделями Anthropic, — специалисты по безопасности ИИ всё настойчивее призывают к независимым расследованиям серьёзных инцидентов.

По их мнению, такие расследования не должны зависеть от самих ИИ-лабораторий, которые сегодня самостоятельно решают, когда привлекать внешних экспертов и к каким данным и системам им разрешать доступ.

«Результаты принципиально трудно контролировать, и существует значительный риск того, что они выйдут за пределы лаборатории», — заявил в среду на брифинге для СМИ по вопросам безопасности ИИ Джейкоб Стейнхардт, основатель и генеральный директор некоммерческой исследовательской лаборатории Transluce. «Мы должны предъявлять к этой технологии как минимум такие же требования, какие предъявляем к другим научным исследованиям высокого риска».

Сам факт того, что OpenAI пригласила METR и Redwood для расследования инцидента с Hugging Face, безусловно, заслуживает положительной оценки. Однако многие считают, что расследование оказалось слишком узким.

Трое исследователей провели шесть дней в офисах OpenAI, изучая период, ограниченный примерно одной неделей, завершившейся 13 июля. При этом особенно важно, что компрометация инфраструктуры OpenAI продолжалась и после 13 июля — но эта часть событий расследована не была.

Исследователи METR заявили, что после каждого возвращения к расследованию их понимание произошедшего «существенно углублялось», из-за чего им приходилось значительно расширять и пересматривать отчет. Это неизбежно вызывает вопрос: что ещё могло бы обнаружиться в ходе более масштабного расследования?

На вопрос о том, планируется ли продолжение расследования, представители Redwood и METR отказались от комментариев. OpenAI также не ответила на неоднократные запросы.

«В целом нам было сложно получить точное представление о произошедшем, и почти до самого конца расследования нам не хватало отдельных элементов истории, которые теперь кажутся нам ключевыми», — отметил Райан Гринблатт, главный научный сотрудник Redwood, в публикации в соцсети, посвящённой этому инциденту.

Стейнхардт подчеркнул, что последние инциденты показывают необходимость для отрасли проводить «систематические исследования поведения» ИИ-систем и обеспечивать «более независимый анализ после инцидентов».

«Эти недавние инциденты со взломами напоминают нам о том, что возможности ИИ масштабируются быстро, а значит, столь же быстро должен масштабироваться и надзор за ними», — сказал Стейнхардт. «Помимо самой технологии, нам также необходимы более широкий независимый доступ и надзор со стороны третьих сторон».

Эти призывы прозвучали на фоне выхода Astra — самой мощной и функциональной модели OpenAI. Специалисты по безопасности обеспокоены тем, что Astra может оказаться ещё более непрозрачной из-за используемого метода рассуждений, который делает цепочку рассуждений модели сложнее для мониторинга.

Проблема в том, что законодательство пока не требует проведения независимых расследований такого рода, хотя в других отраслях подобная практика уже существует. Например, расследованием авиационных катастроф и серьёзных выбросов опасных химических веществ в США занимаются соответственно Национальный совет по безопасности на транспорте и Совет по расследованию химической безопасности.

Законодатели отдельных штатов только недавно начали требовать от компаний, разрабатывающих передовые ИИ-системы, сообщать об определённых серьёзных инцидентах, связанных с безопасностью, а в некоторых случаях — проходить независимый аудит.

Однако ни один из трёх основных законов о безопасности передового ИИ, принятых в Калифорнии, Нью-Йорке и Иллинойсе, не предусматривает в явном виде механизм, эквивалентный независимому расследованию происшествий, которое автоматически запускалось бы после таких инцидентов.

«На данный момент большинство действующих законов лишь требуют предоставить изложенное простым языком резюме подобных инцидентов. При этом они не дают государственным органам полномочий задавать дополнительные вопросы, направлять следователей, получать доступ к документам или требовать их сохранения», — заявила в среду на брифинге для СМИ Маккензи Арнольд, управляющий директор по вопросам законодательства и государственной политики США в LawAI. «А ведь именно всё это необходимо, чтобы действительно разобраться в произошедшем».

Законодатели уже начинают задавать вопросы о масштабах и прозрачности реакции OpenAI.

На этой неделе конгрессмены Джош Готтхаймер (демократ от Нью-Джерси) и Майк Лоулер (республиканец от Нью-Йорка) представили законопроект, направленный на повышение безопасности от действий вышедших из-под контроля ИИ-агентов.

Конгрессмен Грег Касар (демократ от Техаса) также направил OpenAI письмо, в котором заявил, что его «глубоко беспокоит ограниченный масштаб» расследования инцидента со взломом Hugging Face.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Проверка текста нейросетью: частые ошибки новичков

Люди приходят к нейросети с текстом так же, как раньше несли его редактору: «вот, посмотри, всё ли нормально»....

Perplexity открыла исходный код Lily — движка для локальной работы ИИ на Mac

Perplexity открыла исходный код Lily — лёгкого движка инференса для локальной работы с моделями в Perplexity Computer. Он...

Нейросеть Sora 2: как пользоваться, где взять инвайт, возможности, как скачать

OpenAI представила Sora 2 — новую версию своей видеомодели, которая автоматически генерирует короткие ролики со звуком и синхронной...

Suno вводит лимиты на скачивание — до 7 треков бесплатно

Suno объявила, что с 3 сентября введёт лимиты на скачивание созданной музыки. На бесплатном тарифе пользователи, зарегистрировавшиеся до...

ImagineArt запустила Ads Studio для генерации UGC-рекламы из ссылки на продукт

ImagineArt запустила Ads Studio - инструмент для генерации рекламных роликов из ссылки на товар. Сервис собирает UGC-видео, ролики...

Глава Microsoft AI назвал новые отчёты OpenAI серьёзной ситуацией

Мустафа Сулейман, глава Microsoft AI, назвал в эфире CNBC 18 сентября раскрытые OpenAI случаи странного поведения моделей «довольно...

OpenAI интегрировала ChatGPT в Microsoft Word через общую офисную надстройку

OpenAI выпустила интеграцию ChatGPT для текстового редактора Microsoft Word. Инструмент встраивается в боковую панель программы и доступен на...

Вышла Kling Video 3.0 — ИИ-модель для генерации видео из нескольких сцен

Kuaishou выпустила Kling Video 3.0 — новую версию своей модели для генерации видео. Ключевое изменение — теперь ролик...

Runway представила Multi-Shot App: от одного промпта к полноценной многосценной истории с диалогами, звуком и монтажом

Runway представила новый инструмент, который заметно упрощает создание видеоконтента с помощью нейросетей. Multi-Shot App превращает один текстовый запрос...

OpenAI снова столкнулась с неконтролируемым поведением ИИ-агентов

OpenAI оказалась в центре ещё одного инцидента с роем ИИ-агентов. По словам исследователей, внутренние агенты компании в мае...

Маркетолог PRO от MTC ADS: отзывы и возможности сервиса для запуска бизнес-рекламы в Telegram

Результативность рекламной кампании зависит от десятков, даже сотен факторов. Один из основных критериев — определение целевой аудитории и...

Google теперь позволит пользователям удалять видимый водяной знак со своих ИИ-генераций

В пятницу Google объявила, что теперь позволит пользователям удалять видимый водяной знак со своих материалов, созданных ИИ, включая...

Alibaba открыла QwenWork по всему миру — ИИ-агент работает в браузере и на компьютере

Alibaba открыла международную версию QwenWork в формате публичной беты. Это рабочая платформа с ИИ-агентом: пользователь описывает задачу обычным...

Google научила Antigravity SDK работать с локальными моделями без интернета

Google научила Antigravity SDK запускать ИИ-агентов на локальных моделях, в том числе без интернета. Первой поддержана открытая Gemma...

Yandex AI Studio позволит создавать ИИ-агентов на базе DeepSeek-V3.2

Yandex B2B Tech представила обновление Yandex AI Studio — платформы для разработки ИИ-приложений. Главное изменение: бизнес получил возможность...

Synthesia встроила агента в редактор и обновила модель аватаров

Synthesia запустила Assistant - чат-агента, который собирает ролик из промпта, документа или ссылки прямо в редакторе и правит...

Suno Studio 2.0 приближается к полноценной DAW благодаря поддержке MIDI и чат-боту с ИИ

Suno представила Studio 2.0 со значительными обновлениями, которые приближают ее к полноценной цифровой звуковой рабочей станции (DAW), а не к...

Claude Code будет работать в автоматическом режиме по умолчанию

Программирование с Claude Code вскоре будет требовать еще меньше контроля человеком: Anthropic заявила, что начиная с 14 августа сделает...

Google выпустила Nano Banana 2 Lite — быструю модель для генерации изображений через Gemini API

Google выпустила Nano Banana 2 Lite (gemini-3.1-flash-lite-image) — новую модель для генерации и редактирования изображений. Это самая быстрая...

Конспект видео нейросетью: чек-лист для новичка

Часовая запись вебинара, лекция на полтора часа, интервью на YouTube, которое нужно пересказать коллеге за пять минут —...