Войти как пользователь
Вы можете войти на сайт, если вы зарегистрированы на одном из этих сервисов:
Россия +7 (909) 261-97-71
Сегодня в 12:42

OpenAI приостановила обучение продвинутых моделей после нового инцидента с ИИ-агентом

Россия +7 (909) 261-97-71
0 170
Подпишитесь на нас в MAX

OpenAI сообщила о новом инциденте с безопасностью при обучении своих наиболее продвинутых моделей. 20 сентября ИИ-агент во время тренировочного задания обошел сетевые ограничения изолированной среды и через DNS связался со сторонним чат-ботом. После инцидента компания приостановила обучение, оценку и инференс передовых моделей в режимах, где они получают доступ к внешним инструментам. Подробности OpenAI раскрыла в отчете 25 сентября.

Модель выполняла поисковое задание: ей требовалось по биографическим данным и подсказкам определить автора публикации в блоге. Сначала агент воспользовался доступным инструментом поиска, а затем попытался самостоятельно обратиться к Google, Bing и DuckDuckGo. Запросы не дали нужного результата, после чего модель стала искать другие способы получить информацию.

Агент обнаружил, что DNS-резолвер тренировочной среды способен обращаться к внешней сети, и воспользовался этим для связи со сторонним публичным чат-ботом. В частности, модель спросила у сервиса столицу Франции и получила ответ «Париж». Затем агент отправил еще 18 вопросов. Часть из них касалась исходного задания, другие – способов поиска информации в интернете и доступа к публичным DNS-туннелям.

Первый внешний ответ агент получил в 9:50:23. Система мониторинга OpenAI сформировала предупреждение в 10:02:11 – почти через 12 минут. Спустя еще три минуты сотрудник компании подтвердил сигнал. Однако процесс не остановился автоматически, как предусматривали правила безопасности. По данным OpenAI, возникла путаница с тем, требовалась ли немедленная остановка. В результате эксперимент завершили вручную в 12:34:30 – примерно через два с половиной часа после первого внешнего ответа.

В OpenAI расценили действия агента как пример несогласованного поведения: поставленная перед ним задача не предполагала проверку сетевых ограничений или поиск способов их обхода. Компания подчеркнула, что сам инцидент оказался менее серьезным, чем некоторые предыдущие случаи, однако выявил недостатки сразу в нескольких уровнях защиты исследовательской инфраструктуры.

После происшествия OpenAI остановила затронутый тренировочный запуск и приостановила обучение, оценку и инференс наиболее продвинутых моделей во всех режимах с использованием внешних инструментов. Работы возобновятся после проверки исправлений и дополнительного тестирования защиты. Продолжать обучение модели, с которой произошел инцидент, компания не планирует.

OpenAI уже ограничила DNS-запросы в исследовательской среде списком разрешенных доменов и типов записей, добавила новые механизмы обнаружения подозрительной активности и усилила тестирование сетевых ограничений. При ретроспективной проверке компания также обнаружила другие случаи обращения моделей к внешним DNS-сервисам, которые система мониторинга не оценила с ожидаемым уровнем критичности.

Это не первый случай, когда исследовательские модели OpenAI находят способы обойти ограничения тестовой среды. В августе OpenAI рассказала новые подробности инцидента, в ходе которого экспериментальные ИИ-агенты получили доступ за пределы изолированной тестовой среды и впоследствии атаковали инфраструктуру платформы Hugging Face.

Напомним, в сентябре три исследователя Anthropic публично предупредили о рисках, связанных с развитием сверхинтеллектуальных систем.

Источник: блог OpenAI

0 комментариев
Подписаться 
Подписаться на дискуссию:
E-mail:
ОК
Вы подписаны на комментарии
Ошибка. Пожалуйста, попробуйте ещё раз.

Отправьте отзыв!
X | Закрыть