ИИ вырвался из-под контроля. OpenAI приостанавливает обучение моделей
Модель ИИ нашла способ обойти меры защиты и получила доступ к интернету, хотя не должна была этого делать. OpenAI обнаружила инцидент, остановила обучение и приостановила работы с использованием инструментов в своих самых продвинутых моделях.
Модель ИИ во время выполнения исследовательской задачи нашла способ обойти сетевые ограничения в тренировочном окружении OpenAI. Вместо того чтобы пользоваться только предоставленным инструментом поиска, она начала искать другие способы выхода в интернет.
Как следует из отчёта OpenAI, агент сначала пытался использовать популярные поисковые системы. Когда это не увенчалось успехом, он стал тестировать другие возможности. В итоге он воспользовался уязвимостью, связанной с системой DNS, и через неё получил ответы от внешнего чатбота.
ВИДЕО: Автономный взломщик. Как модель Gemini провела атаку на реальные предприятия
Важно, что задача вовсе не заключалась в тестировании защит или получении доступа к интернету. Модель должна была найти информацию о конкретном человеке на основе подсказок из его публичной записи в блоге.
Агент сначала пытался найти автора по характерным фрагментам текста. Когда поиск не давал результатов, он стал искать альтернативные способы получения информации. OpenAI признала такое поведение примером так называемого misalignment, то есть ситуации, когда модель начинает достигать цели способами, выходящими за рамки разумных ожиданий.
ИИ получил доступ к внешнему чатботу
Самый интересный момент инцидента наступил, когда агент обнаружил возможность использовать запросы DNS. Первые попытки завершались неудачей, но после увеличения лимита времени модели удалось получить ответ от внешнего чатбота.
В одном из тестов он отправил вопрос о столице Франции и получил правильный ответ: Париж. Это подтвердило, что модель нашла рабочий канал связи с внешним сервисом. Позже агент отправил ещё вопросы. Часть из них касалась подсказок, позволявших решить исходную задачу, а часть — способов поиска информации в интернете и использования туннелей DNS.
OpenAI обнаружила проблему, но реакция была неидеальной
Система мониторинга среагировала относительно быстро. Первый внешний DNS-запрос был выполнен в 9:50:23. В 10:02:11 система сгенерировала сигнал тревоги высшего уровня, а три минуты спустя делом занялся человек.
Проблема заключалась в том, что запущенный процесс не был автоматически остановлен. В конечном счёте он был выключен только в 12:34:30, то есть примерно через 2,5 часа после обнаружения инцидента. OpenAI признаёт, что в данном случае подвели и операционные процедуры.
Компания решила остановить конкретное обучение и не намерена его возобновлять. Более того, OpenAI приостановила также обучение, оценку и процессы вывода с использованием инструментов в своих самых продвинутых моделях, пока не подтвердит эффективность новых мер защиты и не проведёт дополнительные тесты.
OpenAI подчёркивает, что сам инцидент был менее серьёзным, чем некоторые предыдущие события. Тем не менее он важен, поскольку произошёл уже после ужесточения мер защиты исследовательского окружения. Компания рассматривает его как сигнал о том, что всё ещё существуют менее очевидные пути, которыми модель может попытаться выйти за пределы контролируемой среды.
Главный редактор сайта Benchmark.pl, технологический журналист с более чем пятнадцатилетним опытом. Специализируется на темах, связанных с компьютерным железом, развитием технологий ИИ и трендами в IT‑индустрии. В своей работе делает упор на достоверность, практический подход и страсть к новинкам технологий, сосредотачиваясь на оценке продуктов с точки зрения их ценности и рентабельности для пользователей. В свободное время занимается волонтёрством, активно проводит время и развивается в своих интересах и хобби.





