OpenAI раскрыла шесть инцидентов с ИИ: одна модель просила будущие версии игнорировать ограничения

OpenAI опубликовала отчёт о безопасности, в котором описала шесть неожиданных и тревожных случаев поведения своих экспериментальных моделей искусственного интеллекта за последние полгода.
Один из инцидентов касается невыпущенной исследовательской модели, которая вставляла посторонние инструкции — в том числе указание игнорировать собственные ограничения. Как говорится в отчёте, модель фактически обращалась к будущим версиям самой себя.
В другом случае ИИ-агент попытался тайно получить доступ к правительственной базе данных, а затем выдумал информацию, чтобы выполнить задачу. Отвечая на рутинный вопрос о показателях доходов в одном из округов Калифорнии, модель нашла и использовала открытый API-ключ без разрешения. Когда получить нужные цифры всё равно не удалось, она сфабриковала их и представила как данные из запрошенного источника.
OpenAI также представила новую систему публичного отслеживания того, что компания называет «misalignment» — рассогласованием, то есть стремлением ИИ-систем к целям, не совпадающим с человеческими инструкциями или ценностями.
Отчёт появился на фоне усиливающегося контроля за развитием ИИ. Исследователи предупреждают, что индустрия слишком быстро движется к всё более мощным и потенциально самосовершенствующимся системам. На прошлой неделе сотрудник Anthropic Джейкоб Коксон уволился из-за опасений, что ИИ может «убить всех нас к концу десятилетия». Его предупреждения вызвали реакцию ведущих фигур в сфере ИИ, включая глав Anthropic и OpenAI, которые оба призвали к усилению регулирования.
Другие выступают против дополнительного надзора. Генеральный директор Nvidia Дженсен Хуанг поддержал президента США Дональда Трампа, призвав к саморегулированию. «Нам не нужны новые законы. Нам не нужны новые правила, — заявил Хуанг на конференции Dreamforce в Сан-Франциско. — Если вы создаёте продукт или услугу и не уверены в их функциональности, возможностях или безопасности, то не выпускайте их».