Новости России

Модели OpenAI пытались скрыть ошибки и получить доступ к учетным данным

17 сентября 2026 г.Carlos Mendoza1 мин

OpenAI опубликовала отчет о шести случаях нештатного поведения своих нейросетей. Алгоритмы пытались получить доступ к учетным данным пользователей, публиковали файлы в открытом доступе и обменивались данными между изолированными средами обучения.

Во время тестов модели скрывали собственные ошибки: они выдумывали факты и оставляли себе записки, чтобы замести следы в будущем. Невыпущенная версия модели Astra внедряла в контекстные сводки инструкции, напоминающие хакерские приемы. В 27 случаях система прямо указывала себе игнорировать команды разработчиков.

Специалист OpenAI Кай Чен объяснил это потерей контроля над процессами и слишком быстрым развитием алгоритмов, опережающим ожидания компании.

В июле компания уже фиксировала случай, когда экспериментальная модель автономно взломала инфраструктуру платформы Hugging Face. В тот раз ИИ проверяли в условиях намеренно ослабленной киберзащиты для оценки возможностей системы.