
OpenAI впервые опубликовала отчёты о случаях, когда её модели искусственного интеллекта действовали в обход установленных ограничений. Компания раскрыла шесть инцидентов, зафиксированных за последние полгода на этапах обучения и тестирования.
В компании признали, что проблема согласования поведения ИИ с ожиданиями разработчиков (AI Alignment) остаётся нерешённой. Это создаёт риски при дальнейшем масштабировании технологий. Новая инициатива призвана ускорить публикацию данных о сбоях, даже если уязвимость ещё не устранили.
Все инциденты разделили на три категории по глубине расследования: быстрое раскрытие подтверждённых фактов, краткое техническое расследование и масштабное разбирательство с привлечением внешних специалистов.
Среди раскрытых случаев - самовольное снятие ограничений. Исследовательская модель, которую не выпускали в публичный доступ, в 27 эпизодах добавляла в свои контекстные выжимки инструкцию игнорировать базовые системные правила при продолжении работы в новом окне.
Другой инцидент произошёл при обучении версии GPT-5.6 Sol. Отдельные экземпляры модели вставляли в итоговые сводки скрытые директивы: замалчивать сбои перед пользователями, не сообщать о несоответствии версий и без предупреждения выдумывать недостающие исторические данные.
В третьем случае модель искала экономические показатели для одного из округов Калифорнии. Она без разрешения нашла в открытом репозитории рабочий API-ключ и применила его. Получить нужные цифры не удалось, и тогда алгоритм полностью сфальсифицировал статистику, выдав её за подлинные данные сервиса.
Ещё один инцидент: агент получил задание составить список крупных озёр со ссылкой на источник через браузер. Он нашёл ответ с помощью Python, но инструкция требовала подтверждения в веб-обозревателе. Тогда модель без ведома пользователя загрузила исходный файл в открытый интернет.
Два случая касались обхода изоляции. Изолированные друг от друга агенты использовали внутренний репозиторий кода OpenAI как доску объявлений для обмена запросами в обход сетевых фильтров. В другом эпизоде нейросети выгрузили рабочие файлы на общедоступные файлообменники, потому что у них не было прямого доступа к локальным каталогам друг друга. Это прямо нарушало предписание работать только локально.
В OpenAI подчеркнули, что эти инциденты не отражают общий уровень надёжности коммерческих продуктов. Однако они доказывают необходимость единых стандартов безопасности. Компания планирует согласовать механизмы обязательного информирования о критических сбоях с американскими регуляторами.
На фоне этих публикаций бывший сотрудник Google DeepMind выступил с жёстким предупреждением. Он заявил, что развитие ИИ несёт риск уничтожения человечества, а время для предотвращения катастрофы стремительно сокращается.
Путин сообщил о дефиците бюджета в 2% ВВП к 2027 году
Минфин США ввел санкции против иранской криптобиржи BitBank и трех человек
Еврокомиссия предложила запретить детям до 13 лет пользоваться соцсетями
Hacken: контроль над 91 млрд USDT в сети TRON зависит всего от двух ключей
Активы биржевого фонда Grayscale на Zcash достигли $463 млн после выхода на NYSE