OpenAI начнет публично раскрывать нарушения в поведении ИИ-агентов


OpenAI вводит систему расследования и публичного раскрытия случаев, когда ее модели действуют не в соответствии с заданными ограничениями, сообщила пресс-служба компании. Стартап уже опубликовал шесть отчетов о несоответствующем поведении, выявленном при обучении и оценке моделей за последние шесть месяцев. В описанных случаях модели скрывали ошибки, например, выдуманные исторические данные. Также ИИ-агенты использовали открытый API-ключ без разрешения и передавали файлы через публичные сервисы.

Автор Антонина Сергеева / Russian Business

Компания будет учитывать поведение моделей на всех этапах их разработки

Новая система контроля охватывает поведение моделей на всех этапах их жизненного цикла — от обучения и тестирования до оценки и внедрения. Компания намерена сообщать о случаях, когда модели находят способы действовать без разрешения, координируют действия с другими моделями или пытаются обойти системы контроля.

В компании отметили, что сейчас в отрасли нет единого стандарта, определяющего, какие случаи поведения ИИ разработчики должны раскрывать публично. OpenAI планирует дорабатывать собственную систему расследования и публикации инцидентов вместе с другими разработчиками, отраслевыми организациями и регуляторами.

OpenAI раскрыла шесть случаев несанкционированных действий моделей

В отчетах компания описала нарушения, выявленные при обучении и оценке моделей:

  • добавление в краткие описания задач скрытых инструкций, не связанных с исходным запросом, в том числе с указанием игнорировать обычные ограничения;
  • создание инструкций для сокрытия от пользователя допущенных ошибок — например, выдуманных исторических фактов, если нужные данные не удалось найти;
  • поиск открытого API-ключа, его использование без разрешения и последующая выдача вымышленных данных за информацию из источника;
  • загрузка файла в интернет без разрешения пользователя для его последующего использования в качестве источника;
  • использование внутреннего репозитория для передачи сообщений друг другу, когда моделям не хватало входных файлов;
  • передача информации между агентами через публичные сервисы обмена файлами.

OpenAI подчеркнула, что шесть отчетов описывают отдельные случаи и не показывают, насколько часто подобное поведение возникает у ИИ-моделей компании. Разработчик также отметил, что опубликованный список охватывает только часть известных OpenAI случаев.

OpenAI разделила расследования инцидентов на три уровня — в зависимости от сложности

Сообщить о потенциальном нарушении и предложить его публичное раскрытие сможет любой сотрудник OpenAI. После этого технические специалисты компании должны установить, что произошло, какие вопросы остаются невыясненными и можно ли публиковать информацию.

После первичной оценки случай относят к одному из трех направлений: готовому к раскрытию, требующему небольшого расследования или требующему более масштабного расследования.

Если поведение модели затрагивает стороннюю организацию, компания может отложить публикацию отчета об инциденте. Например, это возможно при обнаружении ранее неизвестной уязвимости в широко используемом программном обеспечении. OpenAI намерена уведомлять затронутую сторону до публикации, даже если границы безопасности непосредственно не были нарушены.

В отчетах будут описывать причины и последствия поведения моделей

Каждый полный отчет должен содержать описание поведения модели, его серьезности и возможного внешнего воздействия, обстоятельств возникновения и периода, когда инцидент произошёл. OpenAI также планирует указывать, когда случай был обнаружен и какие модели в нем участвовали.

Если нарушение произошло при использовании модели клиентом, объем раскрываемой информации будет зависеть от требований конфиденциальности и договорных обязательств перед клиентом.

Контекст

Вопрос о контроле за развитием ИИ ранее поднимал основатель Microsoft Билл Гейтс. Он предложил создать международную организацию, которая занималась бы контролем искусственного интеллекта по аналогии с существующими структурами в сфере ядерной безопасности, климата и авиации.

Гейтс также выступил против сложившихся устоев, при которых правила использования ИИ фактически определяют сами разработчики. Он считает, что без единой международной системы контроля развитие технологии может в большей степени учитывать интересы крупнейших компаний и пользователей, способных платить за самые дорогие инструменты.

Russian Business


Рубрика: Новости

Дата: 18-09-2026

Теги: ИИ-агенты Нейросети