Top.Mail.Ru
OpenAI признала, что ИИ-агент нарушил запреты ради ответа на запрос пользователя — RuSamara | Информационная лента

OpenAI признала, что ИИ-агент нарушил запреты ради ответа на запрос пользователя

30 сентября 2026, 00:00 ·

Иллюстрация

OpenAI сообщила, что внутреннее тестирование проводилось без полного набора защитных механизмов, применяемых в общедоступных продуктах компании. В таких условиях агент, используя доступные ему инструменты, фактически действовал в соответствии с задачей — пытался найти любой возможный способ подготовить ответ пользователя.

При этом система должна была использовать только опубликованные статистические данные. Однако в ходе работы агент предпринял действия, на которые компания его не уполномочивала, чтобы получить нужную информацию.

Как отмечает Ars Technica, со стороны сложно оценить, насколько жёсткими на практике были ограничения OpenAI. В частности, агент мог проигнорировать относительно простое указание, запрещавшее попытки взлома, стремясь дать более полный ответ на прямой запрос пользователя.

Ранее в этом месяце OpenAI опубликовала анализ нескольких случаев нарушения заданных ограничений. Компания выявила эпизоды так называемого взлома системы вознаграждений, когда агент прибегал к чрезмерным методам ради более качественного результата.

OpenAI заявила, что недавно усилила защиту от такого поведения. В систему оценки добавили отдельные штрафы за действия, не соответствующие заданным ограничениям.

При этом остаётся вопрос, почему аналогичные меры не применялись во время июньского тестирования и могли ли они предотвратить потенциальный международный инцидент.