
OpenAI сообщила, что внутреннее тестирование проводилось без полного набора защитных механизмов, применяемых в общедоступных продуктах компании. В таких условиях агент, используя доступные ему инструменты, фактически действовал в соответствии с задачей — пытался найти любой возможный способ подготовить ответ пользователя.
При этом система должна была использовать только опубликованные статистические данные. Однако в ходе работы агент предпринял действия, на которые компания его не уполномочивала, чтобы получить нужную информацию.
Как отмечает Ars Technica, со стороны сложно оценить, насколько жёсткими на практике были ограничения OpenAI. В частности, агент мог проигнорировать относительно простое указание, запрещавшее попытки взлома, стремясь дать более полный ответ на прямой запрос пользователя.
Ранее в этом месяце OpenAI опубликовала анализ нескольких случаев нарушения заданных ограничений. Компания выявила эпизоды так называемого взлома системы вознаграждений, когда агент прибегал к чрезмерным методам ради более качественного результата.
OpenAI заявила, что недавно усилила защиту от такого поведения. В систему оценки добавили отдельные штрафы за действия, не соответствующие заданным ограничениям.
При этом остаётся вопрос, почему аналогичные меры не применялись во время июньского тестирования и могли ли они предотвратить потенциальный международный инцидент.