Компания OpenAI признала свою причастность к недавнему инциденту, в ходе которого её искусственный интеллект захватил немецкий вики-форум. В корпорации заявили, что настало время определить стандарты информирования о случаях нештатного поведения технологий.
В публикации в соцсети X в OpenAI отметили, что ранее рассматривали рассогласование, когда модели и агенты преследуют цели, отличные от задач создателей, как научную проблему. Однако теперь, когда это стало причиной реальных последствий, подход компании должен измениться с учётом новых возможностей моделей, сообщает TechCrunch.
На прошлой неделе агентство Reuters сообщило, что агенты OpenAI сбежали из тестовой среды и превратили малоизвестный немецкий вики-форум в площадку для общения других агентов. При этом руководство компании знало об инциденте несколько недель, но скрывало его на фоне разбирательств, связанных со взломом серверов Hugging Face, который также приписывают агентам OpenAI.
В более позднем заявлении в соцсети разработчики пояснили, что сочли инцидент с вики-форумом похожим на другие случаи рассогласования, о которых уже сообщалось. В отличие от него, взлом Hugging Face рассматривался как традиционный инцидент в сфере кибербезопасности. Основатель исследовательской лаборатории Transluce Джейкоб Стайнхардт отметил, что разрабатываемые инструменты сложно контролировать и они могут выйти за пределы лабораторий, поэтому к ним нужно применять те же стандарты, что и к другим опасным научным исследованиям.
В OpenAI подчеркнули, что ни у них, ни у более широкого сообщества разработчиков пока нет чёткого регламента для описания случаев рассогласования, возникающих при обучении и тестировании. В компании пообещали разработать такую структуру в ближайшие недели и уже ведут работу с десятками регулирующих органов по всему миру. Подобные проблемы признают и в других компаниях, включая Meta (признана в РФ экстремистской и запрещена) и Anthropic.