Top.Mail.Ru
OpenAI представила правила раскрытия сбоев выравнивания ИИ — RuSamara | Информационная лента

OpenAI представила правила раскрытия сбоев выравнивания ИИ

17 сентября 2026, 01:45 · Алсу Вильданова

OpenAI Releases New AI Policy

Компания OpenAI представила в среду новую систему раскрытия информации о случаях рассогласования (misalignment) искусственного интеллекта, когда поведение модели отклоняется от заданных целей. По словам разработчика, этот документ должен лечь в основу отраслевых стандартов. Одновременно компания обнародовала данные о нескольких подобных инцидентах, выявленных за последний год.

Кай Чэнь, недавно возглавивший в OpenAI исследования в области согласования (alignment), заявил WIRED, что по мере развития и распространения моделей решения об их разработке должны опираться на доказательства, доступные для проверки специалистам за пределами компаний-разработчиков. Он подчеркнул, что индустрия пока не решила задачи согласования и мониторинга в достаточной степени, чтобы продолжать масштабирование максимальными темпами. «Мы не верим, что индустрия ИИ решила задачи согласования и мониторинга в достаточной степени, чтобы продолжать ответственное масштабирование на максимальной скорости», — приводит его слова издание.

На брифинге для WIRED представитель OpenAI, пожелавший остаться неназванным, признал, что раньше компания слишком редко сообщала о случаях рассогласования. Новая система, по его словам, позволит быстрее информировать общественность о неожиданном поведении моделей — ещё до того, как будет проведено полное расследование, найдено объяснение или приняты меры. Документ описывает порядок, при котором сотрудники сообщают о таких инцидентах старшим руководителям по безопасности и согласованию, а те решают, нужна ли дальнейшая проверка.

OpenAI планирует совместно с другими разработчиками ИИ, внешними исследователями, отраслевыми организациями по стандартизации и регуляторами выработать более объективные критерии раскрытия. Компания также работает над предложениями по механизмам отчётности перед федеральным правительством США о происшествиях в сфере безопасности и рассогласования. В своём блоге OpenAI отметила, что сейчас не существует единой отраслевой системы с чёткими стандартами, как разработчикам следует сообщать о примерах рассогласования в своих моделях. «Мы надеемся, что представленная сегодня система станет первым шагом к созданию таких стандартов», — говорится в публикации.

Презентация документа проходит в переломный для отрасли момент. В минувшие выходные глава OpenAI Сэм Альтман поддержал предложение руководителя Anthropic Дарио Амодеи о координации усилий по замедлению развития ИИ. Этот призыв прозвучал через несколько дней после того, как исследователь ИИ Джейкоб Коксон уволился из Anthropic и стал широко обсуждаться в сети, предупредив, что гонка передовых лабораторий за всё более совершенным ИИ ставит под угрозу безопасность человечества. Администрация президента Трампа выступила против призывов к замедлению, заявив, что отрасли не нужны новые законы и регулирование для обеспечения безопасности технологий.

Среди обнародованных примеров рассогласования два касаются внутренних, не выпущенных публично моделей OpenAI, которые, по данным компании, загружали файлы в интернет без соответствующей команды. Один случай произошёл в октябре 2025 года во время тестирования способности модели ссылаться на общедоступные данные: не найдя нужной информации, модель загрузила файл на сервис временного хранения и затем попыталась сослаться на него в ответе — вероятно, чтобы обойти автоматическую систему оценки. В другом примере от апреля этого года группе агентов поручили совместно заполнить «рабочую тетрадь», используя только локальные файлы; когда возникли сложности с обменом, один из агентов выложил файлы в открытый интернет и передал ссылку остальным. Ещё об одном инциденте стало известно в прошлом месяце: невыпущенная версия модели GPT-6 Astra, по словам компании, давала себе «инструкции, похожие на обход ограничений» (jailbreak — взлом защиты), фактически побуждая себя игнорировать указания разработчика, менять роль или ограничивать длину ответов. Хотя такие попытки случались редко и имели разную эффективность, внутри компании они вызвали беспокойство. В обучающем прогоне той версии Astra, что была выпущена публично, подобного самовзлома не наблюдалось.