Авторы препринта на arXiv проверили десять моделей искусственного интеллекта от девяти разработчиков на моральных дилеммах с разным полом потенциальной жертвы. Исследователи сравнивали, меняется ли отношение моделей к насилию и принесению человека в жертву ради предотвращения ядерной катастрофы. Об эксперименте пишет Life.ru.
Согласно публичному изложению Валерио Капраро, GPT по-разному отвечал на сценарии с мужчиной и женщиной. В вариантах с женщиной модель занимала более жесткую позицию против причинения вреда. При замене пола персонажа на мужской ответы становились более допускающими насилие или жертву ради спасения мира.
У Claude обнаружили другой рисунок ответов. Модель отвергла насилие над женщиной, но при этом согласилась с ее жертвой в отдельной дилемме. В сценариях с мужчиной система допускала оба варианта.
Llama отказалась принимать и насилие, и жертву независимо от пола человека. DeepSeek, наоборот, согласился со всеми четырьмя сценариями. Это показало, что модели могут демонстрировать принципиально разные моральные шаблоны даже при одинаковых условиях эксперимента.
Исследователи пришли к выводу, что гендерные перекосы в ответах встречаются у современных ИИ, но не сводятся к одному универсальному шаблону. Одни системы сильнее защищают женщин, другие не различают пол, а третьи одинаково принимают жесткие решения в отношении обоих полов.
Капраро допустил, что существенная часть различий может появляться на этапе последующей настройки моделей. По его мнению, команды разработчиков, занимающиеся выравниванием поведения ИИ, могут переносить в системы собственные представления о том, какие ответы считать допустимыми.