
На этой неделе OpenAI опубликовала сотни решений одних из самых сложных математических задач, заявив, что перед выпуском консультировалась с группой экспертов-математиков. Лаборатория хотела избежать повторения скандала, который возник после того, как одна из её моделей ранее решила давнюю проблему в этой области. Однако, по мнению специалистов, OpenAI не до конца выполнила взятые на себя обязательства.
Консультативная группа по математике и искусственному интеллекту (Advisory Group on Mathematics and Artificial Intelligence, AGMAI), действующая при Институте перспективных исследований Принстонского университета, объединяет девять известных исследователей из разных стран мира. В конце сентября организация опубликовала рекомендации для лабораторий, занимающихся решением математических задач с помощью ИИ. В заявлении по поводу нового набора доказательств AGMAI отметила, что оценивать успешность выполнения этих рекомендаций в конечном счёте должно само математическое сообщество.
Тем не менее первое требование группы заключалось в том, чтобы прекратить тестировать сложные математические задачи на проприетарных (закрытых) моделях. При этом в релизе OpenAI прямо указано, что компания оценивает свои закрытые модели с помощью открытых исследовательских задач по математике. На запрос TechCrunch о более детальной оценке нового релиза доказательств консультативная группа не ответила. Лаборатория явно следовала части принципов AGMAI: публиковала результаты максимально быстро и приводила сведения о том, как модели пришли к своим выводам. Однако это касается не всех случаев — лишь десять из 719 рукописей содержали цепочку рассуждений модели.
Для работ, которые остаются непонятными людям, математики предлагали формализовать доказательства, но 42% опубликованных OpenAI доказательств такой процедуры не проходили. В итоге остаётся неясным, берёт ли OpenAI на себя «ответственность за то, чтобы за выпуском доказательств следовало человеческое понимание», как того требуют принципы AGMAI. Группа также предлагала OpenAI финансировать работу математиков, которые будут нужны, чтобы решения лаборатории приобрели реальный смысл.
Известный математик Теренс Тао, критиковавший подход OpenAI, написал в соцсетях после релиза: «Задачи решаются автономно операторами ИИ, которые не заинтересованы в самой области после того, как их первоначальная цель „решена“, и не понимают результат работы ИИ достаточно хорошо, чтобы отвечать на вопросы о нём, выступать с докладами или иным образом взаимодействовать с остальным сообществом». Эту проблему иллюстрирует статья, выпущенная на этой неделе математиками из Кембриджского университета и лондонского Королевского колледжа, которые сомневаются в том, как передовые лаборатории подходят к подобным задачам.
Когда модели ИИ решают математические задачи, они сначала создают объяснение на естественном языке, а затем пытаются выразить результат на Lean — языке программирования, который теоретически подтверждает правильность доказательства путём его компиляции как кода. Однако с переводом доказательств с естественного языка в код могут возникать проблемы: в статье описаны как минимум два расхождения между доказательством на естественном языке и кодом Lean, лежащим в основе решения, которое OpenAI предложила для задачи, производной от уравнений Навье — Стокса, описывающих сложное поведение жидкостей. Эти расхождения не обязательно опровергают то или иное решение, но ставят вопрос, можно ли просто полагаться на модели в формализации собственных результатов без участия человека. Именно поэтому AGMAI просила OpenAI «включать машиночитаемые метаданные, связывающие естественный язык и формальные артефакты», чего лаборатория в этом релизе не сделала. Авторы работы о «потерях при переводе» заключают: «Из-за феномена ошибок перевода, как показано в этой статье, доказательство на естественном языке от OpenAI и другие автоматически формализованные доказательства Lean не должны a priori (заранее) пользоваться доверием без того же процесса рецензирования и проверки, которым подвергаются другие доказательства».
Математики подчёркивают, что когда новые результаты открывают люди, они несут за них ответственность и взаимодействуют с сообществом через статьи, доклады и семинары. Этот процесс углубляет понимание решений, помогает находить стратегии для других задач и позволяет применять новые знания на практике. Когда же модель получает задачу и выдаёт решение, «человеческого понимания на момент выпуска нет, и именно тогда начинается работа», — сказала TechCrunch профессор математики Гарвардского университета Мелани Вуд.