В середине мая в Беркли, штат Калифорния, прошло закрытое мероприятие, на которое съехались тридцать ведущих математиков мира. Целью двухдневной встречи было соревнование с чат-ботом нового поколения, созданным для проверки его способностей к математическим рассуждениям. Ученые предлагали искусственному интеллекту задачи профессорского уровня, разработанные специально для того, чтобы поставить его в тупик. Однако по итогам эксперимента исследователи были ошеломлены, обнаружив, что нейросеть способна решать некоторые из самых сложных в мире математических проблем.
Чат-бот, который участвовал в испытаниях, работает на базе o4-mini — так называемой большой языковой модели от компании OpenAI, обученной делать сложные логические выводы. Как пишет издание Scientific American, для оценки прогресса этой модели некоммерческая организация Epoch AI подготовила 300 ранее не опубликованных математических вопросов. Предыдущие версии нейросетей справлялись менее чем с 2% таких задач, демонстрируя нехватку способности к рассуждениям. Модель o4-mini показала совершенно иные результаты, решив около 20% задач разного уровня сложности — от студенческого до исследовательского.
Чтобы найти самые трудные вопросы, Epoch AI организовала очную встречу 17 и 18 мая под руководством Кена Оно, математика из Университета Вирджинии. Участников разделили на группы, и они соревновались в создании задач, которые могли бы решить сами, но которые оказались бы не по силам искусственному интеллекту. За каждую проблему, с которой чат-бот не справился бы, автору полагалось вознаграждение в размере 7500 долларов. Участники подписывали соглашение о неразглашении и общались только через защищенный мессенджер, чтобы условия задач случайно не попали в обучающие данные нейросети.
Один из показательных случаев произошел, когда Кен Оно, разочарованный прогрессом команды, решил сам задать чат-боту вопрос. Он сформулировал открытую проблему из теории чисел уровня аспирантуры. В течение следующих десяти минут Оно в изумлении наблюдал, как бот в реальном времени разворачивал решение. Первые две минуты ИИ потратил на изучение соответствующей научной литературы, затем решил для тренировки упрощенную версию задачи и только после этого представил правильный и даже дерзкий ответ на исходный вопрос, добавив в конце: «Цитирование не требуется, потому что загадочное число было вычислено мной!».
Несмотря на то что математикам в итоге удалось найти 10 задач, которые поставили бота в тупик, они были поражены прогрессом искусственного интеллекта. Кен Оно сравнил работу с нейросетью с взаимодействием с «сильным коллегой», а другой участник, Ян Хуэй Хэ, отметил, что это уровень очень хорошего аспиранта, и даже выше. Бот также оказался значительно быстрее человека, решая за минуты то, на что у профессионала ушли бы недели или месяцы.
При этом ученые выразили обеспокоенность. Они опасаются, что результатам o4-mini могут доверять слишком сильно из-за его уверенной манеры изложения, которую назвали «доказательством путем запугивания». По итогам встречи математики начали обсуждать будущее своей профессии. Они предположили, что их роль может сместиться от решения задач к их постановке, где они будут направлять ИИ, подобно научному руководителю, работающему с аспирантом. Кен Оно подчеркнул, что уже сегодня эти языковые модели превосходят большинство лучших аспирантов в мире.