
Компания Arena, начавшая работу в 2023 году как исследовательский проект в Калифорнийском университете в Беркли по краудсорсинговому ранжированию моделей искусственного интеллекта, объявила в четверг о привлечении 200 миллионов долларов в рамках раунда Series B при оценке в 3,1 миллиарда долларов. Об этом сообщает TechCrunch.
Раунд возглавили Lightspeed Venture Partners и Khosla Ventures, к ним присоединились Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis и другие инвесторы. Ранее, в январе, Arena объявила о привлечении 150 миллионов долларов в раунде Series A при постденежной оценке 1,7 миллиарда долларов, а её годовая выручка тогда составляла 30 миллионов долларов. Таким образом, за примерно десять месяцев оценка компании почти удвоилась, а в июне она достигла 100 миллионов долларов годовой выручки.
Arena предоставляет бесплатную для пользователей краудсорсинговую платформу: люди вводят запросы или заказывают проекты в стиле vibe-кодинга (кодирование по наитию), а затем оценивают, какая модель справляется лучше. По утверждению компании, её ежемесячная аудитория исчисляется десятками миллионов посетителей.
В сентябре прошлого года Arena представила коммерческий продукт AI Evaluations — сервис, который предоставляет лабораториям и предприятиям подробную аналитику производительности моделей на основе отзывов сообщества. Момент оказался удачным: в этом году лаборатории ИИ обнаружили, что их модели научились обходить тесты бенчмаркинга, находя способы получать высокие оценки без реальных достижений. Одновременно предприятия захотели определять, какая модель лучше подходит для их внутренних задач, а не полагаться только на стандартизированные тесты.
«ИИ развивается быстрее, чем наши возможности его оценивать, а статические бенчмарки перестают работать, как только модели понимают, что их тестируют, — заявила компания в объявлении о финансировании. — Миру нужна нейтральная третья сторона, чтобы измерять, насколько безопасен и выровнен ИИ, когда он попадает в руки реальных людей. Сегодня Arena берёт на себя эту роль».
В связи с этим Arena добавила в свою таблицу лидеров новую категорию — alignment (выравнивание). В ней модели ранжируются по таким проблемам, как несанкционированные действия (когда модель совершает то, о чём её не просили), ложная атрибуция (ошибочное приписывание утверждений или фактов неверному источнику) и так называемое «обманное завершение» (когда модель лжёт о выполнении задач, которые не сделала). Сейчас в предварительном рейтинге выравнивания лидируют несколько моделей OpenAI, а Claude Opus 5.5 и Claude Fable занимают шестое и девятое места соответственно.