
Калифорнийский стартап PrismML, основанный группой исследователей из Калифорнийского технологического института, представил новую версию своей технологии сжатия больших языковых моделей. Компания исходит из того, что мощные модели, способные рассуждать, вовсе не обязаны быть громоздкими. Разработка позволяет уменьшить их настолько, чтобы они помещались на персональных компьютерах и смартфонах.
В четверг PrismML выпустил модель Bonsai 2 27B, которая сжимает открытую модель Qwen3.8 27B от Alibaba до 5,9 ГБ. Этого объёма достаточно для работы на ПК и, вероятно, на флагманских смартфонах. По сравнению с исходным вариантом потребление памяти сократилось примерно в 9–10 раз. Возглавляет стартап Бабак Хассиби, профессор Калифорнийского технологического института и специалист по технологиям сжатия; среди его советников — Ион Стойка, соучредитель Databricks и руководитель лаборатории Sky Computing Lab в Беркли.
Инвесторами PrismML выступили Khosla Ventures, Cerberus Capital и Калифорнийский технологический институт. Компания не единственная, кто занимается сжатием языковых моделей: аналогичные разработки ведёт, например, Multiverse Computing, основанная известным профессором из испанского Центра международной физики Доностии. Однако Хассиби утверждает, что технология PrismML уникальна: его модели практически не теряют в производительности по сравнению с оригиналами. Bonsai 2 показывает 98% от совокупных результатов Qwen в бенчмарках (стандартных тестах), тогда как первая версия Bonsai, вышедшая в марте, достигала 95%. Первую модель скачали более 11 миллионов раз, а ещё более компактные версии — ещё 2,6 миллиона раз.
Таким образом, результаты сжатия от релиза к релизу улучшаются. Достичь полного паритета в 100% по бенчмаркам вряд ли удастся: по словам Хассиби, сжатие, скорее всего, всегда будет оказывать некоторое влияние. Впрочем, идеальное совпадение по тестам — вопрос скорее теоретический. Языковые модели и в несжатом виде не отличаются абсолютной точностью, а бенчмарки не настолько точно отражают реальные задачи, чтобы потеря 2% заметно сказывалась на практике. К тому же на точность сильно влияет программное окружение, в котором работает модель.
Сжатие достигается за счёт уменьшения так называемых весов — информации, которую модель усваивает и хранит в ходе обучения. Обычно каждый вес требует 16 бит, а подход PrismML, названный «тернарным» (троичным), сводит его всего к трём значениям: +1, −1 или 0. Чем меньше значения для хранения, тем компактнее модель. Следующая цель стартапа — применить метод к ещё более крупным моделям. «Следующие модели, которые мы выпустим, надеюсь, в ближайшие пару месяцев, будут в диапазоне нескольких сотен миллиардов параметров, и я ожидаю, что там сохранить интеллект будет проще», — заявил Хассиби изданию TechCrunch. По его словам, чем крупнее модель, тем больше возможностей сжать её без потери качества, поэтому для больших моделей достичь 100% легче. Стойка в свою очередь отметил, что технология открывает путь к запуску продвинутых моделей прямо на устройствах пользователей: «Интеллект окажется у вас под рукой, и он будет бесплатным, потому что заработает на уже купленном вами устройстве. Он также будет приватным, поскольку не придётся отправлять данные в облако».