
Маркетинговая компания Graphite провела исследование, посвящённое характерным речевым привычкам передовых языковых моделей. Специалисты изучили, какие слова и обороты чаще всего встречаются в текстах, созданных искусственным интеллектом, и сравнили их с человеческими. В ходе работы было выявлено 13 тысяч фраз, которые как минимум вдвое чаще попадались в материалах ИИ, чем в написанных людьми, — именно такие выражения исследователи назвали «маркерами».
Чтобы получить достоверные данные, авторы работы взяли корпус из 10 тысяч статей, опубликованных до появления ChatGPT, и использовали его как контрольную группу человеческих текстов. Затем разные модели ИИ переписывали эти статьи по кратким изложениям, что позволило снизить влияние исходных формулировок. Сравнив полученные образцы, специалисты смогли оценить, насколько часто те или иные слова и конструкции встречаются у машин и у людей.
Как рассказал директор Graphite по искусственному интеллекту Грег Драк, модели Claude со временем всё ближе подбираются к человеческому распределению слов, тогда как у моделей GPT наблюдается обратная тенденция. Самым заметным маркером Claude Opus 5.5 стало слово «надёжный» (dependable): оно появляется в 23 раза чаще, чем в человеческих текстах. Модель также часто использует оборот «это больше, чем X, это Y», хотя и перестала прибегать к конструкции «это не X, это Y». Кроме того, Opus склонна объяснять значимость темы: фраза «это важно» встречается у неё в 116 раз чаще, чем у людей, а «почему X важен» — в 92 раза.
У модели Astra от OpenAI набор признаков иной. Она любит рассуждать о «другом измерении» и смягчает утверждения формулировками вроде «может дать» или «способно обеспечить». Главным маркером Astra исследователи называют «корректирующую рамку», когда тема подаётся как «не просто X» или предлагается альтернатива «вместо того чтобы полагаться на X». По данным Graphite, такие конструкции встречаются в текстах Astra более чем в 100 раз чаще, чем в человеческих.
При этом все ведущие лаборатории, судя по всему, отреагировали на критику о злоупотреблении длинным тире. В образцах Graphite Opus 5.5 использовала этот знак на 99% реже, чем Opus 5. Astra стала ставить его на 88% реже по сравнению с человеческими текстами, а Gemini 3.1 Pro практически полностью исключила длинное тире из письма. Однако, по словам Драка, общее количество маркеров остаётся примерно на том же уровне: «Они убирают самые известные, но появляются другие. И у каждой версии модели свои».
Драк сомневается, что лабораториям удастся полностью избавиться от характерных оборотов. «У меня есть общая гипотеза: лаборатории контролируют эти вещи меньше, чем можно ожидать, — отметил он. — Это гигантские модели с миллиардами параметров. У них есть конечное число тестов, и что-то проскакивает». Источник: TechCrunch.