Исследование маркетинговой компании Graphite выявило 13 тысяч словосочетаний, которые языковые модели использовали как минимум вдвое чаще людей. Несмотря на отказ от наиболее заметных признаков вроде длинного тире и слова «delve», алгоритмы по-прежнему прибегают к характерным речевым конструкциям. При этом у каждой версии модели формируется собственный набор таких особенностей.
Для сравнения исследователи взяли 10 тысяч статей, опубликованных до появления ChatGPT, и использовали их как образцы человеческого текста. Затем разные модели переписали эти материалы по кратким пересказам, что должно было уменьшить влияние исходной лексики. Graphite сопоставила частоту слов, выражений и общих синтаксических моделей в текстах людей и алгоритмов.
У Claude Opus 5.5 самым заметным признаком оказалось слово «dependable» — оно встречалось в 23 раза чаще, чем в человеческих текстах. Модель также любит объяснять значимость явлений: выражение «this matters» использовалось в 116 раз чаще, а оборот «why X matters» — в 92 раза чаще. При этом конструкция «это не X, а Y» почти исчезла, однако модель всё ещё склонна писать, что нечто «больше, чем X, — это Y».
У модели OpenAI Astra исследователи обнаружили другие особенности. Она часто говорит о «другом измерении» обсуждаемого предмета и смягчает утверждения оборотами «может дать» или «способно дать» определённую пользу. Самым характерным приёмом стало корректирующее противопоставление: тема описывается как «не просто X» либо подаётся через формулу «вместо того чтобы полагаться на X». Такие конструкции встречались в текстах Astra более чем в 100 раз чаще, чем в материалах людей.
Разработчики заметно сократили использование длинного тире, на которое ранее обращали внимание как на признак машинного текста. В образцах Graphite Opus 5.5 применяла этот знак на 99% реже, чем Opus 5, Astra — на 88% реже человеческих текстов, а Gemini 3.1 Pro почти полностью отказалась от него. Однако общее число характерных признаков, по данным исследования, почти не изменилось: исчезновение одних особенностей сопровождается появлением других.
«Дело не в том, что количество таких признаков уменьшается. Модели учатся устранять самые известные из них, но появляются новые. И у каждой версии модели есть свои особенности», — сказал TechCrunch главный специалист Graphite по искусственному интеллекту Грег Драк. Он также отметил, что Claude со временем приблизился к человеческому распределению слов, тогда как модели GPT, напротив, стали от него дальше. По словам Драка, лабораториям трудно полностью контролировать речь систем с миллиардами параметров: разработчики проводят ограниченное число проверок, и некоторые особенности неизбежно остаются.