尽管早期 AI 写作中常见的“em-dash”(长破折号)和“delve”(深入探究)等词汇已逐渐减少,但研究人员发现,人工智能模型在生成文本时仍保留着大量独特的标志性习惯。

营销公司 Graphite 的一项最新研究揭示了前沿大语言模型的写作特征。虽然旧有的标点滥用现象有所改善,但模型依然依赖高对比度的句式结构,且不同版本的模型展现出各自鲜明的特点。值得注意的是,这种差异化的范围极为广泛:Graphite 识别出 13,000 个短语,这些短语在 AI 生成内容中的出现频率至少是人类内容的两倍。
Graphite 首席人工智能官格雷格·德鲁克(Greg Druker)向 TechCrunch 表示:“事实证明,Claude 模型实际上正随着时间推移越来越接近人类文字的分布规律。”相比之下,GPT 系列模型与人类写作的距离却在拉大。
为了大规模分析 AI 生成的文本,Graphite 设计了严谨的研究方案。团队首先建立了一个包含 10,000 篇文章的语料库,这些文章均发布于 ChatGPT 推出之前,作为人类生成内容的对照组。随后,研究人员让不同的 AI 模型根据摘要重写这些文章,旨在尽可能消除源文本偏差。通过将人类样本与各模型的样本进行匹配,他们能够比较特定词汇、短语在 AI 文本中的出现频率,以及句子构造方面的更广泛模式。
根据 Graphite 的数据,Claude Opus 5.5 最显著的标志是频繁使用“可靠”一词,其出现频率比人类样本高出 23 倍。虽然该版本避免了“它不是 X,而是 Y”这一句式,但仍倾向于使用“它不仅仅是 X,而是 Y”的表达。
此外,Opus 5.5 喜欢强调事情的重要性。数据显示,“这很重要”这一短语的使用频率比人类写作高出 116 倍,而“为什么 X 很重要”的频率也高出 92 倍。
OpenAI 的 Astra 模型则呈现出不同的特征。该模型喜欢描述事物的“另一个维度”,并倾向于通过声称某行动“可能会提供”或“可以提供”特定好处来对冲断言。Graphite 将其最大的特点定义为“纠正框架”,即把主题定义为“不仅仅是 X”或作为对 X 的替代方案提出,而非直接依赖 X。研究显示,这类构造在 Astra 生成的散文中比人类写作常见 100 倍。
值得关注的是,所有前沿实验室似乎都对模型过度使用 em-dash 的问题做出了回应。在 Graphite 的样本中,Opus 5.5 使用的 em-dash 数量比 Opus 5 减少了 99%。而 Gemini 3.1 Pro 则几乎完全从写作中移除了 em-dash。
Graphite 指出,总体上的非人类特征数量基本保持稳定。德鲁克解释道:“这并不是说这些信息正在减少。开发者们设法删除了最知名的说法,但其他特征随之出现。每个模型版本都有其独特的‘指纹’。”
鉴于各大实验室致力于打造类似人类的写作风格,这些特征为何如此持久令人惊讶。在发布 Opus 5.5 时,Anthropic 曾宣传该模型“比以前的模型更自然地沟通”,并称早期用户发现其写作“更清晰,更容易遵循”。同样,在发布 GPT-6 系列的 Sol 和 Luna 版本时,OpenAI 也提出了类似主张,称用户可以期待看到更多的清晰度、更少的术语以及更少的怪异句子。
然而,德鲁克怀疑实验室在完全消除隐性构造或短语方面能做多少工作。“我有一个一般的假设,实验室对这些事情的控制能力比你预期的要差,”德鲁克说,“它们是拥有数十亿参数的巨大模型。它们可以进行有限数量的测试,结果往往是错过了某些细节。”





