一项针对大语言模型写作特征的分析显示,Anthropic旗下的Opus 5.5在生成文本时存在明显的用词偏好,其中「dependable」一词的出现频率比人类写作样本高出23倍,成为该模型最显著的文本标识之一。
除「dependable」之外,该模型还频繁使用「this matters」等表达方式。这类措辞在人类写作中并不常见,但在AI生成内容中反复出现,构成了可被识别的统计特征。研究人员通过对模型输出文本与人类样本进行对比分析,量化了这些用词差异。
此类发现对AI内容检测具有重要意义。随着大语言模型在企业服务场景中的广泛应用,包括自动生成营销文案、客户沟通邮件、技术文档以及代码注释等,AI生成文本与人类撰写文本之间的边界日益模糊。识别模型的用词偏好,为判断内容来源提供了一种基于统计特征的参考路径。
从企业服务角度看,AI写作特征的暴露可能带来两方面影响。一方面,内容平台和学术机构可利用这些特征开发更精准的AI内容识别工具;另一方面,模型开发方也可能针对性地调整训练策略,降低特定词汇的过度使用,使生成文本更接近人类写作习惯。这种「检测与反检测」的博弈,正在成为AI文本治理领域的一个持续议题。
目前,该分析聚焦于Opus 5.5单一模型的表现,尚未覆盖其他主流大语言模型。不同模型是否具有各自独特的用词指纹,以及这些特征在不同语言、不同任务场景下是否稳定,仍有待进一步研究。对于依赖AI生成内容的企业而言,了解所用模型的文本特征,有助于在内容发布前进行必要的编辑和调整,避免因用词模式过于集中而影响内容质量或触发平台检测机制。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。