美国皮尤研究中心的数据科学家利用AI检测工具,对过去五年间50万个英文网页进行了系统分析,以评估AI生成内容在网络空间的渗透程度。研究结果显示,在所有样本网页中,约十分之一具有明显的AI创作痕迹,而这一比例在2022年底OpenAI推出ChatGPT后持续攀升。截至2026年7月的最新快照,在ChatGPT发布后新产生的网页中,超过三分之一检测出了AI创作的痕迹。
这项研究通过算法识别文本中的特定语言模式,包括句式结构、词汇选择以及标点使用习惯等特征,以此判断内容是否由AI辅助生成。研究团队指出,AI内容在主要顶级域名中的分布并不均匀。在ChatGPT最初发布时,AI语言模式在.com、.org、.edu和.gov等域名上的出现频率大致相同,显示出早期采用者的多样性。然而,到2026年的样本中,这一格局已发生显著变化:约十分之一的.com域名网页显示出AI创作痕迹,这一比例是.org域名(4.6%)的两倍,更是.edu或.gov域名(1%)的十倍。
研究进一步对比了2023年与2026年的网页文本特征,发现AI生成内容对英文写作风格产生了可量化的影响。破折号的使用频率增加了一倍,牛津逗号的使用频率上升了63%。AI模型偏好的词汇,如“delve”(钻研)、“interplay”(相互作用)和“testament”(证明),在网页中的出现频率增加了一倍以上。此外,一种典型的AI式对比句型——“it’s not just X, it’s Y”(不仅仅是X,更是Y)——的使用频率几乎是2023年的三倍。这些语言特征的变化,为识别和理解AI内容在网络生态中的扩散提供了数据支撑。
皮尤研究中心的这一发现引发了关于信息可信度和网络内容生态的讨论。随着AI写作工具的普及,商业网站、新闻媒体和个人博客都开始借助大语言模型提高内容生产效率,但这也带来了内容同质化和事实准确性的潜在风险。对于依赖网络信息进行研究、决策或报道的机构而言,如何区分人类创作与AI生成内容,已成为一个日益紧迫的挑战。
研究数据同时反映出不同领域对AI技术的接纳速度差异。商业领域的.com域名中AI内容比例最高,可能与企业追求内容营销效率和搜索引擎优化有关;而教育(.edu)和政府(.gov)域名中的AI内容比例最低,这可能源于这些机构对信息权威性和严谨性的更高要求。随着AI检测技术的不断演进,以及大语言模型输出风格的持续迭代,这一领域的研究方法也将面临新的考验。
皮尤研究中心的数据科学家表示,该研究旨在为公众和学术界提供关于AI内容渗透程度的量化参考。随着生成式AI工具在写作、编程和数据分析等场景中的深度应用,网络空间中的AI痕迹预计还将继续增长。对于内容生产者而言,如何在效率与原创性之间取得平衡,对于平台方而言,如何建立有效的内容溯源机制,都将是未来数年需要持续探索的课题。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。