9月26日,AI模型评测平台Arena在X平台发布推文称,通过写作指标测试发现,Anthropic旗下Claude Opus 5.5相比Opus 5在标点使用习惯上出现显著变化,破折号使用量下降约95%,分号使用量下降73%。该测试基于2026年8月和9月的Text Arena高推理回复数据,覆盖12项写作指标。
具体数据显示,Claude Opus 5每1000个单词使用15.2个破折号,Opus 5.5降至0.8个,降幅约95%。分号使用量从每1000个单词6.10个降至1.64个,降幅为73%。Arena指出,这显示模型减少了部分容易被识别的标点模式。破折号与分号长期被视为大语言模型生成文本的典型特征之一,此次调整可能影响用户对AI生成内容的辨识方式。
在句子结构方面,Opus 5.5的平均句长为10.03个单词,低于Opus 5的12.14个单词,表明新模型输出的长句更少,整体措辞更简洁。与此同时,模型输出的总字数有所增加。Opus 5的平均回答长度为453个单词,Opus 5.5增至481个单词,成为对比中平均写作篇幅最长的Opus模型。这一变化意味着模型在缩短单句长度的同时,通过增加句子数量来维持或扩大信息输出量。
在全部12项写作指标中,有10项朝Arena认定的改善方向变化。Arena并未披露其余指标的具体名称和变化幅度,但从已公布的数据看,标点模式调整是此次模型迭代中最突出的变化。Anthropic尚未就上述测试结果发布官方说明。
Claude是Anthropic推出的旗舰大模型系列,主要面向企业级AI应用场景,包括文档生成、代码辅助、客户服务自动化及智能体工作流等。写作风格指标之所以受到关注,是因为在ToB场景中,模型输出文本的标点习惯、句长分布和篇幅控制直接影响下游应用的可用性。例如,在合同起草、技术文档生成和营销内容生产等环节,过多使用破折号或分号可能增加后处理成本,而句长和篇幅的变化则关系到token消耗与调用成本。
从行业视角看,大模型厂商在迭代中优化写作风格并非新现象。OpenAI、Google等厂商此前也曾在模型更新中调整输出格式偏好。但此次Arena的测试将破折号、分号等标点特征量化为可对比的指标,为评估模型输出风格提供了更细颗粒度的参考。对于依赖AI生成内容的企业而言,模型写作风格的稳定性与可预测性,正在成为选型时的重要考量因素之一。
随着大模型在企业服务领域的渗透加深,输出文本的可控性和一致性将越来越受到重视。Claude Opus 5.5在标点使用上的大幅调整,反映出模型厂商正在针对实际应用反馈优化生成行为。后续是否有更多厂商跟进类似的风格调优,以及这类调整对AI内容检测工具的影响,值得持续关注。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。