微信方言活动小程序回应文本库异常:已完成清理并强调数据授权合规

算法基于日常语义和中文文库随机合成,但算法合成有时候很蠢,于是出现了少量不合常理甚至匪夷所思的字句。

8月26日,微信产品团队通过官方认证账号“微信小安”在小红书发布说明,针对近期上线的“微信方言活动”小程序中出现的异常文本内容作出回应。该团队表示,已对文本库进行仔细清理,剔除不靠谱内容,并重申方言数据授权与安全问题严格遵循法律法规要求。

微信产品团队介绍,“微信方言活动”小程序的推出旨在邀请用户用方言朗读内容,以帮助微信方言语音识别技术迭代。起因是团队经常收到用户关于方言服务缺失的反馈,希望通过该活动加速补齐并提升多种方言的服务能力。小程序中的文本内容由算法基于日常语义和中文文库随机合成,大部分为家常对话、问路、买菜、催回家等场景,例如“你中秋节回家不?”“老伴儿,咱下去公园遛弯去”“你知道附近菜市场在哪里吗”等。

然而,由于算法合成机制的局限性,部分生成文本出现不合常理甚至匪夷所思的字句,引发用户反馈、提醒甚至批评。微信产品团队在说明中承认这一问题的存在,并对用户意见表示感谢,称这些反馈“至为珍贵”。目前,团队已完成对文本库的清理工作,剔除了不靠谱内容。

针对外界关注的方言数据授权与数据安全问题,微信产品团队在说明中强调,相关操作严格遵循法律法规规定的“合法、正当、必要”原则,通过专属授权条款取得用户的“单独同意”。所收集的方言数据仅用于提升方言相关服务质量,例如方言识别模型优化,不会用于与此无关的用途,也不会提供或披露给任何第三方。

方言语音识别一直是中文AI语音技术领域的难点。中国幅员辽阔,方言种类繁多,不同地区甚至同一省份内的口音差异显著,这给语音识别模型的训练带来了极大挑战。微信此前已支持粤语、四川话、河南话等部分方言的语音输入,但覆盖面有限。此次方言活动小程序的上线,本质上是微信通过众包方式扩充方言训练语料的一种尝试,与行业通行的“数据众包+人工校验”模式类似。

从技术角度看,基于日常语义和中文文库随机合成文本的方式,在生成自然对话语料方面具有一定效率优势,但缺乏对地域文化语境和语言习惯的深入理解,容易产生脱离实际的表达。此次文本库清理后,微信产品团队未透露是否将调整算法生成策略或引入人工审核机制,但行业普遍认为,在AI训练数据采集过程中加入多轮人工校验是提升数据质量的关键环节。

此次事件也反映出AI数据采集中一个长期存在的矛盾:一方面需要大量真实、多样的语料来训练模型,另一方面数据质量和合规性要求不断提高。微信方面对数据授权流程的强调,与当前《个人信息保护法》下“单独同意”的合规要求保持一致。对于企业服务领域而言,如何在数据采集效率与合规安全之间取得平衡,仍是AI应用落地过程中需要持续探索的课题。

随着方言语音识别技术的持续迭代,微信有望在更多场景中提供方言交互能力,覆盖老年用户群体和方言使用密集地区的服务需求。此次文本库问题的及时回应与清理,也为同类AI数据采集项目提供了一个关于质量控制与用户沟通的参考样本。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
美国国家经济研究局调查:超九成企业高管称AI未影响就业与生产力
上一篇 2小时前
国内算力用电爆发式增长,7月互联网数据服务用电量同比增长40%
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部