AI图像生成为何默认输出美女:从Lena测试图到模型数据惯性的技术溯源

生成模型的本质,其实就是学一个数据分布,再从分布的中心附近取样。换句话说,模型天生会画平均脸,而平均脸恰好就是人眼里的美。

2025年5月初,X平台上一段五秒钟的视频获得超过1525万次播放。视频内容为韩国职业棒球联赛转播画面,镜头扫过看台时捕捉到一名身穿白衣和牛仔裤的女性观众。该视频配文为「普通韩国女性」,随后被证实为AI生成内容。画面中的比分牌显示已退役多年的球员名字,看台标语与官方口号存在出入,转播解说使用标准美式口音而非韩语。这些细节暴露了视频的合成属性。然而视频并未因被拆穿而消失,反而迅速演变为社交网络上的流行模板,用户将个人面部替换进相同场景,生成「被球场镜头抓拍到的自己」。

这一现象揭示了AI图像生成能力演进过程中的一个规律:每一次模型能力的显著提升,几乎都会催生一个全民参与的爆款玩法。2025年3月GPT-4o开放图像生成功能后,吉卜力动画风格的照片重绘在社交网络刷屏;8月底谷歌推出Nano Banana,用户热衷于将自拍转化为桌面手办风格的图像,两周内生成超过2亿张图片。这些爆款玩法的共同特征是「把自己放进去」,但韩国球场事件呈现了一个不同的顺序:先是一个不存在的美女形象骗过了上千万人,然后才衍生出人人可玩的模板。这一顺序表明,美女形象并非偶然出现在场景中的配角,而更接近一种默认值。

这种默认值的形成可以追溯到半个世纪前。1973年,南加州大学信号图像与处理研究所的研究人员正在为一篇论文寻找测试图像。据记载,一名同事携带1972年11月期的《花花公子》杂志进入实验室,从中间插页顶部撕下一条5.12英寸的长条送入扫描仪。这张图像随后在图像处理领域被广泛使用,成为行业默认的测试图片。1996年,IEEE图像处理汇刊主编戴维·芒森撰文解释了这一现象:技术层面上,该图像包含细节、平坦区域、阴影和纹理,适合测试算法;而另一个原因则更为直接——这是一张有吸引力的女性照片,在以男性为主的研究圈子中受到关注并不意外。

鉴于图片来源,《花花公子》曾在1991年主张版权,但最终允许其继续在研究中使用。图像处理研究共同体内部也出现过反对声音,认为工程师不应使用可被视为贬低女性的出版物中的素材。图像本人Lena Soderberg也在纪录片《Losing Lena》中表态希望停用这张图。2024年4月1日起,IEEE计算机协会正式停止接收使用该图像的论文,距离那次扫描已过去51年。

当前AI图像生成模型面临的某些技术局限,与训练数据的分布特征直接相关。AI难以生成一杯倒满的红酒,杯中液面总是停在中间偏上位置;AI绘制的钟表指针也总是停在10:10。原因相同:网络上的红酒照片大多不是满杯状态,而钟表广告的惯例就是展示10:10。模型会复刻训练数据的分布,无法摆脱数据的惯性。

但在美女形象这一问题上,情况有所不同。模型的惯性恰好与人类审美形成了对齐。1990年,心理学家Judith Langlois和Lori Roggman进行了一项实验:将一批人脸用数学方法平均合成新脸,再请人打分。结果显示,合成脸比参与合成的几乎每一张真人脸都更具吸引力,且参与平均的脸越多,合成脸越好看。这一效应在男性脸和女性脸上均成立,在不同族裔中也得到验证。论文标题为《有吸引力的脸只是平均的》。1877年也有类似观察:将两张女士肖像用立体镜叠合,合成的脸每一次都明显更美。

生成模型的本质是学习一个数据分布,再从分布的中心附近取样。因此,模型天生会画平均脸,而平均脸恰好对应人眼认知中的美。人类心理与机器原理的结合,构成了美女作为AI默认值的技术根基。2023年澳大利亚国立大学的一项研究将这一碰撞推至极端:心理学家发现,AI生成的白人面孔被实验参与者判断为「真人」的次数,比真实的白人面孔更多。研究者称之为「AI超真实」,解释为训练数据以白人为主,模型生成的脸更接近该群体的平均值,而接近平均的脸会被人感知为更典型、更像真人。

Langlois的实验曾受到批评:合成脸好看,也许只是因为取平均时抹掉了皮肤上的斑点和瑕疵。这一方法论质疑在1990年提出,但在今天看来具有预言性质。AI美女最典型的特征恰好是过分光滑的皮肤。三十多年后,事实核查机构教人识别AI图片时,列出的破绽之一就是过度光滑的皮肤。批评者在三十多年前指出的统计伪影,已成为当前AI生成图像的显著特征。

2022年底,修图应用Lensa的「魔法头像」功能爆红:用户上传几张自拍,AI生成一百张不同风格的肖像。《麻省理工科技评论》的AI记者Melissa Heikkilä使用该功能生成了100张自己的头像,其中16张上身赤裸,另有14张衣着极少、姿势性感。而她的男同事获得的图像均为宇航员、探险家和发明家形象。在此过程中,用户未向模型提供任何提示。Heikkilä在文章中解释,背后的模型使用互联网抓取的图像训练,而网络上存在大量衣着暴露的女性照片,导致模型将生成「衣着暴露的女性」作为默认值。用户的行为惯性会继续推动这一倾向。

从1973年的Lena测试图到2025年的AI球场美女,默认值的来源从实验室的偶然选择转变为训练数据的统计分布。技术社区已开始对历史遗留的默认值进行修正,但数据驱动的默认值调整涉及更复杂的模型训练与数据治理问题。随着AI图像生成能力持续增强,如何识别并修正训练数据中的统计偏差,将成为模型开发者和行业标准制定者需要持续面对的课题。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
快手同日内测likli创作Agent并官宣Kling 4.0,AI视频竞争转向工作流
上一篇 1小时前
领克 900 新款谍照疑曝光:插混旗舰 SUV,现款 25.48 万元起
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部