自主AI增长平台Omneky近日推出评估套件TASTE BENCH,用于测试图像和视频模型将创意简报与品牌素材转化为可直接投放广告的能力。
根据Omneky公布的数据,在图像广告类别中,GPT Image 2.5 Sunburst的“可直接投放”率最高,达到54.2%(59条中有32条),平均质量评分为7.38分(满分10分)。八款受测模型的“可直接投放”率区间为22.0%至54.2%。上述结果均为首次生成、且关闭Omneky自有审核环节后的数据。Omneky的AI Growth Agent会针对每条广告,从多家实验室的图像和视频模型中进行选择。
Omneky创始人兼首席执行官Hikari Senju表示:“品味体现在细节中:字体是否合适、产品看起来是否真实、创意是否一目了然。我们构建TASTE BENCH,是为了让这些判断系统化,从而明确哪些模型可以放心用于客户的广告。”
当前版本的TASTE BENCH覆盖八款图像模型、59条广告简报、四个品牌和五种语言(英语、日语、阿拉伯语、印地语、西班牙语),共生成469条广告,并产生1371条有效的盲评评审记录。所有模型接收相同的提示词和素材,由来自OpenAI、Anthropic和Google的AI评审组成盲评小组,从品牌契合度、字体排版和广告效果等八个质量维度对输出进行打分。
此外,该评估还设置11项通过/不通过检查,涵盖文案准确性、语言正确性、标识与产品还原度、安全区放置,以及是否存在虚构声明或视觉瑕疵。当输出在评审小组投票规则下通过适用的硬性检查,且多数评审认为可直接投放时,该输出即被计为“可直接投放”。
Omneky指出,上述结果反映的是自动化创意判断,而非广告投放后的转化率或广告支出回报率。
随着生成式AI在营销创意环节的渗透加快,如何量化评估模型输出是否达到品牌可用标准,正成为广告技术领域的新课题。TASTE BENCH的推出,为广告主和代理商在选择图像与视频生成模型时提供了一套可参照的评测框架,但其与实际投放效果之间的关联仍有待进一步验证。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。