AI幻觉问题在过去两年持续引发行业关注。与早期AI“一本正经地编造”不同,当前大模型生成的虚假内容往往附带引用、数据和看似严谨的支撑材料,识别难度显著上升。幻觉的常见成因之一是模型在缺乏足够数据支撑时仍继续生成,以自信语气填补信息空白。近期一个反例引发思考:某AI模型在被要求判断中文书稿是否带有“翻译腔”时,并未直接给出结论,而是明确表示该判断需要母语级别的语感,超出其可靠回答范围,仅指出若干结构性可疑之处,建议交由专业母语编辑处理。这种对能力边界的认知与主动停止,被视为幻觉的反面。
这一案例折射出概率性AI系统设计中的核心矛盾:故障空间无限开放,而工程资源有限。作者以乒乓球中的“长胶”打法作类比——长胶胶粒较长,对旋转的处理方式特殊,常将对手制造的旋转“借”回,使回球节奏反常。面对此类罕见但棘手的对手,教练的建议并非投入大量时间专门训练,而是学习基本战术的同时有意识地接受偶尔失利。原因在于,过度适应长胶的“非正常”节奏会破坏对付绝大多数普通对手所需的肌肉记忆,且训练过程本身消耗乐趣。这一取舍逻辑被引申至AI产品设计:前沿实验室追求模型能力极致是合理投入,但在面向客户的实际部署中,若为填补最后5%的性能差距需付出十倍成本,则工程成功可能伴随产品策略失败。
作者提出“3C”框架用于系统化思考:组件(Component)指经过验证的单一能力,连招(Combo)是能力的可重复编排,实战(Competition)则是系统在真实环境中的表现。当实战暴露意外案例时,标准反应是将其反馈回系统——高频且有价值的案例可固化为新连招,基础性弱点则需改进组件。但存在第三种可能:案例真实但罕见,适配成本极高,且强行纳入会扭曲系统处理常规任务的能力。此时正确做法是设立边界,将案例路由至人工处理或明确拒绝,而非将其塞入核心系统。判断新故障归属需综合评估三个维度:发生频率、解决价值、对核心系统的影响程度。修改组件需更强证据,因为所有依赖该组件的连招都会受影响;罕见但后果灾难性的案例可能值得处理,而常见但需完全不同能力的案例则不应硬塞进同一组件。
这一框架的实践意义在于,边界本身也是产品设计的一部分。以财报数据提取组件为例,当遭遇扫描质量差、手写或版式怪异的文档时,持续追加指令和例外规则虽能部分改善,但最终需判断该输入是否已超出组件设计范围。明确拒绝或转交人工审核,可能比无限扩展组件边界更符合系统整体效率。作者总结,工程师的天性倾向于修复故障,但在概率性AI系统中,故障空间无限,若将每个边缘案例都吸收进核心系统,系统最终会被罕见案例塑形而非日常功能塑形。有意识地接受部分失败,是为了保护系统真正核心能力所必须付出的代价。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。