9月2日,谷歌正式发布Gemini 3.8 Flash,官方称其在软件工程、Agent任务和复杂多步推理上均有明显提升,距离3.7 Flash发布仅间隔三周。然而就在发布后不久,大模型盲测竞技场Arena中出现了一个同样挂着gemini-3.8-flash名称的模型,其表现明显超出已发布的正式版本,引发开发者社区对其真实身份的广泛猜测。
多位开发者的实测结果显示,该模型在SVG绘图、网页设计、3D场景生成和游戏开发等任务上的表现显著优于正式版Gemini 3.8 Flash。开发者Harshith用SVG绘制侧面家猫的测试中,Arena中该版本在轮廓、比例和细节完整度上均与正式版拉开明显差距。另有网友测试显示,该模型可在8分钟内生成可交互3D场景,约10分钟搭建完整的直升机3D展示页面,约14分钟完成一套单色主题网站设计。此前Gemini系列常被诟病的设计品味问题,在此次测试中似乎得到明显改善。
更引人关注的是开发者Qwinah的说法。他声称成功路由到了该模型的后端,并贴出一张疑似内部终端信息截图。根据其描述,该模型内部标识包含G4P-ARGON和VIA_3.8_FLASH,最大输出达256K,上下文窗口超过1000万token,具备跨会话永久记忆、无需API即可联网、后端自动编译运行脚本,甚至物理机器人控制等能力。若上述信息属实,这显然已超出一次常规Flash升级的范畴。
与此同时,一张据称是Gemini 4 Pro的benchmark对比表在社区流传。数据显示,该模型在软件工程测试DeepSWE v1.1中得分88.7%,终端Agent测试Terminal-Bench 2.1达95.3%,专家级知识推理测试HLE-Verified为72.1%,电脑操作Agent测试OSWorld 2.0达86.8%。在衡量真实知识工作的GDPval-AA v2上,其得分被标注为2064 Elo,突破2000大关。不过,该benchmark表与Qwinah提供的后端截图并不完全吻合,表中作为对照项的Astra得分也与官方数据存在出入。两份材料均未获得谷歌、Arena或相关benchmark官方背书,目前仍属社区流传信息。
唯一可以确认的事实是,Arena中确实存在一个名为gemini-3.8-flash的模型,其表现与正式版Gemini 3.8 Flash存在明显差异。社区之所以迅速将猜测指向Gemini 4 Pro,与谷歌Pro系列模型长期空窗有关。Gemini 3.5 Pro迟迟未正式落地,Gemini 4已确认进入训练,过去数月Flash系列持续迭代,而代表能力上限的Pro线始终没有新型号出现。一个能力异常的“3.8 Flash”突然出现在Arena中,使得外界猜测谷歌可能跳过了3.5 Pro,直接将重大升级留给Gemini 4 Pro。
在此次传闻中,RSI(Recursive Self-Improvement,递归自我改进)成为另一个被反复提及的关键词。该概念指AI参与制造更强的AI,而更强的AI进一步加快下一代模型的研发,形成加速循环。路透社今年8月报道称,谷歌联合创始人Sergey Brin近几个月一直在推动Gemini提速,并将递归自我改进列为重点关注方向之一。谷歌尚未公开宣布实现该闭环,但正将越来越多原本由研究员承担的工作交给Agent,包括评测模型、寻找改进方向、运行实验并将结果反馈至研发流程。9月2日发布Gemini 3.8 Flash时,谷歌在官方说明中提到,一套长期运行的Agent循环正在“递归地评估和改进底层模型”。Google DeepMind研究员姚顺宇在3.8 Flash发布后表示:“这是模型的一小步,RSI的一大步。”
9月14日,谷歌与GDM等团队发布Dream-RSI论文,专门研究如何让Agent通过持续改进探索策略实现递归自我改进。在算法工程、数学优化和GPU kernel任务上,该方法均显示出更高的探索效率和更低的搜索成本。从Gemini 4 Pro的疑似泄露到RSI研究方向的明确推进,谷歌在模型研发自动化方面的布局正在加速。若递归自我改进的闭环真正跑通,模型迭代速度将不再仅由人力投入决定,这对整个AI行业的竞争节奏和研发模式都将产生深远影响。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。