谷歌内部测试数学推理模型Mathematica,支持100万词元上下文

该模型内部标识符为“models / deepthink-mathematica-tf-raw-thoughts”,支持高达100万个词元的上下文窗口,同时输出限制为65,536个词元。

9月16日,X平台用户@lyraxana发布推文称,谷歌正在基于DeepThink V3模型构建一款内部代号为Mathematica的实验性AI模型。该模型主要针对繁重计算和复杂符号问题求解进行专项优化,预估将成为谷歌目前最强的数学推理AI模型。

根据泄露的API数据,该模型的内部标识符为“models / deepthink-mathematica-tf-raw-thoughts”,支持高达100万个词元的上下文窗口,同时输出限制为65,536个词元。上下文窗口指模型单次处理时可读取的文本单位总量,输出上限则指模型单次回答可生成的文本单位数量。这一配置意味着Mathematica能够一次性处理极大规模的数学文档、证明过程或多步骤推导链,并在单次回答中输出较长篇幅的推理结果。

泄露的配置信息还标注了“UNSTABLE_EXPERIMENTAL”状态,表明该版本属于不稳定实验版本,尚未达到对外发布的成熟度。模型同时带有“Teamfood”标签,这是谷歌用于内部员工测试的专用术语,意味着相关服务目前仅处于内部测试范围,仅面向谷歌员工开放试用。

从技术路线来看,Mathematica建立在DeepThink V3基础之上。DeepThink系列是谷歌在深度推理方向上的重要产品线,此前已推出面向高阶数学竞赛的Gemini DeepThink IMO模式,该模式专门针对国际数学奥林匹克竞赛级别的题目进行优化。此次Mathematica的定位进一步聚焦于繁重计算与符号求解场景,与通用推理模型形成差异化分工。

值得注意的是,谷歌在近期明显加快了AI模型的迭代节奏。9月15日,谷歌刚刚推出Gemini 3.8 Live和Live Extended Thinking。TestingCatalog指出,这一系列动作表明谷歌正在多个推理方向上同时推进产品化进程,Mathematica可能是其在专业数学与科学计算领域的重要布局。

从行业影响来看,数学推理能力一直是衡量大模型逻辑能力的关键指标。符号计算、定理证明、复杂方程求解等任务对模型的推理深度和上下文管理能力要求极高。100万词元的上下文窗口若能在数学场景中有效利用,将使得模型能够处理完整的数学论文、多章节证明或大规模计算任务,这对于科研辅助、工程计算、教育等领域的应用具有实际意义。

不过,由于该模型目前仍处于“UNSTABLE_EXPERIMENTAL”阶段,其实际性能表现、推理准确率以及是否会出现幻觉等问题尚待验证。内部测试阶段的模型距离正式发布通常还有较长路径,包括稳定性优化、安全性评估和产品化封装等环节。谷歌方面尚未就此事作出官方回应。

若Mathematica最终落地,谷歌将在AI数学推理这一细分赛道上与OpenAI、Anthropic等厂商形成更直接的竞争。数学与科学计算被视为AI在专业领域创造价值的重要方向,该模型的后续进展值得持续关注。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
联想Vantage应用登陆Google Play,意外曝光AI Mouse智能鼠标新品
上一篇 8小时前
OpenAI推出法律专用AI平台Astra for Law,法律研究基准正确率54%
下一篇 7小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部