27B参数本地模型通过信通院MCP专项测试,StartLux-V1.0排名第二超DeepSeek-V4-Flash

当基础模型能力跨过实用门槛,过去两年以参数规模为核心的军备竞赛已进入同质化阶段。

中国信通院人工智能研究所近日公布的一份检验报告显示,上海原点星辉科学技术有限公司(StartLux)研发的本地大模型StartLux-V1.0-27B-Preview,在可信AI大模型基准测试MCP专项测试中,以27B参数量取得综合性能排名第二的成绩,超过第三名的DeepSeek-V4-Flash,能力范围进入DeepSeek-V4-Pro所代表的万亿参数模型能力区间。

MCP专项测试涵盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计6类专项任务及综合评估,共7项检验项目,重点考察大模型在多工具协同、复杂任务执行及真实环境交互等方面的综合表现。参测模型包括DeepSeek-V4-Pro(1.6T)、DeepSeek-V4-Flash-0731(284B)、Step-3.7-Flash(198B)、StartLux-27B-260715(27B)、Qwen-3.6-27B(27B)和AgentCPM-Explore(4B)。结果显示,StartLux-V1.0-27B-Preview综合得分为39.25,排名第二,超过284B的DeepSeek-V4-Flash-0731和198B的Step-3.7-Flash。在同等参数规模下,该模型较Qwen-3.6-27B高出5.34个百分点。单项任务中,位置导航排名第一,浏览器自动化、金融分析等任务与1.6T参数的DeepSeek-V4-Pro并列第一或独占第一。

StartLux以Qwen3.6-27B为基座做后训练定向增强,采用AI训练AI(Auto Research)的方法,自主开展训练实验,并通过反馈持续优化训练策略。该方法代表了当前全球模型研发的前沿方向。StartLux-V1.0-27B-Preview是国内首个采用该方法进行后训练的本地Agent模型。

行业正在发生一个清晰转向:当基础模型能力跨过实用门槛,过去两年以参数规模为核心的军备竞赛已进入同质化阶段。同等规模模型在Benchmark上的差距越缩越小,但用户和企业的真实困扰从来不是大模型的测试分数与排名,而是模型能否解决实际问题、数据是否安全、成本是否可控。这些答案不在越来越大的云端集群里,而在数据不出域、推理在身边、能力可定制的本地方案里。

全球范围内,本地模型正逐渐进入行业视野。Google于4月推出Gemma 4系列,其中31B Dense版本在开源模型排行榜排名第三,量化后可在消费级显卡上本地运行。8月初,Meta发布30B本地模型Muse Glimmer并开源。英伟达于8月推出开源模型Nemotron 3.5 Lightning,这是一款30B参数的MoE模型,可直接在RTX PC等本地设备上运行。盛大网络创始人、语生科学董事长陈大年近期预测,本地模型将在3年内占据80%的大模型市场。

目前,StartLux-V1.0-27B-Preview可在消费级个人电脑上运行。StartLux计划于年内推出第一代本地智能解决方案,同时正在对扩散式语言模型等新架构进行研究和优化。本地大模型在性能与部署成本之间的平衡能力正在提升,其在企业服务场景中的应用空间值得关注。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
美国ITC对特定移动设备启动337调查,苹果公司列为被告
上一篇 3小时前
协创数据上半年营收125.23亿元同比增长153%,从存储制造商向AI基础设施全栈服务商转型
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部