StartLux发布27B参数本地智能体模型,在信通院MCP专项评测中排名第二

简单对话准确率已无法覆盖全部需求,实际可用性越来越取决于调用工具、跨步骤维持状态以及在动态环境中操作的能力。

上海原点星辉科技(StartLux)开发的本地智能体模型StartLux-V1.0-27B-Preview,在中国信息通信研究院人工智能研究所主导的Trusted AI大模型基准评测MCP专项测试中获得综合得分39.25,位列总排名第二。该模型参数量为270亿,在多项关键任务上表现与参数量远高于自身的模型持平。

本次评测覆盖六个专项任务——位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理和3D设计——并包含综合评估。评测重点考察多工具协同、复杂任务执行以及与真实环境的交互能力,部分测试基于开源MCP-Universe框架。报告对比列表中涉及的模型包括DeepSeek-V4-Pro(1.6万亿参数)、DeepSeek-V4-Flash-0731(2840亿参数)、Step-3.7-Flash(1980亿参数)、同规模的Qwen-3.6-27B,以及参数量为40亿的AgentCPM-Explore。

据多家科技媒体报道,StartLux的270亿参数系统排名领先于2840亿参数的DeepSeek Flash模型和1980亿参数的Step模型,相比同规模的Qwen-3.6-27B高出5.34分。在单项类别中,该模型在位置导航任务上排名第一,在浏览器自动化和金融分析任务上与参数量远大于自身的DeepSeek-V4-Pro持平或领先。

StartLux方面表示,该模型基于Qwen3.6-27B底座,经过针对性后训练。公司将该训练过程描述为依赖”AI训练AI”的Auto Research循环机制,即系统自行设计实验、评估结果并迭代优化策略。StartLux称这款27B预览版是首个以该方式训练的国产本地智能体模型。

该模型设计用于在消费级个人电脑上运行。StartLux计划在今年晚些时候发布第一代本地智能解决方案,并继续进行额外训练工作,包括探索替代架构。信通院MCP评测中使用的智能体类测试与这一趋势直接相关。简单对话准确率已无法覆盖全部需求,实际可用性越来越取决于调用工具、跨步骤维持状态以及在动态环境中操作的能力。在基础能力越过实用门槛后,许多用户和组织对数据本地性、可控成本和可定制性的重视程度已超过对纯模型规模的追求。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
工信部公布前7月软件业运行数据:软件业务收入89785亿元,同比增长9.2%
上一篇 1小时前
卡游全链路智能制造模式透视:从卡牌工艺到文具产线的文创产业升级样本
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部