前OpenAI研究员点燃决策模型赛道,中国团队以开源本地化路线快速跟进

Jev把「判断」从「生成」里剥离出来,做成了一种廉价、高频的基础设施。

9月15日,前OpenAI研究员Diogo Almeida创办的TypeSafe AI发布了决策模型Jev。该模型不生成任何文本,只输出带概率的结构化判断结果,定价为每百万输入token 0.042美元,输出免费。两周之内,OpenAI在开发者日上推出Decisions API,Cloudflare于10月1日开源Clef,亚马逊发布Strands Decider。国内方面,上海人工智能实验室开源了多模态决策模型Intern-Decision,成立不到五个月的上海公司StartLux(原点星辉)于9月30日发布开源StartLux-Decision,并宣称在公开评测中超过Jev。

决策模型的核心逻辑,是将Agent运行中大量琐碎判断从大模型的生成能力中剥离出来。TypeSafe将Jev称为「System One模型」,名称取自卡尼曼的《思考,快与慢》。过去两年大模型主要在深度推理方向竞争,但Agent实际运行中密集发生的是高频、轻量的判断——工单分配、命令放行、界面操作选择、任务完成状态确认等。这些判断此前要么由大模型附带完成,速度慢、成本高;要么写成固定规则,无法覆盖长尾场景。Jev的做法是只回答带预设选项的问题,如单选、打分或判断正误,直接返回结构化结果。

市场反应迅速。Vercel披露,Jev上线24小时内,其AI Gateway上13%的付费用户即开始使用,是此前任何模型发布速度的两倍。但Jev为闭源托管模型,不公开权重,不支持本地部署,仅能通过TypeSafe的API调用。这一缺口成为后续团队切入的入口。

国内团队的跟进路径呈现明显的开源与本地化特征。上海人工智能实验室的Intern-Decision开源了0.8B、2B、4B三档规格,主打多模态能力,可识别图像和界面后做出决策,官方数据显示推理速度比Jev快2至3倍。StartLux则一次性发布0.8B至27B五档规格,配齐量化文件,直接面向本地部署场景。按StartLux公布的数据,27B版本在Decision Index 0.2.1的38项测试中有31项高于Jev 1.13,综合分63.88对57.91。团队同时展示了一组国际象棋对弈结果,36局赢下35局。上述数据为团队基于公开工具、对照9月28日榜单快照完成的自测。

值得关注的是,中国团队几乎不约而同选择开源权重与本地化部署。Jev闭源且仅支持云端调用,对数据敏感或对跨境调用有顾虑的开发者构成门槛。开源模型允许在自有设备上运行,恰好补上了这一空位。此外,Cloudflare的Clef基于Qwen后训练,亚马逊的Strands Decider同样以Qwen为底座,APUS的方案也运行在Qwen上。中国开源基座模型已成为此轮决策模型热潮中全球玩家共用的底层支撑。

StartLux成立于今年,CEO为盛大网络联合创始人陈大年,CTO为郭权玮博士。公司定位「主打本地模型」,目标是让模型能力与数据保留在用户自有设备上。此前该公司以Qwen3.6-27B为基座后训练的StartLux-27B,在中国信通院MCP专项测试中得分39.25,超过284B参数的DeepSeek-V4-Flash。需说明的是,该测试聚焦工具调用能力,不代表通用能力全面领先。在StartLux的规划中,本地AI是一套完整系统:27B模型承担通用能力,决策模型负责高频判断,上层为Agent与记忆模块,底层为量化与推理系统。按公司公布的数据,4B版本经Q4量化后约2.71GB,与原始权重的决策一致率仍达98.3%。

决策模型赛道的竞争格局仍存在较大不确定性。Jev发布时即有分析人士预判大厂将快速推出同类产品,Jev最终需要与「前沿版本的自己」进行价格竞争。一个在两周内即被多方复制的品类,本身难以构成长期壁垒。对StartLux而言,真正的考验在于长任务稳定性、异常恢复、上下文管理与整体体验。郭权玮亦承认,这些工程层面的挑战比单纯运行模型更为复杂。按计划,StartLux首个面向公众的本地智能体验版本有望在年内推出。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
特朗普签署行政令改称”超级智能”后,马斯克确认SpaceXAI将更名为SpaceXSI
上一篇 2小时前
拥抱智慧医疗创新,鼓楼医院谱写高质量发展新篇章
下一篇 2024年8月24日 上午10:54

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部