沙特主权基金旗下HUMAIN发布阿拉伯语大模型 底座来自中国MiniMax

中国开放模型填上了从头预训练和长期调用闭源模型之间的空白。

沙特公共投资基金(PIF)旗下人工智能公司HUMAIN于9月3日发布阿拉伯语大模型HUMAIN-M3,该模型总参数规模达4280亿,每个token激活230亿参数,使用超过1万亿阿拉伯语tokens继续训练。HUMAIN官方新闻稿明确披露,模型经委托由中国AI公司MiniMax开发,底座为MiniMax-M3。HUMAIN董事长由沙特王储小萨勒曼担任,模型部署在HUMAIN Node上,未来计划开放权重。

HUMAIN成立于2025年5月,由小萨勒曼亲自宣布设立,业务覆盖数据中心、云、模型和应用全链条。沙特方面提供资本、算力和阿拉伯语本地数据,MiniMax则提供已完成基础训练的模型底座。双方合作成果以沙特国家模型名义发布。据HUMAIN公布的数据,HUMAIN-M3在七项阿拉伯语公开基准上的等权平均分达到89.37%,比未经本地化训练的M3参考模型高出9个百分点,并在五项测试中取得最高分。需要指出的是,这七项测试均为阿拉伯语基准,模型在编程和电脑操作等通用能力上的表现并未在本次发布中涉及。

发布前两天,沙特科技博主Sultan Alfaifi曾在社交平台X上称该模型为“100%沙特”模型,帖子获得28.5万次浏览后,有用户在评论区质疑这一说法。该博主随后更正:“感谢纠正,它基于MiniMax的M3。”这一插曲反映出部分市场对“自研”定义的理解差异,也侧面印证了此次合作的技术来源透明度。

HUMAIN-M3并非中国开源模型成为海外“自研”上游的孤立案例。日本乐天此前发布Rakuten AI 3.0时,公开配置文件中模型类标注为“DeepseekV3ForCausalLM”,模型类型为“deepseek_v3”,显示DeepSeek定义的架构和兼容方式已进入日本本土模型的技术路线。由新加坡国家研究基金支持的AI Singapore将Qwen3-VL继续训练为Qwen-SEA-LION,适配缅甸语、印尼语、菲律宾语、马来语、泰米尔语、泰语和越南语;泰国CMKL大学则基于Qwen3.5开发出泰英双语模型MANGO。加上沙特的阿拉伯语和乐天的日语,围绕中国模型及其架构的本地化案例已覆盖至少九种非中文语言。

这一趋势也波及美国大型科技公司。据彭博社等媒体报道,Meta在训练代号Avocado的新模型时,使用了Qwen、Gemma和OpenAI的gpt-oss等开放模型作为训练材料来源。Meta拥有全球顶级研究团队,但也不再执着于所有训练材料均由内部生产,而是将Qwen等开放模型视为更便宜、更快补齐能力的可选路径。

Hugging Face的下载数据为这一趋势提供了量化参照。过去一年,中国研发的模型占该平台下载量的41%,首次超过美国;仅Qwen家族就已衍生出超过11.3万个社区模型。下载量虽不完全等同于商业收入,但反映了全球开发者对中国开源模型技术路线的采纳程度。

此次合作模式的核心在于,沙特用资金、算力和本地数据换取了模型训练时间和控制权,MiniMax则从输出API调用服务转向进入他国模型研发的最底层。与仅能使用ChatGPT、Claude等闭源模型相比,基于开放权重模型进行本地化训练,使数据、训练、服务和信息安全可以掌握在当地机构手中。从零开始预训练前沿模型需要数年时间和大量失败成本,长期调用闭源模型则面临数据和服务受制于供应商的问题,中国开放模型在两者之间提供了中间选项。中国大模型出海由此从输出App和API向前推进一层:海外客户不再只是用户,而是可以继续训练、重新命名,将其转化为本国的“自研”AI基础设施。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
江波龙港股发行价较A股折让约42%,年内两轮募资合计近90亿元
上一篇 2小时前
北京经开区落地首批Token算力贷,近20亿元授信支持AI产业链企业
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部