国产大模型密集发布期的起点:从ChatGLM开源到百模大战的行业观?

等大家陆续都上了桌,人们才发现:这些牌是不是有点多?而且打法也不一样。

2023年春季开始,中国科技行业进入大模型密集发布期。从3月中旬到5月底,多家机构相继推出或宣布自研大模型产品,行业格局在这一阶段初步成形。这一时期的显著特征是:部分模型采取开源策略,部分采用邀请测试,而真正面向公众全面开放的产品仍在少数。

3月14日,OpenAI发布GPT-4,Anthropic同期推出旗舰模型Claude。同一天,清华大学与智谱团队在GitHub公开了ChatGLM-6B的模型文件和代码。该模型参数规模为62亿,与此前团队开发的1300亿参数GLM-130B相比规模明显缩小,但开放了权重、调用方式及Web Demo,开发者可在本地运行或基于自身任务进行二次开发。默认版本约需13GB显存,后续社区贡献的量化版本将需求压缩至约6GB。ChatGLM-6B由此成为当年国内开发者最早可实际运行的大模型之一。

3月16日,百度召开文心一言发布会。会上展示的核心能力采用预先录制的视频而非实时演示,李彦宏在发言中承认“不能说百度完全准备好了”,并表示发布动力来自市场需求。发布会期间百度股价一度下跌约10%,收盘跌幅收窄。文心一言随后进入邀请测试阶段,全面开放需等待五个多月。

同期,新一批创业公司开始组建。3月19日,创新工场创始人李开复宣布正在筹组Project AI 2.0,称“资金、算力陆续到位”,招聘方向涵盖大模型、多模态、NLP、分布式计算等领域。该公司后定名为零一万物,李开复将其定位为面向全球的AI 2.0公司,而非“中文版ChatGPT”。

4月10日,前搜狗CEO王小川首次公开亮相,宣布成立百川智能。公司主体于3月24日完成注册,启动资金为5000万美元,部分来自王小川个人,部分来自好友支持。王小川在公开信中提及“距离ChatGPT发布已经第131天”,并表示团队预计在4月底接近50人,模型训练已启动。其公布的方向包括基础模型、搜索、多模态、教育、医疗等。

4月9日至11日,大模型发布进入密集期。360智脑面向企业用户开放内测,商汤发布“日日新”大模型体系,昆仑万维宣布“天工”3.5,阿里正式展示通义千问并计划接入钉钉、天猫精灵,同时通过阿里云向企业开放定制测试。同期媒体报道将这一阶段概括为“3天4款”,称国产大模型进入密集发布期。此后,知乎与面壁智能于4月13日公布“知海图AI”并尝试应用于热榜摘要,科大讯飞于5月6日发布讯飞星火并接入学习机、办公和汽车等产品。

与上述IT及互联网背景公司不同,量化投资机构幻方于4月11日宣布下场后未立即发布产品。5月24日,幻方创始人梁文锋首次向媒体解释其规划,此时新公司深度求索(DeepSeek)已成立。梁文锋表示不会过早设计基于模型的商业模式,团队将专注于模型能力的持续迭代。

这一阶段,中国大模型行业完成了从实验室到市场的初步过渡。开源与闭源路径并行,互联网公司与创业团队同台竞争,产品形态从基础模型向行业应用延伸。尽管多数产品仍处于邀请测试或有限开放状态,但模型数量与参与主体规模已显著扩大,为后续行业竞争格局的形成奠定了基础。随着8月底多款产品向普通用户开放,这场始于春季的“百模大战”开始进入公众视野,行业竞争也从模型发布转向产品体验与落地能力的比拼。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
大疆IFA展出阳台光伏系统,从无人机配件延伸至家庭能源市场
上一篇 10小时前
河北集中处置85个储能项目,11.66GW规模延期或取消,行业进入清退?
下一篇 9小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部