蚂蚁百灵开源Ling-3.0系列Base模型及训练中间checkpoint

由于没有了学习率衰减,该Base Model更适合持续预训练和动态扩展数据,且支持训练后离线探索不同学习率“衰减曲线”。

8月21日,蚂蚁百灵宣布正式开源Ling-3.0-tiny-base与Ling-3.0-flash-base模型。除最终Base checkpoint外,官方同步开放了两个模型的预训练和中期训练权重checkpoint,共计6个checkpoints,相关权重已上架Hugging Face和ModelScope平台。

此次开放的checkpoint分为三个阶段:预训练checkpoint已完成大规模预训练,尚未进行中期训练、WSM合并和后训练;中期训练checkpoint已完成中期训练,尚未进行WSM合并和后训练;WSM合并checkpoint已基于中期训练checkpoint完成WSM合并,尚未进行后训练。Base模型通常指未经特定任务微调的基础预训练模型,在训练过程中最初被开发和优化,旨在平衡性能与资源消耗。

官方表示,这些checkpoints适用于持续预训练、领域监督微调、偏好优化、强化学习后训练、蒸馏,以及长上下文和MoE系统研究。需要说明的是,Base Model并非已完成指令对齐的聊天模型,官方不建议未经后训练便直接将其部署为面向终端用户的聊天服务,也不建议未经额外对齐和评估用于安全关键型应用。任何生产使用都应完成面向具体任务的后训练、评估与验证。

在中期训练结束后,蚂蚁百灵将传统学习率衰减改写为checkpoints加权合并,即WSM(Warmup-Stable and Merge)方法。由于取消了学习率衰减,该Base Model更适合持续预训练和动态扩展数据,并支持训练后离线探索不同学习率“衰减曲线”。

从参数规模看,Ling-3.0-tiny-base总参数7.9B,激活参数1.3B,以相比前代约50%的总参数量在大多数评测中取得更高结果,在与同等规模模型对比中展现出更具竞争力的代码能力。Ling-3.0-flash-base总参数124B,激活参数5.1B,采用稀疏激活设计,为研究者和开发团队提供了可继续训练、拓展并适配真实场景的开放底座。评测显示,该模型在代码、复杂推理和长上下文方向表现突出,相比总参数量约为其2至3倍的base model,整体表现仍具优势。

Ling-3.0系列是蚂蚁集团百灵大模型体系的开源分支,此前已陆续发布Ling-3.0-tiny和Ling-3.0-flash模型,并支持在英伟达DGX Spark、苹果Mac mini等设备上部署。此次开放训练过程中的关键节点权重,为研究社区提供了更细颗粒度的模型演进样本,有助于探索预训练、中期训练与后训练各阶段对模型能力的影响。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
OpenAI为ChatGPT推出Apple Messages插件 支持自动发送短信
上一篇 3小时前
OpenAI升级macOS版ChatGPT接入苹果信息应用 读取发送短信能力引隐私讨论
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部