LinkedIn披露AI职位搜索训练架构,多教师蒸馏让训练速度提升8倍

该模型仅有0.6B参数,却能在职位搜索排序任务中达到接近大型教师模型的性能,同时将训练速度提升至原先的8倍。

LinkedIn近日公布了其AI职位搜索功能背后的训练基础设施细节,披露了一套多教师蒸馏(Multi-Teacher Distillation)流水线。该流水线将多个大型教师模型的知识压缩至一个仅有0.6B参数的紧凑排序模型中,在保持搜索排序质量的同时,将训练速度提升至原先的8倍。

据LinkedIn介绍,其AI职位搜索系统需要在海量职位与用户之间进行实时匹配和排序,这对模型的推理延迟和部署成本提出了较高要求。直接部署大型模型虽然能获得较好的排序效果,但在实际生产环境中面临算力开销过大、响应速度不足等问题。为此,LinkedIn采用多教师蒸馏方案,将多个大型教师模型的能力迁移至一个小规模学生模型中。

多教师蒸馏的核心思路是让多个各自擅长不同任务或数据分布的教师模型共同指导学生模型的训练,而非依赖单一教师模型。这种方法能够让学生模型从多个知识源中学习,避免单一教师模型带来的偏差,同时提升学生模型在多样化场景下的泛化能力。LinkedIn将这一方法应用于职位搜索的排序环节,最终得到的0.6B参数模型在排序质量上接近大型教师模型的表现。

训练效率方面,LinkedIn表示该蒸馏流水线将训练速度提升了8倍。这一提升对于需要频繁迭代和更新的搜索排序系统而言意义明显,意味着团队可以在更短周期内完成模型训练和上线部署,加快产品迭代节奏。

LinkedIn近年来持续加大在AI领域的投入,将大模型技术应用于职位推荐、人才匹配、内容分发等多个核心场景。此次披露的训练架构细节,反映了企业在将大模型能力落地到高并发、低延迟生产环境时所面临的实际工程挑战,以及通过模型压缩和蒸馏技术平衡性能与成本的技术路径。

对于企业级AI应用而言,如何在有限算力预算下实现接近大模型的业务效果,是当前普遍关注的课题。LinkedIn的多教师蒸馏实践为搜索、推荐等需要实时响应的场景提供了一种可参考的工程方案,也表明模型小型化与知识蒸馏正在成为大模型落地的重要技术方向。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
Y Combinator CEO 陈嘉兴:AI 安全讨论应聚焦现实风险而非科幻末日
上一篇 3小时前
国家数据局推行统一数据产权登记制度,首批56份凭证公示
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部