2023年3月13日至17日,AI大模型领域迎来罕见的产品密集发布期。OpenAI、微软、谷歌、Anthropic、百度、斯坦福大学、清华大学等机构在一周内相继推出重要模型或应用,覆盖多模态大模型、办公协同、开源模型、开发工具等多个方向。
3月14日,OpenAI正式发布GPT-4。该模型在对话能力基础上增加了图像理解的多模态能力,推理和输出质量较前代显著提升。GPT-4的发布被视为大模型产业的重要节点,其多模态能力为后续AI应用开发提供了新的技术基础。同日,谷歌开放了大语言模型API——PaLM API,开发者可通过API访问谷歌基础模型,并使用MakerSuite工具进行提示词迭代和模型调优。谷歌还推出了Generative AI App Builder平台,支持在Gmail和Google Docs中直接生成草稿内容。但由于GPT-4在同一天晚些时候发布,谷歌此次发布在社交媒体上的关注度明显低于OpenAI。
3月15日,微软发布Microsoft 365 Copilot,将GPT-4能力嵌入Word、Excel、PowerPoint、Outlook和Teams等办公软件。Copilot以侧边栏形式出现在Microsoft 365界面中,用户可通过对话方式完成写作、编辑、总结、创作演示文稿等工作。微软正在与20位客户共同测试该产品,并计划在未来几个月内扩展预览范围。微软方面表示,正在开发在客户数据上训练模型的能力,以确保数据隔离和安全。
同日,由前OpenAI研究副总裁Dario Amodei创立、谷歌投资的人工智能公司Anthropic宣布聊天机器人Claude开放公测。Claude具备对话推理能力,并可调整AI的语气、个性和行为。Anthropic声称Claude采用“以人为本”的语言建模方法,在遇到超出知识领域的话题时会推迟回答,以降低产生虚假信息的风险。
开源模型方面,斯坦福大学于3月14日发布由Meta LLaMA 7B微调而来的模型Alpaca。该模型仅使用52k数据训练,性能约等于GPT-3.5,训练成本不到600美元。3月15日,由清华技术成果转化的公司智谱AI开源中英双语对话模型ChatGLM-6B,支持在单张消费级显卡上进行推理部署。这两项发布表明,开源社区正在快速缩小与闭源商业模型之间的性能差距,同时大幅降低模型部署门槛。
3月16日,PyTorch 2.0正式版发布。相比1.0版本,2.0编译时间缩短43%,训练速度提升至2倍。PyTorch是当前主流深度学习框架之一,Salesforce等公司均在使用其训练大模型。同日,Midjourney发布V5版本,解决了此前AI生成图像中手指绘制不准确的问题,图像生成质量进一步提升。
3月16日,百度发布文心一言,展示了在文学创作、商业文案创作、数理推算、中文理解和多模态生成五个场景中的能力。百度智能云宣布即将面向企业客户开放文心一言API接口调用服务。文心一言是目前AI商业化产品浪潮中唯一来自中国互联网大厂的代表产品。
3月17日,Stability.AI发布新工具Stable Diffusion Reimagine。该工具允许用户上传图像后无限制生成多种变体,无需编写复杂提示词。此前一周,Stability.AI刚宣布收购图片工具Clipdrop开发商。
从GPT-4的多模态能力到Microsoft 365 Copilot的办公场景落地,再到开源模型训练成本的大幅降低,这一周集中释放的信号表明,大模型正从技术演示阶段加速进入产品化和商业化落地阶段。企业服务领域尤其值得关注:Microsoft 365 Copilot代表了协同办公与AI深度融合的方向,PaLM API和文心一言API则为企业开发者提供了接入大模型能力的入口。随着模型训练成本持续下降和部署门槛降低,AI在企业软件中的渗透速度预计将进一步加快。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。