豆包大模型2.1 Pro更新0915版本,图像与视频推理Token消耗降低超30%

图像推理和视频推理的Token消耗比上一代减少30%以上,看图解题、图像质检、视频审核等高频场景成本更低。

火山引擎9月16日宣布,豆包大模型2.1 Pro已更新至0915版本,API在火山方舟平台全量上线。豆包应用同步完成升级,用户下载或更新至最新版后,选择“豆包2.1 Pro(0915新版)”模型即可使用。此外,TRAE已同步接入该版本,今年6月推出的Doubao-Seed-Evolving也更新至同一版本,企业无需更换API接入节点。

据官方介绍,本次升级围绕企业生产级需求展开,覆盖Agent任务交付、多模态Coding、多模态理解与Token效率优化四个方向。

在Agent任务交付方面,模型强化了证据溯源、权威信源检索、时效判断和数据核验能力,官方称幻觉问题显著减少,模型输出更忠于工具调用事实。在金融投研、办公自动化等长报告任务中,结论具备可查依据。以金融投研为例,模型可自主拆解研究需求、查询高质量数据源并建模分析,产出专家级建模底稿。

多模态Coding能力方面,模型对复杂代码仓库的理解增强,面对跨文件、长程问题能够理清项目结构与模块关系、定位根因并修复,覆盖从理解需求到运行验证的端到端流程。借助VLM能力,模型可直接读取设计稿、图纸和操作录屏,将视觉信息转化为前端代码和游戏逻辑,Web 3D开发与游戏场景呈现效果有所提升。

多模态理解方面,视频推理能力增强,可在视频中定位证据、跨帧整合后作答,也能对照SOP辨认操作并解释原理,物理教学、工程、实验操作、医疗等专业内容理解精度提高,视频标注、内容质检、长视频剪辑与定位摘要等场景均可受益。图像理解在3D物体与密集图文方向增强,可识别CAD工件、游戏引擎3D元素及AR空间;工程图纸尺寸标注与公差符号、PDF图注脚注与表头层级、财报研报表格提取和跨页脚注引用等处理精度提升。

Token效率方面,模型推理轮次和工具调用次数降低,图像推理和视频推理的Token消耗较上一代减少30%以上,看图解题、图像质检、视频审核等高频场景的调用成本随之下降。

此次更新正值大模型厂商加速争夺企业级市场的阶段。Agent任务可靠性、多模态理解精度与推理成本,是当前企业客户评估模型落地的三个核心指标。豆包2.1 Pro在幻觉控制与Token效率上的改进,能否转化为实际的企业付费转化,仍需观察后续客户反馈与竞品跟进节奏。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
智谱与MiniMax上半年营收翻倍增长,销售费用同步下降
上一篇 3小时前
中国移动开源Open-RAIL工程底座,打通VLA/WAM模型与机器人本体适配壁垒
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部