深度求索上线DeepSeek-V4-Flash-Vision-Exp多模态模型,Agent能力接近Opus-4.8

在需要视觉理解的Agent Benchmark上,DeepSeek-V4-Flash-Vision-Exp相比DeepSeek-V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8。

8月21日,深度求索宣布全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp正式上线DeepSeek API平台。该模型在文本输入之外支持图片输入,可完成图片描述、截图文字识别、图表分析等任务,支持的图片格式包括JPEG、PNG、GIF和WebP。

据深度求索官方介绍,V4-Flash-Vision-Exp在各类Agent框架内展现出较好的多模态适配能力,能够有效支持用户借助多样化的Agent工具解锁更多实用工作场景。该模型为实验性质,用户可通过设置model=’deepseek-v4-flash-vision-exp’进行访问。

在模型能力方面,DeepSeek-V4-Flash-Vision-Exp的纯文本能力(包括Agent、推理、世界知识等)与DeepSeek-V4-Flash正式版持平。而在需要视觉理解的Agent Benchmark上,该模型相比DeepSeek-V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8。

API服务方面,图片在传入后会转换为token并按token计费,单张图片最多占用384个token,计费价格与V4-Flash模型保持一致。多模态API支持Chat Completions、Messages、Responses三种格式调用,可方便接入各类Agent工具,支持图文混合输入,并提供base64内联、外部URL、Files API三种图片传入方式。

同期上线的还有Files API。该API不收费,用户可先将图片上传至平台,再在请求中通过file_id引用,从而节省请求带宽,同一张图片在多个请求中无需重复上传。

此次多模态模型的发布,进一步丰富了深度求索在视觉理解领域的产品矩阵。随着Agent工作流对多模态输入需求的增长,该模型的推出为开发者提供了更灵活的视觉理解能力接入方案,或将在文档处理、数据分析等企业级应用场景中产生实际价值。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
海洋科学计算进入深水区,国产算力从可用走向好用
上一篇 8小时前
倍市得发布 《2025客户体验管理白皮书》,挖掘客户体验的多元化价值
下一篇 2025年2月28日 上午8:36

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部