8月21日,深度求索宣布全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp正式上线DeepSeek API平台。该模型在文本输入之外支持图片输入,可完成图片描述、截图文字识别、图表分析等任务,支持的图片格式包括JPEG、PNG、GIF和WebP。
据深度求索官方介绍,V4-Flash-Vision-Exp在各类Agent框架内展现出较好的多模态适配能力,能够有效支持用户借助多样化的Agent工具解锁更多实用工作场景。该模型为实验性质,用户可通过设置model=’deepseek-v4-flash-vision-exp’进行访问。
在模型能力方面,DeepSeek-V4-Flash-Vision-Exp的纯文本能力(包括Agent、推理、世界知识等)与DeepSeek-V4-Flash正式版持平。而在需要视觉理解的Agent Benchmark上,该模型相比DeepSeek-V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8。
API服务方面,图片在传入后会转换为token并按token计费,单张图片最多占用384个token,计费价格与V4-Flash模型保持一致。多模态API支持Chat Completions、Messages、Responses三种格式调用,可方便接入各类Agent工具,支持图文混合输入,并提供base64内联、外部URL、Files API三种图片传入方式。
同期上线的还有Files API。该API不收费,用户可先将图片上传至平台,再在请求中通过file_id引用,从而节省请求带宽,同一张图片在多个请求中无需重复上传。
此次多模态模型的发布,进一步丰富了深度求索在视觉理解领域的产品矩阵。随着Agent工作流对多模态输入需求的增长,该模型的推出为开发者提供了更灵活的视觉理解能力接入方案,或将在文档处理、数据分析等企业级应用场景中产生实际价值。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。