8月21日,DeepSeek宣布全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp正式上线。
DeepSeek官方将该模型定义为“一个实验性质的模型”,用户可通过设置model='deepseek-v4-flash-vision-exp'进行访问。
在性能方面,该模型纯文本能力与DeepSeek-V4-Flash正式版保持同一水平。但在需要视觉理解的Agent Benchmark上,新模型相比DeepSeek-V4-Flash实现了大幅跃升。
在API服务方面,多模态API支持Chat Completions、Messages、Responses三种格式调用,支持图文混合输入,支持base64内联、外部URL、Files API三种图片传入方式。
计费模式方面,此次实验版本依然突出性价比。图片会按尺寸换算成Token后计费,一张图片最多占384 Tokens。费率与V4-Flash一致——输入1元/百万Token,输出2元/百万Token。价格较同类多模态模型有明显优势。
值得注意的是,DeepSeek同步上线了免费的Files API,用户可先将图片上传至平台,再通过file_id在多个请求中引用,无需重复上传,节省请求带宽。
尽管此次模型被官方定义为实验性质,但在业内人士看来此次更新战略意义重大。
记者注意到,DeepSeek此前在纯文本大模型领域已有V4-Flash和V4-Pro两大主力,但视觉理解能力长期缺席。此次Vision模型上线,标志着DeepSeek正式切入多模态赛道。
值得注意的是,就在昨日,DeepSeek Harness刚完成v0.1.0-rc.8版本更新,新增原生图片请求支持,今日模型即上线,节奏紧凑。
招商证券此前研报指出,DeepSeek Harness的战略意图是成为“Agent时代的安卓”,通过定义运行标准增强开发者绑定度。此次视觉模型的加入,恰恰补上了Harness多模态能力的关键一环。
行业竞争格局生变。当前多模态大模型赛道竞争日趋激烈,OpenAI、Anthropic、谷歌等巨头均有布局。
高盛此前研报指出,DeepSeek V4的核心意义在于以更低成本支持更复杂的智能体应用落地。有业内工程师认为,此次视觉版以实验性模型(Exp)先行试水,既控制了风险,又抢占了窗口期。
作者:罗茂林
来源:上海证券报微信公众号