}


不是,DeepSeek 又悄摸更新了?

就在今天下午,DeepSeek 发布了新模型DeepSeek-V4-Flash-Vision-Exp

名字忒长,但核心就一点,Vision 视觉能力。没错,等星星盼月亮,大鲸鱼它终于开眼了。。。


直接看跑分,装上眼睛后,相比老的 0731 版本,一些 Agent 评测成绩出现了明显跃升,跟 Claude Opus 4.8 也能打得有来有回。


而且与此同时,DeepSeek Harness ( DSH ) 也在第一时间进行了适配,图谋已久了属于是。

要知道,之前想给 DSH 的 V4 Flash 发张图,那大概率回你的是不好意思,俺瞅不见。


想要识图,就得去安装第三方的插件,然后再吭哧吭哧配置识图模型的 API,为这事儿,开发者们没少抱怨。

不过现在就简单多了,大伙儿想体验的,只要把 DSH 更新一下,就能在模型选择栏看到 “ deepseek-v4-flash-vision-exp ” 了。


话不多说,咱也直接开测。

先来个最简单的识图,直接把它老板的照片扔进去,看它认不认得。

刚开始我是拿 Codex 试的,速度相当快,但推理太过保守,认出特征就止步了,说是不给信息它不敢瞎猜。。。


那咋行,咱直接切到官方的 DSH,兼容更好一点,果然不保守了,会自己上网搜信息对比。

但结果么,我一口老盐汽水差点喷出来,它都能看到刘海,眼镜和蓝色西装了,甚至还锁定了 AI 行业的领军人物,结果最后认成了隔壁月之暗面的杨植麟。


好家伙,过程全对,结果全错,不想领工资了是吧?

接下来我又从一部神秘电影中,截了张图丢给它,看看它知不知道出自哪儿。


很快啊,两眼一扫,告诉我草地上有两头拟人化的牛,还说这画风多少有点黑色幽默。

不过接着就又开始要信息了,我让它自己去搜,它调查了一会儿,终于认出来出自《牛来》。


然后我又甩给它一张杭州地标的图片,3.5 秒,它就认出来了是奥体中心的大莲花。

作为对比,多模态大哥大的 Gemini 也用了 3.8 秒,速度这一块儿没毛病。


从这儿也能看出,DeepSeek-V4-Flash-Vision-Exp 的多模态调教得比较保守,基础的世界知识储备是有的,但再细一些的信息,就习惯于调用联网工具进行补充,说白了,还是要跟 DeepSeek Harness 打配合。

那咱干脆就直接上开发任务,感受一下,加了多模态后,干起活来有多爽。

直接丢给它一张《星际穿越》里的黑洞照片,让它复刻一。。。


诶,不是,怎么还限制大小啊,高于 3.5M 不让传,略拉了好吧。

看官方文档,发现大小倒是其次,因为即使上传进去,这次的多模态也会自动缩放,不过每张图片最多消耗384个 token,也挺实惠了。

那咱先手动压缩一下继续干,让它根据图片造一个网页版的黑洞,看看效果。


一番折腾后,黑洞搓出来了,看着有点一般。

我给的是 9:16 的竖屏图,所以它也搓了个竖屏的;而且图中有个飞船,它也顺手给造出来了,不说样子如何,看得确实挺准。。。


接下来咱直接截图给它,让它自己看着修,再喂一张更酷炫的,让它优化视觉效果。


不一会儿,最终成品出来了,果然,它自己也能瞅着刚刚的效果太不像话了,直接整体大换血,根据新图片的效果重构了黑洞。

这回也没彩虹飞船了,黑洞周围也有变形效果了,整体的质感向第二幅图靠齐,直接起飞。

除此之外,官方公告里还有个很丝滑的 PPT,用裁切,排版的方式将图片融入到了文案之中,咱也来复刻一手。

把场景从雪山换成雨林,稍微改改提示词,这回它足足捣鼓了半小时,才交出了 PPT。

当然,这效果也是顶中顶,整体配色和主题一致,用了深绿加淡黄的色彩,有种木头的质感。


图片内容也能跟 PPT 讲解的东西一一对应,翻看思维链能看到,它是真的带着眼睛干活儿,哪张图不对会剔掉,图片太多了,也能自己看着挑一挑。


其中印象比较深的还有背景的动效,尤其是森林和亚马逊河当底图的时候,看着像是镜头在缓慢推进,相当高级。

话说回来,现在这些大模型厂商确实越来越重视多模态了。

除了 DeepSeek 之外,今天早上,还有个没有透露来路神秘的模型 Ox Alpha ( 简称牛来 ), 也突然在全球知名的大模型中转站 OpenRouter 里上线测试。


具体是哪家的大家都还说不明白,有猜小米的,有猜腾讯的,还有猜是智谱的。。。


众说纷纭,但是梗图已经搓的满天飞了。


再往前,还有不忘初心的 Gemini,即使 Pro 难产,已经连更 3 个 Flash 模型了,多模态这块仍旧是扛把子。

乃至于 GPT,Claude 的旗舰模型,即使不像 Gemini 那样专一,但考虑到通用场景,也会尽量补一些多模态的能力,让用户用起来更顺手。

没办法,这就是大伙儿一个 token 一个 token 试出来的经验。

不过按照现在模型的更新频率,DeepSeek 的下一个多模态模型可能已经在路上了。。。

撰文:风华

编辑:江江 & 面线

美编:焕妍

图片、资料来源

DeepSeek公众号,X,DeepSeek Harness,部分图源网络