根据公开资料,当前阶段的核心信息是DeepSeek公布了V4-Flash-Vision-Exp模型的权重,该模型作为V4系列首款实验性多模态模型,建立在V4-Flash架构之上。这一发布标志着DeepSeek在多模态能力方面迈出了重要一步。
回顾已完成的步骤来看,DeepSeek于十天前公布了V4-Flash-Vision-Exp模型,该模型的规模约为3050亿参数。这为研究人员和开发者提供了一个可供深入研究和测试的资源点。
在关键性能指标方面,DeepSeek的V4-Flash-Vision-Exp模型与Anthropic多模态大模型Claude Opus 4.8进行了对比测试。具体到ApexBench测试中,DeepSeek的V4-Flash-Vision-Exp Pass@1得分为36.5,低于Anthropic多模态大模型Claude Opus 4.8的39.4分。然而,在Agents' Last Exam测试中,DeepSeek取得了27.3分,高于Anthropic多模态大模型Claude Opus 4.8的25.7分。此外,在ZeroBench测试中,DeepSeek的Pass@5成绩为35.0,也高于Anthropic多模态大模型Claude Opus 4.8的34.0。
从技术迭代的角度看,V4-Flash-Vision-Exp版本相比其前身V4-Flash-0731有了提升。在Terminal Bench 2.1测试中,V4-Flash-Vision-Exp版本取得了83.9分,而此前DeepSeek V4-Flash-0731的成绩为82.7分。
关于模型输入和处理流程,根据DeepSeek API文档,该模型支持JPEG、PNG、GIF和WebP图片格式,并且可以接收单张或多张图片。值得注意的是,进入模型的图片会根据尺寸进行缩放,较大的图片最终会被压缩到总像素量约相当于800×800的水平。
在纯文本能力方面,DeepSeek将V4的纯文本能力概括为与V4-Flash“持平”,这表明其基础语言理解和生成能力保持了稳定的高水准。
时间线梳理显示,此次公布的V4-Flash-Vision-Exp模型权重开放,是DeepSeek在多模态领域持续推进的关键节点。从前一个版本到当前实验性模型的发布,体现了公司对提升跨模态处理能力的不懈努力。
影响分析方面,不同测试集上的表现差异(如ApexBench与Agents' Last Exam的对比)提示用户在使用该模型时,需要根据具体的应用场景和评估维度来判断其相对优势。例如,在Agent任务执行层面,DeepSeek V4-Flash-Vision-Exp展现出领先性。
读者提示:对于关注多模态AI性能的用户,建议重点关注不同基准测试(如ApexBench、Agents' Last Exam等)的得分差异,而非单一指标的绝对高低,以全面评估模型在特定任务上的适用性。同时,了解其对输入图片格式和尺寸的处理机制也是关键的技术细节。
来源限定说明:以上所有信息均基于观察者网报道的公开资料进行梳理,仅限于该单篇来源提供的内容,不代表其他任何第三方机构的评估或结论。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。