DeepSeek-VL2 详细介绍
DeepSeek-VL2 介绍
阔别九月,大家期待的 DeepSeek-VL2 终于来了!DeepSeek-MoE 架构配合动态切图,视觉能力再升级。从视觉定位到梗图解析,从 OCR 到故事生成,从 3B、16B 再到 27B,DeepSeek-VL2 正式开源。

模型亮点
数据
- 比一代 DeepSeek-VL 多一倍优质训练数据,引入梗图理解、视觉定位、视觉故事生成等新能力
架构
- 视觉部分使用切图策略支持动态分辨率图像,语言部分采用 MoE 架构
训练
- 继承 DeepSeek-VL 的三阶段训练流程,同时通过负载均衡适配图像切片数量不定的困难,对图像和文本数据使用不同流水并行策略,对 MoE 语言模型引入专家并行,实现高效训练

模型和论文均已发布
测评结果
DeepSeek-VL2 模型展现出了符合我们预期的强大能力,在各项评测指标上均取得了极具优势的成绩:


案例展示
动态分辨率支持
DeepSeek-VL2 仅使用一个 SigLIP-SO400M 作为图像编码器,通过将图像切分为多张子图和一张全局缩略图来实现动态分辨率图像支持。这一策略使得 DeepSeek-VL2 最多支持 1152×1152 的分辨率和 1:9 或 9:1 的极端长宽比,适配更多应用场景。

图表理解
更多科研文档数据的学习使得 DeepSeek-VL2 可以轻易理解各种科研图表。

Plot2Code
DeepSeek-VL2 同时具备图像理解和代码生成的功能,可以作为你逆向画图的好帮手。

Prompt: Draw a plot similar to the image in Python.
梗图识别
更大规模的训练数据赋予了 DeepSeek-VL2 解析各种 Meme 的能力,有时它甚至懂得比你还要多。

Visual Grounding
大模型的能力绝不仅限于封闭类别的物体识别。
Zero-shot grounding
你可以用任意的自然语言进行描述,然后让 DeepSeek-VL2 帮你在图像里找到符合描述的部分(注:模型本身只是输出相应物体的边界框,而不会直接在原图上绘制边界框,下同)。例如,DeepSeek-VL2 可以在下图里找到 "DeepSeek Whale" (DeepSeek 吉祥物虎鲸):

In-context grounding
你也可以给 DeepSeek-VL2 一个示例,让它有样学样:

Prompt: <|grounding|>In the first image, an object within the black ellipse is highlighted. Please locate the object of the same category in the second image. (在第一张图中有一个物体被黑色椭圆包裹住。在第二张图中找到同类别的物体。)
Grounded conversation
视觉感知+语言推理,强强联手成就模型的视觉语义对话能力。如果你拿着下图问模型 "If you feel hot, what will you do?(如果感觉热,你会怎么做?)",它会回答:"To cool down, you can use <|ref|>the fan<|/ref|><|det|>166, 460, 338, 712<|/det|> which is sitting on the desk.(为了降温,你可以使用 166, 460, 338, 712 位置处的风扇,它放在桌子上)"

Visual Storytelling
你也可以输入多张图像,让模型把它们串联起来,形成一个小小的童话故事。

视觉模型的未来
视觉是人类获取外界信息的主要来源,占据所有信息量的约 80%。然而在大模型时代,视觉方面的进展却远远落后于语言模型。我们坚信,提升模型视觉能力的意义不仅在于支持更多的输入模态,更在于全方位提升模型的感知和认知能力。欢迎加入 DeepSeek,和我们一起探索 AGI 的星辰大海。—— End ——

热门API
- 1. AI文本生成
- 2. AI图片生成_文生图
- 3. AI图片生成_图生图
- 4. AI图像编辑
- 5. AI视频生成_文生视频
- 6. AI视频生成_图生视频
- 7. AI语音合成_文生语音
- 8. AI文本生成(中国)
最新文章
- API文档:深入指南与前沿免费工具 – Apidog
- 交叉熵的Numpy实现:从理论到实践
- Google DeepMind发布 Genie 3与Shopify:2小时上线电商3D样板间实战
- Gemini Deep Research 技术实战:利用 Gemini Advanced API 构建自动化的深度研究 Agent
- FLUX.1 Kontext API 使用完全指南:解锁文本驱动的智能图像编辑
- 如何防范User-Agent信息伪装引发的API访问风险
- 苹果支付流程:从零开始的接入指南
- 全面掌握 OpenAPI 规范:定义、生成与集成指南
- 深入解析granularity是什么?颗粒度中文详解
- 开发者如何利用缓存技术提升API性能
- Orbitz API 全攻略:旅行社高效整合酒店、航班与租车服务的必读指南
- REST API命名规范的终极指南:清晰度和一致性的最佳实践