
文章摘要
DeepSeek 把「看得见的 AI 智能体」——GUI 操作、图表理解、看图行动——以接近 Opus-4.8 的性能开源了。这是 2026 年值得关注的发布。
DeepSeek-V4-Flash-Vision-Exp 指南 2026:DeepSeek 首个多模态 AI 智能体模型详解
本文你能学到
- DeepSeek-V4-Flash-Vision-Exp 是什么、为什么值得关注
- DeepSeek 首个多模态(视觉)模型的工作原理
- 文本与多模态智能体的基准测试结果
- 与 Opus-4.8 的真实差距(诚实评价)
- API 用法与本地运行的现实
- 它能做什么、不能做什么
结论先行:DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 首个「能看图行动」的多模态 AI 智能体
2026 年 8 月 31 日,DeepSeek 发布了 V4 家族首个实验性多模态模型。
DeepSeek-V4-Flash-Vision-Exp(https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp)在以文本为主的 DeepSeek-V4-Flash 上加入视觉模块,通过持续训练获得图像理解能力。
- 文本智能体性能与 V4-Flash-0731 持平的同时
- 多模态智能体性能大幅提升(ApexBench 26.2→36.5、Chartography 64.3、ZeroBench 35.0)
- MIT 许可证・Hugging Face 免费公开(53 赞・发布当天)
- 总参数 304.6B 的巨型 MoE(256 个专家・每次激活 6 个)
- 模型文件约 168GB——个人本地运行不现实
结论:DeepSeek 把「看得见的 AI 智能体」——GUI 操作、图表理解、看图行动——以接近 Opus-4.8 的性能开源了。这是 2026 年值得关注的发布。
DeepSeek-V4-Flash-Vision-Exp 是什么?基本信息
| 项目 | 内容 |
|---|---|
| 模型名 | DeepSeek-V4-Flash-Vision-Exp |
| 开发商 | DeepSeek AI |
| 发布日期 | 2026 年 8 月 31 日 |
| 许可证 | MIT(可商用) |
| 定位 | V4 家族首个实验性多模态模型 |
| 架构 | DeepSeek-V4-Flash + 视觉编码器(32 层) |
| 总参数 | 304.6B(MoE・256 专家・激活 6 个) |
| 模型大小 | 约 168GB(fp8 量化) |
| 上下文 | 最大 1,048,576(1M)token |
| 输入 | 文本+图像(多模态) |
厉害在哪:三大要点
1. DeepSeek 首个多模态化
DeepSeek-V4-Flash 以文本为主。Vision-Exp 加入视觉编码器(32 层・dim 1024),把图像转换为语言模型能理解的视觉特征。
2. 多模态智能体性能大幅提升
官方基准(DeepSeek Harness・max reasoning・temperature=1.0):
| 基准 | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| 文本智能体 | |||
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench | 25.7 | 25.1 | 27.2 |
| 多模态智能体 | |||
| ApexBench (Pass@1) | 36.5 | 26.2† | 39.4 |
| Agents' Last Exam | 27.3 | 25.2† | 25.7 |
| Chartography | 64.3 | - | 65.0 |
| ZeroBench (Pass@5) | 35.0 | - | 34.0 |
† V4-Flash-0731 忽略输入中的多模态元素
怎么读这张表:
- 文本智能体:Vision-Exp 与 0731 基本持平(±1-3pt)——加入视觉几乎没有损伤文本性能
- 多模态:ApexBench +10.3pt,接近 Opus-4.8(36.5 vs 39.4)。Chartography、ZeroBench 持平或更好
- Agents' Last Exam:超过 Opus-4.8(27.3 vs 25.7)
3. 巨型 MoE 架构
- 总参数 304.6B・256 个专家・每个 token 只激活 6 个(MoE)
- 实际「激活参数」约 30B 级——推理成本没有总参数那么高
- fp8 量化(E4M3)+8bit 索引压缩到约 168GB
- 上下文最大1M token(Yarn 扩展・64K 原始 × 16)
用法:走 API(推荐)
Hugging Face Transformers
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"deepseek-ai/DeepSeek-V4-Flash-Vision-Exp",
device_map="auto",
)
tokenizer = AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V4-Flash-Vision-Exp")
用 vLLM 提供服务
vllm serve deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
--host 0.0.0.0 \
--port 30000
Docker Model Runner
docker model run hf.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
带图像的提示示例
仓库的 inference/examples/ 提供等价的 TXT 和 JSON(OpenAI 风格)示例。可输入图像(carrots.jpeg、corn.jpeg)并请求描述或分析。
messages = [
{"role": "user", "content": [
{"type": "text", "text": "描述这张图片里的内容。"},
{"type": "image_url", "image_url": {"url": "https://example.com/carrots.jpeg"}},
]}
]
API 支持范围与定价
- 模型 ID:
deepseek-v4-flash-vision-exp - 支持的 API:Chat Completions、Anthropic 兼容 Messages、OpenAI 兼容 Responses
- 图片的传法:base64、外部 URL、Files API(上传一次后用 ID 引用,免费)
- 每张图最多按 384 token 计费。价格与 V4-Flash 相同,视觉部分不额外加价
同日发布的 DeepSeek Harness 0.1.1 开箱即可使用该新模型。
发布与来源
DeepSeek 于 2026 年 8 月 21 日在官方 X 上发布。
- DeepSeek 官方 X 帖文(2026-08-21)(发布内容与基准表)
- DeepSeek API 文档(api-docs.deepseek.com):API 规格与 Files API
- 媒体报道:explainx.ai、officechai.com 等
本地运行的现实(诚实评价)
结论:个人本地运行不现实。
| 项目 | 数值 | 现实解读 |
|---|---|---|
| 总参数 | 304.6B | 巨型 |
| 模型文件 | 约 168GB | 下载量大・存储压力 |
| 所需 VRAM(全载入) | 约 184-200GB | RTX 5090(32GB)不可能 |
| 激活参数 | 约 30B 级 | 推理成本并非总参数那么高 |
- 约 184-200GB VRAM需要6 张 RTX 5090(32GB)或数据中心 GPU(H200 等)
- 专家部分 CPU 卸载可降低,但实际速度存疑
- 现实路径是 API 调用——DeepSeek 官方 API、Hugging Face Inference、vLLM 云等
这个模型是「用 API 调」而不是「在家跑」。所以本文不放 VPS 或迷你主机广告——它们对运行这个模型没有帮助。
诚实评测
优点
- 多模态化没有牺牲文本性能——文本智能体与 0731 持平
- ApexBench 接近 Opus-4.8(36.5 vs 39.4)——视觉智能体顶级水平
- MIT 许可证完全开放——可商用、可修改
- 诚实的「Exp」标注——不过度宣传
注意与局限
- 实验性模型——生产环境未完全验证
- 本地运行不现实(约 184-200GB VRAM)——以 API 为前提
- NL2Repo・DSBench-Hard 与 Opus-4.8 有明显差距(57.7 vs 69.7・63.6 vs 71.7)——并非全面领先
- 发布当天——社区实测才刚刚开始
总结:DeepSeek 把「看得见的 AI 智能体」开源了
- V4 家族首个多模态——文本+图像都能用的 AI 智能体
- 文本性能保持,多模态性能大幅提升
- ApexBench・ZeroBench 逼近 Opus-4.8的开源选择
- MIT 许可证——任何人都可商用
- 本地运行不现实(约 184-200GB VRAM)→ API 是现实解
想试试「看图行动的 AI 智能体」,DeepSeek-V4-Flash-Vision-Exp 是2026 年 8 月最容易上手的开源模型之一。
读者想了解的内容
Q1. 免费吗?
模型本身MIT 许可证免费公开。API 调用(DeepSeek 官方 API 等)按量计费。
Q2. 家里电脑能跑吗?
现实上不行。需要约 184-200GB VRAM,相当于 6 张 RTX 5090。API 是现实解。
Q3. 支持中文吗?
支持。 DeepSeek 系模型中文很强,可以带图问「解释这个图表」。
Q4. 新增了什么能力?
GUI 操作(看屏幕点击)、图表/图形理解、看图行动的智能体任务大幅提升(ApexBench 26.2→36.5)。
Q5. 比 Opus-4.8 强吗?
看项目。 ApexBench 接近(36.5 vs 39.4);Chartography、ZeroBench、Agents' Last Exam 持平或更好。但 NL2Repo、DSBench-Hard 明显落后(57.7 vs 69.7)。
Q6. 能商用吗?
能。 MIT 许可证允许商用、修改、再分发。
相关文章
相关文章

2026年8月1日
【快讯・2026年7月31日】DeepSeek V4 Flash 官方 API 公测上线!智能体性能超越 V4 Pro Preview,原生支持 Claude Code・Codex・OpenCode・Hermes 等 6 款工具

2026年8月15日
【2026】DeepSeek Harness Desktop 完全解析!无需命令即可使用的官方 AI 智能体桌面版(面向新手)

2026年8月18日
【2026】DeepSeek V4 Flash 去审查版(Abliterated GGUF)完全评测!本地运行方法及注意事项

2026年8月14日
【2026】dots3-note Preview 完全解析!RedNote 的 280B MoE 模型为何能与 DeepSeek V4 Flash 正面交锋

2026年9月10日
【2026】DeepSeek V4.1 Flash 正式发布:Pro 请求自动路由,价格最高降 86%

2026年8月31日
OpenClaw 2.0 指南 2026:16,000 个 PR・933 位贡献者打造的 AI 智能体史上最大更新