
文章摘要
「想在自有机器上运行 DeepSeek V4 Flash。但 VRAM 不够……」
【2026】DS4Flash(DeepSeek V4 Flash)本地运行完全指南!最大化 96–128GB VRAM
「想在自有机器上运行 DeepSeek V4 Flash。但 VRAM 不够……」
解决这个烦恼的就是 DS4Flash。它是为了在本地环境运行 DeepSeek V4 Flash 而极限量化的 GGUF 模型。Vitalik Buterin 请求 GGUF 版而成为话题的这个模型,只要有 96–128GB VRAM,就能用 llama.cpp 完全本地运行。
本文完整讲解如何在 DGX Spark(128GB)、Mac Studio、GMKtec EVO-X2 等高端机器上运行 DS4Flash,包括最大化内存利用的配置。
先看结论:96GB 以上统一内存即可实用运行
| 问题 | 答案 |
|---|---|
| DS4Flash 是什么? | 将 DeepSeek V4 Flash 用 q2/reap+q4 超量化的 GGUF 模型 |
| 所需 VRAM? | 96–128GB。统一内存(UMA)环境最合适 |
| 在什么机器上运行? | DGX Spark / Mac Studio / GMKtec EVO-X2 等 |
| 速度? | 20–40 tokens/s。聊天完全够用 |
| 安装难度? | 会用 llama.cpp 的话约 30 分钟 |
| 为什么量化重要? | 完整模型约 700GB。量化压缩到 96GB |
什么是 DS4Flash
DS4Flash 是为本地运行而量化 DeepSeek 发布的 DeepSeek V4 Flash 的 GGUF 模型。
核心技术:q2/reap + q4 两阶段量化
普通 DeepSeek V4 Flash 采用 MoE(Mixture of Experts)架构,总参数约 700GB(FP16 换算)。直接放到本地事实上不可能。
于是登场的是 q2/reap + q4 两阶段量化:
| 量化方式 | 压缩率 | 对质量的影响 | 用途 |
|---|---|---|---|
| **q2(reap)** | 约削减 90% | 轻微。MoE 路由部分尤其有效 | 模型整体的基础量化 |
| **q4** | 约削减 75% | 几乎可忽略 | 应用于注意力层等重要部分 |
| **2bit + 4bit 混合** | 约削减 85% | 实用上无问题 | DS4Flash 的核心技术 |
两阶段量化概念图
通过这种组合,将 700GB 级模型压缩到 96GB,同时保持实用质量。
为什么 Vitalik Buterin 会请求
2026 年 5 月,以太坊联合创始人 Vitalik Buterin 在 X 上发帖「想要本地运行的 DeepSeek V4 Flash GGUF 版」。响应此请求,本地 LLM 实践者 0xSero 立刻上传了量化版,成为话题。
Vitalik 本人爱用 DGX Spark(128GB 统一内存),「想在自家机器上运行 Claude 级模型」的需求加速了 DS4Flash 的开发。
所需硬件:96–128GB 统一内存是关键
要运行 DS4Flash,96GB 以上 VRAM(或统一内存) 是必要条件。普通 GPU(RTX 5090 32GB)绝对跑不动。
支持机器一览
| 机器 | 内存 | 可分配 VRAM | 预期速度 | 价格区间 |
|---|---|---|---|---|
| DGX Spark | 128GB 统一 | 最大 110GB(Linux) | 30–40 tok/s | 约 $3,000 |
| Mac Studio(M3 Ultra) | 128GB 统一 | 最大 96GB | 25–35 tok/s | 约 $5,000 起 |
| GMKtec EVO-X2 | 128GB LPDDR5X | 最大 110GB(Linux) | 20–30 tok/s | 约 $2,000 |
| Ryzen AI Max+ 395 机型 | 128GB 统一 | 最大 110GB | 20–30 tok/s | 约 $1,500 起 |
| MacBook Pro(M3 Max) | 128GB 统一 | 最大 96GB | 20–25 tok/s | 约 $6,000 起 |
| DIY PC + 2x RTX 3090 | 48GB x2 | 96GB | 35–45 tok/s | 约 $3,000 起 |
统一内存(UMA)最合适的理由
- CPU 与 GPU 共享内存:无需复制数据,可把内存的大部分用作 VRAM
- 单机即可运行超大模型:这是 DS4Flash 能在家用机器运行的前提
- Linux 下分配更灵活:Windows 的 GPU 内存分配受限,因此推荐 Linux
安装步骤(llama.cpp)
1. 构建 llama.cpp
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release
2. 下载 DS4Flash GGUF
从 Hugging Face 获取 0xSero 发布的量化版 GGUF。推荐 q4(128GB 机器)或 q2/reap(96GB 机器)。
3. 启动
./build/bin/llama-cli \
-m ./ds4flash-q4.gguf \
-ngl 99 \
-c 32768 \
--n-cpu-moe 0
-ngl 99:尽可能把层放入 GPU-c 32768:32K 上下文--n-cpu-moe 0:让 MoE 专家也在 GPU 上运行(最大化利用)
4. 用 OpenAI 兼容 API 启动(用于 Cursor 等)
./build/bin/llama-server \
-m ./ds4flash-q4.gguf \
-ngl 99 \
-c 32768 \
--port 8080
之后在 Cursor / Continue.dev 中把 http://localhost:8080/v1 设为 OpenAI 兼容端点即可。
推荐用法(笔者构思)
① 作为本地 AI 智能体的核心 通过 OpenAI 兼容 API,与 Cursor、Continue.dev、Hermes Agent 等联动,打造专属自动化助手。
② 私密文档处理 机密信息不会送出机器。适合内部政策严格的企业环境。
③ 离线编码助手 即使没有网络,也能使用接近 Claude 和 GPT-5 质量的模型。
适合谁 / 不适合谁
| 用户类型 | 推荐度 | 理由 |
|---|---|---|
| AI 重度用户(月 $100 以上) | ★★★★★ | 半年可回本。完全本地无限制 |
| 处理机密信息的工程师 | ★★★★★ | 数据不外泄。也符合内部政策 |
| 对本地 AI 感兴趣的技术爱好者 | ★★★★ | 可体验 2026 年最强本地 LLM。但需要初期投资 |
| 想自运营 AI 智能体的开发者 | ★★★★ | 用 OpenAI 兼容 API 联动 Cursor 和 Continue.dev |
| 普通程序员 | ★★★ | 8B–70B 模型往往够用。DS4Flash 略超规格 |
| AI 初学者・学生 | ★★ | 先从 8B 模型(LFM-2.5-8B 等)开始更现实 |
常见问题(FAQ)
Q1: RTX 5090(32GB)能跑吗?
跑不动。 DS4Flash 需要 96GB 以上内存。RTX 5090 只有 32GB,连模型都加载不了。多 GPU 配置(2x RTX 3090 等)可以,但此时也需要 SLI/NVLink。
Q2: q2/reap 版和 q4 版选哪个?
内存有余选 q4,没有选 q2/reap。 96GB 机器选 q2/reap,128GB 机器选 q4。质量差在实际对话中几乎感受不到。
Q3: Windows 能跑吗?
能跑,但性能不如 Linux。 Windows 限制统一内存的 GPU 分配,128GB 中最多只能把约 48GB 用作 VRAM。要最大化利用 DS4Flash 推荐 Linux(Ubuntu)。
Q4: Ollama 能用吗?
目前不支持。 DS4Flash 使用特殊量化方式(q2/reap),标准 Ollama 无法加载。需要直接用 llama.cpp。未来 Ollama 更新可能支持。
Q5: 能微调吗?
可能,但因超大而现实性低。 用 QLoRA 理论上可行,但考虑所需内存和时间,找现成的微调 GGUF 更现实。
Q6: DGX Spark 和 GMKtec EVO-X2 选哪个?
预算允许选 DGX Spark,性价比选 EVO-X2。 DGX Spark(约 $3,000)是 NVIDIA 正统,运行稳定。EVO-X2(约 $2,000)搭载 AMD Ryzen AI Max+ 395,Linux 配置得当可接近 DGX Spark 的性能。
Q7: 数据隐私完全受保护吗?
是的。完全本地。 下载一次模型后,之后的推理全部在自有机器内完成。也不需要互联网连接。
Q8: 这个模型能做代码生成吗?
可以。 作为通用对话模型非常优秀,覆盖代码生成、文章写作、翻译、摘要等广泛领域。虽然不如代码特化模型(DeepSeek Coder 系)专精。
最终推荐总结
DS4Flash 是 2026 年当下,本地能运行的最强通用 LLM。只要有 96GB 以上 UMA 机器,就能在家运行匹敌 Claude 和 GPT-5 的模型。
按类型推荐:
| 你的情况 | 推荐选择 |
|---|---|
| 已经有 128GB Mac Studio | 毫不犹豫安装 DS4Flash q4 版 |
| 在犹豫买不买 DGX Spark | 买。与 DS4Flash 的组合最强 |
| 在考虑 GMKtec EVO-X2 | 买。Linux 配置下达到 110GB VRAM 则 DS4Flash 舒适 |
| 还没有任何机器 | 先用 8B 模型(LFM-2.5-8B)熟悉本地 AI,再升级 DS4Flash |
| 正在订阅月 $200 的 ChatGPT Pro | DS4Flash + DGX Spark 或 EVO-X2,半年回本 |
本文信息截至 2026 年 6 月。模型版本和价格可能不经预告变更。
推荐阅读
この記事をシェアする
相关文章

2026年7月19日
【2026】Agents-A1(35B MoE)是什么?小参数却能做这些 —— 惊艳的智能体专用模型深度分析

2026年7月18日
【2026】Qwen3.6-35B Genesis Hermes GGUF 完全指南!在本地 PC 运行无审查多模态 MoE 的方法

2026年6月16日
【2026】AI 模型 API 价格完全比较!ChatGPT vs Claude vs Gemini vs DeepSeek vs MiMo

2026年6月17日
【2026】小米 MiMo API 完全解读!与 DeepSeek 同价的多模态 AI 模型

2026年6月26日
【2026】Ornith-1.0 完全解读!超越 Claude Opus・MIT 许可的最强 AI 编码模型

2026年6月26日
【2026】Qwen-AgentWorld 完全解读!让 AI 预测「环境」而非「行动」的革命性方法