
文章摘要
「想在自有 PC 上自由运行最新的大模型」
【2026】Qwen3.6-35B Genesis Hermes GGUF 完全指南!在本地 PC 运行无审查多模态 MoE 的方法
「想在自有 PC 上自由运行最新的大模型」 「但云端花钱,又在意审查……」
2026 年当下备受关注的是 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF。
这是以阿里巴巴的 Qwen3.6 为基础,打磨成「无审查(Uncensored)」+「Hermes 智能体特化」+「GGUF 格式(本地 PC 可运行)」的模型。还是能读图像的多模态(MoE)。
本文以初学者也能看懂的方式,完整讲解这个模型的特征和在自家 PC 上实际运行的方法。
本文你将了解
- Qwen3.6-35B Genesis Hermes 是什么
- 为什么「无审查」令人高兴
- 在本地 PC 运行所需的配置
- llama.cpp / Ollama 的安装步骤
- 推荐的量化(轻量运行的技巧)
- 相关硬件
什么是 Qwen3.6-35B Genesis Hermes
简单说,就是 「把阿里巴巴最新的 MoE 模型 Qwen3.6,做得更方便、更自由的本地版」。
3 个要点
① 无审查(Uncensored) 普通公开模型内置「不回答特定话题」的过滤器。这个模型是去除该限制的「Uncensored」版。适合研究・开发用途,使用更自由。
② Hermes 智能体特化 用 NousResearch 的 Hermes 数据集微调,擅长「AI 使用工具(函数调用・智能体行为)」。最适合想做自动化・工具联动的人。
③ GGUF 格式 = 本地 PC 可运行 GGUF 是 llama.cpp 等推理软件可读取的格式。无需云端,把模型放到自己的 PC 上即可运行。
基本规格
| 项目 | 值 |
|---|---|
| 总参数 | 35B(350 亿) |
| 激活参数 | 3B(MoE) |
| 格式 | GGUF(支持 llama.cpp 等) |
| 支持 | 文本+图像(多模态) |
| 许可证 | apache-2.0 |
| 推荐量化 | APEX quant(面向 RTX 3060 12GB) |
因为是 MoE(混合专家)模型,总参数虽为 35B,实际计算约 3B。所以兼具「大模型的知识」与「轻量运行」。
MoE 工作方式图
为什么在本地运行?
与云端 API(ChatGPT 等)不同,本地模型有明确优势:
- 隐私:输入数据不会发送到外部
- 运行成本 0 元:无 API 计费,可无限次使用
- 自由定制:可按自己喜好调整
- 离线运行:没有网络也能用
特别是这个「无审查」模型,适合想按自己的规则自由使用的开发者。
所需配置
在本地舒适运行的参考:
| 量化 | 所需 VRAM | 参考 GPU |
|---|---|---|
| Q4_K_M(推荐) | 约 12GB | RTX 3060 / 4070 |
| Q5_K_M | 约 16GB | RTX 4060Ti / 4070Ti |
| Q8 / F16 | 约 24GB+ | RTX 4090 |
用 Ollama 运行(最简单)
# 拉取模型
ollama pull qwen3.6-35b-genesis-hermes
# 运行
ollama run qwen3.6-35b-genesis-hermes
用 llama.cpp 运行
# 构建(支持 CUDA 时)
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release
# 运行(ngl 99 = 尽量使用 GPU)
./build/bin/llama-cli \
-m ./qwen3.6-35b.Q4_K_M.gguf \
-p "你好" \
-n 512 \
-ngl 99
-ngl 99 是最大化利用 GPU 的选项。VRAM 不足时请调低数值。
也能读图(多模态)
这个模型支持图像输入。使用 llama.cpp 的多模态支持构建,可以读取照片并让其解说。
./llama-mtmd-cli -m ./model.gguf --mmproj ./mmproj.gguf -i image.png
推荐用法(笔者构思的活用方法)
不只是「聊天」,我提议 3 种发挥这个模型优势的用法:
① 作为本地 AI 智能体的核心 因为 Hermes 特化,擅长函数调用和工具联动。与 Hermes Agent 等智能体框架组合,可以打造专属自动化助手。
② 私密的研究・开发 无审查,因此也能用于普通公开模型难以回答的专业实验・分析。
③ 离线的写作・灵感发散 无需网络即可运行,因此在移动中或通信受限环境下也能作为高性能 AI 助手使用。
注意事项(如实的缺点)
只写优点会失去信任,所以也如实列出缺点:
- 12GB VRAM 能跑,但输出速度取决于 GPU:RTX 3060 会稍慢
- 多模态需要额外文件(mmproj)
- Uncensored 带来的责任:越自由,伦理使用越需要自我管理
- 擅长中文,但英语・日语的精度倾向更高(视任务而定)
常见问题(FAQ)
Q1. 可以免费使用吗?
可以,模型本身以 apache-2.0 许可证公开,免费。llama.cpp 也是开源软件。
Q2. Mac 能跑吗?
可以,llama.cpp 支持 Apple Silicon。内存(RAM)足够就能运行。
Q3. 8GB VRAM 能跑吗?
用 Q2_K 等轻量量化有可能,但 35B 级别建议最低 12GB 以上。
Q4. 比 ChatGPT 聪明吗?
取决于任务。特定用途(智能体・本地・重视隐私)有利,但综合对话质量有时不如顶级云端模型。
Q5. 真的能读图吗?
可以,准备好多模态构建和 mmproj 文件即可读取。
总结
Qwen3.6-35B Genesis Hermes GGUF 是 「无审查・Hermes 特化・本地运行」三者兼备的 2026 年关注模型。
- 基于阿里巴巴 Qwen3.6 的 MoE(35B 总/3B 激活)
- 无审查,自由使用
- 多模态,能读图
- 12GB VRAM 即可在自家 PC 舒适运行
想做本地 AI、想保护隐私、想打造专属智能体的人,这是现在就该试的不二之选。
相关文章
推荐阅读
この記事をシェアする
相关文章

2026年7月19日
【2026】Agents-A1(35B MoE)是什么?小参数却能做这些 —— 惊艳的智能体专用模型深度分析

2026年6月16日
【2026】AI 模型 API 价格完全比较!ChatGPT vs Claude vs Gemini vs DeepSeek vs MiMo

2026年6月17日
【2026】小米 MiMo API 完全解读!与 DeepSeek 同价的多模态 AI 模型

2026年6月25日
【2026】DS4Flash(DeepSeek V4 Flash)本地运行完全指南!最大化 96–128GB VRAM

2026年6月26日
【2026】Ornith-1.0 完全解读!超越 Claude Opus・MIT 许可的最强 AI 编码模型

2026年6月26日
【2026】Qwen-AgentWorld 完全解读!让 AI 预测「环境」而非「行动」的革命性方法