云导航 CloudNavi
← 返回文章列表
【2026】Qwen3.6-35B Genesis Hermes GGUF 完全指南!在本地 PC 运行无审查多模态 MoE 的方法
AI 模型·1 分钟阅读
#Qwen#GGUF#本地 AI#MoE#Uncensored

文章摘要

「想在自有 PC 上自由运行最新的大模型」

【2026】Qwen3.6-35B Genesis Hermes GGUF 完全指南!在本地 PC 运行无审查多模态 MoE 的方法


「想在自有 PC 上自由运行最新的大模型」 「但云端花钱,又在意审查……」

2026 年当下备受关注的是 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF

这是以阿里巴巴的 Qwen3.6 为基础,打磨成「无审查(Uncensored)」+「Hermes 智能体特化」+「GGUF 格式(本地 PC 可运行)」的模型。还是能读图像的多模态(MoE)。

本文以初学者也能看懂的方式,完整讲解这个模型的特征和在自家 PC 上实际运行的方法。


本文你将了解

  • Qwen3.6-35B Genesis Hermes 是什么
  • 为什么「无审查」令人高兴
  • 在本地 PC 运行所需的配置
  • llama.cpp / Ollama 的安装步骤
  • 推荐的量化(轻量运行的技巧)
  • 相关硬件

什么是 Qwen3.6-35B Genesis Hermes

简单说,就是 「把阿里巴巴最新的 MoE 模型 Qwen3.6,做得更方便、更自由的本地版」

3 个要点

① 无审查(Uncensored) 普通公开模型内置「不回答特定话题」的过滤器。这个模型是去除该限制的「Uncensored」版。适合研究・开发用途,使用更自由。

② Hermes 智能体特化 用 NousResearch 的 Hermes 数据集微调,擅长「AI 使用工具(函数调用・智能体行为)」。最适合想做自动化・工具联动的人。

③ GGUF 格式 = 本地 PC 可运行 GGUF 是 llama.cpp 等推理软件可读取的格式。无需云端,把模型放到自己的 PC 上即可运行。

基本规格

项目
总参数35B(350 亿)
激活参数3B(MoE)
格式GGUF(支持 llama.cpp 等)
支持文本+图像(多模态)
许可证apache-2.0
推荐量化APEX quant(面向 RTX 3060 12GB)

因为是 MoE(混合专家)模型,总参数虽为 35B,实际计算约 3B。所以兼具「大模型的知识」与「轻量运行」。

MoE 工作方式图

为什么 35B 能在 12GB VRAM 上运行总参数 35B知识分散存储在全部专家中输入 Token选择要激活的专家激活 3B只计算这部分效果:计算量约为总参数的十分之一Q4_K_M 量化 + 12GB VRAM 即可在自家 PC 运行同时拥有「大模型的知识」激活 3B 也能调用分散在 35B 中的深层知识

为什么在本地运行?

与云端 API(ChatGPT 等)不同,本地模型有明确优势:

  • 隐私:输入数据不会发送到外部
  • 运行成本 0 元:无 API 计费,可无限次使用
  • 自由定制:可按自己喜好调整
  • 离线运行:没有网络也能用

特别是这个「无审查」模型,适合想按自己的规则自由使用的开发者


所需配置

在本地舒适运行的参考:

量化所需 VRAM参考 GPU
Q4_K_M(推荐)约 12GBRTX 3060 / 4070
Q5_K_M约 16GBRTX 4060Ti / 4070Ti
Q8 / F16约 24GB+RTX 4090

用 Ollama 运行(最简单)

# 拉取模型
ollama pull qwen3.6-35b-genesis-hermes

# 运行
ollama run qwen3.6-35b-genesis-hermes

用 llama.cpp 运行

# 构建(支持 CUDA 时)
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release

# 运行(ngl 99 = 尽量使用 GPU)
./build/bin/llama-cli \
  -m ./qwen3.6-35b.Q4_K_M.gguf \
  -p "你好" \
  -n 512 \
  -ngl 99

-ngl 99 是最大化利用 GPU 的选项。VRAM 不足时请调低数值。


也能读图(多模态)

这个模型支持图像输入。使用 llama.cpp 的多模态支持构建,可以读取照片并让其解说。

./llama-mtmd-cli -m ./model.gguf --mmproj ./mmproj.gguf -i image.png

推荐用法(笔者构思的活用方法)

不只是「聊天」,我提议 3 种发挥这个模型优势的用法:

① 作为本地 AI 智能体的核心 因为 Hermes 特化,擅长函数调用和工具联动。与 Hermes Agent 等智能体框架组合,可以打造专属自动化助手。

② 私密的研究・开发 无审查,因此也能用于普通公开模型难以回答的专业实验・分析。

③ 离线的写作・灵感发散 无需网络即可运行,因此在移动中或通信受限环境下也能作为高性能 AI 助手使用。


注意事项(如实的缺点)

只写优点会失去信任,所以也如实列出缺点:

  • 12GB VRAM 能跑,但输出速度取决于 GPU:RTX 3060 会稍慢
  • 多模态需要额外文件(mmproj)
  • Uncensored 带来的责任:越自由,伦理使用越需要自我管理
  • 擅长中文,但英语・日语的精度倾向更高(视任务而定)

常见问题(FAQ)

Q1. 可以免费使用吗?

可以,模型本身以 apache-2.0 许可证公开,免费。llama.cpp 也是开源软件。

Q2. Mac 能跑吗?

可以,llama.cpp 支持 Apple Silicon。内存(RAM)足够就能运行。

Q3. 8GB VRAM 能跑吗?

用 Q2_K 等轻量量化有可能,但 35B 级别建议最低 12GB 以上。

Q4. 比 ChatGPT 聪明吗?

取决于任务。特定用途(智能体・本地・重视隐私)有利,但综合对话质量有时不如顶级云端模型。

Q5. 真的能读图吗?

可以,准备好多模态构建和 mmproj 文件即可读取。


总结

Qwen3.6-35B Genesis Hermes GGUF 是 「无审查・Hermes 特化・本地运行」三者兼备的 2026 年关注模型

  • 基于阿里巴巴 Qwen3.6 的 MoE(35B 总/3B 激活)
  • 无审查,自由使用
  • 多模态,能读图
  • 12GB VRAM 即可在自家 PC 舒适运行

想做本地 AI、想保护隐私、想打造专属智能体的人,这是现在就该试的不二之选。


相关文章


推荐阅读