
文章摘要
Ornith-1.5-35B-A3B 是 DeepReinforce 开发的「35B 参数・3B 激活」的混合专家(MoE)编程模型。
【2026】Ornith-1.5-35B-A3B 本地运行指南:超越 Qwen3.6-35B 的 MoE 模型(量化与硬件配置详解)
📌 本文要点
- Ornith-1.5-35B-A3B 概述(35B MoE・激活 3B 的下一代编程模型)
- 基准测试实力(与 Qwen3.6-35B・Gemma 4-31B 对比)
- 各量化级别的精确内存需求(Q4_K_M 21.7GB 到 BF16 71.1GB)
- 按预算的推荐 PC 配置
- llama.cpp・vLLM 安装步骤
- 注意事项(为什么仅靠 VRAM 不够)
Ornith-1.5-35B-A3B 是什么?
Ornith-1.5-35B-A3B 是 DeepReinforce 开发的「35B 参数・3B 激活」的混合专家(MoE)编程模型。
每个 token 只激活约 3B 参数(A3B = Activated 3 Billion),但其实力在编程和智能体基准测试的所有项目中都超越同尺寸的 Qwen 3.6-35B,并在智能体编程上大幅领先 Gemma 4-31B 和 Muse Glimmer-30B 等稠密模型。
Ornith-1.5 扩展了自我改进循环:联合优化任务生成、脚手架构建和解决方案 rollout。不依赖人工设计的固定任务集,模型持续生成新的训练任务并通过强化学习改进。
基准测试实力(与竞品对比)
| 基准 | Ornith-1.5-35B-A3B | Ornith-1.0-35B-A3B | Qwen3.6-35B-A3B | Gemma-4-31B |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 67.8 | 64.2 | 52.5 | 42.1 |
| SWE-bench Verified | 79.0 | 75.6 | 73.4 | 52.0 |
| SWE-bench Pro | 59.6 | 50.4 | 49.5 | 35.7 |
| SWE-bench Multilingual | 71.4 | 69.3 | 67.2 | 51.7 |
| DeepSWE | 22.0 | 0.0 | 0.0 | - |
| Frontier-Bench v0.1 | 5.1 | 1.4 | 1.4 | - |
| NL2Repo | 46.2 | 34.6 | 29.4 | 15.5 |
| GPQA Diamond | 89.2 | 86.2 | 86.0 | 84.3 |
| MCP-Atlas | 70.2 | 64.4 | 62.8 | 55.0 |
| Toolathlon-Verified | 48.7 | 42.4 | 41.7 | 40.8 |
亮点:
- SWE-bench Verified 79.0 — 大幅领先 Qwen3.6-35B 的 73.4,比 1.0 世代 +3.4pt
- DeepSWE 22.0 — Ornith 1.0 和 Qwen3.6 都是 0.0,它达到 22.0
- GPQA Diamond 89.2 — 科学推理最高水平
- 256K 上下文 — 一次读取整个大型代码库
GGUF 量化与内存需求
Ornith-1.5-35B-A3B 是35B MoE:模型文件很大,但每 token 的计算量只有 3B。
| 量化 | 文件大小 | 推荐 RAM | 推荐 GPU |
|---|---|---|---|
| BF16 | 71.1GB | 192GB | 2× RTX 5090 32GB 或 2× 4090 |
| Q8_0 | 37.8GB | 96GB | RTX 4090 24GB |
| Q6_K | 29.2GB | 96GB | RTX 4090 24GB |
| Q5_K_M | 25.3GB | 64GB | RTX 4060 Ti 16GB |
| Q4_K_M | 21.7GB | 64GB | RTX 4060 Ti 16GB |
※ 仅靠 VRAM 绝对装不下。即使是 Q4_K_M 也有 21.7GB,256K 上下文的 KV 缓存还需要约 20GB。CPU+GPU 混合配置是必须的。
按预算的推荐配置
配置 A:经济型(Q4_K_M・约 25 万日元)
MINISFORUM UM890 Pro已确认
Ryzen 9 8945HS・DDR5 32GB・1TB SSD・Radeon 780M。想压缩预算又想满足 32GB 档的人适合。
- CPU:Ryzen 7 5700X+(8 核以上)
- RAM:DDR5 64GB(32GB×2)
- GPU:RTX 4060 Ti 16GB
- SSD:NVMe 2TB Gen4
配置 B:均衡型(Q6_K/Q8_0・约 50 万日元)
- CPU:Ryzen 9 / Core i7(12 核以上)
- RAM:DDR5 96GB(48GB×2)
- GPU:RTX 4090 24GB
- SSD:NVMe 4TB Gen4
配置 C:最高品质(BF16・约 100 万日元)
- CPU:Threadripper / Core i9(16 核以上)
- RAM:DDR5 192GB(96GB×2)
- GPU:2× RTX 5090 32GB(或 2× RTX 4090)
- SSD:2× NVMe 4TB Gen4
安装步骤
1. llama.cpp(GGUF・最快速)
llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144
2. vLLM(BF16・完整性能)
pip install vllm>=0.19.1
vllm serve ornith-ai/Ornith-1.5-35B-A3B \
--served-model-name Ornith-1.5-35B-A3B \
--host 0.0.0.0 --port 8000 \
--tensor-parallel-size 2 \
--max-model-len 262144 \
--gpu-memory-utilization 0.90 \
--enable-prefix-caching \
--enable-auto-tool-choice --tool-call-parser qwen3_xml \
--reasoning-parser qwen3 \
--trust-remote-code
3. 从编程智能体使用
任何 OpenAI 兼容端点都可以——OpenCode、Hermes Agent、OpenClaw:
export OPENAI_BASE_URL="http://localhost:8000/v1"
export OPENAI_API_KEY="EMPTY"
export MODEL="ornith-ai/Ornith-1.5-35B-A3B"
4. 长上下文(YaRN)
用 YaRN RoPE 缩放扩展到约 100 万 token:
VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ornith-ai/Ornith-1.5-35B-A3B \
--hf-overrides '{"rope_scaling": {"rope_type": "yarn", "factor": 4.0, "original_max_position_embeddings": 262144}}' \
--max-model-len 1000000
注意事项
- 不是仅 VRAM 模型:文件 21.7GB+(Q4_K_M),必须 CPU+GPU 混合加大内存
- 需要新版本运行时:Transformers ≥5.8.1・vLLM ≥0.19.1・SGLang ≥0.5.9
- 推理模型:回答前会输出
<think>块;可用 reasoning parser 分离到reasoning_content - YaRN 是静态的:对所有请求生效,普通长度输入的质量会略有下降——只在需要时启用
- 量化差距:GGUF 量化(尤其 Q4_K_M)可能比报告的基准低几个百分点
总结
Ornith-1.5-35B-A3B 是 2026 年备受关注的本地 AI 编程模型:35B MoE・3B 激活,编程基准全面超越 Qwen3.6-35B。
- SWE-bench Verified 79.0・GPQA Diamond 89.2
- Q4_K_M(21.7GB)用 64GB RAM + RTX 4060 Ti 16GB 即可实用
- BF16(71.1GB)完整性能需要 192GB RAM + 2× RTX 5090
想在本地运行顶级 AI 编程智能体,这个模型在任何预算下都值得尝试。先从 Q4_K_M 开始,需要时再升级更高量化。
相关文章
相关文章

2026年8月27日
【2026】Ornith-1.5-9B-OBLITERATED 指南:本地运行“无拒绝”9B 模型

2026年9月4日
在 Hermes 中一键本地运行 Unsloth GGUF!支持 Qwen3.8-27B、Qwen3.8-Flash、DeepSeek-V4-Flash(2026)

2026年7月28日
Kimi K3 完全指南:2.8T 全球最大开源模型,与 0.18B 超小型版(普通电脑也能跑)的全貌【2026年版】

2026年8月24日
【2026】FreeToken 是什么?在游戏 PC 上运行 290B+ 前沿 MoE 模型的边缘原生推理引擎详解

2026年8月20日
【2026】Qwen3.8-27B 无审查版 12GB GGUF 完全解析!Ridge式混合量化,本地实测 37 tok/s

2026年9月5日
2026 年本地运行 GLM-5.3-Flash 完整指南|320B 模型也能跑在 DGX Spark 与 128GB 迷你主机上