
文章摘要
2026 年 7 月,Moonshot AI(Kimi 的开发方)发布了 **Kimi K3**。这是全球首个「3T 级(3 万亿参数级)开源权重模型」。
Kimi K3 完全指南:2.8T 全球最大开源模型,与 0.18B 超小型版(普通电脑也能跑)的全貌
「2.8 万亿(2.8T)参数的巨型 AI」与「700MB 就能跑的超小型 AI」,其实拥有相同的 DNA。
2026 年 7 月,Moonshot AI(Kimi 的开发方)发布了 Kimi K3。这是全球首个「3T 级(3 万亿参数级)开源权重模型」。
与此同时,社区推出了 「普通电脑也能跑的 0.18B(1.8 亿参数)超小型版」。从 2.8T 压缩到 0.18B 的压缩率约为 15,000 倍,且架构保持不变。

本文基于 HuggingFace 的真实数据与 X 上的帖子,以通俗易懂的方式彻底讲解官方巨型模型与社区超小型模型。
读完本文你将了解:
- Kimi K3 的规格与优势(附基准测试对比)
- 为什么「巨型模型」与「超小型模型」拥有相同的 DNA
- 0.18B 版的技术原理与实际运行体积
- 用 llama.cpp 等运行的现状与注意事项
- 哪一款适合你
什么是 Kimi K3(官方 2.8T 版)
Kimi K3 是 Moonshot AI 发布的 开源权重、原生多模态智能体模型。这是该公司的旗舰模型:在同一模型内理解文本、图像与视频,并拥有 100 万 token(1M)的上下文窗口。
基本规格(官方模型卡)
| 项目 | 规格 |
|---|---|
| 总参数 | 2.8T(2,800B) |
| 每 token 激活参数 | 104B |
| 架构 | MoE(Mixture-of-Experts) |
| 层数 | 93 层 |
| 专家数 | 896(其中共享 2 个) |
| 每 token 激活专家 | 16 |
| 注意力机制 | KDA(Kimi Delta Attention)+ Gated MLA |
| 上下文 | 1,048,576 token(1M) |
| 视觉编码器 | MoonViT-V2(401M) |
| 量化 | MXFP4 权重 / MXFP8 激活(量化感知训练) |
| 模态 | 文本、图像 |
| 许可证 | Kimi K3 License(开源权重) |
什么是新注意力机制「KDA」
最大的技术特征是 Kimi Delta Attention(KDA) 与 Attention Residuals(AttnRes)。
- KDA:计算差值(delta)的新型注意力设计,高效处理长上下文
- AttnRes:保留注意力残差(减法差值),防止信息退化
- Stable LatentMoE:稳定化「896 个专家中激活 16 个」的机制
由此实现了 相比 Kimi K2(上一代)约 2.5 倍的扩展效率。
基准测试(官方分数)
| 基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | GLM-5.2 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 88.0 | 88.8 | 82.7 |
| DeepSWE | 67.5 | 70.0 | 73.0 | 46.2 |
| SWE-Marathon | 42.0 | 35.0 | 39.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | — |
| GPQA Diamond | 93.5 | 92.6 | 94.1 | 91.2 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 67.3 |
Terminal-Bench 2.1 达到 88.3%,与 GPT-5.6 Sol(88.8%)几乎持平。SWE-Marathon 以 42.0% 位居第一。性能与全球前沿模型并驾齐驱。
「0.18B」超小型版(社区版)
根据 X 用户 @0x0SojalSec 发布的帖子:
「在土豆 PC(低配硬件)上也能本地运行的超小型 Kimi-K3。
- 从 2.8T 压缩到 0.18B。
- 激活 0.10B。
- 架构相同。
- 新注意力设计规模相同。
- DNA 相同,只是缩小了。
- 为测试压缩到 0.18B。
- 目前只有 700MB。」
也就是说:并非简单砍掉巨型模型,而是在保持架构(KDA、MoE、AttnRes)不变的情况下,把参数压到极限的「研究验证用微缩模型」。
压缩概念图
超小型版技术规格(HuggingFace: inference-optimization/Kimi-K3-0.18B)
基于官方模型卡(moonshotai/Kimi-K3)缩减如下:
| 参数 | 原始版(2.8T) | 超小型(0.18B) |
|---|---|---|
| num_hidden_layers | 93 | 4 |
| hidden_size | 7168 | 512 |
| num_attention_heads | 96 | 4 |
| intermediate_size(dense) | 33792 | 1024 |
| moe_intermediate_size | 3072 | 256 |
| num_experts | 896 | 8 |
| num_experts_per_token | 16 | 2 |
| num_shared_experts | 2 | 1 |
| kv_lora_rank | 512 | 64 |
重要:「DNA 相同」的含义
不只是缩小,而是 保留了全部层类型(KDA 线性注意力、MoE FFN、MLA 全注意力)。
超小型版 4 层结构:
- Layer 0: Dense FFN + KDA 线性注意力
- Layer 1–2: MoE FFN + KDA 线性注意力
- Layer 3: MoE FFN + MLA 全注意力
由此,可以在普通硬件上测试新注意力设计(KDA)本身的行为。
实际运行体积
- 参数: 0.18B(激活约 0.10B)
- 文件大小: 约 700MB(F32)
- 许可证: MIT(衍生版为 MIT,而非原版 Kimi K3 License)
- 已验证: perplexity=2.12(低于目标 10.0 即合格)
- 生成测试: 「According to all known laws of aviation...」—— 确认可正常生成文本
另一条小型化路线:GGUF 版(IQ1_S,1bit/2bit)
X 用户 @GrEarl 将 2.8T 本体转换为 llama.cpp 用的 GGUF 格式。
- 来源: 1,453.8 GiB(MXFP4)
- 输出: 527.48 GiB(94 分卷 GGUF)
- 有效比特率: 1.63 bpw(低于 2bit)
- 方法: 路由专家用 IQ1_S(约 1.56bpw),其余用 Q4_K 保留
但有一个 重要注意事项(见下方「现状局限」)。
现状局限(如实说明)
⚠️ 超小型版(0.18B)的用途
- 仅为 测试、开发、架构验证用
- 无法期待实用的对话或编程(0.18B 几乎没有知识)
- 用于确认「Kimi K3 架构能否在普通电脑上运行」的技术演示
⚠️ GGUF 版(IQ1_S)目前无法运行
正如 @GrEarl 本人所写:
- 已发布的 llama.cpp 无法加载
- Kimi K3 支持仅在未合并的 PR(ggml-org/llama.cpp#26185)中
- 「结构完整性已验证,但 实际加载与生成未验证」
- 2bit/1bit 修复与 1bit 发布正在并行推进
也就是说,现阶段「在普通电脑上实际运行 Kimi K3」还做不到。 架构验证(0.18B)可行,2.8T 的 GGUF 属于技术先行实现。
所需硬件(按体积)
| 版本 | 体积 | 所需内存参考 | 用途 |
|---|---|---|---|
| 2.8T(官方・MXFP4) | 约 1.45TB | 多 GPU(数十张 H100 级) | 研究、生产 API |
| GGUF IQ1_S | 约 527GB | VRAM 600GB 以上(目前需非官方分支) | 技术验证(尚未运行确认) |
| 0.18B(超小型) | 约 700MB | CPU 约 4GB | 架构验证、学习 |
常见问题(FAQ)
Q1. 普通电脑能跑 Kimi K3 吗?
0.18B 超小型版可以(CPU 约 4GB)。但无法进行实用对话。2.8T 本体与 GGUF 版目前无法运行。
Q2. 为什么说 2.8T 与 0.18B「DNA 相同」?
因为在保留层类型(KDA 线性注意力、MoE、MLA)与新注意力设计的情况下缩小。架构行为本身相同。
Q3. 0.18B 版从哪里获取?
HuggingFace: inference-optimization/Kimi-K3-0.18B(MIT 许可证)。
Q4. GGUF 版什么时候能跑?
等 llama.cpp 的 PR(#26185)合并进官方构建后。时间未定。
Q5. 擅长中文吗?
官方 2.8T 支持多语言。0.18B 版参数太少,不具实用性。
Q6. 应该试哪个模型?
对架构感兴趣可以在本地试 0.18B。追求实用则通过 API(Together AI 等)使用 2.8T。
Q7. 许可证有什么区别?
2.8T 本体使用「Kimi K3 License」(开源权重)。0.18B 衍生版为 MIT。GGUF 版继承 Kimi K3 License。
Q8. 费用如何?
0.18B 免费、本地运行。2.8T API 按提供商定价。
总结 —— 如何看待 Kimi K3
结论:Kimi K3 既是「全球首个 3T 级开源模型」这一历史性里程碑,也正在催生「人人都能试架构」的生态。
- 官方 2.8T: Terminal-Bench 88.3% 等前沿级性能
- 超小型 0.18B: 用 700MB 在普通电脑上验证 KDA 架构
- GGUF 版: 技术先行实现(目前尚未确认可运行)
反过来,这些人可以观望:
- 想立刻在本地用「聪明的 Kimi」(0.18B 不实用)
- 想按普通本地 LLM(Qwen、Llama 等)的感觉运行(GGUF 版尚未支持)
Kimi K3 的真正价值在于下一步:能否把「巨型模型的智能」压缩到「人人都能接触的尺寸」。 0.18B 正是第一步。
「You can actually load the new Kimi K3 architecture on normal hardware now.」
在普通硬件上就能加载新的 Kimi K3 架构。这就是 2026 年本地 AI 的最前线。
本文信息截至 2026 年 7 月 28 日。基准数据基于 Moonshot AI 官方发布(Kimi-K3 模型卡)。0.18B 版见 inference-optimization/Kimi-K3-0.18B,GGUF 版见 GrEarl/Kimi-K3-GGUF-IQ1_S。
推荐阅读
この記事をシェアする
相关文章

2026年7月19日
【2026】Agents-A1(35B MoE)是什么?小参数却能做这些 —— 惊艳的智能体专用模型深度分析

2026年7月18日
【2026】Qwen3.6-35B Genesis Hermes GGUF 完全指南!在本地 PC 运行无审查多模态 MoE 的方法

2026年6月16日
【2026】AI 模型 API 价格完全比较!ChatGPT vs Claude vs Gemini vs DeepSeek vs MiMo

2026年6月17日
【2026】小米 MiMo API 完全解读!与 DeepSeek 同价的多模态 AI 模型

2026年6月25日
【2026】DS4Flash(DeepSeek V4 Flash)本地运行完全指南!最大化 96–128GB VRAM

2026年6月26日
【2026】Ornith-1.0 完全解读!超越 Claude Opus・MIT 许可的最强 AI 编码模型