云导航 CloudNavi
← 返回文章列表
Kimi K3 完全指南:2.8T 全球最大开源模型,与 0.18B 超小型版(普通电脑也能跑)的全貌
AI 模型·1 分钟阅读
#Kimi K3#Moonshot AI#2.8T#开源权重#KDA#MoE#本地 LLM#超小型模型#GGUF#llama.cpp

文章摘要

2026 年 7 月,Moonshot AI(Kimi 的开发方)发布了 **Kimi K3**。这是全球首个「3T 级(3 万亿参数级)开源权重模型」。

Kimi K3 完全指南:2.8T 全球最大开源模型,与 0.18B 超小型版(普通电脑也能跑)的全貌


「2.8 万亿(2.8T)参数的巨型 AI」与「700MB 就能跑的超小型 AI」,其实拥有相同的 DNA。

2026 年 7 月,Moonshot AI(Kimi 的开发方)发布了 Kimi K3。这是全球首个「3T 级(3 万亿参数级)开源权重模型」。

与此同时,社区推出了 「普通电脑也能跑的 0.18B(1.8 亿参数)超小型版」。从 2.8T 压缩到 0.18B 的压缩率约为 15,000 倍,且架构保持不变。

Kimi-K3 HuggingFace 模型卡

本文基于 HuggingFace 的真实数据与 X 上的帖子,以通俗易懂的方式彻底讲解官方巨型模型与社区超小型模型。

读完本文你将了解:

  • Kimi K3 的规格与优势(附基准测试对比)
  • 为什么「巨型模型」与「超小型模型」拥有相同的 DNA
  • 0.18B 版的技术原理与实际运行体积
  • 用 llama.cpp 等运行的现状与注意事项
  • 哪一款适合你

什么是 Kimi K3(官方 2.8T 版)

Kimi K3 是 Moonshot AI 发布的 开源权重、原生多模态智能体模型。这是该公司的旗舰模型:在同一模型内理解文本、图像与视频,并拥有 100 万 token(1M)的上下文窗口。

基本规格(官方模型卡)

项目规格
总参数2.8T(2,800B)
每 token 激活参数104B
架构MoE(Mixture-of-Experts)
层数93 层
专家数896(其中共享 2 个)
每 token 激活专家16
注意力机制KDA(Kimi Delta Attention)+ Gated MLA
上下文1,048,576 token(1M)
视觉编码器MoonViT-V2(401M)
量化MXFP4 权重 / MXFP8 激活(量化感知训练)
模态文本、图像
许可证Kimi K3 License(开源权重)

什么是新注意力机制「KDA」

最大的技术特征是 Kimi Delta Attention(KDA)Attention Residuals(AttnRes)

  • KDA:计算差值(delta)的新型注意力设计,高效处理长上下文
  • AttnRes:保留注意力残差(减法差值),防止信息退化
  • Stable LatentMoE:稳定化「896 个专家中激活 16 个」的机制

由此实现了 相比 Kimi K2(上一代)约 2.5 倍的扩展效率

基准测试(官方分数)

基准Kimi K3Claude Fable 5GPT-5.6 SolGLM-5.2
Terminal-Bench 2.188.388.088.882.7
DeepSWE67.570.073.046.2
SWE-Marathon42.035.039.013.0
BrowseComp91.288.090.4
GPQA Diamond93.592.694.191.2
FrontierSWE81.286.671.367.3

Terminal-Bench 2.1 达到 88.3%,与 GPT-5.6 Sol(88.8%)几乎持平。SWE-Marathon 以 42.0% 位居第一。性能与全球前沿模型并驾齐驱。


「0.18B」超小型版(社区版)

根据 X 用户 @0x0SojalSec 发布的帖子:

「在土豆 PC(低配硬件)上也能本地运行的超小型 Kimi-K3。

  • 从 2.8T 压缩到 0.18B。
  • 激活 0.10B。
  • 架构相同。
  • 新注意力设计规模相同。
  • DNA 相同,只是缩小了。
  • 为测试压缩到 0.18B。
  • 目前只有 700MB。」

也就是说:并非简单砍掉巨型模型,而是在保持架构(KDA、MoE、AttnRes)不变的情况下,把参数压到极限的「研究验证用微缩模型」。

压缩概念图

同一 DNA,压缩 15,000 倍Kimi K3 2.8T(官方・旗舰)93 层 / 896 专家KDA 注意力 + MoE1M 上下文文件大小约 1.45TB压缩约 15,000 倍Kimi K3 0.18B(社区・超小型)4 层 / 8 专家KDA 注意力 + MoE(同架构)激活约 0.10B文件大小约 700MB关键:层类型(KDA 线性注意力・MoE FFN・MLA 全注意力)全部保留因此可以在普通硬件上验证新注意力设计(KDA)的实际行为

超小型版技术规格(HuggingFace: inference-optimization/Kimi-K3-0.18B)

基于官方模型卡(moonshotai/Kimi-K3)缩减如下:

参数原始版(2.8T)超小型(0.18B)
num_hidden_layers934
hidden_size7168512
num_attention_heads964
intermediate_size(dense)337921024
moe_intermediate_size3072256
num_experts8968
num_experts_per_token162
num_shared_experts21
kv_lora_rank51264

重要:「DNA 相同」的含义

不只是缩小,而是 保留了全部层类型(KDA 线性注意力、MoE FFN、MLA 全注意力)

超小型版 4 层结构:

  • Layer 0: Dense FFN + KDA 线性注意力
  • Layer 1–2: MoE FFN + KDA 线性注意力
  • Layer 3: MoE FFN + MLA 全注意力

由此,可以在普通硬件上测试新注意力设计(KDA)本身的行为。

实际运行体积

  • 参数: 0.18B(激活约 0.10B)
  • 文件大小: 约 700MB(F32)
  • 许可证: MIT(衍生版为 MIT,而非原版 Kimi K3 License)
  • 已验证: perplexity=2.12(低于目标 10.0 即合格)
  • 生成测试: 「According to all known laws of aviation...」—— 确认可正常生成文本

另一条小型化路线:GGUF 版(IQ1_S,1bit/2bit)

X 用户 @GrEarl 将 2.8T 本体转换为 llama.cpp 用的 GGUF 格式

  • 来源: 1,453.8 GiB(MXFP4)
  • 输出: 527.48 GiB(94 分卷 GGUF)
  • 有效比特率: 1.63 bpw(低于 2bit)
  • 方法: 路由专家用 IQ1_S(约 1.56bpw),其余用 Q4_K 保留

但有一个 重要注意事项(见下方「现状局限」)。


现状局限(如实说明)

⚠️ 超小型版(0.18B)的用途

  • 仅为 测试、开发、架构验证用
  • 无法期待实用的对话或编程(0.18B 几乎没有知识)
  • 用于确认「Kimi K3 架构能否在普通电脑上运行」的技术演示

⚠️ GGUF 版(IQ1_S)目前无法运行

正如 @GrEarl 本人所写:

  • 已发布的 llama.cpp 无法加载
  • Kimi K3 支持仅在未合并的 PR(ggml-org/llama.cpp#26185)中
  • 「结构完整性已验证,但 实际加载与生成未验证
  • 2bit/1bit 修复与 1bit 发布正在并行推进

也就是说,现阶段「在普通电脑上实际运行 Kimi K3」还做不到。 架构验证(0.18B)可行,2.8T 的 GGUF 属于技术先行实现。


所需硬件(按体积)

版本体积所需内存参考用途
2.8T(官方・MXFP4)约 1.45TB多 GPU(数十张 H100 级)研究、生产 API
GGUF IQ1_S约 527GBVRAM 600GB 以上(目前需非官方分支)技术验证(尚未运行确认)
0.18B(超小型)约 700MBCPU 约 4GB架构验证、学习

常见问题(FAQ)

Q1. 普通电脑能跑 Kimi K3 吗?

0.18B 超小型版可以(CPU 约 4GB)。但无法进行实用对话。2.8T 本体与 GGUF 版目前无法运行。

Q2. 为什么说 2.8T 与 0.18B「DNA 相同」?

因为在保留层类型(KDA 线性注意力、MoE、MLA)与新注意力设计的情况下缩小。架构行为本身相同。

Q3. 0.18B 版从哪里获取?

HuggingFace: inference-optimization/Kimi-K3-0.18B(MIT 许可证)。

Q4. GGUF 版什么时候能跑?

等 llama.cpp 的 PR(#26185)合并进官方构建后。时间未定。

Q5. 擅长中文吗?

官方 2.8T 支持多语言。0.18B 版参数太少,不具实用性。

Q6. 应该试哪个模型?

对架构感兴趣可以在本地试 0.18B。追求实用则通过 API(Together AI 等)使用 2.8T。

Q7. 许可证有什么区别?

2.8T 本体使用「Kimi K3 License」(开源权重)。0.18B 衍生版为 MIT。GGUF 版继承 Kimi K3 License。

Q8. 费用如何?

0.18B 免费、本地运行。2.8T API 按提供商定价。


总结 —— 如何看待 Kimi K3

结论:Kimi K3 既是「全球首个 3T 级开源模型」这一历史性里程碑,也正在催生「人人都能试架构」的生态。

  • 官方 2.8T: Terminal-Bench 88.3% 等前沿级性能
  • 超小型 0.18B: 用 700MB 在普通电脑上验证 KDA 架构
  • GGUF 版: 技术先行实现(目前尚未确认可运行)

反过来,这些人可以观望:

  • 想立刻在本地用「聪明的 Kimi」(0.18B 不实用)
  • 想按普通本地 LLM(Qwen、Llama 等)的感觉运行(GGUF 版尚未支持)

Kimi K3 的真正价值在于下一步:能否把「巨型模型的智能」压缩到「人人都能接触的尺寸」。 0.18B 正是第一步。

「You can actually load the new Kimi K3 architecture on normal hardware now.」

在普通硬件上就能加载新的 Kimi K3 架构。这就是 2026 年本地 AI 的最前线。


本文信息截至 2026 年 7 月 28 日。基准数据基于 Moonshot AI 官方发布(Kimi-K3 模型卡)。0.18B 版见 inference-optimization/Kimi-K3-0.18B,GGUF 版见 GrEarl/Kimi-K3-GGUF-IQ1_S。


推荐阅读