
文章摘要
Ling-3.0-flash 是蚂蚁集团 inclusionAI 开发的新一代混合推理 MoE 模型。擅长编码与智能体工作流(AI 操作工具完成任务),以低成本提供高性能。
2026 年 Ling-3.0-flash 详解:蚂蚁集团新一代混合 MoE(附医疗版 Sante 注意事项)
「如果有个模型,性能媲美万亿参数旗舰,但每个 token 的计算量只有约 1/12,而且还能免费试用——?」
2026 年 7 月 23 日,蚂蚁集团(Ant Group)AGI 实验室 inclusionAI 发布的Ling-3.0-flash引发热议。总参数 124B、每次只激活 5.1B,用远低于万亿级旗舰(Ring-2.6-1T)的计算成本,实现了同级性能。
2026 年 9 月 4 日,专攻医疗的兄弟模型Ling-3.0-flash-Sante也随之亮相。它在诊断推理基准上超越 GPT-5.6 Sol,被定位用于医疗健康工作流。
本文将以通俗易懂的方式,介绍 Ling-3.0-flash 的原理、性能、用法,以及使用医疗版 Sante 时必须注意的事项。
本文内容:
- Ling-3.0-flash 是什么(架构・性能・价格)
- 医疗版 Sante 的能力与基准
- 医疗使用中必须遵守的注意事项
- 实际用法(API・本地运行)
- 它能做什么、绝不能做什么
Ling-3.0-flash 是什么
先给结论:Ling-3.0-flash 是蚂蚁集团 inclusionAI 开发的新一代混合推理 MoE 模型。擅长编码与智能体工作流(AI 操作工具完成任务),以低成本提供高性能。
- 总参数 124B / 激活参数 5.1B(每个 token 只用 5.1B)
- 256K token 上下文(可扩展至 1M)
- 混合线性注意力(KDA+MLA 以 5:1 堆叠)
- MIT 许可证(2026 年 8 月 7 日开放权重)
- 思考模式(thinking)可开关
- OpenRouter・OpenCode・Kilo 等平台免费使用
主要基准结果
| 基准 | 分数 | 领域 |
|---|---|---|
| SWE-Bench Pro | 56.6 | 真实编码 |
| SWE-Bench Multilingual | 72.4 | 多语言编码 |
| Terminal-Bench 2.1 | 57.0 | 终端操作 |
| AIME 2026 | 93.2 | 数学 |
| MCP-Atlas | 65.5 | MCP 工具调用 |
| BrowseComp | 72.2 | 网络搜索 |
只激活 5.1B 参数,成绩却足以比肩 1T 级模型。
为什么「124B 却只用 5.1B」能行?
Ling-3.0-flash 通过MoE(混合专家)机制实现高效。512 个路由专家中,每个 token 只激活8 个。
三个关键点:
-
1/64 稀疏 MoE 512 个专家只激活 8 个(1/64)。用到的部分越少,计算成本就越低。
-
混合线性注意力(KDA+MLA) KDA(Kimi Delta Attention)用对角门控高效处理局部依赖,MLA(多头潜在注意力)压缩长距离信息。以 5:1 堆叠,即使长上下文也能保持高速。
-
支持 256K 上下文 按 8K → 32K → 256K 渐进式训练。可一次处理大型代码库或海量文档。
医疗兄弟模型「Ling-3.0-flash-Sante」
2026 年 9 月 4 日,inclusionAI 发布了面向医疗健康的专用变体Ling-3.0-flash-Sante。名称源自法语「santé(健康)」。
- 专攻医学知识、诊断推理、药物安全与循证检索
- 同样采用 124B 总 / 5.1B 激活的 MoE 架构
- OpenRouter・Vercel・Novita 提供免费 API(截至 2026 年 9 月)
Sante 基准结果
| 基准 | Sante | 对比 |
|---|---|---|
| DiagnosisArena-MCQ | 83.8 | GPT-5.6 Sol 81.9 / Kimi K3 78.4 |
| MedXpertQA-Text | 53.9 | GPT-5.6 Sol 60.2 / Kimi K3 53.5 |
| AFUMED-Drug | 89.6 | 药物安全评估 |
| MedEthicAlign | 82.1 | 医疗伦理对齐 |
在诊断推理(DiagnosisArena-MCQ)上超越 GPT-5.6 Sol,在开源模型中位居前列。
医疗 AI 使用的绝对注意事项
医疗领域「出错可能危及生命」。无论模型多强,都必须遵守以下规则。
作为辅助工具可以使用
- 医学论文的摘要与整理(必须注明信息来源)
- 病历・诊疗记录的草稿辅助(注意隐私合规)
- 药物信息的初步调研(最终由药师・医生判断)
- 第二诊疗意见的参考(须经医生复核)
- 医学教育与学习
绝不能做的事
- 确定诊断・决定治疗方案(最终判断必须由医生作出)
- 判断处方・用药剂量(未经药师・医生确认不可使用)
- 直接向患者提供医疗建议(存在被视为未经批准医疗器械的风险)
- 作为急救・紧急判断依据(无法保证 100% 准确)
- 无保护地输入个人健康信息(可能违反 HIPAA 等隐私法规)
为什么必须谨慎
Sante 本质是语言模型,不是医疗器械。Novita 官方页面明确说明:不得将其输出呈现为诊断、治疗建议或合格医疗判断的替代品。AI 输出可能包含幻觉(看似合理的错误),在医疗场景中这一风险可能致命。
医疗 AI 的铁律:把 AI 输出只当作参考信息,最终医疗判断必须由具备资质的专业人士(医生・药师)作出。遵守这一原则,Sante 就是强大的研究助手。
实际用法(API)
Ling-3.0-flash 在 OpenRouter 提供免费试用(截至 2026 年 9 月,模型 ID inclusionai/ling-3.0-flash:free)。
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="your-openrouter-key",
)
response = client.chat.completions.create(
model="inclusionai/ling-3.0-flash:free",
messages=[
{"role": "user", "content": "用 Python 写一个图片缩放工具"}
]
)
print(response.choices[0].message.content)
要点:模型使用 OpenAI 兼容 API,因此可从既有工具(Hermes Agent、OpenCode、Kilo 等)直接调用。它也以 ling-3.0-flash-free 的身份接入 OpenCode 与 Kilo,可用于免费代码审查等任务。
推荐参数
- temperature=0.6・top_p=0.95・top_k=20(官方推荐)
- 思考模式默认开启(可用
enable_thinking: false关闭)
能本地运行吗?
Ling-3.0-flash 已开放权重(MIT),理论上可本地运行——但124B 总参数需要相当大的硬件。
- BF16(全精度):约 255GB 内存
- FP8:约 128GB 内存
- 推荐:4× 141GB GPU(如 H20)配合 SGLang / vLLM
简单说,普通 PC 本地运行并不现实。想快速体验,免费 API 是最佳选择。FP8 版理论上可放入 128GB 级 DGX Spark,但鉴于体积庞大,建议先用 API 评估性能。
总结:极致效率,正确使用
Ling-3.0-flash 是 2026 年开源模型竞赛中「效率优先」路线的代表。
- 124B 总 / 5.1B 激活,性能比肩 1T 级模型
- 擅长编码・智能体・数学・长上下文理解
- MIT 许可证,OpenRouter 免费使用
- 医疗版 Sante 在诊断推理上超越 GPT-5.6 Sol(仅限辅助用途)
第一步:先在 OpenRouter 免费试用 ling-3.0-flash:free,体验其在代码生成与智能体任务中的性价比。
如果要在医疗领域使用,请先理解 Sante 的能力边界,并始终牢记:「AI 提供参考,医生作出判断」。
相关文章
相关文章

2026年7月28日
Kimi K3 完全指南:2.8T 全球最大开源模型,与 0.18B 超小型版(普通电脑也能跑)的全貌【2026年版】

2026年9月5日
2026 年本地运行 GLM-5.3-Flash 完整指南|320B 模型也能跑在 DGX Spark 与 128GB 迷你主机上

2026年8月14日
【2026】dots3-note Preview 完全解析!RedNote 的 280B MoE 模型为何能与 DeepSeek V4 Flash 正面交锋

2026年9月2日
Qwen3.8-Max-0902 指南 2026:2.4T 参数 MoE 强化 Coding 与 Cowork 的升级版

2026年7月19日
【2026】Agents-A1(35B MoE)是什么?小参数却能做这些 —— 惊艳的智能体专用模型深度分析

2026年7月21日
Laguna S 2.1 深度解析:118B MoE 开源权重 AI 编程模型,如何击败比自己大 25 倍的模型(完整基准对比)【2026年版】