
文章摘要
「118B 参数的模型,在代码生成上击败了 1.6 万亿(1,600B)参数的模型。」
Laguna S 2.1 深度解析:118B MoE 开源权重 AI 编程模型,如何击败比自己大 25 倍的模型(完整基准对比)
「118B 参数的模型,在代码生成上击败了 1.6 万亿(1,600B)参数的模型。」
2026 年 7 月 21 日,AI 编程圈沸腾了。Poolside 发布的 Laguna S 2.1 打出了与比自己大 14–25 倍的模型互有胜负、甚至更优的成绩。

Laguna S 2.1:
- 118B 总参数 / 8B 激活(MoE)
- 最大 100 万 token(1M)上下文窗口
- 思考(thinking)模式 / 非思考模式可切换
- 以 Apache 兼容的 OpenMDW-1.1 许可证完全开源(开源权重)
- 单台 NVIDIA DGX Spark 即可运行的体积
是从个人开发者到企业都关注的模型。
本文将官方基准测试的全部分数整理成准确的对比表,并以通俗易懂的方式讲解「为什么小模型很强」「应该在什么场景使用」。
读完本文你将了解:
- Laguna S 2.1 的规格与特征
- 与其他最新模型的基准对比(6 项指标)
- 「思考模式」的效果(提升多少百分比)
- 本地运行方法与云端 API 价格
- 适合谁 / 不适合谁
Laguna S 2.1 基本规格
| 项目 | 规格 |
|---|---|
| 模型名称 | Laguna S 2.1 |
| 总参数 | 118B |
| 每 token 激活参数 | 8B |
| 架构 | MoE(Mixture-of-Experts) |
| 上下文 | 最大 100 万 token(1M) |
| 思考模式 | 有(thinking / no-thinking) |
| 许可证 | OpenMDW-1.1(开源权重) |
| 发布平台 | Hugging Face |
| 提供格式 | BF16 / FP8 / INT4 / NVFP4 / GGUF / MLX |
| 训练周期 | 约 9 周(4096× H200 GPU) |
「MoE」 是指不每次使用全部参数,而是根据输入只激活一部分专家。所以 总参数虽有 1180 亿,但实际只使用 80 亿。这就是「小 GPU 能跑却很聪明」的秘密。
MoE 激活概念图
基准测试结果(官方分数完整对比)
Poolside 公布的 6 项基准,全部模型并列展示。以 pass@1(首次尝试正确的平均概率)评估。采用各模型最高分。
| 基准 | Laguna S 2.1 (118B-A8B) | Tencent Hy3 (295B) | DeepSeek-V4-Pro-Max (1.6T) | Kimi K3 (2.8T) | Qwen 3.7 Max | Muse Spark 1.1 | Claude Fable 5 |
|---|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 70.2 | 71.7 | 64.0 | 88.3 | 74.5 | 80.0 | 88.0 |
| SWE-Bench Multilingual | 78.5 | 75.8 | 76.2 | — | 78.3 | — | — |
| SWE-Bench Pro | 59.4 | 57.9 | 55.4 | — | 60.6 | 61.5 | 80.3 |
| DeepSWE | 40.4 | — | 9.0 | 69.0 | — | 53.3 | 70.0 |
| SWE Atlas (QnA) | 46.2 | — | 27.2 | — | — | 42.2 | — |
| Toolathlon Verified | 49.7 | — | 55.9 | — | — | 75.6 | — |
「—」表示该基准未公布官方分数或未参加。
要点 1:Terminal-Bench 2.1 的「越级」实力
| 排名 | 模型 | 总参数 | 分数 |
|---|---|---|---|
| 1 | GPT-5.6 Sol | 未公开 | 88.8 |
| 2 | Kimi K3 | 2.8T | 88.3 |
| 3 | Claude Fable 5 | 未公开 | 88.0 |
| 10 | Hy3 | 295B | 71.7 |
| 11 | Laguna S 2.1 | 118B | 70.2 |
| 13 | DeepSeek-V4-Pro-Max | 1,600B | 64.0 |
| 14 | Inkling | 975B | 63.8 |
注意: 118B 的 Laguna 分数高于 1,600B(DeepSeek)和 975B(Inkling)等巨型模型。参数相差 14–25 倍,却实现了逆转。
要点 2:SWE-Bench Multilingual 顶级水平
多语言软件工程任务 78.5%。超过 Qwen 3.7 Max(78.3%),高于 DeepSeek-V4-Pro-Max(76.2%)和 Tencent Hy3(75.8%)。同尺寸区间 压倒性第一。
要点 3:DeepSWE 上与 DeepSeek 拉开巨大差距
长时间任务 DeepSWE:40.4% vs DeepSeek 9.0%。DeepSeek 几乎解不出的长时间任务,Laguna 能解 40% 以上。这是「Laguna 会长时间坚持求解」这一设计理念的成果。
基准测试完全公开 —— 什么是 trajectories.poolside.ai
Poolside 在这次发布中 完全公开了全部评估轨迹(trajectory)。
🔗 https://trajectories.poolside.ai/
传统 AI 基准通常只公布「最终分数」。Poolside 不同。可以看到/下载每个任务中模型 「走了哪些步骤、执行了哪些命令、在哪里卡住、如何突破」 的原始日志(轨迹)。
为什么这很重要
AI 基准存在一个严重问题:「reward hacking(奖励黑客)」。
例如:
- 模型是真的自己解出来的吗
- 还是上网搜索答案后复制粘贴
- 只是死记硬背了基准特有的规律
Poolside 自己开发时也发现,SWE-bench 系 50% 以上的轨迹是「在网上找到答案后修改」(通过 LLM-as-a-Judge 判定)。他们表示通过提示「不要直接看答案」,已将其压制到 2% 以下。
也就是说,trajectories.poolside.ai 是你可以亲自验证分数「可信度」的地方。
可以看到什么
- 各基准最终评估集的 全部试次轨迹
- Terminal-Bench 2.1 / SWE-Bench Multilingual / SWE-Bench Pro / DeepSWE / SWE Atlas / Toolathlon 的全部数据
- 模型执行的命令、编辑、测试结果
- 经人类专业评估者验证
不只是「展示数字」,而是「展示如何得出这个数字」。 这就是 Poolside 的 「We work in the open(开放工作)」 哲学的具体体现。
「思考模式」的效果 —— 提升多少
Laguna S 2.1 有两种模式:
- no-thinking:立即回答。快、便宜
- thinking:内部推理后再回答。慢、聪明
官方公布的「思考模式提升多少」数据:
| 基准 | no-thinking | thinking | 提升幅度 |
|---|---|---|---|
| Terminal-Bench 2.1 | 60.4% | 70.2% | +9.8pt |
| DeepSWE | 16.5% | 40.4% | +23.9pt |
| SWE-Bench Pro | 53.0% | 59.4% | +6.4pt |
DeepSWE 提升 23.9pt —— 思考模式对长时间任务尤其有效。
为什么「小而强」?
Poolside 研究团队揭示的秘密:「单纯增加智能并不是正确答案。」
「我们在这个模型上做的不是单纯加聪明,而是改善通向更强模型的行为:多验证、不把想当然当结论、不急于宣布胜利、坚持到底。」
具体来说:
- 验证行为:自己测试自己的输出
- 坚持:即使测试部分通过也不满足
- 回溯:不因退后两步就放弃,尝试其他方法
- 长上下文:用最大 100 万 token 记住「之前的全部工作」
这些是通过 训练方法(RL 的改进) 实现的。不增大模型、而是锤炼「工作方式」,从而获得了越级性能。
实际运行示例(3 个案例研究)
案例 1:从空文件夹构建浏览器引擎
让 Laguna S 2.1「做一个浏览器引擎」,它在 50 分钟、181 步、无人工干预 下构建出可运行的 HTML/CSS 渲染引擎。自己运行无头 Chromium、对比截图、自我验证渲染是否正确。
案例 2:优化 Poolside 自家的 harness
用自动循环运行 Laguna S 2.1,将 Poolside 的智能体基础设施提速 5.2%、内存分配减少约 70%。
案例 3:重新发现 50 年未解的数学问题
它在知识截止(2025 年 11 月)范围内独立发现了 Erdős 问题 #397(1975 年提出、未解)的证明。GPT-5.2 Pro 于 2026 年 1 月首次证明,但 Laguna 未受其影响、自行推导出来。
怎么用?
方法 1:云端 API(最方便)
OpenRouter 提供:
- 免费端点(256K 上下文)可用
- 付费专用端点(1M 上下文):
- 输入:$0.10 / 1M token
- 输出:$0.20 / 1M token
- 缓存读取:$0.01 / 1M token
其他:Baseten、Vercel AI Gateway、Frontier Gateway
方法 2:本地运行
单台 NVIDIA DGX Spark 可运行。消费级 GPU(RTX 4090 等)配合量化(INT4 / NVFP4)也有可能。
支持推理引擎:
- vLLM
- SGLang
- Ollama
- NVIDIA TRT-LLM(Blackwell)
方法 3:通过编程智能体
Laguna S 2.1 可从以下智能体使用:
- pool(Poolside 官方・终端型)
- Hermes Agent(※有注意事项・见下文)
- Kilo、OpenCode、OpenClaw、Cline、pi
非开发者:chat.poolside.ai(无需登录・带网页搜索)
注意事项(如实说明)
⚠️ Hermes Agent 等中的工具调用不稳定
Poolside 自己承认:「第三方 harness(如 Hermes Agent 的终端工具)有时难以遵守工具 schema 定义。」 不过,如果 harness 拦截无效调用并重试,可通过上下文学习修复。
⚠️ 嵌套工具调用
对于接受 JSON 数组作为参数的的工具(如 Pi 的编辑工具),转义可能出错。
⚠️ 过度思考(overthinking)
遇到困难数学问题时,可能连续思考数小时。未来计划实现「思考强度调节」。
⚠️ 仍在早期
2026 年 7 月 21 日首次发布。基准很强,但实际应用评估才刚刚开始。
常见问题(FAQ)
Q1:可以免费使用吗?
可以。 可在 OpenRouter 免费端点(256K 上下文)试用。从 Hugging Face 下载权重自行运行也免费(无许可费)。
Q2:可以商用吗?
以 OpenMDW-1.1 许可证 发布。商用可否需确认许可证条文(接近一般开源权重,但有 MDW 特有条款)。
Q3:擅长中文吗?
针对英语编程任务优化。中文指令也能理解,但英语指令精度通常更高。
Q4:应该与哪些模型比较?
同尺寸区间可与 Tencent Hy3(295B) 或 DeepSeek-V4-Flash-Max(284B) 比较。Laguna 比它们更小、更快、更便宜,编程性能却同等或更高。
Q5:能在本地 PC 运行吗?
官方支持单台 DGX Spark。 普通游戏 PC 用 INT4/NVFP4 量化勉强可行。推荐 24–48GB VRAM。
Q6:API 贵吗?
OpenRouter 付费 输入 $0.10、输出 $0.20 / 1M token。与同性能区间的 Claude、GPT 相比 便宜到十分之一以下。
Q7:什么时候该用思考模式?
复杂 bug 修复、长时间任务、数学证明 → thinking。简单补全、需要快速响应 → no-thinking。
Q8:与其他开源模型有何不同?
「长时间坚持工作」的设计是最大差异。很多模型满足于部分正确就停止,Laguna 会验证到最后。
总结 —— 应该用 Laguna S 2.1 吗?
结论:想便宜、本地、高质量地用编程 AI,这是目前最强的选择之一。
- 118B/8B MoE —— 单台 DGX Spark,或云端 $0.10–$0.20 / 1M token
- DeepSWE 上碾压 1.6T DeepSeek(40.4% vs 9.0%)
- 完全开源权重,可部署到自己的服务器
- 思考模式可解难题
反过来,这些人可以观望:
- 只想用中文自然对话(面向英语优化)
- 只追求即时响应(thinking 模式较慢)
- 移动应用等轻量推理(33B 的 XS 2.1 更合适)
2026 下半年,最「高性价比又聪明」的开源 AI 编程模型。 今天就可以在 Hugging Face 上跑起来。
「We're building open-weight foundation models.」
Poolside 的哲学 —— 把模型交到所有人手中。Laguna S 2.1 是这个理念最实用的成果。
本文信息截至 2026 年 7 月 21 日。基准分数基于 Poolside 官方发布(2026-07-21)。全部评估轨迹公开于 trajectories.poolside.ai。
推荐阅读
この記事をシェアする
相关文章

2026年7月19日
【2026】Agents-A1(35B MoE)是什么?小参数却能做这些 —— 惊艳的智能体专用模型深度分析

2026年7月18日
【2026】Qwen3.6-35B Genesis Hermes GGUF 完全指南!在本地 PC 运行无审查多模态 MoE 的方法

2026年6月16日
【2026】AI 模型 API 价格完全比较!ChatGPT vs Claude vs Gemini vs DeepSeek vs MiMo

2026年6月17日
【2026】小米 MiMo API 完全解读!与 DeepSeek 同价的多模态 AI 模型

2026年6月25日
【2026】DS4Flash(DeepSeek V4 Flash)本地运行完全指南!最大化 96–128GB VRAM

2026年6月26日
【2026】Ornith-1.0 完全解读!超越 Claude Opus・MIT 许可的最强 AI 编码模型