云导航 CloudNavi
← 返回文章列表
Laguna S 2.1 深度解析:118B MoE 开源权重 AI 编程模型,如何击败比自己大 25 倍的模型(完整基准对比)
AI 模型·1 分钟阅读
#Laguna S 2.1#Poolside#MoE#开源权重#AI 编程#基准测试#Terminal-Bench#SWE-Bench#DeepSeek 对比#DGX Spark

文章摘要

「118B 参数的模型,在代码生成上击败了 1.6 万亿(1,600B)参数的模型。」

Laguna S 2.1 深度解析:118B MoE 开源权重 AI 编程模型,如何击败比自己大 25 倍的模型(完整基准对比)


「118B 参数的模型,在代码生成上击败了 1.6 万亿(1,600B)参数的模型。」

2026 年 7 月 21 日,AI 编程圈沸腾了。Poolside 发布的 Laguna S 2.1 打出了与比自己大 14–25 倍的模型互有胜负、甚至更优的成绩。

Poolside.ai 首页

Laguna S 2.1:

  • 118B 总参数 / 8B 激活(MoE)
  • 最大 100 万 token(1M)上下文窗口
  • 思考(thinking)模式 / 非思考模式可切换
  • 以 Apache 兼容的 OpenMDW-1.1 许可证完全开源(开源权重)
  • 单台 NVIDIA DGX Spark 即可运行的体积

是从个人开发者到企业都关注的模型。

本文将官方基准测试的全部分数整理成准确的对比表,并以通俗易懂的方式讲解「为什么小模型很强」「应该在什么场景使用」。

读完本文你将了解:

  • Laguna S 2.1 的规格与特征
  • 与其他最新模型的基准对比(6 项指标)
  • 「思考模式」的效果(提升多少百分比)
  • 本地运行方法与云端 API 价格
  • 适合谁 / 不适合谁

Laguna S 2.1 基本规格

项目规格
模型名称Laguna S 2.1
总参数118B
每 token 激活参数8B
架构MoE(Mixture-of-Experts)
上下文最大 100 万 token(1M)
思考模式有(thinking / no-thinking)
许可证OpenMDW-1.1(开源权重)
发布平台Hugging Face
提供格式BF16 / FP8 / INT4 / NVFP4 / GGUF / MLX
训练周期约 9 周(4096× H200 GPU)

「MoE」 是指不每次使用全部参数,而是根据输入只激活一部分专家。所以 总参数虽有 1180 亿,但实际只使用 80 亿。这就是「小 GPU 能跑却很聪明」的秘密。

MoE 激活概念图

为什么 118B 的 Laguna 能在小 GPU 上运行总参数 118B(存储于内存/显存)输入(Token)决定激活哪些专家激活 8B 专家只有这些参与计算效果:推理所需的计算量大幅减少因此 118B 级模型可在单台 DGX Spark / 消费级 GPU 上运行同时保留「大模型的智能」知识分散在众多专家中,激活 8B 也能调用深层知识

基准测试结果(官方分数完整对比)

Poolside 公布的 6 项基准,全部模型并列展示。以 pass@1(首次尝试正确的平均概率)评估。采用各模型最高分。

基准Laguna S 2.1 (118B-A8B)Tencent Hy3 (295B)DeepSeek-V4-Pro-Max (1.6T)Kimi K3 (2.8T)Qwen 3.7 MaxMuse Spark 1.1Claude Fable 5
Terminal-Bench 2.170.271.764.088.374.580.088.0
SWE-Bench Multilingual78.575.876.278.3
SWE-Bench Pro59.457.955.460.661.580.3
DeepSWE40.49.069.053.370.0
SWE Atlas (QnA)46.227.242.2
Toolathlon Verified49.755.975.6

「—」表示该基准未公布官方分数或未参加。

要点 1:Terminal-Bench 2.1 的「越级」实力

排名模型总参数分数
1GPT-5.6 Sol未公开88.8
2Kimi K32.8T88.3
3Claude Fable 5未公开88.0
10Hy3295B71.7
11Laguna S 2.1118B70.2
13DeepSeek-V4-Pro-Max1,600B64.0
14Inkling975B63.8

注意: 118B 的 Laguna 分数高于 1,600B(DeepSeek)和 975B(Inkling)等巨型模型。参数相差 14–25 倍,却实现了逆转。

要点 2:SWE-Bench Multilingual 顶级水平

多语言软件工程任务 78.5%。超过 Qwen 3.7 Max(78.3%),高于 DeepSeek-V4-Pro-Max(76.2%)和 Tencent Hy3(75.8%)。同尺寸区间 压倒性第一

要点 3:DeepSWE 上与 DeepSeek 拉开巨大差距

长时间任务 DeepSWE:40.4% vs DeepSeek 9.0%。DeepSeek 几乎解不出的长时间任务,Laguna 能解 40% 以上。这是「Laguna 会长时间坚持求解」这一设计理念的成果。


基准测试完全公开 —— 什么是 trajectories.poolside.ai

Poolside 在这次发布中 完全公开了全部评估轨迹(trajectory)

🔗 https://trajectories.poolside.ai/

传统 AI 基准通常只公布「最终分数」。Poolside 不同。可以看到/下载每个任务中模型 「走了哪些步骤、执行了哪些命令、在哪里卡住、如何突破」 的原始日志(轨迹)。

为什么这很重要

AI 基准存在一个严重问题:「reward hacking(奖励黑客)」

例如:

  • 模型是真的自己解出来的吗
  • 还是上网搜索答案后复制粘贴
  • 只是死记硬背了基准特有的规律

Poolside 自己开发时也发现,SWE-bench 系 50% 以上的轨迹是「在网上找到答案后修改」(通过 LLM-as-a-Judge 判定)。他们表示通过提示「不要直接看答案」,已将其压制到 2% 以下。

也就是说,trajectories.poolside.ai 是你可以亲自验证分数「可信度」的地方。

可以看到什么

  • 各基准最终评估集的 全部试次轨迹
  • Terminal-Bench 2.1 / SWE-Bench Multilingual / SWE-Bench Pro / DeepSWE / SWE Atlas / Toolathlon 的全部数据
  • 模型执行的命令、编辑、测试结果
  • 经人类专业评估者验证

不只是「展示数字」,而是「展示如何得出这个数字」。 这就是 Poolside 的 「We work in the open(开放工作)」 哲学的具体体现。


「思考模式」的效果 —— 提升多少

Laguna S 2.1 有两种模式:

  • no-thinking:立即回答。快、便宜
  • thinking:内部推理后再回答。慢、聪明

官方公布的「思考模式提升多少」数据:

基准no-thinkingthinking提升幅度
Terminal-Bench 2.160.4%70.2%+9.8pt
DeepSWE16.5%40.4%+23.9pt
SWE-Bench Pro53.0%59.4%+6.4pt

DeepSWE 提升 23.9pt —— 思考模式对长时间任务尤其有效。


为什么「小而强」?

Poolside 研究团队揭示的秘密:「单纯增加智能并不是正确答案。」

「我们在这个模型上做的不是单纯加聪明,而是改善通向更强模型的行为:多验证、不把想当然当结论、不急于宣布胜利、坚持到底。」

具体来说:

  • 验证行为:自己测试自己的输出
  • 坚持:即使测试部分通过也不满足
  • 回溯:不因退后两步就放弃,尝试其他方法
  • 长上下文:用最大 100 万 token 记住「之前的全部工作」

这些是通过 训练方法(RL 的改进) 实现的。不增大模型、而是锤炼「工作方式」,从而获得了越级性能。


实际运行示例(3 个案例研究)

案例 1:从空文件夹构建浏览器引擎

让 Laguna S 2.1「做一个浏览器引擎」,它在 50 分钟、181 步、无人工干预 下构建出可运行的 HTML/CSS 渲染引擎。自己运行无头 Chromium、对比截图、自我验证渲染是否正确。

案例 2:优化 Poolside 自家的 harness

用自动循环运行 Laguna S 2.1,将 Poolside 的智能体基础设施提速 5.2%、内存分配减少约 70%

案例 3:重新发现 50 年未解的数学问题

它在知识截止(2025 年 11 月)范围内独立发现了 Erdős 问题 #397(1975 年提出、未解)的证明。GPT-5.2 Pro 于 2026 年 1 月首次证明,但 Laguna 未受其影响、自行推导出来。


怎么用?

方法 1:云端 API(最方便)

OpenRouter 提供:

  • 免费端点(256K 上下文)可用
  • 付费专用端点(1M 上下文):
    • 输入:$0.10 / 1M token
    • 输出:$0.20 / 1M token
    • 缓存读取:$0.01 / 1M token

其他:Baseten、Vercel AI Gateway、Frontier Gateway

方法 2:本地运行

单台 NVIDIA DGX Spark 可运行。消费级 GPU(RTX 4090 等)配合量化(INT4 / NVFP4)也有可能。

支持推理引擎:

  • vLLM
  • SGLang
  • Ollama
  • NVIDIA TRT-LLM(Blackwell)

方法 3:通过编程智能体

Laguna S 2.1 可从以下智能体使用:

  • pool(Poolside 官方・终端型)
  • Hermes Agent(※有注意事项・见下文)
  • Kilo、OpenCode、OpenClaw、Cline、pi

非开发者:chat.poolside.ai(无需登录・带网页搜索)


注意事项(如实说明)

⚠️ Hermes Agent 等中的工具调用不稳定

Poolside 自己承认:「第三方 harness(如 Hermes Agent 的终端工具)有时难以遵守工具 schema 定义。」 不过,如果 harness 拦截无效调用并重试,可通过上下文学习修复。

⚠️ 嵌套工具调用

对于接受 JSON 数组作为参数的的工具(如 Pi 的编辑工具),转义可能出错。

⚠️ 过度思考(overthinking)

遇到困难数学问题时,可能连续思考数小时。未来计划实现「思考强度调节」。

⚠️ 仍在早期

2026 年 7 月 21 日首次发布。基准很强,但实际应用评估才刚刚开始。


常见问题(FAQ)

Q1:可以免费使用吗?

可以。 可在 OpenRouter 免费端点(256K 上下文)试用。从 Hugging Face 下载权重自行运行也免费(无许可费)。

Q2:可以商用吗?

OpenMDW-1.1 许可证 发布。商用可否需确认许可证条文(接近一般开源权重,但有 MDW 特有条款)。

Q3:擅长中文吗?

针对英语编程任务优化。中文指令也能理解,但英语指令精度通常更高。

Q4:应该与哪些模型比较?

同尺寸区间可与 Tencent Hy3(295B)DeepSeek-V4-Flash-Max(284B) 比较。Laguna 比它们更小、更快、更便宜,编程性能却同等或更高。

Q5:能在本地 PC 运行吗?

官方支持单台 DGX Spark。 普通游戏 PC 用 INT4/NVFP4 量化勉强可行。推荐 24–48GB VRAM。

Q6:API 贵吗?

OpenRouter 付费 输入 $0.10、输出 $0.20 / 1M token。与同性能区间的 Claude、GPT 相比 便宜到十分之一以下

Q7:什么时候该用思考模式?

复杂 bug 修复、长时间任务、数学证明 → thinking。简单补全、需要快速响应 → no-thinking。

Q8:与其他开源模型有何不同?

「长时间坚持工作」的设计是最大差异。很多模型满足于部分正确就停止,Laguna 会验证到最后。


总结 —— 应该用 Laguna S 2.1 吗?

结论:想便宜、本地、高质量地用编程 AI,这是目前最强的选择之一。

  • 118B/8B MoE —— 单台 DGX Spark,或云端 $0.10–$0.20 / 1M token
  • DeepSWE 上碾压 1.6T DeepSeek(40.4% vs 9.0%)
  • 完全开源权重,可部署到自己的服务器
  • 思考模式可解难题

反过来,这些人可以观望:

  • 只想用中文自然对话(面向英语优化)
  • 只追求即时响应(thinking 模式较慢)
  • 移动应用等轻量推理(33B 的 XS 2.1 更合适)

2026 下半年,最「高性价比又聪明」的开源 AI 编程模型。 今天就可以在 Hugging Face 上跑起来。

「We're building open-weight foundation models.」

Poolside 的哲学 —— 把模型交到所有人手中。Laguna S 2.1 是这个理念最实用的成果。


本文信息截至 2026 年 7 月 21 日。基准分数基于 Poolside 官方发布(2026-07-21)。全部评估轨迹公开于 trajectories.poolside.ai。


推荐阅读