
文章摘要
2026 年 7 月,颠覆这一常识的模型登场了。它就是 **Agents-A1**。参数为 35B(MoE),与巨型 AI(数百 B~数 T)相比算是「紧凑」,却在科学论文级别课题和长期搜索・调研任务中,**有超越 GPT-5.5 和 DeepSeek-V4 的表现**。
【2026】Agents-A1(35B MoE)是什么?小参数却能做这些 —— 惊艳的智能体专用模型深度分析
「参数少=性能差」—— 你是这样想的吗?
2026 年 7 月,颠覆这一常识的模型登场了。它就是 Agents-A1。参数为 35B(MoE),与巨型 AI(数百 B~数 T)相比算是「紧凑」,却在科学论文级别课题和长期搜索・调研任务中,有超越 GPT-5.5 和 DeepSeek-V4 的表现。
本文对 InternScience 发布的这个模型,以初学者也能看懂的方式,配合基准对比表彻底分析它有多厉害。
读完本文你将了解:
- Agents-A1 到底是个什么样的模型
- 与其他知名模型(Qwen・Kimi・DeepSeek・GPT-5.5)相比厉害在哪
- 在什么场景使用能发挥真正价值
- 自己如何尝试
Agents-A1 是什么样的模型?
一句话概括:为「智能体(自行规划、使用工具、完成任务 AI)」打造的 35B 级 Mixture-of-Experts(混合专家)模型。
开发方是 InternScience(国际联合研究团队)。标语是 「SCALING THE HORIZON, NOT THE PARAMETERS(扩展工作范围,而非参数)」。
也就是说,不是「巨型化一口气做完」,而是**重点锻炼作为智能体的能力(规划・工具使用・长上下文・指令遵循)**的模型。
基本规格
| 项目 | 内容 |
|---|---|
| 参数 | 35B(MoE:Mixture-of-Experts) |
| 上下文长度 | 最大 256K(约 25 万字) |
| 基础 | Qwen3.5-MoE 系 |
| 支持 | 文本生成・VLM(图像理解)・智能体・工具调用 |
| 许可证 | Apache-2.0(可商用) |
| 发布日期 | 2026 年 7 月 15 日(更新) |
| 分发 | Hugging Face / ModelScope |
因为是 Apache-2.0,包括商用在内可以自由使用,这是加分点。
厉害在哪:4 项能力
官方列出的 Agents-A1 优势有这 4 项。
1. 智能体式推理(Agentic reasoning)
将复杂目标分解为可执行的小步骤,事先规划流程。可以边看中间结果边改变策略。
2. 工具使用(Tool use)
可以使用函数调用(function calling)以及 API・代码执行・搜索引擎・任务环境等外部工具。
3. 长上下文(Long context)
即使处理长对话或长文档,也能保持连贯・记忆・多步骤状态(最大 256K)。
4. 指令遵循(Instruction following)
从科学研究提示词到结构化的工具操作,跨领域遵守细致约束。
智能体循环概念图
基准彻底对比
真正的「厉害」看数字就知道。这是官方发布的 Agents-A1 与 5 个主要模型的对比。
| 基准 | Agents-A1 | Qwen3.6-35B | Step-3.5 | Kimi-K2.6 | DeepSeek-V4 | GPT-5.5 |
|---|---|---|---|---|---|---|
| HLE(难题推理) | 47.6 | 36.2 | 23.1 | 54.0 | 48.2 | 52.2 |
| HiPhO(物理奥赛) | 46.4 | 37.7 | 38.3 | 41.1 | 38.7 | 43.3 |
| FrontierScience-Olympiad | 79.0 | 60.3 | 61.0 | 73.0 | 76.0 | 78.0 |
| FrontierScience-Research | 40.0 | 2.9 | 6.7 | 17.9 | 13.3 | 26.7 |
| BrowseComp(Web 调研) | 75.5 | 67.9 | 69.0 | 83.2 | 83.4 | 84.4 |
| XBench | 86.0 | 71.0 | 56.3 | 90.0 | 90.0 | 84.0 |
| SEAL-0 | 56.4 | 38.7 | 36.9 | 50.5 | 55.0 | 42.3 |
| GAIA(通用智能体) | 96.0 | 78.6 | 84.5 | 80.6 | 98.1 | 87.4 |
| IFBench(指令遵循) | 80.6 | 64.4 | 64.6 | 71.8 | 73.5 | 75.9 |
| IFEval(指令遵循) | 94.8 | 91.3 | — | — | — | — |
特别亮眼的地方
FrontierScience-Research(科学研究任务) 中,Agents-A1 获得 40.0,而 GPT-5.5 为 26.7 —— 约为 GPT-5.5 的 1.5 倍。Qwen3.6-35B 仅 2.9,差距一目了然。
IFBench(指令遵循) 以 80.6 超过主要模型。这意味着在严格遵循用户约束的任务中特别强。
什么场景发挥真正价值
| 场景 | 推荐度 | 理由 |
|---|---|---|
| 科学研究・论文级课题 | ⭐⭐⭐⭐⭐ | 研究任务为 GPT-5.5 的 1.5 倍 |
| 长期 Web 调研・搜索 | ⭐⭐⭐⭐ | 规划 + 工具循环很强 |
| 需要严格指令遵循的业务 | ⭐⭐⭐⭐⭐ | IFBench 超过主要模型 |
| 多步骤智能体任务 | ⭐⭐⭐⭐ | 长上下文 256K 保持状态 |
| 一般聊天・最新信息 | ⭐⭐⭐ | Kimi/DeepSeek 系在一般 Web 检索上更擅长 |
限制与注意点
- 并非全能:一般对话・最新信息类任务不如最新云模型
- 需要 GPU 环境:35B MoE,需要 VRAM 24GB 以上(用量化可更轻)
- 面向普通用户的「用法指南」仍在发展中
- 并非中文特化:作为中国团队出品,英文示例多
怎么使用
官方 Usage 部分有本地和云端的运行示例。一般来说:
- 从 ModelScope / Hugging Face 下载
- 用支持推理引擎(vLLM 等)加载
- 连接智能体框架(支持函数调用)
初学者可以先用云端笔记本环境(ModelScope 的「Quick Notebook development」等)尝试,最方便。
推荐的用法・学习顺序
路线 A:先试试(入门)
- 在 ModelScope 打开模型页面
- 在笔记本环境立即尝试
- 让它做简单的「查资料」,观察行为
路线 B:作为智能体使用(实践)
- 准备支持函数调用的环境
- 把搜索・代码执行作为工具交给它
- 试着委托长期调研任务
路线 C:正式活用(高级)
- 集成到自己的工作流
- 用于科学调研・文档处理
- 与其他模型区分使用
常见问题(FAQ)
Q1. Agents-A1 可以免费使用吗?
模型本身以 Apache-2.0 公开,下载・使用免费。但运行需要 GPU 环境(云端则按量计费)。
Q2. 支持中文吗?
基础是 Qwen 系,所以中文・英文很强,也理解日文,但不是日文专用调优。
Q3. 与普通聊天 AI(GPT 等)有什么区别?
不是「一次给出答案」,而是**「规划 → 工具使用 → 确认结果 → 下一步」自己循环**,专为智能体设计。
Q4. 能在自己的 PC 上运行吗?
35B MoE,有高性能 GPU(推荐 VRAM 24GB 以上,用量化可更轻)即可。没有的话用云端更现实。
Q5. 能集成到商用产品吗?
Apache-2.0,商用也可(但请确认各基准的来源・限制)。
Q6. 怎么与其他模型区分使用?
「深度科学调研・长期搜索・严格指令遵循」用 Agents-A1,「一般 Web 检索・最新信息」用 Kimi/DeepSeek 系更强。按用途区分使用。
总结
Agents-A1 以 35B 的「紧凑」参数,重点锻炼了智能体能力(规划・工具・长上下文・指令遵循) 的备受关注模型。
- 科学「研究」任务为 GPT-5.5 的 1.5 倍
- 指令遵循(IFBench)超过主要模型
- Apache-2.0 可自由商用
「参数数=性能」的时代已经结束。「重点锻炼了什么」 是决定胜负的好例子。先在 ModelScope 或 Hugging Face 上轻触试试,亲眼确认它的实力吧。
※本文以信息提供为目的,数值基于官方项目网站(2026 年 7 月公开)的基准。最新分数请在官方确认。
推荐阅读
この記事をシェアする
相关文章

2026年7月18日
【2026】Qwen3.6-35B Genesis Hermes GGUF 完全指南!在本地 PC 运行无审查多模态 MoE 的方法

2026年6月16日
【2026】AI 模型 API 价格完全比较!ChatGPT vs Claude vs Gemini vs DeepSeek vs MiMo

2026年6月17日
【2026】小米 MiMo API 完全解读!与 DeepSeek 同价的多模态 AI 模型

2026年6月25日
【2026】DS4Flash(DeepSeek V4 Flash)本地运行完全指南!最大化 96–128GB VRAM

2026年6月26日
【2026】Ornith-1.0 完全解读!超越 Claude Opus・MIT 许可的最强 AI 编码模型

2026年6月26日
【2026】Qwen-AgentWorld 完全解读!让 AI 预测「环境」而非「行动」的革命性方法