云导航 CloudNavi
← 返回文章列表
【2026】Agents-A1(35B MoE)是什么?小参数却能做这些 —— 惊艳的智能体专用模型深度分析
AI 模型·1 分钟阅读
#Agents-A1#InternScience#智能体模型#MoE#基准

文章摘要

2026 年 7 月,颠覆这一常识的模型登场了。它就是 **Agents-A1**。参数为 35B(MoE),与巨型 AI(数百 B~数 T)相比算是「紧凑」,却在科学论文级别课题和长期搜索・调研任务中,**有超越 GPT-5.5 和 DeepSeek-V4 的表现**。

【2026】Agents-A1(35B MoE)是什么?小参数却能做这些 —— 惊艳的智能体专用模型深度分析


「参数少=性能差」—— 你是这样想的吗?

2026 年 7 月,颠覆这一常识的模型登场了。它就是 Agents-A1。参数为 35B(MoE),与巨型 AI(数百 B~数 T)相比算是「紧凑」,却在科学论文级别课题和长期搜索・调研任务中,有超越 GPT-5.5 和 DeepSeek-V4 的表现

本文对 InternScience 发布的这个模型,以初学者也能看懂的方式,配合基准对比表彻底分析它有多厉害。

读完本文你将了解:

  • Agents-A1 到底是个什么样的模型
  • 与其他知名模型(Qwen・Kimi・DeepSeek・GPT-5.5)相比厉害在哪
  • 在什么场景使用能发挥真正价值
  • 自己如何尝试

Agents-A1 是什么样的模型?

一句话概括:为「智能体(自行规划、使用工具、完成任务 AI)」打造的 35B 级 Mixture-of-Experts(混合专家)模型

开发方是 InternScience(国际联合研究团队)。标语是 「SCALING THE HORIZON, NOT THE PARAMETERS(扩展工作范围,而非参数)」

也就是说,不是「巨型化一口气做完」,而是**重点锻炼作为智能体的能力(规划・工具使用・长上下文・指令遵循)**的模型。


基本规格

项目内容
参数35B(MoE:Mixture-of-Experts)
上下文长度最大 256K(约 25 万字)
基础Qwen3.5-MoE 系
支持文本生成・VLM(图像理解)・智能体・工具调用
许可证Apache-2.0(可商用)
发布日期2026 年 7 月 15 日(更新)
分发Hugging Face / ModelScope

因为是 Apache-2.0,包括商用在内可以自由使用,这是加分点。


厉害在哪:4 项能力

官方列出的 Agents-A1 优势有这 4 项。

1. 智能体式推理(Agentic reasoning)

将复杂目标分解为可执行的小步骤,事先规划流程。可以边看中间结果边改变策略。

2. 工具使用(Tool use)

可以使用函数调用(function calling)以及 API・代码执行・搜索引擎・任务环境等外部工具。

3. 长上下文(Long context)

即使处理长对话或长文档,也能保持连贯・记忆・多步骤状态(最大 256K)。

4. 指令遵循(Instruction following)

从科学研究提示词到结构化的工具操作,跨领域遵守细致约束。

智能体循环概念图

Agents-A1 的智能体循环:自己规划・自己执行① 规划把复杂目标分解为可执行的小步骤② 工具使用搜索・代码执行・API函数调用③ 结果确认确认中间结果评估是否达标④ 下一步改变策略继续执行循环到目标达成为止关键:不是「一次给出答案」,而是「自己循环执行」为此重点锻炼了规划・工具・长上下文・指令遵循 4 项能力

基准彻底对比

真正的「厉害」看数字就知道。这是官方发布的 Agents-A1 与 5 个主要模型的对比

基准Agents-A1Qwen3.6-35BStep-3.5Kimi-K2.6DeepSeek-V4GPT-5.5
HLE(难题推理)47.636.223.154.048.252.2
HiPhO(物理奥赛)46.437.738.341.138.743.3
FrontierScience-Olympiad79.060.361.073.076.078.0
FrontierScience-Research40.02.96.717.913.326.7
BrowseComp(Web 调研)75.567.969.083.283.484.4
XBench86.071.056.390.090.084.0
SEAL-056.438.736.950.555.042.3
GAIA(通用智能体)96.078.684.580.698.187.4
IFBench(指令遵循)80.664.464.671.873.575.9
IFEval(指令遵循)94.891.3

特别亮眼的地方

FrontierScience-Research(科学研究任务) 中,Agents-A1 获得 40.0,而 GPT-5.5 为 26.7 —— 约为 GPT-5.5 的 1.5 倍。Qwen3.6-35B 仅 2.9,差距一目了然。

IFBench(指令遵循)80.6 超过主要模型。这意味着在严格遵循用户约束的任务中特别强。


什么场景发挥真正价值

场景推荐度理由
科学研究・论文级课题⭐⭐⭐⭐⭐研究任务为 GPT-5.5 的 1.5 倍
长期 Web 调研・搜索⭐⭐⭐⭐规划 + 工具循环很强
需要严格指令遵循的业务⭐⭐⭐⭐⭐IFBench 超过主要模型
多步骤智能体任务⭐⭐⭐⭐长上下文 256K 保持状态
一般聊天・最新信息⭐⭐⭐Kimi/DeepSeek 系在一般 Web 检索上更擅长

限制与注意点

  • 并非全能:一般对话・最新信息类任务不如最新云模型
  • 需要 GPU 环境:35B MoE,需要 VRAM 24GB 以上(用量化可更轻)
  • 面向普通用户的「用法指南」仍在发展中
  • 并非中文特化:作为中国团队出品,英文示例多

怎么使用

官方 Usage 部分有本地和云端的运行示例。一般来说:

  1. 从 ModelScope / Hugging Face 下载
  2. 用支持推理引擎(vLLM 等)加载
  3. 连接智能体框架(支持函数调用)

初学者可以先用云端笔记本环境(ModelScope 的「Quick Notebook development」等)尝试,最方便。


推荐的用法・学习顺序

路线 A:先试试(入门)

  1. 在 ModelScope 打开模型页面
  2. 在笔记本环境立即尝试
  3. 让它做简单的「查资料」,观察行为

路线 B:作为智能体使用(实践)

  1. 准备支持函数调用的环境
  2. 把搜索・代码执行作为工具交给它
  3. 试着委托长期调研任务

路线 C:正式活用(高级)

  1. 集成到自己的工作流
  2. 用于科学调研・文档处理
  3. 与其他模型区分使用

常见问题(FAQ)

Q1. Agents-A1 可以免费使用吗?

模型本身以 Apache-2.0 公开,下载・使用免费。但运行需要 GPU 环境(云端则按量计费)。

Q2. 支持中文吗?

基础是 Qwen 系,所以中文・英文很强,也理解日文,但不是日文专用调优。

Q3. 与普通聊天 AI(GPT 等)有什么区别?

不是「一次给出答案」,而是**「规划 → 工具使用 → 确认结果 → 下一步」自己循环**,专为智能体设计。

Q4. 能在自己的 PC 上运行吗?

35B MoE,有高性能 GPU(推荐 VRAM 24GB 以上,用量化可更轻)即可。没有的话用云端更现实。

Q5. 能集成到商用产品吗?

Apache-2.0,商用也可(但请确认各基准的来源・限制)。

Q6. 怎么与其他模型区分使用?

「深度科学调研・长期搜索・严格指令遵循」用 Agents-A1,「一般 Web 检索・最新信息」用 Kimi/DeepSeek 系更强。按用途区分使用。


总结

Agents-A1 以 35B 的「紧凑」参数,重点锻炼了智能体能力(规划・工具・长上下文・指令遵循) 的备受关注模型。

  • 科学「研究」任务为 GPT-5.5 的 1.5 倍
  • 指令遵循(IFBench)超过主要模型
  • Apache-2.0 可自由商用

「参数数=性能」的时代已经结束。「重点锻炼了什么」 是决定胜负的好例子。先在 ModelScope 或 Hugging Face 上轻触试试,亲眼确认它的实力吧。

※本文以信息提供为目的,数值基于官方项目网站(2026 年 7 月公开)的基准。最新分数请在官方确认。


推荐阅读