MacroAlpha.ioLaunch App启动应用啟動應用

PUBLISHED WORK · 已公开作品

阶跃星辰 Step-DeepResearch 原子级的深度研究智能体?

正式公开于 · 公开视频

YouTube:

SITE PLAYER · 站内播放

视频、双语字幕与配套资料

免费公开
正在加载永久媒体文件…

完整文字稿

16

阶跃星辰 Step-DeepResearch 原子级的深度研究智能体?阶跃星辰 Step-DeepResearch 原子级的深度研究智能体?阶跃星辰 Step-DeepResearch 原子级的深度研究智能体?

0%0% · 计算阅读时间中…

阶跃星辰 Step-DeepResearch 原子级的深度研究智能体?

1. 引言:从信息检索到认知代理的范式转移

1.1 大语言模型的演进拐点与“北极星”指标

在人工智能的发展历程中,大语言模型(LLM)正经历着从被动响应的对话系统向具备主动性、规划力与执行力的自主智能体(Autonomous Agents)的深刻转型。这一转型的核心驱动力在于,单纯的文本生成已无法满足现实世界中日益复杂的任务需求。随着模型参数规模的指数级增长与训练数据的耗尽,边际效应递减的规律促使学术界与工业界寻找新的增长极。在这一背景下,“深度研究”(Deep Research)作为一种集成了意图识别、长程规划、多工具调用、信息甄别与逻辑重构的高阶认知任务,迅速崛起并被公认为衡量通用智能体(General-Purpose Agents)核心竞争力的“北极星”指标 1。

深度研究不仅仅是搜索技术的延伸,它代表了人工智能在认知层面的一次质的飞跃。传统的搜索引擎或检索增强生成(RAG)系统,本质上是在解决“召回率”与“准确率”的匹配问题,其核心逻辑是基于关键词或语义向量的相似度匹配。然而,真实世界中的开放式研究任务往往具有极高的模糊性与不确定性。例如,当用户提出“分析未来五年全球合成生物学市场的投资风险”这一需求时,这并非一个简单的查询指令,而是一个需要拆解为数十个子问题、跨越多个信息源、历经数小时甚至数天的数据收集与清洗,最终综合形成观点的复杂决策过程。现有的技术栈在面对此类任务时,往往表现出信息碎片化、推理链条断裂以及在噪声数据干扰下的幻觉问题 3。因此,如何构建一个能够像人类专家一样进行深度思考、自我反思并持续迭代的研究型智能体,成为了当前 AI 领域的顶级挑战。

1.2 “搜索非研究”:对现有技术范式的批判性解构

在 Step-DeepResearch 的技术哲学中,一个核心的论断被反复强调:“搜索不是研究”(Search is not research)1。这一论断深刻揭示了当前大量 AI 搜索产品的局限性。目前的许多系统,包括 Perplexity 或基于简单 RAG 的应用,倾向于将“研究”简化为“搜索”。它们在面对用户查询时,往往直接将其转化为搜索引擎的关键词,然后对返回的前几条结果进行摘要。这种做法在处理多跳问答(Multi-hop QA)等封闭域问题时或许有效,但在面对开放式研究时则显得捉襟见肘。

研究是一个非线性的、迭代的认知过程。它包含了对初始意图的质疑与重构、对搜索结果的批判性评估、对缺失信息的敏锐感知以及对矛盾证据的交叉验证。真正的研究者不会止步于获取信息,而是致力于构建证据链条,形成严密的逻辑闭环。现有的评估基准,如 BrowseComp 或 GAIA,虽然在一定程度上推动了 Agent 技术的发展,但其过度关注具有标准答案的事实性检索,导致了模型训练的异化——模型被优化成了高效的网页爬虫,而非具备独立思考能力的研究者 1。这种对“搜索效率”的过度追求,牺牲了对“思考深度”的培养,使得现有 Agent 难以产生具有洞察力的专业报告。

1.3 Step-DeepResearch 的战略破局

正是在这样的产业背景下,阶跃星辰(StepFun)推出了 Step-DeepResearch 系统。这不仅仅是一款产品,更是一种全新的技术路线验证。Step-DeepResearch 没有盲目追随万亿参数的暴力美学,而是在 32B 的中等参数规模上,通过引入“原子能力”(Atomic Capabilities)的数据合成策略与端到端的强化学习训练范式,实现了媲美甚至超越 OpenAI o3、Gemini Deep Research 等顶级闭源模型的深度研究能力 4。

该系统通过将复杂的 Agent 行为解构为规划(Planning)、信息搜寻(Information Seeking)、反思(Reflection)和报告撰写(Reporting)等可训练的原子技能,并构建了从 Agentic Mid-training 到 SFT 再到 RL 的渐进式优化路径,成功打破了“智能涌现依赖超大参数”的迷思。更重要的是,Step-DeepResearch 以极低的推理成本(单次报告生成成本低于 0.5 元人民币),为 AI Agent 的大规模商业化落地探索出了一条极具可行性的路径,标志着深度研究技术从实验室走向工业界的关键一步 4。

2. 阶跃星辰:企业基因、技术谱系与市场格局

2.1 微软亚洲研究院的“黄金血统”与团队构成

要理解 Step-DeepResearch 的技术深度,必须回溯其母公司阶跃星辰的团队基因。阶跃星辰成立于 2023 年 4 月,其创始人姜大昕博士是全球自然语言处理与数据挖掘领域的权威专家。在创立阶跃星辰之前,姜大昕曾任微软亚洲互联网工程研究院副院长及首席科学家,直接领导了必应(Bing)搜索引擎、Cortana 智能助手以及 Azure 云平台等核心产品的研发工作 5。这种长达 16 年的微软职业生涯,赋予了创业团队独特的“微软系”基因:既拥有探索 AI 前沿理论的学术高度,又具备构建大规模分布式系统、处理海量互联网数据的工程底蕴。

核心团队的构成进一步强化了这种“算法+系统”的双螺旋优势。系统负责人朱亦博曾在微软、字节跳动和谷歌任职,拥有管理单集群万卡以上算力的实战经验,这对于训练高效的 Agent 模型至关重要。数据负责人焦斌星则曾担任微软必应引擎核心搜索团队负责人,深谙互联网数据的挖掘、清洗与索引技术 5。这种对搜索生态的深刻理解,使得 Step-DeepResearch 在构建其专有的“权威信息索引”和“反思验证机制”时,能够站在巨人的肩膀上,避免了许多初创公司在数据质量上的陷阱。

2.2 “六小强”格局下的战略突围与资本背书

在中国大模型创业的激烈竞争中,阶跃星辰与智谱 AI、月之暗面、百川智能、零一万物、MiniMax 并称为“六小强”或“新五小虎” 5。尽管在早期宣传上相对低调,但阶跃星辰在资本市场上却展现出强大的吸金能力。公司已完成 B 轮融资,估值达到数十亿美元级别,甚至有消息称其正在进行新一轮估值 20 亿美元的融资。其投资者名单涵盖了上海国资、腾讯投资、五源资本、启明创投以及阿里巴巴等顶级机构与科技巨头 7。

阿里与腾讯的同时注资极具战略信号意义。这不仅是对阶跃星辰技术实力的背书,也暗示了其在未来 AI 生态中的关键位置。在巨头林立的格局下,阶跃星辰选择以“深度研究”这一高价值、高门槛的垂直场景作为切入点,而非单纯卷通用对话模型的参数量,体现了其差异化的竞争策略。通过 Step-DeepResearch,阶跃星辰试图在 B 端专业服务与 C 端高端助手市场建立起技术护城河。

2.3 Step 系列模型矩阵:从多模态到万亿参数的基座支撑

Step-DeepResearch 并非空中楼阁,而是建立在阶跃星辰强大的 Step 系列基础模型矩阵之上。公司已发布了包括 Step-1(千亿参数语言模型)、Step-1V(多模态模型)以及 Step-2(万亿参数 MoE 语言模型)在内的全栈产品线 10。

* Step-1 & Step-1.5V:这些模型展现了卓越的图像理解与生成能力。在 Step-DeepResearch 中,Agent 需要像人类一样“看”网页,对图表、布局进行视觉解析,Step-1V 的多模态能力为此提供了原生支持。

* Step-2:作为万亿参数的 Mixture-of-Experts (MoE) 模型,Step-2 在数学、逻辑编程及多轮对话能力上全面对标 GPT-4。虽然 Step-DeepResearch 的技术报告主要基于 32B 模型(基于 Qwen2.5 定制),但 Step-2 的存在意味着该系统未来具备向更高智力水平扩展的潜力 10。

* 多模态布局:Step-Audio 和 Step-Video 的研发,预示着未来的深度研究 Agent 将不仅仅局限于文本报告,还可能具备处理音视频素材、生成多媒体报告的全方位能力 12。

3. 理论框架与数据策略:原子能力的解构与重构

Step-DeepResearch 的核心创新在于其并未将深度研究视为一个不可分割的单一任务,而是将其解构为一系列可独立训练、可迁移的“原子能力”(Atomic Capabilities)。这种还原论的思想,结合系统论的整合方法,构成了其技术路线的基石。

3.1 核心哲学:从“预测下一个 Token”到“决策下一个原子动作”

在传统的 LLM 预训练中,核心目标函数是最小化预测下一个 Token 的困惑度(Perplexity)。然而,在 Agent 场景下,生成流畅的文本并不等同于做出了正确的决策。一个能写出优美句子的模型,可能在面对复杂问题时束手无策,或者陷入无限的死循环。Step-DeepResearch 提出了一种范式转移:将训练目标从“预测下一个 Token”重塑为“决策下一个原子动作”(Deciding the next Atomic Action)1。

这一转变的数学本质是在庞大的原始 Token 空间 $\mathcal{A}_{token}$ 中,寻找一个紧凑的、高语义的动作子空间 $\mathcal{A}_{atomic}$。在这个子空间中,模型的每一步输出不再仅仅是字符的堆砌,而是代表了一个具体的认知操作,如“制定计划”、“发起搜索”、“验证事实”或“修正错误”。目标是同时最小化两类误差:一是因剪枝导致的潜在最优解丢失(Pruning Error),二是强化学习在子空间中的探索难度(RL Exploration Difficulty)。通过这种方式,模型学会了像专家一样思考,即在行动之前先进行高层的意图规划,而非被动地进行字面续写。

3.2 数据合成策略:四大原子能力的精细化构建

为了支撑上述理论框架,阶跃星辰团队设计了一套精密的数据合成管线,专门针对四项核心原子能力进行高质量数据的生产与筛选。

3.2.1 规划与任务分解(Planning & Task Decomposition)

规划能力是 Agent 的“大脑”。为了让模型学会如何拆解复杂问题,团队采用了一种“逆向工程”(Reverse Engineering)的策略。

* 后见之明(Hindsight)机制:利用现有的高质量研报、学术综述等“完美结果”,通过强大的教师模型(Teacher Model)反推其产生的“初始任务”和“执行计划”。例如,给定一份关于“2025年量子计算商业化进程”的深度报告,反推其最初的用户 Query 以及生成该报告所需的步骤拆解。

* 轨迹一致性过滤:并非所有生成的计划都是有效的。系统会生成实际的执行轨迹,并计算其与预设计划的对齐度(Alignment Score)。只有那些严格遵循了规划逻辑且最终解决了问题的轨迹,才会被保留用于训练。这确保了模型不仅学会了“画饼”(制定计划),更学会了“圆饼”(执行计划)1。

3.2.2 深度信息搜寻(Deep Information Seeking)

搜寻能力是 Agent 的“感官”。为了避免模型退化为简单的关键词匹配工具,团队构建了基于图谱和文档拓扑的训练数据。

* 基于图的合成(Graph-based Synthesis):利用 Wikidata5m 和 CN-DBpedia 等大规模知识图谱,通过受控的子图采样(Subgraph Sampling)构建复杂的推理路径。系统会选择度数较小的实体作为种子节点,进行多跳扩展,然后基于这些子图生成必须经过多步推理才能回答的复杂问题。这强制模型必须在知识网络中进行“游走”,而非单点查询。

* 多文档关联检索:在 Wiki-doc 等文档库中模拟“超链接跳转”的拓扑行走。模型被训练在不知道最终答案位置的情况下,通过文档间的引用关系和超链接线索,主动探索信息路径。

* 难度过滤机制:引入 QwQ-32b 模型作为难度过滤器。如果一个合成的问题能被 QwQ-32b 直接通过简单的 ReAct 循环解决,则该问题被判定为“简单”,从训练集中剔除。这确保了 Step-DeepResearch 的训练资源全部集中在那些现有模型无法解决的“硬骨头”上 1。

3.2.3 反思与验证(Reflection & Verification)

反思能力是 Agent 的“免疫系统”。针对 LLM 常见的幻觉问题,团队设计了专门的“错误-反思闭环”(The Error-Reflection Loop)。

* 自省机制:在数据生成过程中,系统会诱导专家模型生成错误的路径,然后强制要求模型基于错误结果进行“反思”,识别错误原因(如数据源不可靠、逻辑推导错误),并保留历史记忆进行重试。

* 深度验证工作流:模拟人类专家的验证过程,将其拆解为 Extract(提取核心事实)、Plan(规划验证路径)、Verify(执行多源搜索验证)、Replan(基于验证结果动态调整)和 Report(汇总验证结论)五个原子步骤。这种结构化的验证流被内化为模型的本能,使其在生成报告时会自动进行交叉验证,大幅降低了事实性错误 1。

3.2.4 报告生成(Report Generation)

写作能力是 Agent 的“表达系统”。

* Mid-training 阶段:侧重于领域风格和内容深度的内化。利用反向工程生成的(Query, Report)对,让模型学习金融、法律、科技等不同领域的专家级行文逻辑、术语风格和篇章结构。

* SFT 阶段:侧重于指令遵循和格式规范。特别是针对学术和商业报告的严谨性要求,系统强制模型学习标准的 \cite{} 引文格式,要求每一句关键论断都必须有明确的来源标注,确保报告的可追溯性和权威性。

4. 训练管线与技术架构:渐进式优化的系统工程

Step-DeepResearch 采用了一个从 Agentic Mid-training 到 SFT 再到 RL 的三阶段渐进式训练管线。这一设计不仅体现了课程学习(Curriculum Learning)的思想,更是将 32B 的基座模型逐步打磨成领域专家的关键。

4.1 阶段一:Agentic Mid-training(代理中间训练)

这是连接预训练与指令微调的关键桥梁,旨在为模型注入基础的 Agent 认知图式。

* 课程学习机制:训练被划分为两个精心设计的子阶段。

* Phase 1 (32K 上下文):重点在于注入原子能力,数据主要包括学术主动阅读、百科知识重写等。此时不涉及显式的工具调用,旨在让模型在纯文本环境中建立对复杂任务结构的理解。

* Phase 2 (128K 上下文):上下文窗口扩展至 128K,引入了 URL QA、Deep Search 轨迹和 Web Browsing 数据。模型开始学习如何在超长上下文中管理信息,以及如何进行多轮的工具交互。

* 能力涌现:实验表明,经过约 150B Token 的训练,模型在 FRAMES 等 Agent 基准上的性能提升了 10% 以上,证明了 Mid-training 对长程推理能力的决定性作用 1。

4.2 阶段二:有监督微调(SFT)—— 行为的规范与对齐

这一阶段的核心是组合原子能力,形成端到端的、符合人类期望的行为模式。

* 轨迹优化原则:遵循“正确且最短”(Correct and Shortest)原则。在数据清洗时,系统会从无数条成功的搜索轨迹中筛选出步骤最少、工具调用最精准的那一条。这迫使模型学会“奥卡姆剃刀”式的思考,剔除冗余步骤,以最低的计算成本获取信息。

* 鲁棒性注入:为了防止模型在真实网络环境中“玻璃心”,训练数据中刻意保留了一定比例的包含工具调用错误(如 404 错误、搜索结果为空)的轨迹。模型通过学习这些样本,掌握了在遇到挫折时进行自我修正、尝试替代方案的能力。

4.3 阶段三:强化学习(RL)—— 探索与策略优化

这是让模型从“模仿者”进化为“探索者”的质变阶段。

* Rubrics Judge 奖励模型:针对深度研究报告难以用单一标量(如 Rouge 分数)评价的问题,StepFun 创新性地设计了基于 Checklist 的 Rubrics Judge。通过“两步逆向合成”法生成(Query, Rubrics, Report)三元组数据训练 Judge 模型,使其能够像人类专家一样,基于细粒度的评分标准(如“是否覆盖了 2024 年 Q3 的数据”、“是否引用了权威机构报告”)对模型生成的报告进行多维度打分。

* Rubrics as Rewards:为了提供更明确的梯度信号,系统将 Rubrics 的三级评分(满足、部分满足、不满足)映射为更严格的二元信号(对于正面标准,只有“完全满足”才得 1 分;对于负面标准,只要有缺陷即为 0 分)。这种严苛的奖励机制加速了模型向专家级行为的收敛。

* PPO 算法:采用近端策略优化(PPO)算法,结合 GAE 优势估计,直接优化模型在长程任务中的策略分布。与简单的 Rejection Sampling 不同,PPO 允许模型在探索过程中试错,从而发现人类未曾演示过的更优策略 1。

5. 系统架构与工程实现:极简主义的 ReAct 生态

与许多试图通过复杂的多智能体(Multi-Agent)协作来解决问题的系统不同,Step-DeepResearch 回归了单智能体(Single-Agent)ReAct 架构的本源。这一设计选择不仅降低了系统的通信开销和延迟,更验证了只要模型本身足够强大,单一 Agent 完全具备处理复杂任务的潜力 1。

5.1 极简 ReAct 循环与统一工具层

系统将复杂的任务重构为动态的“推理-行动-观察”(Reasoning-Action-Observation)循环。在这一循环中,统一的工具层起到了至关重要的作用。

* batch_web_surfer:这是信息获取的核心。与普通的爬虫不同,它支持批量、并发的网页搜索与浏览,能够一次性消化大量信息。

* todo:用于状态管理。在长达数小时的研究任务中,模型容易“迷路”或忘记初心。todo 工具强制模型维护一个动态的任务列表,随时记录已完成、进行中和待办的事项,确保目标不漂移。

* file:模拟文件系统,支持长文档的读取、写入和修补(Patch)。引入 Patch 操作是一个工程上的神来之笔——它允许模型只修改文档的一小部分(如修正一个数据或增加一段引用),而无需重写整个文档,从而将长文修改时的 Token 消耗降低了 70% 以上 1。

5.2 权威信息索引:从源头治理数据质量

“垃圾进,垃圾出”(Garbage In, Garbage Out)是 AI 搜索的顽疾。Step-DeepResearch 在工程上建立了一个包含 600+ 核心权威站点的白名单索引库,涵盖了政府官网、顶级学术期刊、知名智库及行业研报平台。系统在物理层和逻辑层隔离了这些高质量信息源与充满 SEO 垃圾的普通互联网内容。在检索时,权威站点的权重被显著提升,从源头保证了 Agent 获取信息的信度与效度。

5.3 视觉冗余消除(Visual Redundancy Elimination):PHash 技术的应用

在处理网页浏览时,Agent 往往需要像人类一样“看”网页截图。然而,连续的网页操作(如鼠标滚动)会产生大量高度相似的图像,导致多模态 Token 的巨大浪费。

StepFun 引入了 PHash(感知哈希) 技术,实时计算连续动作间网页截图的感知距离。

* 按需感知(Perception-on-Demand):如果页面变化微小(PHash 距离低于阈值),系统会抑制图像输入,回退到纯文本流。

* 效益分析:这种策略在保持模型对页面状态掌控的同时,极大地减少了多模态 Token 的冗余消耗,显著提升了推理速度并降低了成本。实验表明,这一机制是 Step-DeepResearch 能够实现极低推理成本的关键工程优化之一 2。

6. 评估体系:重构深度研究的度量衡

6.1 ADR-Bench:填补中文深度研究评估的空白

现有的学术基准(如 BrowseComp)主要面向事实性问答,且缺乏对中文互联网环境的适配。为了更真实地反映 Agent 在中文语境下的能力,StepFun 建立了 ADR-Bench (Application-driven Deep Research Benchmark) 1。

* 场景覆盖:ADR-Bench 涵盖了商业研究、政策分析、软件工程等真实的高价值场景,不再是简单的“谁是美国第 45 任总统”这类问题。

* 双轨评估机制:

* 通用领域(70题):采用人工 Elo 对战(Human Side-by-Side)。由经过培训的评估员对模型生成的报告进行盲测,评估维度包括信息完整性、内容深度、需求契合度和可读性。

* 专业领域(40题,金融与法律):这是 ADR-Bench 的精华所在。由资深金融分析师和律师设计了严格的 Checklist 评分标准。特别是引入了负面评分机制——不仅看模型“做对了什么”,更看它“有没有犯错”(如引用了过时的法规、计算错了关键财务指标)。这种严苛的评估更能反映 B 端用户对专业工具的真实要求。

6.2 xBench:第三方权威视角的验证

除了自建基准,Step-DeepResearch 在红杉中国(Sequoia China)发布的 xBench-DeepSearch 评测中也取得了统治级表现 14。

* 评测背景:xBench 旨在评估 Agent 在真实世界任务中的效用(Real-world Utility),特别是中文互联网环境下的复杂信息检索能力。

* 成绩对比:Step-DeepResearch 获得了 70% 的通过率,位列第一,大幅领先其他模型。相比之下,其在 BrowseComp(OpenAI 发布的基准)上的通过率为 23%,虽然也属前列,但 xBench 的成绩更能反映其在本土复杂信息环境下的生态优势。这证明了 Step-DeepResearch 不仅“懂研究”,更“懂中文互联网”。

7. 性能表现与经济学分析:在效率边界上的极致探索

7.1 ResearchRubrics 基准上的全面领先

在 Scale AI 的 ResearchRubrics 基准上,Step-DeepResearch 取得了 61.42 的高分,这一成绩具有里程碑意义 1。

模型名称

类型

ResearchRubrics 得分

预估单次报告成本 (RMB)

Gemini DeepResearch

闭源商用系统

63.69

≈ 6.65

Step-DeepResearch

StepFun Agent

61.42

< 0.50

Kimi-k2-thinking

开源 ReAct Agent

56.17

≈ 0.76

OpenAI DeepResearch

闭源商用系统

53.67

≈ 5.32

MiniMax Agent Pro

商用 Agent 系统

49.24

≈ 3.36

Qwen DeepResearch

商用 Agent 系统

40.0+

≈ 0.63

注:OpenAI DeepResearch 的得分基于报告中特定版本的测试结果;成本估算基于官方定价及平均 Token 消耗。

从上表可以看出,Step-DeepResearch 的得分仅次于 Gemini DeepResearch,超过了 OpenAI DeepResearch 和 Kimi-Researcher。在细分维度上,其在“沟通质量”(Communication Quality)和“引文质量”(Citation Quality)上表现尤为出色,这意味着它生成的报告不仅内容详实,而且行文流畅、引用规范,更符合人类专家的阅读习惯。

7.2 极致的成本效益:重新定义 Agent 经济学

如果说性能上的领先令人印象深刻,那么成本上的突破则是颠覆性的。

Step-DeepResearch 生成一份深度研究报告的成本不到 0.50 元人民币。相比之下,使用 Gemini DeepResearch 需要花费约 6.65 元,OpenAI DeepResearch 约为 5.32 元。这意味着 Step-DeepResearch 以不到竞品 1/10 的价格,提供了同等级别的研究能力。

这种成本优势的来源是多方面的系统性优化:

1. 32B 中等参数规模:相比千亿或万亿参数模型,32B 模型的推理算力需求本身就低一个数量级。

2. PHash 视觉过滤:大幅减少了昂贵的多模态 Token 处理,避免了为重复的网页截图付费。

3. 高效的原子能力:由于模型经过了深度的原子能力训练,它能够更精准地规划路径,减少了无效的搜索和错误的尝试,从而降低了总的 Token 消耗。

8. 局限性分析与未来技术演进

8.1 当前系统的“阿喀琉斯之踵”

尽管 Step-DeepResearch 表现优异,但技术报告也诚恳地指出了当前的局限性,这些挑战也是整个 Agent 领域共同面临的难题 2。

* 工具使用的鲁棒性:虽然引入了错误恢复训练,但在面对极端情况(如复杂的 API 鉴权失败、网页反爬虫机制升级)时,Agent 仍可能表现出脆弱性。

* 长链任务中的“逻辑退化”:在极长周期的研究任务中,尤其是当外部信息极度碎片化或充满噪声时,模型可能会生成逻辑通顺但缺乏确凿证据支持的“似是而非”的推论。这种“合理的幻觉”比离谱的错误更难被察觉。

* 可解释性的黑盒:尽管有反思机制,但 Agent 的某些决策(如为何放弃某条搜索路径)对用户来说仍是不可见的,这在金融和法律等高风险领域可能构成合规障碍。

8.2 未来展望:协作智能与过程监督

针对上述问题,StepFun 团队规划了清晰的技术演进路径。

* 协作智能(Collaborative Intelligence):从 Single-Agent 向 Multi-Agent 演进。引入专门的 Planner(规划者)、Retriever(搜寻者)、Verifier(验证者)和 Writer(撰写者)角色。通过角色分工和相互制衡(如 Verifier 专门挑 Writer 的刺),可以显著降低幻觉率。

* 过程监督(Process Supervision):引入过程奖励模型(Process Reward Models, PRM)。目前的 Rubrics Judge 主要是对最终报告(Outcome)进行打分。未来将致力于评估 Agent 的每一步思考过程,确保每一步推理都“可验证且清晰正确”,而非仅仅关注最终结果。这将是通向更可信 AI 的必由之路 1。

9. 结论:开启 AI Agent 的普惠时代

Step-DeepResearch 的横空出世,标志着 AI Agent 领域的一个重要风向标:从参数竞赛转向能力建模。通过精细化的数据工程(原子能力合成)和系统化的训练范式(RL + Rubrics Judge),阶跃星辰有力地证明了中等规模模型完全可以在特定垂直领域(如深度研究)达到甚至超越顶尖闭源模型的效果。

对于产业界而言,Step-DeepResearch 提供的不仅是一个高性能的工具,更是一个极具性价比的生产力解决方案。它以极低的边际成本,将原本昂贵的“专家级研究”能力普惠化,为金融分析、市场调研、学术综述等知识密集型行业带来了自动化的曙光。在 xBench 和 ADR-Bench 等基准上的优异表现,进一步确立了其在中文深度研究领域的领跑地位。随着未来多模态交互与协作智能的引入,我们有理由相信,Step-DeepResearch 将引领人机协作的新范式,推动 AI 从“助手”真正进化为“合作伙伴”。

平台入口与其他公开链接

CONVERSATION DIGEST · 对话摘要

分享这段讨论

摘要可以编辑;公开后会以你的名义显示,并链接到完整对话。