MacroAlpha.io
Launch App启动应用

LLMWIKI · CONCEPT

深度研究智能体 (Deep Research Agent) — 「搜索不是研究」与原子能力路线

阶跃星辰 Step-DeepResearch 用 32B 中等参数、靠把 Agent 行为拆成「规划/搜寻/反思/写作」四种可训练的原子能力,做到媲美甚至超越 o3、Gemini Deep Research 的深度研究能力,单次报告成本不到 0.5 元。核心命题:研究是非线性迭代的认知过程,不是把 query 转成关键词再摘要前几条结果。

免费开放 · 更新于

TL;DR阶跃星辰 Step-DeepResearch 用 32B 中等参数、靠把 Agent 行为拆成「规划/搜寻/反思/写作」四种可训练的原子能力,做到媲美甚至超越 o3、Gemini Deep Research 的深度研究能力,单次报告成本不到 0.5 元。核心命题:研究是非线性迭代的认知过程,不是把 query 转成关键词再摘要前几条结果。

「深度研究智能体」是把意图识别、长程规划、多工具调用、信息甄别与逻辑重构集成在一起的高阶认知任务型 Agent,被业界视为衡量通用智能体核心竞争力的「北极星」指标。阶跃星辰的 Step-DeepResearch 是这条路线最锋利的样本:它没追万亿参数的暴力美学,而是在 32B 中等参数上靠「原子能力」数据合成 + 端到端强化学习,做到媲美乃至超越 OpenAI o3、Gemini Deep Research,且单次报告成本不到 0.5 元人民币。^1

「搜索不是研究」:对现有范式的批判

Step-DeepResearch 反复强调一句技术哲学:Search is not research。当前许多 AI 搜索产品(含 Perplexity 类、简单 RAG 应用)把「研究」简化为「搜索」——把 query 转成关键词,对返回的前几条结果做摘要。这在有标准答案的多跳问答里也许有效,但面对开放式研究就捉襟见肘。

真正的研究是非线性、迭代的认知过程:质疑并重构初始意图、批判性评估搜索结果、敏锐感知缺失信息、交叉验证矛盾证据,最终构建严密的证据链闭环。过度追求「搜索效率」的基准(BrowseComp、GAIA 只看有标准答案的事实检索)把模型异化成了高效网页爬虫,而非有独立思考能力的研究者。这与频道 推理时代 讲的「System 1 → System 2」是同一转向在 Agent 层面的落地。

四种原子能力:把「研究」还原再重构

核心创新是不把深度研究当成不可分割的单一任务,而是解构为可独立训练、可迁移的「原子能力」(Atomic Capabilities),训练目标从「预测下一个 token」重塑为「决策下一个原子动作」:^1

原子能力 类比 数据合成关键手法
规划与任务分解 大脑 「后见之明」逆向工程:拿完美研报反推初始 query 与执行计划;轨迹一致性过滤只留「既画饼又圆饼」的轨迹
深度信息搜寻 感官 基于知识图谱子图采样构造多跳推理;用 QwQ-32b 做难度过滤,能被简单 ReAct 解决的题直接剔除,只留硬骨头
反思与验证 免疫系统 「错误-反思闭环」:诱导生成错误路径再强制反思;五步验证流 Extract→Plan→Verify→Replan→Report
报告生成 表达系统 Mid-training 内化领域行文风格;SFT 强制学 \cite{} 引文格式,每句关键论断必须有来源

三阶段渐进式训练管线

graph LR
    A[Agentic Mid-training<br/>32K→128K 课程学习<br/>注入原子认知图式] --> B[SFT<br/>组合原子能力<br/>正确且最短+鲁棒性注入]
    B --> C[RL/PPO<br/>Rubrics Judge 奖励<br/>从模仿者→探索者]
  • Mid-training:约 150B token 后,模型在 FRAMES 等 Agent 基准提升 10%+,证明中间训练对长程推理的决定性作用。
  • SFT:遵循「正确且最短」(奥卡姆剃刀)原则筛轨迹;刻意保留含 404、空结果的错误轨迹,注入「玻璃心」的反面——遇挫自我修正。
  • RL:针对深度报告难用单一标量评价的问题,设计基于 Checklist 的 Rubrics Judge(如「是否覆盖了 2024 Q3 数据」「是否引用权威机构」),把三级评分映射为严苛二元信号,用 PPO 直接优化长程策略。

极简 ReAct 与三件工程「神来之笔」

与许多堆多智能体的系统不同,Step-DeepResearch 回归单智能体 ReAct(推理-行动-观察)本源,验证了「只要模型够强,单 Agent 也能处理复杂任务」。三个降本关键:^1

  • 统一工具层batch_web_surfer(批量并发浏览)+ todo(强制维护动态任务列表,防长任务「迷路 / 目标漂移」)+ filePatch 操作(只改文档一小部分,长文修改 token 降 70%+)。
  • 权威信息索引:600+ 核心权威站点白名单(政府/期刊/智库/研报),物理隔离 SEO 垃圾,从源头治「垃圾进垃圾出」。
  • 视觉冗余消除(PHash 感知哈希):连续网页截图高度相似时抑制图像输入回退纯文本(按需感知),大幅削减多模态 token——这是低成本的关键工程之一。

经济学:重新定义 Agent 成本

模型 类型 ResearchRubrics 单次报告成本(RMB)
Gemini DeepResearch 闭源商用 63.69 ≈ 6.65
Step-DeepResearch StepFun Agent 61.42 < 0.50
Kimi-k2-thinking 开源 ReAct 56.17 ≈ 0.76
OpenAI DeepResearch 闭源商用 53.67 ≈ 5.32

成绩仅次于 Gemini,却以不到竞品 1/10 的价格提供同级研究能力;在红杉中国 xBench-DeepSearch 上以 70% 通过率位列第一,证明它「不仅懂研究,更懂中文互联网」。它把原本昂贵的「专家级研究」普惠化,为金融分析、市场调研、学术综述等知识密集行业带来自动化曙光——这正是 推理时代 讲的「白领认知劳动贬值」的供给侧引擎。详见公司实体页 阶跃星辰

诚实的局限

技术报告也坦承当前的「阿喀琉斯之踵」:工具使用在极端情况(API 鉴权失败、反爬升级)下仍脆弱;长链任务可能产生「逻辑通顺但缺证据」的合理幻觉(比离谱错误更难察觉);某些决策(为何放弃某条搜索路径)对用户仍是黑盒,在金融法律等高风险领域构成合规障碍。未来路径是从单 Agent 走向多 Agent 协作(Planner/Retriever/Verifier/Writer 分工制衡)+ 过程监督(Process Reward Model 评估每一步而非只看最终报告)。「合理幻觉」与「过程监督」两点,恰好与 不法分子悖论 讲的「欺骗难检测」「需要过程级而非结果级验证」遥相呼应。完整定位见 智能体时代

深度研究智能体 (Deep Research Agent) — 「搜索不是研究」与原子能力路线 · 关系图