MacroAlpha.io
Launch App启动应用

LLMWIKI · CONCEPT

智能体 AI (Agent AI)

李飞飞团队 2024 综述提出的 AI 新范式——AI 不再是被动的信息处理者,而是能感知、规划、在物理世界中执行的"主动行动者",是 LLM 通往 AGI 的必经之路

免费开放 · 更新于

TL;DR李飞飞团队 2024 综述提出的 AI 新范式——AI 不再是被动的信息处理者,而是能感知、规划、在物理世界中执行的"主动行动者",是 LLM 通往 AGI 的必经之路

智能体 AI(Agent AI)是李飞飞团队联合微软研究院在 2024 年综述论文《Agent AI: Surveying the Horizons of Multimodal Interaction》中正式提出的概念框架,用以定义"能够感知视觉刺激、语言输入及其他环境基础数据,并能产生有意义的具身行动的交互系统"^1。这是一次范式转换——AI 不再是 ChatGPT 式的"被动信息处理者",而是被重新定义为"环境中的主动行动者"。

三要素:定义边界的关键

智能体 AI 区别于传统对话机器人的不是参数规模,而是结构性的三要素:

graph LR
    A[多模态感知<br/>Multimodal Perception] -->|图像/声音/触觉| D[Agent AI]
    B[环境接地<br/>Environmentally Grounded] -->|挂钩特定环境| D
    C[具身行动<br/>Embodied Action] -->|对环境产生改变| D
    D --> E[通往 AGI]
要素 含义 与 ChatGPT 的区别
多模态感知 同时处理像素、波形、触觉等多种模态 ChatGPT 只活在文本世界
环境接地(Grounding) 输入输出与特定物理/虚拟环境挂钩 ChatGPT 在真空中回答问题
具身行动 输出不只是文本,而是改变环境的操作 ChatGPT 只生成文字

李飞飞的核心论断:单纯的大语言模型已触及理解物理世界的"天花板",未来的 AGI 必须具备具身性(Embodiment)和空间感(Spatiality)^1。从"知道"到"做到"的转变,是 AI 发展史上的关键跃迁。

分类学:四种智能体形态

类别 典型代表 关键挑战
具身智能体(Embodied) 家庭机器人、自动驾驶 Sim-to-Real 鸿沟
模拟与游戏智能体 Minecraft Voyager、生成式 NPC 长期任务规划
交互式助手 UI/OS 智能体、AutoGPT 工具调用 + 任务分解
知识智能体 检索增强对话系统 减少幻觉

认知架构:递归优化循环

智能体 AI 的通用架构是一个感知-推理-行动-观察的闭环:

  1. 大脑(推理引擎):基础模型(LLM/VLM)不再只是文本生成器,而是利用预训练知识进行零样本推理
  2. 规划:从 [思维链 CoT] → [ReAct(推理+行动+观察循环)] → [思维树 ToT]——智能体能像下棋一样预演多分支决策
  3. 记忆:工作记忆(上下文窗口)+ 长时记忆(向量数据库 + RAG)——实现"越用越聪明"
  4. 感知与行动空间:CLIP 等视觉编码器把图像与文本映射到同一语义空间;行动空间设计决定了执行能力

解决幻觉的唯一路径:环境接地

李飞飞团队特别强调,幻觉 在 Agent AI 中的危险性远超 LLM:在纯文本场景下,幻觉可能只是一篇错误的新闻;但在 Agent AI 中,幻觉可能让机器人打破花瓶、误诊病情、在自动驾驶中做出危险决策^1。

根本原因在于 LLM 的知识是"无实体的"(Disembodied)——模型学的是词与词的统计概率,而不是词与物理世界的因果联系。解决方案:用物理事实校准预测——通过多模态视觉确认 + 行动反馈,让重力、摩擦力等真实约束修正模型的认知。

这一思路与 缘起性空 在哲学上同构——所有概念都不是孤立自存的,必须在与环境的关系网络中获得意义。

关键挑战

  • Sim-to-Real 鸿沟:模拟器永远无法完美复刻现实,模型在模拟中表现完美一旦部署到真机就"弱智化"
  • 长期规划与灾难性遗忘:执行数小时甚至数天的任务时容易迷失目标,新技能覆盖旧技能
  • 安全对齐物理化:传统安全对齐只检测有害文本,Agent AI 需要"物理防火墙"拦截有害行动

跨界对齐:与佛学认知科学的同构

智能体 AI 的"感知-推理-行动-观察"递归循环,与 止观 在佛学修行中的"观-照-行-果"结构有惊人对应。更深一层,Grounding(环境接地)作为反幻觉机制,与佛学中"依止现量(直接经验)破除遍计所执(概念虚构)"的方法论同构——见 三自性

李飞飞团队的隐含哲学立场:真正的智能不能脱离身体和世界存在——这与西方笛卡尔传统(心物二元)形成对抗,反而与东方"身心一如""色心不二"的整体观一致。

与本频道其他主题的关联

  • 空间智能——同一团队后续路线,从"单个智能体如何行动"转向"如何构建智能体能理解的完整世界"
  • 与 世界模型——LeCun JEPA 路径 vs 李飞飞生成式路径的世界模型之争
  • 因陀罗网——Agent AI 的网络化协作与"一即一切"的拓扑同构
  • 中文房间——具身性争论的现代版本:没有身体的 AI 能"理解"吗
智能体 AI (Agent AI) · 关系图