文章总结: 小红书推出了通用推理智能体DeepAgent,这是一个端到端的深度推理智能体,能够自主思考、动态查找工具并执行任务。DeepAgent通过统一的自主推理核心、自主记忆折叠机制、结构化记忆系统和ToolPO训练框架等创新设计,在多个基准测试中表现优异,成功率高达89.0%,远超同级别模型。该系统能够驾驭海量通用工具、在具身智能环境中精准导航,并可作为科研助手提供深度研究支持。
综合评分: 85
文章分类: AI安全,产品介绍
小红书推出通用推理智能体 DeepAgent:工具&任务随心配!
等你加入的
小红书技术REDtech
2025年11月20日 18:02
北京
在人工智能的浪潮之巅,大型推理模型已展现出解决复杂难题的非凡潜力。然而,当面对真实世界的挑战时,它们往往因无法灵活使用外部工具集和进行长程、连贯的交互而受限。为了突破这一瓶颈,小红书团队推出了 DeepAgent。这不仅是一个AI模型,更是一个全新的端到端深度推理智能体。它革命性地将自主思考、动态工具查找与任务执行融于一次连贯的推理流程中,为通用 Agentic AI 的实现迈出了坚实的一步。
论文标题:
DeepAgent: A General Reasoning Agent with Scalable Toolsets
论文地址:
https://arxiv.org/abs/2510.21618
GitHub地址:
https://github.com/Rednote-DeepExperience/DeepAgent
1.1 驾驭海量通用工具:挑战 16,000+ 真实API
已关注
关注
重播 分享 赞
关闭
观看更多
更多
退出全屏
切换到竖屏全屏退出全屏
小红书技术REDtech已关注
分享视频
,时长01:09
0/0
00:00/01:09
切换到横屏模式
继续播放
[ ]
进度条,百分之0
播放
00:00
/
01:09
01:09
倍速
全屏
倍速播放中
0.5倍 0.75倍 1.0倍 1.5倍 2.0倍
超清 流畅
继续观看
小红书推出通用推理智能体 DeepAgent:工具&任务随心配!
观看更多
转载
,
小红书推出通用推理智能体 DeepAgent:工具&任务随心配!
小红书技术REDtech已关注
分享点赞在看
已同步到看一看写下你的评论
视频详情
DeepAgent 展示了其强大的可扩展性,能够在一个包含超过 16,000 个 RapidAPI 的庞大工具库中,根据任务需求自主搜索、筛选并调用最合适的工具,以连贯的深度思考完成复杂的通用任务。(注:由于 ToolBench 中的部分 API 已不可用,此演示中的 API 响应由 LLM 模拟,以展示系统的正常功能)
1.2 化身具身智能体:在ALFWorld中精准导航
已关注
关注
重播 分享 赞
关闭
观看更多
更多
退出全屏
切换到竖屏全屏退出全屏
小红书技术REDtech已关注
分享视频
,时长00:39
0/0
00:00/00:39
切换到横屏模式
继续播放
[ ]
进度条,百分之0
播放
00:00
/
00:39
00:39
倍速
全屏
倍速播放中
0.5倍 0.75倍 1.0倍 1.5倍 2.0倍
超清 流畅
继续观看
小红书推出通用推理智能体 DeepAgent:工具&任务随心配!
观看更多
转载
,
小红书推出通用推理智能体 DeepAgent:工具&任务随心配!
小红书技术REDtech已关注
分享点赞在看
已同步到看一看写下你的评论
视频详情
无论是网页浏览、操作系统控制还是与虚拟环境交互,DeepAgent 都能游刃有余。它通过一套灵活可插拔的动作指令集(如移动、观察、拾取),在 ALFWorld 等具身AI环境中高效完成复杂的目标导向型任务。
1.3 赋能深度研究:变身科研助手
已关注
关注
重播 分享 赞
关闭
观看更多
更多
退出全屏
切换到竖屏全屏退出全屏
小红书技术REDtech已关注
分享视频
,时长00:33
0/0
00:00/00:33
切换到横屏模式
继续播放
[ ]
进度条,百分之0
播放
00:00
/
00:33
00:33
倍速
全屏
倍速播放中
0.5倍 0.75倍 1.0倍 1.5倍 2.0倍
超清 流畅
继续观看
小红书推出通用推理智能体 DeepAgent:工具&任务随心配!
观看更多
转载
,
小红书推出通用推理智能体 DeepAgent:工具&任务随心配!
小红书技术REDtech已关注
分享点赞在看
已同步到看一看写下你的评论
视频详情
DeepAgent 还能化身强大的科研助手。它配备了一整套专业的工具集,能够熟练运用网络搜索、网页内容提炼、代码执行、视觉问答及文件处理等高级功能,为用户提供深度、全面的研究支持。
为何我们需要一个全新的推理智能体?当前主流的 AI 智能体框架存在明显天花板:
- 传统工作流的束缚:像 ReAct、Plan-and-Solve 等框架,被困于预设的“思考-行动-观察”死板循环中,缺乏任务全局观和执行自主性。它们需要人类预先指定工具,无法应对未知和变化。
- 现有研究智能体的局限:尽管一些前沿的“深度研究”智能体(如 Search-o1, WebThinker)尝试在推理中集成工具,但它们能使用的工具集非常有限,通常仅限于搜索、浏览等几种,难以胜任真实世界五花八门的需求。
为了打破僵局,DeepAgent从根本上重新设计了智能体的运作模式,其核心设计体现在以下四个方面。
3.1 统一的自主推理核心:从“死板工作流”到“端到端的边思考、边找工具、边调用”
传统智能体受限于预设的“思考-行动”循环,而 DeepAgent 则由一个强大的推理模型作为核心,在一条完整连贯的“思路链”中驱动整个任务。它不再是机械地执行指令,而是真正地进行自主思考。
在推理过程中,当需要与外部世界交互时,DeepAgent 会生成特定的文本指令,如用 <tool\_search>...</tool\_search> 来动态搜索所需工具,或用 <tool\_call>...</tool\_call> 来调用工具。系统会捕捉这些指令并执行相应操作。这种模式赋予了智能体极大的灵活性,工具不再是预设选项,而是按需发现的资源。
此外,为了让主推理模型能更专注于顶层战略思考,DeepAgent 还设计了一个辅助大语言模型,负责处理冗长的工具文档摘要、过滤工具返回的繁杂信息等,确保了核心推理过程的高效与专注。
3.2 自主记忆折叠机制:让 AI 学会“喘口气、再思考”
长程任务的一大挑战是信息过载和“迷失陷阱”。为此,DeepAgent 引入了独特的“自主记忆折叠”能力。在推理过程的任何关键节点——例如完成一个子任务后,或意识到当前探索路径错误时——智能体可以主动生成 <fold\_thought> 指令,决定“喘口气”。
收到指令后,系统会借助辅助大模型,将此前冗长的交互历史压缩成一份高度结构化的记忆摘要。这个过程不仅能大幅节省计算资源,更重要的是,它为智能体提供了一个宝贵的反思和重新规划的契机,使其能跳出错误的探索循环,调整策略,从而显著提升复杂任务的最终成功率。
3.3 受人脑启发的结构化记忆:让记忆不仅全面,而且易用
为了确保上述“记忆折叠”的过程高效、精准,并实现信息的高保真压缩,DeepAgent 专门设计了一套先进的脑启发式结构化记忆系统。所有历史信息均被整理为稳定、可预测的 JSON 格式,取代了杂乱的自然语言记录。这种严谨的结构化设计是折叠机制的成功基础,它确保了智能体能够快速、无歧义地解析和利用这些信息,有效避免了关键细节在压缩与提取过程中的丢失,显著提高了长期推理的可靠性。该系统包含三个关键部分:
-
情节记忆(Episodic Memory): 作为智能体的长期记忆核心,它以高层、宏观的视角记录任务的关键节点、重大决策和里程碑事件。这不仅提供了任务全局的完整历史线索,更是支持智能体进行深度反思和长期战略规划的依据。
-
工作记忆(Working Memory): 类似于大脑的短期“缓存”,保存当前正在处理的子目标、即时挑战和下一步行动计划。它至关重要地保障了智能体在记忆折叠前后的思考连贯性和任务执行的即时性。
-
工具记忆(Tool Memory): 一本动态更新的自学习“工具使用手册”,系统地记录了所有已用工具的调用方式、效果好坏,乃至每一次成功与失败的宝贵经验。这种结构化的知识积累使得智能体能够持续优化其工具使用策略,实现工具利用效率的显著提升。
3.4 高效稳定的ToolPO训练框架:为通用工具使用量身打造的强化学习
为了将这些先进理念高效地训练进模型,我们独创了 ToolPO(Tool Policy Optimization),一个专为通用工具使用设计的端到端强化学习方法。它通过两大创新解决了训练中的核心难题:
- 引入“LLM工具模拟器”:在训练中直接调用成千上万的真实 API,会因网络延迟、接口变更等因素导致过程极不稳定且成本高昂。为此,我们利用一个辅助大模型来模拟真实 API 的响应,从而创造了一个稳定、高效且低成本的训练环境。
- 实现“双重优势归因”:为了让奖励更精准,ToolPO 设计了双重奖励机制。一是基于最终任务是否成功的“全局奖励”,该奖励会被分配给整个思考过程中的所有决策点;二是基于中间工具调用是否正确的“工具奖励”。最关键的是,这部分奖励通过“优势归因”技术,被精准地只传递给触发工具调用的那几个关键 Token。这种精细化的激励机制,让智能体能够更高效、准确地学会如何正确地使用工具。
我们在8个业界公认的基准测试中对 DeepAgent 进行了严苛的评估,涵盖了从通用工具使用到复杂的下游应用场景。
关键结论:
- 全面超越传统方法:无论是在给定工具集还是需要自主发现工具的开放场景下,DeepAgent 的端到端推理模式都显著优于基于工作流的传统智能体。例如,在 TMDB 基准上,成功率高达 89.0%,远超同级别模型的 55.0%。
- 无惧开放环境挑战:在拥有上万个工具的 ToolBench 测试中,DeepAgent 的成功率达到64.0%,而传统方法在工具检索面前表现挣扎,这证明了其在真实开放环境中的强大鲁棒性和扩展性。
- 下游应用表现卓越:在具身智能(ALFWorld)、在线购物(WebShop)、通用AI助理(GAIA)等复杂任务中,DeepAgent 同样取得了 SOTA 性能,展现了其强大的场景适应能力。例如,在 GAIA 任务上得分 53.3,显著领先于其他先进模型。
- 强大的扩展与泛化能力:实验证明,DeepAgent 的架构能有效适配不同规模和类型的推理模型作为其“大脑”,并且随着模型能力的增强,其性能也相应地获得更大提升,展现了巨大的发展潜力。
除了亮眼的总体表现,我们还通过一系列分析实验,深入探究 DeepAgent 成功的关键所在。
- 更高效稳定的训练:独创 ToolPO 方法
我们对比了独创的 ToolPO 训练法与传统的 GRPO 方法。实验曲线清晰显示,ToolPO 不仅能让模型达到更高的性能上限,而且整个训练过程的奖励曲线波动更小。这证明,通过引入“工具模拟器”和对工具调用过程的“精准奖励”,我们能让智能体在学习使用工具时,学得更快、更好、也更稳定。
- 环环相扣的系统设计:每个组件都不可或缺
我们对 DeepAgent 进行了“拆解”分析,验证了每个核心组件的价值。结果表明:
-
移除端到端的 ToolPO 训练,性能下降最多,证明这是提升能力的核心。
-
移除“记忆折叠”机制,在需要长期规划的 GAIA 任务上性能大幅下滑,说明“喘口气、再思考”的能力对复杂任务至关重要。
-
移除训练中的“工具模拟器”和“优势归因”,性能均会受损,再次验证了我们训练策略的先进性。
- 更聪明的工具检索策略:边思考、边发现
传统方法通常在任务开始前就“一次性”检索好所有可能用到的工具,而 DeepAgent 则采用“边思考、边发现”的动态策略。实验证明,DeepAgent 的策略在所有场景下都更优越,尤其是在面对包含上万个工具的大型工具库时,其优势愈发明显。这证明了DeepAgent 的架构与动态发现的模式完美契合,能更高效地驾驭海量工具。
- 更强的扩展性:思考步数越多,解决问题能力越强
我们通过限制智能体的最大“行动步数”来观察其性能变化。结果显示,随着步数上限的提高,DeepAgent 的性能稳定增长,且与传统 ReAct 方法的性能差距越拉越大。这说明 DeepAgent 能够更有效地利用每一步行动,没有“废操作”,因此在处理需要更多步骤的复杂任务时,其扩展能力和效率远超传统方法。
- 卓越的泛化能力:强大的框架适配不同“大脑”
我们将 DeepAgent 的框架分别应用于 30B 和 235B 参数规模的推理模型上。结果显示,无论在哪种“大脑”的支持下,DeepAgent 的表现都持续、显著地优于传统方法。这证明了 DeepAgent 作为一个通用框架的强大泛化能力,它能有效释放不同底层模型的能力,并随模型规模的增大而变得更强。
DeepAgent 通过其统一的推理流程、自主的记忆管理和高效的训练方法,为构建更通用、更强大的 AI 智能体树立了新的标杆。它不仅是一个模型,更代表了一种全新的、可落地的智能体设计范式,让AI真正自主学会如何思考、如何学习、如何与复杂世界互动。
未来,我们将继续探索更加前沿的AI多智能体技术方向,包括更高级的记忆管理、更自然的人机协作模式、更懂用户的AI助手,致力于打造一个能够全面融入人类生活和工作的通用智能伙伴。
李晓熙
中国人民大学博士生,小红书中台算法组实习生。以第一作者在人工智能顶会 NeurIPS、ACL、EMNLP、AAAI 等发表多篇论文。代表工作包括 Search-o1、WebThinker、DeepAgent。主要研究方向为 Agentic AI、Deep Research 等。
焦文祥
小红书中台算法组大模型应用算法专家,主要研究方向为 Agentic AI、Deep Research、LLM Personality 等,先后在 NeurIPS、ICLR、ACL、EMNLP 等发表多篇论文。代表工作包括 Multi-Agent Debate、CipherChat、PsychoBench 等。
晋嘉睿
小红书算法工程师,主要研究方向为大语言模型应用、信息检索技术、多模态建模。以第一作者在人工智能顶会 ICML、KDD、WWW 等发表多篇论文。
陆远
小红书中台算法组技术负责人,从事自然语言处理、多模态算法研究十余年,先后在 ICLR、ACL、EMNLP、CVPR 等发表多篇论文。近年来主要研究方向聚焦基于大模型的人机交互、情感陪伴、多智能体系统,致力于构建体验导向的AI创新应用。
团队介绍
小红书中台算法组致力于打造业界领先的AI创新应用。团队专注文本和多模态的后训练及强化学习技术,深入探索类人交互、情感陪伴、智能体系统等前沿应用领域,持续推动AI与人文社会深度融合,构建长远用户价值。团队成员在ICLR/ICML/CVPR/ACL 等顶会发表论文60+篇,依托丰富的计算资源和良好的人文氛围,面向在校优秀硕博生提供日常和 ACE实习机会,并开放校招与社招全职岗位。
招聘岗位
大模型应用算法专家
ACE顶尖实习生
大模型算法实习生
任职资格
- 自然语言处理、人工智能等专业的硕士或博士生
- 代码能力突出,同时具备DeepSpeed/Megatron等分布式训练框架、vLLM/SGLang等高性能推理框架的实际使用经验;
- 具备良好的责任心、自驱力和技术前瞻性,擅长产研协作,能主动攻坚技术难点,通过算法迭代推动业务增长;
- (加分项)有顶会或开源项目落地经验优先。
简历投递至:
[email protected];[email protected]
**往期精彩内容指路 :
RecSys 2025 | 小红书推荐团队提出视频时长预估新方法:EGMN
ACL 2025 杰出论文 | 小红书 AI 搜索和北理工提出“容量差距法则”
从“实现需求”到“共创价值”:AI Native时代需要什么样的工程师团队?
**添加小助手,了解更多内容
微信号 / REDtech01
****
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:小红书技术REDtech 等你加入的《小红书推出通用推理智能体 DeepAgent:工具&任务随心配!》