Loading...
近年来,大规模模型的进步主要集中在一个主题上:扩展(Scaling)。随着模型能力的增强,智能代理的功能逐步从单纯的“聊天”转向更实用的“工作”。然而,这种转变在模型正式投入使用后并不是终结。当智能代理进入一个未知的软件、工具或企业系统时,面临的挑战才刚刚开始。新环境通常有新的交互逻辑及调用方式,并伴随特定的限制和潜在问题。即便底层技术足够强大,代理也可能无法完全理解新环境中的因果关系,如哪些操作会产生何种结果或哪些条件可能导致失败。
传统方法是在面对新环境时收集交互数据,通过微调或强化学习重新培训模型,但这一过程并非无限制。数据采集和训练都有其成本,且许多企业环境中的数据不易获取,因此不断重训模型并不可行。因此,新的问题是:如果不更改模型参数,代理是否能像人类一样,自主探索环境、识别因果规律并逐步提升能力。
为此,专注因果智能的Aether AI开发了RSIAgent,探索以经验扩展的全新路径,而不是继续扩展模型本身。RSIAgent的设计是让智能体自主进入新环境,进行探索和试错,验证结果后将经验积累。这一方法形成了一种递归自我提升的框架,允许代理决定学习内容、获取经验、验证成果,并将稳定的因果关系记录在内存中,以便将来用作参考。 龙8国际登录
RSIAgent的研究表现出积极效果。在不加新参数的情况下,它推动Kimi-K3及GLM-5.3等开源模型的代理能力提升,并在OSWorld 2.0和Agents’ Last Exam中超越了闭源模型GPT-6 Astra。在OSWorld 2.0的测试中,RSIAgent获得了78.98%的部分得分,而在Agents’ Last Exam中得到了84.82%,均远超GPT-6 Astra的72.60%和82.26%。
RSIAgent的核心在于将代理与新环境的互动变为一个持续的学习过程。系统围绕动态演变的内存建立了一个包含课程代理、行动代理和验证代理的多智能体递归闭环:课程代理决定探索内容,行动代理执行任务积累经验,验证代理评估结果的可靠性,最终有效信息会被逐步写入内存中。此方法使得代理不仅能被动完成任务,还能自主选择学习方向、积累经验并不断扩展环境知识。
在此基础上,RSIAgent还采用了广泛到深入的双阶段自我探索策略,其逻辑类似于大模型训练中的预训练到后训练:第一阶段是广泛的递归自我探索。 龙8国际登录
2026-09-16
2026-09-16
2026-09-16
2026-09-16
2026-09-16
2026-09-16
杨毅分析中国男篮亚运阵容选择背后的原因
为篮球赛事提供媒体宣传、报道、直播和新闻发布服务,提升赛事的可见度。...
我退休存款被女婿逼问,律师上门要求我签字
为篮球赛事提供媒体宣传、报道、直播和新闻发布服务,提升赛事的可见度。...