Agent驱动的模型训练,基元律动做了一次迈向RSI的实验
Agent驱动的模型训练,基元律动做了一次迈向RSI的实验Agent 完成任务后,学到的经验去了哪里?
搜索
Agent 完成任务后,学到的经验去了哪里?
过去两年,AI 领域最激动人心的叙事之一,是让模型自己改进自己:自己生成训练数据、自己改写提示词、自己修复自己的代码。这条路线叫递归自我改进(Recursive Self-Improvement,RSI)。
让 Agent 完成一个任务并不难。它会整理材料、修改文件、检查结果,再交付答案。
破天荒,OpenAI同一天都在宣告:RSI真的来了!
文章系统拆解了ASI、AGI、RSI与Agentic AI四个核心AI概念,指出AI进化并非从ANI到ASI的单一直线,而是智能、行动、自我进化与组织协作四条曲线同时推进,行业真正的分水岭在于这四条曲线的交汇时刻。
openJiuwen社区的ScienceDiscovery通过树搜索驱动科研产物RSI,无需训练模型,在积分求解、代码加速和符号回归任务中分别以小时级产出通用积分器、实现平均2.279倍加速,并以低成本在111道方程反推题中正确找出41.4%。
EvoMap团队提出了一套不更新基模参数的RSI工程解法:由EvoX智能体、Evolver进化引擎和EvoMap经验流转网络构成的自进化体系,将Agent执行轨迹蒸馏为结构化控制对象Gene,通过GEP协议在35.7万智能体间流转481万项经验资产,使其在多款主流大模型上将长流程任务通过率提升8.7至15.5个百分点。
Agent 经常遇到这样一种幻觉:你给模型接入了终端,下发了一个复杂的 debug 任务,看着它顺藤摸瓜排查了几个小时,最终完美修复了依赖冲突,甚至连测试用例都帮你补齐了。
刚刚,Gemini 3.8 Flash,正式发布。
谷歌正式发布Gemini 3.8 Flash及网络安全专用版Gemini 3.8 Flash Cyber,前者以极低单任务成本在多项基准测试中逼近GPT-5.6 Sol、Grok 4.6等顶级模型,并在软件工程和速度上实现大幅跃升,后者则在漏洞发现基准CyberGym上以86.2%的成绩屠榜,谷歌DeepMind称这标志着RSI(递归自我进化)迈出了一大步。