8月26日下午,由华罗庚·原点学院主办,通用决策智能研究所承办,常州市知识产权公共服务平台协办的RLChina前沿学术论坛第1期在中国以色列常州创新园圆满落下帷幕。
本次论坛聚焦人工智能、强化学习与智能体决策前沿技术趋势,论坛由中国科学院自动化研究所张海峰副研究员主持,特邀来自浙江大学、厦门大学、南京大学、上海财经大学的四位学者,围绕大模型记忆、多智能体底层机制、自进化智能体及AI经济仿真等前沿议题,带来了四场极具深度的学术报告。
精彩回顾:报告解读
一、轻量化多模态大模型记忆系统
张宁豫 浙江大学副教授
张教授指出,随着大模型向长期运行的智能体演进,记忆能力已成为支撑持续学习、个性化服务和复杂任务执行的关键基础。他详细介绍了涵盖多模态记忆建模、记忆错误定位和端侧应用的完整技术体系。该体系支持文本、图像等多模态信息的统一存储、管理与检索,实现了记忆错误的精准定位和可解释分析,并为下一代AI智能体提供了高效、可靠、可部署的端侧记忆解决方案。
二、多智能体强化学习神经元优化策略探究
沈思淇 厦门大学副教授
针对多智能体强化学习中学习效率低、模型可塑性缺失的普遍瓶颈,沈教授从神经元微观机制层面切入,重点探讨了“休眠、徒劳、迟滞”三类制约模型性能的问题神经元,并系统介绍了ReBorn、GradPS、KNIFE三大创新算法。通过动态权重重分配激活闲置神经元、差异化分流冲突梯度、以及重初始化迟滞神经元,有效解决了多智能体协同训练中的梯度干扰与学习僵化问题,大幅提升了跨场景泛化可塑性。
三、迈向自进化智能体:利用数据飞轮持续改进基础模型
王志 南京大学副教授
王教授分享了当前基础模型从静态预训练向部署后持续提升演进的最新路径。他详细阐述了如何通过“收集经验——转化评估信号——强化微调”闭合数据-评估-优化循环,并围绕大语言模型推理、统一多模态模型、Agentic RAG以及具身视觉-语言-行动模型,重点剖析了教师轨迹、探索、回放、过程级奖励、搜索和共识机制如何将部署数据转化为更强的能力。同时,他指出了避免多样性和通用性坍缩的核心挑战,并展望了可信评估与稳定算法等未来趋势。
四、人工智能驱动的经济主体决策:群体仿真与策略求解
米祈睿 上海财经大学助理教授
米教授聚焦现实经济系统中普遍存在的多层次策略互动,介绍了融合人工智能与经济学理论的最新探索。报告提炼出“经济建模—智能体建模—AI算法求解—经济学分析与验证”四个方法环节,展示了从税收专项仿真平台TaxAI到通用经济仿真平台EconGym的递进式研究体系。通过提出动态Stackelberg均值场模型,将微观群体的动态反馈纳入宏观政策优化;并进一步开发平均场大语言模型(Mean Field LLM),提升了大规模社会群体行为模拟的准确性与可扩展性,为利用AI治理复杂经济系统提供了有益参考。
来源:通用决策智能研究所
|