✅直播预告!聊聊 Agentic RL 下半场: 无需梯度更新的即时强化学习JitRL
JitRL 让冻结权重的大模型打破了“学不会”的桎梏——不更新一次梯度,即可在推理侧完成等价于强化学习的策略迭代,真正实现“边用边进化”!
8月11日(周二)20:00点,青稞Talk 第145期,青稞社区邀请到新加坡国立大学(NUS)计算学院博士生李一博,直播分享ICML 2026 Spotlight 论文:JitRL——无需梯度更新的即时强化学习。
李一博,新加坡国立大学(NUS)计算学院博士生,研究方向聚焦于大语言模型、自进化Agent、可信大模型。其研究成果多次在国际顶会上发表,其中JitRL获评ICML spotlight。
了解更多:http://t.cn/AXNbCcDu
#青稞社区##人工智能[超话]##强化学习#
发布于 河北
