AI资讯新闻榜单内容搜索-强化学习

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 强化学习
被开除的Thinking Machines CTO,又离开OpenAI回谷歌了

被开除的Thinking Machines CTO,又离开OpenAI回谷歌了

被开除的Thinking Machines CTO,又离开OpenAI回谷歌了

几个小时前,Barret Zoph 在 𝕏 上发了一条推文,他说自己将加入谷歌 DeepMind,而他的 AI 生涯正是从谷歌 Brain 的 Residency 项目起步的,这次算是重返旧地;他将专注于强化学习(RL)与后训练(Post-Training)方向,更多消息稍后公布;他还补了一句,谷歌拥有在 AI 领域持续成功所需要的全部要素,他很高兴能成为这个使命的一部分。

来自主题: AI资讯
8593 点击    2026-08-27 20:15
他亲手造出o1和o3,却突然宣布:人类可以永远退休了!

他亲手造出o1和o3,却突然宣布:人类可以永远退休了!

他亲手造出o1和o3,却突然宣布:人类可以永远退休了!

这是前OpenAI推理模型一号位Jerry Tworek抛出的最新暴论。他2019年进的OpenAI,一待就是七年。当年强化学习死活scale不动,是他死死咬住不放硬推上去的,o1和o3这两代大杀器都是他亲自带队砸出来的。

来自主题: AI资讯
8116 点击    2026-08-27 09:34
字节Seed架构迎来重大调整

字节Seed架构迎来重大调整

字节Seed架构迎来重大调整

近期,字节跳动大模型核心部门Seed完成新一轮组织调整,调整核心集中在Seed Foundation Model(Seed基础模型)板块,新设四个一级部门,重构了预训练数据、强化学习与后训练的组织链路。

来自主题: AI资讯
8628 点击    2026-08-21 09:08
突发!OpenAI紧急暂停GPT-6训练

突发!OpenAI紧急暂停GPT-6训练

突发!OpenAI紧急暂停GPT-6训练

史无前例,OpenAI真的停手了!刚刚,奥特曼亲自官宣,「OpenAI暂停下一代旗舰模型的强化学习训练,为期两周」。官方给出停更的原因是:要确保安全、对齐和监控标准,能跟得上眼前这个全新的能力水平。

来自主题: AI资讯
9426 点击    2026-08-19 12:09
在WAIC现场,我们见到了Richard Sutton

在WAIC现场,我们见到了Richard Sutton

在WAIC现场,我们见到了Richard Sutton

WAIC 2026 期间,我们和另外几家媒体(机器之心是其中唯一的专业媒体)共同对来到中国的强化学习奠基人、2024 年图灵奖得主 Richard Sutton 做了一场群访。

来自主题: AI资讯
8948 点击    2026-07-20 15:19
大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)正在成为大模型后训练的关键技术。数学题能判对错,代码能跑测试,可验证奖励让大模型可以通过强化学习持续提升推理能力。

来自主题: AI技术研报
10509 点击    2026-07-16 10:10
年近70,强化学习之父Sutton创业了!

年近70,强化学习之父Sutton创业了!

年近70,强化学习之父Sutton创业了!

年近 70 岁的图灵奖得主、强化学习之父理查德・萨顿(Richard Sutton),宣布创业了。本周一,Richard Sutton 宣布与 Khurram Javed 共同创立新公司 Oak Lab,要打破当前深度学习方式,用全新的理念构建 AGI。

来自主题: AI资讯
8542 点击    2026-07-14 16:15