AI资讯新闻榜单内容搜索-强化学习

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 强化学习
AI 下半场,不会只剩一个超级模型|对谈 Kevin Ding:Pyromind 创始人/CEO

AI 下半场,不会只剩一个超级模型|对谈 Kevin Ding:Pyromind 创始人/CEO

AI 下半场,不会只剩一个超级模型|对谈 Kevin Ding:Pyromind 创始人/CEO

本周「十字路口」的嘉宾是 Pyromind 创始人 / CEO Kevin Ding。Pyromind 所在的赛道,常被称作 RL as a Service,也就是强化学习即服务、或后训练即服务。公司前不久完成天使轮融资,投资方包括高瓴、百度风投、蓝驰、Atypical 等机构。

来自主题: AI资讯
5364 点击    2026-09-01 10:28
AI自己出题自己练!两个月狂涨11%,编码自测反超Opus 4.8

AI自己出题自己练!两个月狂涨11%,编码自测反超Opus 4.8

AI自己出题自己练!两个月狂涨11%,编码自测反超Opus 4.8

Ornith-1.5采用模型自出题、自搭脚手架、自跑轨迹的三段式强化学习闭环,在Terminal-Bench 2.1自测中以86.1分超过其自测的Claude Opus 4.8(85.0分),较两个月前的1.0版本提升约11%。

来自主题: AI资讯
8348 点击    2026-08-30 14:10
被开除的Thinking Machines CTO,又离开OpenAI回谷歌了

被开除的Thinking Machines CTO,又离开OpenAI回谷歌了

被开除的Thinking Machines CTO,又离开OpenAI回谷歌了

几个小时前,Barret Zoph 在 𝕏 上发了一条推文,他说自己将加入谷歌 DeepMind,而他的 AI 生涯正是从谷歌 Brain 的 Residency 项目起步的,这次算是重返旧地;他将专注于强化学习(RL)与后训练(Post-Training)方向,更多消息稍后公布;他还补了一句,谷歌拥有在 AI 领域持续成功所需要的全部要素,他很高兴能成为这个使命的一部分。

来自主题: AI资讯
9046 点击    2026-08-27 20:15
他亲手造出o1和o3,却突然宣布:人类可以永远退休了!

他亲手造出o1和o3,却突然宣布:人类可以永远退休了!

他亲手造出o1和o3,却突然宣布:人类可以永远退休了!

这是前OpenAI推理模型一号位Jerry Tworek抛出的最新暴论。他2019年进的OpenAI,一待就是七年。当年强化学习死活scale不动,是他死死咬住不放硬推上去的,o1和o3这两代大杀器都是他亲自带队砸出来的。

来自主题: AI资讯
8334 点击    2026-08-27 09:34
字节Seed架构迎来重大调整

字节Seed架构迎来重大调整

字节Seed架构迎来重大调整

近期,字节跳动大模型核心部门Seed完成新一轮组织调整,调整核心集中在Seed Foundation Model(Seed基础模型)板块,新设四个一级部门,重构了预训练数据、强化学习与后训练的组织链路。

来自主题: AI资讯
8958 点击    2026-08-21 09:08
突发!OpenAI紧急暂停GPT-6训练

突发!OpenAI紧急暂停GPT-6训练

突发!OpenAI紧急暂停GPT-6训练

史无前例,OpenAI真的停手了!刚刚,奥特曼亲自官宣,「OpenAI暂停下一代旗舰模型的强化学习训练,为期两周」。官方给出停更的原因是:要确保安全、对齐和监控标准,能跟得上眼前这个全新的能力水平。

来自主题: AI资讯
9530 点击    2026-08-19 12:09
在WAIC现场,我们见到了Richard Sutton

在WAIC现场,我们见到了Richard Sutton

在WAIC现场,我们见到了Richard Sutton

WAIC 2026 期间,我们和另外几家媒体(机器之心是其中唯一的专业媒体)共同对来到中国的强化学习奠基人、2024 年图灵奖得主 Richard Sutton 做了一场群访。

来自主题: AI资讯
8990 点击    2026-07-20 15:19