3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路
3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路多轮智能体任务只有一个终点奖励,但在一条包含搜索、工具调用和多轮决策的轨迹里,决定成败的往往是一个不起眼的查询词、动作或对象选择。
搜索
多轮智能体任务只有一个终点奖励,但在一条包含搜索、工具调用和多轮决策的轨迹里,决定成败的往往是一个不起眼的查询词、动作或对象选择。
英伟达CEO黄仁勋在洛杉矶All-In Summit上接听特朗普现场来电,明确表示"绝不让AI减速",并就AI安全工程化、开源重塑中美AI竞争、英伟达向模型与基础设施两端延伸等议题展开近50分钟讨论,坚持放慢AI发展是错误策略。
Claude Code 里,已经有人玩起了俄罗斯方块。不是另外打开一个游戏窗口,游戏直接出现在 Claude Code 的界面里。
「人类造的最后一个 AI」还有多远?OpenAI、Anthropic 等头部厂商进度如何?定义中国 RSI 的 roadmap——前沿 AI 研究机构 Theseus Labs 结合 72 家产业实践,推出「RSI 五级框架」
2026年上半年,具身智能赛道狂揽超过460亿元融资,人形机器人的单价也正式迈入「万元以内」的门槛。
大家小时候有没有看过交换空间,我可太爱了。
单科冠军不够,具身智能落地需要没有结构性短板的底座
说AI毁了数学,可能还是太小瞧AI了。
Claude Opus 5.2深夜在Claude Code中开启灰度测试悄然上线,开发者通过抓包确认前端未变的Opus 5已被路由至5.2版本,响应速度和自主迭代能力显著提升;同时Anthropic内部代号Model 2的模型在CoBench v2榜单取得62.8%高分并接管大部分代码编写工作,RSI进程疑似加速。
据雷峰网独家获悉,一位长期在英国工作的Google Gemini预训练专家(L7-L8级别)近期加入国内某互联网大厂,被视为本轮BAT高价争抢Gemini人才以来首次"找对了人";此前多家大厂虽从Gemini硅谷办公室挖角,但因Google有意将核心预训练人才留在DeepMind英国办公室,导致此前引入的部分人选并未触及预训练核心环节。