4B模型下棋比肩大师、还会讲棋,陈丹琦团队怎么做到的?
4B模型下棋比肩大师、还会讲棋,陈丹琦团队怎么做到的?普林斯顿大学陈丹琦团队在arXiv发布约4B参数模型QUEEN,通过门控交叉注意力连接Leela与SmolLM3-3B,并引入四阶段课程和迭代搜索蒸馏,使其棋力接近特级大师且能用自然语言解释着法。
搜索
普林斯顿大学陈丹琦团队在arXiv发布约4B参数模型QUEEN,通过门控交叉注意力连接Leela与SmolLM3-3B,并引入四阶段课程和迭代搜索蒸馏,使其棋力接近特级大师且能用自然语言解释着法。
Karpathy建议让LLM采用约80%的ASD-STE100规范,并生成图示、HTML交互页面或定制讲解视频,将输出转化为更清晰易懂的软件产物。
2016 年 3 月,首尔四季酒店。人机大战第二局进行到中途,AlphaGo 把一颗黑子落在了第五线上。现场解说一时语塞,有人怀疑程序出了 bug,因为在职业棋手的常识里,这手棋近乎于白送。
openJiuwen WorkSwarm首发全双工多模态能力,实现用户在前台像聊天一样随时与Agent交互、插话和追问,复杂任务则交给后台Core Agent独立执行,且原生亲和昇腾算力,支持基于华为云ModelArts与vLLM-Omni框架在昇腾NPU上部署。
华为诺亚方舟实验室、华为云天筹AI求解器团队与华中科技大学John Hopcroft计算中心组成的联合团队,依托华为云天筹决策智能引擎和LLM4AD_Next算法设计平台,斩获SAT Competition 2026并行AI赛道SAT组冠军。
当经典算法遇到 LLM,用概率预判代替盲目试错,或许才是架构演进的真正解法。
在社会变化的洪流中,LLM 能不能不断修正自己对社会的认知?
Insilico Medicine、Liquid AI、巴克衰老研究所等机构在Cell发表论文,推出面向衰老研究的AI工具链LongevityBench、Longevity-LLMs和Longevity Claw,其中参数量仅9B的专用模型L-Qwen3.5-9B在综合排名中超越Gemini 3.1 Pro和Claude Opus 4.6。
在过去的几年里,LLM RL 系统的工作负载发生了巨大的变化。早期的 RLHF 围绕同步训练展开:模型按固定顺序进行生成、打分和训练,每个阶段之间有着明确的同步边界。如今,系统还需要处理异步生成、持续训练、多轮 Agent 以及与外部环境的交互 —— 那些在同步执行中原本隐含的状态、版本和故障边界,现在都必须显式地进行管理。
北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学等 8 家机构的 19 位研究者联合完成 Theory of Agent 综述,讨论模型内部与外部 harness 应如何分配能力,并据此梳理 LLM Agent 的学习、对齐、演化与评测。