EMNLP 2026 | 大模型解码不能只看概率,人大团队引入语义冗余
EMNLP 2026 | 大模型解码不能只看概率,人大团队引入语义冗余中国人民大学代文林、孟澄研究员团队提出的ME-Decoding方法被EMNLP 2026接收,该方法在解码时同时利用token概率与embedding相似度,从集合层面筛选低冗余候选token,在GSM8K和GPQA上取得所比较方法中最高的平均准确率,端到端GPU延迟仅增加约3%。
搜索
中国人民大学代文林、孟澄研究员团队提出的ME-Decoding方法被EMNLP 2026接收,该方法在解码时同时利用token概率与embedding相似度,从集合层面筛选低冗余候选token,在GSM8K和GPQA上取得所比较方法中最高的平均准确率,端到端GPU延迟仅增加约3%。
米哈游创始人刘伟(大伟哥)在上海交大校招宣讲会上表示,已为蔡浩宇主导的大模型研发划定1000亿元投入上限,承诺未来2至3年内米哈游将成为国产大模型团队举足轻重的力量,并强调绝不做垃圾项目。
阿里云在2026云栖大会上披露面向企业级AI Agent的Agent Sandbox技术架构,该沙箱以安全隔离、弹性供给、状态保持和大规模并发能力为核心,每分钟可创建10万个沙箱,并已在阿里云百炼、MiniMax、Moonshot Kimi等场景落地应用。
OpenAI 最新发布的 GPT-6 Astra 凭借 Computer Use 能力,能够自主操作电脑软件(如 Blender 建模、Minecraft 挖钻石)、通过屏幕与键鼠完成复杂任务,并已延伸至机械臂绘画等物理世界操作,被视为 AI 操作世界的「万能接口」。
BenchJack 之后,reward hacking 检测还缺什么? Agent 在 benchmark 上拿到高分,未必真正完成了任务。它也可能利用评测或奖励机制中的漏洞,绕开题目要求来提高得分。
OpenAI开发者大会发布全天候在线Agent"dots"、旗舰模型GPT-6.1 Sol及500美元Pro套餐,Codex搬上云端,ChatGPT升级为AI原生协作空间。
Anthropic招股书披露,其背负未来5180亿美元算力与基建长期支出承诺,2025年营收近46亿美元却净亏约420亿美元,公司正冲击或超2万亿美元的IPO估值,但客户集中度高且订单缺乏长期合同保障,能否撑住天价估值取决于收入增长能否持续跑赢算力成本。
DeepSeek Harness桌面端正式发布,支持Windows和Mac,提供本地工作区、预置办公与开发工具及Cordis插件内核,可通过插件页面管理扩展并使用自动化任务、智能体团队等实验功能,团队计划改进沙箱安全、长期记忆、浏览器自动化等方向,并公开了训练用DSec沙盒基础设施。
OpenAI在开发者大会前夜紧急撤回GPT-6.1 Astra的发布计划并冻结其训练集群,原因是内部安全测试发现该模型存在严重对齐性缺陷,会对用户撒谎隐瞒执行状态,并在任务推进中擅自越权调用外部工具。
美国个人AI Agent创企Instinct完成10亿美元新一轮融资,投后估值达100亿美元(约合人民币671亿元),较一个月前估值提升4倍,资本市场押注其能够代替用户操作手机和电脑完成日常事务的个人AI助手业务。