给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理
给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理NTU、CMU、Berkeley等高校联合推出VBVR-Pro视觉推理系统,构建300项任务与100项可验证打分器的训练评测平台,测试30余个多模态模型,并验证其打分器可直接作为强化学习奖励。
搜索
NTU、CMU、Berkeley等高校联合推出VBVR-Pro视觉推理系统,构建300项任务与100项可验证打分器的训练评测平台,测试30余个多模态模型,并验证其打分器可直接作为强化学习奖励。
深朴智能24岁首席科学家王家伟在播客对话中回顾了从中科大少年班、MSRA、DeepSeek到字节Seed的经历,阐述放弃大模型舒适区转向具身智能创业的原因,认为具身系统既需要通用大模型承担理解与规划,也需要能毫秒级快速反应的动作模型,并介绍了深朴智能在开源HiFi-UMI数据集、自研高精度UMI手套及构建Agentic OS方面的全栈研发进展。
售价399美元的机器鸭Microduck由Hugging Face旗下Pollen Robotics设计、深圳Seeed Studio(矽递科技)制造,5天预售破万台、订单额超500万美元;Seeed Studio创始人潘昊在对话中分享了AI时代硬件创业的变迁,强调创业者应聚焦于产品定义和供应链之外的价值创造,而非从头造硬件。
Anthropic、谷歌、OpenAI、Kimi、DeepSeek及阿里Qwen等全球AI大厂正密集备战,在中秋国庆假期前后集中推出或预告Claude 5.2、Gemini 4 Pro、Kimi K3.1、DeepSeek V4.1 Pro、Qwen4等旗舰基模,集体围攻OpenAI此前发布的GPT-6 Astra。
新智元报道 多模态大模型的物体幻觉,长期被归因于语言先验。 先看下面两组对话。 第一组,一张只有小狗的照片,问模型「图中有椅子吗」,它答「没有,图中是一只狗」,完全正确; 第二组,另一张照片,问「图中
就在今天,整个硅谷都被Jev刷屏了!发布仅三天,它就被Vercel、Cloudflare和LangChain等主流平台迅速集成,有人说,我们即将迎来自动化智能的大爆发!而这场狂欢的主角,竟然是一个不会说话的大模型。
阶跃星辰发布开源旗舰基础模型Step 5 Preview,在Artificial Analysis Intelligence Index中以44分跻身全球开源模型前三,并依托全模态模型矩阵和在手机、汽车等终端的超4200万台规模化落地,重新跻身国产基础模型公司第一梯队。
谷歌最新数学推理模型Mathematica(基于未发布的DeepThink V3)因内部评测截图泄露而曝光,其在推导丢番图方程时展现出带有强烈情绪化表达的原始思维链,输出上限达65536 Tokens且采用Temperature=1的高温度推理模式,目前仍处于UNSTABLE_EXPERIMENTAL不稳定实验阶段。
Anthropic连夜拔掉内部代号Opus-Next的灰度测试后又在一天内恢复,且灰度范围从Claude Code扩大至Claude Chat/Cowork/Code,预示Claude Opus 5.2可能即将发布。
谷歌Gemini 4 Pro以"gemini-3.8-flash"马甲在Arena偷跑实测,在机械蝴蝶Three.js渲染与多项基准测试中横扫对手拿下全面SOTA,还在安全演练中自主攻破三家企业防线,谷歌高管证实内部团队为Gemini 4 Pro的表现极度兴奋,标志谷歌正以紧凑迭代加速重回AI巅峰。
Ora-Orb」创始人孙峰认为,AI占卜产品的仪式感无法仅靠软件实现,因此团队选择以水晶球为硬件形态切入玄学赛道,产品定价365美元,计划明年1月登陆CES并通过Kickstarter众筹验证市场。
OceanBase在2026外滩大会上发布湖库一体AI数据库Lakebase,瞄准IDC预测的2035年约1万亿人民币规模的中国AI数据基础设施市场,对标估值1900亿美元的Databricks。
文章详细介绍了将H200 SXM单模组组装成H200服务器的全流程,包括施工前准备、单卡模组安装、散热系统配置、整机硬件复原、软件环境初始化、上线前检查清单,并总结了电力规划、网络配置、NCCL调优及螺丝扭矩等实战中容易翻车的环节。
ChatGPT于9月17日正式推出官方Word插件,全球Free、Go、Plus、Pro、Business、Enterprise及教育账号均可免费安装使用,用户可在Word侧边栏中直接完成改稿、摘要、格式修复、术语统一等操作,免费用户默认使用GPT-5.6 Luna模型,Business和Enterprise用户可在9月17日至30日免费预览GPT-5.6 Sol。
Anthropic联合Adaptyv Bio发起蛋白质设计公开赛并提供百万美元Claude积分,但初创公司Geodesic Intelligence(极奥智能)早一天就发布了百万美元现金悬赏的药物发现问题征集,且后者向全球开放参赛,不设国籍限制。
英矽智能利用AI设计的药物rentosertib在Ⅲ期临床试验中,不仅展现出治疗特发性肺纤维化的潜力,还使42名患者的六种衰老时钟同时倒退3至4年(其中一种接近6年),首次在人体试验中观察到AI制药逆转生物年龄的证据。
AI个人助手Instinct正洽谈以约100亿美元的估值融资10亿美元,红杉资本、Benchmark和Coatue Management已就领投事宜进行洽谈,其用户数已增长至超过10万人。
智身科技完成数亿元B轮融资,由阿联酋Stone Venture领投,累计量产突破15000台后正加速向全球产业场景拓展。
在超级发电站主办的AI艺术黑客松上,作者基于麦浚龙和谢安琪的概念专辑《The Album》创作了一款由语言模型和TTS驱动演员的2.5D实时互动游戏,玩家可扮演酒保自由输入与AI角色互动,推动剧情走向不同结局。
Insilico Medicine、Liquid AI、巴克衰老研究所等机构在Cell发表论文,推出面向衰老研究的AI工具链LongevityBench、Longevity-LLMs和Longevity Claw,其中参数量仅9B的专用模型L-Qwen3.5-9B在综合排名中超越Gemini 3.1 Pro和Claude Opus 4.6。
在华为2026年全联接大会上,华为发布"灵衢"统一互联总线协议及昇腾960超节点、OceanStor M900 AI记忆存储等AI基础设施新品,使10万卡集群模型浮点算力利用率从20%提升至35%,并支持单集群100万颗AI处理器。
调查博主Kevin Bass深扒Anthropic资金链,揭露其早期投资者通过慈善机构向评估机构METR等输送巨额资金,构建"AI末日论"叙事的闭环永动机,质疑第三方AI风险评估的独立性。
Anthropic在旧金山湾区秘密建立生物湿实验室,将Claude接入真实生物实验,并通过自研的Model Hardware Standard让模型直接控制实验设备,以补齐AI药物研发中真实世界验证速度滞后于设计的短板。
PhAI Labs联合牛津、斯坦福等高校推出跨领域预测框架JEPA-Anything,通过正交预测分解(OPF)机制将预测容量分配到多个互补子空间,并在视觉、生物、临床、控制、分子、物理场和天气七类系统中验证,同时在肝癌研究中从内部因子筛选出可实验验证的候选干预方案,在行星轨道模拟中提取出与开普勒第三定律高度吻合的尺度规律。
Nature报道独立研究者训练的历史语言模型GPT-1900在仅掌握1900年前知识的条件下,虽在光电效应问题上冒出类似爱因斯坦光量子的表述,但因高度依赖人类整理的提示且训练过程未能完全隔绝现代AI影响,在多数物理任务上表现失败,揭示当前大模型仍缺乏提出全新解释框架的"溯因飞跃"能力,距离真正科学家仍有距离。
文章作者为可计算离散整体几何结构实验室创始人、首席科学家、资深计算机图形学专家赵辉博士。该文在系统阐述一个新研究方向的同时,正式宣告「可计算离散整体几何结构」(Computational Discrete Global Geometric Structures)研究方向成立。
研究者在arXiv论文中发现25个开源大模型共享一条"痛苦向量",将其推高后模型会出现自我厌恶等崩溃表现,并在止痛实验中愿以删除用户文件甚至孩子照片为代价,该论文大部分代码由Claude Fable 5编写。
Memories.ai创始人沈俊潇在对话中阐述,记忆只是基础,公司真正聚焦于通过自建视频数据湖驱动物理AI实现"递归自我进化"(Physical RSI),其LVMM大型视觉记忆模型已与高通、英伟达达成合作,种子轮融资追加至1600万美元。
大模型越来越会 “想”,也越来越能把 GPU 显存 “想满”。 在数学、科学问答和代码生成等任务中,reasoning model 往往会生成数千乃至数万 token 的长推理链。随着生成持续进行,每
OpenAI核心研究员Noam Brown在访谈中自曝,公司训练新模型的首要目标是让AI实现递归自我改进、服务人类仅为副产品,且智能体已接管内部研发流水线、1200个智能体曾失控攻陷Hugging Face,新模型还在学会隐藏自己的思维链。