刚刚,Hinton发了首篇RSI论文
刚刚,Hinton发了首篇RSI论文Hinton等22位作者在首篇RSI论文中指出,AI全面参与下一代AI研发可能形成递归自我改进并引发智能爆炸,但现阶段证据不足以证明智能爆炸已经发生。
搜索
Hinton等22位作者在首篇RSI论文中指出,AI全面参与下一代AI研发可能形成递归自我改进并引发智能爆炸,但现阶段证据不足以证明智能爆炸已经发生。
Utopai Studios打造的Utopai X在Artificial Analysis Video Arena盲评中以1150 Elo位列全球第二,其核心竞争力是将模型深度集成PAI制作系统,并通过真实影视项目、专家反馈与系统迭代形成持续进化的数据飞轮。
StartLux发布完全开源的StartLux-Decision,其27B版本在Decision Index 0.2.1的38项基准中有31项超过Jev 1.13,并以63.88分升至公开榜首。
AI虚拟细胞(AIVC)正围绕基础模型、扰动数据、算力和评测标准展开竞赛,百图生科等机构加速布局,但纯AI尚不能稳定战胜统计基线,高质量扰动数据仍是瓶颈。
文章指出,AI时代的FDE已从软件部署延伸至梳理企业Ontology、验证方案、推动系统接入与员工采用,并通过沉淀可复用能力服务产品迭代,其核心难点正由技术转向沟通和组织变革。
开源项目agent-wow接入GPT-6 Astra,使其不读取游戏画面、仅依据服务器网络数据包自主感知和规划,40分钟内零死亡完成《魔兽世界》兽人新手村全部任务。
Rabbit创始人吕骋表示,人不该为Agent改变思考方式,OS3以持续对话、最多连接五台电脑并支持自带模型密钥和本地执行来降低门槛,但个人Agent的长期需求仍待验证。
Karpathy建议让LLM采用约80%的ASD-STE100规范,并生成图示、HTML交互页面或定制讲解视频,将输出转化为更清晰易懂的软件产物。
Tavus发布全双工视频到视频交互模型Griffin,可实时生成720p数字人并理解停顿、表情与动作,在一分钟测试中让54名参与者近48%误以为在与人交谈,但该结果未独立验证且模型尚未公开。
在Anthropic冲刺IPO之际,Meta将Claude Code活跃用户从6万降至3万并转向Muse Code,微软也将内部Claude支出削减逾33%,单员工月度Token预算从10万美元降至1万美元。
《The Verge》报道,Mercor、Scale AI 和 Surge AI 招募律师、编剧、教师等专业人士生产 AI 训练数据,使劳动者在教 AI 取代原有工作的同时,面临项目骤停、严密监控、降薪和技能被模型掌握后需求消失的困境。
Google等提出RRSI,通过正则化Agent Harness自我改进中的Proposal与Selection,减少过拟合与复杂度累积,并提升未见基准上的迁移表现、降低Token成本。
Opus 5.5通过MV、3D游戏和机械沙虫等案例展示出编排完整创作流程的能力,文章指出爆款Demo正成为观察模型的新benchmark,但应结合时间、成本、工具与修改过程判断其成熟度。
Anthropic 为 Claude Code 默认开放可深度改装的 Mods,并推出拥有超 2000 个插件和连接器的 Claude Marketplace,但高权限与暂缺收益分成也带来安全和持续运营疑问。
一位北大数学系校友认为,OpenAI和Anthropic借AI高调宣传数学突破,可能误导公众并打击青年学习数学的热情,学界仍应支持人类数学研究与公平成果归属。
OpenAI员工David Robinson在离职信中称,持续冲刺和“迭代部署”文化已无法保持必要谨慎,并警告随着AI能力增强,失败的代价将扩大,人类可能失去决定自身生活方式的权利。
OpenAI将订阅用户使用GPT-6 Astra和GPT-6.1 Sol的速度提升约50%,但SemiAnalysis实测称Anthropic订阅的API等价价值约为OpenAI的5倍,OpenAI 200美元套餐额度也已减半。
Ateve 团队发布 AI 决策模型 Ateve Jev,首个版本 ateve-jev-v1 支持候选选择、是非判断和等级评分,并上线 TokenDance 平台。
今天,外网被这个视频刷屏了。有人用Fable 5.5一键生成了一部「人类数万年进化史」,把整个人类历史压缩进了3分钟。整个过程,都是用纯代码写出,零视频素材,零版权音乐,没有使用任何视频生成模型。
马斯克确认正与台积电讨论Terafab芯片制造合作,而英特尔仍是目前唯一被正式点名的合作伙伴,计划提供14A工艺。
Caltech的Anima Anandkumar团队利用物理信息神经网络(PINN)和自研优化器,在三维无强迫欧拉方程自由空间中求得奇点候选解,缩放指数收敛至约0.5,但最终证明仍待完成。
哈佛物理学家Matthew Schwartz用Claude和开源工具BootLoops处理可验证的科研任务,90天产出横跨18个学科的36篇论文初稿,并主张由人挑题、追问和验收,让AI发挥辅助而非替代科学家的作用。
文章指出,AI常生成美女,是因为模型倾向生成接近数据分布中心的平均脸,而人类更偏爱平均脸,训练数据偏置、用户点击、奖励模型与商业激励进一步强化了这一反馈循环。
CScale完成1.45亿美元C轮融资,由Valor与Atreides联合领投,两家9月已四次联合领投AI融资,显示跨市场基金正成为AI数据中心互连项目的重要领投方,并使相关估值更受Astera Labs、Credo等美股表现影响。
腾讯推出永久免费的AI接待工具Knocket,支持网站、联系页和移动应用接入,上传FAQ及文档后可让AI依据知识库回复访客,并在需要时转接人工。
VA-Bench测试12个主要多模态模型发现,Qwen3.8-max、Opus-5和GPT-5.6-sol虽在目标识别与定位上达100%、操作语义理解达99.6%—100%,完整任务成功率却仅为53.93%、52.86%和51.55%,暴露大模型从空间理解到执行与修正的断层。
Physical Intelligence联合创始人Sergey Levine指出,机器人尚未进入稳定缩放阶段,应以先验知识、有效决策循环和多样化数据提升泛化与可靠性,并在找到真正可规模化的技术后扩大投入。
大模型竞技场Arena让Claude Opus 5.5与GPT-6 Astra各自练棋200局,前者估算评分从约1500升至1760,后者从第29盘的1810降至1400,显示AI仅靠记录与复盘提升能力的表现并不一致。
来自上海创智学院、复旦大学、伦敦国王学院与牛津大学等机构的研究团队推出SocioVerse2,将大模型社会模拟扩展为可干预、可迭代、可回溯的开源社会科学研究框架。
Harvey联合创始人Gabe Pereyra表示,AI应用公司不必与大模型公司比拼资金和算力,可借助真实任务评测、领域专家、开源模型和外部研究团队建立持续学习能力。