DeepSeek新论文公开Agent训练!梁文锋署名
DeepSeek新论文公开Agent训练!梁文锋署名大模型训练拼的是算力,Agent训练拼的是环境。
搜索
大模型训练拼的是算力,Agent训练拼的是环境。
这年头,实时生成的世界模型越来越会「造世界」了。
两年前,一段机器人炒虾的视频在网上爆火。
搜索结果里但凡出现 AI 摘要,用户点开普通网页的几率就几乎腰斩。Pew Research Center 对美国用户在 Google 上大规模浏览行为的分析发现:有 AI 摘要时,用户点击传统搜索结果的比例从 15%直接暴跌至 8%。
6天,2000多万,小米这场史无前例的「炼丹直播」终于尘埃落定。
谁还没有被GPT-6 Astra搓3D的案例狠狠刷屏啊!
过去一年,Agent 的讨论大多围绕模型本身展开:推理能力更强、上下文更长、工具调用更稳定。但进入真实工作流后,另一个问题开始变得更关键:Agent 的能力从哪里来,又如何被持续复用。
AI视频,已经开始挑战「实时造世界」了!
谁也没想到, AGI 随着 GPT-6 的到来竟然来得这么快。
当预训练将大模型带到新的能力起点,强化学习则通过持续的探索与反馈,不断激发模型在新环境、新任务中的推理与行动能力,决定它们还能走多远。
最近 AI 桌面换装视频突然爆火,Twitter 上随便一条就是百万播放。
自现代大模型诞生以来,“下一个Token预测(Next-Token Prediction, NTP)”就被奉为不可撼动的黄金律条。然而,逼着模型逐字死记硬背,真能学会宏观语义规划吗?
现在的 Agent 的产品越来越多,有些主打 Coding,有些事做日常办公,也有些用于情感陪伴虽然这些产品的用途不同,背后的工作原理其实都大同小异,便是 Harness 对上下文的自动化编排
随着编辑工具与生成模型的快速普及,「改图」正在变得越来越容易,篡改者可以在几乎不改变画面观感的前提下完成内容伪造,给内容真实性核验、平台治理与数字媒体信任带来新的风险。因此,图像取证与可信鉴伪证据,成为了内容安全中尤为重要的一环。
当Agent已经能够调用工具、使用技能并保存记忆,一个更进一步的问题是:这些能力怎样在任务中配合,又怎样从过去的执行中积累可复用的经验?
让 AI 生成一张海报已经不难。更难的是,让它围绕同一个设计目标持续工作:理解品牌与产品要求,生成初稿;发现标题、产品位置或整体风格存在问题后,知道应该修改哪里、怎样修改;同时保留已经确认的内容。等到下一次活动,它还能延续此前确定的设计偏好和有效经验。
人麻了!
当经典算法遇到 LLM,用概率预判代替盲目试错,或许才是架构演进的真正解法。
数学界重大突破!
AI办公这块蛋糕,中国电信可能要先切走一块了。
在社会变化的洪流中,LLM 能不能不断修正自己对社会的认知?
Codex、Claude Code等数字世界智能体,已经向我们展示出了一种全新且高效的工作方式:大模型理解目标,拆解任务,调用适当的工具,并根据执行结果不断调整计划,直到完成任务。
工具调用使大语言模型能够通过外部 API 获取信息、执行操作。训练这类能力,需要建立用户请求与具体函数调用之间的对应关系。一条合格的训练样本,不仅要符合函数定义,还要保证工具选择、调用次数和参数取值与用户意图一致。
桌面上放着面包、刀还有一个婴儿人偶。
科学进步正在明显放缓。
现有的音视频奖励模型,能通过局部指标捕捉到画质或同步上的优势,却往往忽略声音失真、台词与提示不符,以及动作和语音配合不自然等问题。
AI 写代码的能力经常能让开发者「双手离开键盘」,但对于设计师而言,AI 生成的图片距离能交稿总是差了好几步。
经过 Octop 团队与社区开发者一段时间的共同推进,在一次次测试、打磨与优化之后,我们正式推出 Octop 1.0 GA版本(General Availability,正式发布版),并同步上线腾讯云轻量应用服务器(Lighthouse)与云服务器(CVM)官方应用镜像——购买即用的自托管 AI 助手,现在触手可及。
「会结网的动物有几条腿?」
一段人坐上椅子的视频,对人类而言再普通不过。我们不仅能看见 “人坐了下来”,还天然理解椅子承受人体重量,人与椅面形成接触并最终稳定,这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言,“看见动作” 与 “重建真实交互” 仍是两回事。一个视觉上准确坐在椅子上的人体,进入物理仿真后,椅子可能因结构缺失倒下,人体也可能与椅面严重穿模。视觉上成立,并不意味着物理交互上成立。