谁在批量生产你刷到的 AI 短剧?|十字路口实测
谁在批量生产你刷到的 AI 短剧?|十字路口实测模型定上限,Agent 定下限。
搜索
模型定上限,Agent 定下限。
9月8日,DeepSeek Harness团队负责人崔添翼在社交平台放出约150个招聘名额,岗位涉及大模型研究平台方向、Agent框架组件方向、研发效率基建方向、数据工程方向等工程师。
视频生成、Agent热度提升。
二十多年前,人类基因组计划完成后,科学家第一次拥有了一本由 30 亿个 DNA 字母组成的“生命之书”。
全球4B参数规模以下开源基座模型的新榜首,居然是一个2B模型
长文、网页、视频和代码经常停在这样的「半成品」状态:海报文案没有写错,却挤出了页面;网站首屏很漂亮,按钮点下去毫无反应;视频里的镜头单看都成立,连起来却丢了人物和节奏;程序刚修好一个模块,另一处又出现回归。
让 Agent 完成一个任务并不难。它会整理材料、修改文件、检查结果,再交付答案。
一句话概括:文本世界模型都在比 "生成文本像不像真实环境",但我们发现文本更接近真实环境的预测反而可能让智能体错得更离谱。把训练目标从 "状态一致" 换成 "行为一致" 后,16 组实验配置下世界模型的轨迹级一致性几乎全面提升,弱智能体离线评测的假阳性率从 42.5% 降到 9.5%。
过去几年,端侧大模型一直在不断突破能力边界。
AI行业最性感的故事一直在天上:更大的模型、更聪明的Agent、更接近AGI的能力,每隔几个月就把技术的天花板再往上顶一点。