分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA
分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。
搜索
刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。
有知情人士透露,美团LongCat团队基础模型负责人裴鹏即将离职。公开资料显示,裴鹏毕业于北京大学,长期深耕信息检索与自然语言处理方向,职业履历覆盖多家全球顶尖科技企业。
国内AI设计智能体扎堆冒出来,而且很多操盘手都来自同一批地方,字节剪映系和腾讯系尤其密集。最近注意到了一个产品叫OJO Design,官网的定位是全球首个设计Agent团队工作台,并且已经上线2个月了。
近日,上海新智具身智能科技有限公司(NeoteAI)联合复旦大学可信具身智能研究院,正式发布了 N0 系列三份技术报告,把触觉从 “辅助模态” 跃升为 “核心基建”。 三份报告合起来看,恰好拼出一张蓝图 —— 一套触觉数据底座,搭配两条不同侧重的技术路线。
新智元报道 AI第一次拿起彩铅画蒙娜丽莎,但发生了一件奇怪的事: 没有任何一个模型的最终作品,赢过它自己中途最好那版:它们总在最好的时候改过了头。 而且,同样是7幅画,成本相差了20倍! 最左为原作,
越来越多体育明星开始投资科技公司。 2026年7月19日,美加墨世界杯决赛落幕,西班牙击败阿根廷夺冠,39岁的梅西以亚军身份告别了世界杯舞台。 但这场比赛之后,人们讨论得最多的不是比分,而是一条来自硅
2026 年春天,AI 中转站这门略显灰色的生意,突然迎来了一位最不缺流量的玩家。4 月,孙宇晨开始为 B.AI 站台,把「一个 Key 调用所有大模型」的生意,称作「AI Agent 的底层金融基础设施」。
陪伴开始有了下一幕。这类产品这几年确实撑起了这条赛道用户量的天花板,也养出了一批愿意为角色付费的重度用户,但增长曲线普遍比较难看,泛兴趣用户很难被一个纯聊天框留住,付费的往往只是一小撮硬核玩家。
Stephen Wolfram,一个把毕生精力都花在「让机器变聪明」上的人,坐在电脑前,屏幕上是ChatGPT刚替他写好的一段代码。语言是他自己发明的Wolfram Language,语法他看过,没问题,按下回车键就能直接在这台机器上跑。
现在的 Agent 将所有的工程线索和垃圾噪音都一股脑扔进 Chat Context 里,缺乏一层独立、结构化的 Engineering State 来做隔离与控制。为了打破这个瓶颈,Valkor 联合浙江大学智能计算与软件研究中心、伦敦大学学院(UCL)软件工程团队正式推出并开源了 loom。
这些项目未必都是最成熟的,但它们有一个共同点:没有把模型本身当作产品,而是把 AI 放进一条具体的任务链里,让一个想法变成物品,让一个需求得到回应,或者让一套智能系统真正运转起来。
近日,有关DeepSeek创始人梁文锋此前一次长达4小时的投资人会议内容在业内流传。不过,据报道,这场本应在小范围封闭场合进行的内部交流,因会议纪要在未经授权的情况下外泄,引起了梁文锋的不满。
官宣入职 Anthropic 才两个多月,Andrej Karpathy 就要走了?刚刚,有网友发现 Karpathy 修改了自己的个人简介,去掉了其中的公司信息。在删除之前,他的信息简介栏有着清晰的「Anthropic」字眼。有人说,这个改动发生在昨天。
一部由AI创作的连续短剧,成了最近中文互联网上最受关注的作品之一。上线不到30天,《被裁掉的女孩》第一季,播放量破亿。作品之外,剧中的两名角色也开始拥有自己的“观众”,方桃子和周以衡分别开设了社交账号,“两个AI演员比内娱待爆艺人都火”也成为社交平台上的热门讨论。
我们想强调的是:智能体 “跑得久”,并不等于 “具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动。长期以来,Autonomous Agent、Self-Evolving Agent 等概念常与长程智能体混用。
你有没有想过,写代码这件事的对象正在悄悄换人?上周一晚上,我在旧金山Market Street上WorkOS的办公室里待了将近两个小时,看了二十几个现场demo。进门之前我以为这只是一场普通的创业展示夜,但看完之后我意识到,这群人在展示的根本不是产品,而是他们对"写代码、用代码、读代码"这件事本身的理解,已经发生了多深的变化。
“包括Physical Intelligence在内,如今的北美头部具身智能公司离成熟都还有不短的距离。整个领域,也还没出现真正的奠基性工作。”“中国真正领先的,恰恰是机器人硬件。美国同样没有成熟答案,中国公司又何必急着把自己称为‘中国版XX’?”
SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:准备标注数据(QA对、指令-回复对等)在基座模型上跑SFT训练。看loss曲线收敛了→认为训练完成。但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。
以往的空间音频模型,要么受限于实验室的苛刻采集条件,要么被高昂的人工标注成本卡住脖子。而团队的核心洞察是:相机的自运动本身就是一种免费的监督信号。当相机转动时,声源在声场中的相对位置随之改变——这种变化无需人工标注,模型即可从中学习空间对应关系。这项工作入选CVPR 2025 Highlight,投稿论文前2%。
经常用AI的人都知道,AI给出的答案质量,很大程度上取决于你提问的方式。这一点,几乎成了当下社交媒体的流量密码。打开各大平台,随处可见兜售各类Prompt的帖子,我们自己的收藏夹里也往往躺着几十套Pr
按照超聚变的定位,TokenBox™ 是一套面向办公室场景的企业级本地 AI 平台。它将算力模块、模型服务、推理加速、Token 运营和安全管理整合进同一套产品体系,让企业能够在本地持续生产、调度和管理 Token。
Anthropic又被扒光了!这一次,Claude Opus 5的系统提示词,被人整份扒下来,传到GitHub上了。旗舰刚发,就被全网「开盒」,这一波属实猝不及防。就在上线的同一天,开发者Eversmile1直接建了个新仓库。
Agent 执行任务的时候,会反复踩坑、不断试错,最后积累一些正确的经验。但这些经验通常只能停留在当前会话,或者当前 Agent 的记忆里,很难传给其他 AI。一个 Agent 调用某个 API,花了半个小时查文档、改参数,连续失败好几次,最后终于找到正确方法。
最近,DeepSeek 接连上了几次热搜。先是因为一张实习 offer 引发围观。一位清华学生在社交媒体晒出录用信息,岗位是 DeepSeek 实习生,税前日薪 5500 元。按每月 22 个工作日计算,月薪超过 12 万元。
今年 6 月,Google DeepMind 宣布与电影公司 A24 建立长期研究合作,并向其投资约 7500 万美元。成立于 2012 年的 A24,以开发独具文艺气息的小众电影见长。它的代表作包括奥斯卡最佳影片《月光男孩》和《瞬息全宇宙》、全球票房大卖的《至尊马蒂》,以及今年热映的恐怖片《后室》。14 年间,A24 早已把片厂名字做成品牌:A24 三个字,本身就是人气的保证。
7月16日,Nature刊出消息:科学家用AI造出了自然界里从来没有过的CRISPR酶,切基因比「天然版本」更利索。论文同日发表在Science。带队的人,是2020年因为CRISPR拿下诺贝尔化学奖的Jennifer Doudna。
「我们删除了 80% 的 Claude Code 系统提示,这是我们从编写系统提示词、Skill 和 Claude.MD 中学到的。」本周五,Claude Opus 5 正式上线,Anthropic 技术团队成员 Thariq Shihipar 立即发帖,向我们介绍了新一代大语言模型之上,工程方面的趋势变化。
近日,Z Potentials 获悉,AI4Bio“模型 × 本体”公司 Fullive.ai 正式宣布完成种子++轮融资。至此,公司在 4 个月内已连续完成三轮融资。本轮资金将主要用于首款 AI 睡眠硬件 Somni 的研发与量产推进、AI4Bio 前沿技术储备,以及 Fullive.ai 在“模型 × 本体”方向上的技术体系建设。
卖断货的 Codex 键盘,终于发货了。首批上手体验中,争议最少的就是 Codex Micro 的做工。网友们一致认为按键手感和声音非常不错,有着舒适的点击感和段落感,甚至觉得有苹果产品的味道。从开箱体验,撕开层层包装盒,到整机的外观,果味都很重。
2023 年他在深圳创立听象科技,推出自有品牌昂听 ELEHEAR(下文统一简称 ELEHEAR)。前期发布 Alpha 系列产品试水助听器市场,2024 年 10 月推出旗舰产品 Beyond,凭借全栈自研的 AI 助听器+远程实时验配的新模式,用 1 年时间做到了美国亚马逊助听器类目 Top1,年销超 1500 万美元,市场份额从 1% 迅速增长至 18%。