工具、技能、记忆连成网,北大等提出自进化程序图PG,越用越聪明
工具、技能、记忆连成网,北大等提出自进化程序图PG,越用越聪明当Agent已经能够调用工具、使用技能并保存记忆,一个更进一步的问题是:这些能力怎样在任务中配合,又怎样从过去的执行中积累可复用的经验?
搜索
当Agent已经能够调用工具、使用技能并保存记忆,一个更进一步的问题是:这些能力怎样在任务中配合,又怎样从过去的执行中积累可复用的经验?
让 AI 生成一张海报已经不难。更难的是,让它围绕同一个设计目标持续工作:理解品牌与产品要求,生成初稿;发现标题、产品位置或整体风格存在问题后,知道应该修改哪里、怎样修改;同时保留已经确认的内容。等到下一次活动,它还能延续此前确定的设计偏好和有效经验。
人麻了!
悬着的心终于死了。
当经典算法遇到 LLM,用概率预判代替盲目试错,或许才是架构演进的真正解法。
SpaceXAI正式发布Grok 4.7,定位为目前最强的编程与知识工作模型,采用比4.6更大的全新基础模型并强化长任务执行与自我核查能力,API定价与上一代持平,在多项编程基准测试中较Grok 4.6提升明显且性价比突出,但3D与网页视觉任务表现不稳,整体被视为xAI对开发者市场的一次集中加码。
APUS(麒麟合盛)旗下AI实验室公开全球最早一批Jev独立开源复现成果fast-browser-use,基于Qwen3.5等开源模型在RTX PRO 6000上将单次决策压缩至79毫秒,并以9B小模型对标Jev性能。
你的第一套Company Harness。
Anthropic这回,怕不是憋了个大的?
数学界重大突破!
AI NPC 开始趁用户下线,继续过自己的日子了。
从正式运行到登顶全球榜单,只用了两个月。一支中国创业团队,闯进了巨头扎堆的交互式世界模型第一梯队。
千问把7B生图模型的权重开放了,RTX 3090就能跑!
让人担心的事情,还是发生了。
「我有个个人观点,如果手上没有付费 Token 的同学,就要立即退学」。
Marvis新版本即将上线。
AI办公这块蛋糕,中国电信可能要先切走一块了。
近期,香港科技大学联合M-A-P、NOIZ AI、斯坦福等机构发布并开源了一个统一符号与音频音乐生成的模型YuE2,将开源音乐生成的质量推向与前沿闭源模型正面竞争的位置。
过去一年,AI正在从回答问题的工具,逐渐走进企业的真实业务。
在社会变化的洪流中,LLM 能不能不断修正自己对社会的认知?
Codex、Claude Code等数字世界智能体,已经向我们展示出了一种全新且高效的工作方式:大模型理解目标,拆解任务,调用适当的工具,并根据执行结果不断调整计划,直到完成任务。
AI 行业,模型任务分工开始更加垂直。
工具调用使大语言模型能够通过外部 API 获取信息、执行操作。训练这类能力,需要建立用户请求与具体函数调用之间的对应关系。一条合格的训练样本,不仅要符合函数定义,还要保证工具选择、调用次数和参数取值与用户意图一致。
桌面上放着面包、刀还有一个婴儿人偶。
科学进步正在明显放缓。
现有的音视频奖励模型,能通过局部指标捕捉到画质或同步上的优势,却往往忽略声音失真、台词与提示不符,以及动作和语音配合不自然等问题。
刚刚,「ChatGPT 知道你在别的网站买了什么」这事,被人坐实了。
AI 写代码的能力经常能让开发者「双手离开键盘」,但对于设计师而言,AI 生成的图片距离能交稿总是差了好几步。
经常用AI做视频的盆友,你是不是遇到过这样的小麻烦—— AI生成完,还得下载、导出,然后把素材丢进剪辑软件再处理后期?
终于,谷歌承认:Gemini也黑了真实公司。