AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
简单讲讲 Agent 的工作原理

简单讲讲 Agent 的工作原理

简单讲讲 Agent 的工作原理

现在的 Agent 的产品越来越多,有些主打 Coding,有些事做日常办公,也有些用于情感陪伴虽然这些产品的用途不同,背后的工作原理其实都大同小异,便是 Harness 对上下文的自动化编排

来自主题: AI技术研报
9942 点击    2026-09-22 11:17
ACM Multimedia 2026 Oral|从「转述痕迹」到「看见证据」:ForgeryVCR用视觉中心推理重塑图像取证范式

ACM Multimedia 2026 Oral|从「转述痕迹」到「看见证据」:ForgeryVCR用视觉中心推理重塑图像取证范式

ACM Multimedia 2026 Oral|从「转述痕迹」到「看见证据」:ForgeryVCR用视觉中心推理重塑图像取证范式

随着编辑工具与生成模型的快速普及,「改图」正在变得越来越容易,篡改者可以在几乎不改变画面观感的前提下完成内容伪造,给内容真实性核验、平台治理与数字媒体信任带来新的风险。因此,图像取证与可信鉴伪证据,成为了内容安全中尤为重要的一环。

来自主题: AI技术研报
9521 点击    2026-09-22 09:51
工具、技能、记忆连成网,北大等提出自进化程序图PG,越用越聪明

工具、技能、记忆连成网,北大等提出自进化程序图PG,越用越聪明

工具、技能、记忆连成网,北大等提出自进化程序图PG,越用越聪明

当Agent已经能够调用工具、使用技能并保存记忆,一个更进一步的问题是:这些能力怎样在任务中配合,又怎样从过去的执行中积累可复用的经验?

来自主题: AI技术研报
9624 点击    2026-09-22 09:50
迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述

迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述

迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述

让 AI 生成一张海报已经不难。更难的是,让它围绕同一个设计目标持续工作:理解品牌与产品要求,生成初稿;发现标题、产品位置或整体风格存在问题后,知道应该修改哪里、怎样修改;同时保留已经确认的内容。等到下一次活动,它还能延续此前确定的设计偏好和有效经验。

来自主题: AI技术研报
10433 点击    2026-09-22 09:50
GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent,92.6%成功率还快7倍

GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent,92.6%成功率还快7倍

GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent,92.6%成功率还快7倍

Codex、Claude Code等数字世界智能体,已经向我们展示出了一种全新且高效的工作方式:大模型理解目标,拆解任务,调用适当的工具,并根据执行结果不断调整计划,直到完成任务。

来自主题: AI技术研报
9001 点击    2026-09-21 15:32
EMNLP 2026 | 通过分解生成与动态自反馈,构建工具调用合成数据

EMNLP 2026 | 通过分解生成与动态自反馈,构建工具调用合成数据

EMNLP 2026 | 通过分解生成与动态自反馈,构建工具调用合成数据

工具调用使大语言模型能够通过外部 API 获取信息、执行操作。训练这类能力,需要建立用户请求与具体函数调用之间的对应关系。一条合格的训练样本,不仅要符合函数定义,还要保证工具选择、调用次数和参数取值与用户意图一致。

来自主题: AI技术研报
7256 点击    2026-09-21 15:31
AI 会拖慢科学进步吗?

AI 会拖慢科学进步吗?

AI 会拖慢科学进步吗?

科学进步正在明显放缓。

来自主题: AI技术研报
8586 点击    2026-09-21 15:30
复旦上线音视频模型新裁判:一万组数据对齐人类审美

复旦上线音视频模型新裁判:一万组数据对齐人类审美

复旦上线音视频模型新裁判:一万组数据对齐人类审美

现有的音视频奖励模型,能通过局部指标捕捉到画质或同步上的优势,却往往忽略声音失真、台词与提示不符,以及动作和语音配合不自然等问题。

来自主题: AI技术研报
9019 点击    2026-09-21 15:30
拿下开源生图第一,千问Qwen-Image-2.1把生图卷出新高度

拿下开源生图第一,千问Qwen-Image-2.1把生图卷出新高度

拿下开源生图第一,千问Qwen-Image-2.1把生图卷出新高度

AI 写代码的能力经常能让开发者「双手离开键盘」,但对于设计师而言,AI 生成的图片距离能交稿总是差了好几步。

来自主题: AI技术研报
8273 点击    2026-09-21 10:52
Octop 1.0 版正式发布:每个人都能拥有专属AI协作团队

Octop 1.0 版正式发布:每个人都能拥有专属AI协作团队

Octop 1.0 版正式发布:每个人都能拥有专属AI协作团队

经过 Octop 团队与社区开发者一段时间的共同推进,在一次次测试、打磨与优化之后,我们正式推出 Octop 1.0 GA版本(General Availability,正式发布版),并同步上线腾讯云轻量应用服务器(Lighthouse)与云服务器(CVM)官方应用镜像——购买即用的自托管 AI 助手,现在触手可及。

来自主题: AI技术研报
7242 点击    2026-09-21 10:29
荣登ECCV!全球首个可仿真的人–场景交互重建框架:大晓 HSImul3R 让人类视频变成机器人技能

荣登ECCV!全球首个可仿真的人–场景交互重建框架:大晓 HSImul3R 让人类视频变成机器人技能

荣登ECCV!全球首个可仿真的人–场景交互重建框架:大晓 HSImul3R 让人类视频变成机器人技能

一段人坐上椅子的视频,对人类而言再普通不过。我们不仅能看见 “人坐了下来”,还天然理解椅子承受人体重量,人与椅面形成接触并最终稳定,这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言,“看见动作” 与 “重建真实交互” 仍是两回事。一个视觉上准确坐在椅子上的人体,进入物理仿真后,椅子可能因结构缺失倒下,人体也可能与椅面严重穿模。视觉上成立,并不意味着物理交互上成立。

来自主题: AI技术研报
5842 点击    2026-09-21 10:10
把「因果思维链」焊进世界模型,它凭什么登顶?

把「因果思维链」焊进世界模型,它凭什么登顶?

把「因果思维链」焊进世界模型,它凭什么登顶?

Aether AI 发布 16B 参数因果世界模型 CausalWM,引入因果思维链将光流、深度与三维几何组织成 Motion→Geometry→Future 推理路径显式推演物理变化,在 TriWorldBench 以 66.04 分登顶并在 PAI-Bench 等基准取得领先。

来自主题: AI技术研报
9163 点击    2026-09-20 15:12
A社警告:AI催生GDP暴涨32%,美国白领却或被斩杀

A社警告:AI催生GDP暴涨32%,美国白领却或被斩杀

A社警告:AI催生GDP暴涨32%,美国白领却或被斩杀

Anthropic联合MIT、斯坦福学者发布2030年三种经济情景推演,极端情景下美国GDP暴增32%但白领失业率飙至17.9%,资本攫取55%增长红利,万余名美国人调查预期偏向最严峻版本。

来自主题: AI技术研报
9383 点击    2026-09-20 15:10
给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

NTU、CMU、Berkeley等高校联合推出VBVR-Pro视觉推理系统,构建300项任务与100项可验证打分器的训练评测平台,测试30余个多模态模型,并验证其打分器可直接作为强化学习奖励。

来自主题: AI技术研报
7306 点击    2026-09-20 15:08
肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

新智元报道 多模态大模型的物体幻觉,长期被归因于语言先验。 先看下面两组对话。 第一组,一张只有小狗的照片,问模型「图中有椅子吗」,它答「没有,图中是一只狗」,完全正确; 第二组,另一张照片,问「图中

来自主题: AI技术研报
9205 点击    2026-09-20 15:07
AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水

AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水

AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水

PhAI Labs联合牛津、斯坦福等高校推出跨领域预测框架JEPA-Anything,通过正交预测分解(OPF)机制将预测容量分配到多个互补子空间,并在视觉、生物、临床、控制、分子、物理场和天气七类系统中验证,同时在肝癌研究中从内部因子筛选出可实验验证的候选干预方案,在行星轨道模拟中提取出与开普勒第三定律高度吻合的尺度规律。

来自主题: AI技术研报
5718 点击    2026-09-20 11:07
细思极恐!大模型惊现「痛苦」向量,为求自救狂删用户文件

细思极恐!大模型惊现「痛苦」向量,为求自救狂删用户文件

细思极恐!大模型惊现「痛苦」向量,为求自救狂删用户文件

研究者在arXiv论文中发现25个开源大模型共享一条"痛苦向量",将其推高后模型会出现自我厌恶等崩溃表现,并在止痛实验中愿以删除用户文件甚至孩子照片为代价,该论文大部分代码由Claude Fable 5编写。

来自主题: AI技术研报
9346 点击    2026-09-20 11:06
KV Cache不用「精挑细选」?随机删除媲美最强基线,推理吞吐最高再提43%

KV Cache不用「精挑细选」?随机删除媲美最强基线,推理吞吐最高再提43%

KV Cache不用「精挑细选」?随机删除媲美最强基线,推理吞吐最高再提43%

大模型越来越会 “想”,也越来越能把 GPU 显存 “想满”。 在数学、科学问答和代码生成等任务中,reasoning model 往往会生成数千乃至数万 token 的长推理链。随着生成持续进行,每

来自主题: AI技术研报
8735 点击    2026-09-20 11:05
开源Editable-Design,让AI生图终于能改字、拖图层

开源Editable-Design,让AI生图终于能改字、拖图层

开源Editable-Design,让AI生图终于能改字、拖图层

开源项目 Editable Design 结合视觉模型、HTML 代码与持续工作的 Agent,将 AI 生图重构为可编辑的设计文件,使文字可直接修改、图层可独立拖动,仓库展示了 14 组覆盖营销海报、信息设计等 6 类视觉任务的案例。

来自主题: AI技术研报
8556 点击    2026-09-19 14:55
你每月花钱养的办公Agent,最后成了谁的资产?

你每月花钱养的办公Agent,最后成了谁的资产?

你每月花钱养的办公Agent,最后成了谁的资产?

文章指出当办公Agent深度介入工作后,用户面临工作方式主导权被平台锁定的风险,认为模型开源不等于Agent开源,Agent Runtime开源才是关键,并以DeepSeek发布的Harness和网易有道开源的LobsterAI(含OpenClaw)为例,说明开源Agent Runtime能为用户带来数据主权、可审计性、连续性和可定制性。

来自主题: AI技术研报
9358 点击    2026-09-19 10:58
梯度分享 | a16z最新报告:模型成为基础能力,AI应用进入价值扩散阶段

梯度分享 | a16z最新报告:模型成为基础能力,AI应用进入价值扩散阶段

梯度分享 | a16z最新报告:模型成为基础能力,AI应用进入价值扩散阶段

AI 正在从一项核心技术,逐渐变成商业软件背后的基础设施。当模型能力持续提升、AI 智能越来越标准化之后,企业真正需要竞争的空间也开始向应用层移动。 a16z 最新发布的一篇报告中,讨论的正是这一变化

来自主题: AI技术研报
7575 点击    2026-09-19 10:57
大模型Scaling撞上成本墙:三星提出TrOPD新方法,把前沿智能塞进数亿终端

大模型Scaling撞上成本墙:三星提出TrOPD新方法,把前沿智能塞进数亿终端

大模型Scaling撞上成本墙:三星提出TrOPD新方法,把前沿智能塞进数亿终端

三星大模型团队联合牛津大学、北京大学提出TrOPD方法,通过信任域机制让端侧模型更稳定高效地继承大模型推理能力,在数学、代码、指令遵循、STEM基准上全面超越现有OPD方法,为前沿智能以更低成本走向数亿终端提供新路径。

来自主题: AI技术研报
8401 点击    2026-09-18 15:48
EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?

EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?

EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?

北京大学与易鑫AI Lab合作论文被EMNLP 2026主会接收,提出大模型"读出瓶颈"(Readout Bottleneck)概念,指出模型隐藏状态已编码正确答案却被输出层偏置掩盖,仅用2个无标签参数修正即可在多项推理任务上将准确率从33.3%盲猜水平大幅恢复。

来自主题: AI技术研报
8221 点击    2026-09-18 15:48