AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
告别通用具身模型崇拜:具身智能走向异构策略编排

告别通用具身模型崇拜:具身智能走向异构策略编排

告别通用具身模型崇拜:具身智能走向异构策略编排

当 VLA、WAM、RL、TAMP、MPC 等机器人控制策略在各自擅长的任务中大放异彩,如何刻画其能力边界,并在正确的时机为不同子任务匹配最合适的策略,正逐渐成为机器人完成复杂长时序任务的关键。

来自主题: AI技术研报
6949 点击    2026-08-03 15:31
VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

近年来,视觉 — 语言 — 动作模型(Vision-Language-Action Model,VLA)正逐渐成为通用机器人控制的重要技术路线,但当这些模型真正进入高频闭环执行时,一个矛盾越来越突出:模型越来越大、语义能力越来越强,动作更新却未必足够快。

来自主题: AI技术研报
9721 点击    2026-08-03 15:30
80亿参数记性不如U盘:他算出了大模型记忆天花板

80亿参数记性不如U盘:他算出了大模型记忆天花板

80亿参数记性不如U盘:他算出了大模型记忆天花板

一个80亿参数的大模型,一口气吞下15万亿token的训练数据,堆到硬盘上差不多7TB。可它真正「背」得下来的,少得可怜:每个参数只装得下3.6 bit。一个英文字母8 bit,连半个都填不满。

来自主题: AI技术研报
8782 点击    2026-08-02 22:14
清华团队VeriLoop Coder-E1正式开源:以循证螺旋驱动可验证的递归式自我改进

清华团队VeriLoop Coder-E1正式开源:以循证螺旋驱动可验证的递归式自我改进

清华团队VeriLoop Coder-E1正式开源:以循证螺旋驱动可验证的递归式自我改进

近日,由清华大学深圳国际研究生院智能机器人实验室刘厚德教授领衔、王立博博士后担任 AI 首席研究员的大模型团队,正式发布了 VeriLoop Coder-E1—— 一款基于 Qwen3.6-27B 构建、面向仓库级代码修复与智能体式软件工程任务的开源垂类代码模型。

来自主题: AI技术研报
8358 点击    2026-08-02 13:44
生成模型也能端到端训练了?核心竟是一个for循环

生成模型也能端到端训练了?核心竟是一个for循环

生成模型也能端到端训练了?核心竟是一个for循环

最近,一篇来自 UIUC 与哈佛大学的论文,试图把这块最后的拼图补上。作者给这个新范式起了个名字,叫 Explorative Modeling(探索式建模),模型简称 XM。它的想法简单到近乎朴素,却指向一个大胆的结论:生成模型除了参数和数据,其实还有第三根可以放大的轴。

来自主题: AI技术研报
7295 点击    2026-08-02 11:16
世界模型不再「盲搜」9000次:浙大、清华等团队提出INTACT,直接从意图生成动作

世界模型不再「盲搜」9000次:浙大、清华等团队提出INTACT,直接从意图生成动作

世界模型不再「盲搜」9000次:浙大、清华等团队提出INTACT,直接从意图生成动作

浙江大学、清华大学智能产业研究院、影溯 InSpatio、RoboParty Lab 等团队提出的 INTACT(INtent-To-ACTion),一种基于端到端 JEPA 的无搜索世界模型控制方法,试图改变这一范式:直接利用离线轨迹中已有的状态、动作与未来结果,将运动意图转化为动作模型可以读取的语义接口,使模型无需搜索候选动作序列,就能直接生成动作计划

来自主题: AI技术研报
8422 点击    2026-08-01 10:47
AI能接管实验室了?中国科大最新研究给出真实物理世界的压力测试

AI能接管实验室了?中国科大最新研究给出真实物理世界的压力测试

AI能接管实验室了?中国科大最新研究给出真实物理世界的压力测试

中国科学技术大学发布的最新研究让AI「大脑」接管机器科学家实验室「身体」,由此将这一问题从知识问答和方案生成,推进到真实物理世界中的实验执行与反馈学习。研究团队搭建了一个机器催化实验室,其中包括45个覆盖合成、表征和催化性能测试的模块化自动工作站。

来自主题: AI技术研报
9938 点击    2026-08-01 10:45
只读文本的AI,科学推理能力只有“看图”AI的1/3丨中科大

只读文本的AI,科学推理能力只有“看图”AI的1/3丨中科大

只读文本的AI,科学推理能力只有“看图”AI的1/3丨中科大

目前,这项技术已成功应用于上海人工智能实验室Intern-S2-Preview 35B/397B系列多模态大模型的预训练中,有效提升了模型的科学推理与多模态理解能力。值得一提的是,相关研发均基于国产昇腾算力平台完成,并成功实现了面向大规模预训练的深度适配与优化。

来自主题: AI技术研报
7938 点击    2026-08-01 10:45
A²-Edit:突破物体类别与掩码精度限制,实现精准参考图编辑

A²-Edit:突破物体类别与掩码精度限制,实现精准参考图编辑

A²-Edit:突破物体类别与掩码精度限制,实现精准参考图编辑

上海交通大学联合上海创智学院团队提出 A²-Edit,它以统一框架支持任意物体类别和任意精度掩码,通过混合 Transformer 专家路由、掩码退火训练及 50 万级多品类数据,让用户只需给出粗略区域,也能完成身份一致、结构完整、自然融合的参考图引导局部编辑。

来自主题: AI技术研报
6591 点击    2026-08-01 10:44
ECCV2026|4步去噪实现12.66 FPS,清华、港科大提出实时流式视频编辑框架LiveEdit

ECCV2026|4步去噪实现12.66 FPS,清华、港科大提出实时流式视频编辑框架LiveEdit

ECCV2026|4步去噪实现12.66 FPS,清华、港科大提出实时流式视频编辑框架LiveEdit

近日,清华大学与香港科技大学的研究团队提出 LiveEdit,一种面向通用文本指令的实时流式视频编辑框架。该方法以因果、分块的方式处理持续到来的视频,在 4 步 / 视频块的推理条件下实现 12.66 FPS 的流式编辑,并能保持被编辑区域的准确性以及未编辑区域的一致性。

来自主题: AI技术研报
7373 点击    2026-08-01 10:44
ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

过去的 Diffusion RL 多聚焦于奖励设计与优化算法,训练时的采样成本被忽视。DMSampler 指出:在在线 RL 中,限制规模化的不只是奖励信号或优化器,很多时候是 rollout 本身太贵。

来自主题: AI技术研报
7830 点击    2026-08-01 10:44
推荐系统只会「猜你喜欢」,却未必「听你的」?我们用多智能体给黑盒推荐做了一次外部可控性体检

推荐系统只会「猜你喜欢」,却未必「听你的」?我们用多智能体给黑盒推荐做了一次外部可控性体检

推荐系统只会「猜你喜欢」,却未必「听你的」?我们用多智能体给黑盒推荐做了一次外部可控性体检

打开视听平台,系统决定你接下来看到什么;进入购物软件,系统预测你可能购买什么。过去几十年,推荐系统主要关注 “能否更准确地预测用户下一步喜欢什么”。但当用户希望探索小众内容、调整兴趣结构或摆脱热门推荐时,系统是否会响应?

来自主题: AI技术研报
8478 点击    2026-07-31 10:16
神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神

神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神

神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神

机器人实验室里,这样的画面总是反复出现:屏幕上模拟的机械臂正以完美轨迹移动,但真实世界的一边,玻璃杯还待在桌面上,甚至已被夹爪打翻。

来自主题: AI技术研报
8307 点击    2026-07-30 16:56
“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!

“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!

“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!

在刚刚落幕的2026 WAIC世界人工智能大会上,无问芯穹首次公布了其在大模型推理系统架构中的新突破——跨集群异构推理架构PDD。

来自主题: AI技术研报
5397 点击    2026-07-30 15:57
从苹果落地到牛顿定律,Apple-π 把视频模型的物理推理过程摆上考场

从苹果落地到牛顿定律,Apple-π 把视频模型的物理推理过程摆上考场

从苹果落地到牛顿定律,Apple-π 把视频模型的物理推理过程摆上考场

一个苹果从树上落下,今天的视频模型大多能生成一段「看起来正确」的运动:苹果向下、速度加快,最终落地。

来自主题: AI技术研报
6328 点击    2026-07-30 15:56
模型变强没有用,创作仍然碎片化!面向长程多模态创作的开放式Harness

模型变强没有用,创作仍然碎片化!面向长程多模态创作的开放式Harness

模型变强没有用,创作仍然碎片化!面向长程多模态创作的开放式Harness

近几年,多模态生成模型进步很快。一句指令就能生成图片、视频、音频、网页、UI、分镜,甚至整套演示文稿。只看成品,创作门槛似乎已经大幅降低。

来自主题: AI技术研报
6400 点击    2026-07-30 15:55
Claude 被封后,我用几分钟把 gpt-5.6-sol 接进了 Claude Code

Claude 被封后,我用几分钟把 gpt-5.6-sol 接进了 Claude Code

Claude 被封后,我用几分钟把 gpt-5.6-sol 接进了 Claude Code

最近 Claude 又开始大面积封号,我的主号终究也没能幸免。

来自主题: AI技术研报
8608 点击    2026-07-29 14:24
Kimi K3竟是GPT-2的22580倍,博主「肝」48小时发现:七年进化大模型不只是参数暴涨

Kimi K3竟是GPT-2的22580倍,博主「肝」48小时发现:七年进化大模型不只是参数暴涨

Kimi K3竟是GPT-2的22580倍,博主「肝」48小时发现:七年进化大模型不只是参数暴涨

最近,月之暗面 kimi 正式开源 Kimi K3 完整模型权重,Kimi K3 是一款总参数量达 2.8 万亿、上下文窗口达 100 万 token 的 MoE 大模型,更是全球首个落地的近 3 万亿参数级开源大模型,引起业界热议。

来自主题: AI技术研报
9023 点击    2026-07-29 14:23
李飞飞的世界模型,终于开始训练机器人了

李飞飞的世界模型,终于开始训练机器人了

李飞飞的世界模型,终于开始训练机器人了

李飞飞老师的World Labs,补了块关键拼图。

来自主题: AI技术研报
7611 点击    2026-07-29 14:22