AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
DeepSeek V4.1 Flash 开源:全新架构

DeepSeek V4.1 Flash 开源:全新架构

DeepSeek V4.1 Flash 开源:全新架构

刚刚,DeepSeek 开源了 V4.1 Flash,原生支持视觉理解,也是全新架构系列中最小的一款模型,550B 总参数,输入时激活 8B,输出时激活 16B(你没看错,输入输出激活不同)

来自主题: AI技术研报
6829 点击    2026-09-10 16:58
国产世界模型EchoWM开源!会发声的「可探索世界」来了

国产世界模型EchoWM开源!会发声的「可探索世界」来了

国产世界模型EchoWM开源!会发声的「可探索世界」来了

进入到 2026 年,可交互世界生成面对一道更难的考题:AI 生成的世界能否经得起用户反复探索?一扇门画得逼真,只是起点。往前走,它要自然靠近;穿过走廊再回头,它还应该留在原来的位置。用户每一次移动、转身和折返,都在检验模型是否有能力记住已经生成的世界。

来自主题: AI技术研报
7000 点击    2026-09-10 16:58
ECCV 2026 | AgentVLN:让机器人导航进入Agent时代

ECCV 2026 | AgentVLN:让机器人导航进入Agent时代

ECCV 2026 | AgentVLN:让机器人导航进入Agent时代

近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。

来自主题: AI技术研报
6169 点击    2026-09-10 15:18
还记得龙虾User.md吗「个性化」和记忆究竟能在多大程度上影响LLM的输出?UIUC评测

还记得龙虾User.md吗「个性化」和记忆究竟能在多大程度上影响LLM的输出?UIUC评测

还记得龙虾User.md吗「个性化」和记忆究竟能在多大程度上影响LLM的输出?UIUC评测

个性化在通用AI产品中一直是个加分项。无论是ChatGPT、Gemini还是Claude,还是今年的Openclaw、Harmes都把记忆和个性化当成核心卖点,理由是它能提高可用性、参与度和用户满意度。学术界对个性化的研究,也几乎全部集中在"如何做得更好、更准、更符合用户口味"上。

来自主题: AI技术研报
8745 点击    2026-09-10 15:17
被小米悄悄上线的MiMoAgent惊到了!【附邀请码】

被小米悄悄上线的MiMoAgent惊到了!【附邀请码】

被小米悄悄上线的MiMoAgent惊到了!【附邀请码】

不得不说,国内Agent大战已经到了白热化阶段,就在昨天,小米也正式下场。开放桌面端应用:MiMo Desktop。目前是邀测阶段。

来自主题: AI技术研报
8674 点击    2026-09-10 11:12
Astra 的 Computer Use 能力是如何实现的?

Astra 的 Computer Use 能力是如何实现的?

Astra 的 Computer Use 能力是如何实现的?

文章拆解了 Astra 模型与 Codex Harness 的配合方式:Codex 启动一个持续运行的代码环境,接入浏览器和桌面操作工具;Astra 通过无障碍模式读取界面中的文字、按钮结构,并通过截图综合判断。模型把准备执行的操作写成代码,交给 Codex 的工具完成。

来自主题: AI技术研报
5583 点击    2026-09-10 10:41
Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式

Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式

Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式

If I Had One Bet on Robot Learning, I’d Bet on Cross-Entropy. 大语言模型的成功揭示了一个适用于一维序列数据的清晰 Scaling Law:通过自回归训练,并采用交叉熵(cross-entropy)目标函数预测下一个 token 的概率分布,模型能够建模非常复杂的语义概率分布,并随着数据规模和模型规模的增长持续提升性能。

来自主题: AI技术研报
6660 点击    2026-09-10 10:19
长期知识库怎么维护?WeKnora 维护机制拆解与Milvus 接入实测

长期知识库怎么维护?WeKnora 维护机制拆解与Milvus 接入实测

长期知识库怎么维护?WeKnora 维护机制拆解与Milvus 接入实测

给一个需要长期维护的知识库做数据库选型,通常会碰到两类问题:内容持续更新以后,框架能不能方便修改和回退;数据量和负载上来以后,底层向量数据库能不能根据需求切换。

来自主题: AI技术研报
10073 点击    2026-09-10 09:55
揭开多智能体决策的隐形不公,结果指标相同也未必可靠 | EMNLP'26

揭开多智能体决策的隐形不公,结果指标相同也未必可靠 | EMNLP'26

揭开多智能体决策的隐形不公,结果指标相同也未必可靠 | EMNLP'26

当多个大语言模型(LLM)组成「招聘委员会」,共同筛选简历、讨论候选人、打分并投票时,我们通常会用最终录用率来判断系统是否公平。

来自主题: AI技术研报
8366 点击    2026-09-09 14:51
大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

自动手语翻译中,一直存在一个隐蔽难题:模型即使已经较好地对齐了视觉与文本,也可能在逐词生成时,被某个局部合理、却缺少视觉证据支持的词带偏。

来自主题: AI技术研报
9194 点击    2026-09-09 14:49
GPT-6 Astra为何如此惊艳?S-Space透视多模态模型内部的空间智能

GPT-6 Astra为何如此惊艳?S-Space透视多模态模型内部的空间智能

GPT-6 Astra为何如此惊艳?S-Space透视多模态模型内部的空间智能

最近,GPT-6 Astra 的三维建模与空间理解 demo 引发关注。它能在 Blender 中搭建带家具和庭院的住宅,再将场景转入 Unreal Engine 5,让人能走进房间、打开柜门,甚至操作咖啡机。

来自主题: AI技术研报
8373 点击    2026-09-09 11:43
首个统一元递归自我改进架构,让AI「变强的方式」本身变强

首个统一元递归自我改进架构,让AI「变强的方式」本身变强

首个统一元递归自我改进架构,让AI「变强的方式」本身变强

过去两年,AI 领域最激动人心的叙事之一,是让模型自己改进自己:自己生成训练数据、自己改写提示词、自己修复自己的代码。这条路线叫递归自我改进(Recursive Self-Improvement,RSI)。

来自主题: AI技术研报
5477 点击    2026-09-09 11:27
系统综述259项工作:AI创作如何从「会生成」走到「能交付」?

系统综述259项工作:AI创作如何从「会生成」走到「能交付」?

系统综述259项工作:AI创作如何从「会生成」走到「能交付」?

长文、网页、视频和代码经常停在这样的「半成品」状态:海报文案没有写错,却挤出了页面;网站首屏很漂亮,按钮点下去毫无反应;视频里的镜头单看都成立,连起来却丢了人物和节奏;程序刚修好一个模块,另一处又出现回归。

来自主题: AI技术研报
5584 点击    2026-09-08 15:29
Agent长时工作如何不跑偏?WorkSwarm用「永续会话」给出解法

Agent长时工作如何不跑偏?WorkSwarm用「永续会话」给出解法

Agent长时工作如何不跑偏?WorkSwarm用「永续会话」给出解法

让 Agent 完成一个任务并不难。它会整理材料、修改文件、检查结果,再交付答案。

来自主题: AI技术研报
5346 点击    2026-09-08 15:28
EMNLP 2026 Main|预测越像真实环境,Agent反而做得更差?我们把世界模型的训练目标从"状态一致"换成了"行为一致"

EMNLP 2026 Main|预测越像真实环境,Agent反而做得更差?我们把世界模型的训练目标从"状态一致"换成了"行为一致"

EMNLP 2026 Main|预测越像真实环境,Agent反而做得更差?我们把世界模型的训练目标从"状态一致"换成了"行为一致"

一句话概括:文本世界模型都在比 "生成文本像不像真实环境",但我们发现文本更接近真实环境的预测反而可能让智能体错得更离谱。把训练目标从 "状态一致" 换成 "行为一致" 后,16 组实验配置下世界模型的轨迹级一致性几乎全面提升,弱智能体离线评测的假阳性率从 42.5% 降到 9.5%。

来自主题: AI技术研报
5957 点击    2026-09-08 15:06
用GPT-6 Astra操控Blender玩3D,保姆级教程来了。

用GPT-6 Astra操控Blender玩3D,保姆级教程来了。

用GPT-6 Astra操控Blender玩3D,保姆级教程来了。

Blender,可能就是这次GPT-6 Astra上线后的最大受益者。

来自主题: AI技术研报
7042 点击    2026-09-08 11:52
王云鹤创业后交出首个模型

王云鹤创业后交出首个模型

王云鹤创业后交出首个模型

王云鹤创业后,首次交卷了大模型成果。

来自主题: AI技术研报
10182 点击    2026-09-08 11:51
颜水成团队重磅发布VoiceMem,提出「流式双脑架构」打造下一代实时交互基础设施

颜水成团队重磅发布VoiceMem,提出「流式双脑架构」打造下一代实时交互基础设施

颜水成团队重磅发布VoiceMem,提出「流式双脑架构」打造下一代实时交互基础设施

科幻早就预演过这一天,而这两年 AI 的真实进展,正把它推成一个可讨论的命题:AI 或许不会停在「工具」上,而会成为与人类共生的存在 ——AGI Being。

来自主题: AI技术研报
8928 点击    2026-09-08 11:03
全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。

来自主题: AI技术研报
6093 点击    2026-09-08 11:02
同等预算下,Looped Transformer更强吗?清华、字节Seed给出答案

同等预算下,Looped Transformer更强吗?清华、字节Seed给出答案

同等预算下,Looped Transformer更强吗?清华、字节Seed给出答案

在大模型的发展中,提升能力的主要手段一直是 "做大"—— 更多参数、更多数据、更多算力。如今,另一条思路开始受到关注:与其不断堆叠新的层,不如让已有的层再跑一遍。这就是 Looped Transformer。普通 Transformer 的每一层只执行一次,而 Looped Transformer 会把其中一部分层重复执行,让模型在不增加参数的情况下获得更深的计算。

来自主题: AI技术研报
6097 点击    2026-09-08 11:01
虚幻引擎CEO围观最新世界模型:代码驱动,视频模型生成画面

虚幻引擎CEO围观最新世界模型:代码驱动,视频模型生成画面

虚幻引擎CEO围观最新世界模型:代码驱动,视频模型生成画面

近年来,视频生成模型在清晰度、时序一致性和可控性上快速进步。给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让「可交互视频世界」逐渐从概念走向可观看、可操作的原型。

来自主题: AI技术研报
6700 点击    2026-09-08 10:42