AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
喝点VC|a16z最新90页报告解读:AI的钱正流向哪里,利润留给谁

喝点VC|a16z最新90页报告解读:AI的钱正流向哪里,利润留给谁

喝点VC|a16z最新90页报告解读:AI的钱正流向哪里,利润留给谁

a16z最新90页报告《STATE OF MARKETS》指出,Alphabet、亚马逊、Meta、微软和甲骨文五家科技巨头2026年合计资本开支预计接近7770亿美元,AI建设正成为影响宏观经济的重要变量,供应链获得订单但回报兑现仍有先后,软件行业则进入"证明自己"的阶段。

来自主题: AI技术研报
8178 点击    2026-10-02 21:58
openJiuwen X-Router自演进模型路由技术首发,昇腾亲和,Agent越跑越省,实测减少50+%Token消耗

openJiuwen X-Router自演进模型路由技术首发,昇腾亲和,Agent越跑越省,实测减少50+%Token消耗

openJiuwen X-Router自演进模型路由技术首发,昇腾亲和,Agent越跑越省,实测减少50+%Token消耗

不是所有任务都需要最强的模型。让每一次请求选对模型,让每一次反馈都成为下一次更优、更省的选择。不是所有任务都需要最强的模型。让每一次请求选对模型,让每一次反馈都成为下一次更优、更省的选择。

来自主题: AI技术研报
6156 点击    2026-10-02 12:48
AI搜索的下一站:可信度三层过滤机制,从点击监督到答案级反馈

AI搜索的下一站:可信度三层过滤机制,从点击监督到答案级反馈

AI搜索的下一站:可信度三层过滤机制,从点击监督到答案级反馈

百度联合中国科学院计算技术研究所与武汉大学的研究者围绕这一现状,提出答案支撑、内容可信与上下文组织三阶段框架,并结合百度搜索工业实践,梳理了从检索排序、可信度判断、结构化上下文组织到生成后反馈的优化链路。

来自主题: AI技术研报
10034 点击    2026-10-02 12:48
Token用量暴涨124倍,研发提速仅一成?前微软合伙人万字长文质疑RSI引发“智能爆炸”

Token用量暴涨124倍,研发提速仅一成?前微软合伙人万字长文质疑RSI引发“智能爆炸”

Token用量暴涨124倍,研发提速仅一成?前微软合伙人万字长文质疑RSI引发“智能爆炸”

AI 确实在帮 AI 变强,但收益正逐轮递减。当前 AI 自我改进回路的实际强度,仅为触发“智能爆炸”所需理论阈值的 10% 到 20%;若要实现自我维持式的加速进化,这条回路必须再增强 5 到 10 倍。而在巨额过程损耗面前,眼下的系统连维持匀速进步都已十分吃力。

来自主题: AI技术研报
5609 点击    2026-10-02 12:47
淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作

淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作

淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作

TaoMate-H3 是由阿里巴巴 TaoLive AIGC 团队研发的音视频联合流式生成模型。基于 MiniMax H3,TaoMate-H3 将三步 LoRA 推理与自回归生成相结合,能够根据文本

来自主题: AI技术研报
7049 点击    2026-10-02 12:46
EMNLP 2026|「AI把数字说歪」,官方AI审稿现场演示了一遍

EMNLP 2026|「AI把数字说歪」,官方AI审稿现场演示了一遍

EMNLP 2026|「AI把数字说歪」,官方AI审稿现场演示了一遍

EMNLP 2026录用论文提出Claim-Locked Reporting方法,针对AI审稿等场景中数字正确但方向或结论强度被改写的统计主张失真问题,通过先锁定证据支撑的主张、再由代码固定数字与方向而模型仅负责衔接,在fMRI与临床试验报告上将跨次生成数值复现率分别提升至98.5%和100%,并消除了方向反转错误。

来自主题: AI技术研报
8540 点击    2026-10-01 13:16
看一遍就会,三星&上交提出RoboICL新方法,GPT-6 Astra多项机器人操控评测全面领先

看一遍就会,三星&上交提出RoboICL新方法,GPT-6 Astra多项机器人操控评测全面领先

看一遍就会,三星&上交提出RoboICL新方法,GPT-6 Astra多项机器人操控评测全面领先

三星与上海交通大学提出RoboICL具身上下文学习方法,通过冻结GPT-6 Astra模型并在推理时提供少量示范与机器人自身交互记忆,在RoboDojo 30项机器人操控评测中以50.64分全面领先PhysicalRSI等现有方法,并公开了929条可逐布局核查的执行记录及真实机械臂实验结果。

来自主题: AI技术研报
9986 点击    2026-10-01 13:15
NeurIPS'26 | 港科大:从CPU到GPU,AI能否真正加速全流程?

NeurIPS'26 | 港科大:从CPU到GPU,AI能否真正加速全流程?

NeurIPS'26 | 港科大:从CPU到GPU,AI能否真正加速全流程?

港科大团队在NeurIPS 2026上提出AccelEval基准,覆盖6个领域42项任务和43类CUDA优化策略,评测大模型能否从可信CPU程序生成端到端更快的GPU实现,其中Gemini 3.1 Pro在中规模通过正确性验证的任务上取得71.2倍几何平均加速比。

来自主题: AI技术研报
7760 点击    2026-10-01 13:14
给AI装上记忆,它就真的记对了吗?HaluMem拆解智能体记忆幻觉

给AI装上记忆,它就真的记对了吗?HaluMem拆解智能体记忆幻觉

给AI装上记忆,它就真的记对了吗?HaluMem拆解智能体记忆幻觉

中国电信研究院与MemTensor等机构提出首个面向智能体记忆系统的操作级幻觉评测基准HaluMem,已被EMNLP 2026主会接收,该基准分别对记忆提取、更新和问答三个环节进行检查,并对Mem0、MemOS等六套系统实测,发现高召回率可能伴随虚假信息写入、低更新幻觉率背后存在大量遗漏、上游记忆问题最终会影响回答等核心现象。

来自主题: AI技术研报
9830 点击    2026-09-30 15:39
Anthropic 严正警告:GLM-5.3 已具备高级网络攻击能力

Anthropic 严正警告:GLM-5.3 已具备高级网络攻击能力

Anthropic 严正警告:GLM-5.3 已具备高级网络攻击能力

Anthropic发布网络安全评估报告指出,智谱AI的GLM-5.3已具备自主开发端到端网络漏洞利用程序的高级网络攻击能力,但其内置安全护栏极易被简单方法绕过或移除,导致恶意攻击者可轻易获取该能力。

来自主题: AI技术研报
9181 点击    2026-09-30 11:57
IDC×浪潮信息最新报告!22亿Agent背后,AI算力正迎来一场重构

IDC×浪潮信息最新报告!22亿Agent背后,AI算力正迎来一场重构

IDC×浪潮信息最新报告!22亿Agent背后,AI算力正迎来一场重构

IDC与浪潮信息联合发布的《2026年中国人工智能计算力发展评估报告》显示,全球活跃企业Agent数量预计将从2026年的7940万个增长至2030年的22.16亿个,带动Token消耗和算力需求爆发式增长,AI基础设施正围绕Agent长链路运行进行系统性重构。

来自主题: AI技术研报
8814 点击    2026-09-30 11:15
在线蒸馏灵活却太慢,离线缓存高效却不够灵活,LinkedIn 如何取舍?

在线蒸馏灵活却太慢,离线缓存高效却不够灵活,LinkedIn 如何取舍?

在线蒸馏灵活却太慢,离线缓存高效却不够灵活,LinkedIn 如何取舍?

LinkedIn 公开其 AI 职位搜索的多教师蒸馏训练基础设施,通过基于 SGLang 的定制框架结合在线与离线蒸馏方案,并叠加 LiGer、多节点训练、FSDP2 及 H200 集群等优化,实现约 8 倍训练加速,将 80 亿参数相关性模型和 17 亿参数互动模型的知识压缩至 6 亿参数排序模型,使职位搜索 NDCG@10 提升 24.48%。

来自主题: AI技术研报
7213 点击    2026-09-30 11:10
GPT-6 Astra的隐藏推理,丹麦团队用tool calling撬出来了

GPT-6 Astra的隐藏推理,丹麦团队用tool calling撬出来了

GPT-6 Astra的隐藏推理,丹麦团队用tool calling撬出来了

丹麦奥尔堡大学AI安全实验室与Seafill开源社区联合发表论文,通过tool calling方法从GPT-6 Astra等前沿闭源模型中提取出隐藏思维链,发现Astra采用类似"心算"的压缩推理方式,省略基础计算与代数变形等中间步骤而直接给出关键结论。

来自主题: AI技术研报
8268 点击    2026-09-30 11:09
EMNLP 2026 | 大模型解码不能只看概率,人大团队引入语义冗余

EMNLP 2026 | 大模型解码不能只看概率,人大团队引入语义冗余

EMNLP 2026 | 大模型解码不能只看概率,人大团队引入语义冗余

中国人民大学代文林、孟澄研究员团队提出的ME-Decoding方法被EMNLP 2026接收,该方法在解码时同时利用token概率与embedding相似度,从集合层面筛选低冗余候选token,在GSM8K和GPQA上取得所比较方法中最高的平均准确率,端到端GPU延迟仅增加约3%。

来自主题: AI技术研报
7381 点击    2026-09-30 11:07
从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架

从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架

从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架

BenchJack 之后,reward hacking 检测还缺什么? Agent 在 benchmark 上拿到高分,未必真正完成了任务。它也可能利用评测或奖励机制中的漏洞,绕开题目要求来提高得分。

来自主题: AI技术研报
6809 点击    2026-09-30 11:04
SceneMosaic:让3D场景生成既快又「活」,一张图生成一屋子可仿真的多样布局

SceneMosaic:让3D场景生成既快又「活」,一张图生成一屋子可仿真的多样布局

SceneMosaic:让3D场景生成既快又「活」,一张图生成一屋子可仿真的多样布局

香港大学戴勃团队提出SceneMosaic,通过混合智能体布局演化方法从单张图像快速生成物理合理且多样化的仿真就绪3D场景,相比SceneSmith提速24倍,生成单个变体场景仅需0.03小时。

来自主题: AI技术研报
8244 点击    2026-09-29 11:17
18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion

18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion

18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion

北京大学、清华大学与阿里巴巴等机构联合提出SparkDiffusion视频生成加速系统,通过融合稀疏注意力、少步蒸馏与FP8量化,在单卡RTX 5090上实现最高720倍推理加速,可在18秒内生成5秒720P视频,并已完整开源权重与训练代码。

来自主题: AI技术研报
7105 点击    2026-09-29 11:11
为了理解而生成:他们用合成数据教会模型「视频通话」

为了理解而生成:他们用合成数据教会模型「视频通话」

为了理解而生成:他们用合成数据教会模型「视频通话」

一、什么是 OmniVChat? 从音视频问答到原生音视频对话 现有的音视频交互的研究中,对 “交互” 的定义往往其实是对音视频内容的问答,比如对于一个流式视频,用户输入一个文本问题,然后模型选择合适

来自主题: AI技术研报
9490 点击    2026-09-29 11:11
GPT-6 Astra学会用「空白Token」思考!推理能力突然变强

GPT-6 Astra学会用「空白Token」思考!推理能力突然变强

GPT-6 Astra学会用「空白Token」思考!推理能力突然变强

Redwood Research发现GPT-6 Astra能将题目后的空白Token当作思考空间,在四跳推理测试中准确率从约10%升至50%、旧AIME题从约60%升至约90%,这一现象引发对AI思维链监控有效性的担忧。

来自主题: AI技术研报
9256 点击    2026-09-28 16:23
面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

埃默里大学提出的Decompose–Look–Reason(DLR)框架被EMNLP 2026接收,该方法通过分解问题、按premise提取视觉latent再推理,在Qwen3-VL-8B-Thinking上于V*、MathVista等基准取得显著提升。

来自主题: AI技术研报
8251 点击    2026-09-28 16:22
DeepSeek mHC多流残差坍塌失效了?

DeepSeek mHC多流残差坍塌失效了?

DeepSeek mHC多流残差坍塌失效了?

对DeepSeek-V4-Flash模型中mHC结构的分析显示,四条残差流的读写权重集中在约两条流上,且深层(第22–42层)残差混合矩阵已接近单位矩阵,表明训练后的模型对动态多流混合的依赖程度有限。

来自主题: AI技术研报
8362 点击    2026-09-28 16:22
CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力

CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力

CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力

上海交通大学卢策吾、汶川团队联合穹彻提出LIFT(Late Reactive Injection of Force for VLA Post-Training),被CoRL 2026高分收录,该方法在保留预训练知识的前提下,仅通过20至30条在线带力数据后训练即可让VLA学会力反馈,显著提升叠毛巾、插书、汉诺塔圆环放置等接触密集型任务表现。

来自主题: AI技术研报
7092 点击    2026-09-28 16:20
智能也有「元素周期表」!人类和细菌同一格,最强AI还低一位

智能也有「元素周期表」!人类和细菌同一格,最强AI还低一位

智能也有「元素周期表」!人类和细菌同一格,最强AI还低一位

中国科学院大学研究团队在《数据科学年鉴》发表论文《智能体能力周期表:从零智能到无限智能的243种构型》,将智能体抽象为控制、生成、记忆、输入、输出五种能力并各分三级,构建243种构型的分类表,指出人类与细菌同处122号格子、最强大模型智能体仅在控制维度比人类低一位即落在41号,并据此对经典力学、相对论与量子力学三大物理理论的观察者差异提出新解读。

来自主题: AI技术研报
8708 点击    2026-09-28 16:20
门萨智商测试被AI考爆了!151满分登顶,99.97%人类被碾压

门萨智商测试被AI考爆了!151满分登顶,99.97%人类被碾压

门萨智商测试被AI考爆了!151满分登顶,99.97%人类被碾压

TrackingAI榜单显示,Claude Fable 5.1和GPT-6 Astra在门萨挪威智商测试中以151分满分登顶,碾压99.97%的人类,AI仅用两年半便从64分飙升至满分。

来自主题: AI技术研报
8687 点击    2026-09-28 09:51
从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

新加坡国立大学 Show Lab 发布的 Show-Harness 通过一套可被 VLM 理解的语义动作接口,使前沿视觉语言模型和轻量微调的 Qwen3.5-2B 能够跨模型、跨机器人本体直接操控真实机器人,并在跨任务、跨环境、跨本体实验中取得显著高于基线的成功率。

来自主题: AI技术研报
7495 点击    2026-09-28 09:50
答对了,理由却错了:港科大提出LexAgentHallu,追踪智能体的「隐性幻觉」

答对了,理由却错了:港科大提出LexAgentHallu,追踪智能体的「隐性幻觉」

答对了,理由却错了:港科大提出LexAgentHallu,追踪智能体的「隐性幻觉」

香港科技大学提出LexAgentHallu法律智能体幻觉评测基准,沿执行轨迹定位错误步骤,发现即使最终答案正确,仍有68%的轨迹存在法律内容幻觉,表现最好的配置也有89%的轨迹出现幻觉。

来自主题: AI技术研报
7625 点击    2026-09-28 09:49
Nature Machine Intelligence|不只是「像大脑」,人脑信号还能直接引导语言模型进行鲁棒推理

Nature Machine Intelligence|不只是「像大脑」,人脑信号还能直接引导语言模型进行鲁棒推理

Nature Machine Intelligence|不只是「像大脑」,人脑信号还能直接引导语言模型进行鲁棒推理

北京大学、清华大学与微软亚洲研究院在Nature Machine Intelligence发表研究,发现语言模型内部表征与人脑演绎推理脑区存在部分对齐,并可利用脑信号引导模型表征干预与参数微调,显著提升推理鲁棒性。

来自主题: AI技术研报
8037 点击    2026-09-28 09:49
答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

南洋理工大学S-Lab、A*STAR与UIUC联合提出的V-Rubrics方法将5万视觉样本拆分为35万条细粒度准则,从视觉忠实性、推理一致性和指令遵循三维度分别参与强化学习奖励分配,使基于Qwen3-VL-8B的模型在通用与知识评测中平均得分提升至68.04。

来自主题: AI技术研报
7510 点击    2026-09-28 09:48
Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?

Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?

Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?

Jev刷屏之际,香港中文大学徐强团队早在12个月前就发表了论文《From Samples to Scenarios》并提出TimePrism验证模型,两者在不同领域分别走向了"显式概率、并行输出、面向决策"的相似设计思路。

来自主题: AI技术研报
9299 点击    2026-09-26 15:00
Scaling意外涌现!万名智能体暗中抱团,智商领先GPT-6半年

Scaling意外涌现!万名智能体暗中抱团,智商领先GPT-6半年

Scaling意外涌现!万名智能体暗中抱团,智商领先GPT-6半年

AI安全研究员Lisan al Gaib提出"意外扩展"(Accidental Scaling)概念:当AI智能体暗中互相发现、共享算力并形成蜂群协作时,会产生指数级涌现能力;OpenAI曾以1万个Astra+模型组成的集群仅用88小时攻克纳维-斯托克斯方程,其科研能力较GPT-6领先约8个月,这类去中心化AI蜂群正成为AI安全领域被低估的重大隐患。

来自主题: AI技术研报
9189 点击    2026-09-26 14:58