AI资讯新闻榜单内容搜索-视觉

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视觉
让代码接管世界演化,西湖大学发布Code视频世界模型

让代码接管世界演化,西湖大学发布Code视频世界模型

让代码接管世界演化,西湖大学发布Code视频世界模型

西湖大学AGI实验室发布Code World Model视频世界模型,将世界演化与视觉生成分离,由Coding Agent和代码负责因果规则执行、视频模型负责高保真视觉渲染,并提出Proxy作为可编译视觉条件通道,用约5.6小时游戏视频完成原型验证。

来自主题: AI资讯
8059 点击    2026-09-04 15:49
苹果新作:内化视觉思考,推理提速 5 倍

苹果新作:内化视觉思考,推理提速 5 倍

苹果新作:内化视觉思考,推理提速 5 倍

苹果研究团队提出 Internalized Visual Thinking(IVT)后训练框架,通过在训练阶段联合学习文本答案与未来帧隐空间表征、在推理阶段完全移除未来视觉预测过程,使模型在主动视频推理任务上相比 Visual CoT 获得超过 5 倍的推理加速,且在六项评测设置中均优于 Answer-Only SFT。

来自主题: AI技术研报
7492 点击    2026-09-04 10:36
刚刚,Anthropic公布Fable 5.1保姆级使用技巧,看完少走十天弯路

刚刚,Anthropic公布Fable 5.1保姆级使用技巧,看完少走十天弯路

刚刚,Anthropic公布Fable 5.1保姆级使用技巧,看完少走十天弯路

Anthropic发布Fable 5.1完整提示词与工程落地指南,涵盖思考档位选择、工具调用进度汇报、历史对话管理、上下文压缩、写作密度控制、检索引用规范、安全策略调优、多智能体并行及视觉任务处理等多方面的使用技巧与避坑要点。

来自主题: AI资讯
9903 点击    2026-09-04 00:02
答对了却没看图?EASE给多模态RLVR装上「视线校正器」

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在:最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。

来自主题: AI技术研报
6722 点击    2026-09-03 14:17
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

大视觉语言模型(LVLM)把语言理解扩展到了图像等多模态输入,同时,也带来了更隐蔽的攻击面。

来自主题: AI技术研报
5470 点击    2026-09-03 09:50
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。

来自主题: AI技术研报
8800 点击    2026-09-02 14:32
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。

来自主题: AI技术研报
9794 点击    2026-09-02 09:27
刚刚,DeepSeek-V4多模态模型开源

刚刚,DeepSeek-V4多模态模型开源

刚刚,DeepSeek-V4多模态模型开源

DeepSeek-V4-Flash-Vision-Exp多模态模型正式开源,该模型为DeepSeek-V4系列首个实验性多模态模型,基于DeepSeek-V4-Flash架构集成视觉模块,在真实世界软件工程测试DeepSWE中以59.3%反超Opus-4.8登顶,并在零样本视觉推理测试ZeroBench中击败Opus-4.8。

来自主题: AI资讯
9181 点击    2026-08-31 21:53
V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文《V-RAE: Rethinking Video Latent Spaces for Generation》中提出视频表征自编码器 V-RAE。该方法以冻结的视觉基础模型为编码器,通过轻量级时间池化压缩视频特征,并将具有丰富语义和时间连续性的表征直接用于视频重建、生成与未来预测。

来自主题: AI技术研报
9112 点击    2026-08-26 10:19
1分钱9张图!DeepSeek视觉模型连夜实测

1分钱9张图!DeepSeek视觉模型连夜实测

1分钱9张图!DeepSeek视觉模型连夜实测

等了四个月,DeepSeek的多模态模型:deepseek-v4-flash-vision-exp,终于发布。我也是第一时间赶到现场,连夜开始实测。相比V4 Flash最大的不同,就是支持原生支持图片输入了,但图片生成当然还是没有的。

来自主题: AI产品测评
9082 点击    2026-08-22 14:27