AI资讯新闻榜单内容搜索-视觉

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视觉
解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换

解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换

解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换

视觉 - 语言 - 动作(VLA)模型已成为端到端自动驾驶的主流技术路线,但基于自回归(AR)解码的现有架构面临双重结构性瓶颈:其一,逐 Token 串行生成导致推理延迟随序列长度线性增长,严重制约实时部署;其二,训练阶段依赖真实前缀的 teacher forcing 机制,使模型在推理时暴露于自身生成的误差之上,引发长时序累积的曝光偏差(exposure bias)。

来自主题: AI技术研报
6348 点击    2026-08-19 14:39
GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!

GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!

GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!

最近,第三方视觉评测机构Roboflow,把GPT-5.6 「全家桶」拖进自家VLM基准跑了一圈。测试的内容,都是最实在的活儿:找东西、数东西、认字、抽信息。仅在目标检测这项,上一代GPT-5.5只拿到13.8分。这个分数,在视觉模型圈里基本等于交白卷。

来自主题: AI资讯
8747 点击    2026-08-19 10:18
DeepSeek Harness插件一夜燃爆GitHub:长期记忆、电子宠物、4399小游戏全来了

DeepSeek Harness插件一夜燃爆GitHub:长期记忆、电子宠物、4399小游戏全来了

DeepSeek Harness插件一夜燃爆GitHub:长期记忆、电子宠物、4399小游戏全来了

DeepSeek Harness这下真快被网友「插成万物」了。小黑鲸上线还没多久,单单在GitHub上打着dsh-plugin标签的公开仓库,就已经冲到了700+个???有人给它装浏览器、长期记忆、数据库和任务管理;有人嫌DeepSeek不会看图,现场接了个视觉模型进去。

来自主题: AI资讯
8617 点击    2026-08-16 11:46
办一届百花奖,需要喊几声“豆包豆包”?

办一届百花奖,需要喊几声“豆包豆包”?

办一届百花奖,需要喊几声“豆包豆包”?

这次百花奖时间紧、任务重,好在豆包帮了金启棣大忙。在豆包工作任务模式下,他把舞台数据、观众规模、视觉需求等一并交给豆包。豆包很快就生成了舞美概念和效果图,让原本模糊的创意迅速落地。在此基础上,舞美设计团队继续精修,省下了大量做基础工作的时间。

来自主题: AI资讯
9273 点击    2026-08-14 16:42
刚刚,阿里开源 Qwen3.8-Max 2.4万亿参数大模型!性能比肩Fable 5

刚刚,阿里开源 Qwen3.8-Max 2.4万亿参数大模型!性能比肩Fable 5

刚刚,阿里开源 Qwen3.8-Max 2.4万亿参数大模型!性能比肩Fable 5

刚刚,阿里千问大模型团队开放Qwen3.8-2.4T-A95B模型权重! Qwen3.8-Max是基于Qwen3.8-2.4T-A95B的官方版本,于8月3日发布,拥有更多功能,例如视觉输入功能、无需思考即可使用、默认支持1百万上下文长度处理、内置官方工具等。

来自主题: AI资讯
9571 点击    2026-08-14 04:59
让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架

让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架

让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架

近日,浙江大学 OmniAI 团队在 《Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text》 中提出 ProVisE,让图像生成模型直接在图中回答空间问题,并将视觉答案还原为原 benchmark 可以评分的结构化预测。

来自主题: AI技术研报
8584 点击    2026-08-08 13:34
何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

当下计算机视觉长期陷入“一任务一专用模型”内卷: 做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。

来自主题: AI技术研报
8736 点击    2026-08-07 09:10
快手可灵AI核心技术骨干王鑫涛离职

快手可灵AI核心技术骨干王鑫涛离职

快手可灵AI核心技术骨干王鑫涛离职

根据雷锋网报道,快手可灵AI核心技术骨干王鑫涛已确认离职。有知情人士透露,其下一站大概率将前往另一家头部互联网大厂。公开资料显示,王鑫涛本科毕业于浙江大学,博士阶段进入香港中文大学多媒体实验室深造,师从汤晓鸥教授,长期深耕计算机视觉与生成式AI方向。

来自主题: AI资讯
8470 点击    2026-08-07 00:26
别再吹AI生图了,不能图层编辑的AI都是“画饼”

别再吹AI生图了,不能图层编辑的AI都是“画饼”

别再吹AI生图了,不能图层编辑的AI都是“画饼”

面向设计生产场景,兔展智能研发了UniWorld-Design,进一步强化了视觉生成与编辑能力的结合,并基于此打造了产模一体战略的重要产品——RabbitVis。AI正在从通用能力竞争,进入场景能力竞争

来自主题: AI资讯
8372 点击    2026-08-06 10:47
视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

随着 AI 生图能力不断提升,如何让 AI 真正进入创作流程成为新的行业问题。兔展智能基于 UniWorld-Design 视觉 AI 大模型推出 RabbitVis,尝试推动视觉 AI 从图片生成走向可编辑、可交付的创作流程。

来自主题: AI技术研报
8683 点击    2026-08-06 09:36