AI资讯新闻榜单内容搜索-视觉

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视觉
办一届百花奖,需要喊几声“豆包豆包”?

办一届百花奖,需要喊几声“豆包豆包”?

办一届百花奖,需要喊几声“豆包豆包”?

这次百花奖时间紧、任务重,好在豆包帮了金启棣大忙。在豆包工作任务模式下,他把舞台数据、观众规模、视觉需求等一并交给豆包。豆包很快就生成了舞美概念和效果图,让原本模糊的创意迅速落地。在此基础上,舞美设计团队继续精修,省下了大量做基础工作的时间。

来自主题: AI资讯
8838 点击    2026-08-14 16:42
刚刚,阿里开源 Qwen3.8-Max 2.4万亿参数大模型!性能比肩Fable 5

刚刚,阿里开源 Qwen3.8-Max 2.4万亿参数大模型!性能比肩Fable 5

刚刚,阿里开源 Qwen3.8-Max 2.4万亿参数大模型!性能比肩Fable 5

刚刚,阿里千问大模型团队开放Qwen3.8-2.4T-A95B模型权重! Qwen3.8-Max是基于Qwen3.8-2.4T-A95B的官方版本,于8月3日发布,拥有更多功能,例如视觉输入功能、无需思考即可使用、默认支持1百万上下文长度处理、内置官方工具等。

来自主题: AI资讯
9225 点击    2026-08-14 04:59
让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架

让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架

让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架

近日,浙江大学 OmniAI 团队在 《Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text》 中提出 ProVisE,让图像生成模型直接在图中回答空间问题,并将视觉答案还原为原 benchmark 可以评分的结构化预测。

来自主题: AI技术研报
8370 点击    2026-08-08 13:34
何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

当下计算机视觉长期陷入“一任务一专用模型”内卷: 做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。

来自主题: AI技术研报
8587 点击    2026-08-07 09:10
快手可灵AI核心技术骨干王鑫涛离职

快手可灵AI核心技术骨干王鑫涛离职

快手可灵AI核心技术骨干王鑫涛离职

根据雷锋网报道,快手可灵AI核心技术骨干王鑫涛已确认离职。有知情人士透露,其下一站大概率将前往另一家头部互联网大厂。公开资料显示,王鑫涛本科毕业于浙江大学,博士阶段进入香港中文大学多媒体实验室深造,师从汤晓鸥教授,长期深耕计算机视觉与生成式AI方向。

来自主题: AI资讯
8248 点击    2026-08-07 00:26
别再吹AI生图了,不能图层编辑的AI都是“画饼”

别再吹AI生图了,不能图层编辑的AI都是“画饼”

别再吹AI生图了,不能图层编辑的AI都是“画饼”

面向设计生产场景,兔展智能研发了UniWorld-Design,进一步强化了视觉生成与编辑能力的结合,并基于此打造了产模一体战略的重要产品——RabbitVis。AI正在从通用能力竞争,进入场景能力竞争

来自主题: AI资讯
8314 点击    2026-08-06 10:47
视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

随着 AI 生图能力不断提升,如何让 AI 真正进入创作流程成为新的行业问题。兔展智能基于 UniWorld-Design 视觉 AI 大模型推出 RabbitVis,尝试推动视觉 AI 从图片生成走向可编辑、可交付的创作流程。

来自主题: AI技术研报
8615 点击    2026-08-06 09:36
Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

人类看图时,不会先在大脑中拍下一张「截图」,再闭眼推理。思考过程会不断引导我们的目光:找到一个线索,形成一个假设,再回到图像里验证它。

来自主题: AI技术研报
8537 点击    2026-08-05 15:50
VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

视觉问答模型的准确率不断提高,但高分未必来自视觉理解 —— 当基准图像与答案已进入训练语料,模型可能只是复现了记忆。浙江大学等团队提出 ReKey:保留原始真实场景,只更新决定答案的那一小块视觉线索,使每轮评测都面向未见过的内容。

来自主题: AI技术研报
8395 点击    2026-08-04 10:33
VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

近年来,视觉 — 语言 — 动作模型(Vision-Language-Action Model,VLA)正逐渐成为通用机器人控制的重要技术路线,但当这些模型真正进入高频闭环执行时,一个矛盾越来越突出:模型越来越大、语义能力越来越强,动作更新却未必足够快。

来自主题: AI技术研报
10249 点击    2026-08-03 15:30