AI资讯新闻榜单内容搜索-视觉

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视觉
iOS 19还没来,我提前在iPhone上体验到了苹果最新的AI

iOS 19还没来,我提前在iPhone上体验到了苹果最新的AI

iOS 19还没来,我提前在iPhone上体验到了苹果最新的AI

苹果近期开源本地端侧视觉语言模型FastVLM,支持iPhone等设备本地运行,具备快速响应、低延迟和多设备适配特性。该模型依托自研框架MLX和视觉架构FastViT-HD,通过算法优化实现高效推理,或为未来智能眼镜等新硬件铺路,体现苹果将AI深度嵌入系统底层的战略布局。

来自主题: AI资讯
10100 点击    2025-05-16 15:48
谁还请真人模特?AI正在颠覆电商工作流

谁还请真人模特?AI正在颠覆电商工作流

谁还请真人模特?AI正在颠覆电商工作流

在电商世界,没有人会忽视视觉的力量。

来自主题: AI资讯
10479 点击    2025-05-16 12:07
DanceGRPO:首个统一视觉生成的强化学习框架

DanceGRPO:首个统一视觉生成的强化学习框架

DanceGRPO:首个统一视觉生成的强化学习框架

R1 横空出世,带火了 GRPO 算法,RL 也随之成为 2025 年的热门技术探索方向,近期,字节 Seed 团队就在图像生成方向进行了相关探索。

来自主题: AI技术研报
9716 点击    2025-05-15 10:47
豆包全新视频生成模型、视觉深度思考模型发布

豆包全新视频生成模型、视觉深度思考模型发布

豆包全新视频生成模型、视觉深度思考模型发布

5月13日,在 FORCE LINK AI 创新巡展·上海站,火山引擎发布豆包·视频生成模型 Seedance 1.0 lite、豆包1.5·视觉深度思考模型,升级豆包·音乐模型。同时,Data Agent 正式亮相、Trae 接入豆包深度思考模型并全新升级。火山引擎正在以更强大的模型矩阵、更丰富的智能体工具,帮助企业打通从业务到智能体的应用链路。

来自主题: AI资讯
12416 点击    2025-05-14 11:49
ICML 2025 | 长视频理解新SOTA!蚂蚁&人大开源ViLAMP-7B,单卡可处理3小时视频

ICML 2025 | 长视频理解新SOTA!蚂蚁&人大开源ViLAMP-7B,单卡可处理3小时视频

ICML 2025 | 长视频理解新SOTA!蚂蚁&人大开源ViLAMP-7B,单卡可处理3小时视频

在视觉语言模型(Vision-Language Models,VLMs)取得突破性进展的当下,长视频理解的挑战显得愈发重要。以标准 24 帧率的标清视频为例,仅需数分钟即可产生逾百万的视觉 token,这已远超主流大语言模型 4K-128K 的上下文处理极限。

来自主题: AI技术研报
7864 点击    2025-05-13 08:54
又快又好!豆包文生图3.0重构企业视觉内容生产线

又快又好!豆包文生图3.0重构企业视觉内容生产线

又快又好!豆包文生图3.0重构企业视觉内容生产线

最近我们AI爱好者的群里玩的全都是豆包和即梦生成的海报图片,大家评价做图片和海报效果真的很不错,豆包进步了,即梦也进步了。真的进步太大了!下面是我的朋友们尝试过的一些趣味玩法:

来自主题: AI资讯
14143 点击    2025-05-12 14:23
阿里通义成了AI的“黄埔军校”?

阿里通义成了AI的“黄埔军校”?

阿里通义成了AI的“黄埔军校”?

最近阿里通义实验室应用视觉团队负责人薄列峰被曝离职,引起了一轮热议。而这已是继2月语音团队负责人鄢志杰、2024年8月大模型技术负责人周畅之后,阿里AI核心部门第三次失去关键人物了。

来自主题: AI资讯
9846 点击    2025-05-11 15:11
Harmon:协调视觉表征,统一多模态理解和生成(模型已开源)

Harmon:协调视觉表征,统一多模态理解和生成(模型已开源)

Harmon:协调视觉表征,统一多模态理解和生成(模型已开源)

GPT-4o 生图功能的出现揭示了统一理解与生成模型的巨大潜力,然而如何在同一个框架内协调图像理解与生成这两种不同粒度的任务,是一个巨大的挑战。

来自主题: AI技术研报
10074 点击    2025-05-10 13:35