大模型给图片打分不再“靠嘴说”!结构图、频谱图当“物证”,用“视觉证据”来给图片打分 | ECCV‘26
大模型给图片打分不再“靠嘴说”!结构图、频谱图当“物证”,用“视觉证据”来给图片打分 | ECCV‘26让大模型给一张图片打“质量分”,它其实经常看走眼。
搜索
让大模型给一张图片打“质量分”,它其实经常看走眼。
Kimi K3 是一个 2.8 万亿参数模型,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。
阿里巴巴达摩院的最新工作RynnWorld-Teleop对此给出的方案是:用生成式世界模型替代真实机器人。操作员的手势驱动一个实时视频生成器,由“数字世界中的机器人”完成全部视觉演示,同时自动获得关节级的动作标签。该方案被称为数字遥操作(Digital Teleoperation)。
PhyMAGIC通过让物体动起来,从视频中提取物理证据,帮助准确推断材料属性。它结合图生视频与视觉语言模型,生成针对性运动探针,并不断修正物理参数,最终构建出可微分的3D动态模型,实现更符合现实的视频生成。
7 月 16 日,月之暗面正式发布 Kimi K3:总参数量 2.8 万亿(2.8T),原生视觉理解,100 万 token 上下文,并且——开源权重。这是历史上第一个摸到 2.8 万亿参数量级的开源模型。前任"开源最大模型"的纪录保持者?也是它自己。
近日,商汤科技发布并全面开源日日新SenseNova-Vision理解生成统一视觉大模型,试图宣告视觉AI“缝合怪”时代的终结。截至当前,该模型综合得分登顶Hugging Face Any-to-Any Leaderboard,位列该全模态任意输入输出开源模型榜单全球第一。
近年来,多模态大语言模型(MLLM)在视觉问答、图表理解、科学推理等任务上取得了令人瞩目的进展。
过去几年,扩散模型几乎定义了高质量图像生成:从随机噪声出发,经过多轮迭代,逐步 “雕刻” 出一张图像。但随着大语言模型席卷人工智能领域,另一条路线正迅速走到舞台中央 —— 图像,能否也像语言一样,通过自回归方式逐步生成?
大家好,我是冷逸。 前段时间,我设计了一家民宿「冷同学的院子」,视觉还算有点意思,不少朋友跑来问设计上的事。也有人问我:要是自己网上开店,有没有那种“够简单、说一句就能出设计”的电商工具?
音乐和视频之间那道墙,好像被打破了。 上个月,一个做独立音乐的朋友找我吃饭,聊到新歌宣发的事,愁得不行。 歌写好了,录完了,混音也做了,但到了要发的时候才发现,没有视觉内容。 发网易云?光秃秃一个音频