AI资讯新闻榜单内容搜索-多模态

金山与华科发布多模态模型MonkeyOCR v1.5：文档解析能力超越PaddleOCR-VL，复杂表格解析首次突破90%

是金山派来的猴子，复杂文档解析有救了！

来自主题: AI技术研报

11508 点击 2025-11-18 15:16

Lumina-DiMOO：多模态扩散语言模型重塑图像生成与理解

上海人工智能实验室推出了一款革新的多模态生成理解一体化的扩散语言模型 ——Lumina-DiMOO。基于离散扩散建模（Discrete Diffusion Modeling），Lumina-DiMOO 打破了多模态任务之间的壁垒，在同一离散扩散框架下，完成从文本→图像、图像→图像、图像→文本的全栈能力闭环。

来自主题: AI技术研报

9146 点击 2025-11-17 14:33

VinciCoder：多模态统一代码生成框架和视觉反馈强化学习，数据代码模型权重已开源

长期以来，多模态代码生成（Multimodal Code Generation）的训练严重依赖于特定任务的监督微调（SFT）。尽管这种范式在 Chart-to-code 等单一任务上取得了显著成功，但其 “狭隘的训练范围” 从根本上限制了模型的泛化能力，阻碍了通用视觉代码智能（Generalized VIsioN Code Intelligence）的发展。

来自主题: AI技术研报

9742 点击 2025-11-17 14:32

NeurIPS 2025 Spotlight | NYU提出QSVD，仅数学压缩让模型更轻、更快、更稳

在多模态智能浪潮中，视觉语言模型（Vision-Language Models, VLM）已成为连接视觉理解与语言生成的核心引擎。从图像描述、视觉问答到 AI 教育和交互系统，它们让机器能够「看懂世界、说人话」。

来自主题: AI技术研报

9878 点击 2025-11-17 09:53

6款小游戏难倒所有顶级VLM！愤怒的小鸟让它们全军覆没，性能不如随机猜测

首个系统性评估多模态大模型（VLM）交互式物理推理能力的综合基准来了。

来自主题: AI技术研报

8826 点击 2025-11-17 09:25

小度AI眼镜Pro 2299元起售：这次把“超能小度”塞进了39g的眼镜里

百度这次又往AI眼镜里狠狠塞了一把“猛料”。刚刚，百度官方发布了全新AI拍摄眼镜——小度AI眼镜Pro，2299元起。这回不光把颜值搞上去了，还把全新发布的多模态AI智能助手「超能小度」塞进了这幅39g重的眼镜里：

来自主题: AI资讯

8252 点击 2025-11-16 13:21

全球最大开源具身大模型！中国机器人跑完马拉松后开始学思考

昨天，全球参数量最大的具身智能多模态大模型——Pelican-VL 1.0正式开源。它不仅覆盖了7B到72B级别，能够同时理解图像、视频和语言指令，并将这些感知信息转化为可执行的物理操作。

来自主题: AI资讯

9139 点击 2025-11-15 10:18

破解多模态大模型“选择困难症”！内部决策机制首次揭秘：在冲突信息间疯狂"振荡"

多模态大语言模型（MLLMs）在处理来自图像和文本等多种来源的信息时能力强大。然而，一个关键挑战随之而来：当这些模态呈现相互冲突的信息时（例如，图像显示一辆蓝色汽车，而文本描述它为红色），MLLM必须解决这种冲突。模型最终输出与某一模态信息保持一致的行为，称之为“模态跟随”（modality following）

来自主题: AI技术研报

8619 点击 2025-11-14 13:54

下一代目标检测模型：3B参数MLLM Rex-Omni首度超越Grounding DINO，统一10+视觉任务

多模态大语言模型（MLLM）在目标定位精度上被长期诟病，难以匹敌传统的基于坐标回归的检测器。近日，来自 IDEA 研究院的团队通过仅有 3B 参数的通用视觉感知模型 Rex-Omni，打破了这一僵局。

来自主题: AI技术研报

6828 点击 2025-11-14 10:18

用155万模拟视频给模型上课！GVE模型一次学会9种视频检索技能

当前视频检索研究正陷入一个闭环困境：以MSRVTT为代表的窄域基准，长期主导模型在粗粒度文本查询上的优化，导致训练数据有偏、模型能力受限，难以应对真实世界中细粒度、长上下文、多模态组合等复杂检索需求。

来自主题: AI技术研报

6476 点击 2025-11-14 09:41