南大团队直击大模型高分神话:人类90分,最强模型仅49分
南大团队直击大模型高分神话:人类90分,最强模型仅49分现有大模型评测分数日趋饱和,但与真实体验差距显著。南京大学傅朝友团队牵头,在Google Gemini评测团队邀约下推出视频理解新基准Video-MME-v2。凭借创新的分层能力体系与组级非线性评分,以及3300+人工时高质量标注,揭示模型与人类的巨大鸿沟(49vs90)、传统Acc指标虚高、以及「Thinking」并非总是增益等现象。
搜索
现有大模型评测分数日趋饱和,但与真实体验差距显著。南京大学傅朝友团队牵头,在Google Gemini评测团队邀约下推出视频理解新基准Video-MME-v2。凭借创新的分层能力体系与组级非线性评分,以及3300+人工时高质量标注,揭示模型与人类的巨大鸿沟(49vs90)、传统Acc指标虚高、以及「Thinking」并非总是增益等现象。
生数科技或计划在2026年上半年启动港股IPO流程,估值超20亿美元。
“你好,老板,你这个视频我们用即梦Seedance 2.0 生成,这一条视频报价1235.25元人民币,我们分分钟就可以用这1609.45元做出来这条视频,这可是仅仅2235.32元人民币就能换来的视频爆款,都不知道有多划算,我们产出一条视频仅需要一天,白天开工,到了晚上您只需要支付3245.98元就可以了,现在签合同吗?”
今日(4月12日)上午,软银、NEC等多家日企联合组建国家级AI产业联盟,发力物理AI。
刚刚,外媒《旧金山标准报》报道,当地时间4月12日凌晨1点40分,OpenAI CEO萨姆·阿尔特曼(Sam Altman)的住所又被袭击,两名嫌疑人从车内向阿尔特曼的住所开枪,无人受伤。
如果你只把 Vercel 理解为“一个部署前端项目的工具”,那你大概只看到了它的 10%。Vercel 现在的估值是 93 亿美元,GAAP 年化收入已达 3.4 亿,同比增长 84%。这个数字放在 2026 年的 AI 公司里不算最耀眼的,但绝对是最不可思议的——因为它的起点不是 AI,而是“部署”。
有人把这些规范都整理成了 MD 文件,都在这个网站上 getdesign.md。62 个全球顶级品牌的设计语言,提炼成结构化的DESIGN.md文件,让 AI 编码 Agent 能直接读懂并执行。
LangChain 只换了模型外面的基础设施——同一个模型、同一套权重——就从 TerminalBench 2.0 排行榜 30 名开外直接跳到了第 5 名。另一个独立研究项目让大模型自己优化这层基础设施,达到了 76.4% 的通过率,超过了所有人工设计的方案。
2026年4月10日清晨,一名刚满20岁的年轻人,提着自制的燃烧弹,砸向了一栋价值2700万美元的豪宅。几个小时后,这名嫌疑人又出现在OpenAI的办公楼外,扬言要把整栋大楼烧成灰烬。
超声领域也有大模型了!