扩散语言模型驱动的实时交互视频模型:SigmaZ 完成数百万美元融资
扩散语言模型驱动的实时交互视频模型:SigmaZ 完成数百万美元融资Pixel 擅长表达 appearance,Code 擅长表达 structure;未来会进入 Pixel-Code 联合的视觉表达。
搜索
Pixel 擅长表达 appearance,Code 擅长表达 structure;未来会进入 Pixel-Code 联合的视觉表达。
视觉 - 语言 - 动作(VLA)模型已成为端到端自动驾驶的主流技术路线,但基于自回归(AR)解码的现有架构面临双重结构性瓶颈:其一,逐 Token 串行生成导致推理延迟随序列长度线性增长,严重制约实时部署;其二,训练阶段依赖真实前缀的 teacher forcing 机制,使模型在推理时暴露于自身生成的误差之上,引发长时序累积的曝光偏差(exposure bias)。
最近,第三方视觉评测机构Roboflow,把GPT-5.6 「全家桶」拖进自家VLM基准跑了一圈。测试的内容,都是最实在的活儿:找东西、数东西、认字、抽信息。仅在目标检测这项,上一代GPT-5.5只拿到13.8分。这个分数,在视觉模型圈里基本等于交白卷。
DeepSeek Harness这下真快被网友「插成万物」了。小黑鲸上线还没多久,单单在GitHub上打着dsh-plugin标签的公开仓库,就已经冲到了700+个???有人给它装浏览器、长期记忆、数据库和任务管理;有人嫌DeepSeek不会看图,现场接了个视觉模型进去。
这次百花奖时间紧、任务重,好在豆包帮了金启棣大忙。在豆包工作任务模式下,他把舞台数据、观众规模、视觉需求等一并交给豆包。豆包很快就生成了舞美概念和效果图,让原本模糊的创意迅速落地。在此基础上,舞美设计团队继续精修,省下了大量做基础工作的时间。
刚刚,阿里千问大模型团队开放Qwen3.8-2.4T-A95B模型权重! Qwen3.8-Max是基于Qwen3.8-2.4T-A95B的官方版本,于8月3日发布,拥有更多功能,例如视觉输入功能、无需思考即可使用、默认支持1百万上下文长度处理、内置官方工具等。
近日,浙江大学 OmniAI 团队在 《Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text》 中提出 ProVisE,让图像生成模型直接在图中回答空间问题,并将视觉答案还原为原 benchmark 可以评分的结构化预测。
当下计算机视觉长期陷入“一任务一专用模型”内卷: 做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。
根据雷锋网报道,快手可灵AI核心技术骨干王鑫涛已确认离职。有知情人士透露,其下一站大概率将前往另一家头部互联网大厂。公开资料显示,王鑫涛本科毕业于浙江大学,博士阶段进入香港中文大学多媒体实验室深造,师从汤晓鸥教授,长期深耕计算机视觉与生成式AI方向。
面向设计生产场景,兔展智能研发了UniWorld-Design,进一步强化了视觉生成与编辑能力的结合,并基于此打造了产模一体战略的重要产品——RabbitVis。AI正在从通用能力竞争,进入场景能力竞争