DeepSeek V4.1 Flash 开源:全新架构
DeepSeek V4.1 Flash 开源:全新架构刚刚,DeepSeek 开源了 V4.1 Flash,原生支持视觉理解,也是全新架构系列中最小的一款模型,550B 总参数,输入时激活 8B,输出时激活 16B(你没看错,输入输出激活不同)
搜索
刚刚,DeepSeek 开源了 V4.1 Flash,原生支持视觉理解,也是全新架构系列中最小的一款模型,550B 总参数,输入时激活 8B,输出时激活 16B(你没看错,输入输出激活不同)
近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。
视觉编程成绩超GPT-5.4。
自动手语翻译中,一直存在一个隐蔽难题:模型即使已经较好地对齐了视觉与文本,也可能在逐词生成时,被某个局部合理、却缺少视觉证据支持的词带偏。
先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。
芝诺机器人发布全球首个协作具身智能基础模型Zeno-1,该3B参数模型专为去中心化多机器人协作设计,能在本地以30Hz频率进行闭环视觉—运动推理,通过四阶段递进训练让机器人从同一策略副本中自发涌现协作行为,实现1+1>2的效果。
Meta联合南洋理工大学等多所高校全开源HumanCLAW基准,将高层行动决策与低层运动控制分离以单独测量视觉语言模型的行动智能,九个前沿模型完整交互成功率仅16.8%,揭示出当前基础模型缺乏持续维护自身身体状态估计的具身自我感知缺口。
西湖大学AGI实验室发布Code World Model视频世界模型,将世界演化与视觉生成分离,由Coding Agent和代码负责因果规则执行、视频模型负责高保真视觉渲染,并提出Proxy作为可编译视觉条件通道,用约5.6小时游戏视频完成原型验证。
苹果研究团队提出 Internalized Visual Thinking(IVT)后训练框架,通过在训练阶段联合学习文本答案与未来帧隐空间表征、在推理阶段完全移除未来视觉预测过程,使模型在主动视频推理任务上相比 Visual CoT 获得超过 5 倍的推理加速,且在六项评测设置中均优于 Answer-Only SFT。
Anthropic发布Fable 5.1完整提示词与工程落地指南,涵盖思考档位选择、工具调用进度汇报、历史对话管理、上下文压缩、写作密度控制、检索引用规范、安全策略调优、多智能体并行及视觉任务处理等多方面的使用技巧与避坑要点。