Transformer开始构建三维世界:开源模型几张图片秒级生成可探索3D场景
Transformer开始构建三维世界:开源模型几张图片秒级生成可探索3D场景从 2D 像素到 3D 场景 Query,影溯正在尝试把三维内容生产推向可规模化调用的新阶段。
搜索
从 2D 像素到 3D 场景 Query,影溯正在尝试把三维内容生产推向可规模化调用的新阶段。
2023 年,于开丞刚开始做“世界模型”时,处在一种他自己形容为“孤独和无助”的状态里。他经常找人聊这个方向,得到的反馈大多是:太远了,天方夜谭。三年后,世界模型成了 AI 行业最热的词之一;而在热潮到来之前,他已经拿过世界冠军,又否定了那套让自己获胜的技术路线。
AI 行业有个吊诡的事儿我一直想不明白,最近有了点思路了,不吐不快。前几天,一个朋友买了某大模型公司的模型套餐。每月 700 块钱的档位。模型确实很不错,用起来也舒服。结果花了两天就把一个月的额度用没了,没想到会这么贵。
人类看图时,不会先在大脑中拍下一张「截图」,再闭眼推理。思考过程会不断引导我们的目光:找到一个线索,形成一个假设,再回到图像里验证它。
“用 Vibe Coding 的成本越低,你被模型卷死的概率就越高。”
曾经最相信强化学习的人之一,如今却认为:强化学习没有把我们带到 AGI。
Qwen 3.8 Max是一个很适合干活的模型。
8 月 4 日,腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview。基于最新一代大语言模型 Hy3 的语言理解能力,Hy ASR 3.0 preview 融合高精度语音识别与深度语义理解能力,在通用识别、上下文感知、多场景鲁棒性以及方言覆盖等核心维度实现全面提升,
她是xAI前推理团队负责人。她研究并发起的开源推理引擎SGLang,已经成为众多大模型部署和推理的重要底层工具,也是目前AI infra领域最具影响力的开源推理框架之一。如今,她从SGLang开源生态中孵化出创业公司RadixArk,希望把只有少数科技巨头才能拥有的前沿AI基础设施,变成整个行业都可以使用的开放技术底座。
前不久,OpenAI 公布了其智能体入侵 HuggingFace 的 AI 安全事件,令很多企业和公众第一次意识到:AI 模型可能并不总会按照设计好的方式行动。