把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径
把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径新智元报道 大模型变强,过去靠两条路。 做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了Sca
搜索
新智元报道 大模型变强,过去靠两条路。 做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了Sca
今天,据《华尔街日报》报道,美国金融科技公司Stripe正洽谈收购顶流大模型中转站OpenRouter。目前,交易的具体价格尚不清楚,但部分知情人士称,这笔交易估值可能达到约100亿美元(约合人民币677.55亿元)。
联想之星、银杏谷资本、啟赋资本等投了。
当大模型 Agent 被部署到工具调用、长程任务和开放环境中,一个关键问题会随之出现:能否在不更新模型参数的情况下,将执行经验沉淀下来,并在下一次做得更好?
你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。
现在还在场的模型公司里比较奇葩的是阶跃,首先它模型能力就那样,属于大伙有共识的排在第二梯队。
如果要让机械臂把咖啡机旁的杯子移到桌上,需要经历哪几个步骤?
向ChatGPT问一个看起来挺简单的问题:“Lasha Talakhadze之前的奥运举重纪录是多少?”
Acrab的Agent Box在这个背景下出现。它没有停在“把模型装进桌面设备”这一步,而是把模型、个人数据、Runtime、工具链和Agent编排放进同一套系统,让Agent能够保存上下文、调用工具,并在不同应用之间连续完成任务。
独家获悉,近期,腾讯混元多模态理解负责人胡瀚提出了离职。此前,他曾担任微软亚洲研究院视觉计算组首席研究员。2025年初加入腾讯后,负责视觉大模型的研究。在后续的调整中,他加入大语言模型部旗下的“Frontier”前沿技术研究组,负责多模态理解的相关研究,汇报给姚顺雨。