AI资讯新闻榜单内容搜索-MoE

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: MoE
5050亿参数!余承东开源盘古新模型openPangu-2.0-Pro,距离“世界第一”还有差距

5050亿参数!余承东开源盘古新模型openPangu-2.0-Pro,距离“世界第一”还有差距

5050亿参数!余承东开源盘古新模型openPangu-2.0-Pro,距离“世界第一”还有差距

今日,华为开源基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro。该模型是openPangu-2.0系列的最新开源模型,总参数规模5050亿,激活参数规模180亿,支持512K上下文长度,训练数据总量约34T tokens。另一轻量化模型openPangu-2.0-Flash已于6月12日开源,参数92亿,其中6亿为激活参数。

来自主题: AI资讯
9073 点击    2026-07-31 21:54
Kimi K3竟是GPT-2的22580倍,博主「肝」48小时发现:七年进化大模型不只是参数暴涨

Kimi K3竟是GPT-2的22580倍,博主「肝」48小时发现:七年进化大模型不只是参数暴涨

Kimi K3竟是GPT-2的22580倍,博主「肝」48小时发现:七年进化大模型不只是参数暴涨

最近,月之暗面 kimi 正式开源 Kimi K3 完整模型权重,Kimi K3 是一款总参数量达 2.8 万亿、上下文窗口达 100 万 token 的 MoE 大模型,更是全球首个落地的近 3 万亿参数级开源大模型,引起业界热议。

来自主题: AI技术研报
9004 点击    2026-07-29 14:23
把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

新智元报道 大模型变强,过去靠两条路。 做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了Sca

来自主题: AI技术研报
8454 点击    2026-07-24 15:54
港科大新发现:MoE路由很脆弱!重复token输入阻塞负载均衡 | ICML'26

港科大新发现:MoE路由很脆弱!重复token输入阻塞负载均衡 | ICML'26

港科大新发现:MoE路由很脆弱!重复token输入阻塞负载均衡 | ICML'26

来自港科大的研究团队提出了RepetitionCurse,这是一种针对MoE大模型服务的黑盒压力测试方法。它不需要模型权重,不需要梯度,也不需要知道后端专家如何部署,只利用高度重复的输入模式,就能诱导专家路由把大量token路由到同一小批专家上。

来自主题: AI技术研报
9208 点击    2026-07-19 10:11
美团 LongCat-2.0:第一个在纯国产芯片训练的万亿参数大模型

美团 LongCat-2.0:第一个在纯国产芯片训练的万亿参数大模型

美团 LongCat-2.0:第一个在纯国产芯片训练的万亿参数大模型

如果只看标题,它很容易被归到“又一个万亿参数大模型”的队伍里:1.6 万亿总参数、MoE 架构、100 万 token 上下文、面向代码和 Agent 场景。但这次真正值得看的,不只是模型有多大,而是它背后的三个问题:国产算力能不能支撑前沿级大模型训练?

来自主题: AI资讯
10362 点击    2026-06-30 21:04
离谱,AI 圈都在疯转一只不存在的「法国胖猫」

离谱,AI 圈都在疯转一只不存在的「法国胖猫」

离谱,AI 圈都在疯转一只不存在的「法国胖猫」

离谱了。 这两天,AI 圈都在疯传一个叫 Le Chaton Fat 的新模型。 30T MoE、256 个专家、100 万上下文窗口、多模态多语言,跑分全面碾压 Claude Fable 5、Claude Opus 4.8 和 GPT-5.5。

来自主题: AI资讯
9419 点击    2026-06-16 12:14
国产大模型第一梯队迎新势力:云知声发了个原生Agent大模型U2,再次捅破行业天花板

国产大模型第一梯队迎新势力:云知声发了个原生Agent大模型U2,再次捅破行业天花板

国产大模型第一梯队迎新势力:云知声发了个原生Agent大模型U2,再次捅破行业天花板

今天,“港股AGI第一股”云知声发布其最新通用大语言模型U2,该模型是由云知声自研的、基于快慢思考融合的MoE(混合专家)范式构建的通用大语言模型。U2跳出了传统大模型盲目堆参数、堆Token的内卷路径,实现了“小参数强能力、少Token高产出、低算力低成本”的进化。

来自主题: AI资讯
10449 点击    2026-06-08 20:56
重磅!谷歌开源Gemma 4 12B:统一的、无编码器的多模态模型,16G内存笔记本就可以跑

重磅!谷歌开源Gemma 4 12B:统一的、无编码器的多模态模型,16G内存笔记本就可以跑

重磅!谷歌开源Gemma 4 12B:统一的、无编码器的多模态模型,16G内存笔记本就可以跑

刚刚,谷歌DeepMind发布了Gemma 4 12B。一句话概括这个模型的定位:把原本需要高端服务器才能跑的多模态智能,装进你的笔记本电脑里。它填补的是Gemma家族里一个关键空缺:比边缘端的E4B更强,比26B混合专家模型(MoE)更轻。而且在整个Gemma 4系列里,它是第一个支持原生音频输入的中等规模模型。

来自主题: AI资讯
10527 点击    2026-06-04 09:46