
「同志们朋友们,版本回调了!
搞AI应用的家人们没活了。胜利女神的天平又一次倾向了大模型公司一边。有鉴于此,我们将复刻致敬葬AI一年前的系列——把模型公司挨个写一遍。
之前已经写过了Kimi、智谱、豆包、千问和百度,发现一个问题是二线模型写少了,于是紧急加入美团、小米、腾讯等一众转型中的公司,更多模型公司敬请期待😘」
理论上不该写美团的,因为如果美团是大模型公司,那显然股价不会被一直按在地上摩擦。
不过既然美团LongCat 2.0发布,且大炒特炒了一番,甚至都有人说美团LongCat 2.0是「国芯国模的张雪时刻」。典型的拼词组拼麻了,那我就去认真复盘下美团都搞了哪些AI。
LongCat 2.0发布后,我第一印象是诧异,完全没想到小王在罪己诏说股价崩了自己有很大责任同时还抽空发了个模型。
怎么,是阿里上的强度还不够吗?
当时还有一波宣发是,LongCat 2.0 的预览版以匿名身份「Owl Alpha」接入 OpenRouter 平台后,跻身 OpenRouter 全球大模型调用量前三,
这OpenRouter前三怎么这么多啊,我看国产几家得商量下,要是同时发模型不就麻烦了。
我看这几家都得商量下了,别同时发模型要在OpenRouter刷就麻烦了。
OpenRouter你也是,它要刷你下次得收笔品牌赞助费,别整点免费Token就让上榜了。
这操作我看已经跟Manus火了以后,AI应用发产品必须创始人坐在Wework里讲英文,并且后面配两颗绿植一样常规了。
有没有Agency提供个套餐服务,AI应用选择绿植英文宣传片套餐,大模型选择OpenRouter诚信互刷套餐,两个套餐价钱都可以升级为马斯克点赞至尊套餐。
另外一个吹的是,月调用量在 Hermes和 OpenClaw 上分列全球第一和第三,成为最受全球 Agent 开发者欢迎的模型之一。
我问了下朋友对此的评价,得到的回复是,「吹 Hermes 和 OpenClaw 真的都没啥品味,自己内部多用用、免费套餐搞一搞就冲上去了。」
连阿里老哥都不这么搞了,上一次唠这套匿名打榜嗑的我印象里的还是快乐马,说明阿里老哥有长足进步,哪天炒作能力达到Kimi水平就回过头来把其他模型豆沙了。
再回来聊模型水平。
首先Long Cat 2.0能发模型已经勇气可嘉了,模型水平至少是超过百度文心一言的,因为文心一言还在跑高考分数。
团子也非常诚实,自己测的bench都排在第一梯队往后。
咸鱼上周跑了一遍葬AI Bench,评价是LongCat 2.0处于二线国产模型的中游水平,和DeepSeep V4 Pro、MiMo V2.5 Pro、Seed Evolving坐一桌,不如同样二线的Hunyuan Hy3、MiniMax M3。
很遗憾,上面这段话是上周写的。昨天咸鱼又跑了一遍,LongCat 2.0已经掉到了二线国产模型的末流水平,全靠同行太努力😭
这里多说一句,国产模型现在卷得非常夸张,基本都在按周发版。特别是Hunyuan Hy3、MiniMax M3这两个模型,这一个月来提升巨大,也就是版本号没变,模型实际上更新了若干版。
可以作为参照系的是Qwen 3.7 Max。因为阿里集中精力搞Qwen 3.8后训练去了,这两周对3.7没啥更新,所以这个上一代和GLM 5.2坐一桌的模型,马上被同行拉开差距。
那么,第二梯队的差别体现在哪呢?
主要就是稳定性不行。得益越来越成熟的蒸馏数据管线,这些二线国产模型可以快速学会SOTA模型的动作模版。
比如说做知识图谱,二线国产模型都能学会「先列计划、再读文件、再写单文件应用、再加搜索和路径,再跑脚本,最后总结」这套动作流程。
问题就在于评估验收能力不行,上述每个动作都要评估验收真实产物。验收过程,就很容易发生模型的动作都是对的,但不管真实产物有问题。
所以,二线国产模型的共同特征是不稳定,都能跑出高分轮次,但大部分都是低分轮次,偶尔还有超低分。
咋说呢?蒸馏不是一件坏事。因为大模型最重要的就是数据,找人打标也是数据,用SOTA模型的输出也是数据,今天应该没一家模型厂敢说自己不蒸馏。
但是蒸馏容易只蒸到SOTA模型的动作流程,很难学会人家的评估验收能力,后者才是划分一二线模型的分界线。
这部分能力如何训练,已经开源在了上周发布的K3技术报告里,相信也会出现在下周开源的Qwen 3.8报告里。
Kimi活确实做得细,把Agent运行环境都训进了模型里。相信二线国模马上又能突飞猛进🤓
当然长猫还有一点是好的,就是内部不硬性要求业务部门必须使用 LongCat,不强行落地自研技术,像Tabbit最早也没用LongCat。
长猫另外一点好的,就是很便宜。只要9.9元就能买5000万Token,相当于白送。这也见得中国大模型竞争的残酷,这要是美国大厂,亚马逊微软之流能搞出来一个LongCat就偷着乐了,而在中国LongCat、Mimo也只能近乎白送😭
其实长猫能做到这个阶段已经不错了。
在资源和人力完全不够的情况下,做到了和混元、MiniMax、小米一个梯队。
这也说明大模型主要是工程问题。做SOTA模型是需要超前的技术判断力,但做二线模型完全是工程问题。
腾讯、美团、小米都能在半年时间内做出来能用的模型,充分说明这玩意就是制造业,搞国产替代没有不可逾越的问题。
这也反过来说明团子唠国芯国模嗑的价值。
LongCat是一般,大概是25年下半年的SOTA模型水平。
但它训练推理都用国产芯片啊,实现了大模型链条闭环。只要能闭环,那剩下的都是时间问题,每个环节都可以逐步优化,同步进入陡峭的产能上升曲线。
可惜团子的声量全然不如其他几家,归根结底是人民群众对团子的认知就是个送外卖的。
我有一计可解此局,那就是让长猫把姚顺雨挖过来,先摆正态度塑造AI公司形象。退一步可以挖姚顺雨的华人同学,实在不行就去被投里定向挖人好了。
简单盘了下,美团现在属于五线出击。外卖、出海、小象超市、大模型还有AI应用。
还是美团龙珠这种投资部门争气,投的都是智谱、Kimi,合着全靠财务回报和外卖员的汗水来养着自己的大模型业务。
从这个程度上看,美团和MiniMax有点太像了,既要又要还要,但都不突出。我常听到对美团的评价也是,一家做苦生意的公司,兴哥很厉害,可惜选错了赛道。
其实美团最好的AI产品是美团小美,当年发布可是一码难求,如今都没人吹了。
我现在就爱用这玩意点柠檬茶、排队取烤匠。其实大伙对豆包许的愿它都能干,不懂怎么用的人这少。

可惜烤匠不让线上取号,不过可以帮我打电话
唯一一个问题是,思考实在太慢了。啥时候能跟豆包一个速度就好了。
后来推的什么NoCode这种编程工具,完全被Qoder、WorkBuddy打成路边一条、还有那个觅游整龙虾社交,纯拿龙虾骗我兴哥注意力。
至于CatPaw这种刚推的编程工具,完全是用自己弱势区打对手的优势区。
美团显然是最适合做生活方式Agent的呀,多投入投入小美吧,兴哥别搞那些乱七八糟的了。
还有,那些具身智能公司动弹都费劲,还敢吹自己什么物理AI,明明美团才是真正的物理AI公司啊。
完全可以跟阿里争一下谁是物理AI第一了,老辈子在AI时代继续对打吧。
我建议美团直接转型数据公司好吧。
因为大模型纯纯制造业,和光伏、电动车一个类型。主要靠建立数据管线和不断优化训练能力。
那这事情是美团舒适区啊。建议团子原地转化10万骑手进入打标流水线。反正骑手学历高的不少,筛选一下统统坐办公室。大伙都开心。
剩下的骑手每人头戴采集数据的摄像头,这还有啥数据公司的事。
真实世界建模这块,自动驾驶都是路边,美团才是第一。
文章来自于"葬AI",作者 "沐秋Muqiu"。
【开源免费】OWL是一个完全开源免费的通用智能体项目。它可以远程开Ubuntu容器、自动挂载数据、做规划、执行任务,堪称「云端超级打工人」而且做到了开源界GAIA性能天花板,达到了57.7%,超越Huggingface 提出的Open Deep Research 55.15%的表现。
项目地址:GitHub:https://github.com/camel-ai/owl
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md